ALiBi Là Gì?

ALiBi (Attention with Linear Biases) là một kỹ thuật giúp mô hình ngôn ngữ xử lý được văn bản dài hơn nhiều so với lúc huấn luyện, mà không cần thêm bất kỳ tham số nào. Thay vì học “vị trí” của từng token như cách truyền thống, ALiBi chỉ đơn giản là phạt nhẹ attention khi token ở quá xa nhau.
Cách nghĩ đơn giản: mô hình mặc định “quên dần” những thứ ở xa. Token càng xa nhau trong văn bản, mức kết nối giữa chúng càng bị giảm xuống theo đường thẳng. Nhờ vậy mô hình vừa tiết kiệm chi phí, vừa mở rộng được context window dễ dàng.
Kỹ thuật này được giới thiệu trong bài báo của Ofir Press và cộng sự (2021), và nổi tiếng nhất qua mô hình MPT của MosaicML — vốn từng đạt context 65K token, dài gấp nhiều lần mức phổ biến thời điểm đó.
ALiBi Hoạt Động Như Thế Nào?
Bình thường, mô hình dùng positional encoding để “gắn số nhà” cho từng token. ALiBi bỏ qua bước này. Khi tính attention, nó trừ đi một giá trị phạt tỷ lệ thuận với khoảng cách giữa hai token.
Ví dụ: token đang xét ở vị trí 10, token ở vị trí 9 bị trừ 1 đơn vị phạt, token ở vị trí 2 bị trừ 8 đơn vị. Càng xa, điểm attention càng thấp, mô hình tự nhiên tập trung vào ngữ cảnh gần.
Điểm hay là đường phạt này linear — tức đường thẳng, không cong. Nhờ vậy khi suy luận với văn bản dài hơn lúc huấn luyện, đường thẳng cứ kéo dài ra vô hạn mà không bị “vỡ” như các phương pháp cũ. Đây chính là lý do ALiBi extrapolate (ngoại suy) tốt.
Vì Sao ALiBi Quan Trọng Với AI Hiện Nay?
Context window dài là cuộc đua thật sự. Người dùng muốn nhét cả cuốn sách, cả codebase vào một lần chat. Nhưng huấn luyện lại mô hình với context dài tốn kém khủng khiếp.
ALiBi cho phép “mua rẻ”: huấn luyện ở 1K token, suy luận ở 4K-16K mà chất lượng vẫn chấp nhận được. Với nhóm tự huấn luyện mô hình open weights, đây là công cụ tiết kiệm GPU rất thực tế.
Ngoài ra, vì không thêm tham số, ALiBi không làm mô hình to ra. Tốc độ huấn luyện và suy luận gần như không đổi — thứ mà RoPE hay các phương án phức tạp khác không phải lúc nào cũng làm được.
ALiBi Khác RoPE Và Positional Encoding Truyền Thống Ở Điểm Nào?
Câu trả lời ngắn: ALiBi phạt theo khoảng cách, RoPE xoay theo vị trí, còn positional encoding cổ điển gán nhãn vị trí tuyệt đối.
Sinusoidal encoding (thời BERT, GPT-2 đầu) học vị trí tuyệt đối, nên vượt độ dài huấn luyện là_fail. RoPE xoay vector query và key theo vị trí, hoạt động tốt nhưng khi vượt quá context huấn luyện cần các chỉnh sửa như YaRN hay NTK-scaling.
ALiBi thì “dumb but effective” — không học gì thêm cả, chỉ trừ điểm theo khoảng cách. Mình thấy đây là triết lý đẹp: đôi khi giải pháp đơn giản lại generalize tốt nhất. Đổi lại, ALiBi có thể làm mô hình hơi yếu ở các tác vụ cần chú ý token xa nhau chính xác, nên ngày nay RoPE biến thể vẫn phổ biến hơn ở các mô hình lớn.
Nên Dùng ALiBi Khi Nào?
Nếu bạn fine-tune hoặc huấn luyện mô hình nhỏ từ đầu, đặc biệt với dữ liệu ngắn nhưng muốn suy luận dài (chatbot, summarize tài liệu), ALiBi là lựa chọn đáng cân nhắc.
Các mô hình dùng ALiBi nổi tiếng: MPT-7B, MPT-30B, BLOOM của BigScience. Nếu bạn làm việc với các mô hình này, việc hiểu ALiBi giúp bạn chọn max_seq_len hợp lý khi deploy.
Còn nếu dùng model lớn hiện đại như Llama hay Qwen thì RoPE đã là mặc định — ALiBi lúc này chỉ đáng để đọc cho hiểu bức tranh tổng thể.
Câu Hỏi Thường Gặp
ALiBi có làm chậm mô hình không? Không. Phép trừ linear rẻ hơn nhiều phép nhân ma trận, overhead gần như bằng không.
ALiBi có thể kết hợp với RoPE không? Về lý thuyết hai cái giải quyết cùng bài toán vị trí nên thường dùng một trong hai, không trộn.
Vì sao ít mô hình mới dùng ALiBi? Vì RoPE cho độ chính xác tốt hơn ở tác vụ dài phức tạp, cộng thêm hệ sinh thái scaling RoPE đã rất trưởng thành.
Kết Luận
ALiBi là minh chứng rằng đôi khi chỉ cần một phép trừ đơn giản cũng giải được bài toán hóc búa như mở rộng context window. Dù không còn là xu hướng chính, hiểu ALiBi giúp bạn nắm được cách mô hình “cân bằng” giữa trí nhớ gần và xa — nền tảng của mọi cuộc trò chuyện dài hiện nay.