Liquid AI vừa ra mắt LFM2.5-2.6B, model AI open-weight chỉ 2.6 tỷ parameter nhưng chạy được trên Raspberry Pi. 220 tokens/giây trên Apple M5 Max, 30 tokens/giây trên smartphone, dùng chưa tới 2.5 GB RAM. Đấy là điều mà GPT-5.6 hay Claude Fable 5 không bao giờ làm được.
Điều đáng chú ý nhất: model này được train trực tiếp bên trong OpenClaw và Hermes Agent. Liquid AI không tạo ra chatbot. Họ tạo ra AI agent chạy local.
LFM2.5-2.6B là gì và tại sao bạn cần quan tâm?

LFM2.5-2.6B là model ngôn ngữ open-weight của Liquid AI, startup thành lập 2023 bởi cựu nhà nghiên cứu MIT. Model chỉ 2.6 tỷ parameter nhưng hỗ trợ context window 128.000 token, native tool calling, và được thiết kế riêng cho agentic workload.
Điểm khác biệt lớn nhất so với các model cùng size: LFM2.5-2.6B không cạnh tranh trên benchmark tuyệt đối. Nó cạnh tranh trên khả năng triển khai. Bạn không cần GPU, không cần cloud, không cần trả tiền per-token. Chỉ cần một chiếc Raspberry Pi.
Chạy trên Raspberry Pi nhanh như thế nào?
Theo số liệu Liquid AI công bố, LFM2.5-2.6B đạt 220 tokens/giây trên Apple M5 Max, 113 tokens/giây trên AMD Ryzen AI Max+ 395, và khoảng 30 tokens/giây trên smartphone. Toàn bộ dùng chưa tới 2.5 GB RAM.
Trên một Nvidia H100 duy nhất, model đạt gần 15.000 tokens/giây, tương đương 1.3 tỷ token mỗi ngày. Khi so với DeepSeek-V4-Flash, model này nhanh hơn 3.7 lần trong một test độc lập. Tất nhiên đây là số liệu từ chính Liquid AI, chưa được verify độc lập.
LFM2.5-2.6B vs Gemma 4 vs Qwen 3.5: Ai thắng?
Đây là phần thú vị nhất. Dù nhỏ nhất trong nhóm so sánh, LFM2.5-2.6B dẫn đầu mọi benchmark instruction-following và gần như mọi benchmark tool use.
Trên AIME25 (toán), LFM2.5-2.6B đạt 51.87 điểm, so với 26.33 của Gemma 4 E2B (5.1B) và 49.33 của Qwen 3.5-4B. Trên BFCLv4 (tool calling), nó đạt 56.88, bỏ xa Gemma 4 E2B ở 36.98. Chỉ trên LiveCodeBench (coding) thì các model lớn hơn như Qwen 3.5-9B mới vượt.
Tóm lại: nếu task là tool use, instruction following, hoặc agentic workflow, model 2.6B này đánh bại model gấp 4 lần size.
Training pipeline có gì đặc biệt?
Liquid AI dùng pipeline 4 giai đoạn cho post-training. Đầu tiên là Supervised Fine-Tuning (SFT) với dataset gấp 7 lần phiên bản trước. Tiếp theo là Teacher Specialization: train từng expert riêng biệt cho từng domain (math, code, tool use, instruction following).
Giai đoạn 3 là Multi-Domain On-Policy Distillation (MOPD): gộp các expert lại thành một student model. Giai đoạn cuối là Agentic Reinforcement Learning: model được train trực tiếp bên trong Hermes Agent, OpenClaw, và các harness khác trên các task thực tế như research, coding, document management.
Maxime Labonne, head of post-training tại Liquid AI, gọi kết quả ngoài mong đợi là “happy accident”: quá trình train cho agentic khiến model giỏi hơn ở mọi thứ, kể cả code, điều mà các phiên bản trước chưa làm được.
Tại sao đây là tín hiệu cho tương lai AI agent?
Labonne nói thẳng: “Models are not consumed in chatbots anymore. They’re really consumed through agentic harnesses.” Đây là xác nhận từ bên trong ngành: tương lai AI không phải là chatbot. Là agent.
Những gì Liquid AI làm chứng minh rằng bạn không cần model nghìn tỷ parameter để có AI agent hữu ích. Một model 2.6B, chạy trên điện thoại, tool calling mượt, 128K context, zero chi phí per-token. Đó là công thức thay đổi cuộc chơi cho enterprise.
Labonne cũng nhấn mạnh: thay vì fine-tune model cho từng task, bạn chỉ cần đổi harness. Cùng một model, đổi tools xung quanh là thành calendar assistant, meeting assistant, hay research agent. Chi phí thấp, tính linh hoạt cao.
Giấy phép open-weight: cẩn thận!
LFM2.5-2.6B phát hành trên Hugging Face với custom open weights license. Tương tự Kimi K3 của Moonshot, đây không phải license open-weight chuẩn. Enterprise cần đọc kỹ trước khi deploy, đặc biệt nếu có yêu cầu compliance nghiêm ngặt.
Model hỗ trợ day-one với llama.cpp, MLX, vLLM, SGLang, và ONNX. Liquid AI cũng cung cấp LEAP, framework fine-tune open-source riêng.
Kết luận: AI agent chạy trên thiết bị không còn là viễn cảnh
LFM2.5-2.6B chứng minh rằng edge AI agent đã đến. Không cần cloud, không cần GPU, không cần trả tiền token. Chỉ cần một thiết bị phổ thông và model 2.6B.
Dành cho developer đang build AI agent, đây là lúc nghiêm túc nhìn vào edge deployment. Chi phí gần như bằng không, privacy tuyệt đối, latency thấp. Coding-heavy thì vẫn cần model lớn hơn, nhưng tool use, document management, workflow automation: LFM2.5-2.6B đã sẵn sàng.
Bạn có thể tải model ngay trên Hugging Face hoặc thử qua app Apollo của Liquid AI trên điện thoại.
