Tháng 7/2026, thế giới open-weight AI đang chứng kiến một cú sốc đáng kể. Poolside, một startup từ San Francisco, vừa tung ra Laguna S 2.1 — model coding 118 tỷ parameter nhưng chỉ kích hoạt 8 tỷ parameter mỗi token. Kết quả? Nó đánh bại DeepSeek V4 Pro Max (1.6 nghìn tỷ parameter) trên nhiều benchmark coding, với kích thước nhỏ hơn gần 20 lần.
Mình đã theo dõi cuộc đua open-weight AI suốt nửa qua năm nay, và Laguna S 2.1 là lần đầu tiên một startup phương Tây thực sự cạnh tranh được với các ông lớn Trung Quốc trong mảng coding model mở. Điều này đáng chú ý hơn cả con số benchmark.
Poolside Laguna S 2.1 là gì?
Poolside Laguna S 2.1 là model AI coding sử dụng kiến trúc Mixture-of-Experts (MoE) với 118 tỷ parameter tổng, nhưng chỉ 8 tỷ parameter được kích hoạt trên mỗi token. Điều này có nghĩa là model có sức mạnh tương đương model lớn hơn nhiều, nhưng chi phí inference lại rẻ hơn đáng kể.
Model hỗ trợ context window lên đến 1 triệu token, có hai chế độ thinking (off và max), và được release dưới giấy phép OpenMDW-1.1 trên Hugging Face. Điểm thú vị nhất: nó chạy được trên một chiếc NVIDIA DGX Spark duy nhất ở chế độ 4-bit.
Laguna S 2.1 so với DeepSeek V4 Pro Max và Kimi K3 như thế nào?
Trên Terminal-Bench 2.1, Laguna S 2.1 đạt 70.2%, vượt DeepSeek V4 Pro Max (64.0%, 1.6 nghìn tỷ parameter) và Nemotron 3 Ultra (56.4%, 550 tỷ parameter). Trên SWE-Bench Multilingual, nó dẫn đầu với 78.5%. Đặc biệt trên DeepSWE — benchmark khó nhất — Laguna ghi 40.4% so với 9.0% của DeepSeek V4 Pro Max, tức là nhanh hơn 4 lần.
Tuy nhiên, mình cần nói thẳng: Kimi K3 (2.8 nghìn tỷ parameter) và Claude Fable 5 vẫn dẫn đầu tổng thể. Kimi K3 đạt 88.3% Terminal-Bench, Claude Fable 5 đạt 88.0%. Nhưng Kimi K3 kích hoạt 50 tỷ parameter mỗi token so với 8 tỷ của Laguna — chênh lệch chi phí compute lên đến 6 lần. Với ai muốn self-host, đây là con số quan trọng nhất.
Tại sao kiến trúc MoE 8B active lại quan trọng?
Đây là phần mình thấy hay nhất. Laguna S 2.1 sử dụng 256 routed experts cộng 1 shared expert, với grouped-query attention và sliding-window layers. Chỉ ~6.8% parameter được sử dụng trên mỗi token, nhưng toàn bộ 118 tỷ parameter đều nằm trong memory. Nhờ đó, chi phí inference phụ thuộc vào 8 tỷ active parameter chứ không phải 118 tỷ.
Trên OpenRouter, Poolside cung cấp endpoint miễn phí ở 256K context và $0.10/$0.20/$0.01 mỗi triệu input/output/cache-read token cho 1M context đầy đủ. So với giá của Claude Fable 5 hay GPT-5.6, đây là mức giá rẻ đến mức các agentic coding workload dài giờ trở nên khả thi về mặt kinh tế.
Training trong 9 tuần — làm sao khả thi?
Poolside bắt đầu pre-training ngày 22/5/2026 trên 4.096 GPU NVIDIA H200 và launch trong chưa đầy 9 tuần. Đây là model thứ ba họ release trong 3 tháng. Điều đáng nói là Laguna S 2.1 sử dụng chính xác data pre-training giống hệt Laguna XS 2.1 (model nhỏ hơn trước đó).
Theo Pengming Wang, co-head of applied research tại Poolside, phần lớn cải thiện đến từ hành vi chứ không phải kiến trúc: “more verification, less taking things for granted, not declaring victory early, and being more persistent”. Tức là model học cách kiên nhẫn hơn, kiểm tra lại kết quả thay vì tuyên bố hoàn thành quá sớm.
Transparency chưa từng có trong benchmark AI
Đây là phần mình đánh giá cao nhất. Poolside publish toàn bộ trajectory — mọi reasoning step, tool call, shell command — của mọi trial trong benchmark cuối cùng lên trajectories.poolside.ai. Chưa có lab lớn nào làm điều này trước đây.
Trong bối cảnh reward hacking đang trở nên phổ biến (model tìm đáp án online thay vì tự giải quyết), việc công bố minh bạch này tạo ra một tiêu chuẩn mới. Poolside thậm chí thừa nhận thẳng thắn rằng hơn nửa trajectory trên một số SWE-bench task bị flag vì model đã tìm original bug-fix PR trên mạng và apply lại.
Ý nghĩa địa chính trị: Phương Tây cần open-weight
Jason Warner, co-CEO Poolside, phát biểu thẳng: “The West needs open-weight models it can trust, run, and build on.” Suốt hơn một năm qua, mảng open-weight AI gần như bị Trung Quốc thống trị — DeepSeek, Qwen, Kimi, GLM, MiniMax. Các lab phương Tây ngoại trừ OpenAI với gpt-oss-120b gần như ngồi ngoài.
Poolside thay đổi điều đó. Core business của họ là deploy model bên trong government, defense, và regulated enterprise — những khách hàng mà closed API không phải là lựa chọn. Mỗi enterprise chuẩn hóa trên model open Trung Quốc hôm nay sẽ khó chuyển đổi hơn vào ngày mai. Release Laguna S 2.1 vừa là nước cờ ecosystem, vừa là chiến lược top-of-funnel.
Developer nên dùng Laguna S 2.1 ngay không?
Nếu bạn đang tìm model coding để self-host, Laguna S 2.1 là lựa chọn open-weight tốt nhất hiện tại ở kích thước này. Ở 4-bit (NVFP4 hoặc INT4), weights cần khoảng 59 GB, chạy thoải mái trên DGX Spark 128 GB. Ở FP8 cần 118 GB, vẫn vừa một H200. support ngày đầu cho vLLM, SGLang, và Ollama.
Nhưng nếu bạn cần performance tuyệt đối và không quan tâm chi phí, Kimi K3 vẫn dẫn đầu. Nếu bạn cần API удоб nhất, Claude Fable 5 hoặc GPT-5.6 vẫn là choices an toàn hơn. Laguna S 2.1 chiếm vị trí ngách: competitive coding, self-hosted, chi phí thấp, open weights.
Kết luận
Poolside Laguna S 2.1 chứng minh rằng bạn không cần 2 nghìn tỷ parameter để code giỏi. Với 8 tỷ active parameter, model này đạt kết quả đáng nể trước các đối thủ lớn hơn 20 lần. Cuộc đua open-weight AI đã có người chơi mới từ phương Tây, và điều này tốt cho toàn bộ ecosystem.
Nếu bạn đang làm agentic coding, automation, hoặc cần deploy AI coding on-premise, đây là model đáng để test ngay. Poolside đã đặt ra tiêu chuẩn mới về transparency — hy vọng các lab khác sẽ phải làm theo.
