Nhật Bản vừa làm điều mà không ai trong thung lũng Silicon nghĩ tới: thay vì xây một model khổng lồ mới, họ chế tạo một “nhạc trưởng” AI điều phối GPT, Gemini, Claude Opus cùng nhau. Sakana Fugu đạt hiệu năng ngang Fable 5 mà không cần Fable 5.
Sakana Fugu là gì?
Sakana Fugu là hệ thống multi-agent của Sakana AI (Tokyo, Nhật Bản), hoạt động như một model duy nhất nhưng thực chất điều phối động nhiều LLM hàng đầu thế giới. Thay vì phụ thuộc vào GPT-5.5 hay Gemini 3.1 Pro riêng lẻ, Fugu tự phân chia task, giao đúng việc cho đúng model, rồi tổng hợp kết quả thành một câu trả lời hoàn chỉnh.
Điểm thú vị nhất: Fugu đạt mức Fable 5-level trên benchmark mà không hề dùng Fable 5 trong agent pool. Với model bị chính phủ Mỹ hạn chế, đây là cách tiếp cận thông minh để có hiệu năng frontier mà không vướng rào cản pháp lý.
Khác gì so với dùng ChatGPT hay Claude trực tiếp?
Khi mình dùng ChatGPT, mình bị khóa vào OpenAI. Khi dùng Claude, mình phụ thuộc Anthropic. Fugu giải bài toán khác: nó像一个 đội ngũ mà mỗi thành viên giỏi một mảng. Model A giỏi code, model B giỏi reasoning, model C giỏi verify. Fugu tự học cách phối hợp họ qua hai paper ICLR 2026: TRINITY (phân vai Thinker/Worker/Verifier) và Conductor (reinforcement learning để tối ưu giao tiếp giữa agents).
So sánh thực tế: nếu một model bị block đêm hôm (như Fable 5 từng bị), hệ thống single-vendor chết ngay. Fugu đơn giản swap model khác vào pool và tiếp tục chạy. Đó là resilience mà không AI lab nào cung cấp.
Hiệu năng thực tế có thật sự ấn tượng?
Con số nói lên tất cả. Trên SWE Bench Pro (coding thực chiến), Fugu Ultra ghi 73.7%, vượt Opus 4.8 ở 69.2%. Trên TerminalBench 2.1, Fugu Ultra đạt 82.1% so với 74.6% của Opus 4.8. Khoảng cách gần 8 điểm phần trăm trên benchmark coding là rất lớn.
Trên Humanity’s Last Exam (exam khó nhất hiện nay), Fugu Ultra ghi 50.0%, hơn Opus 4.8 (49.8%) và GPT-5.5 (41.4%). LiveCodeBench Pro: 90.8% so với 84.8%. GPQA-D (scientific reasoning): 95.5% so với 92.0% của Opus 4.8.
Bảng so sánh nhanh giữa Fugu Ultra vs các frontier model:
- SWE Bench Pro: Fugu Ultra 73.7% | Opus 4.8 69.2% | GPT-5.5 58.6%
- TerminalBench 2.1: Fugu Ultra 82.1% | Opus 4.8 74.6% | GPT-5.5 78.2%
- LiveCodeBench Pro: Fugu Ultra 90.8% | Opus 4.8 84.8% | GPT-5.5 88.4%
- Humanity’s Last Exam: Fugu Ultra 50.0% | Opus 4.8 49.8% | Gemini 3.1 Pro 44.4%
Ba phiên bản Fugu phục vụ nhu cầu gì?
Sakana cung cấp ba phiên bản qua một API duy nhất (OpenAI-compatible, dễ tích hợp):
Fugu (bản tiêu chuẩn): Cân bằng giữa hiệu năng và tốc độ. Phù hợp cho coding hàng ngày, code review, chatbot. Tích hợp thẳng vào Codex hay Cursor mà không cần đổi integration.
Fugu Ultra: Dùng pool agent sâu hơn, tối ưu cho task khó. Người dùng đầu tiên dùng cho Kaggle competitions, reproduce paper, phân tích cybersecurity, điều tra patent. Latency cao hơn nhưng chất lượng answer tốt hơn.
Fugu Cyber: Specialize cho cybersecurity. Đạt 86.9% trên CyberGym và 72.1% trên CTI-REALM, ngang các model security-focused như GPT-5.5-Cyber.
Developer tại Việt Nam nên quan tâm Fugu không?
Mình nghĩ có, vì ba lý do thực tế. Thứ nhất, Fugu dùng OpenAI-compatible API nên integrate vào workflow hiện tại cực nhanh, không cần rewrite code. Thứ hai, khả năng opt-out specific provider giúp tuân thủ yêu cầu compliance nếu công ty cấm model nào đó. Thứ ba, giá ước tính rẻ hơn dùng Opus 4.8 hay GPT-5.6 Sol riêng lẻ vì Fugu route task rẻ cho model rẻ.
Limitation cần biết: Fugu chưa available ở EU/EEA do đang compliant GDPR. Tại Việt Nam thì dùng được. Và vì Fugu gọi qua nhiều model, latency có thể cao hơn dùng single model trực tiếp.
Nếu mình đang build product phụ thuộc nhiều vào AI reasoning quality, Fugu Ultra là option worth testing. Đặc biệt khi các frontier model bị chính phủ kiểm soát ngày càng chặt, việc có một layer orchestration độc lập là chiến lược de-risk khôn ngoan.
Cuộc đua AI đang đổi hướng
Sakana Fugu chứng minh một điều: tương lai AI không nhất thiết thuộc về ai build model lớn nhất. Nó thuộc về ai phối hợp model tốt nhất. Khi OpenAI, Anthropic, Google đào sâu từng silo, Nhật Bản chọn hướng khác: build layer phía trên, nơi tất cả model cùng hợp tác.
Đó có thể là blueprint cho kỷ nguyên tiếp theo. Khi frontier model ngày càng bị kiểm soát, locked behind government approval, multi-agent orchestration trở thành cách tiếp cận dân chủ hơn. Không cần quyền truy cập Fable 5 hay GPT-5.6 Sol. Chỉ cần biết phối hợp những gì đã có.
Sakana AI từng gây chú ý với evolutionary model merge năm 2024. Năm 2026, họ lại đi trước đám đông, lần này bằng cách nhìn AI không như một sản phẩm, mà như một dàn nhạc.
