Ant Group vừa thả một quả bom vào làng AI cuối tuần qua. Ling 3.0 Flash – model MoE 124 tỷ parameter nhưng chỉ kích hoạt 5.1 tỷ parameter mỗi token – chính thức khẳng định: bạn không cần một siêu máy tính để chạy model xịn. Mình đã thử tìm hiểu kỹ và đây là những gì đáng chú ý nhất.
Ling 3.0 Flash Là Gì?
Ling 3.0 Flash là model ngôn ngữ lớn mới nhất từ inclusionAI, nhóm nghiên cứu AI trực thuộc Ant Group – công ty mẹ của Alipay. Model này thuộc dòng “Flash” – tầng nhanh và tiết kiệm, nằm dưới các flagship lớn hơn của Ant. Điểm neo nhất: 124 tỷ parameter tổng nhưng chỉ 5.1 tỷ parameter active cho mỗi token nhờ kiến trúc Mixture-of-Experts.
124 Tỷ Parameter Nhưng Chỉ 5.1 Tỷ Active – Nghĩa Là Gì?
Trong MoE (Mixture-of-Experts), không phải tất cả parameter đều “bật” cùng lúc. Mỗi token chỉ kích hoạt một phần nhỏ network. Với Ling 3.0 Flash, bạn trả chi phí inference xấp xỉ model 5 tỷ parameter, nhưng tận dụng sức mạnh tri thức của 124 tỷ parameter. So với bản tiền nhiệm Ling 2.6 Flash (104B tổng, 7.4B active), Ant Group đã tăng tổng parameter lên nhưng giảm active parameter xuống – nước cờ rất thông minh.
Ling 3.0 Flash So Với Các Model Khác Như Thế Nào?
Ant Group khẳng định Ling 3.0 Flash đánh bại hoặc sánh ngang chính flagship 1 nghìn tỷ parameter của họ trên hầu hết benchmark. Trên SWE-Bench Pro, model đạt 56.63 điểm ở chế độ thinking. Nhưng cần lưu ý: đây là số liệu từ chính nhà phát hành, chưa có đánh giá độc lập. So với Grok 4.5 hay GPT-5.6 Luna, Ling 3.0 Flash có lợi thế giá cực rẻ nhờ active parameter thấp, nhưng ecosystem và community vẫn mỏng hơn nhiều.
Hybrid Reasoning Hoạt Động Ra Sao?
Ling 3.0 Flash là model hybrid-reasoning, tức là nó trả lời trực tiếp khi prompt đơn giản, và tự chuyển sang chế độ “tư duy dài” khi gặp bài toán khó. Điều này khác với các model chỉ có một chế độ duy nhất. Mình thấy đây là điểm hay vì tiết kiệm token cho tác vụ nhẹ, nhưng vẫn đủ sâu cho bài toán phức tạp. Kiến trúc hybrid linear-attention với tỉ lệ 5:1 (5 lớp KDA trên 1 lớp MLA) giúp model giữ context dài 256K token mà vẫn rẻ, có thể mở rộng lên 1 triệu token.
Có Thể Dùng Ling 3.0 Flash Miễn Phí Không?
Có, và đây là phần mình thích nhất. Ling 3.0 Flash đang miễn phí hoàn toàn trên OpenRouter (model: inclusionai/ling-3.0-flash) và ZenMux đến hết ngày 3 tháng 8 năm 2026. API tương thích chuẩn OpenAI, nên bạn chỉ cần đổi base URL, API key và model name là chạy. Sau ngày 3/8, giá dự kiến xấp xỉ bản tiền nhiệm – khoảng $0.01 input và $0.03 output cho mỗi triệu token, mức giá cực kỳ cạnh tranh.
Ling 3.0 Flash Có Open-Weight Không?
Không. Đây là thay đổi đáng thất vọng nhất. Khác với Ling 2.6 Flash (có open-weight trên Hugging Face), Ling 3.0 Flash chỉ dùng được qua API tại thời điểm ra mắt. Nếu bạn cần self-host hoặc quantize lên hardware riêng, tạm thời phải dùng bản 2.6 Flash. Theo mình đánh giá, Ant Group đang chuyển sang mô hình API-first để kiếm tiền, giống xu hướng chung của ngành AI năm 2026 khi Meta cũng đóng cửa Muse Spark 1.1.
Model Này Phù Hợp Cho Ai?
Ling 3.0 Flash được thiết kế cho agentic workload: code, tool calling, research multi-step, browser automation. Nếu bạn đang xây AI agent cần chạy hàng nghìn token mỗi task với chi phí thấp, đây là ứng cử viên rất mạnh. Ngược lại, nếu bạn cần model cho chat đơn thuần hoặc cần tự host, các lựa chọn như GLM-5.2 hay DeepSeek phù hợp hơn. Mình đánh giá Ling 3.0 Flash là model “đặc nhiệm” cho agent – không phải model đa năng nhất, nhưng cực kỳ hiệu quả trong niche của nó.
Tại Sao Mình Quan Tâm Đến Một Model Của Trung Quốc?
Đơn giản vì giá. Khi OpenAI GPT-5.6 Luna tính $1 input và Anthropic Claude Opus 5 tính $25 output cho mỗi triệu token, một model có chất lượng tương đương với giá gần như bằng không là cơ hội thực tế cho developer Việt Nam. Bạn không cần vốn lớn để build product AI nữa. Và với 256K context, Ling 3.0 Flash đủ sức xử lý những task dài mà trước đây chỉ flagship mới làm được.
Kết
Ling 3.0 Flash là minh chứng rõ nhất: cuộc đua AI không chỉ về ai có model lớn nhất, mà về ai tối ưu được mỗi token rẻ nhất. Ant Group đã chọn hướng “thông minh hơn, không to hơn” – và nó hoạt động. Nếu bạn đang tìm model cho AI agent với chi phí thấp, hãy thử Ling 3.0 Flash miễn phí trên OpenRouter trước khi cửa sổ đóng vào 3/8. Mình sẽ theo dõi thêm khi có benchmark độc lập và cập nhật khi Ant Group mở weight.
