GLM-5.3-Flash Chính Là Ox Alpha: Z.ai Bật Mí Model 320B Giá 1/10 Đánh Gần Ngang Claude Opus 4.8

Câu trả lời nhanh
GLM-5.3-Flash là model 320B parameter mới nhất của Z.ai, chính là Ox Alpha từng chạy ẩn danh trên OpenRouter. Với 18B active parameter, context 1 triệu token, license MIT và giá bằng 1/10 GLM-5.2, nó thắng GLM-5.2 ở cả 8 benchmark đã công bố và tiệm cận Claude Opus 4.8 ở coding. Lựa chọn đáng cân nhắc cho coding agent và workflow tự động.

Mình từng nghi ngờ Ox Alpha là model của một lab lớn nào đó giấu tên để test phản ứng cộng đồng. Hôm 26/8, câu trả lời lộ ra: Ox Alpha chính là GLM-5.3-Flash của Z.ai, model 320B parameter mở khóa (open weight) chạy lén trên OpenRouter suốt nhiều tuần trước khi được xướng tên. Chuyện này thú vị hơn bất kỳ benchmark nào, vì nó cho thấy cách các lab tung model ra công chúng đã đổi hẳn.

Nhưng bỏ phần drama lại, bản thân GLM-5.3-Flash mới là thứ đáng nói: 320B tổng parameter nhưng chỉ kích hoạt 18B mỗi lần chạy, cửa sổ ngữ cảnh 1 triệu token, phát hành dưới license MIT, và Z.ai tuyên bố nhanh hơn GLM-5.2 ở mọi bài test coding lẫn agentic với giá chỉ bằng một phần mười. Mình đọc xong bảng benchmark là mở tab download luôn.

GLM-5.3-Flash là gì và nó đến từ đâu?

Z.ai bật mí GLM-5.3-Flash chính là Ox Alpha

GLM-5.3-Flash là model multimodal mới nhất của Z.ai, ra mắt ngày 26/8/2026, được huấn luyện trên kho dữ liệu 30 nghìn tỷ token. Đây là bản “nhẹ” đứng sau GLM-5.3 (743B parameter) đúng 12 ngày, nhưng thay vì so với anh cả, Z.ai lại đưa nó ra đọ với GLM-5.2 thế hệ trước — và thắng trắng ở cả 8 bài test mà GLM-5.2 từng công bố.

Điểm thú vị nhất: model này đã chạy trên OpenRouter dưới tên Ox Alpha mà không ai biết chủ nhân là ai. Nếu bạn còn nhớ bài Ox Alpha Model Ẩn Danh Miễn Phí Trên OpenRouter mình viết hồi giữa tháng, cộng đồng khi đó đặt đủ loại giả thuyết, từ OpenAI, Anthropic đến một startup bí ẩn nào đó. Kết quả: Z.ai. Họ chọn cách test product thật với người dùng thật trước khi làm marketing.

Thông số nào khiến GLM-5.3-Flash đáng chú ý?

Con số gây ấn tượng nhất với mình là tỷ lệ 320B/18B: tổng parameter lớn nhưng chỉ 18B được kích hoạt mỗi token nhờ kiến trúc MoE kết hợp linear attention cho ngữ cảnh cục bộ và sparse attention cho ngữ cảnh toàn cục. Điều đó đồng nghĩa chi phí inference thấp, tốc độ nhanh, mà vẫn giữ được chất lượng của model lớn.

Những thông số chính bạn cần nhớ:

  • 320B parameter tổng, 18B active — kiến trúc Mixture-of-Experts tiên tiến
  • 1 triệu token context — đủ nhét cả codebase lớn hoặc hàng trăm trang tài liệu
  • License MIT — tự do thương mại, tự do sửa, tự do deploy
  • Giá bằng 1/10 GLM-5.2 theo tuyên bố của Z.ai
  • Đa phương thức từ gốc — hiểu cả text, ảnh, video, biểu đồ ngay từ lúc huấn luyện

GLM-5.3-Flash chạy benchmark ra sao so với đối thủ?

Z.ai công bố 14 benchmark lúc ra mắt, và GLM-5.3-Flash đứng đầu tuyệt đối ở 4 bài. Cá nhân mình thấy mấy con số này đáng chú ý nhất: Toolathlon-Verified 78,4% (dùng tool hàng ngày như người thật), Terminal-Bench 2.1 đạt 84,3% (làm việc qua command line), DeepSWE 1.1 đạt 63,4% (coding agentic end-to-end), và AutomationBench 48,8% (chạy workflow văn phòng nhiều bước).

So với Claude Opus 4.8, Z.ai khẳng định GLM-5.3-Flash “tiệm cận” trên benchmark coding nội bộ của họ — cách nói khôn khéo, vì benchmark tự nghĩ thì ai cũng thắng trên đó. Nhưng qua số liệu độc lập từ Artificial Analysis, chất lượng thực của model này so với giá tiền đang thuộc nhóm tốt nhất thị trường. Cứ thử rồi biết, mình đã test vài model cùng lúc thế hệ này và xác nhận phần hiệu năng không phải chỉ trên giấy.

Vì sao Z.ai chọn cách ra mắt model ẩn danh?

Đây là phần mình thích nhất của câu chuyện. Thay vì buổi ra mắt truyền thống với banner to đùng, Z.ai thả model lên OpenRouter không tên tuổi, miễn phí, rồi im lặng theo dõi. Cộng đồng tự test, tự lan truyền, tự dựng giả thuyết. Đến hôm công bố, cái tên GLM-5.3-Flash tiếp nhận một lượng attention có sẵn mà không tốn một đồng quảng cáo nào.

Nếu bạn làm product, đây là bài học đáng ghi nhớ: để sản phẩm tự chứng minh trước khi đập brand vào nó. Người dùng quan tâm model chạy có tốt không, không phải ai làm ra nó. Với GLM-5.3-Flash, câu trả lời đã có từ nhiều tuần trước khi ai biết tên nó.

Nên dùng GLM-5.3-Flash ngay không?

Theo mình: nên, nhất là nếu bạn đang trả tiền cho API của các model lớn. Với giá bằng 1/10 GLM-5.2 mà chất lượng ngang hoặc hơn, bài toán chi phí cho agent chạy tự động đổi hẳn. Ba kịch bản mình đề xuất:

  • Coding agent chạy dài: 1M token context cộng giá rẻ nghĩa là nhét cả repo vào và để nó tự sửa, không cần chia nhỏ.
  • Workflow tự động hóa: điểm AutomationBench 48,8% ở model giá rẻ là lý do đủ để chuyển task batch sang nó.
  • Chạy local qua quant: đội Unsloth chắc chắn sẽ ra bản nén GGUF sớm, kiểu như họ đã làm với Unsloth Dynamic 3.0 cho Qwen. Ai có GPU cá nhân thì cứ chờ.

Còn nếu bạn quan tâm dòng GLM nói chung, có thể đọc thêm bài GLM-5.3 vượt Anthropic trên benchmark bảo mật để hiểu Z.ai đang leo thang thế nào trong năm nay.

Kết luận: model giá rẻ đang định hình lại cuộc chơi

GLM-5.3-Flash không phải model mạnh nhất từng ra mắt, nhưng nó là minh chứng rõ nhất cho xu hướng 2026: chất lượng cao, giá thấp, mở khóa triệt để. Khi một model 320B miễn phí chạy tốt hơn các lựa chọn đắt gấp mười, câu hỏi không còn là “nên dùng AI nào” mà là “vì sao vẫn trả tiền đắt”. Mình sẽ tiếp tục test GLM-5.3-Flash trong vài tuần tới và cập nhật kết quả thực chiến.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *