Ngày 14/8/2026, Z.ai (tên quốc tế của Zhipu AI) chính thức ra mắt GLM-5.3. Model này ghi 84.5% trên CyberGym, benchmark đo khả năng tìm và xác minh lỗ hổng bảo mật từ mã nguồn, vượt qua Anthropic Mythos 5 với 83.8% và OpenAI GPT-5.6 Sol với 83.6%. Đây là lần hiếm hoi một model Trung Quốc ngồi đầu bảng ở mảng năng lực nhạy cảm này.

Phần mình thấy đáng nói hơn cả điểm số: Z.ai tự ý trì hoãn phát hành trọng số mở khoảng 2 tuần, lý do là năng lực an ninh mạng tăng nhanh hơn đội ngũ dự kiến trong lúc post-training. Một công ty mở mà chủ động giữ lại weights vì model “quá giỏi tìm lỗ hổng”, đây là tình tiết mình chưa thấy ở vòng đời model nào trước đó.
GLM-5.3 là gì?
GLM-5.3 là model flagship mới nhất của Z.ai, ra mắt ngày 14/8/2026, sử dụng đúng nền tảng 743 tỷ tham số của GLM-5.2 chứ không huấn luyện lại từ đầu. Toàn bộ mức tăng đến từ post-training, chủ yếu là dữ liệu về tìm kiếm lỗ hổng. Hiện API và gói GLM Coding Plan đã dùng được ngay, còn trọng số mở sẽ phát hành sau khi hoàn tất đánh giá an toàn.
Điểm đáng chú ý nằm ở tốc độ tiến bộ so với thế hệ trước. GLM-5.2 ghi 77.2% trên CyberGym và 24.4% trên ExploitBench. GLM-5.3 nhảy lên 84.5% và 54.4%, tương đương hơn gấp đôi ở bài đo khả năng biến lỗ hổng thành đòn khai thác chạy được. Z.ai thừa nhận họ chỉ kỳ vọng cải thiện nhẹ, ai ngờ năng lực cứ tăng theo quy mô huấn luyện.
GLM-5.3 so với Anthropic Mythos 5 và GPT-5.6 Sol như thế nào?
Ở bài tìm lỗ hổng, GLM-5.3 dẫn đầu với 84.5%, hơn Mythos 5 (83.8%) và GPT-5.6 Sol (83.6%). Nhưng sang bài đo khai thác, Mythos 5 vẫn giữ khoảng cách lớn với 78.0% trên ExploitBench, trong khi GLM-5.3 chỉ đạt 54.4%. Nói ngắn gọn: tìm ra cửa hậu thì GLM-5.3 giỏi nhất, mà mở được cửa thì Anthropic vẫn hơn hẳn.
| Bài test | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|
| CyberGym (tìm lỗ hổng) | 84.5% | 83.8% | 83.6% |
| ExploitBench (khai thác) | 54.4% | 78.0% | ~76.5% |
| ExploitGym, 2 giờ (số task) | 105 | 181 | Chưa công bố |
Lưu ý quan trọng: toàn bộ số liệu trên do chính Z.ai công bố, chưa qua xác minh độc lập. Mình khuyên bạn giữ một khoản hoài nghi khỏe mạnh với mọi bảng điểm do hãng tự chấm, kể riêng mảng an ninh mạng vốn rất dễ “học vẹt” benchmark.
Theo Reuters, chính Z.ai cũng xác nhận GLM-5.3 tụt sau Mythos 5 ở khâu biến lỗi phát hiện thành đòn tấn công chạy được. Khoảng cách 181 so với 105 task trong 2 giờ trên ExploitGym cho thấy gap về lập kế hoạch nhiều bước vẫn còn rõ.
Tại sao Z.ai trì hoãn phát hành trọng số mở?
Vì năng lực tìm lỗ hổng tăng nhanh ngoài mong đợi trong lúc post-training, Z.ai cần khoảng 2 tuần để đánh giá an toàn và hardening trước khi mở weights. Trong thời gian đó, các chức năng an ninh nhạy cảm chỉ truy cập được qua chương trình “trusted access” dành cho người dùng đã xác minh. API thường và GLM Coding Plan vẫn hoạt động bình thường.
Lý do nằm ở bản chất của hai mô hình phân phối. Chạy qua API, Z.ai kiểm soát được từng yêu cầu, giới hạn năng lực nguy hiểm và thu hồi quyền truy cập khi cần. Phát trọng số cho tải về thì mọi lớp kiểm soát đó gần như vô hiệu, vì ai cũng tự chạy và tự chỉnh sửa model. Ai muốn nắm rõ sự khác biệt này có thể đọc lại bài trọng số mở (open weights) là gì.
Bối cảnh rộng hơn cũng đáng chú ý. Anthropic giữ Mythos 5 ở dạng restricted, OpenAI xử lý thận trọng với GPT-5.6 Sol, cả hai đều dựa trên lập luận giữ model nguy hiểm sau API có kiểm soát. GLM-5.3 chưa phá vỡ lập luận đó vì vẫn thua rõ ở khâu khai thác, nhưng nó bộc lộ điểm yếu của giả định open model luôn đi sau closed model ở năng lực chuyên môn nguy hiểm.
GLM-5.3 đã tìm được bao nhiêu lỗ hổng thật?
Theo Z.ai, hệ sinh thái quanh GLM-5.3 đã tìm ra 2.436 lỗ hổng riêng biệt trên 269 dự án, trong đó 1.097 lỗi thuộc mức nghiêm trọng hoặc cao. Các đối tác gồm Đại học Tsinghua, Đại học Nankai, NSFOCUS và CyberKunlun. Phần mềm bị ảnh hưởng có Linux, WebKit và FreeBSD, tức là hạ tầng nguồn mở mà hàng tỷ thiết bị đang dùng.
Con số này khiến GLM-5.3 vượt ra ngoài chuyện benchmark cho vui. Năng lực quét lỗi hệ thống hóa trên phần mềm phổ biến mang giá trị phòng thủ rõ ràng, và đúng năng lực đó cũng có giá trị với kẻ tìm điểm yếu để tấn công. Z.ai đang đẩy mạnh hướng phòng thủ qua sáng kiến Open Source Shield.
Nhìn từ góc kiếm tiền, đây là tín hiệu đáng lưu tâm cho ai làm bug bounty: công cụ tìm lỗ hổng bằng AI đang rẻ và mạnh lên nhanh. Ai từng đọc cuộc chiến giá API năm 2026 sẽ nhận ra mô hình quen thuộc, năng lực xịn đang đổ về phía giá giảm dần.
Có nên dùng GLM-5.3 ngay bây giờ không?
Nên thử nếu bạn cần trợ lý đọc code, audit bảo mật hoặc coding agent với chi phí thấp: API và GLM Coding Plan đã mở, chất lượng tìm lỗi tốt nhất bảng. Nên chờ nếu bạn cần tự host, vì weights chưa phát hành. Còn nếu công việc của bạn xoay quanh khai thác lỗ hổng chuyên sâu thì Claude vẫn là lựa chọn an toàn hơn ở thời điểm này.
Mình đã theo dõi Z.ai vài vòng ra model, và lần này ấn tượng nhất ở nhịp phát hành chứ không chỉ điểm số. GLM-5.3 dùng lại nền 743 tỷ tham số của GLM-5.2 mà đạt mức nhảy hơn gấp đôi ở ExploitBench, tức là họ tối ưu post-training thay vì đốt tiền huấn luyện lại. Caixin đưa tin doanh thu định kỳ của Z.ai đã chạm mốc 1 tỷ USD, nên đà đầu tư của hãng còn dài. Trước đó Mistral cũng ký thỏa thuận host GLM-5.2 tại điện toán châu Âu, cho thấy model Trung Quốc đang len lỏi vào hạ tầng phương tiện hơn nhiều người nghĩ.
Tóm lại, GLM-5.3 là bản cập nhật đáng giá với người làm kỹ thuật: mạnh hẳn về đọc code và tìm lỗi, giá tốt, nhưng chưa phải đối trọng thật sự của Mythos 5 ở khâu khai thác. Khoảng 2 tuần nữa khi weights mở, chúng ta sẽ có câu trả lời rõ hơn cho cuộc đua open vs closed năm nay.
