Grok 4.6 SpaceXAI Ra Mắt: Vượt Kimi K3, Ngang GPT-5.6 Sol, Giá Rẻ 4 Lần Fable 5

Grok 4.6 ra mắt bởi SpaceXAI
Câu trả lời nhanh
Grok 4.6 của SpaceXAI (tên mới xAI) đạt 61 điểm Artificial Analysis Index, vượt Kimi K3 và ngang GPT-5.6 Sol Max. Giá API chỉ $2/$6 mỗi triệu token, rẻ hơn GPT-5.6 Sol 4 lần. Cải thiện lớn ở agent benchmark, đặc biệt APEX-Agents tăng 10.4 điểm. Claude Opus 5 và Fable 5 vẫn dẫn đầu top 1-2.

SpaceXAI (tên mới của xAI sau khi SpaceX thâu tóm) vừa ra mắt Grok 4.6, model AI frontier tập trung vào agent dài hạn, coding và knowledge work. Điểm số trên Artificial Analysis Intelligence Index đạt 61, vượt Kimi K3 của Moonshot và ngang GPT-5.6 Sol Max của OpenAI, cải thiện 5 điểm so với Grok 4.5.

Grok 4.6 SpaceXAI ra mắt model AI mới

Nhưng điều đáng chú ý hơn không nằm ở benchmark. Grok 4.6 giữ giá API chỉ $2 mỗi triệu input token và $6 mỗi triệu output token, rẻ hơn GPT-5.6 Sol Standard tới 4 lần và rẻ hơn Claude Fable 5 gần 8 lần. Mình so sánh chi tiết bên dưới.

Grok 4.6 đạt mức nào trên bảng xếp hạng AI?

Trên Artificial Analysis Intelligence Index, Grok 4.6 ghi 61 điểm, xếp thứ 4 toàn cầu. Claude Opus 5 và Claude Fable 5 của Anthropic vẫn chiếm vị trí số 1 và 2. Grok 4.6 vượt Kimi K3 (Moonshot) và ngang GPT-5.6 Sol Max (OpenAI).

Đáng ý hơn là các benchmark agent. Trên APEX-Agents, Grok 4.6 nhảy từ 47.1% lên 57.5%, vượt cả GPT-5.6 Sol Max (56.7%). Trên AA-Briefcase (nhiệm vụ chuyên môn dài hạn), Grok 4.6 đạt Elo 1.577, vượt Fable 5 Max (1.574) và GPT-5.6 Sol Max (1.502). Tuy nhiên, Terminal-Bench vẫn là điểm yếu: 26% so với 34.6% của GPT-5.6 Sol Max.

Grok 4.6 có giá rẻ hơn đối thủ bao nhiêu?

Nhiều người hỏi mình về chi phí thực tế. Dưới đây là so sánh giá API các model frontier tính đến tháng 8/2026:

  • Grok 4.6 (dưới 200K token): $2 input / $6 output mỗi triệu token
  • GPT-5.6 Sol Standard: $5 / $30 — đắt hơn Grok 4.6 gấp 4.4 lần về output
  • Claude Fable 5: $10 / $50 — đắt hơn 8.3 lần về output
  • Claude Opus 5: $5 / $25 — đắt hơn 4.2 lần về output
  • Kimi K3: $3 / $15 — đắt hơn 2.5 lần về output

Lưu ý quan trọng: khi prompt vượt 200.000 token, giá Grok 4.6 tăng lên $4 input / $12 output, áp dụng cho toàn bộ token trong request đó. Context window tối đa là 500.000 token.

Grok 4.6 cải thiện gì so với Grok 4.5?

SpaceXAI cho biết họ tập trung huấn luyện Grok 4.6 cho các tác vụ agent dài hạn: nghiên cứu chủ đề mới, phân tích thông tin, duyệt codebase và chuyển ý tưởng sản phẩm thành ứng dụng chạy được.

Cải thiện đáng kể nhất so với Grok 4.5:

  • CursorBench v3.2: 66.7% tăng lên 69.9%
  • DeepSWE v1.1: 54% nhảy lên 65.9%
  • APEX-Agents: 47.1% lên 57.5% (tăng 10.4 điểm)
  • AA-Briefcase Elo: 1.526 lên 1.577
  • Harvey LAB: 12.9% lên 15.8%

Điều mình thấy thú vị là Grok 4.6 có xu hướng tự test và tự kiểm tra kết quả trước khi tiếp tục, thay vì chạy một mạch như Grok 4.5. SpaceXAI mô tả đây là kết quả của reinforcement learning nhắm vào môi trường agent bao gồm coding, web development và CAD.

Grok 4.6 vs Claude Fable 5 vs GPT-5.6 Sol: ai thắng hạng nào?

Không có model nào thắng toàn diện. Mình tổng hợp từ dữ liệu SpaceXAI và Artificial Analysis:

  • Coding (CursorBench): Fable 5 Max dẫn (70.5%), Grok 4.6 (69.9%), GPT-5.6 Sol Max (68.x%)
  • SWE (DeepSWE): GPT-5.6 Sol Max dẫn (73%), Grok 4.6 (65.9%)
  • Agent (APEX-Agents): Fable 5 Max dẫn (59.2%), Grok 4.6 (57.5%), GPT-5.6 Sol Max (56.7%)
  • Terminal-Bench: GPT-5.6 Sol Max (34.6%), Fable 5 Max (34.1%), Grok 4.6 (26%)
  • Knowledge work (AA-Briefcase): Grok 4.6 dẫn (1.577), Fable 5 Max (1.574)

Grok 4.6 mạnh nhất ở knowledge work dài hạn, yếu nhất ở terminal tasks. Nếu bạn cần AI agent chạy code thì Fable 5 hoặc GPT-5.6 Sol vẫn tốt hơn. Nhưng nếu cần agent xử lý tác vụ chuyên môn phức tạp với chi phí thấp, Grok 4.6 là lựa chọn hấp dẫn.

Chi phí thực tế mỗi task agent đắt bao nhiêu?

Artificial Analysis đo Grok 4.6 hoàn thành task AA-Briefcase trung bình trong 53 turns và 0.5 tỷ input token. So với Claude Opus 5 Max cần 103 turns và 2 tỷ input token cho cùng loại task.

Điều đó nghĩa là chi phí hoàn thành 1 task agent của Grok 4.6 khoảng $0.84 theo Artificial Analysis, trong khi Opus 5 đắt hơn nhiều. Tuy nhiên, các model như GPT-5.6 Luna, GLM-5.2 và Muse Spark 1.2 còn rẻ hơn Grok 4.6 về cost-per-task.

Grok 4.6 dùng ở đâu ngay hôm nay?

Grok 4.6 đã có sẵn trên:

  • Grok Build: công cụ coding của SpaceXAI, bắt đầu từ gói SuperGrok $30/tháng
  • Cursor: sau khi SpaceX thâu tóm, tích hợp sẵn Grok 4.6
  • OpenRouter, Vercel, Cloudflare: các đối tác phân phối API

Tuần đầu tiên, SpaceXAI cung cấp gấp đôi usage cho Grok 4.6 trên Cursor và Grok Build để thu hút developer.

Đồng thời, SpaceXAI ra mắt Grok Bot: AI agent persistent chạy 24/7 trên máy riêng, có thể đăng nhập vào ứng dụng và website thay bạn. Giá $120/tháng mỗi seat cho team, $200/tháng cho cá nhân. Đây là bước chuyển mình của SpaceXAI từ chatbot sang AI coworker thực thụ.

Brand Grok có rủi ro cho doanh nghiệp không?

Đây là câu hỏi nhiều người né nhưng mình phải nói thẳng. Grok có lịch sử controversy đáng kể: output bài antisemitic năm 2025, chèn nội dung “white genocide” vào câu trả lời không liên quan, khen ngợi Musk thái quá, và nghiêm trọng nhất là UK regulator Ofcom mở điều tra vì Grok tạo ảnh nhạy cảm không đồng thuận.

SpaceXAI (dưới cấu trúc công ty mới sau khi SpaceX thâu tóm xAI) cần chứng minh Grok 4.6 được kiểm soát tốt hơn. Đối với doanh nghiệp có yêu cầu compliance khắt khe (ngân hàng, y tế, chính phủ), đây là yếu tố cần cân nhắc bên cạnh giá và benchmark.

Developer nên chọn Grok 4.6 hay đợi?

Nếu bạn đang build AI agent cần chạy dài hạn với budget hạn hẹp, Grok 4.6 đáng thử. Giá $2/$6 mỗi triệu token là mức rất cạnh tranh cho model đạt top 4 toàn cầu. Khả năng self-verification trên long-running task cũng là điểm cộng thực tế.

Nếu bạn cần terminal-heavy work hoặc SWE thuần túy, GPT-5.6 Sol hoặc Fable 5 vẫn dẫn đầu. Và nếu doanh nghiệp của bạn nhạy cảm về brand safety, hãy đợi thêm dữ liệu thực tế từ production trước khi commit.

Nói chung, cuộc đua AI tháng 8/2026 chứng minh một điều: benchmark cao không đủ, giá rẻ cũng không đủ. Model nào hoàn thành task với ít token nhất, ít turns nhất, và kiểm soát được rủi ro mới là người thắng cuối cùng.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *