Gemini 3.6 Flash Ra Mắt: 17% Ít Token Hơn, Computer Use Tích Hợp Sẵn, Giá Rẻ Nhất Tier Flash

Câu trả lời nhanh
Gemini 3.6 Flash ra mắt 21/7/2026 với giá $1.50/$7.50/M tokens, rẻ hơn 17% so với 3.5 Flash. Điểm nổi bật: tiêu tốn ít token hơn 17% cho cùng task, tốc độ 304 token/giây, 1M context window, Computer Use tích hợp sẵn. Chi phí thực tế cho agentic workflow giảm 30-40%. Google cũng ra mắt Flash-Lite $0.30/M và bắt đầu pre-train Gemini 4.

Ngày 21/7/2026, trong khi cả ngành đang chờ mỏi mắt Gemini 3.5 Pro, Google lặng lẽ thả Gemini 3.6 Flash ra thị trường. Không kèn trumpet, không sự kiện ra mắt hoành tráng. Chỉ một con số khiến mọi developer ngồi dậy: $7.50/M output tokens, rẻ hơn 17% so với bản tiền nhiệm.

Google Gemini 3.6 Flash với hiệu suất token vượt trội

Nhưng giá không phải câu chuyện thật. Sự thật nằm ở token efficiency — model mới tiêu tốn ít token hơn để hoàn thành cùng một task. Và khi giá rẻ hơn kết hợp với ít token hơn, chi phí thực tế cho agentic workflow giảm 30-40%.

Mình đã theo dõi Gemini kể từ đời 1.0, và đây là lần đầu tiên Google tung ra một model “mid-cycle update” mà cộng đồng developer phản ứng tích cực đến vậy. Bài này sẽ phân tích chi tiết tại sao.

Gemini 3.6 Flash có gì mới so với 3.5 Flash?

Google không gọi đây là bản nâng cấp lớn, nhưng thay đổi đủ để đáng ý. Gemini 3.6 Flash mang đến bộ thông số ấn tượng: 1 triệu token context window, tốc độ 304 token/giây, AA Intelligence Index đạt 50 điểm (thinking mode cao), và knowledge cutoff đẩy lên tháng 3/2026.

Điểm mới đáng chú ý nhất là Computer Use tích hợp sẵn — khả năng điều khiển máy tính qua giao diện giống người dùng. Đây là tính năng trước đây chỉ có trên Claude Computer Use và OpenAI Operator. Google đưa thẳng vào Flash tier chứ không giữ cho Pro, cho thấy họ muốn phổ biến agentic capability với giá thành thấp.

Bảng so sánh giá: Gemini 3.6 Flash vs Claude Sonnet 5 vs GPT-5.6 Terra

Đây là phần mà mình nghĩ nhiều developer quan tâm nhất. Cùng nhìn vào bảng so sánh trực tiếp:

  • Gemini 3.6 Flash: $1.50 input / $7.50 output per 1M tokens, 1M context, 304 tok/s
  • Claude Sonnet 5: $2 input / $10 output per 1M tokens, 1M context, ~120 tok/s
  • GPT-5.6 Terra: $2.50 input / $15 output per 1M tokens, 1.05M context, ~100 tok/s

Không khó để thấy Gemini 3.6 Flash rẻ hơn rõ rệt ở cả input lẫn output. Nhưng điều quan trọng hơn là tốc độ: 304 token/giây nhanh gấp 2.5 lần Claude Sonnet 5 và gấp 3 lần GPT-5.6 Terra. Cho workflow cần phản hồi thời gian thực, khoảng cách này rất lớn.

Tất nhiên, AA Index score 50 của Gemini 3.6 Flash thấp hơn chút so với Claude Sonnet 5 (~52) và GPT-5.6 Terra (~54). Nếu task cần reasoning ở mức cao nhất, Pro tier vẫn hơn. Nhưng với đa số use case thực tế, Flash xử lý tốt mà chỉ tốn một phần chi phí.

Tại sao token efficiency quan trọng hơn giá?

Đây là điểm mà mình muốn giải thích rõ. Google cắt giá output 17% — từ $9 xuống $7.50. Nhưng model mới còn tiêu tốn ít token hơn 17% cho cùng một task. Hai con số này cộng dồn.

Hãy tưởng tượng một agentic workflow 10 bước. Mỗi bước tiết kiệm 17% token. Trước khi tính đến giá, tổng token đã giảm xuống còn 83% so với cũ. Sau đó áp dụng giá mới rẻ hơn 17% nữa. Kết quả: chi phí thực tế chỉ còn khoảng 60-70% so với dùng 3.5 Flash.

Logan Kilpatrick của Google cho biết model “spends a lot less tokens to deliver better performance”. Với những team đang chạy high-volume agentic pipeline, chuyển sang 3.6 Flash có thể tiết kiệm hàng nghìn USD mỗi tháng.

Flash-Lite $0.30/M và Flash Cyber là gì?

Cùng ngày, Google tung thêm hai model nữa. Gemini 3.5 Flash-Lite với giá cực rẻ $0.30 input / $2.50 output per 1M tokens — lựa chọn rẻ nhất trong Gemini lineup. Model này nhắm vào routing, classification, document extraction ở quy mô lớn. Benchmark cho thấy nó đánh bại bản Flash-Lite cũ đáng kể: Terminal-Bench 2.1 đạt 54% so với 31% trước đó.

Gemini 3.5 Flash Cyber là model chuyên biệt về bảo mật, chuyên tìm và sửa lỗ hổng phần mềm. Không có API công khai, không có giá niêm yết. Truy cập chỉ qua partnership với Google. Đây là model đầu tiên trong gia đình Gemini chuyên về security, cho thấy Google đang đầu tư nghiêm túc vào niche AI security.

Gemini 3.5 Pro vẫn “bóng chim tăm cá”

Đây có lẽ là câu chuyện hài hước nhất tháng. Gemini 3.5 Pro đã trễ hạn 3 lần: ban đầu targeting đầu tháng 7, rồi dời sang giữa tháng, rồi dời lần nữa. Google xác nhận model vẫn đang “partner testing” và sẽ ship “khi sẵn sàng”.

Trong khi đó, đối thủ liên tục tung model mới: Grok 4.5, GPT-5.6 với 3 variant, Kimi K3 open-weight 2.8 nghìn tỷ parameter. Anthropic Claude Fable 5 ngồi trên đỉnh public leaderboard. Google thì… slip ra một Flash update.

Nhưng tin vui là Google đã bắt đầu pre-training Gemini 4 — gọi là “most ambitious pre-training run yet”. Có thể họ sẽ skip 3.5 Pro và nhảy thẳng sang Gemini 4. Chiến lược đặt cược vào generational leap thay vì iterate trên 3.5 Pro.

Developer cần biết gì khi migrate từ 3.5 Flash sang 3.6 Flash?

Google thay đổi khá nhiều thứ dưới hood. Một số sampling parameter cũ bị deprecated — kiểm tra migration guide trước khi đổi model ID. Prefilled model turns bị từ chối — nếu prompting strategy của bạn dùng prefilled responses, code sẽ break. Và thinking control parameter mới — cấu hình inference cần được review lại.

Lời khuyên của mình: test 3.6 Flash trên workload thực tế ngay, nhưng giữ 3.5 Flash làm fallback cho đến khi canary test pass. Token efficiency gains là thật, nhưng migration risk cần verify trên use case cụ thể của bạn.

Google Gemini 3.6 Flash thay đổi cuộc chơi như thế nào?

Nhìn bức tranh lớn, Gemini 3.6 Flash cho thấy chiến lược mới của Google: không cần model mạnh nhất, chỉ cần model đủ tốt với giá tốt nhất. Khi Claude Fable 5 charge $10-50/M output và GPT-5.6 Terra ở $15/M, Gemini 3.6 Flash ở $7.50/M với tốc độ gấp 3 lần là một lời mời gọi khó từ chối.

Với doanh nghiệp Việt Nam đang xây dựng sản phẩm AI, đây là lúc nghiêm túc đánh giá Gemini làm backbone thay vì mặc định dùng OpenAI hay Anthropic. Chi phí vận hành thấp hơn 30-50% không phải con số nhỏ, đặc biệt khi scale lên hàng triệu request.

Mình sẽ tiếp tục theo dõi Gemini 3.5 Pro (nó ra mắt thật) và Gemini 4. Nhưng còn bây giờ, Gemini 3.6 Flash là model đáng dùng nhất trong tầm giá. Test ngay hôm nay.

Thông số kỹ thuật Gemini 3.6 Flash

  • Model ID: gemini-3.6-flash
  • Giá: $1.50/M input, $7.50/M output
  • Context window: 1,048,576 tokens (1M)
  • Max output: 65,536 tokens
  • Tốc độ: 304 tokens/giây
  • AA Intelligence Index: 50
  • Knowledge cutoff: March 2026
  • Computer Use: tích hợp sẵn
  • Nền tảng: Gemini API, AI Studio, Vertex AI, Android Studio, GitHub Copilot

Theo dõi thêm: Google Search chuyển sang Gemini 3.5 Flash-Lite: Tác động SEO như thế nàoGemini 3.5 Pro ra mắt 17/7

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *