Ngày 14/8/2026, Financial Times đăng phân tích mà cả ngành AI đọc xong phải ngồi dậy: OpenAI và Anthropic đang rơi vào một cuộc chiến giá API đúng nghĩa, và họ không tự nguyện chút nào — các model Trung Quốc ép họ vào thế bị động. PYMNTS đưa số liệu cụ thể hơn: trung bình các phòng lab Mỹ đã cắt 25% giá API chỉ trong vòng một tháng.

Mình theo dõi bảng giá API như người ta theo dõi tỉ giá. Đây là đợt giảm đáng chú ý nhất từ hồi cú sốc DeepSeek đầu 2025. Khác biệt lớn: lần trước chỉ một bên rẻ, còn bây giờ cả thị trường đang bị kéo xuống một mặt giá hoàn toàn mới.
Cuộc chiến giá API AI tháng 8/2026 diễn ra như thế nào?
Ngắn gọn: các lab Mỹ đang giảm giá hàng loạt, còn các lab Trung Quốc thì không còn rẻ như hình dung cũ. Google ra mắt Gemini 3.7 Flash với giá 0,75 USD mỗi triệu token input và 3,75 USD mỗi triệu token output — rẻ hơn 50% so với bản 3.6 Flash lúc ra mắt. Ngược lại, DeepSeek bất ngờ tăng giá API bản V4 Pro, riêng chi phí cache hit tăng gấp sáu lần mức cũ.
Con số 25% trong một tháng của PYMNTS là tốc độ hiếm thấy ở một ngành mà chi phí huấn luyện vẫn đang leo thang. Trường hợp Gemini 3.7 Flash là ví dụ rõ nhất: Google chủ động đặt price-to-performance làm tiêu chí ra mắt, như mình đã bóc tách trong bài Gemini 3.7 Flash ra mắt: giá giảm nửa.
Vì sao OpenAI và Anthropic buộc phải cắt giá?
Vì thị phần đang dịch chuyển từng tuần. DeepSeek V4 Flash đạt chất lượng tương đương GPT-5.6 Luna nhưng rẻ hơn khoảng 60% — mức chênh mà không đội ngũ kỹ thuật nào đủ lý do để bảo vệ trong báo cáo chi phí. Alibaba vừa mở khoá Qwen3.8 dưới giấy phép Apache 2.0. Z.ai cũng ra mắt model coding mới đối đầu trực diện Claude và GPT, theo Bloomberg ngày 14/8.
Một lực đẩy nữa: IPO. Theo Bloomberg, doanh số annualized của OpenAI vừa vượt 40 tỷ USD; nhà đầu tư Anthropic đang nhắm định giá 2.000 tỷ USD cho đợt IPO được đồn đoán vào tháng 10. Cả hai đều cần volume tăng tốc trước khi ra mắt cổ phiếu — mà muốn tăng volume thì không còn đường nào ngoài giảm giá đầu vào cho developer. Bối cảnh tài chính này mình đã phân tích chi tiết trong bài OpenAI IPO S-1 và bài Anthropic lãi lần đầu Q2/2026.
Sau đợt này, model Mỹ hay model Trung Quốc rẻ hơn?
Câu trả lời hơi bất ngờ: model Mỹ đang giành lại lợi thế về giá. Benzinga ngày 14/8 nhận định rằng sau đợt cắt giá, một số model của OpenAI và Anthropic thực tế đã rẻ hơn cả model Trung Quốc — điều khó tưởng tượng năm ngoái. Lý do rất đơn giản: bên Mỹ đang giảm mạnh thì bên Trung Quốc lại đang tăng.
| Model | Giá tham khảo | Điểm đáng chú ý |
|---|---|---|
| Gemini 3.7 Flash | 0,75 / 3,75 USD mỗi triệu token | Rẻ hơn 50% so bản tiền nhiệm lúc ra mắt |
| DeepSeek V4 Flash | Rẻ hơn khoảng 60% so GPT-5.6 Luna | Chất lượng tương đương, có bản open-weight |
| Ling 3.0 Flash | Rẻ nhất mỗi token trong phân khúc | Ant Group phát hành, giấy phép MIT |
| GPT-5.6 Luna | Mốc tham chiếu của OpenAI | Bị V4 Flash so kè cả chất lượng lẫn giá |
| DeepSeek V4 Pro | Tăng giá, cache hit gấp 6 lần cũ | Vừa rời giai đoạn beta |
Bảng trên cho thấy trò chơi đã đổi chiều: bên nào cũng đang chạy đua trên đường cong giá, chỉ khác hướng. DeepSeek tăng giá vì đã đủ tầm để định giá theo giá trị, còn OpenAI và Anthropic giảm giá để giữ chân khách hàng đang chần chừ trước các lựa chọn thay thế.
Dev và người làm MMO được lợi gì từ giá API giảm?
Margin, thẳng thắn luôn. Phần lớn sản phẩm AI hiện nay có chi phí API chiếm 30-60% giá vốn. Giá API giảm 25% đồng nghĩa biên lợi nhuận tăng tương ứng mà không cần sửa gì trong sản phẩm. Với agent workflow — kiểu gọi model lặp lại hàng trăm lần cho một tác vụ — hiệu ứng cộng dồn còn lớn hơn, tương tự case giảm 67% chi phí AI agent mình từng chia sẻ.
Nhóm hưởng lợi nhất là dev indie và team nhỏ. Hai năm trước, dựng một sản phẩm AI ổn định cần kha khá vốn API. Giờ rào cản đó thấp hẳn: model cấp trung chỉ vài chục cent mỗi triệu token, đủ sức gánh 80% tác vụ thường ngày của đa số sản phẩm.
Mình chọn model nào để tối ưu chi phí ngay bây giờ?
Nguyên tắc mình rút ra sau khi test liên tục mấy tháng qua: đừng trung thành với một model, hãy phân tầng theo độ khó tác vụ. Việc bulk như phân loại, trích xuất, tóm tắt đơn giản — dùng model rẻ. Việc khó như coding phức tạp hay phân tích nhiều bước — mới gọi model xịn. Tách đúng hai tầng này, hóa đơn API giảm một nửa là chuyện bình thường.
- Đưa routing qua một AI Gateway để tự chuyển việc dễ sang model rẻ nhất hiện có.
- Bật prompt caching cho mọi tác vụ lặp — cache hit đang được bán rẻ hơn token thường nhiều lần.
- Đo chi phí theo từng loại tác vụ thay vì theo tháng, để biết việc nào đang âm thầm đốt tiền.
- Soát lại bảng giá mỗi tháng: mặt bằng đang đổi liên tục, chọn sai thời điểm là lỗ ngay.
Giá API AI còn giảm tiếp không?
Theo mình là có, và còn nhanh hơn trong hai quý tới. Lý do: cả OpenAI lẫn Anthropic đều IPO trong năm, lúc nào cũng cần số liệu tăng trưởng usage đẹp. Trong khi đó, các model open-weight cứ hai ba tháng lại nhảy một bậc chất lượng và gần như miễn phí cho ai tự host. Bị cạnh tranh hai chiều như vậy, giá chỉ còn một hướng để đi.
Nhưng rẻ hơn không đồng nghĩa nên xài phóng tay. Mình vẫn giữ thói quen cũ: đo trước, đổi sau. Cứ thử rồi biết — nhưng thử có số liệu, đừng thử theo cảm hứng. Đây là thời điểm tốt nhất từ trước tới nay để bắt đầu một sản phẩm AI nhỏ, và mình tin cửa sổ này còn mở khá lâu cho ai biết nắm lấy.
Nguồn: Financial Times, PYMNTS, Benzinga, Bloomberg, the-decoder (8/2026).
