Prompt Caching Là Gì?

\n\n
Prompt Caching là tính năng cho phép lưu trữ tạm thời phần prompt cố định (system prompt, tài liệu tham khảo, ví dụ) để khi gọi API lần sau, mô hình AI không cần xử lý lại từ đầu. Kết quả là giảm 50-90% chi phí token và giảm thời gian phản hồi đáng kể.
\n\n
Nói đơn giản hơn: thay vì mỗi lần hỏi đều gửi nguyên bộ ngữ cảnh và tính tiền đầy đủ, Prompt Caching giúp mình “nhớ” phần cố định và chỉ tính phí phần mới.
\n\n
Cách Prompt Caching Hoạt Động?
\n\n
Khi mình gửi request lên API, prompt thường gồm hai phần: phần cố định (system prompt dài, tài liệu RAG, few-shot examples) và phần thay đổi (câu hỏi mới của user). Bình thường, mô hình phải xử lý toàn bộ prompt mỗi lần, tính tiền cho tất cả token input.
\n\n
Với Prompt Caching, provider sẽ lưu kết quả xử lý của phần cố định vào bộ nhớ tạm. Lần gọi sau, nếu phần đầu prompt giống hệt, họ tái sử dụng kết quả đã cache. Phần được cache tính phí thấp hơn nhiều, thường chỉ 10-50% giá gốc.
\n\n
Một số provider đi xa hơn: Anthropic Cache giảm 90% giá input token cho phần cached, OpenAI giảm 50%, Google Gemini giảm 75%. Mỗi provider có TTL (thời gian sống cache) khác nhau, từ 5 phút đến 24 giờ.
\n\n
Ví Dụ Thực Tế
\n\n
Mình đang xây chatbot hỗ trợ khách hàng cho shop online. System prompt gồm: vai trò agent (500 token), catalog sản phẩm (3.000 token), chính sách đổi trả (800 token). Tổng phần cố định: 4.300 token.
\n\n
Mỗi khách hỏi một câu (~100 token), mình vẫn phải gửi đủ 4.400 token lên API. Trong ngày có 1.000 cuộc trò chuyện, mỗi cuộc 5-10 lượt chat. Tổng token input chỉ phần cố định đã là 21-43 triệu token/ngày.
\n\n
Khi bật Prompt Caching, 4.300 token cố định chỉ tính giá 10-50% tùy provider. Với Anthropic (giảm 90%), chi phí phần cố định giảm từ ~86 USD xuống ~8,6 USD/ngày. Tiết kiệm gần 80 USD mỗi ngày cho một chatbot duy nhất.
\n\n
Tại Sao Prompt Caching Quan Trọng?
\n\n
Giảm chi phí đáng kể. Với ứng dụng RAG hoặc chatbot có system prompt dài, phần cố định chiếm 80-95% tổng token input. Caching phần này cắt giảm chi phí API xuống mức khả thi cho các sản phẩm quy mô lớn.
\n\n
Giảm độ trễ. Mô hình không cần xử lý lại phần cached, thời gian “time to first token” giảm 40-60%. Người dùng cảm nhận phản hồi nhanh hơn rõ rệt, đặc biệt quan trọng với chatbot thời gian thực.
\n\n
Mở rộng khả thi. Nhiều ý tưởng AI product không khả thi vì chi phí quá cao. Prompt Caching biến mô hình kinh doanh bền vững: từ “mỗi user tốn 2 USD/chat” xuống “0,2 USD/chat”.
\n\n
Cách Sử Dụng Prompt Caching
\n\n
Anthropic Claude hỗ trợ explicit caching qua tham số cache_control. Mình chủ động đánh dấu phần nào cần cache trong system prompt và tool definitions. Cache tồn tại 5 phút (free) hoặc 1 giờ (beta, phí lưu trữ nhỏ).
\n\n
OpenAI áp dụng automatic caching cho prompt dài từ tháng 10/2024. Không cần làm gì, hệ thống tự nhận diện prefix trùng lặp và cache. Giảm 50% giá cho cached token, TTL 5-10 phút.
\n\n
Google Gemini cung cấphai loại chế độ: implicit caching (tự động) và explicit context caching (chủ động qua API riêng). Giảm 75% cho cached token, TTL có thể lên 24 giờ.
\n\n
Quy tắc vàng: sắp xếp prompt sao cho phần cố định ở đầu, phần thay đổi ở cuối. Nếu thay đổi một ký tự ở giữa system prompt, toàn bộ cache bị invalidate.
\n\n
Những Lưu Ý Khi Dùng
\n\n
Thứ tự prompt rất quan trọng. Cache hoạt động theo prefix matching. Phần đầu prompt phải giống hệt 100% giữa các lần gọi. Đặt system prompt, tài liệu, ví dụ lên trước. Đặt câu hỏi user ở cuối.
\n\n
Cache có thời hạn. Sau TTL (5 phút đến 24 giờ), cache hết hạn và phải xử lý lại. Nếu traffic thấp, cache hết hạn trước khi dùng lại, không tiết kiệm được gì. Phù hợp nhất cho ứng dụng có traffic liên tục.
\n\n
Không phải provider nào cũng hỗ trợ. Các model open source tự host cần tự triển khai caching (Semantic Cache qua Redis, GPTCache). Provider managed API thì đã built-in.
\n\n
Phân biệt với Context Caching ở tầng application. Prompt Caching là tối ưu ở tầng API provider. Application-level cache (lưu cả response) là chiến lược khác bổ sung chứ không thay thế.
\n\n
Khi Nào Nên Dùng Prompt Caching?
\n\n
Phù hợp khi: system prompt dài trên 1.000 token, có traffic liên tục (cache không bị expire giữa các request), nội dung cố định lặp lại nhiều lần. Các trường hợp điển hình: chatbot RAG, agent có tool definitions dài, ứng dụng few-shot learning, code review bot gửi cùng bộ coding guidelines.
\n\n
Ít hiệu quả khi: prompt ngắn dưới 500 token, traffic thưa thớt (cache hết hạn trước khi dùng lại), mỗi request có nội dung hoàn toàn khác nhau.
\n\n
Kết Luận
\n\n
Prompt Caching là tối ưu hóa đơn giản nhưng tác động lớn. Nếu đang xây ứng dụng AI có system prompt dài hoặc RAG, bật caching là bước đầu tiên nên làm. Tiết kiệm 50-90% chi phí, giảm thời gian phản hồi, và biến nhiều ý tưởng product từ “đắt quá” thành “khả thi”. Chỉ cần lưu ý sắp xếp prompt đúng cách và duy trì traffic đủ dày để cache không bị expire.
Thuật ngữ liên quan
- Agentic AI Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- Agentic Workflow (Luồng Công Việc AI Tự Chủ) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- AGI (Artificial General Intelligence) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- AI (Artificial Intelligence) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- AI Agent Framework Là Gì? Framework Xây Dựng AI Agent Phổ Biến Nhất 2026
Xem toàn bộ thư viện thuật ngữ AI & SEO A-Z.

