Google vừa thêm một lớp kiểm soát hoàn toàn mới cho Gemini API: Environment Hooks. Developer giờ đây có thể chặn, kiểm tra và phê duyệt từng tool call mà AI agent thực hiện bên trong sandbox. Cùng đợt cập nhật này, Gemini 3.6 Flash trở thành model mặc định cho managed agents, kèm theo giới hạn token và lịch chạy tự động.
Nếu bạn đang xây dựng AI agent trên Gemini API, đây là bản cập nhật quan trọng nhất trong tháng. Mình sẽ phân tích chi tiết từng tính năng, so sánh với các nền tảng khác, và giải thích tại sao điều này quan trọng với bất kỳ ai phát triển AI agent production.
Google Gemini Environment Hooks Là G?
Environment Hooks là một cơ chế cho phép developer chạy code riêng trước và sau mỗi lần AI agent gọi tool bên trong sandbox của Google. Khi agent muốn chạy code, đọc file, ghi file hay tải webpage, hook sẽ kích hoạt trước. Nếu hook trả về “deny”, tool call đó bị hủy ngay lập tức.
Cách hoạt động rất đơn giản: bạn tạo file hooks.json mount vào sandbox, đăng ký handlers cho hai thời điểm: trước khi tool chạy (pre-execution) và sau khi tool chạy (post-execution). Mỗi rule dùng regular expression để match tên tool, nên một entry có thể cover nhiều tool cùng lúc. Khi handler trả về denial, runtime bỏ qua tool call và gửi lý do trở lại context của model, để agent có thể chọn cách khác hoặc giải thích cho user trong cùng turn đó.
Tại Sao Developer Cần Quan Tâm Đến Environment Hooks?
Trước bản cập nhật này, managed agents của Google chạy trong một sandbox Linux từ xa. Bạn gửi task vào, agent tự lập kế hoạch, chạy code, cài package, đọc ghi file, tải webpage cho đến khi hoàn thành. Vấn đề là: bạn không thể kiểm soát những gì agent làm bên trong sandbox đó từ bên trong. Nó giống như giao chìa khóa nhà cho người lạ và hy vọng họ không làm hỏng gì.
Environment Hooks thay đổi điều đó. Giờ đây bạn có thể:
- Chặn tool call trước khi chạy: Kiểm tra xem agent có được phép thực hiện hành động đó không
- Chạy validation sau khi tool chạy: Kiểm tra output trước khi đưa vào context
- Log mọi hoạt động: Gửi event đến endpoint bên ngoài để audit
- Apply business rules: Chặn agent truy cập file nhạy cảm, chạy code nguy hiểm
Một case study thực tế: OffDeal, một ngân hàng đầu tư AI-native, đang dùng post-execution hook để chạy pipeline kiểm tra chất lượng ảnh ngay khi agent viết ra danh sách công ty. Trước hooks, họ không thể làm điều này trên managed agents của Gemini vì sandbox ở xa.
Gemini 3.6 Flash Trở Thành Model Agent Mặc Định
Cùng với hooks, Google đẩy Gemini 3.6 Flash làm model mặc định cho managed agents mà không cần thay đổi code. Model này được phát hành vào ngày 21/7/2026, với những thông số rất ấn tượng so với thế hệ trước:
- Giá: $1.50/M input tokens, $7.50/M output tokens (so với $9.00 output của 3.5 Flash)
- Hiệu suất: 17% ít output token hơn trên Artificial Analysis Index
- Coding: 49% trên DeepSWE benchmark (so với 37% của 3.5 Flash)
Trong context của AI agent, một task có thể chạy hàng trăm bước, tiêu tốn hàng triệu token. Việc giảm 17% output token cộng với giá output rẻ hơn 17% so với thế hệ trước tạo ra khoản tiết kiệm khổng lồ. Google ước tính một task xử lý dữ liệu nặng tốn khoảng $0.70 đến $3.25, trong khi workflow phức tạp có thể tích lũy 3-5 triệu token, tốn khoảng $5 cho một lần tương tác.
Nếu muốn pin model khác, bạn có thể chọn Gemini 3.5 Flash hoặc 3.5 Flash-Lite cho chi phí thấp hơn. Tuy nhiên, với agent lưu persistent, model bị cố định lúc tạo và không thể override per-call, điều mà Google nói giúp tool-calling behavior và security boundary ổn định hơn.
Spend Limits Và Scheduled Triggers: AI Agent Thành Infrastructure
Hai tính năng mới biến managed agents từ per-request call thành standing infrastructure:
Token ceiling: Bạn truyền một giới hạn token cùng request, cap input, output và thinking tokens cho toàn bộ tương tác. Cached tokens được loại trừ. Khi agent chạm giới hạn, run trả về incomplete với sandbox state nguyên vẹn, và một call tiếp theo có thể resume với budget mới. Đây là best-effort chứ không exact, nhưng đủ để tránh bill shock.
Scheduled triggers: Bind agent, prompt, environment và cron expression thành một persistent resource chạy tự động. Mỗi run dùng lại cùng sandbox, nên file từ lần chạy trước vẫn visible. Nó auto-pause sau 5 lần fail liên tiếp, và sandbox compute không bị tính phí trong preview.
Đặc biệt, toàn bộ tính năng này доступ cho cả project không billing attached. Một developer với free API key giờ có thể chạy scheduled, budget-capped agent với policy layer enforceable. So với ChatGPT Plus giá $20/tháng hay Claude Pro, đây là lời mời gọi rất hấp dẫn.
Environment Hooks Vs Cách Tiếp Cận Của Đối Thủ
Google không phải công ty đầu tiên nghĩ đến AI agent governance, nhưng cách tiếp cận của họ khác vớiOpenAI hay Anthropic. Mình so sánh nhanh:
- OpenAI: ChatGPT Code Interpreter chạy sandbox nhưng developer không có hook chặn tool call. Kiểm soát chủ yếu qua system prompt và function-level permissions
- Anthropic: Claude computer use cho phép developer define tool schema, nhưng không có pre/post execution hooks bên trong sandbox
- Google Gemini: Hooks.json chạy bên trong sandbox, intercept trực tiếp tại runtime, trước và sau mỗi tool call
Điểm khác biệt lớn nhất: hooks chạy bên trong sandbox network, không phải client-side. Điều này có nghĩa là check xảy ra ở nơi agent hoạt động, không có latency round-trip. Nhưng nó cũng có một tradeoff: agent có shell hoặc write access có thể chỉnh sửa hooks file trong writable workspace. Google khuyến nghị mount configuration từ read-only repository nếu cần tamper resistance.
Một chi tiết quan trọng về failure mode: nếu hook script crash, timeout, trả về server error hay emit JSON không hợp lệ, tool call vẫn tiếp tục. Lý do từ documentation của Google: một linter hỏng hay telemetry server unreachable không nên deadlock production application. Đây là design choice thiên về permission hơn là restriction.
AI Agent Governance Đang Trở Thành Thị Trường Riêng
Ngay khi Google thêm policy layer vào runtime của mình, startup chuyên về AI agent governance cũng đang hút vốn mạnh. Hush Security vừa huy động $30M Series A với Akamai tham gia strategic investment, nâng tổng vốn lên $41M chưa đầy một năm sau khi ra mắt từ stealth.
Vấn đề mà Hush Security giải quyết rộng hơn hooks của Google: identity management cho AI agent. Khi agent truy cập corporate apps, database, cloud infrastructure, chúng cần identity controls tương tự human users. Startup này thay thế static credentials bằng just-in-time runtime access, có audit trail và kill switch.
Điều này cho thấy AI agent governance không còn là feature phụ mà đang trở thành một category riêng. Google chọn build vào runtime, startup chọn build cross-platform. Cả hai tiếp cận đều có giá trị, và 2026 có thể là năm mà enterprise bắt đầu hỏi: ai đang quản lý agent của chúng ta?
Developer Nên Bắt Đầu Từ Đâu?
Nếu bạn đang dùng Gemini API cho agent, đây là checklist mình tổng hợp:
- Kiểm tra model default: Managed agent giờ chạy Gemini 3.6 Flash. Nếu cần stability, pin model trong agent config
- Tạo hooks.json: Bắt đầu với pre-execution hook đơn giản, log mọi tool call ra console
- Mount read-only: Nếu agent có shell access, mount hooks config từ repo read-only
- Set token ceiling: Đặt budget cho mỗi run, test xem threshold nào phù hợp cho use case
- Configure allowlist: Post-execution hook gửi data ra external endpoint cần config allowlist trong environment
- Test scheduled trigger: Chạy agent trên cron, kiểm tra sandbox persistence giữa các run
Bản cập nhật này cho thấy Google đang chạy nhanh trong cuộc đua AI agent platform. Với hooks, spend limits, scheduled triggers, và Gemini 3.6 Flash với giá cạnh tranh, managed agents của Gemini API đang trở thành một lựa chọn nghiêm túc cho developer xây dựng AI agent production. Câu hỏi còn lại là: liệu kiểm soát cấp runtime có đủ để enterprise tin tưởng giao việc cho AI agent hay không?
