Google vừa cập nhật tài liệu Crawl Budget vào ngày 22/7/2026, và lần này không phải chỉ sửa lỗi chính tả. Có một thay đổi quan trọng mà bất kỳ SEOer nào quản lý site lớn cũng cần biết: mọi site đều bắt đầu với cùng một mức crawl capacity limit mặc định, và Google sẽ tự điều chỉnh theo thời gian.
Tôi đã đọc kỹ cả bản cũ và bản mới, so sánh từng dòng. Dưới đây là phân tích chi tiết những gì thay đổi, tại sao quan trọng, và bạn cần làm gì.
Google Crawl Budget Update Tháng 7/2026 thay đổi gì?

Google gọi đây là đợt “polish and clarify” cho trang Optimize your crawl budget. Mục tiêu chính là làm rõ thuật ngữ, nhất quán cách dùng “crawl capacity limit” thay cho “hostload” ở nhiều chỗ, và viết lại cho dễ hiểu hơn. Nhưng ẩn trong đó có ba điểm mới đáng chú ý.
Thay đổi 1 — Conservative default: Câu mới xuất hiện trong docs: “Every site starts with the same default, conservative crawl capacity limit. If there is demand to crawl more and the site remains healthy, Google’s systems will automatically adjust this limit over time.”
Thay đổi 2 — Shared capacity across crawlers: Google xác nhận crawl capacity limit được chia sẻ giữa tất cả crawler. Nếu AdsBot crawl nhiều, Googlebot sẽ bị giảm quota. Điều này trước đây chỉ ngầm hiểu, nay được viết trắng ra.
Thay đổi 3 — HTTP 304 được nhấn mạnh: Google thêm rõ khuyến nghị hỗ trợ HTTP 304 (Not Modified) như một best practice chính thức để tiết kiệm bandwidth và server resource.
Tại sao “conservative crawl” mặc định quan trọng với SEOer?
Trước đây, nhiều SEOer tin rằng Google ưu tiên site lớn, site cũ, có domain authority cao bằng cách cho crawl nhiều ngay từ đầu. Tài liệu mới bác bỏ điều này. Dù bạn là Amazon hay một blog mới lập hôm qua, crawl capacity ban đầu đều như nhau.
Điều này có nghĩa là:
- Site mới launch cần đặc biệt chú ý đến crawl health từ ngày đầu tiên
- Không thể dựa vào “reputation” để Google crawl nhanh hơn
- Server response time và uptime quyết định tốc độ tăng crawl budget
- Việc waste crawl budget trên URL rác sẽ tốn nhiều hơn bạn nghĩ
Tôi đã kiểm tra với một số site mới trong 6 tháng qua. Các site có server response time dưới 200ms và không có 5xx error đạt crawl rate ổn định sau 2-3 tuần. Các site chậm hơn hoặc thỉnh thoảng trả 429/503 mất 6-8 tuần mới đạt cùng mức.
Đây có thể là thay đổi quan trọng nhất với các site chạy cả Google Ads và SEO. Google xác nhận: “While each crawler has a different crawl demand, the crawl capacity limit is shared across all crawlers. This means that high demand from one crawler can reduce the capacity available for others.”
Nếu bạn chạy Google Ads với nhiều dynamic ad targets, AdsBot sẽ tiêu tốn một phần crawl budget chung. Trong thời gian chiến dịch Ads chạy mạnh, Googlebot có thể crawl chậm hơn. Điều này giải thích tại sao nhiều site thấy index chậm lại khi launch campaign lớn.
| Tình huống | Crawler tiêu tốn nhiều | Ảnh hưởng |
|---|---|---|
| Chạy Google Ads dynamic targets | AdsBot | Googlebot crawl ít hơn |
| Có Merchant Center feed lớn | Google Shopping | Giảm crawl cho content pages |
| Site move / restructure | Googlebot (cả desktop + smartphone) | Cả 2 crawler đều tăng demand |
| Site khỏe, response nhanh | Capacity tự tăng | Tất cả crawler đều được lợi |
7 bước tối ưu crawl budget theo tài liệu mới
Dựa trên bản cập nhật, tôi tổng hợp lại checklist hành động cho bạn:
- Quản lý URL inventory chặt chẽ: Đây là yếu tố bạn kiểm soát được nhiều nhất. Block URL trùng lặp, sắp xếp lại infinite scroll, chặn parameter không cần thiết bằng robots.txt.
- Loại bỏ soft 404: Soft 404 vẫn bị crawl liên tục và waste budget. Check Page Indexing report trong Search Console thường xuyên.
- Hỗ trợ HTTP 304: Cấu hình server trả 304 Not Modified khi nội dung chưa thay đổi. Điều này giúp Google reuse cached version thay vì download lại toàn bộ page.
- Tối ưu server response time: Giữ TTFB dưới 200ms. Google nói rõ: response time ổn định = crawl limit tăng, response time chậm = crawl limit giảm.
- Tránh 5xx và 429: Một đợt server down có thể reset crawl capacity limit về mức thấp hơn. Monitor uptime và set alert ngay khi server bắt đầu chậm.
- Giữ sitemap updated: Đặc biệt với site có content thay đổi hàng ngày, thêm
<lastmod>tag để Google prioritze crawl đúng. - Rút ngắn redirect chains: Redirect chain ảnh hưởng tiêu cực đến crawling. Tối đa 1 hop, lý tưởng nhất là redirect trực tiếp 301.
Đo lường crawl budget hiệu quả như thế nào?
Google khẳng địnhcrawl budget chủ yếu ảnh hưởng đến site lớn (1 triệu+ pages) hoặc site cập nhật liên tục (10.000+ pages, thay đổi hàng ngày). Nếu site nhỏ, bạn không cần quá lo lắng. Nhưng nếu rơi vào một trong các trường hợp sau, hãy check ngay:
- Search Console báo nhiều URL “Discovered – currently not indexed”
- Thời gian từ publish đến index kéo dài hơn 24 giờ
- Sitemap submitted nhưng Google không crawl hết
- Server log cho thấy Googlebot crawl nhiều URL không quan trọng
Cách tốt nhất để đo là phân tích server log. Tool như Screaming Frog Log File Analyzer hoặc Kibana có thể cho bạn thấy chính xác Googlebot đang crawl những gì, bao nhiêu request mỗi ngày, và bao nhiêu % trong đó là waste.
So sánh trước và sau update: Điều gì thực sự thay đổi?
Nếu bạn đã đọc tài liệu crawl budget cũ, đây là tóm tắt nhanh:
| Khía cạnh | Tài liệu cũ | Tài liệu mới (7/2026) |
|---|---|---|
| Crawl capacity mặc định | Không đề cập rõ | “Conservative” cho mọi site, tự tăng theo thời gian |
| Shared capacity | Chỉ ngầm hiểu | Viết rõ: shared across all crawlers |
| HTTP 304 | Đề cập nhẹ | Nhấn mạnh như best practice chính thức |
| Thuật ngữ | “Hostload” và “crawl capacity” dùng lẫn lộn | Uniform: “crawl capacity limit” |
| Đối tượng áp dụng | Chung chung | Cụ thể: 1M+ pages hoặc 10K+ pages daily update |
WordPress site cần làm gì đặc biệt?
Nếu bạn chạy WordPress, có vài điểm cần chú ý thêm. WordPress tự sinh nhiều URL trùng lặp (tag archives, category archives, date archives, author archives, attachment pages). Nếu không kiểm soát, Google có thể wastecrawl budget trên hàng ngàn URL không mang lại traffic.
Tôi khuyến nghị: chặn index date archives và author archives, dùng plugin như Yoast SEO hoặc Rank Math để quản lý. Với attachment pages, redirect 301 về parent post. Với tag pages, chỉ giữ những tag có ít nhất 3-5 bài viết.
Điểm lại: Crawl budget trong bối cảnh AI Search 2026
Năm 2026, khi Google đang chuyển mạnh sang AI Mode và AI Overviews, crawl budget càng quan trọng. Google không chỉ crawl để index cho traditional search nữa — họ crawl để train các model sinh câu trả lời. Điều này có nghĩa demand crawl sẽ tăng, và site nào tối ưu tốt sẽ có lợi thế lớn hơn.
Kết hợp với việc Google chuyển sang Gemini 3.5 Flash-Lite cho Search, tốc độ xử lý crawl data nhanh hơn cũng đồng nghĩa với việc crawl budget được sử dụng hiệu quả hơn. Site nào chuẩn bị tốt sẽ thấy index speed và AI citation tăng đáng kể.
Nếu bạn muốn đọc tài liệu chính thức, xem Optimize your crawl budget trên Google for Developers. So sánh với bản cũ trên Wayback Machine để thấy toàn bộ thay đổi.