Tuần này tôi đọc được một hiện tượng đáng để mọi người làm SEO và GEO dừng lại vài phút: tỷ lệ crawl-to-refer của Anthropic đã được truyền thông đăng dưới bảy con số khác nhau — 70.900:1, 38.000:1, 23.951:1, 11.122:1, 10.300:1, 4.580:1 và 2.237:1. Tất cả đều trích dẫn Cloudflare. Tất cả đều ra đời trong khoảng 13 tháng. Hai số công bố cùng một tháng lệch nhau tới 17 lần.
Không ai nói dối. Cloudflare công bố metric rõ ràng, tài liệu hóa phương pháp đầy đủ và tự tiết lộ giới hạn của chính nó. Vậy mà số liệu vẫn tan rã trên đường lan truyền. Bài viết này tôi bóc tách vì sao, và điều đó nghĩa gì với quyết định chặn hay cho phép AI crawler trên site của bạn.
Tỷ lệ crawl-to-refer là gì và vì sao nó quan trọng?

Đây là tỷ số giữa số trang một nền tảng AI lấy từ site của bạn và số khách nó gửi trả lại. Crawler lấy 5 trang, trả 1 lượt truy cập thì tỷ lệ là 5:1. Lấy 70.000 trang trả 1 lượt thì là 70.000:1. Nó tồn tại vì hợp đồng cũ của web đã vỡ: công cụ tìm kiếm lấy nội dung và trả traffic, còn AI trả lời ngay tại chỗ, việc lấy tiếp diễn nhưng việc trả lại gần như dừng. Đây là con số thẳng thắn nhất mô tả sự mất cân đối đó.
Vì sao một metric tốt lại ra bảy con số khác nhau?
Vì một tỷ lệ là tử số chia mẫu số, và tỷ lệ này có tới bốn quyết định ẩn trong mẫu số mà gần không ai giữ lại khi trích dẫn: khoảng thời gian đo, crawler nào được gộp, site nào nằm trong mẫu, và quan trọng nhất — referral nào tự xưng danh. Bỏ một trong bốn, con số vẫn trông sử dụng được nhưng đã không còn đo cùng một thứ. Đó là lý do bảy phân tích cùng thiện chí cho bảy kết quả.
Bốn biến số nào làm lệch con số crawl-to-refer?
Tôi tách thành bảng để bạn thấy mức độ ảnh hưởng của từng biến:
| Biến số | Vấn đề | Mức lệch quan sát được |
|---|---|---|
| Cửa sổ thời gian | Tuần, tháng, quý, rolling 28 ngày trộn lẫn | Google dao động 19,4% chỉ trong một tuần |
| Crawler nào được đếm | Training crawler và user-request crawler gộp chung một tên nền tảng | Hai hành vi trái ngược, không đại diện cái nào |
| Mẫu site | Cloudflare chỉ thấy traffic qua mạng Cloudflare | Một nền tảng có tỷ lệ gấp đôi khi đổi panel đo |
| Referer header | Referral từ native app không gửi header | Cloudflare thừa nhận “không rõ lệch bao nhiêu” |
Chi tiết đáng chú ý nhất: tháng 6/2025, cùng Cloudflare, Anthropic ra 70.900:1 trong một bài và 73.000:1 trong bài khác. Cùng tháng Google dao động 19,4% tuần qua tuần chỉ vì một quyết định lịch crawl. Còn Mistral cùng tuần đó đạt 0,1:1 — trả 10 lượt truy cập cho mỗi trang lấy. Khoảng cách giữa các nền tảng không phải sai số làm tròn, đó là khác biệt quyết định sản phẩm tại từng thời điểm.
Vì sao referral từ native app là vấn đề lớn nhất?
Vì mẫu số không phải là referral, mà là referral tự xưng danh. Một lượt truy cập chỉ được tính khi request mang Referer header của nền tảng. Cloudflare nói thẳng: traffic từ native app của Claude không có header này, họ tin các nhà cung cấp khác cũng vậy, và vì thế tỷ lệ có thể bị phóng đại phần không ai định lượng được. Người dùng AI ngày càng dùng native app — đúng chỗ không đếm. Đây không phải footnote, đây là thanh sai số không ai đo được, do chính bên công bố metric thú nhận.
SEOer Việt Nam nên dùng con số này thế nào?
Theo tôi, dùng để định hướng, không dùng để ra quyết định chặn hay mở. Nếu bạn đang cân nhắc chặn AI crawler chỉ vì đọc somewhere rằng Anthropic lấy 70.000 trang mới trả 1 khách, hãy hỏi lại ba câu: số này đo trong khoảng thời gian nào, gộp crawler nào, và thu thập ở đâu. Nếu người đưa số không trả lời được ngay, họ cũng không biết con số đó nghĩa là gì — và cả hai bạn sắp quyết định dựa trên một hình dạng giống con số.
Bài trước tôi từng phân tích việc ChatGPT-User bỏ qua Disallow trong dữ liệu TollBit — cùng một luận điểm: dữ liệu tổng hợp của bên thứ ba chỉ đáng tin khi bạn biết ranh giới thu thập của nó.
Nên đo traffic AI bằng cách nào cho đúng?
Đo trên log server của chính bạn, không qua trung gian. Ba nguyên tắc tôi áp dụng: một là tách riêng từng user agent thay vì gộp theo nền tảng; hai là ghi rõ cửa sổ thời gian và không bao giờ cộng dồn các kỳ; ba là đo cả traffic không có Referer bằng UTM hoặc landing page chuyên dụng, vì native app không xưng danh. Tôi đã viết chi tiết cách theo dõi và đo lường kênh AI search trong bài về Similarweb AI Ads Tracking mà bạn nên đọc kèm.
Bài học lớn hơn nằm ở đâu?
Bài học vượt ra ngoài crawler. Một con số tách khỏi cửa sổ thời gian, cách gộp nhóm và ranh giới thu thập không còn là con số — nó chỉ còn hình dạng giống con số. Loại tệ hơn con số sai rõ ràng, vì con số sai sẽ bị phản biện ngay trong cuộc họp, còn con số “đúng nhưng không xác định” sẽ đi thẳng vào slide trình bày квартý và trở thành chính sách. Trong thời điểm các vendor đang ùa ra bán công cụ đo AI visibility, tiêu chí chọn hàng đơn giản: bên xứng đáng tiền của bạn tự nói rõ ba thứ kia mà không cần bạn hỏi.
Cloudflare công khai đủ cả ba và hệ sinh thái vẫn làm mất chúng khi truyền tin. Một vendor không bao giờ công bố thì thậm chí không cho bạn thứ gì để mất. Đó là ranh giới tôi sẽ dùng khi đánh giá mọi dashboard AI visibility từ nay.
