Tỷ Lệ Crawl-To-Refer Của Anthropic Có 7 Con Số: Khi Số Liệu Cloudflare Rời Khỏi Bài Viết Của Nó

Câu trả lời nhanh
Tỷ lệ crawl-to-refer của Anthropic từng được báo chí đăng thành 7 con số khác nhau, từ 2.237:1 đến 70.900:1, tất cả trích Cloudflare. Nguyên nhân không phải sai số: bốn biến ẩn trong mẫu số gồm cửa sổ thời gian, cách gộp crawler, panel đo và referral không mang Referer header từ native app. SEOer nên dùng con số này để định hướng, không dùng để quyết định chặn AI crawler.

Tuần này tôi đọc được một hiện tượng đáng để mọi người làm SEO và GEO dừng lại vài phút: tỷ lệ crawl-to-refer của Anthropic đã được truyền thông đăng dưới bảy con số khác nhau — 70.900:1, 38.000:1, 23.951:1, 11.122:1, 10.300:1, 4.580:1 và 2.237:1. Tất cả đều trích dẫn Cloudflare. Tất cả đều ra đời trong khoảng 13 tháng. Hai số công bố cùng một tháng lệch nhau tới 17 lần.

Không ai nói dối. Cloudflare công bố metric rõ ràng, tài liệu hóa phương pháp đầy đủ và tự tiết lộ giới hạn của chính nó. Vậy mà số liệu vẫn tan rã trên đường lan truyền. Bài viết này tôi bóc tách vì sao, và điều đó nghĩa gì với quyết định chặn hay cho phép AI crawler trên site của bạn.

Tỷ lệ crawl-to-refer là gì và vì sao nó quan trọng?

Tỷ lệ crawl-to-refer của Anthropic với nhiều con số khác nhau
Tỷ lệ crawl-to-refer của Anthropic với nhiều con số khác nhau

Đây là tỷ số giữa số trang một nền tảng AI lấy từ site của bạn và số khách nó gửi trả lại. Crawler lấy 5 trang, trả 1 lượt truy cập thì tỷ lệ là 5:1. Lấy 70.000 trang trả 1 lượt thì là 70.000:1. Nó tồn tại vì hợp đồng cũ của web đã vỡ: công cụ tìm kiếm lấy nội dung và trả traffic, còn AI trả lời ngay tại chỗ, việc lấy tiếp diễn nhưng việc trả lại gần như dừng. Đây là con số thẳng thắn nhất mô tả sự mất cân đối đó.

Vì sao một metric tốt lại ra bảy con số khác nhau?

Vì một tỷ lệ là tử số chia mẫu số, và tỷ lệ này có tới bốn quyết định ẩn trong mẫu số mà gần không ai giữ lại khi trích dẫn: khoảng thời gian đo, crawler nào được gộp, site nào nằm trong mẫu, và quan trọng nhất — referral nào tự xưng danh. Bỏ một trong bốn, con số vẫn trông sử dụng được nhưng đã không còn đo cùng một thứ. Đó là lý do bảy phân tích cùng thiện chí cho bảy kết quả.

Bốn biến số nào làm lệch con số crawl-to-refer?

Tôi tách thành bảng để bạn thấy mức độ ảnh hưởng của từng biến:

Biến sốVấn đềMức lệch quan sát được
Cửa sổ thời gianTuần, tháng, quý, rolling 28 ngày trộn lẫnGoogle dao động 19,4% chỉ trong một tuần
Crawler nào được đếmTraining crawler và user-request crawler gộp chung một tên nền tảngHai hành vi trái ngược, không đại diện cái nào
Mẫu siteCloudflare chỉ thấy traffic qua mạng CloudflareMột nền tảng có tỷ lệ gấp đôi khi đổi panel đo
Referer headerReferral từ native app không gửi headerCloudflare thừa nhận “không rõ lệch bao nhiêu”

Chi tiết đáng chú ý nhất: tháng 6/2025, cùng Cloudflare, Anthropic ra 70.900:1 trong một bài và 73.000:1 trong bài khác. Cùng tháng Google dao động 19,4% tuần qua tuần chỉ vì một quyết định lịch crawl. Còn Mistral cùng tuần đó đạt 0,1:1 — trả 10 lượt truy cập cho mỗi trang lấy. Khoảng cách giữa các nền tảng không phải sai số làm tròn, đó là khác biệt quyết định sản phẩm tại từng thời điểm.

Vì sao referral từ native app là vấn đề lớn nhất?

Vì mẫu số không phải là referral, mà là referral tự xưng danh. Một lượt truy cập chỉ được tính khi request mang Referer header của nền tảng. Cloudflare nói thẳng: traffic từ native app của Claude không có header này, họ tin các nhà cung cấp khác cũng vậy, và vì thế tỷ lệ có thể bị phóng đại phần không ai định lượng được. Người dùng AI ngày càng dùng native app — đúng chỗ không đếm. Đây không phải footnote, đây là thanh sai số không ai đo được, do chính bên công bố metric thú nhận.

SEOer Việt Nam nên dùng con số này thế nào?

Theo tôi, dùng để định hướng, không dùng để ra quyết định chặn hay mở. Nếu bạn đang cân nhắc chặn AI crawler chỉ vì đọc somewhere rằng Anthropic lấy 70.000 trang mới trả 1 khách, hãy hỏi lại ba câu: số này đo trong khoảng thời gian nào, gộp crawler nào, và thu thập ở đâu. Nếu người đưa số không trả lời được ngay, họ cũng không biết con số đó nghĩa là gì — và cả hai bạn sắp quyết định dựa trên một hình dạng giống con số.

Bài trước tôi từng phân tích việc ChatGPT-User bỏ qua Disallow trong dữ liệu TollBit — cùng một luận điểm: dữ liệu tổng hợp của bên thứ ba chỉ đáng tin khi bạn biết ranh giới thu thập của nó.

Nên đo traffic AI bằng cách nào cho đúng?

Đo trên log server của chính bạn, không qua trung gian. Ba nguyên tắc tôi áp dụng: một là tách riêng từng user agent thay vì gộp theo nền tảng; hai là ghi rõ cửa sổ thời gian và không bao giờ cộng dồn các kỳ; ba là đo cả traffic không có Referer bằng UTM hoặc landing page chuyên dụng, vì native app không xưng danh. Tôi đã viết chi tiết cách theo dõi và đo lường kênh AI search trong bài về Similarweb AI Ads Tracking mà bạn nên đọc kèm.

Bài học lớn hơn nằm ở đâu?

Bài học vượt ra ngoài crawler. Một con số tách khỏi cửa sổ thời gian, cách gộp nhóm và ranh giới thu thập không còn là con số — nó chỉ còn hình dạng giống con số. Loại tệ hơn con số sai rõ ràng, vì con số sai sẽ bị phản biện ngay trong cuộc họp, còn con số “đúng nhưng không xác định” sẽ đi thẳng vào slide trình bày квартý và trở thành chính sách. Trong thời điểm các vendor đang ùa ra bán công cụ đo AI visibility, tiêu chí chọn hàng đơn giản: bên xứng đáng tiền của bạn tự nói rõ ba thứ kia mà không cần bạn hỏi.

Cloudflare công khai đủ cả ba và hệ sinh thái vẫn làm mất chúng khi truyền tin. Một vendor không bao giờ công bố thì thậm chí không cho bạn thứ gì để mất. Đó là ranh giới tôi sẽ dùng khi đánh giá mọi dashboard AI visibility từ nay.

Minh Đức

Tôi là Minh Đức, làm SEO đã mấy năm. Ngày xưa tôi cũng nghĩ SEO chỉ là nhét từ khóa cho đủ tỷ lệ, đến khi tự tay đẩy vài site lên top mới hiểu nó phức tạp đến mức nào. Tôi thích tự test, tự đo, và chỉ tin khi có số liệu. Ngoài giờ thì tôi đọc sách, chơi cờ, và hay tranh luận với bạn bè về chuyện AI có giết chết SEO không.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *