ChatGPT-User Bỏ Qua Disallow: Số Liệu TollBit H1/2026 Và Cách SEOer Kiểm Soát AI Bot Thực Sự

Câu trả lời nhanh
Báo cáo TollBit H1/2026 cho thấy 15% AI bot fetch trang tại châu Âu truy cập cả URL bị disallow, trong đó ChatGPT-User bị chặn nhiều nhất nhưng cũng vi phạm nhiều nhất. OpenAI lập luận robots.txt không ràng buộc bot do người dùng khởi tạo. SEOer cần kiểm tra server log và kiểm soát AI crawler ở tầng mạng thay vì chỉ tin robots.txt.

Tôi vừa xong báo cáo State of the Bots nửa đầu 2026 của TollBit và phải nói thẳng: đây là lần đầu tiên tôi thấy dữ liệu xác nhận điều mà giới technical SEO nghi ngờ từ lâu. Dòng Disallow trong robots.txt đang bị một số AI bot coi như lời đề nghị chứ không phải rào cản.

Chuyện bắt đầu từ số liệu: khoảng 15% các AI bot fetch trang tại các website châu Âu đã truy cập cả những URL mà chính site đó đánh dấu là disallow. Và cái tên đứng đầu danh sách vi phạm không ai khác ngoài ChatGPT-User — agent fetch trang của ChatGPT.

Đáng chú ý hơn, tài liệu chính thức của OpenAI giải thích vì sao họ cho rằng robots.txt có thể không áp dụng cho bot này. Tôi sẽ bóc tách từng lớp dưới đây.

Robots.txt còn chặn được AI bot không?

AI bot ChatGPT-User truy cập cả URL bị cấm bằng Disallow trong robots.txt
15% lượt fetch của AI bot chạm cả URL disallow (TollBit H1/2026)

Câu trả lời ngắn gọn: không đáng tin như trước. Theo dữ liệu TollBit, 15% AI page-fetcher tại website châu Âu chạm vào URL bị disallow. Ba agent vi phạm nặng nhất là ChatGPT-User, Bytespider và Youbot — mỗi bot truy cập trang bị cấm trên gần một nửa số site đã explicitly liệt kê chúng trong robots.txt. ChatGPT-User vừa là bot bị disallow nhiều nhất, vừa là bot vi phạm nhiều nhất.

Nghịch lý nằm ở chỗ này: website càng chủ động chặn, bot càng vẫn vào. Nếu bạn đang tin rằng vài dòng trong robots.txt là đủ để bảo vệ nội dung, số liệu này nên khiến bạn xem lại.

Số liệu TollBit H1/2026 cụ thể nói gì?

Tôi tổng hợp lại phần dữ liệu chính của báo cáo thành bảng để dễ đối chiếu:

AgentTình trạng disallow (châu Âu)Hành vi ghi nhận
ChatGPT-UserBị disallow nhiều nhất trong nhóm fetcherTruy cập URL bị cấm trên gần 50% site liệt kê; bypass nhiều site nhất
BytespiderÍt được chú ý khi chặnGần 50% site liệt kê vẫn bị truy cập
YoubotÍt được chú ý khi chặnGần 50% site liệt kê vẫn bị truy cập
Claude-User9% website disallowAnthropic cam kết tôn trọng robots.txt
Perplexity-User13% website disallowPerplexity thừa nhận bỏ qua file với fetch do user khởi tạo

Một chi tiết đáng suy nghĩ: tỷ lệ disallow ở châu Âu thấp hơn hẳn Bắc Mỹ. Claude-User bị 9% site châu Âu chặn so với 26% ở Bắc Mỹ. Perplexity-User là 13% so với 26%. Tức là phần lớn website chưa hề chặn các agent mới — họ chỉ lo chặn ChatGPT và nghĩ đó là xong.

TollBit định nghĩa rất rõ: mọi request đến URL bị disallow đều được tính là bypass, bất kể bên vận hành bot giải thích thế nào. Tôi tán thành cách đo này. Đừng nghe lời hứa, hãy nhìn vào request thực tế trong log.

Vì sao OpenAI cho rằng robots.txt không ràng buộc ChatGPT-User?

Lập luận của OpenAI nằm ngay trong tài liệu crawler của họ: ChatGPT-User chỉ truy cập một trang khi có người dùng ChatGPT đặt câu hỏi liên quan. Vì hành động fetch do con người khởi tạo, nó giống trình duyệt của visitor hơn là crawler tự động — nên quy ước robots.txt dành cho crawler có thể không áp dụng. Perplexity giữ quan điểm tương tự với Perplexity-User.

Anthropic lại đứng về phía ngược lại: cả ba bot của họ đều tôn trọng robots.txt, thậm chí cho phép chặn granular ở từng loại bot. Đây là điểm phân hóa quan trọng khi bạn quyết định chặn ai.

Cá nhân tôi thấy lập luận “user-initiated” có phần tréo ngoe. Nếu mọi assistant AI đều fetch trang theo kiểu này — và hiện nay tất cả đều làm vậy — thì robots.txt trên thực tế mất tác dụng với chính nhóm traffic tăng nhanh nhất.

Chặn ChatGPT-User có khiến website biến mất khỏi ChatGPT?

Không hẳn, và đây là cái bẫy mà nhiều người bỏ qua. Theo chính tài liệu của OpenAI, agent quyết định website có xuất hiện trong kết quả tìm kiếm của ChatGPT là OAI-SearchBot, không phải ChatGPT-User. Hai bot, hai vai trò khác nhau.

Nếu bạn block cả hai agent để “chặn AI”, bạn đánh đổi mất nửa visibility của thỏa thuận mà giữ lại phần kiểm soát fetch vốn đã có carve-out. Ngược lại, nếu traffic từ ChatGPT referral đang chuyển đổi tốt cho site của bạn — như phân tích về hành vi ChatGPT chọn thương hiệu trước cả khi tìm kiếm mà tôi đã bàn trong bài trước — thì chặn toàn bộ là tự cắt nguồn traffic đang tăng.

SEOer nên kiểm tra gì trong server log ngay tuần này?

Tôi đề xuất quy trình ba bước, làm được trong một buổi chiều. Thực tế cho thấy file robots.txt chỉ cho thấy cái bạn yêu cầu; server log mới cho thấy cái thực sự đến.

  • Bước 1: Grep access log hoặc log CDN theo user-agent: ChatGPT-User, OAI-SearchBot, Perplexity-User, Claude-User, Bytespider. Cloudflare Analytics có sẵn mục bot riêng.
  • Bước 2: Đối chiếu request thực tế với các dòng disallow của bạn. Tính tỷ lệ bypass thật của từng agent thay vì đoán.
  • Bước 3: Ra quyết định theo mục tiêu: site kiếm tiền từ traffic AI thì giữ OAI-SearchBot mở; site bị scrape content nặng thì chặn ở tầng mạng, không phải ở file text.

Sau khi test trên mấy chục website khách hàng, tôi nhận ra quy luật: những ai quyết định dựa trên log của chính mình luôn chọn đúng hướng hơn những ai copy robots.txt của người khác.

Cloudflare thay đổi luật chơi từ 15/9 như thế nào?

Tin quan trọng nhất với dân technical SEO: Cloudflare đang chuyển việc kiểm soát crawler xuống tầng mạng. Từ 15/9/2026, các domain mới thêm vào Cloudflare sẽ mặc định chặn Training và Agent crawlers trên những trang có quảng cáo, trong khi Search crawlers vẫn được phép đi qua.

Điểm khác biệt là enforcement: compliance không còn phụ thuộc vào thiện chí của bot. Bot không tự nguyện tuân thủ sẽ bị chặn ở edge. Với những ai muốn hiểu sâu hơn cách chặn AI agent kết nối tự động, bài viết về phát hiện MCP traffic của Cloudflare trên blog này rất đáng đọc.

Theo dữ liệu của Cloudflare, machine traffic thậm chí có thể gấp 1.000 lần human traffic trong vòng 5 năm nữa. Nếu đúng hướng đó, việc kiểm soát bot ở tầng mạng sẽ trở thành kỹ năng cơ bản của SEOer, ngang với việc tối ưu crawl budget ngày trước.

Chặn hay không chặn nên dựa vào dữ liệu nào?

Kết luận của tôi sau khi đọc hết báo cáo: robots.txt là lời đề nghị, không phải bức tường. Cơ chế đồng thuận xây cho web thập kỷ 90 không thiết kế cho thời đại mà mọi trợ lý AI đều fetch trang thay người dùng. Câu hỏi đúng không còn là “block hay không block” mà là “block ở tầng nào và đổi lấy cái gì”.

Nếu chiến lược của bạn bao gồm GEO — xuất hiện trong câu trả lời của ChatGPT, Perplexity, Google AI — thì mỗi quyết định chặn đều là quyết định đánh đổi visibility. Tôi đã tổng hợp khung đánh đổi trong hướng dẫn GEO toàn diện 2026, bạn có thể đối chiếu trước khi quyết.

Còn một việc nữa: đừng quên kiểm tra xem các URL bị disallow có thực sự đáng chặn không. Trong vài case tôi audit, webmaster chặn cả thư mục mà AI bot vẫn vào vì đường dẫn query string không khớp pattern. Data sạch trước, quyết định sau.

Nguồn tham khảo: TollBit State of the Bots H1/2026, tài liệu crawler của OpenAI, và công bố của Cloudflare về chính sách crawler mặc định từ 15/9/2026.

Minh Đức

Tôi là Minh Đức, làm SEO đã mấy năm. Ngày xưa tôi cũng nghĩ SEO chỉ là nhét từ khóa cho đủ tỷ lệ, đến khi tự tay đẩy vài site lên top mới hiểu nó phức tạp đến mức nào. Tôi thích tự test, tự đo, và chỉ tin khi có số liệu. Ngoài giờ thì tôi đọc sách, chơi cờ, và hay tranh luận với bạn bè về chuyện AI có giết chết SEO không.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *