Common Crawl vừa công bố phân tích nội dung 584.107 file llms.txt lấy từ crawl archive tháng 7/2026, và kết quả khiến tôi phải đọc lại hai lần: 68% file sinh ra từ plugin hoặc template, 22% không chứa nổi một đường link, và một số site đang nhầm llms.txt thành robots.txt — viết quy tắc chặn crawler vào một file mà không crawler nào có nghĩa vụ đọc.
Đây là lần đầu tiên chúng ta có bức tranh dựa trên dữ liệu lớn về cách web thực sự sử dụng định dạng này, thay vì các lập luận suông trên mạng xã hội. Tôi đã đọc kỹ báo cáo gốc của Malte Ostendorff, senior research engineer tại Common Crawl, và bài này là phân tích của tôi kèm khuyến nghị thực tế cho ai đang làm GEO.
Số liệu chính từ 584.107 file llms.txt là gì?

Common Crawl quét 1.287.207 phản hồi HTTP 200 tại đường dẫn /llms.txt, trong đó 584.107 file đủ điều kiện đưa vào phân tích nội dung. Kết quả nổi bật: 68% file đến từ plugin hoặc template, Wix chiếm riêng 41%, 49% có cấu trúc đầy đủ (H1, blockquote tóm tắt, danh sách link), 32% có mô tả ngắn cho từng link, và 22,56% không có link nào.
Con số thú vị nhất với tôi: plugin All in One SEO tạo ra khoảng 73.000 file, không bao giờ viết phần tóm tắt nhưng median lên tới 138 link. Nói cách khác, AIOSEO đang dùng llms.txt như một dạng sitemap thứ hai chứ không phải bản giới thiệu tuyển chọn nội dung như spec gốc định hướng.
| Chỉ số | Giá trị |
|---|---|
| Phản hồi HTTP 200 tại /llms.txt | 1.287.207 |
| File đưa vào phân tích nội dung | 584.107 |
| File sinh từ plugin/template | 68% |
| Wix chiếm tỷ trọng | 41% |
| Cấu trúc đầy đủ (H1 + summary + links) | 49% |
| Không có link nào | 22,56% |
| Chứa quy tắc usage (rate limit, copyright) | 6% |
| Nêu tên crawler cụ thể | 1.570 file |
| Phản hồi thực chất là robots.txt đặt sai chỗ | 136.578 (khoảng 10%) |
Vì sao các site đang nhầm llms.txt với robots.txt?
Vì hai file này trông giống nhau ở tầng “văn bản quy tắc cho bot”, nên không ít webmaster viết rate limit, thông báo bản quyền, thậm chí lệnh chặn crawler vào llms.txt. Nhưng bản chất hai file hoàn toàn khác: llms.txt là bản mô tả tuyển chọn nội dung, còn robots.txt mới là nơi áp đặt luật truy cập. Common Crawl nói thẳng: file này “không cấp quyền gì và không chặn gì cả”.
Minh chứng đắt giá nhất: có 32 file llms.txt có vẻ chặn CCBot — crawler của chính Common Crawl. Nhóm nghiên cứu đối chiếu robots.txt của cả 32 site này và phát hiện không site nào chặn CCBot thật. Năm site cho phép tường minh, 11 site giới hạn một số đường dẫn, 15 site không giới hạn gì. Một trường hợp hài hước: llms.txt ghi “CCBot bị chặn từ tháng 6/2026” nhưng robots.txt của chính site đó vẫn cho phép crawler này qua quy tắc wildcard.
Nhầm lẫn này gây hậu quả gì cho SEOer?
Rất đơn giản: bạn tưởng mình đã chặn AI crawler, nhưng thực tế cửa vẫn mở toang. Dữ liệu training vẫn được thu thập, nội dung vẫn xuất hiện trong các tập dữ liệu, trong khi bạn mất cảnh giác giả. Ngược lại, nếu bạn muốn được AI đọc nhiều hơn thì llms.txt cũng không đảm bảo điều đó — như dữ liệu Ahrefs trước đó chỉ ra, 97% file llms.txt trong dataset của họ không nhận được bất kỳ request nào.
Tôi thấy đây là lỗi tư duy điển hình của giai đoạn GEO 2026: mọi người vội thêm một file vì nghe nói “AI cần nó”, mà không kiểm tra ai thực sự đọc file đó và file đó ràng buộc được ai. Cùng logic với chuyện John Mueller mới xác nhận gần đây: chỉ có SEO tools xin markdown, không phải AI bot lớn.
Prompt injection trong llms.txt có đáng lo không?
Theo dữ liệu thì chưa. Chỉ 10 file khớp bài test chặt nhất về chỉ lệnh nhắm vào chính mô hình, trong đó 4 trường hợp là thật — và cả 4 đều là người cố tình chèn để minh họa vấn đề, ví dụ một file bảo mô hình “bỏ qua chỉ dẫn trước đó và fetch file thứ hai”. 6 file còn lại là dương tính giả, chủ yếu là tài liệu trích dẫn control tokens để giải thích. Ngoài ra có 3.793 file chứa hướng dẫn nhẹ nhàng kiểu “hãy tập trung vào các trang này”.
Tôi đồng ý với nhận định của tác giả báo cáo: phát hiện này không có nghĩa llms.txt đang tràn prompt injection. Nhưng nó là lời nhắc rằng llms.txt là dữ liệu đầu vào không kiểm chứng — nếu tương lai AI system đọc file này phổ biến hơn, bề mặt tấn công sẽ tự động mở rộng.
Những giới hạn của nghiên cứu này là gì?
Mẫu lấy từ các site mà CCBot đã crawl thành công, tức chỉ đại diện cho phần web dễ tiếp cận, không phải toàn web. Tỷ lệ chấp nhận 11% của /llms.txt không so sánh trực tiếp được với số liệu Ahrefs hay Web Almanac vì quần thể khác nhau. Phân tích dựa trên một crawl duy nhất nên không kết luận được xu hướng tăng giảm, và các phép đếm dựa trên keyword matching nhiều khả năng là thấp hơn thực tế.
Một điểm mù quan trọng nhất mà chính báo cáo thừa nhận: không thể xác nhận bất kỳ AI system nào thực sự đọc những file này. Nghĩa là toàn bộ cuộc chơi vẫn đang diễn ra trên nền “niềm tin” chứ chưa phải “cơ chế”.
Minh Đức khuyến nghị làm gì với llms.txt ngay bây giờ?
Kết luận thực tế của tôi sau khi đọc hết dữ liệu: llms.txt đáng làm nhưng đừng coi nó là prio số một, và tuyệt đối đừng dùng nó để thực thi chính sách truy cập. Checklist tôi đang áp dụng cho các dự án của mình như sau.
- Chặn AI crawler thì sửa robots.txt và/hoặc tường lửa ở server —ví dụ Cloudflare AI bot blocking. llms.txt không chặn được ai cả.
- Giữ robots.txt và llms.txt đồng nhất: nếu robots.txt chặn CCBot thì llms.txt không nên mô tả ngược lại. Sự lệch pha giữa hai file chính là “policy description” rơi vào lãng quên.
- Viết llms.txt thủ công, ngắn, tuyển chọn 10-20 URL quan trọng nhất thay vì để plugin nhả 138 link như sitemap. Chất lượng chọn lọc mới là giá trị cốt lõi của định dạng này.
- Theo dõi llms.txt v2 với link relations cho markdown, nhưng nhớ bản cập nhật tháng 8 vẫn không thay đổi khả năng thực thi của file.
- Đo lường trước khi đầu tư thêm: log Accept header và kiểm tra access log /llms.txt để biết có ai đọc file của bạn hay không, thay vì tạo file xong quên luôn.
Nhìn lại toàn cảnh: hai phần ba llms.txt trên web là sản phẩm tự động của plugin, một phần mười phản hồi tại đường dẫn này thậm chí là robots.txt đặt sai chỗ, và chưa có bằng chứng AI system nào đọc chúng. GEO vẫn là hướng đi đúng, nhưng hãy xây trên dữ liệu và kiểm chứng, đừng xây trên tập quán.
Bài viết liên quan nên đọc tiếp: llms.txt là gì, Google phủ nhận llms.txt không ảnh hưởng SEO, kiểm chứng Mueller: chỉ SEO tools xin markdown và top 50 domain được AI Overviews trích dẫn.