Google DeepMind Thử Nghiệm Autoregressive Ranking: LLM Thay Thế Kiến Trúc Ranking Hai Tầng Của Tìm Kiếm

Câu trả lời nhanh
Google DeepMind công bố nghiên cứu Autoregressive Ranking (ARR): dùng một LLM duy nhất gộp retrieval và ranking, thay thế kiến trúc hai tầng Dual Encoder + Cross Encoder. Kết quả thử nghiệm ngang Cross Encoder và vượt Dual Encoder, dù còn yếu ở precision@1 cho shopping. Chưa rollout nhưng định hình rõ tương lai ranking của tìm kiếm.

Hôm 10/9/2026, một nghiên cứu của Google DeepMind hợp tác với Đại học Massachusetts Amherst và Đại học Texas at Austin khiến tôi phải đọc lại hai lần. Tên paper ngắn gọn: Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders. Nội dung dài hơi hơn: huấn luyện một LLM để tự xếp hạng tài liệu, thay thế toàn bộ kiến trúc ranking hai tầng mà Google đã dùng nhiều năm qua.

Đây không phải tính năng mới trên SERP mà là thay đổi ở tầng sâu nhất của động cơ tìm kiếm. Với dân SEO, đây là loại tin đáng đọc kỹ hơn mọi bản core update, vì nó cho biết Google đang định đưa ranking đi về đâu.

Autoregressive Ranking là gì?

Google DeepMind thử nghiệm Autoregressive Ranking cho tìm kiếm
Google DeepMind thử nghiệm Autoregressive Ranking cho tìm kiếm

Autoregressive Ranking (ARR) là mô hình LLM sinh trực tiếp danh sách tài liệu đã xếp hạng, gộp retrieval và ranking vào một hệ thống duy nhất. Nó thay thế kiến trúc hai tầng truyền thống gồm Dual Encoder tìm nhanh ứng viên và Cross Encoder xếp hạng lại. Mô hình được huấn luyện bằng hàm loss mới tên SToICaL, dạy LLM dồn xác suất cho các token docID tương ứng tài liệu liên quan và đẩy tài liệu rác xuống dưới.

Kiến trúc ranking hiện tại của Google hoạt động ra sao?

Để hiểu vì sao ARR đáng chú ý, cần nhìn lại hệ thống đang chạy. Suốt nhiều năm, ranking của các cỗ máy tìm kiếm lớn dựa trên chuỗi hai bước khá kinh điển.

Tầng một là Dual Encoder (DE): query và tài liệu được mã hóa thành vector, so khớp nhanh để lọc ra vài trăm ứng viên từ hàng tỷ trang. Tầng này rẻ, nhanh, nhưng độ chính xác bị giới hạn bởi kích thước vector biểu diễn.

Tầng hai là Cross Encoder (CE): đọc kỹ từng cặp query-tài liệu rồi chấm điểm xếp hạng. Mạnh hơn nhiều nhưng đắt đỏ, nên chỉ dùng cho lượng ứng viên nhỏ đã được DE lọc sẵn.

Điểm nghẽn nằm đúng ở đó. DE phải đánh đổi giữa tốc độ và khả năng biểu diễn. Nghiên cứu của DeepMind chứng minh về mặt lý thuyết: để DE xếp hạng chính xác k tài liệu, chiều vector phải tăng tuyến theo k. Nghĩa là corpus càng lớn, vector càng phình, chi phí càng đội.

Tiêu chíDual EncoderCross EncoderARR (nghiên cứu)
Vai tròRetrieval nhanhXếp hạng lại ứng viênGộp cả hai
Chi phí tính toánThấpRất caoTrung bình (chưa xác định ở quy mô thật)
Giới hạn biểu diễnVector phải tăng theo số tài liệuKhông phù hợp retrieval lớnChiều ẩn cố định, xếp hạng được số tài liệu tùy ý (lý thuyết)

Kết quả thử nghiệm cho thấy gì?

Kết quả thử nghiệm trên hai bộ dữ liệu WordNet và ESCI Shopping Queries khá tích cực nhưng chưa toàn thắng. ARR với huấn luyện SToICaL ngang Cross Encoder và vượt hẳn Dual Encoder trên WordNet, đồng thời giảm mạnh lỗi xếp tài liệu rác lên trên. Tuy nhiên ở bài toán shopping, một biến thể của phương pháp lại tệ hơn ở việc đưa đúng kết quả liên quan nhất lên vị trí đầu tiên, dù ranking tổng thể tốt hơn.

Cụ thể, ba phát hiện đáng chú ý nhất từ paper:

  • Hàm loss SToICaL với item-level reweighting và prefix-tree marginalization cải thiện rõ các chỉ số ranking sau vị trí top-1, tức chất lượng danh sách tổng thể tốt lên.
  • Lỗi đưa tài liệu không liên quan lên trên bị “giảm mạnh” trong thử nghiệm WordNet, điều mà DE vốn làm kém.
  • Trên ESCI Shopping Queries, phương pháp vẫn còn điểm yếu ở precision@1, đúng chỗ quan trọng nhất với ecommerce.

Tôi thấy chi tiết precision@1 thú vị không kém phần tốt đẹp. Nó cho thấy các nhà nghiên cứu chưa giải xong bài toán khó nhất của thương mại điện tử: đúng một sản phẩm duy nhất người dùng muốn mua. Với SEOer làm ecommerce, đây là tín hiệu nên theo dõi kỹ các bản cập nhật tiếp theo của hướng nghiên cứu này.

SEOer nên lo hay không nên lo?

Theo đánh giá của tôi, chưa nên lo, nhưng phải bắt đầu chuẩn bị. Đây là research paper, không phải tính năng đang rollout. Chính kết luận của paper cũng thừa nhận phần vượt trội về “sức mạnh biểu diễn” mới dừng ở mức lý thuyết, và chưa có bằng chứng nó chạy được trên quy mô hàng tỷ query mỗi ngày của Google thật.

Tuy nhiên, hướng đi này khớp với những gì tôi đã quan sát suốt năm 2026. Trong bài phân tích Google August 2026 Volatility và AI quality scoring, tôi đã note xu hướng Google thay các khối ranking truyền thống bằng mô hình học sâu từng phần. ARR là bước hợp lý tiếp theo: thay cả hai tầng bằng một LLM.

Nếu ARR (hoặc một biến thể của nó) vào production, hệ quả với SEO và AEO sẽ sâu sắc hơn bất kỳ core update nào: cách nội dung được “hiểu” thay đổi hoàn toàn, các tín hiệu kỹ thuật được mã hóa thành token, và ranh giới giữa được trích dẫn bởi AI Overviews và xếp hạng organic sẽ mờ dần. Bạn nên đọc thêm bài về GSC AI Report để thấy Google đang đo lường AI visibility ra sao, vì đó chính là chỉ số sẽ quan trọng khi ranking và citation hợp nhất.

SEOer nên làm gì ngay từ bây giờ?

Ba việc tôi đang làm cho các site mình quản lý, và bạn nên cân nhắc theo:

  • Bỏ ảo tưởng về “thuật toán cũ”. Nếu còn ai nói ranking là backlink thuần túy, đưa họ đọc paper này. Hãy tối ưu cho cả hệ thống vector lẫn mô hình ngôn ngữ: nội dung rõ ràng, cấu trúc tốt, thực thể được định nghĩa sạch.
  • Đầu tư vào nội dung chất lượng cao theo chủ đề sâu. Mô hình ranking dạng LLM học từ độ liên quan thật của tài liệu, nội dung mỏng được spin sẽ càng dễ bị đẩy xuống khi hệ thống loại bỏ lỗi xếp tài liệu rác lên trên.
  • Theo dõi ESCI nếu làm ecommerce. Bộ dữ liệu shopping chính là nơi Google thử nghiệm ranking sản phẩm. Điểm yếu precision@1 của ARR nghĩa là cuộc chơi feed và schema sản phẩm vẫn còn dài, xem thêm bài về ChatGPT Shopping và product feed cho bức tranh đầy đủ.

Kết luận

ARR chưa thay đổi SERP của bạn hôm nay, nhưng nó vạch rõ đích đến: một ngày không xa, retrieval và ranking có thể là một mô hình ngôn ngữ duy nhất. Khoảng cách giữa “tối ưu cho thuật toán” và “tối ưu cho AI” sẽ đóng lại. Ai đã làm GEO bài bản từ bây giờ sẽ có lợi thế kép, kẻ nào vẫn kéo dài SEO kiểu 2015 sẽ phải chơi chạy bám. Tôi sẽ tiếp tục theo dõi các paper tiếp theo của nhóm nghiên cứu này và cập nhật khi có dấu hiệu ARR được thử nghiệm rộng hơn.

Minh Đức

Tôi là Minh Đức, làm SEO đã mấy năm. Ngày xưa tôi cũng nghĩ SEO chỉ là nhét từ khóa cho đủ tỷ lệ, đến khi tự tay đẩy vài site lên top mới hiểu nó phức tạp đến mức nào. Tôi thích tự test, tự đo, và chỉ tin khi có số liệu. Ngoài giờ thì tôi đọc sách, chơi cờ, và hay tranh luận với bạn bè về chuyện AI có giết chết SEO không.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *