Faraday Của Inherent Chạy Qwen 27B Đánh Bại Claude Opus 4.8 Và GPT-5.5 Trong Tái Hiện Nghiên Cứu Khoa Học

Câu trả lời nhanh
Faraday là AI agent của startup London Inherent, chạy trên Qwen 3.6 chỉ 27 tỷ parameter nhưng đánh bại Claude Opus 4.8 và GPT-5.5 trong việc độc lập tái hiện kết quả nghiên cứu khoa học. Bí quyết nằm ở reinforcement learning dạy research taste thay vì luật cứng, kết hợp dùng GPT-5.5 Codex làm công cụ code. Bài học: model nhỏ huấn luyện đúng cách vẫn thắng model frontier cho tác vụ chuyên sâu.
AI agent Faraday của Inherent chạy Qwen 27B đánh bại Claude Opus 4.8 và GPT-5.5 trong tái hiện nghiên cứu khoa học

Startup AI London tên Inherent vừa làm chuyện mà ít ai ngờ: AI agent Faraday của họ chạy trên model Qwen 3.6 chỉ 27 tỷ parameter, lại đánh bại Claude Opus 4.8 và GPT-5.5 — hai “khủng long” frontier — trong việc độc lập tái hiện kết quả của các bài nghiên cứu khoa học đã công bố. Không được cho biết đáp án trước, agent phải tự thiết kế thí nghiệm, tự chạy, tự đối chiếu.

Mình thấy câu chuyện này đáng chú ý không phải vì ai thắng ai, mà vì cách họ thắng: reinforcement learning dạy cho AI “gu nghiên cứu” thay vì dạy quy tắc cứng. Đó là hướng đi có thể thay đổi cách chúng ta xây AI agent trong 2026.

Faraday là gì và nó vừa làm được gì?

Faraday là AI “đồng nghiệp nghiên cứu” do Inherent phát triển, nhiệm vụ cụ thể trong thử nghiệm lần này là replicate: đọc một bài báo khoa học đã publish rồi tự tái hiện kết quả mà không biết trước câu trả lời. Theo công bố của công ty, Faraday vượt qua cả Claude Opus 4.8 lẫn GPT-5.5 ở tác vụ này, dù model bên dưới chỉ là Qwen 3.6 27B — nhỏ hơn nhiều lần so với hai đối thủ.

Đây không phải trò xoàng. Edward Hughes, đồng sáng lập kiêm chief scientist của Inherent, so sánh: sinh viên PhD thường cũng bắt đầu sự nghiệp bằng việc tái hiện paper của người khác. AI làm được việc này nghĩa là nó đã chạm tới bước đầu của chuỗi nghiên cứu thật.

Vì sao model 27B lại thắng model frontier?

Câu trả lời nằm ở phương pháp huấn luyện chứ không nằm ở kích thước. Inherent dùng reinforcement learning — thưởng cho AI khi có kết quả tốt thay vì viết luật từng bước — để rèn thứ mà họ gọi là “research taste”: khả năng phán đoán thí nghiệm nào đáng chạy và nên thiết kế thế nào.

Điểm thú vị thứ hai: Faraday không tự viết code. Nó dùng GPT-5.5 Codex của OpenAI làm công cụ, y như nhà khoa học thật vẫn dùng phần mềm có sẵn thay vì tự dựng mọi thứ. Một agent nhỏ biết “điều phối” tốt vẫn thắng agent to làm mọi thứ một mình.

Qwen 3.6 27B đối đầu Claude và GPT: nhỏ mà có võ?

So sánh nhanh ba bên: Claude Opus 4.8 mạnh về phân tích dài, GPT-5.5 mạnh về phạm vi tổng quát, còn Qwen 3.6 27B thắng nhờ được tinh chỉnh chuyên sâu cho đúng tác vụ. Nó giống trận đấu mà vận động viên hạng nhẹ đánh bại hạng nặng vì được huấn luyện đúng môn.

Bài học cho người làm sản phẩm AI: không phải lúc nào cũng cần model to nhất. Chọn model nhỏ phù hợp, huấn luyện theo outcome cụ thể, ghép công cụ có sẵn — công thức đó vừa rẻ vừa hiệu quả. Đây cũng là lý do dòng Qwen open-weight liên tục gây sốc, như bài mình từng viết về Qwen 27B thắng Claude Opus trên SWE-bench Pro.

Inherent là công ty nào?

Inherent đặt trụ sở tại King’s Cross, London, do bốn đồng sáng lập trong đó ba người từng ở Google DeepMind. Công ty vừa ra khỏi stealth hồi tháng 5/2026 với vòng seed 50 triệu USD và hiện chỉ có khoảng 12 nhân viên, làm việc trực tiếp tại văn phòng. Cuối năm nay họ dự kiến tăng lên 20-25 người.

Mục tiêu dài hạn của họ tham vọng hơn nhiều: xây AI có thể khám phá tri thức khoa học mới, không chỉ kiểm chứng kết quả cũ. Việc DeepMind đang chảy máu chất xám sau khi Demis Hassabis đổi vai trò cũng đang biến Inherent thành điểm đến hấp dẫn cho các nhà nghiên cứu muốn ra đi.

Điều này có ý nghĩa gì với người làm AI và kiếm tiền online?

Mình rút ra ba điểm thực tế. Một, agent chuyên dụng nhỏ đang là hướng đi sinh lời: chi phí chạy 27B thấp hơn nhiều so với model frontier, phù hợp cho sản phẩm cần gọi API liên tục. Hai, kỹ năng “điều phối” — chọn đúng tool, đúng model cho từng bước — đang có giá hơn kỹ năng tự làm hết. Ba, niche nghiên cứu, tài liệu, phân tích dữ liệu là mảnh đất AI agent có thể bán được dịch vụ ngay bây giờ.

Nếu bạn đang xây tool trên nền model lớn vì nghĩ model to luôn tốt hơn, đây là lúc nên thử nghiệm lại giả định đó. Kết quả của Inherent cho thấy vùng đất trung gian — model nhỏ được rèn đúng cách — vẫn còn rất nhiều dư địa.

Kết luận

Faraday của Inherent chứng minh một điều: trong cuộc đua AI agent, kích thước model không quyết định tất cả. Phương pháp huấn luyện theo outcome và triết lý “AI như đồng nghiệp tò mò” — tự đi thử nghiệm rồi quay lại hỏi ý kiến — có thể là khuôn mẫu cho thế hệ agent tiếp theo. Mình sẽ theo dõi Inherent chặt, vì họ thuộc nhóm hiếm hoi nói được và làm được ngay từ vòng seed.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *