MMLU Là Gì? Benchmark Đánh Giá AI Toàn Diện Nhất

Câu trả lời nhanh
MMLU (Massive Multitask Language Understanding) là bộ benchmark gồm 15.908 câu hỏi trắc nghiệm trên 57 chủ đề, dùng để đo lường khả năng hiểu kiến thức diện rộng của AI. Từ toán, luật, y khoa đến nghệ thuật, MMLU kiểm tra xem model có thực sự hiểu hay chỉ nói được.

MMLU Là Gì?

MMLU - Benchmark đánh giá AI trên 57 lĩnh vực kiến thức
MMLU – Benchmark đánh giá AI trên 57 lĩnh vực kiến thức

MMLU (Massive Multitask Language Understanding) là một bộ bài kiểm tra dùng để đo lường mức độ hiểu của AI trên nhiều lĩnh vực kiến thức khác nhau. Gồm 15.908 câu hỏi trắc nghiệm trải dài qua 57 chủ đề — từ toán học, luật, y khoa, đến lịch sử, nghệ thuật và tin học. Nói nôm na, MMLU giống như một kỳ thi đại hội bao trùm mọi ngành học để xem AI có thực sự hiểu hay chỉ nói được.

Lần đầu đọc về MMLU, mình liền nghĩ đến kỳ thi SAT hay thi đại học. Bạn không thể qua môn chỉ bằng mẹo đánh lụi. Muốn điểm cao, bạn phải thật sự hiểu. MMLU ép AI phải như vậy.

MMLU Đo Lường Cái Gì?

MMLU kiểm tra kiến thức diện rộng của mô hình ngôn ngữ. 57 chủ đề được chia làm 4 nhóm chính:

1. STEM (Khoa học, Công nghệ, Kỹ thuật, Toán): Toán cao cấp, vật lý, hóa học, sinh học, khoa học máy tính, thống kê.

2. Humanities (Khoa học nhân văn): Lịch sử, triết học, luật pháp, đạo đức, ngôn ngữ học.

3. Social Sciences (Khoa học xã hội): Kinh tế học, tâm lý học, xã hội học, chính trị học.

4. Other (Khác): Y khoa, kế toán, marketing, quản lý, an ninh thông tin, ngoại giao.

Mỗi câu hỏi có 4 đáp án (A, B, C, D). AI phải chọn đúng. Nghe đơn giản, nhưng nhiều câu trong đó khó tới mức người không chuyên cũng không làm được.

Ví Dụ Câu Hỏi MMLU

Một câu hỏi điển hình trong nhóm STEM có thể là: “Tìm đạo hàm của hàm số f(x) = x^3 * ln(x)”. Để trả lời đúng, AI cần hiểu cả giải tích lẫn logarit.

Trong nhóm humanities, có thể là: “Triết gia nào cho rằng ý thức tự nhiên nảy sinh từ mâu thuẫn giữa chủ thể và khách thể?” — câu cần kiến thức triết học sâu.

Điều khiến MMLU khó là nó không chỉ kiểm tra một lĩnh vực. Model phải giỏi toàn diện mới được điểm cao. Giỏi toán mà dốt sử thì vẫn điểm thấp.

Cách Chấm Điểm MMLU

Điểm MMLU được tính theo tỷ lệ phần trăm câu trả lời đúng trên tổng số câu hỏi. Ví dụ, nếu model trả lời đúng 8.000/15.908 câu, điểm sẽ là khoảng 50,3%.

Ngoài ra, người ta còn chia theo độ khó: câu hỏi được phân loại theo năm học (elementary, middle school, high school, college, professional). Câu cấp độ professional thường là khó nhất, đòi hỏi kiến thức chuyên sâu.

Người ta thường báo cáo cả 2 số: 5-shot accuracy (cho 5 ví dụ trước khi hỏi) và 0-shot accuracy (không ví dụ). 5-shot thường cao hơn vì model được nhắc nhở định dạng câu trả lời.

MMLU Khác Gì So Với Các Benchmark Khác?

MMLU vs HumanEval: HumanEval kiểm tra khả năng viết code. MMLU kiểm tra kiến thức rộng. Hai cái bổ sung cho nhau, không thay thế được.

MMLU vs GSM8K: GSM8K chỉ tập trung vào toán cấp tiểu học. MMLU bao trùm nhiều lĩnh vực hơn, nhưng câu hỏi cũng học thuật hơn.

MMLU vs MMLU-Pro: MMLU-Pro là phiên bản nâng cấp với câu hỏi khó hơn, 10 đáp án thay vì 4, và loại bỏ những câu dễ đoán mò.

Điểm MMLU Của Các Model AI Lớn

Mình đã theo dõi điểm MMLU của các model qua các năm, và sự tiến bộ khá ấn tượng:

Năm 2020 (GPT-3): Khoảng 43,9%. Khi đó model mới chỉ hơn đoán ngẫu nhiên một chút.

Năm 2022 (GPT-4): 86,4%. Một bước nhảy khổng lồ.

Năm 2025-2026: Các model hàng đầu như GPT-5.5, Claude Opus 4.8, Gemini 3.5 Pro đều đạt trên 90%.

Khi gần mọi model đều đạt trên 90%, MMLU bắt đầu bão hòa — khó phân biệt được model nào thực sự giỏi hơn. Đó là lý do MMLU-Pro ra đời.

Hạn Chế Của MMLU

MMLU không hoàn hảo. Một số hạn chế mà mình nhận thấy:

Câu hỏi trắc nghiệm: Thực tế, khả năng chọn A/B/C/D không phản ánh đầy đủ năng lực suy luận. AI có thể biết đáp án mà không giải thích được tại sao.

Thiên vị văn hóa: Nhiều câu hỏi mang góc nhìn phương Tây, đặc biệt trong nhóm humanities và social sciences. Model huấn luyện trên dữ liệu Mỹ sẽ có lợi thế không công bằng.

Rò rỉ dữ liệu: Vì MMLU công khai trên mạng, có nguy cơ model đã thấy câu hỏi trong quá trình huấn luyện, dẫn đến điểm cao “ảo”.

Bão hòa: Khi model đã đạt trên 90%, khó dùng MMLU để phân biệt. Cần benchmark khó hơn.

Tại Sao MMLU Vẫn Quan Trọng?

Dù có hạn chế, MMLU vẫn là một trong những benchmark được dùng phổ biến nhất khi đánh giá AI. Lý do rất đơn giản: nó bao quát, dễ hiểu, và đã được cộng đồng công nhận.

Khi một model mới ra mắt, người ta thường báo cáo điểm MMLU trước tiên. Giống như điểm SAT — nó không nói hết, nhưng là điểm tham chiếu nhanh để so sánh.

Theo mình, MMLU đóng vai trò như bài kiểm tra sức khỏe tổng quát cho AI. Nó không chẩn đoán được mọi vấn đề, nhưng cho bạn bức tranh tổng thể về mức độ hiểu biết của model.

Kết Luận

MMLU là benchmark nền tảng — nó tạo chuẩn mực để đo lường AI trong nhiều năm. Dù đang dần được thay thế bởi các benchmark khó hơn như MMLU-Pro hay GPQA, MMLU vẫn là cái tên mà ai quan tâm AI đều cần biết.

Nếu bạn đọc báo cáo kỹ thuật của model mới và thấy điểm MMLU, giờ bạn đã biết nó nghĩa là gì: bài kiểm tra kiến thức phổ thông của AI, 57 môn học, và điểm số cho biết model hiểu rộng đến đâu.

ThienLv

Mình là Thien, người tạo ra blog này. Ban ngày làm marketing, ban đêm cày tiền online và chơi với AI. Blog này là nơi mình ghi lại những gì mình thử qua — tool nào xịn, chiến thuật nào chạy được, cái gì thất bại. Mình không giỏi nhất, nhưng mình thích chia sẻ thật. Chill với một ly cafe đá là lý tưởng nhất.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *