Benchmark Contamination Là Gì? Nhiễm Bẩn Benchmark Trong AI Giải Thích Dễ Hiểu
Bạn đã bao giờ gặp một học sinh biết trước toàn bộ đề thi chưa? Dù không học giỏi hơn ai, cậu ấy vẫn đạt...
Đọc tiếp →Đánh giá AI (AI Evaluation) là quy trình đo lường chất lượng model: accuracy, fairness, safety, latency. Dùng benchmark (MMLU, HumanEval) và human eval. Cốt lõi cho AI governance.
5 bài viết
Bạn đã bao giờ gặp một học sinh biết trước toàn bộ đề thi chưa? Dù không học giỏi hơn ai, cậu ấy vẫn đạt...
Đọc tiếp →
LLM-as-a-Judge Là Gì? LLM-as-a-Judge: dùng AI đánh giá AI LLM-as-a-Judge là cách dùng một mô hình ngôn ngữ lớn để chấm điểm, đánh giá và...
Đọc tiếp →BLEU Score là thước đo chất lượng dịch máy phổ biến nhất hiện nay. Nếu bạn từng thắc mắc làm sao đánh giá AI dịch...
Đọc tiếp →AI Evaluation (Eval) Là Gì? AI Evaluation, hay gọi tắt là Eval, là quá trình đo lường và đánh giá hiệu suất của một mô...
Đọc tiếp →