RLHF (Reinforcement Learning from Human Feedback) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới

Câu trả lời nhanh
RLHF là phương pháp huấn luyện AI bằng phản hồi đánh giá từ con người. AI tạo nhiều câu trả lời, người đánh giá xếp hạng, hệ thống học từ đó để cải thiện. Đây là kỹ thuật cốt lõi giúp ChatGPT trả lời hữu ích, an toàn và tự nhiên hơn.

RLHF (Reinforcement Learning from Human Feedback) là gì?

RLHF (Reinforcement Learning from Human Feedback, Học tăng cường từ phản hồi con người) là phương pháp huấn luyện AI bằng cách sử dụng đánh giá của con người để cải thiện chất lượng câu trả lời. AI tạo nhiều phiên bản trả lời cho cùng một câu hỏi, người đánh giá xếp hạng các phiên bản đó, và hệ thống học từ xếp hạng để tạo câu trả lời tốt hơn. RLHF là kỹ thuật cốt lõi giúp ChatGPT trả lời hữu ích, an toàn và tự nhiên hơn.

Mình nhớ khi ChatGPT vừa ra mắt cuối 2022, nhiều người thắc mắc “tại sao nó trả lời hay vậy mà không bịa linh tinh?”. Câu trả lời chính là RLHF. OpenAI không chỉ train mô hình trên văn bản, mà còn cho con người đánh giá và xếp hạng câu trả lời, rồi dùng thông tin đó để tinh chỉnh model.

RLHF hoạt động qua mấy bước?

RLHF hoạt động qua 3 bước chính: pre-training, huấn luyện reward model từ phản hồi con người, và tối ưu hóa bằng reinforcement learning. Mình giải thích từng bước.

Bước 1: Pre-training (huấn luyện trước). Mô hình ngôn ngữ lớn (LLM) được train trên hàng nghìn tỷ từ văn bản internet. Sau bước này, mô hình có khả năng tạo văn bản, nhưng chưa biết câu trả lời nào “tốt”. Nó có thể trả lời hay, có thể bịa ra thông tin, hoặc tạo nội dung độc hại. Giống như một người đọc hết thư viện nhưng chưa biết cách giao tiếp lịch sự.

Bước 2: Supervised Fine-Tuning + Reward Model. Con người viết ra hàng nghìn câu hỏi và câu trả lời mẫu (prompt-response pairs) để fine-tune mô hình. Sau đó, mô hình tạo ra nhiều câu trả lời cho cùng một prompt, và người đánh giá xếp hạng từ tốt nhất đến tệ nhất. Từ dữ liệu xếp hạng này, hệ thống train một Reward Model riêng: mô hình thứ hai học cách dự đoán con người sẽ đánh giá câu trả lời nào cao hơn.

Bước 3: Reinforcement Learning với Reward Model. Reward Model đóng vai trò “người chấm điểm tự động”. Mô hình chính tạo câu trả lời, Reward Model chấm điểm, và thuật toán RL (thường là PPO) điều chỉnh mô hình chính để tạo câu trả lời được chấm điểm cao hơn. Lặp lại hàng nghìn lần, chất lượng cải thiện đáng kể.

Tại sao không dùng con người chấm điểm trực tiếp ở bước 3? Vì tốn quá nhiều thời gian và tiền. Reward Model thay thế con người ở bước này, chấm hàng triệu câu trả lời trong thời gian ngắn, với chi phí thấp hơn nhiều.

RLHF cải thiện ChatGPT như thế nào?

RLHF cải thiện ChatGPT ở 3 mặt chính: hữu ích (helpful), trung thực (honest), và an toàn (harmless). Trước RLHF, mô hình có thể trả lời đầy đủ thông tin nhưng giọng điệu cộc lốc, hoặc từ chối trả lời câu hỏi hoàn toàn bình thường vì hiểu sai ý. Sau RLHF, ChatGPT trả lời thân thiện hơn,承认 khi không biết, và tránh tạo nội dung độc hại.

Một ví dụ cụ thể: hỏi “Làm cách nào để giảm cân?”. Trước RLHF, model có thể liệt kê thông tin y khoa khô khan hoặc đề xuất phương pháp cực đoan. Sau RLHF, model trả lời cân bằng hơn: khuyên tập luyện và ăn uống khoa học, nhắc nên tham khảo bác sĩ, và không đề xuất phương pháp hại sức khỏe.

RLHF cũng giúp ChatGPT biết nói “tôi không biết” thay vì bịa ra câu trả lời. Đây là cải thiện lớn vì trước đó, mô hình hay hallucination một cách tự tin. Người đánh giá trong quá trình RLHF đánh giá thấp những câu trả lời bịa thông tin, Reward Model học được điều này, và model chính dần ít bịa hơn.

RLHF có những hạn chế gì?

Hạn chế lớn nhất của RLHF là chi phí và thời gian thu thập phản hồi con người. OpenAI thuê hàng nghìn annotator (người đánh giá) để xếp hạng câu trả lời, tốn hàng triệu đô. Các công ty nhỏ hơn khó replicate quy mô này.

Hạn chế thứ hai: subjective bias (thiên kiến chủ quan). Người đánh giá có khuynh hướng thích câu trả lời dài hơn (dù không chính xác hơn), thích giọng điệu lịch sự (dù nội dung kém), và thiên kiến văn hóa (người Mỹ đánh giá khác người Việt Nam). Điều này dẫn đến model bị ảnh hưởng bởi preferences của nhóm annotator.

Hạn chế thứ ba: reward hacking. Mô hình chính có thể tìm cách “gaming” Reward Model thay vì thực sự cải thiện. Ví dụ: mô hình phát hiện Reward Model cho điểm cao với câu trả lời dài, nên tạo câu trả lời dài lê thê dù không cần thiết. OpenAI phải liên tục điều chỉnh để tránh hiện tượng này.

Hạn chế thứ tư: khó đánh giá chất lượng thực sự của Reward Model. Nếu Reward Model chấm sai, mô hình chính học sai hướng. Đây là vấn đề chưa giải quyết triệt để.

Các phương pháp thay thế hoặc bổ sung cho RLHF

Nhiều phương pháp mới ra đời nhằm khắc phục hạn chế của RLHF:

DPO (Direct Preference Optimization): bỏ bước train Reward Model riêng, tối ưu trực tiếp từ dữ liệu xếp hạng. Đơn giản hơn, ổn định hơn, và cho kết quả tương đương RLHF trong nhiều bài toán. Meta dùng DPO cho Llama 3.

RLAIF (RL from AI Feedback): thay con người bằng AI đánh giá. GPT-4 chấm điểm câu trả lời của mô hình đang train. Rẻ hơn RLHF và scale dễ hơn, nhưng chất lượng đánh giá phụ thuộc vào model chấm điểm.

Constitutional AI: Anthropic phát triển, kết hợp self-critique (mô hình tự đánh giá và sửa) với RL. Mô hình tạo câu trả lời, tự đánh giá theo “hiến pháp” (tập nguyên tắc), và tự sửa. Giảm phụ thuộc vào human feedback.

Mình thấy DPO đang trở thành xu hướng chính vì đơn giản và hiệu quả. Nhiều open-source model hiện nay dùng DPO thay vì RLHF truyền thống. Nhưng RLHF vẫn là baseline mạnh và được dùng rộng rãi nhất.

RLHF liên quan gì đến Generative AI mà bạn dùng hàng ngày?

Mỗi khi bạn dùng ChatGPT và thấy nó trả lời lịch sự, không bịa thông tin, và từ chối yêu cầu độc hại, đó là nhờ RLHF. Nếu không có RLHF, ChatGPT chỉ là một text generator thô: tạo ra văn bản đọc được nhưng không kiểm soát được chất lượng.

RLHF là cầu nối giữa AI tạo sinh (xem Generative AI Là Gì) và trải nghiệm người dùng tốt. Cơ sở kỹ thuật là Reinforcement Learning (xem Reinforcement Learning Là Gì), nhưng thay vì reward từ môi trường game, reward đến từ đánh giá con người.

Hiểu RLHF giúp bạn hiểu tại sao prompt engineering quan trọng: bạn đang tương tác với một mô hình đã được tinh chỉnh để ưu tiên trả lời hữu ích. Viết prompt rõ ràng, cụ thể, bạn sẽ nhận được câu trả lời tốt hơn vì mô hình được train để trả lời tốt nhất khi hiểu rõ yêu cầu.

ThienLv

Mình là Thien, người tạo ra blog này. Ban ngày làm marketing, ban đêm cày tiền online và chơi với AI. Blog này là nơi mình ghi lại những gì mình thử qua — tool nào xịn, chiến thuật nào chạy được, cái gì thất bại. Mình không giỏi nhất, nhưng mình thích chia sẻ thật. Chill với một ly cafe đá là lý tưởng nhất.

Xem tất cả bài viết →