SFT (Supervised Fine-Tuning) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới

Câu trả lời nhanh
SFT (Supervised Fine-Tuning) là giai đoạn huấn luyện AI bằng dữ liệu hỏi-đáp mẫu do con người soạn, dạy mô hình cách làm theo chỉ dẫn và trình bày câu trả lời chuẩn mực. Đây là bước biến mô hình pretrain thô thành chatbot biết nghe lời, thường đi trước RLHF trong pipeline alignment.

SFT (Supervised Fine-Tuning) Là Gì?

SFT (Supervised Fine-Tuning) là giai đoạn huấn luyện mô hình ngôn ngữ bằng dữ liệu có “đáp án mẫu” — tức là các cặp hướng dẫn và câu trả lời đúng do con người soạn sẵn. Mô hình học cách bắt chước câu trả lời này để biết cách làm theo chỉ dẫn, thay vì chỉ biết đoán từ tiếp theo như lúc mới pretrain xong.

Nói đơn giản: nếu pretraining là đi học chữ, thì SFT là lớp học thực hành có giáo viên chữa bài từng câu một.

Vì Sao Cần SFT Sau Pretraining?

Một mô hình chỉ trải qua pretraining về bản chất là một “cỗ máy hoàn thành văn bản”. Nó giỏi tiếp tục câu chữ nhưng không hiểu mình đang được hỏi và cần trả lời thế nào.

Hỏi nó “Thủ đô Việt Nam là gì?” nó có thể trả “…của nước CHXHCN Việt Nam là Hà Nội” — vì trên mạng người ta thường viết câu kiểu đó. Không phải формат trả lời mà bạn muốn.

SFT chính là bước biến cỗ máy hoàn thành văn bản thành trợ lý hội thoại. Bằng cách cho mô hình học hàng trăm nghìn ví dụ hỏi-đáp chuẩn mực, nó dần “hiểu” vai trò của mình là trả lời trực tiếp, có cấu trúc, đúng trọng tâm.

SFT Hoạt Động Như Thế Nào?

Quy trình khá đơn giản:

1. Người ta thu thập hoặc biên soạn bộ dữ liệu gồm các cặp (instruction, response) chất lượng cao — thường do annotator được đào tạo viết ra.

2. Toàn bộ dữ liệu này được đưa vào mô hình pretrain sẵn, và mô hình được huấn luyện tiếp với hàm loss chỉ tính trên phần câu trả lời.

3. Sau vài epoch, mô hình học được “phong cách” trả lời của dữ liệu mẫu.

Điểm thú vị: SFT không dạy mô hình kiến thức mới nhiều như mọi người tưởng. Kiến thức chủ yếu có sẵn từ pretraining rồi. SFT chủ yếu dạy mô hình cách trình bàycách làm theo chỉ dẫn.

SFT Khác RLHF Ở Điểm Nào?

Đây là câu hỏi nhiều người hay nhầm. Hai cái không thay thế nhau mà nối tiếp nhau:

SFT học từ đáp án mẫu cố định. Mô hình chỉ việc bắt chước càng giống càng tốt. Giống như học sinh chép bài mẫu.

RLHF (học tăng cường từ phản hồi con người) thì không có đáp án mẫu. Thay vào đó con người chấm điểm các câu trả lời khác nhau của mô hình, và mô hình học cách sinh ra câu được điểm cao. Giống như học sinh tự viết rồi được thầy chấm.

Hầu hết chatbot hiện đại đi theo pipeline: pretraining → SFT → RLHF (hoặc DPO). SFT đặt nền, RLHF tinh chỉnh cuối cùng.

Theo quan điểm cá nhân của mình, SFT quyết định “tính cách” của mô hình nhiều hơn người ta nghĩ. Cùng một base model, SFT với bộ dữ liệu tiếng Việt tốt sẽ ra chatbot tiếng Việt tự nhiên; SFT bằng dữ liệu mediocre thì dù RLHF giỏi mấy cũng khó cứu.

Instruction Tuning Và SFT Có Phải Là Một?

Gần như là một. Instruction tuning là một dạng SFT mà dữ liệu tập trung vào các hướng dẫn đa dạng (“tóm tắt đoạn này”, “viết email”, “dịch câu này”). Ngày nay hai thuật ngữ thường được dùng thay thế nhau trong ngữ cảnh chatbot. Các bài báo lớn như InstructGPT mô tả SFT chính là giai đoạn đầu của pipeline alignment.

Ứng Dụng Thực Tế: Fine-Tune Mô Hình Cho Riêng Bạn

Nếu bạn đang chạy dự án AI thực tế, SFT là kỹ thuật dễ tiếp cận nhất để custom mô hình:

– Muốn chatbot trả lời theo văn phong thương hiệu? Soạn vài nghìn cặp hỏi-đáp mẫu rồi SFT.

– Muốn mô hình output JSON theo schema cố định? SFT với dữ liệu đúng schema đó.

– Ngân sách ít thì dùng LoRA hoặc QLoRA — chỉ huấn luyện thêm một phần nhỏ trọng số, chạy được trên GPU gaming.

Mình từng thấy nhiều đội sai lầm ở bước chuẩn bị dữ liệu SFT: lấy 500 cặp hỏi-đáp viết vội rồi thắc mắc vì sao mô hình vẫn ngu. Kinh nghiệm chung từ cộng đồng open-source: vài nghìn ví dụ chất lượng cao đánh bại vài trăm nghìn ví dụ tự sinh kiểu spam.

Hạn Chế Của SFT Cần Biết

SFT không phải viên đạn bạc:

Chỉ tốt ngang dữ liệu mẫu. Dữ liệu sai, mô hình sai theo. Dữ liệu thiếu đa dạng, mô hình sẽ “cứng” khi gặp tình huống mới.

Dễ catastrophic forgetting. Huấn luyện quá mạnh trên dữ liệu hẹp, mô hình quên kiến thức chung đã học — đây chính là lý do kỹ thuật weight freezing và learning rate nhỏ ra đời.

Không dạy được suy luận sâu. SFT dạy mô phỏng hình thức câu trả lời, không dạy cách tư duy. Đó là lý do các reasoning model hiện đại cần thêm giai đoạn RL với reward dựa trên tính đúng đắn.

Kết Luận

SFT là bước chuyển đổi quyết định biến mô hình ngôn ngữ thô thành trợ lý AI biết nghe lời. Hiểu SFT giúp bạn hiểu vì sao hai mô hình cùng kiến thức lại chat khác nhau một trời một vực — và nếu muốn fine-tune mô hình riêng cho dự án của mình, SFT luôn là điểm khởi đầu rẻ nhất, dễ nhất.

Nếu bạn muốn đào sâu tiếp, hãy đọc thêm về Instruction Tuning và RLHF vs DPO trên blog của mình — ba khái niệm này nối với nhau thành bức tranh hoàn chỉnh về cách một chatbot được “nuôi lớn”.

Thuật ngữ liên quan

Xem toàn bộ thư viện thuật ngữ AI & SEO A-Z.

ThienLv

Mình là Thien, người tạo ra blog này. Ban ngày làm marketing, ban đêm cày tiền online và chơi với AI. Blog này là nơi mình ghi lại những gì mình thử qua — tool nào xịn, chiến thuật nào chạy được, cái gì thất bại. Mình không giỏi nhất, nhưng mình thích chia sẻ thật. Chill với một ly cafe đá là lý tưởng nhất.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *