Model Distillation hay chưng cất mô hình là kỹ thuật chuyển giao kiến thức từ mô hình lớn (teacher) sang mô hình nhỏ (student). Mình sẽ giải thích chi tiết cách nó hoạt động và tại sao đây là xu hướng quan trọng trong AI 2025-2026.
Distillation Là Gì?

Distillation (chưng cất mô hình) là kỹ thuật huấn luyện một mô hình nhỏ sao cho nó bắt chước hành xử của mô hình lớn hơn. Mô hình lớn gọi là teacher (giáo viên), mô hình nhỏ gọi là student (học sinh). Mục tiêu: student nhỏ gọn, chạy nhanh, rẻ hơn nhưng vẫn giữ được phần lớn khả năng của teacher.
Thuật ngữ này được Geoffrey Hinton và đồng nghiệp giới thiệu trong bài báo “Distilling the Knowledge in a Neural Network” năm 2015. Ý tưởng cốt lõi: thay vì train student trên dữ liệu gốc (như ảnh mèo/chó), ta cho student học luôn “cách suy nghĩ” của teacher thông qua soft labels — phân phối xác suất mà teacher đưa ra cho mỗi đầu vào.
Soft Labels Khác Gì Hard Labels?
Đây là phần quan trọng nhất của distillation. Khi bạn train AI phân loại ảnh, hard label chỉ nói “đây là con mèo” (1) hoặc “đây là con chó” (0). Trong khi đó, soft label từ teacher có thể nói “70% là mèo, 25% là chó, 5% là ô tô”.
Thông tin trong soft labels phong phú hơn rất nhiều. Teacher biết rằng con vật trong ảnh nhìn hơi giống chó — student học được nuances này thay vì chỉ nhớ kết quả cuối cùng. Quá trình transfer dùng thêm tham số temperature để làm mềm phân phối xác suất, giúp student “nhìn rõ” hơn các mối quan hệ giữa các lớp.
Ví Dụ Thực Tế Phổ Biến
Nhắc đến distillation thành công nhất, mình phải nói DeepSeek R1. Đội ngũ DeepSeek train R1 (mô hình reasoning lớn) bằng RL, sau đó distill xuống các mô hình nhỏ 1.5B đến 70B tham số. Kết quả: DeepSeek-R1-Distill-Qwen-7B đạt điểm số ngang ngửa GPT-4 ở nhiều benchmark toán học, nhưng chạy được trên GPU gia đình.
Một ví dụ khác: Llama 3.2 của Meta. Phiên bản 1B và 3B được distill từ Llama 3 lớn hơn, tối ưu chạy on-device trên điện thoại. Apple cũng dùng distillation cho Apple Intelligence — model chạy local trên iPhone nhưng được “truyền nghề” từ model lớn trên server.
Trong SEO và web, distillation giúp chạy AI inference trên server rẻ hơn. Thay vì gọi API GPT tốn tiền, bạn có thể distill một model nhỏ chuyên cho task cụ thể (phân loại sentiment, tóm tắt bài viết) và chạy trên VPS giá 5 USD/tháng.
Tại Sao Distillation Quan Trọng?
Ba lý do chính khiến distillation trở thành kỹ thuật không thể thiếu:
1. Giảm chi phí inference. Mô hình 70B tham số cần GPU A100 giá 4 USD/giờ. Sau distillation, mô hình 7B chạy trên RTX 4090 — card đồ họa gamer mua được. Chi phí giảm 10-20 lần.
2. Tăng tốc độ phản hồi. Mô hình nhỏ sinh token nhanh hơn đáng kể. Với chatbot phục vụ khách hàng, mỗi giây giảm thời gian chờ đều tăng tỷ lệ chuyển đổi. DeepSeek-R1-Distill sinh token nhanh gấp 5-7 lần bản gốc.
3. Chạy on-device. Điện thoại, laptop, IoT device không đủ RAM chứa model lớn. Distillation biến AI thành feature local — không cần internet, không lo rò rỉ dữ liệu. Đây là hướng đi của Apple, Google Gemini Nano, và Microsoft Phi.
Quy Trình Distillation Hoạt Động Thế Nào?
Bước 1: Cho teacher xử lý tập dữ liệu lớn, thu thập soft labels (output probabilities) cho mỗi mẫu.
Bước 2: Khởi tạo student — mô hình có kiến trúc nhỏ hơn, ít tham số hơn.
Bước 3: Train student sao cho output của nó giống output của teacher nhất. Hàm loss thường kết hợp hai phần: distillation loss (khác biệt giữa student và teacher trên soft labels) và task loss (khác biệt giữa student và hard labels thật).
Bước 4: Tinh chỉnh tham số temperature. Temperature cao làm soft labels “mềm” hơn, student học nhiều thông tin hơn. Temperature thấp làm output “sắc nét” hơn. Hinton đề xuất temperature = 2-4.
Bước 5: Đánh giá student trên test set. Nếu điểm số thấp hơn teacher quá nhiều, thử tăng kích thước student hoặc train thêm epochs.
Các Loại Distillation Phổ Biến
Response-based distillation: Student học output cuối cùng của teacher. Đơn giản nhất, phổ biến nhất. DeepSeek R1 distill dùng cách này.
Feature-based distillation: Student học cảđặc trưng (features) ở các layer trung gian của teacher. Khó hơn nhưng student giữ được nhiều thông tin hơn. Phù hợp khi student cùng kiến trúc nhưng nhỏ hơn.
Relation-based distillation: Student học mối quan hệ giữa các mẫu dữ liệu trong teacher. Phức tạp nhất, dùng cho task retrieval và ranking.
Nhược Điểm Cần Biết
Distillation không phải bánh mì kẹp. Có vài trade-off cần cân nhắc:
Mất mát chất lượng: Student không bao giờ bằng teacher. Mô hình 7B distill từ 70B thường mất 5-15% điểm số ở benchmark phức tạp. Đặc biệt yếu ở reasoning nhiều bước và creative writing.
Phụ thuộc chất lượng teacher: “Garbage in, garbage out”. Nếu teacher hallucinate, student học luôn lỗi đó. Nếu teacher yếu ở toán, student cũng yếu.
Chi phí train ban đầu: Cần chạy teacher trên toàn bộ dataset để thu thập soft labels. Với dataset 1 tỷ token và model 70B, bước này tốn hàng nghìn USD GPU.
Đóng băng kiến thức: Student bị “đóng dấu” tại thời điểm distill. Khi teacher cập nhật (fine-tune thêm), phải distill lại từ đầu.
Distillation vs Fine-tuning vs Quantization
Nhiều người nhầm ba khái niệm này. Phân biệt nhanh:
Distillation: Chuyển tri thức từ model lớn sang model nhỏ. Thay đổi kích thước mô hình.
Fine-tuning: Train tiếp mô hình trên dữ liệu chuyên ngành. Không thay đổi kích thước, chỉ thay đổi trọng số. Xem thêm bài Fine-tuning.
Quantization: Nén mô hình bằng cách giảm độ chính xác tham số (FP32 sang INT8). Cùng mô hình, chỉ giảm bộ nhớ. Xem thêm bài Quantization.
Ba kỹ thuật này kết hợp được. Bạn có thể distill 70B xuống 7B, sau đó quantize 7B xuống 4-bit để chạy trên laptop. Đây là pipeline phổ biến trong cộng đồng open-source AI.
Xu Hướng Distillation 2025-2026
Một vài xu hướng đáng chú ý mình quan sát được:
Reasoning distillation: Thay vì chỉ distill output cuối, các lab giờ distill luôn chain-of-thought của teacher. DeepSeek R1 là tiên phong — student học cách suy luận từng bước, không chỉ kết quả.
Cross-architecture distillation: Distill từ Transformer sang kiến trúc khác (Mamba, HRM, RWKV). Giúp kiến trúc mới nhanh chóng bắt kịp Transformer mà không cần train từ đầu.
Multimodal distillation: Teacher xử lý text + ảnh + audio, student chỉ xử lý text nhưng inherit được phần nào khả năng hiểu multimodal.
On-device AI: Apple, Google, Qualcomm đều đầu tư mạnh vào distillation cho edge device. Mục tiêu: AI chạy trên điện thoại không cần internet, độ trễ dưới 100ms.
Lời Kết
Distillation là cầu nối giữa AI quyền lực và AI phổ thông. Nhờ kỹ thuật này, mô hình chất lượng cao không còn là đặc quyền của các lab tỷ đô. Bất kỳ ai có GPU gia đình đều có thể chạy AI xịn — đó là điều không tưởng cách đây 3 năm.
Nếu bạn mới bắt đầu với AI, mình khuyến nghị thử chạy DeepSeek-R1-Distill-Qwen-7B trên máy cá nhân. Cài Ollama, gõ ollama run deepseek-r1:7b, bạn đã có AI reasoning chạy local miễn phí. Đó là sức mạnh của distillation.
Thuật ngữ liên quan nên đọc tiếp: LoRA (tinh chỉnh model nhỏ), Quantization (nén model), Inference (chạy AI), Reasoning Model (mô hình suy luận).
Thuật ngữ liên quan
- Adapter Layer (Lớp Adapter) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- Fine-tuning Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- FTP/SFTP (Giao Thức Truyền Tệp) Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- Knowledge Distillation vs Quantization Là Gì? Giải Thích Dễ Hiểu Cho Người Mới
- LoRA (Low-Rank Adaptation) Là Gì? Tinh Chỉnh AI Hiệu Quả Chi Phí Thấp
Xem toàn bộ thư viện thuật ngữ AI & SEO A-Z.
