NVIDIA TwoTower: AI Sinh Văn Bản Nhanh 2.42x, Giữ 98.7% Chất Lượng Bằng Diffusion

Câu trả lời nhanh
NVIDIA phát hành Nemotron-Labs-TwoTower, model diffusion language đầu tiên chạy trên backbone Nemotron-3-Nano-30B-A3B. Thay vì generate text từng token như LLM thông thường, TwoTower sinh nhiều token song song rồi tinh chỉnh, đạt throughput gấp 2.42 lần trong khi giữ 98.7% chất lượng. Open weight, cho phép commercial use, phù hợp cho batch generation và synthetic data.

NVIDIA vừa thả một quả bom vào thế giới AI text generation mà ít ai để ý. Trong khi tất cả đều mắt chữ O miệng chữ A với Gemini 3.5 Pro hay GPT-5.6, team NVIDIA lặng lẽ phát hành Nemotron-Labs-TwoTower — model ngôn ngữ diffusion đầu tiên đạt throughput gấp 2.42 lần so với autoregressive truyền thống, mà vẫn giữ 98.7% chất lượng. Mình nghĩ đây là một trong những breakthrough bị underestimate nhất tháng 7/2026.

NVIDIA TwoTower Là Gì Và Vì Nó Khác Gì Với LLM Thường?

TwoTower là model ngôn ngữ sử dụng phương pháp diffusion để tạo văn bản, thay vì generate token theo tuyến tính như các LLM hiện nay. Nói cách khác, thay vì viết từng chữ một, TwoTower viết nhiều chữ cùng lúc rồi tinh chỉnh lại. Kết quả: tốc độ sinh text nhanh hơn rất nhiều.

Điểm khác biệt lớn nhất nằm ở kiến trúc “two tower”. Thay vì dùng một mạng đơn để làm hai việc (represent clean tokens và denoise corrupted tokens), TwoTower tách thành hai tháp độc lập. Tháp AR context tính toán ngữ cảnh, tháp denoiser chuẩn hóa các token bị nhiễu. Hai tháp kết nối layer-by-layer bằng cross-attention.

Tại Sao Diffusion Language Model Lại Là Cuộc Cách Mạng?

Vấn đề lớn nhất của tất cả LLM hiện nay — từ GPT-5.6 đến Claude Sonnet 5 đến Gemini 3.5 Pro — là chúng đều generate text lần lượt từng token. Đây là quá trình tuyến tính (sequential). Bạn không thể sinh token thứ 100 cho đến khi token thứ 99 được xác nhận. Điều này giới hạn throughput ở mức cơ bản.

Diffusion language model giải quyết vấn đề này bằng cách sinh nhiều token song song trong từng block, rồi dần dần chỉnh sửa chúng qua nhiều bước. Giống như cách Stable Diffusion hay DALL-E tạo ảnh — bắt đầu từ nhiễu rồi dần dẫn dắt đến chi tiết. TwoTower áp dụng cùng ý tưởng cho text.

Benchmark Thực Tế: 2.42x Tốc Độ, 98.7% Chất Lượng

NVIDIA đánh giá TwoTower trên Nemotron-3-Nano-30B-A3B backbone, chạy BF16 trên 2x H100 GPU. Kết quả khá ấn tượng:

  • MMLU: 78.56% (AR) so với 78.24% (diffusion) — gần như không khác biệt
  • ARC-Challenge: 91.72% so với 92.66% — diffusion còn cao hơn
  • GSM8K: 92.49% so với 90.14% — giảm nhẹ
  • HumanEval: 79.27% so với 75.58% — giảm ở code
  • Throughput: nhanh hơn 2.42 lần với default config (gamma=0.8, S=16)

Như thấy, kiến thức chung (MMLU, ARC) gần như giữ nguyên. Code và math có giảm một chút. Commonsense và multilingual bằng hoặc nhỉnh hơn. Đây là trade-off rất đáng giá.

TwoTower So Với GPT-5.6 So Với Claude Sonnet 5: Khác Biết Ở Đâu?

Đây là so sánh mà nhiều người nhầm nhất. TwoTower không phải model để thay thế GPT-5.6 hay Claude Sonnet 5. Nó là một phương pháp generation mới, áp dụng được lên bất kỳ autoregressive backbone nào.

GPT-5.6 và Claude Sonnet 5 vẫn generate text theo kiểu cũ — từng token một lần. Chúng tốt ở reasoning, coding, agentic work. TwoTower tốt ở batch generation, synthetic data creation, và các ứng dụng cần throughput cao. Hai thứ hoạt ở các tầng khác nhau của stack.

Điều thú vị nhất: TwoTower release checkpoint bao gồm cả 3 mode — full diffusion, mock-AR, và AR thuần. Team nào cũng có thể chuyển giữa diffusion và AR trên cùng một checkpoint mà không cần tải model riêng.

Cấu Hình Kỹ Thuật: Cần 2 GPU, 60B Parameters

Đây là phần cần lưu ý. Full two-tower diffusion cần 2 GPU riêng biệt — tháp context trên GPU 0, tháp denoiser trên GPU 1. Mỗi GPU cần khoảng 59GB BF16. Nghĩa là bạn cần tối thiểu 2x H100 80GB để chạy full diffusion.

Tổng parameters khoảng 60B (cả hai tháp), nhưng active parameters per token chỉ khoảng 3B mỗi tháp. Backbone là Nemotron-3-Nano-30B-A3B — hybrid model kết hợp Mamba-2, self-attention, và mixture-of-experts layers. MoE có 128 routable experts, active 6, cộng 2 shared experts.

Ai Nên Dùng NVIDIA TwoTower Ngay Bây Giờ?

Mình thấy ba use case rõ ràng nhất:

1. Synthetic data generation: Nếu bạn đang generate hàng triệu mẫu text để train model khác, TwoTower giảm cost đáng kể. Trade 1.3% quality lấy 2.42x speed là deal rất ngon.

2. Batch inference: Các service cần generate lượng lớn text trong thời gian ngắn — content creation, translation batch, summarization — sẽ thấy throughput tăng ngay lập tức.

3. Research và experiment: Với open weight và full code, researcher có thể tinh chỉnh trade-off giữa quality và throughput bằng cách thay gamma. Gamma cao hơn giữ quality tốt hơn, gamma thấp hơn chạy nhanh hơn.

Open Weight Và License: Dùng Cho Thương Mại Được Không?

Được. TwoTower phát hành dưới NVIDIA Nemotron Open Model License — cho phép commercial use. Code và weights đều có sẵn trên HuggingFace. Đây là tin tốt cho startups và SMBs muốn tự host model mà không phải trả API fee cho OpenAI hay Anthropic.

Điều cần lưu ý: checkpoint hiện tại là base model, chưa qua instruction tuning hay alignment. Nghĩa là TwoTower ngay bây giờ phù hợp hơn cho inference tasks, không phải cho conversation hay chatbot. NVIDIA sẽ release instruction-tuned version sau.

Những Điểm Yếu Của TwoTower

Không phải mọi thứ đều hoa hồng. Mình thấy có ba vấn đề thực tế:

1. Hardware requirement: Cần 2 GPU riêng — nhiều team sẽ không có setup này. So với Claude Sonnet 5 chạy trên 1 GPU 80GB, TwoTower khó hơn để deploy.

2. Code và math giảm: HumanEval giảm từ 79.27% xuống 75.58%. Với coding tasks, vẫn chưa thể thay AR model.

3. Chưa có instruction tuning: Base model thôi, chưa qua RLHF hay DPO. Chat experience sẽ không bằng Claude hay GPT.

Tương Lai Của Diffusion Language Model

Mình tin rằng TwoTower là dấu hiệu của một sự chuyển mình. Autoregressive generation đã làm tốt nhiều năm, nhưng nó có giới hạn vật lý — bạn không thể sinh text nhanh hơn tốc độ của một token mỗi step.

Diffusion language modeling mở ra khả năng sinh text theo block, tự động tăng throughput mà không cần đợi hardware nhanh hơn. Nếu NVIDIA apply method này lên Nemotron-4 hay các model lớn hơn, chúng ta có thể thấy throughput 5-10x trong tương lai gần.

Với Vietnamese tech community, đây là cơ hội để nghiên cứu và ứng dụng một approach hoàn toàn mới. Open weight nghĩa là bạn có thể download, chạy local, và tinh chỉnh ngay bây giờ.

Kết Luận: Có Nên Dùng TwoTower Không?

Nếu bạn làm batch text generation và cần throughput cao — đáp. TwoTower là tín hiệu cho thấy NVIDIA đang đi đầu cuộc đua với OpenAI và Anthropic, không chỉ ở model quality mà còn ở phương pháp generation. Cuộc đua AI không còn chỉ là “ai tốt hơn” mà còn là “ai nhanh hơn”.

Nếu bạn cần conversation, coding, hay agentic work — đừng chuyển. Claude Sonnet 5 với giá $2/$10 per million tokens vẫn là deal tốt nhất bây giờ. TwoTower là bổ sung, không phải thay thế.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *