NVIDIA Nemotron 3.5 Lightning và Switchyard: Combo Open-Source Giảm 67% Chi Phí AI Agent

NVIDIA Nemotron 3.5 Lightning và Switchyard open source
Câu trả lời nhanh
NVIDIA vừa ra mắt Nemotron 3.5 Lightning, model open-weight 30B parameter tối ưu cho AI agent, đi kèm NeMo Switchyard, thư viện router open-source tự chuyển model giữa chừng tác vụ. Combo này giữ nguyên chất lượng frontier nhưng giảm chi phí xuống còn một phần ba so với chạy Claude Opus 4.8 đơn lẻ.

NVIDIA vừa tung ra cú đôi đánh thẳng vào vấn đề đau đầu nhất của bất kỳ ai chạy AI agent trong production: chi phí. Nemotron 3.5 Lightning, model open-weight 30 tỷ parameter tối ưu cho agent, đi kèm NeMo Switchyard, thư viện router mã nguồn mở tự đổi model giữa chừng tác vụ. Theo NVIDIA, combo này giữ nguyên chất lượng frontier nhưng cắt chi phí xuống còn một phần ba so với chạy Claude Opus 4.8 đơn lẻ.

Mình đã theo dõi làn sóng open-weight suốt từ mùa xuân nay, từ Kimi K3 của Moonshot đến Qwen3.8-Max của Alibaba, rồi Muse Glimmer của Meta. Nhưng NVIDIA làm khác ở một điểm: họ không chỉ tung model rồi bảo “tự xử”, họ tung cả router để tự quyết định khi nào dùng model rẻ, khi nào gọi model đắt. Đó là sự khác biệt lớn.

Nemotron 3.5 Lightning và Switchyard là gì?

NVIDIA Nemotron 3.5 Lightning và Switchyard open source

Nemotron 3.5 Lightning là model open-weight 30 tỷ parameter, kiến trúc hybrid Mamba-Transformer kết hợp latent mixture-of-experts, được tối ưu cho các tác vụ agent khối lượng lớn như code review, trả lời câu hỏi billing, theo dõi security alert. NeMo Switchyard là thư viện open-source điều phối việc route từng bước trong workflow agent đến model phù hợp nhất, dựa trên trạng thái thực tế của agent tại thời điểm đó.

Tại sao việc route model động quan trọng với AI agent?

Vấn đề mà bất kỳ ai chạy AI agent 24/7 đều biết: gửi mọi thứ cho frontier model thì hóa đơn bay nhanh hơn tốc độ generate token. Nhưng tự build logic routing thì lại trở thành một project engineering riêng, phải maintain mỗi khi workflow thay đổi. Switchyard giải quyết bằng cách đánh giá trạng thái agent theo thời gian thực, khi tool trả kết quả, khi lỗi xuất hiện, khi một bước hóa ra đơn giản hơn dự kiến, và tự động chuyển sang model phù hợp.

Kari Briski, VP Generative AI tại NVIDIA, giải thích trong buổi briefing rằng Switchyard hỗ trợ nhiều chiến lược routing: agent state route, classifier route, và kể cả dự đoán độ verbose của model để steer công việc sang option rẻ hơn trước khi call. Nghĩa là cost đi vào quyết định routing trực tiếp, không phải afterthought.

Switchyard so với các giải pháp routing khác ra sao?

Switchyard không phải đầu tiên trong game routing. Not Diamond đã powering OpenRouter Auto mode, RouteLLM từ UC Berkeley và LMSYS cũng là framework open-source phổ biến. Nhưng khác biệt lớn nhất: không đối thủ nào ship kèm model riêng. NVIDIA sở hữu cả hai mặt của quyết định, model và router, dưới cùng một license open-source. Đó là thứ mà competitor chỉ có model hoặc chỉ có router không thể match.

Danh sách partner của Switchyard chia làm hai nhóm: agent framework tích hợp trực tiếp gồm Cognition, LangChain, Nous Research; và LLM gateway đã build Switchyard vào sản phẩm gồm Kong, LiteLLM, OpenRouter. Kong ship Switchyard native trong Kong AI Gateway.

Số liệu thực tế từ chín công ty test Switchyard

NVIDIA chia sẻ kết quả từ chín công ty thử nghiệm Switchyard, và vài con số đáng chú ý:

  • LangChain: giảm 74% chi phí trên 145 multi-turn Deep Agents tasks, chỉ route 7% call đến frontier model, đánh đổi 6% accuracy.
  • Ramp: match performance frontier model trên Ramp SWE-Bench, giảm 58% chi phí và 33% runtime.
  • Cognition: tích hợp Switchyard staged router vào Devin Desktop, near-frontier performance trên FrontierCode Main, giảm 28% mean cost so với route tất cả vào một frontier model.

Theo dữ liệu PinchBench mà NVIDIA cung cấp, Lightning match độ chính xác của Qwen3.6-35B nhưng nhanh hơn khoảng 30%, và vượt Gemma 4 26B ở mức hoàn thành tương đương thời gian. Trên Artificial Analysis Intelligence Index, Lightning đạt 24 điểm, ngang gpt-oss-120b nhưng đứng sau Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku và Mistral Medium 3.5 ở mức 30. NVIDIA không claim Lightning là leader general-intelligence trong phân khúc, và điều đó thành thật.

Có nên dùng Nemotron 3.5 Lightning ngay không?

Nếu bạn đang chạy AI agent production với khối lượng call lớn, câu trả lời là nên test ngay. Switchyard tích hợp được với OpenRouter, LiteLLM, Kong, nên bạn không cần refactor toàn bộ stack. Bắt đầu bằng cách route một phần traffic qua Lightning cho các task đơn giản, giữ frontier model cho task phức tạp, rồi đo cost và quality.

Nếu bạn chỉ cần chatbot đơn thuần, Lightning không phải chọn chọn hàng đầu. Nhưng nếu agent của bạn gọi tool, chạy multi-step workflow, và hóa đơn API đang là vấn đề, thì combo Lightning + Switchyard là một trong những giải pháp open-source đáng giá nhất mình thấy trong tháng này.

Open-weight đang từ lợi thế trở thành mặc định

Điều mình thấy rõ ràng nhất từ vụ release này: open-weight đã chuyển từ differentiator thành table stakes trong vòng vài tháng. Alibaba, Moonshot, Zhipu, DeepSeek tung model liên tục từ mùa xuân. Meta thêm áp lực với Muse Glimmer. Giờ NVIDIA cũng tham gia. Cạnh tranh không còn ở việc “có open hay không”, mà ở việc ai cung cấp solution end-to-end tốt nhất cho bài toán cost của enterprise.

NVIDIA đặt cược rằng open source ở cả model layer lẫn routing layer mới là thứ thực sự move cost needle trên agentic AI. Không phải một model rẻ hơn, không phải một router thông minh hơn gắn vào stack người khác. Mình nghĩ đây là hướng đúng, và sẽ không ngạc nhiên nếu sau này mọi AI lab đều phải ship router riêng thay vì để khách tự mò.

Nếu muốn tìm hiểu thêm về open-weight landscape, bạn có thể đọc bài LongCat-2.0 của Meituan hoặc Kimi K3 của Moonshot để thấy bức tranh toàn cảnh.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *