OpenAI Jalapeño Benchmark Đầu Tiên: Chip Tự Phát Triển Vượt Nvidia Blackwell Về Hiệu Suất Trên Mỗi Watt

Câu trả lời nhanh
OpenAI công bố benchmark đầu tiên của chip inference Jalapeño tại Hot Chips 25/8: trên bài test InferenceX của SemiAnalysis, Jalapeño đạt nhiều token hơn cho mỗi user và throughput cao hơn trên mỗi kilowatt so với Nvidia Blackwell. Chip do OpenAI phát triển cùng Broadcom, tối ưu riêng pha prefill và communication, giữ KV cache tại chỗ. Triển khai nhỏ cuối 2026, quy mô lớn 2027.

Tại hội nghị Hot Chips ngày 25/8, OpenAI lần đầu công bố benchmark của chip inference tự phát triển mang tên Jalapeño. Trên bài test InferenceX của SemiAnalysis, Jalapeño ghi nhận cả số token trên mỗi user lẫn throughput trên mỗi kilowatt đều cao hơn các processor inference tốt nhất hiện nay, trong đó có hệ thống Nvidia Blackwell. Richard Ho, Giám đốc hardware của OpenAI, gọi đây là “một bước tiến hiệu năng rất, rất đáng kể”.

Mình theo dõi chuyện chip AI riêng của OpenAI từ lúc nó chỉ là tin đồn, và đây là lần đầu tiên có số liệu thật để soi thay cho lời hứa. Bài này mình tóm tắt những gì OpenAI tiết lộ, vì sao kiến trúc của Jalapeño lại nhanh, và điều đó có ảnh hưởng gì đến túi tiền của dân dùng AI API.

Jalapeño là gì và benchmark nói gì?

Chip inference Jalapeño do OpenAI tự phát triển

Jalapeño là chip inference do OpenAI phát triển cùng Broadcom, công bố lần đầu vào tháng 10 năm trước, với chính các model AI của OpenAI tham gia hỗ trợ quá trình thiết kế. Lần này OpenAI đưa kết quả đo trên InferenceX của SemiAnalysis: Jalapeño đạt nhiều token hơn cho mỗi người dùng và throughput cao hơn trên mỗi kilowatt so với các processor inference hàng đầu hiện có trên thị trường.

Điểm đáng chú ý nhất: đối thủ so sánh chính là hệ thống Nvidia Blackwell. Tức là OpenAI đang nói thẳng vào mặt Nvidia, nhà cung cấp GPU đang gánh gần như toàn bộ hạ tầng AI của họ. Hiệu năng trên mỗi watt là chỉ số đắt giá nhất trong ngành data center ngày nay, vì điện mới là thứ đang bóp cổ chi phí AI, không phải silicon.

Vì sao Jalapeño nhanh hơn GPU thông thường?

Khác với GPU đa năng, Jalapeño được thiết kế full-stack: model, chip, bộ nhớ và network được tối ưu cùng nhau theo từng thế hệ. Nhờ vậy OpenAI xử lý được những điểm nghẽn kinh điển của inference, đặc biệt là hai pha prefill và communication vốn thường ăn mất phần lớn thời gian phản hồi.

Cách làm cụ thể là giảm tối đa di chuyển dữ liệu. Trạng thái model, kể cả KV cache dùng khi sinh câu trả lời, được giữ cố định tại chỗ thay vì di chuyển qua lại giữa các node. Hệ thống chỉ kích hoạt đúng tổ hợp compute, memory và network cần thiết cho từng pha inference. Kết quả: độ trễ thấp mà vẫn phục vụ được lượng user khủng. Nếu bạn từng đọc bài về cuộc chia đôi prefill vs decode của Etched, đây là cùng một cuộc chơi nhưng OpenAI chơi từ trong ra.

Nvidia có nên lo chưa?

Chưa vội. Chính Richard Ho cũng thừa nhận Jalapeño sẽ chỉ triển khai “volumes rất nhỏ” vào cuối 2026, còn triển khai quy mô lớn phải chờ 2027. Đến lúc đó Nvidia có thể đã sang thế hệ sau Blackwell, tức là mốc so sánh hôm nay có thể đã lỗi thời.

Nhưng xu hướng thì đã rõ: Anthropic tự làm hạ tầng Theseus, Google có TPU, Meta có MTIA, và giờ OpenAI có Jalapeño. Mỗi AI lab lớn đều đang cố thoát khỏi phụ thuộc GPU Nvidia. Với người dùng API, đây là tin tốt — cạnh tranh hạ tầng đồng nghĩa chi phí inference mỗi token còn dư địa giảm tiếp, đúng như cuộc chiến giá API đang diễn ra mấy tuần qua.

Người dùng thường cần quan tâm gì?

Nếu bạn chỉ dùng ChatGPT hay Claude qua app thì gần như không cần để ý. Còn nếu bạn build sản phẩm trên AI API, chạy agent với context dài, hay lo về chi phí token hàng tháng, thì đây là tín hiệu nên theo dõi sát. Prefill nhanh hơn nghĩa là những tác vụ agent nhiều bước, nhiều lượt gọi liên tiếp sẽ rẻ và nhanh rõ rệt vào 2027.

Mình nghĩ mối quan hệ OpenAI – Nvidia đang bước vào giai đoạn “làm ăn với nhau nhưng chuẩn bị đường lui cho cả hai bên”. Nvidia vừa cắt bảo lãnh đầu tư OpenAI xuống còn 120 tỷ USD, và giờ Jalapeño lập kỷ lục hiệu năng. Cạnh tranh khốc liệt ở tầng hạ tầng luôn là điều tốt nhất có thể xảy ra cho dev và end-user.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *