Black Forest Labs vừa ra mắt FLUX 3, model AI đầu tiên trên thị trường tạo được cả image, video 20 giây kèm audio từ một prompt duy nhất. Không phải ghép vài model lại với nhau, mà là một kiến trúc duy nhất train chung cho tất cả các modalities.
Mình đã theo dõi Black Forest Labs từ hồi FLUX 1 chỉ làm image generation. Đến giờ, họ nhảy thẳng lên bàn lớn với Google Veo 3.1, Runway Gen-4.5 và Gemini Omni Flash. Bài này mình sẽ so sánh thực tế để bạn biết FLUX 3 có thực sự đáng quan tâm hay chỉ là hype.
FLUX 3 là gì và tại sao nó khác?

FLUX 3 là model multimodal frontier của Black Forest Labs (BFL), công ty AI có trụ sở tại Freiburg, Đức. Thay vì build riêng một model tạo ảnh, một model tạo video, một model tạo audio rồi ghép lại, BFL train chung tất cả trên cùng một kiến trúc dựa trên kỹ thuật Self-Flow mà họ công bố từ tháng 3/2026.
Điều này có nghĩa là model hiểu bản chất của hình ảnh, chuyển động và âm thanh trong cùng một không gian biểu diễn. Khi bạn yêu cầu “một con chó chạy dưới mưa kèm tiếng sấm”, FLUX 3 không cần gọi ba API khác nhau. Nó sinh ra tất cả từ một lần forward pass.
BFL gọi tầm nhìn này là “visual intelligence” — không chỉ tạo nội dung mà còn mở rộng sang simulation, computer use và robotics. FLUX 3 Action, một trong bốn phiên bản, chính là bước đầu tiên hướng tới ứng dụng vật lý.
Bốn phiên bản FLUX 3: Bạn nên quan tâm phiên bản nào?
BFL chia FLUX 3 thành bốn dòng sản phẩm. FLUX 3 Video hỗ trợ tạo video lên đến 20 giây kèm audio native, đây là model đang ở giai đoạn Early Access. FLUX 3 Image tập trung vào tạo ảnh tĩnh, sẽ rollout trong vài tuần tới. FLUX 3 Action nhắm đến computer use và robotics, cũng đang ở Early Access. Cuối cùng, FLUX 3 Dev sẽ là phiên bản open-weight, dự kiến ra mắt cuối năm nay.
Đối với majority reader, FLUX 3 Video và FLUX 3 Image là hai phiên bản đáng chú ý nhất. Nếu bạn là developer muốn self-host, FLUX 3 Dev mới là đích đến, nhưng phải chờ thêm vài tháng.
FLUX 3 so với Google Veo 3.1: Ai thắng?
Theo benchmark của chính BFL, FLUX 3 thắng Luma Ray 3.2 trong 93% so sánh, Runway Gen-4.5 trong 77%, và Grok Imagine Video trong 69%. Những con số này ấn tượng nhưng cần lưu ý: đây là preliminary evaluation trên pre-release checkpoint, không phải model cuối cùng.
So sánh thú vị nhất là với Gemini Omni Flash của Google: FLUX 3 chỉ thắng 52%, gần như là coin flip. Và Google có lợi thế lớn về giá: Gemini Omni Flash tính 1 USD cho 10 giây video 720p, trong khi BFL chưa công bố giá FLUX 3. Google Veo 3.1 tính 4 USD cho 10 giây 720p, Veo 3.1 Fast là 1 USD, còn Veo 3.1 Lite chỉ 0.50 USD.
Tóm lại, FLUX 3 ngang ngửa Gemini Omni Flash về chất lượng nhưng chưa rõ giá. Nếu BFL định giá cạnh tranh, đây sẽ là đối thủ đáng gờm. Nếu không, Google vẫn là lựa chọn an toàn cho enterprise.
Tại sao FLUX 3 chưa có open weights là vấn đề?
Đây là điểm mình thấy thất vọng nhất. FLUX từ trước đến nay nổi bật nhờ open weights. Cộng đồng developer quen với việc tải FLUX Dev về chạy local, tinh chỉnh, build product. Nhưng FLUX 3 ra mắt không kèm weights tải xuống.
BFL cam kết FLUX 3 Dev sẽ có open-weight “cuối năm nay”, bao gồm multimodal backbone cho video, audio, image và action prediction. Nhưng trong bối cảnh DeepSeek, Qwen, Kimi K3 từ Trung Quốc đang thống trị open-weight AI, việc một lab Tây Âu ra mắt flagship mà không có weights ngay lập tức tạo cảm giác hụt hẫng.
Poolside mới ra Laguna S 2.1 hôm qua, model open-weight 118 tỷ parameter đánh bại DeepSeek-V4-Pro-Max gấp 10 lần kích thước. Họ mở weights ngay ngày đầu. BFL nên học Poolside về chiến lược này.
FLUX 3 ảnh hưởng thế nào đến creator và marketer?
Nếu bạn đang làm content marketing, video production hoặc social media, FLUX 3 mở ra khả năng tạo video 20 giây kèm audio từ text prompt. Đủ dài cho một TikTok, Instagram Reel hoặc YouTube Short. Không cần quay, không cần dựng, không cần thu âm riêng.
Nhưng hãy cẩn thận. FLUX 3 đang ở Early Access, bạn phải apply và được BFL duyệt. Chưa có API public, chưa có pricing, chưa có SLA. Nếu bạn cần giải pháp production-ready ngay, Runway Gen-4.5 hoặc Google Veo 3.1 vẫn là lựa chọn an toàn hơn.
Đối với những ai muốn thử nghiệm, mình khuyên nên apply Early Access ngay. Kinh nghiệm cho thấy các model ở giai đoạn này thường có chất lượng tốt nhất trước khi bị optimize cho cost khi GA.
Mình đánh giá FLUX 3 thế nào?
FLUX 3 là một step function jump về capability. Một model duy nhất làm được image, video, audio là thành tựu kỹ thuật đáng nể. Vị thế “visual intelligence” mở rộng sang robotics cũng là vision đúng hướng.
Nhưng BFL đang mắc lỗi điển hình của lab châu Âu: ra mắt sản phẩm impressive nhưng thiếu pricing, thiếu benchmark độc lập, thiếu open weights. Trong khi Google, OpenAI, Anthropic đều đã có ecosystem mature, BFL cần move faster trên commercial side.
Dù vậy, mình sẽ theo dõi sát sao FLUX 3 Dev khi ra mắt. Nếu open-weight version giữ được 80% capability của flagship, đây sẽ là game changer cho developer tự host. Còn bây giờ, hãy apply Early Access, thử nghiệm, nhưng đừng base production pipeline lên nó chưa.
Bạn nghĩ sao về FLUX 3? Bạn sẽ dùng model này cho dự án gì? Cho mình biết ở phần bình luận bên dưới.