
Tóm lại
- Black Forest Labs đã ra mắt FLUX 3 ở chế độ truy cập sớm, mô hình đầu tiên tạo video, tạo ra các clip dài tới 20 giây với âm thanh được đồng bộ hóa.
- Xương sống tương tự cung cấp năng lượng cho FLUX-mimic, một mẫu robot được chế tạo bằng robot bắt chước mà Audi đang thử nghiệm trên dây chuyền sản xuất của mình.
- Chỉ có phiên bản “Dev” trọng lượng mở được lên kế hoạch ra mắt vào cuối năm 2026; Hiện tại, Video và Hành động vẫn ở phía sau API và quyền truy cập của đối tác, còn Hình ảnh sẽ tiếp theo trong những tuần tới.
Phòng thí nghiệm Rừng Đen được phát hành THÔNG 3 vào thứ Năm và lần đầu tiên, mẫu máy hàng đầu của công ty tạo ra video thay vì chỉ hình ảnh tĩnh. Phòng thí nghiệm AI của Đức, nổi tiếng với dòng máy tạo hình ảnh FLUX, đã đào tạo hệ thống mới về hình ảnh, video và âm thanh cùng một lúc, bên trong một hệ thống dùng chung.
Đó được gọi là đa phương thức: một mô hình học nhiều loại thông tin cùng nhau thay vì các công cụ riêng biệt được gắn cạnh nhau.
Phần video là tính năng tiêu đề. FLUX 3 tạo ra các đoạn clip dài tối đa 20 giây, với âm thanh được tạo dọc theo hình ảnh và được đồng bộ hóa với những gì đang diễn ra trên màn hình—đoạn hội thoại, hiệu ứng âm thanh, tiếng ồn xung quanh. Trong các đánh giá ban đầu, người đánh giá ưa thích đầu ra của FLUX 3 hơn Runway Gen-4.5 trong 77% so sánh trực tiếp và hơn Luma Ray 3.2 trong 93%. Nó có vẻ tốt hơn một chút so với Gemini Omni và Seedance, đánh bại những mô hình đó với 52% số đánh giá.

Tất nhiên, đó là bài kiểm tra sở thích chứ không phải thang điểm cố định: người đánh giá chỉ cần xem hai clip và chọn một clip trông có vẻ thuyết phục hơn và BFL tính tần suất FLUX 3 thắng.
Ngoài ra, mô hình này dường như cũng có khả năng xử lý ảnh tĩnh rất tốt, tiếp nối di sản của nó. BFL đã chia sẻ một số hình ảnh và FLUX 3 dường như rất linh hoạt và có khả năng tạo ra nhiều phong cách khác nhau ngoài chủ nghĩa quang học.
BFL coi đây không chỉ là một công cụ nội dung. Đồng sáng lập và Giám đốc điều hành Robin Rombach cho biết: “Một mô hình chỉ học bằng hình ảnh chỉ có thể tạo ra hình ảnh. Công ty đặt cược rằng việc học cách dự đoán video cũng có nghĩa là học các yếu tố vật lý bên dưới nó—trọng lượng, sự tiếp xúc, thời gian—đó chính xác là những gì một cỗ máy cần để di chuyển trong thế giới vật chất.
Vụ cá cược đó có tên: FLUX-bắt chước. Được xây dựng bằng công nghệ robot bắt chước có trụ sở tại Zurich, nó sử dụng công cụ dự đoán video của FLUX 3 và bổ sung thêm một “bộ giải mã” nhẹ—một thành phần tiện ích bổ sung nhỏ giúp chuyển cảm giác bên trong của mô hình về cách mọi thứ chuyển động thành chuyển động thực tế của robot. Nhà sản xuất ô tô Audi đã thử nghiệm nó trong các nhiệm vụ như lắp đệm cửa linh hoạt, công việc mà hệ thống tự động hóa thông thường gặp khó khăn trong việc xử lý.

“Audi đại diện cho loại đối tác sản xuất mà chúng tôi đã xây dựng FLUX-bắt chước,” đồng sáng lập bắt chước Stephan-Daniel Gravert cho biết. Christoph Schneider của Audi cho biết các robot hiện nay “giải quyết được công việc thao tác cơ thể mềm phức tạp” mà các máy cũ không thể chạm tới. BFL cho biết toàn bộ hệ thống sẽ phản ứng trong khoảng 101 mili giây, gần bằng phản xạ thị giác của con người.
Sự gia tăng của FLUX không xảy ra trong chân không. Được thành lập vào tháng 8 năm 2024 bởi các nhà nghiên cứu kỳ cựu, những người đã giúp xây dựng các mô hình Khuếch tán ổn định ban đầu tại AI ổn định, Black Forest Labs đã tung ra các mô hình Flux đánh bại MidJourney và vượt trội so với chính Stability’s. Khuếch tán ổn định 3.
Các mô hình Flux Dev và Schnell mã nguồn mở đã giành được danh hiệu “trình tạo hình ảnh nguồn mở tốt nhất” mà các nghệ sĩ AI đã mong đợi Stable Diffusion 3.5, bản kế thừa của Stability, cuối cùng sẽ giành lại được.
Nó không bao giờ làm vậy. FLUX 1.1 Pro tiếp tục đứng đầu Đấu trường hình ảnh phân tích nhân tạo tháng 10 năm đó. Tuy nhiên, đó không phải là nguồn mở.
BFL phát hành FLUX.2 vào tháng 11 năm 2025 nhưng nó không phổ biến bằng. Vương miện nguồn mở do Flux ban đầu nắm giữ kéo dài cho đến khi Alibaba Hình ảnh Z Turbo đã truất ngôi nó vào cuối năm 2025, phù hợp với chất lượng của nó trên các card đồ họa dành cho người tiêu dùng cấp thấp hơn. “Đây chính là mục đích của SD3,” một người dùng CivitAI đã viết vào thời điểm đó.
FLUX 3 là sự trở lại của BFL và nó vẫn chưa mở hoàn toàn. Video và Hành động hiện có quyền truy cập sớm thông qua các API và các đối tác chọn lọc, bắt chước robot trong số đó, với việc tạo hình ảnh sẽ diễn ra “trong những tuần tới” theo BFL. Phiên bản Dev có trọng lượng mở, BFL cấp duy nhất có kế hoạch phát hành để sử dụng cục bộ, sẽ không ra mắt cho đến cuối năm 2026.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.

