德国 AI 实验室 Black Forest Labs 于周四发布 FLUX 3。这是该公司旗舰模型第一次从只生成静态图像,扩展到直接生成视频。

Black Forest Labs 以 FLUX 图像生成模型系列闻名。此次新系统在同一套共享系统中,同时使用图像、视频和音频进行训练。
FLUX 3 将视频、音频和图像放进同一模型
这类方法被称为多模态,也就是让一个模型一起学习多种类型的信息,而不是把不同工具并排拼接在一起。
FLUX 3 最核心的新功能是视频生成。该模型可生成最长 20 秒的视频片段,并同步生成音频,内容会跟随画面中的事件对应,包括对白、音效和环境噪声。
在早期评测中,人工评审在一对一对比里,更偏好 FLUX 3 而非 Runway Gen-4.5 的输出,比例为 77%;对比 Luma Ray 3.2 时,这一比例为 93%。与 Gemini Omni 和 Seedance 相比,FLUX 3 也略占优势,在评测中以 52% 的比例胜出。
不过,这里采用的是偏好测试,而不是固定评分标准。评测人员只需观看两段视频,然后选出在观感和声音上更可信的一段,Black Forest Labs 统计的则是 FLUX 3 的胜出次数。
在静态图像上仍保持原有能力
除视频外,这一模型在静态图像生成上似乎也保持了原有水准。Black Forest Labs 展示了几张样张,从结果看,FLUX 3 的风格覆盖面较广,不只限于照片级写实风格。

从内容生成走向机器人控制
Black Forest Labs 将这次发布定位为不只是内容生成工具。联合创始人兼 CEO Robin Rombach 表示:“一个只学习图像的模型,只能生成图像。”
该公司的判断是,学习预测视频,也意味着学习视频背后的物理规律,包括重量、接触和时序,而这些正是机器在物理世界中移动所需要的能力。
这一方向对应的产品名为 FLUX-mimic。它由 Black Forest Labs 与总部位于苏黎世的 mimic robotics 共同打造,在 FLUX 3 的视频预测引擎基础上加入一个轻量级“解码器”,把模型内部对运动方式的理解,转换成真实的机器人动作。
汽车制造商奥迪已经在测试该系统,涉及柔性车门密封条装配等任务。这类工作一直是传统自动化较难处理的环节。
mimic robotics 联合创始人 Stephan-Daniel Gravert 表示:“奥迪正是我们为 FLUX-mimic 所打造的那类制造业合作伙伴。”奥迪的 Christoph Schneider 称,这些机器人现在可以“解决旧式机器无法处理的复杂软体操控工作”。
Black Forest Labs 表示,整套系统的反应时间约为 101 毫秒,接近人类视觉反射水平。

Black Forest Labs 的 FLUX 路线与这次回归
FLUX 的崛起并非偶然。Black Forest Labs 成立于 2024 年 8 月,创始团队包括曾参与 Stability AI 原始 Stable Diffusion 模型开发的资深研究人员。公司随后推出的 Flux 模型击败 MidJourney,也超过 Stability 自家表现不佳的 Stable Diffusion 3。
开源版本 Flux Dev 和 Schnell 此后拿下“最佳开源图像生成器”的位置。此前不少 AI 艺术创作者原本认为,Stability 作为修正版推出的 Stable Diffusion 3.5 最终会夺回这一称号。
但这一情况并未发生。随后发布的 FLUX 1.1 Pro 在当年 10 月登上 Artificial Analysis 图像竞技榜榜首,不过这一版本并不是开源模型。
Black Forest Labs 在 2025 年 11 月发布 FLUX.2,但受欢迎程度不如预期。最初 Flux 系列持有的开源优势,一直持续到 2025 年晚些时候才被阿里巴巴的 Z-Image Turbo 取代。后者在较低端消费级显卡上实现了接近的质量表现。当时有 CivitAI 用户写道:“这才是 SD3 本来该有的样子。”
当前开放范围与发布时间表
Black Forest Labs 将 FLUX 3 视为一次回归,但该模型目前还没有完全开放。Video 和 Action 两个版本现已通过 API 和部分合作伙伴进入早期接入阶段,mimic robotics 就在其中。
按照 Black Forest Labs 的说法,图像生成功能将在“未来几周内”跟进。至于 open-weight 的 Dev 版本,也就是该公司计划提供给本地部署使用的唯一层级,要等到 2026 年晚些时候才会发布。

