产品更新 Black Forest Labs · 2026-07-23

Black Forest Labs 发布 FLUX 3 多模态基础模型,开放视频 Early Access

查看原文 ↗

7 月 23 日,Stable Diffusion 原班团队创立的 Black Forest Labs 发布 FLUX 3——首个统一架构的多模态基础模型,联合训练图像、视频、音频与机器人动作,视频子模型支持最长 20 秒原生音视频生成,以受邀 Early Access 形式开放。

FLUX 3 于 2026 年 7 月 23 日由德国 AI 实验室 Black Forest Labs(BFL)发布,是该公司继纯图像 FLUX.1 / FLUX.2 之后首个视频模型,也是首个统一多模态架构:在同一套 Self-Flow 骨干上联合训练图像、视频、音频与动作预测,而非把多个专用模型拼在统一界面之后。

FLUX 3 Video 作为首个上线子产品,单次生成最长 20 秒视频并附带原生音频(对话、音效与环境声),支持文生视频、图生视频、视频生视频与关键帧控制,并可把单镜头智能串接为多镜头序列;BFL 自测在 10 秒 720p 带声视频中胜率 93% 超 Luma Ray 3.2、77% 超 Runway Gen-4.5。

发布采取「Early Access + 受邀团队」模式:视频与机器人动作预测通过私有 API 与合作伙伴渠道开放,图像模型在「未来数周」推出,开放权重(FLUX 3 Dev)最后于下半年发布;尚无公开定价。这标志 BFL 从「只做图像」转向押注长视频与机器人「世界模型」的视觉智能路线。

相关资讯