Black Forest Labs 发布 FLUX 3 多模态基础模型,开放视频 Early Access
7 月 23 日,Stable Diffusion 原班团队创立的 Black Forest Labs 发布 FLUX 3——首个统一架构的多模态基础模型,联合训练图像、视频、音频与机器人动作,视频子模型支持最长 20 秒原生音视频生成,以受邀 Early Access 形式开放。
FLUX 3 于 2026 年 7 月 23 日由德国 AI 实验室 Black Forest Labs(BFL)发布,是该公司继纯图像 FLUX.1 / FLUX.2 之后首个视频模型,也是首个统一多模态架构:在同一套 Self-Flow 骨干上联合训练图像、视频、音频与动作预测,而非把多个专用模型拼在统一界面之后。
FLUX 3 Video 作为首个上线子产品,单次生成最长 20 秒视频并附带原生音频(对话、音效与环境声),支持文生视频、图生视频、视频生视频与关键帧控制,并可把单镜头智能串接为多镜头序列;BFL 自测在 10 秒 720p 带声视频中胜率 93% 超 Luma Ray 3.2、77% 超 Runway Gen-4.5。
发布采取「Early Access + 受邀团队」模式:视频与机器人动作预测通过私有 API 与合作伙伴渠道开放,图像模型在「未来数周」推出,开放权重(FLUX 3 Dev)最后于下半年发布;尚无公开定价。这标志 BFL 从「只做图像」转向押注长视频与机器人「世界模型」的视觉智能路线。
相关资讯
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅跃升并实行分时定价
8 月 12 日晚 DeepSeek 与 xAI 同日发布新模型。V4-Pro 正式版主打智能体能力,DeepSWE 得分由 12.8 升至 62.7、多项 Agent 测试超过 Claude Opus 4.8;8 月 17 日起实行分时定价,高峰输出价涨至现行 4.5 倍。
Gemini 3.7 Flash 发布:编程与智能体升级,API 价格年内直降 50%
Google DeepMind 推出 Gemini 3.7 Flash,软件工程、调试与多步智能体工作流显著提升,登 WebDev Code Arena 第 8、Agent Arena 第 20;上下文扩至 100 万 token,API 价格年内下调 50%。
智谱发布 GLM-5.3 开源大模型,编程能力跃居开源模型首位
智谱发布 GLM-5.3,基于 GLM-5.2 基座、通过后训练 Scaling 提升智能上限;Terminal-Bench 3.0 编程能力较前代提升 50%、居开源模型第一,模型权重将于两周后开源。
OpenAI 被曝测试 GPT Image 2.5,官方为 GPT Image 2 API 加透明背景
多名海外用户发现名为 luna-lisa-alpha 的神秘模型现身 LMArena 盲测平台,重点提升人物一致性、真实感与文字生成能力,社区猜测其为 GPT Image 2.5 早期版本;同期 GPT Image 2 API 预览支持透明背景生成。OpenAI 尚未公开确认该模型存在。