Midjourney V8.2 上线:从「生成」走向「编辑」,支持指令微调与局部重绘
8 月下旬,Midjourney 推出 V8.2 图像编辑模型,新增指令微调、多图参考、局部重绘与画布扩展,用户可用自然语言直接修改已有图像,创作控制精度显著提升。
V8.2 的核心变化是从单次「文生图」走向对已有图像的灵活编辑。新增的指令编辑能力允许用户通过文本指令直接修改画面,而无需重新生成整张图,显著降低反复试错的算力与时间成本。
具体能力包括多图参考(以多张图共同约束风格与构图)、局部重绘(只改图中特定区域)与画布扩展(将画面向四周延展)。对创作者而言,这意味着 Midjourney 从「灵感生成器」升级为更可控的「视觉创作工作台」。
在 AI 图像赛道竞争加剧的当下,图像编辑与可控性正成为头部产品的差异化焦点——这回应了设计师、电商与营销场景对「精准改图」而非「随机出图」的真实需求。
相关资讯
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅跃升并实行分时定价
8 月 12 日晚 DeepSeek 与 xAI 同日发布新模型。V4-Pro 正式版主打智能体能力,DeepSWE 得分由 12.8 升至 62.7、多项 Agent 测试超过 Claude Opus 4.8;8 月 17 日起实行分时定价,高峰输出价涨至现行 4.5 倍。
Gemini 3.7 Flash 发布:编程与智能体升级,API 价格年内直降 50%
Google DeepMind 推出 Gemini 3.7 Flash,软件工程、调试与多步智能体工作流显著提升,登 WebDev Code Arena 第 8、Agent Arena 第 20;上下文扩至 100 万 token,API 价格年内下调 50%。
智谱发布 GLM-5.3 开源大模型,编程能力跃居开源模型首位
智谱发布 GLM-5.3,基于 GLM-5.2 基座、通过后训练 Scaling 提升智能上限;Terminal-Bench 3.0 编程能力较前代提升 50%、居开源模型第一,模型权重将于两周后开源。
OpenAI 被曝测试 GPT Image 2.5,官方为 GPT Image 2 API 加透明背景
多名海外用户发现名为 luna-lisa-alpha 的神秘模型现身 LMArena 盲测平台,重点提升人物一致性、真实感与文字生成能力,社区猜测其为 GPT Image 2.5 早期版本;同期 GPT Image 2 API 预览支持透明背景生成。OpenAI 尚未公开确认该模型存在。