千问办公首发上线 Qwen3.8-Flash,单任务生成速度翻倍、Token 消耗降 75%
8 月 26 日晚,千问办公首发上线 Qwen3.8-Flash 模型并推出标准模式:基于全新千亿级参数架构,在真实办公场景中单任务生成速度提升约 100%、Token 消耗平均减少 75%,95% 日常任务可由标准模式完成。
8 月 26 日晚,千问办公首发上线刚刚发布的 Qwen3.8-Flash 模型,并同步推出标准模式。基于全新的千亿级总参数架构,该模型在多项能力上超越 Claude Opus 4.6,并针对多步规划、工具选择、上下文压缩等办公场景做了专项训练调优。
千问大模型团队与千问办公团队联合推出办公专属版本,通过推理优化与定制 Harness 架构进一步提升吞吐效率。真实办公场景测试显示,标准模式单任务生成速度提升约 100%,Token 消耗平均减少 75%。
千问办公表示,未来模型供给将只有「标准」与「高级」两种模式,约 95% 的日常任务通过标准模式即可完成,仅 5% 的复杂任务需要高级模式——Agent 与模型的深度协同优化,正在打破性能、成本与速度的「不可能三角」。
相关资讯
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅跃升并实行分时定价
8 月 12 日晚 DeepSeek 与 xAI 同日发布新模型。V4-Pro 正式版主打智能体能力,DeepSWE 得分由 12.8 升至 62.7、多项 Agent 测试超过 Claude Opus 4.8;8 月 17 日起实行分时定价,高峰输出价涨至现行 4.5 倍。
Gemini 3.7 Flash 发布:编程与智能体升级,API 价格年内直降 50%
Google DeepMind 推出 Gemini 3.7 Flash,软件工程、调试与多步智能体工作流显著提升,登 WebDev Code Arena 第 8、Agent Arena 第 20;上下文扩至 100 万 token,API 价格年内下调 50%。
智谱发布 GLM-5.3 开源大模型,编程能力跃居开源模型首位
智谱发布 GLM-5.3,基于 GLM-5.2 基座、通过后训练 Scaling 提升智能上限;Terminal-Bench 3.0 编程能力较前代提升 50%、居开源模型第一,模型权重将于两周后开源。
OpenAI 被曝测试 GPT Image 2.5,官方为 GPT Image 2 API 加透明背景
多名海外用户发现名为 luna-lisa-alpha 的神秘模型现身 LMArena 盲测平台,重点提升人物一致性、真实感与文字生成能力,社区猜测其为 GPT Image 2.5 早期版本;同期 GPT Image 2 API 预览支持透明背景生成。OpenAI 尚未公开确认该模型存在。