2026 年 8 月 13 日版本更新未改变模型基础架构,仍沿用 1.6T 总参数、49B 激活 MoE 架构,支持 1M 上下文窗口及最大 384K Token 输出。此次升级聚焦后训练能力优化,显著提升智能代理、工具调用及工程代码开发水平,并新增原生图像解析功能。
一、核心能力更新
1. 智能代理与工程能力大幅跃升
本次迭代强化了多步骤复杂任务处理、循环工具调用、项目代码修改及终端操作能力。权威测试数据显示,部分智能代理任务表现已超越 Claude Fable5:
- DeepSWE(工程代码):从 12.7 提升至 62.7,涨幅近 5 倍
- Terminal Bench 2.1(终端操作):从 72.1 提升至 87.9
- Cybergym(安全智能体):从 52.7 提升至 83.3
- DSBench-Hard(高难任务):从 31.1 提升至 67.2
2. 新增原生图文混合推理
新版搭载 DeepThink 图文融合推理引擎,弥补了预览版仅支持纯文本的短板。现已支持图片解析、截图分析及图文混合文档输入,可在智能代理流程中直接调用图像能力,实现高效的图文联动推理。
3. 推理强度分级可控
新增reasoning_effort三档推理模式,用户可根据场景灵活调配算力:
- low:轻量化推理,优先保障响应速度
- high:均衡模式,兼顾推理质量与效率
- max:深度推理,适配高难度问题及复杂长链路智能代理任务
4. API 服务能力优化
原生兼容 OpenAI Responses API 并适配 Codex 工具,存量业务迁移成本低,模型调用标识保持不变;上线峰谷错峰定价及 KV 缓存复用机制,有效降低调用成本;网页 Expert 模式、客户端及 API 服务全终端同步更新。
5. 配套开源框架发布
同步推出生产级智能代理开发框架 Harness Agent,优化工具编排、长期记忆及异常回退机制,为开发者提供标准化、可落地的应用开发方案。
二、V4-Pro 与 V4-Flash 版本定位差异
V4-Pro:面向复杂智能代理、重度工程开发、深度推理及图文混合场景。具备更高推理精度,但单请求资源消耗较高,并发吞吐量略低。
V4-Flash:面向高吞吐、低成本场景,适配日常问答及基础工具调用等轻量化任务,性价比突出。
三、版本使用体验总结
在日常基础对话中,新旧版本表现无明显差异,核心升级主要体现在多步骤复杂任务、项目代码迭代及循环工具调用等专业场景。
开启 max 深度推理模式可显著提升复杂任务准确率,但会相应增加 Token 消耗与响应延迟。
延续 CSA+HCA 混合注意力机制,百万级上下文调用的 KV 缓存开销可控,长文本处理性能保持稳定。

