作者丨郑佳美
编辑丨马晓宁
DeepSeek 正式更新 DeepSeek-V4-Flash 版本。此次更新目前仅在 API 端开启公测,暂未同步至 V4-Pro API、App 及网页端。
相较于“正式版”的命名,本次更新的核心亮点在于:DeepSeek-V4-Flash-0731 与此前 Preview 版本采用完全相同的模型结构和参数规模,仅通过重新进行后训练(Post-training)实现了能力跃升。
架构未变,能力为何提升?
大模型训练通常分为两个阶段:预训练与后训练。预训练阶段让模型通过海量数据掌握基础知识和通用能力;后训练则类似于“专项特训”,旨在优化模型的回答逻辑、工具调用能力及任务执行策略。
本次 DeepSeek 并未调整模型架构或扩大参数规模,而是对原有模型权重和行为方式进行了重构。这如同在不更换发动机的前提下,通过优化变速箱、控制系统和驾驶策略,显著提升了车辆在特定路况下的表现。
由于官方尚未披露具体的后训练数据、奖励机制及流程细节,目前尚无法断定性能提升的确切技术来源,但可以确定的是,重新后训练是关键变量。
提升聚焦于 Agent 能力
官方数据显示,新版 V4-Flash 在多项基准测试中表现优异:Terminal Bench 2.1 得分 82.7,DeepSWE 得分 54.4,DSBench-FullStack 得分 68.7。
与传统代码补全测试不同,上述 Agent 测试要求模型进入真实工作环境,具备读取文件、理解仓库、调用终端、修改程序及根据报错迭代处理的多步执行能力。
值得注意的是,部分成绩依赖于未公开的 DeepSeek Harness 框架及高推理档位,且 DSBench 系列为内部测试集。因此,更准确的结论是:V4-Flash-0731 在官方指定的 Agent 运行环境中取得了显著进步,其在第三方框架中的实际表现仍需独立验证。
Responses API 优化接入体验
此次更新的另一大变化是 V4-Flash 原生支持 Responses API,并针对 Codex 进行了适配。该接口专为 Agent 设计,能统一处理模型回复、推理状态、工具调用及执行结果。
Responses API 虽不直接提升模型智力,但大幅降低了接入 Codex 等 Agent 工具的适配成本,助力开发者将模型更高效地融入软件开发流程。
综上,本次更新由“重新后训练的模型权重”与“适配 Agent 的接口环境”两部分组成。最终性能表现是模型、推理预算、工具环境及 Agent 框架共同作用的结果。
更新背后的技术路线启示
可以确定的是,DeepSeek 在保持 V4-Flash 架构和参数不变的情况下,通过后训练提升了官方 Agent 基准成绩,并强化了对 Responses API 和 Codex 工作流的支持。
然而,现阶段不宜过度解读为“后训练可替代模型扩容”或"V4-Flash 已全面领先”。一方面,具体后训练细节尚未公开;另一方面,部分测试缺乏外部复现条件。
此次更新的核心价值在于验证了一条务实的技术路线:在模型结构固定的前提下,能否通过重新后训练、工具接口适配及 Agent 框架优化,进一步提升模型解决真实任务的能力。
DeepSeek 已展示初步成果,但该路线的实际潜力仍有待更多训练细节披露、工具开源及第三方测试的进一步验证。

