DeepSeek 正式发布 DeepSeek-V4-Flash 正式版。该模型在架构未变、参数量未增的情况下,仅通过后训练优化,便在九项 Agent 基准测试中全面超越参数量更大的 DeepSeek-V4-Pro 预览版。其中 DeepSWE 得分从 7.3 飙升至 54.4,涨幅超六倍,而 API 价格维持输入 1 元/百万 token、输出 2 元/百万 token 不变。
01|九项 Agent 测试全胜,Flash 全面碾压 Pro
DeepSeek-V4-Flash 正式版在九项 Agent 基准测试中均取得最高分。数据显示,其总参数为 284B(激活 13B),远小于 V4-Pro 的 1.6T(激活 49B),但在 Agent 和编码类任务上表现更优。需注意,在传统知识问答类测试中,Pro 的大参数优势依然存在。
| 基准测试 | Flash 正式版 | Flash 预览版 | Pro 预览版 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
02|核心突破:DeepSWE 得分从 7.3 跃升至 54.4
DeepSWE 测试包含 113 个原创软件工程任务,要求 AI 在隔离环境中完成代码修改、测试及 Bug 修复。Flash 正式版在此项得分高达 54.4,不仅远超预览版的 7.3,也超越了 GLM-5.2(46.2),与 Claude Opus 4.8(58.0)仅差 3.6 分。此外,CyberGym(安全漏洞挖掘)得分也从 38.7 翻倍至 76.7。
03|架构未变,性能提升源于后训练
Flash 正式版的模型架构、预训练数据及参数量与前代完全一致,所有性能提升均源自后训练策略。DeepSeek 采用“多领域专家模型训练 + 监督微调/GRPO 强化学习 + 蒸馏整合”的技术路径。推测此次优化重点在于工具调用格式、长任务规划、代码验证及执行失败后的自动恢复能力。
04|对标国际顶尖:性能逼近 Claude Opus 4.8
在多项关键指标上,DeepSeek-V4-Flash 正式版已接近 Claude Opus 4.8,差距仅在 3-6 分之间,且在所有对比项目中均高于 GLM-5.2。考虑到其成本仅为竞品的几十分之一,这一性价比极具竞争力。
| 基准测试 | Flash 正式版 | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 85.0 | 81.0 |
| DeepSWE | 54.4 | 58.0 | 46.2 |
| CyberGym | 76.7 | 83.1 | - |
| Toolathlon | 70.3 | 76.2 | 59.9 |
| Agents' Last Exam | 25.2 | 25.7 | 23.8 |
05|极致性价比:输入 1 元,输出 2 元
Flash 正式版定价极具优势:输入 1 元/百万 token,输出 2 元/百万 token。若利用缓存命中(实测命中率超 90%),输入成本可低至 0.02 元。相比之下,Claude Opus 4.8 的输出价格约为 168 元/百万 token,价差高达 80 倍。官方提示未来高峰时段可能实行加倍收费,具体日期待定。
| 项目 | Flash | Pro |
|---|---|---|
| 输入(非缓存) | ¥1 / 百万 token | ¥3 |
| 输入(缓存命中) | ¥0.02 | ¥0.025 |
| 输出 | ¥2 | ¥6 |
| 并发上限 | 2500 | 500 |
06|原生适配 Codex 与 Responses API
Flash 正式版原生支持 OpenAI Responses API 格式,并针对 Codex 进行专门适配。开发者可在 Codex CLI、桌面端及 VS Code 扩展中直接使用,只需将 base_url 指向 DeepSeek 接口,模型名设为 deepseek-v4-flash。目前支持流式输出、工具调用及结构化输出,但暂不支持图片输入、文件上传、MCP 工具及 Computer Use 功能。此外,当前接口为无状态,需自行管理上下文。
07|自研 Harness 框架布局 Agent 生态
本次测试基于 DeepSeek 自研的"Harness 极简模式框架”。该框架旨在解决模型之外的工具调用、终端运行及上下文管理等问题,对标 Claude Code。团队由前 Jane Street 量化交易专家崔天一领导。研究表明,对于长期任务,Harness 层面的优化收益远超模型迭代带来的提升。
08|测试前提与局限性说明
所有 Agent 测试均在 max 推理档位(top_p 0.95, temperature 1.0)下进行,实际使用中可根据成本调整。另外,DSBench 系列测试集及 Harness 极简模式尚未公开,外部难以完全复现结果。开发者实测反馈,Flash 在工具识别和 MCP 调用上表现稳定,整体接近 Cursor Composer 2.5 水平,但在思维链长度和速度上仍有优化空间。
09|更新范围:仅限 Flash API,Pro 正式版待发布
本次升级仅针对 Flash 模型的 API 接口,App 端、网页端及 V4-Pro API 暂未更新。V4-Pro 正式版预计将在稍后发布。对于以 Agent 和编码为主要场景的用户,Flash 正式版目前已具备替代 Pro 预览版的能力。
10|接入指南与适用场景
接入方式无需变更,仅需将模型 ID 设置为 deepseek-v4-flash,兼容 OpenAI ChatCompletions 和 Anthropic Messages 两种格式。该模型适合代码编写、Bug 修复、终端运行及 Agent 搭建等场景,支持 100 万 token 上下文。由于暂不支持多模态输入及特定工具,相关需求仍需等待后续更新。
DeepSeek-V4-Flash 正式版已在 Hugging Face 开源(MIT 协议),支持商用下载。
开源地址:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
实测显示,在双 DGX Sparks 环境下,模型推理速度可达 77 token/秒。尽管 284B 的 MoE 权重对显存要求较高,但其开源策略与强大的 Agent 能力标志着 DeepSeek 在闭源顶配模型竞争中占据了重要席位。

