大数跨境

刚刚,DeepSeek 杀死了比赛!V4 Flash 10 大反直觉硬核拆解

刚刚,DeepSeek 杀死了比赛!V4 Flash 10 大反直觉硬核拆解 AI信息Gap
2026-08-01
14
导读:关于 DeepSeek-V4-Flash 正式版,你需要知道的,都在今天这篇了。

DeepSeek 正式发布 DeepSeek-V4-Flash 正式版。该模型在架构未变、参数量未增的情况下,仅通过后训练优化,便在九项 Agent 基准测试中全面超越参数量更大的 DeepSeek-V4-Pro 预览版。其中 DeepSWE 得分从 7.3 飙升至 54.4,涨幅超六倍,而 API 价格维持输入 1 元/百万 token、输出 2 元/百万 token 不变。

01|九项 Agent 测试全胜,Flash 全面碾压 Pro

DeepSeek-V4-Flash 正式版在九项 Agent 基准测试中均取得最高分。数据显示,其总参数为 284B(激活 13B),远小于 V4-Pro 的 1.6T(激活 49B),但在 Agent 和编码类任务上表现更优。需注意,在传统知识问答类测试中,Pro 的大参数优势依然存在。

基准测试 Flash 正式版 Flash 预览版 Pro 预览版
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3 12.8
Toolathlon Verified 70.3 49.7 55.9
Agents' Last Exam 25.2 15.8 16.5
AutomationBench 25.1 10.8 12.8
DSBench-FullStack 68.7 37.0 41.8
DSBench-Hard 59.6 25.8 31.1

02|核心突破:DeepSWE 得分从 7.3 跃升至 54.4

DeepSWE 测试包含 113 个原创软件工程任务,要求 AI 在隔离环境中完成代码修改、测试及 Bug 修复。Flash 正式版在此项得分高达 54.4,不仅远超预览版的 7.3,也超越了 GLM-5.2(46.2),与 Claude Opus 4.8(58.0)仅差 3.6 分。此外,CyberGym(安全漏洞挖掘)得分也从 38.7 翻倍至 76.7。

03|架构未变,性能提升源于后训练

Flash 正式版的模型架构、预训练数据及参数量与前代完全一致,所有性能提升均源自后训练策略。DeepSeek 采用“多领域专家模型训练 + 监督微调/GRPO 强化学习 + 蒸馏整合”的技术路径。推测此次优化重点在于工具调用格式、长任务规划、代码验证及执行失败后的自动恢复能力。

04|对标国际顶尖:性能逼近 Claude Opus 4.8

在多项关键指标上,DeepSeek-V4-Flash 正式版已接近 Claude Opus 4.8,差距仅在 3-6 分之间,且在所有对比项目中均高于 GLM-5.2。考虑到其成本仅为竞品的几十分之一,这一性价比极具竞争力。

基准测试 Flash 正式版 Claude Opus 4.8 GLM-5.2
Terminal Bench 2.1 82.7 85.0 81.0
DeepSWE 54.4 58.0 46.2
CyberGym 76.7 83.1 -
Toolathlon 70.3 76.2 59.9
Agents' Last Exam 25.2 25.7 23.8

05|极致性价比:输入 1 元,输出 2 元

Flash 正式版定价极具优势:输入 1 元/百万 token,输出 2 元/百万 token。若利用缓存命中(实测命中率超 90%),输入成本可低至 0.02 元。相比之下,Claude Opus 4.8 的输出价格约为 168 元/百万 token,价差高达 80 倍。官方提示未来高峰时段可能实行加倍收费,具体日期待定。

项目 Flash Pro
输入(非缓存) ¥1 / 百万 token ¥3
输入(缓存命中) ¥0.02 ¥0.025
输出 ¥2 ¥6
并发上限 2500 500

06|原生适配 Codex 与 Responses API

Flash 正式版原生支持 OpenAI Responses API 格式,并针对 Codex 进行专门适配。开发者可在 Codex CLI、桌面端及 VS Code 扩展中直接使用,只需将 base_url 指向 DeepSeek 接口,模型名设为 deepseek-v4-flash。目前支持流式输出、工具调用及结构化输出,但暂不支持图片输入、文件上传、MCP 工具及 Computer Use 功能。此外,当前接口为无状态,需自行管理上下文。

07|自研 Harness 框架布局 Agent 生态

本次测试基于 DeepSeek 自研的"Harness 极简模式框架”。该框架旨在解决模型之外的工具调用、终端运行及上下文管理等问题,对标 Claude Code。团队由前 Jane Street 量化交易专家崔天一领导。研究表明,对于长期任务,Harness 层面的优化收益远超模型迭代带来的提升。

08|测试前提与局限性说明

所有 Agent 测试均在 max 推理档位(top_p 0.95, temperature 1.0)下进行,实际使用中可根据成本调整。另外,DSBench 系列测试集及 Harness 极简模式尚未公开,外部难以完全复现结果。开发者实测反馈,Flash 在工具识别和 MCP 调用上表现稳定,整体接近 Cursor Composer 2.5 水平,但在思维链长度速度上仍有优化空间。

09|更新范围:仅限 Flash API,Pro 正式版待发布

本次升级仅针对 Flash 模型的 API 接口,App 端、网页端及 V4-Pro API 暂未更新。V4-Pro 正式版预计将在稍后发布。对于以 Agent 和编码为主要场景的用户,Flash 正式版目前已具备替代 Pro 预览版的能力。

10|接入指南与适用场景

接入方式无需变更,仅需将模型 ID 设置为 deepseek-v4-flash,兼容 OpenAI ChatCompletions 和 Anthropic Messages 两种格式。该模型适合代码编写、Bug 修复、终端运行及 Agent 搭建等场景,支持 100 万 token 上下文。由于暂不支持多模态输入及特定工具,相关需求仍需等待后续更新。

DeepSeek-V4-Flash 正式版已在 Hugging Face 开源(MIT 协议),支持商用下载。

开源地址:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

实测显示,在双 DGX Sparks 环境下,模型推理速度可达 77 token/秒。尽管 284B 的 MoE 权重对显存要求较高,但其开源策略与强大的 Agent 能力标志着 DeepSeek 在闭源顶配模型竞争中占据了重要席位。

【声明】内容源于网络
0
0
AI信息Gap
各类跨境出海行业相关资讯
内容 1043
粉丝 0
AI信息Gap 各类跨境出海行业相关资讯
总阅读108.2k
粉丝0
内容1.0k