大数跨境

The Batch: 978 | DeepSeek-V4-Pro 更新了

The Batch: 978 | DeepSeek-V4-Pro 更新了 DeeplearningAl
2026-09-03
5

DeepSeek 旗舰模型 DeepSeek-V4-Pro-0813 正式发布,性能显著提升并开源基准测试框架,同时上调 API 价格。

最新消息:DeepSeek 正式推出 DeepSeek-V4-Pro-0813,这是其第四代大模型中较大版本的正式版。公司同步发布了开源的 Agent Harness 开发者预览版,并调整了全系模型的 API 定价策略。

  • 输入/输出:支持最多 100 万 tokens 文本输入,输出上限为 384,000 tokens(速度约 78.1 tokens/秒)。
  • 架构规格:采用混合专家(MoE)Transformer 架构,总参数量 1.6 万亿,每 token 激活 490 亿参数;可选推测解码模块将检查点参数量提升至 1.7 万亿。
  • 核心特性:支持可调推理强度(无/低/高/最高,默认为高)、工具调用及上下文缓存功能。
  • 性能排名:在 Artificial Analysis Intelligence Index 中得分为 53,位列开源权重模型第三;在 Arena WebDev 排行榜中居第 10 位(共 115 个模型)。
  • 可用性与时价:可通过 DeepSeek 应用及网站以 Expert Mode 使用。API 高峰时段(UTC 01:00–04:00 及 06:00–10:00)价格为:输入$1.32、缓存$0.044、输出$3.96(每百万 tokens),非高峰时段价格减半。
  • 许可协议:基于 MIT 许可证,免费开放商业及非商业用途。
  • 未披露信息:具体训练数据构成、新方法细节及知识截止时间暂未公布。

工作原理与技术架构

架构延续与增强:DeepSeek-V4-Pro-0813 保留了 4 月预览版的参数规模与核心架构,包括推测解码模块 DSpark。官方表示此次更新重点增强了模型的 Agentic(智能体)能力,但未详述具体改动细节。

  • 训练流程:模型先基于超 32 万亿 tokens 进行预训练,随后通过监督学习与强化学习对 10 个独立领域的模型副本进行微调。最终利用 On-policy Distillation 技术,让学生模型模仿这 10 个专家模型的输出,合并为单一模型。
  • 混合注意力机制:在两类注意力层间交替运作。针对 100 万 tokens 长文本输入,其计算量仅为 DeepSeek-V3.2 的 27%,KV 缓存内存占用仅为后者的 10%。
  • 推理持续性:模型返回答案时附带推理过程。若请求涉及工具调用,后续 API 请求必须包含此前的推理轨迹,以确保多轮调用间的逻辑连贯性。
  • DeepSeek Harness 架构:将模型、工具、技能、会话、沙箱等视为可插拔组件。系统完整记录系统提示、推理链、工具调用结果等全链路信息,支持会话恢复、分叉、搜索与回放。其最小配置仅提供 Shell 与文件编辑器,专为编码智能体基准测试设计。该框架基于 Cordis 插件内核构建。
  • 兼容性:API 兼容 OpenAI Responses 格式,OpenAI Codex 编码智能体经简单脚本配置即可迁移至 DeepSeek 模型。

性能表现评测

综合评估:独立评测显示,DeepSeek-V4-Pro-0813 较 4 月预览版提升显著,但相对于自家较小的 Flash 模型优势微弱。其在开源权重模型综合智能指数中排名第三,距顶尖闭源模型仍有约 10 分差距。编码能力是其最显著的改进项。尽管单任务成本仍低于多数闭源竞品,但在 OpenAI GPT-5.6 Luna 降价后,后者在成本效益上已具备更强竞争力。

  • Intelligence Index 得分:在最高推理模式下,该模型得分为 53(单任务成本$0.25),较预览版的 45 分($0.05)提升 8 分,略高于 DeepSeek-V4-Flash-0731 的 52 分($0.11)。虽优于 GPT-5.6 Luna(52 分,$0.05/任务),但后者单位成本更低。
  • 编码智能体任务突破:在官方测试(最高推理 + 最小 Harness 配置)中,Terminal-Bench 2.1 成功率从 72.1% 跃升至 87.9%;DeepSWE(软件工程难题)从 12.8% 提升至 62.7%;CyberGym(漏洞发现)从 52.7% 提升至 83.3%,微幅领先 Claude Fable 5(83.1%)。
  • 第三方评测差异:外部评测结果略低。Vals AI 使用内部 Harness 测得分为 54.68;Artificial Analysis 使用开源 Terminus 2 Harness 测得 Terminal-Bench 2.1 成功率为 78.7%。

新闻背景与行业意义

产品动态:DeepSeek 近期已发布具备视觉能力的实验版 DeepSeekV4-Flash,但尚未公布支持视觉语言的 Pro 版本计划。

开源价值:DeepSeek 罕见地公开了其基准测试 Harness。鉴于智能体性能是模型能力与脚手架协同的结果,开源 Harness 使开发者不仅能查看评分,更能复现测试环境。该框架采用 MIT 许可且模型无关,有助于推动行业透明度。

观察与展望

智能体 Harness 赛道竞争日益激烈。尽管此次为开源发布,但在安全专家完成全面评估、以及更多第三方在不同模型上的基准测试结果出炉前,部分用户对其直接投入生产环境可能持谨慎态度。业界期待尽快出现扎实的第三方测试报告及开发者的创新实验。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k