向AI转型的程序员都关注公众号 机器学习AI算法工程
8 月 13 日晚,API 价格页的版本号悄悄从 DeepSeek-V4-Pro-Preview 改成了 DeepSeek-V4-Pro-0813。同一时间,DeepSeek 官方群放出那张评测对比表:正式版 vs Preview vs Flash vs GLM-5.2 vs Kimi-K3 vs Opus-4.8 vs Fable 5。
一句话总结这次升级:不是"参数大一点、分数高一截"那种渐进式升级,而是把 Agent 这个维度从"勉强可用"直接拉到了"无短板的第一梯队"。
二、V4 Pro 的关键看点
2.1 上下文与输出:1M + 384K 的长任务硬刚需
正式版的规格是这样的:
-
上下文窗口:1,000,000 tokens(约等于 3–4 本中等长度的英文书,或一个中型代码仓库的全文) -
最大输出:384,000 tokens(一次性可以生成大约 20 万汉字) -
双模式:thinking 模式 + 非 thinking 模式,默认开启思考
通俗解释:1M 输入 + 384K 输出的组合,在国产模型里属于头部水平。它真正解决的问题不是"聊天聊得长",而是长文档摘要、长代码库重构、多步骤 Agent 任务——这类任务需要的不是"上下文大一点",而是"一次调用就能吞下、还能吐回足够多"的硬规格。
2.2 接入方式:OpenAI、Anthropic 双兼容 + Responses API
对开发者更友好的是这次在接口层面下了狠功夫:
- OpenAI 格式
:原来就支持, base_url不变,把model改成deepseek-v4-pro即可。 - Anthropic 格式
:通过 api.deepseek.com/anthropic端点接入,原本基于 Claude 构建的 Agent 应用可以近乎零成本迁移。 - Responses API
:正式支持,可直接接入 Codex 类工具。 - Tool Calls / JSON Output
:原生结构化输出。 - FIM 补全
(Beta):仅在非思考模式下可用,适合 IDE 补全场景。 - 对话前缀续写
(Beta):长对话场景下的连续性优化。
关键信号:DeepSeek 在 OpenAI 之外主动兼容 Anthropic 格式,意思是"无论你之前栈在 OpenAI 还是 Claude 上,都不需要重写"。这背后是过去半年国产模型在 Agent 工程栈上"挖人"的现实——能不能让现有 Agent 框架无缝切换,决定了能不能吃到迁移红利。
三、技术创新点
官方没公布完整技术报告,但从评测表和功能清单可以反推出五个着力点:
3.1 Agent 能力"从 12.8 到 62.7"的大幅跃升
DeepSWE(软件工程类)从 Preview 的 12.8 跳到正式版 62.7,AutomationBench 从 12.8 到 31.8,DSBench-Hard 从 31.1 到 67.2——这不是单点优化能解释的,整套 Agent 后训练管线大概率换了基底。
3.2 长上下文与长输出的协同
1M 输入 + 384K 输出不是孤立的两个数字,它们决定了 Agent 在长任务里能"装得下、吐得出"。384K 的输出能力意味着 Agent 一次性可以给出大段代码或多步计划而不被截断。
3.3 双 API 兼容 + Responses API
兼容 OpenAI 与 Anthropic 双格式,再加 Responses API,是工程层面的"开放式生态"策略——把迁移成本压到接近零,把竞品的开发者拉进来。
3.4 双模式(思考 / 非思考)
思考模式适合复杂推理和 Agent 规划;非思考模式适合延迟敏感的补全 / 短回复场景。FIM 补全只在非思考模式下开放,验证了这一分层逻辑。
3.5 价格与并发的明确分层
Pro 与 Flash 在价格和并发上"错位竞争",形成清晰的产品矩阵——这一点我们下文第六节展开。
四、技术原理:评测分数为什么能翻这么多倍
虽然官方没发布技术报告,但横向对比下来,能从评测维度看出一些线索:
一句话:这次升级的核心战场是"在真实环境里长时间、多步骤地完成任务",也就是 Agent 这一维度,而不是单纯的语言建模或世界知识。
从评测名字就能看出来——Terminal Bench(终端操作)、DeepSWE(软件工程)、NL2Repo(自然语言到仓库)、Cybergym(安全攻防)、Toolathlon-Verified(工具调用)、AutomationBench、DSBench-FullStack / Hard——全部是 Agent 任务,没有一个是传统选择题或文本生成题。
DeepSWE 从 12.8 到 62.7 这种跃升,最可能来自:
- Agent 后训练数据的规模化
:大量合成或采自真实仓库的工具调用轨迹。 - 规划 / 反思能力
:让模型在多步骤任务里能自我检查、回溯。 - 长上下文利用率
:1M 上下文 + 384K 输出让模型能"看到全部代码、吐出完整计划"。 - 工具调用稳定性
:Tool Calls、JSON Output、Responses API 的稳定性提升,减少 Agent 流程中断。
通俗解释:如果说老模型是"考试分数高但不会干活"的学生,正式版是"考试分数同样高、还能在真实公司里干活的实习生"——后者需要的是长期记忆、动手能力、抗干扰能力,而不是再多刷几道题。
五、技术成果:评测对比一览
下面是来自 DeepSeek 官方公布的对比表:
1. V4-Pro 正式版没有任何一项掉出第一梯队。单项未必全第一(Terminal Bench 输给 Kimi-K3 0.4 分,DeepSWE 输给 Kimi-K3 4.8 分、输给 Fable 5 7.3 分),但 Agent 这一维度的"无短板"才是最难做到的。
2. Preview 到正式版不是渐进式升级,是跃迁。DeepSWE 12.8→62.7、AutomationBench 12.8→31.8、DSBench-Hard 31.1→67.2、Cybergym 52.7→83.3——单看任一项,都不是常规后训练能解释的幅度。
3. 最强的对手是 Fable 5,但二者定位不同。V4 Pro 在 HLE w/tools 上拿到 60.0,仅次于 Fable 5 的 63.0;Cybergym 上甚至以 83.3 vs 83.1 微超;AutomationBench 上 31.8 vs 29.1 反超。剩下几项里 Fable 5 仍占优,但差距已经小到"按场景选"的级别。
六、价格与并发:Pro 与 Flash 的"错位分工"
价格表如下(单位:元 / 百万 tokens):
|
|
|
|
|
|
|---|---|---|---|---|
| DeepSeek-V4-Pro-0813 |
|
|
|
|
|
|
|
|
|
|
几个值得注意的事实:
- 输入未命中从 1 元涨到 3 元,输出从 2 元涨到 6 元
,都是 Flash 的 3 倍。 -
缓存命中价格几乎没变(0.02 → 0.025),意味着只要善用上下文缓存,真实成本远低于"裸价"。 - 并发限制从 2500 降到 500
——能力越强、算力越贵,官方在用并发做隐形队列管理。 -
价格页下方挂了一条重要注释:"计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大"——这比 Pro 版转正本身更值得长期用户关注。
通俗解释:Pro 版不是用来"刷量"的,是用来啃硬骨头的;日常对话、轻量编程、批量任务继续用 Flash。想让真实成本接近定价表的"标价",必须把上下文缓存用起来,否则 3 元/百万 输入 + 6 元/百万输出 会很疼。
七、实战代码案例
7.1 OpenAI 兼容接口调用
from openai import OpenAI client = OpenAI( api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com", ) resp = client.chat.completions.create( model="deepseek-v4-pro", # 正式版默认走 thinking 模式 messages=[ {"role": "system", "content": "你是一个严谨的助手。"}, {"role": "user", "content": "用 Python 写一个 1M tokens 滑动窗口分块器。"}, ], max_tokens=8192, # 想要非思考模式时,把 model 换成 deepseek-v4-pro-no-think 即可 ) print(resp.choices[0].message.content)
7.2 Anthropic 兼容接口调用
from anthropic import Anthropic client = Anthropic( api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com/anthropic", ) msg = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[ {"role": "user", "content": "把这份 50 万字的合同总结成 20 条风险点。"} ], ) print(msg.content[0].text)
7.3 长上下文 + 缓存命中(真实成本最低的姿势)
# 长文档场景:把同一份系统提示 + 同一份长文档作为 prefix, # 后续请求命中 prefix cache,输入按 0.025 元/百万 tokens 算。 SYSTEM_PROMPT = "你是合同审查助手,按风险等级标注每一处异常。" DOC = open("contract.txt", encoding="utf-8").read() # ~ 800k tokens for q in [ "总结违约责任相关条款。", "找出所有金额超过 100 万的付款节点。", "把所有'不可抗力'定义列出来。", ]: resp = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": SYSTEM_PROMPT}, {"role": "user", "content": f"{DOC}\n\n问题:{q}"}, ], max_tokens=8192, ) print(q, "→", resp.choices[0].message.content[:80], "...")
7.4 Tool Calls / JSON Output(Agent 场景)
import json from openai import OpenAI client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com") resp = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": "你可以调用 read_file 工具读取用户文件。"}, {"role": "user", "content": "读 ./repo/main.py,告诉我它导入了哪些模块。"} ], tools=[{ "type": "function", "function": { "name": "read_file", "description": "读取本地文件", "parameters": { "type": "object", "properties": {"path": {"type": "string"}}, "required": ["path"], }, }, }], tool_choice="auto", response_format={"type": "json_object"}, # 强制 JSON 输出 ) print(json.dumps(resp.choices[0].message.tool_calls, ensure_ascii=False, indent=2))
几个落地贴士:
• 想让成本接近"标价",必须复用同一份长 prefix,否则走的是 3 元/百万 输入。
• 并发只有 500,高 QPS 场景上 Flash(并发 2500)。
• FIM 补全仅在非思考模式可用:model="deepseek-v4-pro-no-think"。
• 长输出任务记得显式给 max_tokens,避免 384K 上限被默认截断。
• 价格页已挂"近期整体涨价"注释,需要长期使用的团队建议提前评估。
八、写在最后
不喊口号,列三条客观启示:
第一,国产大模型的下一个战场是 Agent。语言建模、知识问答这些"考试分数"已经被反复证明,下一步是"在真实环境里长时间、多步骤干活"。V4 Pro 正式版把 Agent 这一维度从"勉强可用"拉到"无短板第一梯队",是这条路径上的一个明确信号。
第二,价格依然是国产模型的最大武器。Pro 版价格是 Flash 的 3 倍,但即便如此,按前沿模型的标准看仍然便宜。配合双 API 兼容 + Responses API,迁移成本几乎为零——这是比参数、分数更"会传染"的护城河。
第三,并发和价格的错位分层。Pro(500 并发 / 3–6 元)与 Flash(2500 并发 / 1–2 元)形成了清晰的产品矩阵:高频大规模走 Flash,复杂 Agent、长任务、长输出走 Pro。这种"分层定价"比单一旗舰模型更适合企业落地。
机器学习算法AI大数据技术
搜索公众号添加: datanlp
长按图片,识别二维码
阅读过本文的人还看了以下文章:
【模型高效部署】tensorrtx 深度解读,yolov11高性能推理实战案例
整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主
基于40万表格数据集TableBank,用MaskRCNN做表格检测
《深度学习入门:基于Python的理论与实现》高清中文PDF+源码
2019最新《PyTorch自然语言处理》英、中文版PDF+源码
《21个项目玩转深度学习:基于TensorFlow的实践详解》完整版PDF+附书代码
不断更新资源
深度学习、机器学习、数据分析、python
搜索公众号添加: datayx

