大数跨境

正式版发布!DeepSeek-V4-Pro-0813

正式版发布!DeepSeek-V4-Pro-0813 机器学习AI算法工程
2026-08-13
0
导读:向AI转型的程序员都关注公众号 机器学习AI算法工程
图片

向AI转型的程序员都关注公众号 机器学习AI算法工程


8 月 13 日晚,API 价格页的版本号悄悄从 DeepSeek-V4-Pro-Preview 改成了 DeepSeek-V4-Pro-0813。同一时间,DeepSeek 官方群放出那张评测对比表:正式版 vs Preview vs Flash vs GLM-5.2 vs Kimi-K3 vs Opus-4.8 vs Fable 5。

一句话总结这次升级:不是"参数大一点、分数高一截"那种渐进式升级,而是把 Agent 这个维度从"勉强可用"直接拉到了"无短板的第一梯队"

二、V4 Pro 的关键看点

2.1 上下文与输出:1M + 384K 的长任务硬刚需

正式版的规格是这样的:

  • 上下文窗口:1,000,000 tokens(约等于 3–4 本中等长度的英文书,或一个中型代码仓库的全文)
  • 最大输出:384,000 tokens(一次性可以生成大约 20 万汉字)
  • 双模式:thinking 模式 + 非 thinking 模式,默认开启思考

通俗解释:1M 输入 + 384K 输出的组合,在国产模型里属于头部水平。它真正解决的问题不是"聊天聊得长",而是长文档摘要、长代码库重构、多步骤 Agent 任务——这类任务需要的不是"上下文大一点",而是"一次调用就能吞下、还能吐回足够多"的硬规格。

2.2 接入方式:OpenAI、Anthropic 双兼容 + Responses API

对开发者更友好的是这次在接口层面下了狠功夫:

  • OpenAI 格式
    :原来就支持,base_url 不变,把 model 改成 deepseek-v4-pro 即可。
  • Anthropic 格式
    :通过 api.deepseek.com/anthropic 端点接入,原本基于 Claude 构建的 Agent 应用可以近乎零成本迁移
  • Responses API
    :正式支持,可直接接入 Codex 类工具。
  • Tool Calls / JSON Output
    :原生结构化输出。
  • FIM 补全
    (Beta):仅在非思考模式下可用,适合 IDE 补全场景。
  • 对话前缀续写
    (Beta):长对话场景下的连续性优化。

关键信号:DeepSeek 在 OpenAI 之外主动兼容 Anthropic 格式,意思是"无论你之前栈在 OpenAI 还是 Claude 上,都不需要重写"。这背后是过去半年国产模型在 Agent 工程栈上"挖人"的现实——能不能让现有 Agent 框架无缝切换,决定了能不能吃到迁移红利。

三、技术创新点

官方没公布完整技术报告,但从评测表和功能清单可以反推出五个着力点:

3.1 Agent 能力"从 12.8 到 62.7"的大幅跃升

DeepSWE(软件工程类)从 Preview 的 12.8 跳到正式版 62.7,AutomationBench 从 12.8 到 31.8,DSBench-Hard 从 31.1 到 67.2——这不是单点优化能解释的,整套 Agent 后训练管线大概率换了基底

3.2 长上下文与长输出的协同

1M 输入 + 384K 输出不是孤立的两个数字,它们决定了 Agent 在长任务里能"装得下、吐得出"。384K 的输出能力意味着 Agent 一次性可以给出大段代码或多步计划而不被截断。

3.3 双 API 兼容 + Responses API

兼容 OpenAI 与 Anthropic 双格式,再加 Responses API,是工程层面的"开放式生态"策略——把迁移成本压到接近零,把竞品的开发者拉进来。

3.4 双模式(思考 / 非思考)

思考模式适合复杂推理和 Agent 规划;非思考模式适合延迟敏感的补全 / 短回复场景。FIM 补全只在非思考模式下开放,验证了这一分层逻辑。

3.5 价格与并发的明确分层

Pro 与 Flash 在价格和并发上"错位竞争",形成清晰的产品矩阵——这一点我们下文第六节展开。

四、技术原理:评测分数为什么能翻这么多倍

虽然官方没发布技术报告,但横向对比下来,能从评测维度看出一些线索:

一句话:这次升级的核心战场是"在真实环境里长时间、多步骤地完成任务",也就是 Agent 这一维度,而不是单纯的语言建模或世界知识。

从评测名字就能看出来——Terminal Bench(终端操作)、DeepSWE(软件工程)、NL2Repo(自然语言到仓库)、Cybergym(安全攻防)、Toolathlon-Verified(工具调用)、AutomationBench、DSBench-FullStack / Hard——全部是 Agent 任务,没有一个是传统选择题或文本生成题。

DeepSWE 从 12.8 到 62.7 这种跃升,最可能来自:

  • Agent 后训练数据的规模化
    :大量合成或采自真实仓库的工具调用轨迹。
  • 规划 / 反思能力
    :让模型在多步骤任务里能自我检查、回溯。
  • 长上下文利用率
    :1M 上下文 + 384K 输出让模型能"看到全部代码、吐出完整计划"。
  • 工具调用稳定性
    :Tool Calls、JSON Output、Responses API 的稳定性提升,减少 Agent 流程中断。

通俗解释:如果说老模型是"考试分数高但不会干活"的学生,正式版是"考试分数同样高、还能在真实公司里干活的实习生"——后者需要的是长期记忆、动手能力、抗干扰能力,而不是再多刷几道题。

五、技术成果:评测对比一览

下面是来自 DeepSeek 官方公布的对比表:


1. V4-Pro 正式版没有任何一项掉出第一梯队。单项未必全第一(Terminal Bench 输给 Kimi-K3 0.4 分,DeepSWE 输给 Kimi-K3 4.8 分、输给 Fable 5 7.3 分),但 Agent 这一维度的"无短板"才是最难做到的。
2. Preview 到正式版不是渐进式升级,是跃迁。DeepSWE 12.8→62.7、AutomationBench 12.8→31.8、DSBench-Hard 31.1→67.2、Cybergym 52.7→83.3——单看任一项,都不是常规后训练能解释的幅度。
3. 最强的对手是 Fable 5,但二者定位不同。V4 Pro 在 HLE w/tools 上拿到 60.0,仅次于 Fable 5 的 63.0;Cybergym 上甚至以 83.3 vs 83.1 微超;AutomationBench 上 31.8 vs 29.1 反超。剩下几项里 Fable 5 仍占优,但差距已经小到"按场景选"的级别。

六、价格与并发:Pro 与 Flash 的"错位分工"

价格表如下(单位:元 / 百万 tokens):

档位
缓存命中输入
缓存未命中输入
输出
并发上限
DeepSeek-V4-Pro-0813
0.025
3
6
500
DeepSeek-V4-Flash-0731
0.02
1
2
2500

几个值得注意的事实:

  • 输入未命中从 1 元涨到 3 元,输出从 2 元涨到 6 元
    ,都是 Flash 的 3 倍。
  • 缓存命中价格几乎没变(0.02 → 0.025),意味着只要善用上下文缓存,真实成本远低于"裸价"
  • 并发限制从 2500 降到 500
    ——能力越强、算力越贵,官方在用并发做隐形队列管理。
  • 价格页下方挂了一条重要注释:"计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大"——这比 Pro 版转正本身更值得长期用户关注。

通俗解释:Pro 版不是用来"刷量"的,是用来啃硬骨头的;日常对话、轻量编程、批量任务继续用 Flash。想让真实成本接近定价表的"标价",必须把上下文缓存用起来,否则 3 元/百万 输入 + 6 元/百万输出 会很疼。

七、实战代码案例

7.1 OpenAI 兼容接口调用

from openai import OpenAI  client = OpenAI(     api_key="YOUR_DEEPSEEK_KEY",     base_url="https://api.deepseek.com", )  resp = client.chat.completions.create(     model="deepseek-v4-pro",          # 正式版默认走 thinking 模式     messages=[         {"role": "system", "content": "你是一个严谨的助手。"},         {"role": "user",   "content": "用 Python 写一个 1M tokens 滑动窗口分块器。"},     ],     max_tokens=8192,     # 想要非思考模式时,把 model 换成 deepseek-v4-pro-no-think 即可 )  print(resp.choices[0].message.content)

7.2 Anthropic 兼容接口调用

from anthropic import Anthropic  client = Anthropic(     api_key="YOUR_DEEPSEEK_KEY",     base_url="https://api.deepseek.com/anthropic", )  msg = client.messages.create(     model="deepseek-v4-pro",     max_tokens=4096,     messages=[         {"role": "user", "content": "把这份 50 万字的合同总结成 20 条风险点。"}     ], ) print(msg.content[0].text)

7.3 长上下文 + 缓存命中(真实成本最低的姿势)

# 长文档场景:把同一份系统提示 + 同一份长文档作为 prefix, # 后续请求命中 prefix cache,输入按 0.025 元/百万 tokens 算。 SYSTEM_PROMPT = "你是合同审查助手,按风险等级标注每一处异常。" DOC = open("contract.txt", encoding="utf-8").read()    # ~ 800k tokens  for q in [     "总结违约责任相关条款。",     "找出所有金额超过 100 万的付款节点。",     "把所有'不可抗力'定义列出来。", ]:     resp = client.chat.completions.create(         model="deepseek-v4-pro",         messages=[             {"role": "system",  "content": SYSTEM_PROMPT},             {"role": "user",    "content": f"{DOC}\n\n问题:{q}"},         ],         max_tokens=8192,     )     print(q, "→", resp.choices[0].message.content[:80], "...")

7.4 Tool Calls / JSON Output(Agent 场景)

import json from openai import OpenAI  client = OpenAI(api_key="YOUR_DEEPSEEK_KEY",                 base_url="https://api.deepseek.com")  resp = client.chat.completions.create(     model="deepseek-v4-pro",     messages=[         {"role": "system",          "content": "你可以调用 read_file 工具读取用户文件。"},         {"role": "user",          "content": "读 ./repo/main.py,告诉我它导入了哪些模块。"}     ],     tools=[{         "type": "function",         "function": {             "name": "read_file",             "description": "读取本地文件",             "parameters": {                 "type": "object",                 "properties": {"path": {"type": "string"}},                 "required": ["path"],             },         },     }],     tool_choice="auto",     response_format={"type": "json_object"},   # 强制 JSON 输出 )  print(json.dumps(resp.choices[0].message.tool_calls, ensure_ascii=False, indent=2))

几个落地贴士:
• 想让成本接近"标价",必须复用同一份长 prefix,否则走的是 3 元/百万 输入。
• 并发只有 500,高 QPS 场景上 Flash(并发 2500)。
• FIM 补全仅在非思考模式可用:model="deepseek-v4-pro-no-think"
• 长输出任务记得显式给 max_tokens,避免 384K 上限被默认截断。
• 价格页已挂"近期整体涨价"注释,需要长期使用的团队建议提前评估

八、写在最后

不喊口号,列三条客观启示:

第一,国产大模型的下一个战场是 Agent。语言建模、知识问答这些"考试分数"已经被反复证明,下一步是"在真实环境里长时间、多步骤干活"。V4 Pro 正式版把 Agent 这一维度从"勉强可用"拉到"无短板第一梯队",是这条路径上的一个明确信号。

第二,价格依然是国产模型的最大武器。Pro 版价格是 Flash 的 3 倍,但即便如此,按前沿模型的标准看仍然便宜。配合双 API 兼容 + Responses API,迁移成本几乎为零——这是比参数、分数更"会传染"的护城河。

第三,并发和价格的错位分层。Pro(500 并发 / 3–6 元)与 Flash(2500 并发 / 1–2 元)形成了清晰的产品矩阵:高频大规模走 Flash,复杂 Agent、长任务、长输出走 Pro。这种"分层定价"比单一旗舰模型更适合企业落地。


机器学习算法AI大数据技术

 搜索公众号添加: datanlp

图片

长按图片,识别二维码


阅读过本文的人还看了以下文章:


YOLO实时定位,Qwen3-VL-Seg深度诊断,两者协同完成从"看见"到"看懂"再到"审断"的AI质检全链路
GPT-4o做大脑,Qwen2-VL做眼睛,让无人机+无人船自动巡检港口
NVIDIA开源LocateAnything深度解读:3B参数,比Qwen3-VL快10倍,最强3B视觉定位大模型来了
本地部署AI Agent,6G显存跑Qwen3.6-35B-A3B 从入门到实战全流程
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
汇集所有大模型架构图!大模型架构演进全解析
98%准确率!这个双分支AI模型,精准识别木薯叶病害(附代码)
2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
14.7M参数,小目标AP达到13.9%!FSDETR用频空融合重新定义目标检测
skill刚开源就斩获 1.7K Star!web-access让AI真正"上网"
Qwen3.5实战教程:从0到1掌握本地部署与微调
引入小目标注意力模块改进YOLO12用于无人机视角下的岸边人员玩水检测
pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包
next-ai-draw-io 用这款AI 画图几十秒就搞定了
10 万文档 RAG 落地实战:从 Demo 到生产,我踩过的所有坑
最强一键抠图19Kstar 的 Rembg 开源神器
YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码
基于DINOv2和SAM2改进的U-Net模型
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
最新视觉大模型 DINOv3论文精读(逐段解析)
医学影像数据集汇总(持续更新)150个
【医学影像分割】UN-SAM:一种高效且通用的细胞核分割模型
小目标检测难点分析和解决策略

【模型高效部署】tensorrtx 深度解读,yolov11高性能推理实战案例

实时语义分割ENet算法,提取书本/票据边缘


整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主


《大语言模型》PDF下载


动手学深度学习-(李沐)PyTorch版本


基于40万表格数据集TableBank,用MaskRCNN做表格检测


《基于深度学习的自然语言处理》中/英PDF


Deep Learning 中文版初版-周志华团队


【全套视频课】最全的目标检测算法系列讲解,通俗易懂!


《深度学习入门:基于Python的理论与实现》高清中文PDF+源码


python就业班学习视频,从入门到实战项目


2019最新《PyTorch自然语言处理》英、中文版PDF+源码


《21个项目玩转深度学习:基于TensorFlow的实践详解》完整版PDF+附书代码


《深度学习之pytorch》pdf+附书源码


《Python数据分析与挖掘实战》PDF+完整源码



不断更新资源

深度学习、机器学习、数据分析、python

 搜索公众号添加: datayx  

图片

【声明】内容源于网络
0
0
机器学习AI算法工程
计算机视觉、自然语言处理、推荐系统、人工智能、大模型、深度学习、机器学习、大数据技术社区,分享各类算法原理与源码、数据处理、可视化、爬虫、竞赛开源代码等资源。
内容 1570
粉丝 1
机器学习AI算法工程 计算机视觉、自然语言处理、推荐系统、人工智能、大模型、深度学习、机器学习、大数据技术社区,分享各类算法原理与源码、数据处理、可视化、爬虫、竞赛开源代码等资源。
总阅读41.9k
粉丝1
内容1.6k