这是我的第477篇Ai笔记,本篇3100、累计笔记8,438,145
彩蛋:文末给大家准备了一份《DeepSeek V4 Pro Agent实战工具包》,包括模型选择表、Agent实测任务卡和接入配置指南,记得取!
今天凌晨,DeepSeek 又悄悄干了件大事。
没有铺天盖地的发布会,也没有给模型重新起一个花里胡哨的名字,DeepSeek V4 Pro 正式版直接更新到了 API。调用方式基本没变,但背后的模型已经换成了新的正式版本。
而我看完这次更新后的第一感觉是:
DeepSeek 这次真正盯上的,已经不是“谁更会聊天”了,而是谁能让 AI 自己把活干完。
这次更新最值得看的关键词,其实就两个字:Agent。
因为 Preview 和正式版之间的差距,大得甚至有点不像同一个模型。
这两年大家评测大模型,最喜欢看的还是数学、知识问答、编程跑分。
但到了 2026 年,这套东西正在迅速变得不够用了。
因为我们现在越来越少让 AI 单纯“回答一道题”,而是把一个真实任务扔给它:自己看项目、找文件、调用工具、敲命令、处理报错,然后连续干几十分钟甚至几个小时,最后把结果交回来。
模型真正进入 Agent 时代以后,考的已经不只是脑子聪不聪明,还得看它能不能把聪明变成行动。
这也是我觉得 DeepSeek V4 Pro 正式版最有意思的地方。
以前的 V4 Pro 给我的感觉更像一个很聪明的模型;这次正式版,DeepSeek 明显是在疯狂补“干活能力”。
01|这次正式版,到底涨了多少?
先看最夸张的一组数据。
Terminal Bench 从 Preview 版的 72.1,直接冲到了 87.9;DeepSWE 更离谱,从 12.8 干到了 62.7,接近五倍提升。AutomationBench、DSBench、Cybergym 等一系列 Agent 相关评测,也都出现了明显上涨。
这些名字看着很硬核,其实你不用全记。
Terminal Bench 可以简单理解成:把模型扔进真实终端,让它自己装环境、敲命令、解决报错,再想办法把任务真正完成。DeepSWE则更接近真实软件开发,它由113个原创的长周期工程任务组成,需要模型自己理解代码仓库并解决实际工程问题。
所以这波提升真正值得关注的地方在于:
DeepSeek 没有只把考试分数刷高,而是在疯狂训练模型怎么自己干活。
这就很有意思了。
02|它真的已经追上 Fable 5 了吗?
先别急着开香槟。
如果只看部分 Agent 榜单,这次 V4 Pro 的确已经贴得非常近。Terminal Bench 87.9,而材料中 Fable 5 是 88;带工具的 HLE,V4 Pro 达到 60,Fable 5 是 63。
但如果因此直接说“DeepSeek 已经全面追平 Fable 5”,我觉得还是吹过头了。
Fable 5 本身就是 Anthropic 面向高难度推理、长期 Agent 任务推出的旗舰模型,官方给到 1M 上下文,并专门强调复杂、长时间运行任务。
从目前公开的结果来看,V4 Pro 最接近它的地方,恰恰是带工具之后的战斗力。纯知识推理、最困难的软件工程任务,以及长期运行的稳定性,依然还有差距;而且目前 V4 Pro 还是文本模型,没有多模态输入。
所以如果非要给它一个定位,我更愿意叫:
Agent 和 Coding 领域的“准 Fable 级模型”。
这个说法,我觉得更接近现实。
03|真正离谱的,其实还是价格
能力涨成这样以后,我原本以为 DeepSeek 多少得开始收割一波了。
结果一看价格,好家伙,还是熟悉的味道。
目前官方价格是:百万 Token 缓存命中 0.025元,未命中输入 3元,输出 6元;上下文直接给到了 1M,最大输出 384K。Pro 的并发上限是500。
对比一下,Claude Fable 5 官方 API 是百万 Token 输入 10美元、输出 50美元。
当然,不能只拿 Token 单价简单判断模型价值,但当一个 Agent 模型已经摸到第一梯队,同时还保持这种调用成本时,杀伤力就完全不一样了。
尤其是自动化任务。
比如每天跑几十次资料整理、代码检查、数据处理、批量生成、后台 Agent,这类任务最怕的不是一次贵,而是每一天都在烧 Token。
以前你可能舍不得让旗舰模型24小时干这些脏活累活。
DeepSeek V4 Pro 出来以后,这笔账就得重新算了。
而且官方目前已经明确支持 Anthropic API 格式,并提供 Claude Code、GitHub Copilot、OpenCode 等 Agent 和编程工具的接入方式。
所以我觉得,它真正恐怖的地方不是“便宜”。
而是第一次让很多人可以用接近旗舰模型的 Agent 能力,去跑那些以前嫌贵、不舍得跑的长期任务。
夸了半天,该泼的冷水还是得泼。
第一,别被跑分冲昏头。
Terminal Bench 87.9 不代表你的项目扔进去,它就能一次把所有活干漂亮。Agent最终效果还跟工具、上下文、权限、提示词和运行环境绑在一起,同一个模型换一个 Agent 外壳,表现都可能完全不同。
第二,它依然偏科。
目前 V4 Pro 主要还是文本、Coding 和 Agent 路线,没有图像输入;如果你的工作天天涉及图片、截图、设计稿和视频,它很难单独成为全能主力。
第三,便宜也是有代价的。
Pro 当前并发上限只有500,而 Flash 是2500。真要拿它跑高并发生产任务,吞吐量和任务等待时间仍然要自己测试。
还有一点我专门提醒一下:由于正式版刚刚更新,DeepSeek 官方不同文档页面目前仍存在同步时间差。比如最新流传的信息已经提到新的 Responses API 和更多工具接入,但我查到的官方价格页截至发稿前,仍把 V4 Pro 的 Responses API 标记为暂不支持。
所以别急着看一张截图就全量迁移。
最靠谱的办法,永远是拿你自己的真实任务跑一遍。
最后,老规矩,用三句话总结今天这次更新:
DeepSeek V4 Pro 正式版最大的变化不是“更聪明了一点”,而是 Agent 能力出现了一次明显跃升,从会做题进一步走向会干活。
它还没有全面追平 Fable 5,但在工具调用、终端操作和代码 Agent 上,已经真正挤进全球第一梯队。
真正有杀伤力的是“第一梯队能力 + DeepSeek价格”。以后大量后台自动化、异步 Agent 和高 Token 消耗任务,可能真没必要继续全部扔给最贵的旗舰模型。
这才是这次 V4 Pro 正式版真正值得关注的地方。
工具越来越强,问题也随之变成了:
到底什么任务适合交给 V4 Pro?V4 Pro、V4 Flash 和 Fable 5 又该怎么选?以及怎么判断自己的 Agent 到底是真的会干活,还是只会跑分?
所以这次我准备给大家整理一份 《DeepSeek V4 Pro Agent实战工具包》。
里面我会放三份可以直接拿来用的东西:
第一份是 《DeepSeek V4 Pro / V4 Flash / Fable 5任务选择表》,把开发、自动化、长文档、批处理、高并发等常见任务放进去,告诉你不同任务该选哪个模型,避免拿着大炮打蚊子。
第二份是 《Agent真实能力压力测试卡》。我会设计一套真实工作任务,不再只测“写个贪吃蛇”,而是测试读代码仓库、连续修改项目、处理报错、长任务执行、工具调用和失败恢复,大家可以直接拿去测试自己的 Agent。
第三份是 《DeepSeek V4 Pro接入与参数速查指南》,把 API、Claude Code、OpenCode 等接入方式,以及上下文、价格、并发和思考模式整理成一张可以直接照着配置的说明书。涉及仍在更新中的接口,我也会按照官方最新文档持续修正。
扫码回复关键词【V4】,这套《DeepSeek V4 Pro Agent实战工具包》直接发给你。
这次别光看跑分。拿真实工作流狠狠干它一遍,才知道这条鲸鱼到底有多能打。

