Hi,我是绛烨。
这个月DeepSeek 做了两件事。
一是把 V4-Pro 更新到 0813 版本,二是预告 API 要「整体上调,预计涨幅较大」。
消息一出,开发者群里两种声音:一种是「梁文锋也撑不住了」,另一种是「只要能力够强,涨点价也合理」。
我倾向于第二种,但前提是:V4-Pro-0813 的能力,真的配得上更高的定价吗?
为了回答这个问题,我们针对模型的特性设计了一套 5 个高复杂度 case 的评测方案,重点测 DeepSeek-V4-Pro-0813,同时用豆包 Seed-Evolving (也是字节的一个coding模型)做对照。
每个 case 都对应 DeepSeek 官方宣称的能力,并且要求模型输出可视化结果。
SUMMARY
一、DeepSeek-V4-Pro-0813 官方到底说了什么?
在评测之前,先回顾官方口径,避免主观臆测。
DeepSeek 对 V4-Pro-0813 的核心定位是:
当前最佳开源模型,在代码 benchmark 上达到顶尖水平,并在推理和 Agentic 任务上显著缩小与领先闭源模型的差距。
官方强调的关键参数:
这些数字里最值得关注的是三个:1M 上下文、Agentic Coding、MoE 效率,它们构成了 V4-Pro 的核心竞争力。
不过这次我把数据也跑完了。
先把结果摆在前面:5 个 case,每个 case 独立跑 3 次,一共 15 次有效运行,DeepSeek V4 Pro 的综合得分是 77.6/100。
最亮眼的两个是多文档交叉分析和 Dashboard,分别拿到 95.5 和 90.0。
更重要的是,5 个 case 都产出了可以直接审阅的真实文件,说明 V4 Pro 不只是会回答问题,而是已经具备比较完整的复杂任务交付能力。
Workflow Agent 和 TCO 这两项虽然重复运行的一致性还有提升空间,但最好一次已经能跑出相当完整的结果。
所以这轮评测看下来,我觉得 V4 Pro 可以是能力上限已经进入第一梯队,跟顶尖的fable5还是有一点差距。
五大 Case 综合得分与稳定性上面,长文交叉分析与 Dashboard 表现最亮眼,工程型任务也已经展现出很高的能力上限。
SPECS
二、为什么要用高复杂度 case 来测?
话说回来,为什么要做这个测评呢,现在市面上的模型评测,太多是「 Lightweight 」的:写个快排、翻译句话、解道数学题。这些测试能说明模型「聪明」,但说明不了模型「能不能干活」。
所以我们设计的每个 case 接近一定的复杂度,并且要求输出可视化结果,能画图、能生成图表、能把流程理清楚的模型,才是真正理解了任务。
为了尽量避免一次跑得好就算赢,我没有只看最佳样本。
每个 Case 使用独立 workspace,避免前一次运行把代码、文件或结果带到下一次;
每个 Case 连续跑 3 次,一共 15 次有效运行;
代码任务直接跑测试,Markdown / JSON 检查结构和字段,HTML 检查 DOM、数据和交互锚点,图表则检查真实文件和渲染结果;
每个 Case 的综合分按 0.7 × 中位数 + 0.3 × 最低分 计算,不让一次满分把低谷完全盖掉。
我还单独算了一个稳定性,三次运行分差越大,稳定性越低。
这个指标后来比我想象中更有用,因为它能把能力上限和生产可重复性分开看。
好消息是,几个工程型 case 的最好一次都已经非常强,接下来主要是通过测试和约束把高分状态固定下来。
METHOD
三、5 个实际的 case,重点测 DeepSeek-Pro
一、Case 1:促销规则引擎重构
这个case对应了 DeepSeek-v4-pro官方能力:Agentic Coding。
任务是这样的,给一个存在技术债的电商订单系统做重构,把硬编码的促销逻辑抽离成可扩展的规则引擎。
Agentic Coding 不是让模型写一段代码,而是让模型在真实代码库里做工程决策。这个 case 考验的是系统理解能力和架构设计能力。
以豆包 seed-evolving模型作为对照:豆包更擅长快速出原型和前端交互,但在这种偏底层架构重构上,可能不如 DeepSeek 扎实。
实际跑下来的结果,DeepSeek v4 pro工程重构能力已经很能打。
最好的一次很漂亮,它把 `PromotionEngine` 和 `Rule` 扩展点拆了出来,用 JSON 配置驱动规则,金额计算也用了 Decimal,源码、自动化测试和 `ARCHITECTURE.md` 都交齐了。
另外两次运行也基本完成了主体重构,只是在复杂叠加场景的金额结果上出现了偏差,这说明它对架构层的把握已经比较成熟,细节精度还需要用测试进一步锁定。
这项能力已经很接近可用,差的更多是最后一层工程能力。
真要拿它改支付、促销、计费这类核心逻辑,把金额金丝雀用例和组合规则测试加上,就能把这种高上限更稳地固定下来。
二、Case 2:70 万字多文档交叉分析
对应 DeepSeek-v4-pro 官方能力:1M 长上下文
我们这次同时分析三份长文档(公司年报、行业报告、媒体报道,共约 70 万字),交叉验证数据矛盾,分析研发重点转移趋势,并生成折线图、柱状图、桑基图。
现在长上下文不是「能读得长」就够了,还要「读得准」「能跨文档关联」。
实测下来,它不只是把三类材料读完,而是把来源标注、结构化 JSON、中文报告和可复现图表一起交了出来。尤其是在事实—来源—结论这条链上,完整度明显高于其他工程型任务。
Run 2 唯一比较明显的扣分来自字段格式:引文结构本来应该是对象,它写成了字符串。分析本身基本到位,主要是输出规则需要再收紧。
如果你的工作是年报、行业报告、研究材料这种长文档交叉分析,这轮数据基本验证了它确实是 V4 Pro 的强项。
三、Case 3:交互式数据分析 Dashboard
这个case对应 DeepSeek 官方能力,代码生成这块。
给他的任务:根据 12 个月销售数据,生成一个包含 5 种图表、支持联动交互、可排序搜索的响应式 Dashboard。
DeepSeek v4 pro的实际表现,当前版本多模态能力弱,如果给它设计稿截图,它无法处理。
以豆包seed-evolving模型支持视觉输入,如果给它 Dashboard 设计稿,还原度会更高,这是豆包的明显优势(如下)。
Run 2 满分通过了全部锚点和交互校验,KPI、收入趋势、三产品堆叠、双 Y 轴、占比、数据表、筛选和重置都在一个单文件 Dashboard 里完成。
Run 1 和 Run 3 各少了 10 分,主要集中在响应式静态规则检查,核心数据、图表、交互和单文件交付都保持完整。
这说明 V4 Pro 做前端数据产品时,核心逻辑和交付完整度已经相当不错,再补上移动端断点和真实浏览器截图回归,基本就是一套很标准的上线前工程流程。
四、Case 4:新员工入职自动化工作流
对应 DeepSeek 官方能力:Function Calling / Tool Calls
给它的一个实际任务:设计一个 10+ 步骤的入职流程,涉及 AD 账号、硬件分配、邮箱别名、权限组、经理通知,任何一步失败都要回滚。
作为对照组,豆包有现成工具链,搭建工作流更顺滑,但灵活度不如 DeepSeek。
实际测下来,Run 2 可以把 AD、硬件、邮箱、群组、通知串成完整工作流,失败后按已完成步骤逆序补偿,成功、AD 失败、群组部分失败、幂等等测试也都有。
另外两次运行也把主体流程跑了出来,只是在短路、补偿触发和幂等性这些边界条件上还有差异。
这个 case 反而让我更看好它的 Agent 潜力:完整链路已经能跑通,下一步主要是把边界条件工程化。 如果要进企业流程,把故障注入、补偿幂等和状态快照放进 Harness,就能把最好一次的表现更稳定地复现出来。
五、Case 5:智能客服系统 TCO 分析
对应 DeepSeek 官方能力:MoE 效率、极致性价比
给他的任务四:为一个日均 100 万次咨询的智能客服系统做总拥有成本分析,并生成多种成本对比图表。
成本是 DeepSeek 最大的标签之一,要用真实场景验证它到底便宜多少。
Case 5 的表现比较特别。三次分别是 15 / 65 / 75,综合分 50.0。虽然整体分数不算高,但最好一次已经能完整覆盖大部分 TCO 建模链路,说明它并不是不会做,而是对复杂口径的依赖比较强。
最好的一次已经能把日/月/年 Token 成本、混合架构和图表完整做出来。后两次也覆盖了大部分核心内容,只是在峰值并发口径、人工兜底和文件命名等细节上没有完全对齐验收项。
这反而说明一个很现实的问题:模型本身的低成本优势是成立的,而复杂 TCO 计算最好配合固定公式和业务口径一起使用。
所以涉及预算、SLA、容量和财务决策时,我会把价格表、公式和字段 Schema 固化到代码里,再让模型负责推演、解释和方案比较。这样更能发挥它的分析能力,也更符合企业真实使用方式。
ENGINE
四、DeepSeek-Pro 的能力雷达
基于官方特性和 5 个 case 的设计,可以画出 V4-Pro-0813 的能力画像:
如果只看官方能力,我会把长上下文、Coding、Agent、成本都放在强项里;跑完这轮之后,我更愿意再加一个维度:能力上限已经到哪一步,以及离稳定生产还有多远。
虽然这篇文章主角是 DeepSeek v4 pro,但豆包Seed-Evolving不是陪跑。在以下场景,豆包Seed-Evolving明显更优:
1. 前端/UI 任务:多模态输入让它能看图改代码;
2. 字节生态内:Trae、扣子、飞书、火山引擎已经打通;
3. 快速搭建 Agent:工具链完整,不用自己造轮子;
DeepSeek V4-Pro-0813 是「给技术团队的基础设施」,豆包Seed-Evolving是「给字节生态用户的生产工具」。
CONTEXT
写在最后
DeepSeek-V4-Pro-0813 在几个最关键的维度上做到了顶尖:长上下文、代码能力、Agent 能力、成本控制。
对于需要这些能力的技术团队和企业来说,它是一个非常有竞争力的选项。
豆包 Seed-Evolving 则是另一个路线上非常成功的模型,它更适合已经身处字节生态、需要快速落地、重视多模态的用户。
我是绛烨,热衷于分享 AI 观察与干货。
如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。

