大数跨境

DeepSeek-V4-Pro正式版实测:山不在高,有“梁”则灵

DeepSeek-V4-Pro正式版实测:山不在高,有“梁”则灵 光子星球
2026-08-13
3
导读:即便涨价,依然极具性价比


撰文 | 高晓阳

编辑 | 郝鑫

DeepSWE 基准得分从 12.8 跃升至 62.7,提升幅度约 4.9 倍。这是 DeepSeek 官方给出的 V4-Pro 正式版(版本号 0813)在软件工程智能体能力上的核心数据。

8 月 12 日晚,该模型悄然上线 DeepSeek API 文档,未举行发布会或发布官宣推文。

定价策略上,DeepSeek V4-Pro 定位高端走量,价格显著高于 V4-Flash。按每 1M token 计算:缓存命中输入 0.025 元,未命中输入 3 元,输出 6 元。相比之下,V4-Flash 分别为 0.02 元、1 元和 2 元。输出 Token 价格涨幅达三倍,输入未命中价格同样翻三倍。

官方对此直言不讳:“计划近期整体上调 DeepSeek API 服务定价,预计涨幅较大”。

为验证其涨价底气,我们采用社区最新的复杂测试手法进行实测。结论显示:此次升级在前端审美与 Agent 执行力上实现质变,但在部分基础逻辑(如“鹈鹕骑自行车”及月亮生成)仍存在偶发性 Bug。

一个悄悄上线的新版本

V4-Pro 并非全新模型,而是此前 Preview 版本的正式转正。自今年 4 月发布以来,历经三个多月打磨,最终以日期"0813"命名正式版。

技术参数方面实现多项突破:支持 1M 上下文长度,输出上限提升至 384K Token;默认开启思考模式(Thinking),同时兼容 Non-thinking 模式;接口全面兼容 OpenAI 与 Anthropic 格式,接入 Claude Code 等 Agent 框架仅需替换 base_url

官方的叙事,换了一个词

相比参数堆砌,官方叙事重心从“更会答题”转向“更会把一件事干完”。DeepSWE 从 12.8 提升至 62.7,标志着评测维度从“代码片段生成”升级为“持续工程化作业能力”。

九项 Agent 与代码基准全线大涨:Terminal Bench 2.1(终端操作)达 87.9,Cybergym(网络安全)升至 83.3,NL2Repo(自然语言转仓库)涨至 61.5。相较于 Preview 版本,各项指标均有显著提升。

社区对此存在不同声音。有开发者认为 0813 版本略逊于 Luna MX,或部分基准落后于 Kimi K3。由于官方尚未发布完整 Benchmark 报告,第三方实测验证显得尤为关键。

考题换代,从鹈鹕到指环王

测试方法论正在经历迭代。Anthropic 的 Karpathy 提出应告别“鹈鹕骑自行车”类简单测试,转向高复杂度任务。此前 Opus 5 在《指环王》场景生成中耗时 2 小时产出 5500 行代码,虽有效果但存在穿模问题;而 DeepSeek V4 Flash 复现时则出现人物漂浮等明显瑕疵。

本次实测避开基础能力考察,直接接入 Claude Code 的 Anthropic 兼容接口,在真实 Agent 环境中执行 7 项递进式任务:从旧基准“鹈鹕”到新基准“指环王 3D 世界”,再到长周期工程任务。

第一道题,它就翻车了

在经典的“鹈鹕骑自行车”SVG 生成测试中,0813 版本表现不佳。尽管踏板与车轮连接,但车架结构违背物理常识,且云朵方向错误。即便降低推理强度,问题依旧存在。

此类低级失误在 Kimi K3 等模型中也偶有发生,提示我们在关注高光时刻的同时,不可忽视模型在简单逻辑上的稳定性波动。

60 种风格,一张墙

第二项测试要求在一个 HTML 文件中生成包含 60 种设计风格的 Bento 卡片墙,且每种风格需体现典型视觉语言,严禁仅换色敷衍。

0813 一次性通过测试,60 种风格完整呈现,不规则拼贴执行严格。玻璃拟态与粗野主义等截然不同的风格被精准捕捉并并列展示,证明其对设计语料的理解已超越死记硬背。

把一段文字变成一部动画

第三项测试为前端动画叙事:将“老水手夜晚等船”的文字描述转化为自动播放、镜头推进的循环动画页面。

模型交出了完整的叙事作品,画风、节奏与镜头运镜把控得当,文字排版精致且随场景动态出现。唯独月亮绘制再次出现错误,与第一题的鹈鹕问题形成呼应,显示出特定图形生成的不稳定性。

这次,配色终于不像 AI 了

第四项测试为 Three.js 3D 打砖块游戏,要求机制闭环、UI 美观且手感流畅。

测试结果令人印象深刻:游戏逻辑完整,碰撞检测准确,无穿模现象。更重要的是,配色方案摆脱了以往 AI 生成的“蓝紫渐变 + 玻璃拟态”刻板印象,音效与操作反馈均达到顶级模型水准。

让 AI 搭一个中土世界

第五项测试复刻 Karpathy 的新基准:基于《指环王》开篇描述,用 Three.js 构建霍比屯 111 岁生日宴会的 3D 世界。

0813 在有限输入下,成功构建了洞屋、长桌、宾客及烟火等要素,无漂浮或穿模现象。运镜从俯瞰推近至角色特写,效果与 Opus 5 单场景表现相当,证明国产模型在新赛道上并未掉队。

1.5 小时,一座浮岛

压轴测试要求使用 React Three Fiber 构建 3D 浮岛创意网站,涵盖滚动驱动相机、四章节叙事、物件交互及移动端适配等复杂需求。

0813 耗时 1.5 小时完成,并在最后半小时自行测试修复,最终交付零 Bug 版本。转场、运镜及交互体验极佳,仅在初始界面存在轻微过曝问题。

对比历史成绩,0813 在 V4-Flash 基础上补齐了运镜与交互短板,性能表现扎实,印证了其高性能定位。

它能连续干完一件事吗

最后一项测试聚焦长周期工程能力:从零搭建全栈记账本应用,连续完成三轮迭代(核心功能、统计分类、预算提醒),每轮均需修改多文件、运行测试并自主修复 Bug。

模型全程自主完成三轮迭代,测试不通过即自动修复,无需人工介入。这种“稳稳接住需求”的工程化能力,是其作为 Agent 的核心竞争力。

一个可能被低估的版本

综合七项测试,0813 版本展现出超越官方基准的立体画像:

  • 前端审美质变:从配色到运镜,彻底告别"AI 感”,跻身顶级模型行列。
  • 创意任务高分:复杂 3D 场景构建零失误,单场景表现媲美国际顶尖模型。
  • 工程能力扎实:具备测试闭环与自修 Bug 能力,真正实现了“连续干活”。

尽管在鹈鹕与月亮等简单图形上存在偶发失误,但瑕不掩瑜。随着 Grok 4.6 等竞品的发布,大模型行业正集体转向高性能、高价值路线。对于 DeepSeek V4-Pro 而言,即便价格上涨,其展现出的综合实力依然极具性价比。

【声明】内容源于网络
0
0
光子星球
细微之处,看见未来
内容 1148
粉丝 0
光子星球 细微之处,看见未来
总阅读83.6k
粉丝0
内容1.1k