大数跨境

实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新

实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新 极客公园
2026-08-13
15
导读:大鲸鱼的旗舰终于补完了最大的短板。
DeepSeek V4 Pro 正式版悄然上线,补齐了其在 Agent 能力上的关键短板。

作者|桦林舞王

编辑|靖宇

8 月 13 日凌晨,DeepSeek 官网在未发布预告及更新日志的情况下,悄然将 API 文档中的模型指纹更新为 fp_v4pro_20260812,标志着 DeepSeek V4 Pro 正式版正式上线。

自 4 月 24 日预览版发布至今历时 111 天。在此期间,竞品 Kimi K3 高调发布,V4 Flash 正式版亦先行上线,加之 API 涨价预期悬而未决,市场对 Pro 版正式版的问世关注已久。

架构未变,Agent 能力显著跃升

V4 Pro 正式版保持了与预览版一致的模型架构:1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文窗口及 384K 最大输出。核心升级在于后训练阶段,其变化幅度堪比模型重构。

评测数据显示,该版本在 Agent 相关基准测试中表现惊人:DeepSWE(软件工程基准)得分从 12.8 飙升至 62.7;Cybergym 从 52.7 提升至 83.3;Terminal Bench 达到 87.9;DSBench-Hard 更是翻倍至 67.2。这些测试主要涵盖长链路代码修改、环境操作及工具调用,正是此前预览版的薄弱环节。

DeepSeek V4 Pro 正式版 Agent 能力大幅增强|图片来源:DeepSeek

结合 V4 Flash 正式版的更新策略推断,此次升级核心在于面向代码 Agent 场景的大规模后训练,成功弥补了预览版在复杂任务执行上的不足。

定价方面,目前仍维持输入 3 元/百万 token、输出 6 元/百万 token 的标准,与预览版持平。尽管官方已预告近期将上调 API 价格,但新版暂未调整,开发者可把握当前窗口期。

实测表现:天花板与特性分析

为验证模型在“一次性生成完整可运行代码”方面的实际水平,进行了三项不同维度的实测。

复杂逻辑与实时渲染任务

在"Boids 群体涌现模拟”任务中,要求实现包含物理模拟、实时渲染及 UI 设计的综合功能。V4 Pro 耗时约 170 秒,生成 761 行完整 HTML 代码。运行结果显示,200 个粒子的群体行为流畅,交互控制正常,代码一次通过。

模糊需求的产品化补全

针对“好看的番茄钟工作面板”这一模糊指令,模型不仅实现了基础计时功能,还自主添加了任务标签、统计图表、快捷键支持及白噪音合成等特性,共输出 1223 行代码。这表明其对模糊需求的理解与产品化补全能力较预览版有显著提升。

Thinking 模式的资源占用特征

在“寻路算法可视化”这一高代码量任务中,默认开启 Thinking 模式导致模型消耗了大量 Token 用于推理(约占输出的 80%),致使实际代码生成被截断。关闭该模式后,模型在 54 秒内即可输出完整且功能健全的 715 行代码。

实测表明,Thinking 模式在复杂代码生成场景中可能存在资源挤占问题。对于需要大段代码输出的任务,建议开发者主动关闭该模式或大幅提高 max_tokens 阈值。

市场定位与生态布局

从绝对性能来看,V4 Pro 正式版尚未在所有维度实现全面碾压。在 HLE 无工具测试及 NL2Repo 等纯知识推理和复杂软件工程任务上,其得分略低于 Claude Opus 4.8 及部分竞品。

然而,DeepSeek 的核心竞争优势依然稳固:在 Agent 能力大幅提升至可与头部闭源模型抗衡的同时,其定价仅为竞品的十分之一至三分之一。这种“高性价比 + 强 Agent 能力”的组合,极大提升了其市场竞争力。

更值得关注的信号来自 V4 Flash 更新日志中提及的"DeepSeek Harness 极简模式”。结合相关团队注册信息推测,DeepSeek 正计划推出集成模型与 Agent 运行框架的一体化解决方案。这意味着行业竞争焦点将从单一的“模型智力”转向“系统级执行力”,即构建能真正替代人工完成复杂任务的智能体系统。

V4 Pro 正式版的发布标志着其“大脑”环节已基本完善,市场后续将重点关注其 Agent 框架系统的落地进程。

*头图来源:AI 生成

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

【声明】内容源于网络
0
0
极客公园
用极客视角,追踪你最不可错过的科技圈。
内容 929
粉丝 0
极客公园 用极客视角,追踪你最不可错过的科技圈。
总阅读42.2k
粉丝0
内容929