DeepSeek V4 Pro、原生 Harness、GLM-5.3
三天,三发,三记重锤。
8 月 12 日深夜,DeepSeek V4 Pro 正式版悄然上线 API 文档;8 月 13 日,DeepSeek Harness 开发者预览版发布并开源;8 月 14 日,智谱 GLM-5.3 闪亮登场。
国产 AI 在 2026 年这个盛夏,打出了一套教科书级别的组合拳——模型、框架、生态,一个都没落下。
距 Fable 5 仅差 0.1 分
从 12.8 飙升 · 近 5 倍
反超 Fable 5 的 83.1
最大输出 38.4 万 Token
8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版,V4 Pro 从预览版切换为正式版(DeepSeek-V4-Pro-0813)。这一次,它摸到了全球大模型的性能天花板。
Terminal-Bench 2.1(终端操作能力测试):V4 Pro 拿到 87.9 分,全球第一的 Claude Fable 5 是 88.0 分——差距只剩 0.1 分。三个月前,V4 Pro 预览版这个成绩还只有 72.1 分。三个月,跃升 15.8 分。
更狠的是两项反超。网络安全攻防测试 CyberGym 上,V4 Pro 以 83.3 分压过 Fable 5 的 83.1;自动化工作流测试 AutomationBench 上,31.8 对 29.1,V4 Pro 直接赢。衡量软件工程能力的 DeepSWE,从 12.8 分飙到 62.7 分——近五倍跃升,超过了 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分。
这不是纸面题库的分数内卷。Terminal-Bench、DeepSWE 这类评测,考察的是 AI 能不能真正"干活"——自主进入终端装环境、敲命令、排查报错,读懂完整代码仓库、处理复杂工程问题、调用多步工具完成长链条任务。
换句话说,DeepSeek 这次补上的不是"考试分数",是真实场景的战斗力。
核心规格方面,100 万 Token 上下文窗口,最大输出 38.4 万 Token,默认开启思考模式,支持 low/high/max 三档思考强度调节。同时兼容 OpenAI 和 Anthropic 两套 API 格式,支持 JSON Output、Tool Calls、Responses API,可直接导入 Codex 使用。
价格方面,¥3/百万输入,¥0.025 缓存命中,¥6/百万输出。8 月 17 日起采用峰谷定价,空闲时段半价。而 Claude Fable 5 的 API 价格是 V4 Pro 的60 倍。
0.1 分的性能差,
60 倍的价格差。
如果说 V4 Pro 是"灵魂",那 DeepSeek Harness 就是给它造了一个"身体"。
8 月 13 日,DeepSeek Harness 开发者预览版上线并开源。这是 DeepSeek 自研的 Agent 框架,类似 Claude Code,命令行缩写是 dsh。
核心设计原则只有一条:一切皆插件。模型接入、工具注册表、会话日志、审批策略,甚至驱动智能体运转的主循环本身——这个 harness 的一切,全部都是插件。你想换搜索引擎?改个配置就行。想接自己公司的模型服务?改个配置就行。给系统加功能就是挂一个新插件,卸载时注册的一切自动撤销,不留残余。
技术上,Harness 基于具有"时空可组合性"的 Cordis 插件系统构建。Cordis 作为元框架,只负责插件的加载与卸载以及依赖关系,Agent Harness 的所有具体组件都是不同的 Cordis 插件。插件通过服务与事件彼此协作,并可以在配置层自由组合。
Harness 提供四种随附模式:标准模式(功能完整的编程智能体)、PTC 模式(程序化工具调用,一段代码跑完多步任务)、极简模式(两个工具,适合基准测试)、创造模式(用自然语言创建自定义 Agent Preset)。多智能体协作方面,subagent 可续跑的后台子代理,工作流引擎通过脚本确定性地编排多个子代理,Ralph 循环反复试直到通过。
安全与治理方面,三大桌面平台各自使用操作系统原生隔离机制——Linux 用 bwrap/Landlock,macOS 用 Seatbelt,Windows 用 ACL 受限令牌。沙箱分三档:read-only、workspace-write、danger-full-access。密钥不进日志,数据默认留在本地。生态上支持 MCP 协议,任何 MCP 服务器都可以接入;Hooks 桥让 Claude Code 和 Codex 的钩子脚本直接可用。
一行命令启动:npx @deepseek-ai/dsh web。内测期间,用户们已经玩出了花——同花顺皮肤、娘化皮肤、Excel 皮肤、复古 XP 皮肤,甚至还有人做了表情包插件和小游戏插件。这些皮肤和插件全部是独立插件,即插即用。
昨儿 DeepSeek V4 Pro+Harness、Grok 4.6"你方唱罢",今儿 GLM-5.3 闪亮登场。一出手便杀回开源一哥、国模一哥,甚至在 Coding 方面更加接近 Claude Fable 5。在多项主流基准测试中,GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5。
两个关键词:Coding 和安全。
Coding 方面,GLM-5.3 在六个 benchmark 中表现都不赖,尤其是 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别——提升主要来自后训练 Scaling。智谱还开源了名为 Slime 的后训练框架,从 GLM 4.5 开始就一直在用。
安全方面,CyberGym 白盒代码审查 GLM-5.3 拿到 84.5%,相比 5.2 的 77.2% 继续提升,成为最强开源安全模型。在 GLM-5.3 发布前两周,智谱联合清华、南开开展了密集的红队测试,累计发现漏洞 2404 个(经过初筛、去重),其中 1088 个为中高危,覆盖 220 个项目。最早的 Bug 可以追溯到 40 年前。
安全实测同样惊艳:7 分钟找出 12 类安全漏洞,9 分 20 秒修完所有 Bug 并补上回归测试(54/54 通过),在无 GPU 的 Mac 上写 CUDA 代码时主动区分 VERIFIED、INFERRED 和 UNVERIFIED——能做的尽量做,没做的明确说没做。
目前 GLM-5.3 已上线 ZCode 和 AutoClaw,WorkBuddy、QwenWork、TraeWork 等第三方平台也开放抢先体验。API 预计下周二开放,模型权重两周内开源。
把这三发放在一起看,你会发现一个清晰的趋势:国产 AI 已经不满足于单一维度的突破,而是在模型能力、Agent 框架、安全生态三个维度同时发力。
DeepSeek V4 Pro 证明了国产模型在性能上已经触摸到全球天花板——0.1 分的差距,几乎可以忽略不计。而 60 倍的价格差,让它在全球市场上拥有了碾压级的性价比。
DeepSeek Harness 解决的是"模型如何落地"的问题。Agent = Model + Harness,模型是灵魂,Harness 是身体。有了这个"一切皆插件"的框架,开发者可以自由组装适合自己的 Agent,而不是被某个闭源生态锁死。
GLM-5.3 则补上了最关键的拼图——安全。当 AI 开始以机器速度写代码、操作系统,安全也得跟上机器速度。GLM-5.3 把 Coding 和安全放在一起强化,因为模型一旦真正开始写工程代码,安全本身就是工程能力的一部分。
梁文锋此前承认"我们跟美国的差距可能是落后美国 12 个月"。但回看这三天——模型性能追平、Agent 框架开源、安全能力领先——这个差距正在以前所未有的速度缩小。
也许用不了 12 个月了。
因为嘉阳从某些消息渠道得知,8 月,国产大模型还会有很多惊艳的更新。大胆猜测下,也许我们对于美国模型的追赶—追平—超越,就在这个 8 月完成!我们一起来拭目以待吧!
模型性能追平、Agent 框架开源、安全能力领先——这三连击之后,你会怎么选?
评论区聊聊你的场景,我会挑几个典型方向展开写。

