大数跨境

再现AI盛夏3连击:DeepSeek V4 Pro、原生Harness、GLM-5.3

再现AI盛夏3连击:DeepSeek V4 Pro、原生Harness、GLM-5.3 吴嘉阳跨境电商营销研究者
2026-08-15
48
导读:AI 盛夏三连击 · 2026年8月
AI 盛夏三连击 · 2026 年 8 月DeepSeek · 智谱
再现 AI 盛夏 3 连击:
DeepSeek V4 Pro、原生 Harness、GLM-5.3
三天,三发,三记重锤。8 月 12 日 DeepSeek V4 Pro 正式版上线,8 月 13 日 DeepSeek Harness 开源发布,8 月 14 日智谱 GLM-5.3 登场——模型、框架、生态,一个都没落下。

2026 年 8 月,AI 盛夏

天,三发,三记重锤。

8 月 12 日深夜,DeepSeek V4 Pro 正式版悄然上线 API 文档;8 月 13 日,DeepSeek Harness 开发者预览版发布并开源;8 月 14 日,智谱 GLM-5.3 闪亮登场。

国产 AI 在 2026 年这个盛夏,打出了一套教科书级别的组合拳——模型、框架、生态,一个都没落下。

DeepSeek V4 Pro 正式版性能跃升BY THE NUMBERS
87.9
Terminal-Bench 2.1
距 Fable 5 仅差 0.1 分
62.7
DeepSWE 软件工程
从 12.8 飙升 · 近 5 倍
83.3
CyberGym 安全攻防
反超 Fable 5 的 83.1
100 万
Token 上下文窗口
最大输出 38.4 万 Token

SECTION 01
第一击:0.1 分之差,60 倍价差

8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版,V4 Pro 从预览版切换为正式版(DeepSeek-V4-Pro-0813)。这一次,它摸到了全球大模型的性能天花板。

Terminal-Bench 2.1(终端操作能力测试):V4 Pro 拿到 87.9 分,全球第一的 Claude Fable 5 是 88.0 分——差距只剩 0.1 分。三个月前,V4 Pro 预览版这个成绩还只有 72.1 分。三个月,跃升 15.8 分。

更狠的是两项反超。网络安全攻防测试 CyberGym 上,V4 Pro 以 83.3 分压过 Fable 5 的 83.1;自动化工作流测试 AutomationBench 上,31.8 对 29.1,V4 Pro 直接赢。衡量软件工程能力的 DeepSWE,从 12.8 分飙到 62.7 分——近五倍跃升,超过了 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分。

这不是纸面题库的分数内卷。Terminal-Bench、DeepSWE 这类评测,考察的是 AI 能不能真正"干活"——自主进入终端装环境、敲命令、排查报错,读懂完整代码仓库、处理复杂工程问题、调用多步工具完成长链条任务。

换句话说,DeepSeek 这次补上的不是"考试分数",是真实场景的战斗力

核心规格方面,100 万 Token 上下文窗口,最大输出 38.4 万 Token,默认开启思考模式,支持 low/high/max 三档思考强度调节。同时兼容 OpenAI 和 Anthropic 两套 API 格式,支持 JSON Output、Tool Calls、Responses API,可直接导入 Codex 使用。

价格方面,¥3/百万输入,¥0.025 缓存命中,¥6/百万输出。8 月 17 日起采用峰谷定价,空闲时段半价。而 Claude Fable 5 的 API 价格是 V4 Pro 的60 倍


"

0.1 分的性能差,
60 倍的价格差。

这就是 DeepSeek 给全球 AI 市场的信号


SECTION 02
第二击:一切皆插件,Agent 有了"身体"

如果说 V4 Pro 是"灵魂",那 DeepSeek Harness 就是给它造了一个"身体"。

8 月 13 日,DeepSeek Harness 开发者预览版上线并开源。这是 DeepSeek 自研的 Agent 框架,类似 Claude Code,命令行缩写是 dsh。

核心设计原则只有一条:一切皆插件。模型接入、工具注册表、会话日志、审批策略,甚至驱动智能体运转的主循环本身——这个 harness 的一切,全部都是插件。你想换搜索引擎?改个配置就行。想接自己公司的模型服务?改个配置就行。给系统加功能就是挂一个新插件,卸载时注册的一切自动撤销,不留残余。

技术上,Harness 基于具有"时空可组合性"的 Cordis 插件系统构建。Cordis 作为元框架,只负责插件的加载与卸载以及依赖关系,Agent Harness 的所有具体组件都是不同的 Cordis 插件。插件通过服务与事件彼此协作,并可以在配置层自由组合。

Agent 范式换挡ROLE SHIFT
传统 Agent
核心逻辑写死
预留接口 · 有限定制 · 换组件要改框架代码
DeepSeek Harness
一切皆插件
模型 · 工具 · 调度 · UI 全可替换 · 改配置不改代码
关键转折点:从"框架决定你能做什么"变成"你决定框架能做什么"。

Harness 提供四种随附模式:标准模式(功能完整的编程智能体)、PTC 模式(程序化工具调用,一段代码跑完多步任务)、极简模式(两个工具,适合基准测试)、创造模式(用自然语言创建自定义 Agent Preset)。多智能体协作方面,subagent 可续跑的后台子代理,工作流引擎通过脚本确定性地编排多个子代理,Ralph 循环反复试直到通过。

安全与治理方面,三大桌面平台各自使用操作系统原生隔离机制——Linux 用 bwrap/Landlock,macOS 用 Seatbelt,Windows 用 ACL 受限令牌。沙箱分三档:read-only、workspace-write、danger-full-access。密钥不进日志,数据默认留在本地。生态上支持 MCP 协议,任何 MCP 服务器都可以接入;Hooks 桥让 Claude Code 和 Codex 的钩子脚本直接可用。

一行命令启动:npx @deepseek-ai/dsh web。内测期间,用户们已经玩出了花——同花顺皮肤、娘化皮肤、Excel 皮肤、复古 XP 皮肤,甚至还有人做了表情包插件和小游戏插件。这些皮肤和插件全部是独立插件,即插即用。


SECTION 03
第三击:杀回国模顶流,按下重置键

昨儿 DeepSeek V4 Pro+Harness、Grok 4.6"你方唱罢",今儿 GLM-5.3 闪亮登场。一出手便杀回开源一哥、国模一哥,甚至在 Coding 方面更加接近 Claude Fable 5。在多项主流基准测试中,GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5。

两个关键词:Coding 和安全。

Coding 方面,GLM-5.3 在六个 benchmark 中表现都不赖,尤其是 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别——提升主要来自后训练 Scaling。智谱还开源了名为 Slime 的后训练框架,从 GLM 4.5 开始就一直在用。

安全方面,CyberGym 白盒代码审查 GLM-5.3 拿到 84.5%,相比 5.2 的 77.2% 继续提升,成为最强开源安全模型。在 GLM-5.3 发布前两周,智谱联合清华、南开开展了密集的红队测试,累计发现漏洞 2404 个(经过初筛、去重),其中 1088 个为中高危,覆盖 220 个项目。最早的 Bug 可以追溯到 40 年前。

GLM-5.3 实测三连击FIELD TEST
1
指环王基准28 分钟
自主规划、写代码、编排动画,完成可运行的中文版指环王交互 Demo
2
可交付模拟游戏40 分钟
前端 + 后端 + 数据库 + 权限 + 测试 + 部署全跑通,54/54 回归测试通过
3
无 GPU 硬写 CUDA18 分 52 秒
主动区分 VERIFIED / INFERRED / UNVERIFIED,能做的做,没做的明确说没做

安全实测同样惊艳:7 分钟找出 12 类安全漏洞,9 分 20 秒修完所有 Bug 并补上回归测试(54/54 通过),在无 GPU 的 Mac 上写 CUDA 代码时主动区分 VERIFIED、INFERRED 和 UNVERIFIED——能做的尽量做,没做的明确说没做。

目前 GLM-5.3 已上线 ZCode 和 AutoClaw,WorkBuddy、QwenWork、TraeWork 等第三方平台也开放抢先体验。API 预计下周二开放,模型权重两周内开源。


SECTION 04
三连击的背后:从"追赶到并行"

把这三发放在一起看,你会发现一个清晰的趋势:国产 AI 已经不满足于单一维度的突破,而是在模型能力、Agent 框架、安全生态三个维度同时发力。

DeepSeek V4 Pro 证明了国产模型在性能上已经触摸到全球天花板——0.1 分的差距,几乎可以忽略不计。而 60 倍的价格差,让它在全球市场上拥有了碾压级的性价比。

DeepSeek Harness 解决的是"模型如何落地"的问题。Agent = Model + Harness,模型是灵魂,Harness 是身体。有了这个"一切皆插件"的框架,开发者可以自由组装适合自己的 Agent,而不是被某个闭源生态锁死。

GLM-5.3 则补上了最关键的拼图——安全。当 AI 开始以机器速度写代码、操作系统,安全也得跟上机器速度。GLM-5.3 把 Coding 和安全放在一起强化,因为模型一旦真正开始写工程代码,安全本身就是工程能力的一部分。

梁文锋此前承认"我们跟美国的差距可能是落后美国 12 个月"。但回看这三天——模型性能追平、Agent 框架开源、安全能力领先——这个差距正在以前所未有的速度缩小。

也许用不了 12 个月了。

因为嘉阳从某些消息渠道得知,8 月,国产大模型还会有很多惊艳的更新。大胆猜测下,也许我们对于美国模型的追赶—追平—超越,就在这个 8 月完成!我们一起来拭目以待吧!

OPEN QUESTION

模型性能追平、Agent 框架开源、安全能力领先——这三连击之后,你会怎么选?

评论区聊聊你的场景,我会挑几个典型方向展开写。

— END —


吴嘉阳
CROSS-BORDER E-COMMERCE · AI INSIGHTS
跨境电商营销研究者 · 记录 AI 产品的真实现场

【声明】内容源于网络
0
0
吴嘉阳跨境电商营销研究者
川流SaaS CEO 吴嘉阳 11年跨境电商经验 精通SEO SEM 联盟营销等 亚马逊中国3年资深流量产品经理 阿里巴巴国际4年资深流量产品经理
内容 529
粉丝 0
吴嘉阳跨境电商营销研究者 川流SaaS CEO 吴嘉阳 11年跨境电商经验 精通SEO SEM 联盟营销等 亚马逊中国3年资深流量产品经理 阿里巴巴国际4年资深流量产品经理
总阅读14.8k
粉丝0
内容529