导读8 月 19 日 GLM-5.3 API 正式上线,定价与上一代持平。通稿都在刷"开源 SOTA、逼近 Fable 5",但真正反常识的是另一件事——它和 GLM-5.2 用的是同一个基座,全部提升来自后训练。本文不堆 benchmark,而是聊一个工程师视角的判断:当模型在接近真实工作流的环境里训练,它长出来的能力就不只是"会写代码",而是"能把活交付、敢承认自己没验证"。这对接下来选模型、用 Agent,可能比分数更重要。
先别急着喊开源一哥
图片来源:智谱
GLM-5.3 是 8 月 14 日发布的,今天 API 正式开放调用,模型权重按官方说法下周五开源。上下文还是 1M,最大输出 128K,定价和 GLM-5.2 持平。
分数当然好看。Artificial Analysis 综合智能指数 60 分,和 Kimi K3 并列开源第一梯队;Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9。智谱自家的 Z.ai Code Bench 上,High 档位准确率 31.4%,超过 Claude Opus 4.8 最高档的 29.5%,而且每项任务平均只吐约 5 万 token,Opus 4.8 要 12 万。
图片来源:Z.ai Blog
但这些数字加起来,不如官方博客里那句轻描淡写的话更值得停下来想一想:基座模型没变,和 GLM-5.2 完全一样,性能提升全部来自后训练。
同一个运动员,没换身体,换了一套训练方法,成绩涨了一大截。这才是这次发布最该看的地方。
"能交付"到底长什么样
我翻了几篇实测,量子位那组 AegisDesk 测试最能说明问题。
AegisDesk 是一个真实结构的小型 Node.js 应用,提前埋了一组漏洞,但不告诉模型埋了多少、在哪。GLM-5.3 在 ZCode 里跑了大约 7 分钟,交出一份 348 行的审计报告:明文密码、Stored XSS、Mass Assignment 提权、跨用户 IDOR、路径穿越,12 类全找出来了。三个散落在不同路由里的 IDOR,它没拆成三个 bug 刷数量,而是识别出共同根因,合并成一条 Finding。
图片来源:量子位
找出来不算完。研究人员把这份它自己写的报告又塞回去,让它自己补。9 分 20 秒,改了 22 个文件、新增 1463 行代码。它没有简单删掉危险功能,而是路径穿越加目录边界校验、IDOR 把 ownerId 真正压进查询、明文密码迁移到带 salt 的 scrypt,还给每个修复补了回归测试——跑完 54/54 全过。为了防止"自己出题自己判满分",项目被单独拎出来重跑,还是 54/54。
图片来源:量子位
更有意思的是第三个测试。在一台没有英伟达 GPU 的 Mac 上,不提前告诉它这一点,直接让它写 CUDA 工程。18 分 52 秒后它先确认本机跑不了 CUDA,然后把任务拆开:CPU 能验证的算法逻辑自己造模拟测试,CUDA 代码借 Docker 里的 nvcc 真编了一遍,但真实 GPU 执行、CPU/GPU 数值一致性、性能 benchmark 全部标成 UNVERIFIED。
图片来源:量子位
能做的尽量做,没做的明确说没做。
这三个动作连起来,是一条过去大多数 Coding 模型走不完的链路。
会写代码是第一关,能交付、能验证、知道边界,才是生产级 Coding Agent 真正开始的地方。
这不是我替它吹。第三方横评里它也露馅:沃垠 AI 用同一批前端、3D、网站、游戏任务,在 Claude Code 里统一接官方 API 跑 Kimi K3、GLM-5.3、DeepSeek-v4-pro,综合结论是 K3 最强、GLM-5.3 次之,GLM 在游戏任务第二关出现操作失效,而且 43 分钟的速度比 v4-pro 的十来分钟慢不少。
能交付,和样样都第一,是两回事。
能力是训练环境的形状
问题来了。基座没换,这些能力从哪冒出来的?
官方给的答案是后训练 Scaling:数十倍的长程任务环境、更丰富的环境类型、超长的后训练时间,底层靠 IndexShare、SAO 和新一代 Slime 框架——分别对应长上下文成本、长程任务强化学习和大规模异步训练。这些名词的具体机制智谱还没在技术 blog 里完全展开(z.ai 的 blog 我这边这会儿打不开,等能访问了再补技术细节),但有一句话官方说得很直白:训练环境里有些任务的工作量,相当于一位工程师连续数天的工作。模型要用和算法工程师相同的计算集群、存储、内部文档、代码库和实验结果,端到端把一件事做完。
这就是我想说的那个判断:模型在什么环境里训练,就会长出什么形状的能力。
你让模型只做编程题,它就学会解题。你把它放进一个有数据库、有权限系统、有测试、有部署、要反复跑几天的环境里,它要活下去,就只能自己学会补回归测试、学会核对 owner、学会在证据不够的时候闭嘴。那个"UNVERIFIED"不是对齐出来的礼貌,是它在长程任务里被失败训出来的本能——前面九十步都对,临门一脚瞎编,整条轨迹归零。
AI生成
网络安全能力也是这么"涌现"的。智谱自己讲,安全本质上是约束严格的编程。CyberGym 白盒审计 84.5%,略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;但到了真正要亲手打穿漏洞的 ExploitBench,GLM-5.3 是 54.4%,Mythos 5 是 78%。越往漏洞利用链后端走,差距越大。这条曲线恰好说明能力是环境喂出来的——白盒代码审查和它的编程训练环境高度同构,它就强;完整的利用链它还没练够,就弱。
体育圈有个老说法,训练的质量决定比赛的样子。放在这儿挺合适。
一个样本,不等于范式转移
说到这儿得踩一脚刹车。
我不同意把 GLM-5.3 解读成"预训练已死、后训练通吃"。一个模型、一个基座、一次发布,证明不了范式转向。更大的可能是:对于已经把基座做到某个水平的厂商,后训练这条线的边际收益现在被低估了,智谱拿出了一个特别扎眼的样本。基座的天花板仍然在那儿,官方自己都说"可能还远未开发完这个基座的上界"——这句话的另一面是,基座本身得够硬,后训练才有东西可榨。
而且开源第一不等于追上闭源旗舰。CyberGym 赢了 0.7 个百分点,ExploitBench 和 ExploitGym 吞吐量还差 Mythos 一大截;编程体感据智谱自己的口径也只是"接近 Fable 5"。
图片来源:智谱
越往漏洞利用链后端走,差距拉得越开。再加上横评里 K3 综合更强、GLM 游戏任务翻车、速度偏慢,真实生产环境里它能不能稳定接住复杂活,还得靠大量项目去磨。
安全这面也别只看高光。2436 个漏洞、1097 个中高危、最早追到约 45 年前、DNS 协议级漏洞能把计算压力放大近 8 万倍、Cursor 任意文件写入、微软三枚漏洞换来官方致谢"Kunlun Lab & GLM"——这些战绩是真的。但它们几乎都是 GLM 辅助清华、赛博昆仑、云起无垠这些专业安全团队完成的,是"AI + 研究员"的成果,不是模型一个人深夜挖出来的。把人抽掉讲"AI 自主猎杀漏洞",就是另一篇通稿了。
今天能不能用
实用层面说几句。
API 今天已经在 BigModel 和 Z.ai 开放,定价和 GLM-5.2 一样;ZCode、AutoClaw、GLM Coding Plan 全量接入,Trae、扣子、CodeBuddy、Qoder 这些第三方编码平台也开了抢先体验。权重下周五开源,开源前智谱要做安全加固,攻击性最强的那部分能力只通过"网络安全受信访问"计划放给验证过的用户。
如果你现在就在用 Coding Agent,我的建议是:复杂的多文件重构、带数据库和权限的全栈小项目、代码审计和修漏洞这类活,值得拿真实任务试一把,重点观察它能不能自己跑通测试、会不会在不确定的时候停住。但游戏、强交互、对响应速度敏感的场景先观望,横评里的翻车和 43 分钟不是偶然。还有一点,它是纯文本模型,本身不识图,别把截图甩给它指望看懂。
至于"开源的盾"计划、cvd.z.ai 披露账本、给开源项目免费提供安全审计额度——方向我是认的。攻击能力在扩散(今年 Hugging Face 那次事件,攻击方就是个自主 Agent,防守方末了是把 GLM-5.2 部署到本地才重建出攻击时间线),防守能力确实不能只锁在闭源公司手里。但这套东西实际运转起来什么样,得看接下来半年披露了多少、修了多少。
选模型这件事,我现在越来越少看榜单第一行那个数字了。我更想看:给它一个真 repo,它能不能把事做完,做完敢不敢告诉我哪一步它其实没验证。GLM-5.3 在这个方向上,往前迈了一步。
不大,但方向对。
参考资料
-
智谱官方《GLM-5.3上线:拓展智能上界的可及边界》: https://mp.weixin.qq.com/s/G9sMhRdH7rywdSmzBHA4Cg -
智谱官方《GLM-5.3:前沿编程能力与涌现的网络安全能力》: https://mp.weixin.qq.com/s/JdBx3B12L7Mhxruf4Nfr4g -
IT之家《智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%》: https://www.ithome.com/0/989/689.htm -
量子位《GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了》: https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg -
沃垠AI《横评GLM-5.3、DeepSeek-v4-pro、K3,谁才是Coding新王?》: https://mp.weixin.qq.com/s/DTyW8N4D7cHmMQ3lmHuXlg -
新智元《GLM-5.3撕开闭源安全神话!0.1倍参数追平Mythos战力》: https://mp.weixin.qq.com/s/eO-qusnAD0lj-xcaldRoKQ -
GLM-5.3 技术 Blog: https://z.ai/blog/glm-5.3 -
Z.ai 安全披露账本: https://cvd.z.ai/
— THE END —
文章仅做学术分享,如有侵权请联系删除,非常感谢!

