这是我的第487篇Ai笔记,本篇3492、累计笔记8467507
彩蛋:结尾扫描二维码,领取《GLM-5.3 Flash Agent 实战使用手册》。
刚刚,前几天把 AI 圈猜了个遍的神秘模型 Ox Alpha,终于掉马了。
答案是:智谱。
8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash,同时确认此前突然出现在 OpenCode、OpenRouter 上的匿名模型 Ox Alpha,就是它的匿名预览版。更有意思的是,智谱称这款模型在匿名测试期间很快冲到了当周最受欢迎的模型之一,而且这些真实用户流量全部跑在国产 AI 芯片上。
好家伙,牛来还真是国产牛。
但如果只是“神秘模型破案”,这事其实没那么值得写。真正让我更感兴趣的,是 GLM-5.3-Flash 公布之后那张 Artificial Analysis 的性价比图。
320B 总参数,每次推理只激活 18B;Artificial Analysis Intelligence Index 拿到 57 分;API 当前公开价格是每百万 Token 输入 0.15 美元、输出 0.50 美元。智谱官方给出的定位更直接:能力超过 GLM-5.2,价格只有 GLM-5.2 的十分之一。
看到这里,我第一反应是:
大模型下一轮最狠的竞争,可能要开始从“谁最聪明”,转向“1 块钱到底能买到多少智能”了。
为什么我觉得这一点比跑分更重要?
过去一年,我们已经被各种 Benchmark 教育麻了。今天这个模型超过 Claude,明天那个模型打平 GPT,后天又冒出一个新 SOTA。
对于普通人来说,榜单上多两分、少三分,其实很难直接改变你的使用习惯。
但 Agent 不一样。
你跟 AI 聊十句话,贵一点便宜一点,体感并不明显。可一旦进入 Coding Agent、Computer Use(电脑操作)、Browser Use(浏览器操作)这类场景,模型会自己读文件、看网页、调用工具、反复修改、检查结果。
一项任务跑下来,很容易消耗几十万甚至上百万 Token。
这时候模型每百万 Token 贵 5 倍、10 倍,最后就真的会变成成本。
所以我觉得 GLM-5.3-Flash 最值得关注的地方,是它在尝试干一件很现实的事:
把原本旗舰模型才能承担的任务,塞进一个可以高频调用、长时间运行的价格区间。
Artificial Analysis 目前给 GLM-5.3-Flash 的综合智能指数是 57。按照智谱发布时的折扣价格计算,每项任务成本大约只有 0.045 美元。
这意味着它开始有资格从“便宜的备用模型”,变成 Agent 里的常驻干活模型。
而这,可能比又拿了一个榜单第一重要得多。
那 GLM-5.3-Flash 到底能干什么?这次我不把十几项 Benchmark 全搬过来,挑三个最值得看的。
01|Coding 和 Agent,已经不是“小杯模型”的水平了
先看最硬的一块:写代码。
智谱公布的结果里,GLM-5.3-Flash 在 DeepSWE v1.1 上拿到 63.4,GLM-5.2 是 46.2,Claude Opus 4.8 是 58.0;AutomationBench 上则从 GLM-5.2 的 26.2 提升到了 48.8。
在智谱自己的 Z.ai Code Bench 上,最高推理强度下 GLM-5.3-Flash 是 29.0,Claude Opus 4.8 是 29.5。自家 Benchmark 当然要留一点余地看,但至少从公开结果来说,它已经进入了很能打的 Coding / Agent 区间。
这里有个变化特别关键。
以前我们说 Flash、Mini、Haiku 这类模型,默认印象通常是:便宜、快,碰到复杂任务再换旗舰模型。
GLM-5.3-Flash 想做的明显更激进。
它希望大量日常 Coding、工具调用、网页操作、仓库修改,都直接让便宜模型狠狠干完,只有真正困难的任务再升级旗舰模型。
这对开发者和做 Agent 产品的公司很现实,因为真正把 AI 成本烧起来的,往往不是偶尔问一次难题,而是一天执行几百次、几千次的普通任务。
02|它终于开始“看着东西干活”了
第二个我比较看重的是视觉。
GLM-5.3-Flash 是 GLM-5 系列第一款原生多模态模型,官方称其使用了 30T Token 的多模态预训练数据,同时支持最长 100 万 Token 上下文。
这件事对 Agent 的意义,比“能识别一张图片”大得多。
比如你让 AI 写一个网页。
以前它把 HTML、CSS、JS 写完,代码层面觉得自己没问题,结果真正打开页面一看:按钮歪了、文字溢出了、弹窗挡住了主界面。
现在这类模型可以继续看自己刚刚做出来的页面,根据真实视觉结果判断哪里出了问题,然后回来继续改。
同样的能力也可以放到 PDF、PPT、Excel、Dashboard、网页后台这些真实办公场景里。
代码让 Agent 能修改东西,视觉让 Agent 知道自己到底改成什么样了。
这也是我觉得 GLM-5.3-Flash 很适合拿来做办公 Agent 的原因。
给它文档,它可以读;给它表格和页面,它可以看;再接上浏览器、文件系统和 Office 工具以后,很多过去只能“给建议”的 AI,开始有机会真正把事情做完。
03|便宜的秘密,藏在模型怎么“算”里面
还有一个容易被忽略的地方。
GLM-5.3-Flash 虽然有 320B,也就是 3200 亿总参数,但真正生成每个 Token 时只激活 18B。相比 GLM-4.5 的 355B 总参数、32B 激活参数,它的激活规模接近砍半,模型层数也从 92 层降到了 45 层。
同时,这次智谱第一次在 GLM 系列里引入了稀疏注意力和线性注意力的混合架构。
简单理解,以前处理一百万 Token 的超长内容,模型需要进行大量昂贵的信息关联;现在则把大量局部联系用更便宜的方式处理,再重点寻找真正重要的远距离信息。
按照智谱公布的数据,相比 GLM-5.3,GLM-5.3-Flash 的 Attention 计算量降到了约三分之一,KV Cache 占用降低约 4.4 倍。
所以这次便宜,并不只是厂家咬牙打价格战。
它确实在模型架构上狠狠干了一轮效率。
更有意思的是,Ox Alpha 匿名测试期间的真实流量,全部由国产 AI 芯片集群承载。智谱称这套推理系统已经运行在数万张国产加速卡上,相比初始基线实现了约 3 倍端到端服务性能提升。
模型、推理框架、芯片一起把成本往下压,这条路如果持续跑通,影响会比一次模型跑分第一大得多。
夸了这么多,该泼的冷水还是得泼。
第一,别急着喊“全面斩杀”。GLM-5.3-Flash 的公开成绩确实很漂亮,但 Benchmark 的测试环境、推理强度并不完全一致,自家榜单也要留一点余地。跑分领先,不代表你自己的代码库、Agent 和业务任务一定全部领先。
第二,便宜和聪明做到了,速度还没拉满。目前公开第三方测试里,它的输出速度并不算快。如果是后台 Agent 问题不大,但对于需要坐在电脑前不断等结果的 Coding 场景,速度依然会影响体验。
第三,开源也不等于普通电脑随便跑。虽然只有 18B 激活参数,但它依然是 320B 总参数的大模型。本地部署对显存和推理环境要求不低,现阶段多数用户直接用 API 或云端服务会更实际。
所以我的态度很简单:这模型很值得试,但先别急着封神。真正决定它能不能成为 Agent 主力的,还是接下来大量真实任务里的稳定性。
最后,老规矩,用三句话总结一下。
1. GLM-5.3-Flash 最大的变化,是把接近前沿模型的 Coding 和 Agent 能力,压进了一个可以高频调用的成本区间,大模型竞争开始越来越看“每块钱买到多少智能”。
2. 它现在的公开成绩已经很能打,原生多模态、百万 Token 上下文和低推理成本也很适合 Agent,但速度和不同任务下的真实稳定性,还需要更多实战验证。
3. 对普通用户和企业来说,未来更划算的玩法很可能是模型分工:大量办公、Coding 和工具调用任务交给这种高性价比模型狠狠干,真正困难的长任务再升级到旗舰模型。
看完这篇,如果你只是知道 GLM-5.3-Flash “便宜、能写代码”,其实还不够。
真正有用的问题是:它到底适合放在哪些 Agent 里?该给它什么任务?什么时候该换更强的模型?
所以这次我给大家整理了一份 《GLM-5.3 Flash Agent 实战使用手册》,直接按照真实工作场景来写,里面重点整理了两套方案:办公 Agent 和 编程 Agent。
从读 PDF、整理资料、做 PPT/Excel,到读代码仓库、改 Bug、写功能、调用工具,以及 GLM-5.3 Flash、DeepSeek、Claude 等模型应该怎么搭配,都给大家做成了可以直接照着搭的参考方案。
拿到以后,不用继续研究跑分,直接开始搭自己的 Agent。扫码回复关键词【GLM53】,自动领取。

