6月17日,智谱正式发布并开源新一代旗舰模型GLM-5.2。
这次它瞄准的不是普通聊天,也不是"帮我写一个排序函数",而是更难的长程任务:读完整个代码仓库、持续工作数小时、修改多个文件,最后把一个复杂工程真正跑起来。
最引人注意的一项成绩是FrontierSWE:GLM-5.2拿到74.4分,Claude Opus 4.8为75.1分,两者只差0.7分。
差距确实还在,但已经小到了不能再简单用"国产模型还在追赶"来概括。
编程能力:已经进入第一梯队
先看几项比较有代表性的编程测试:
SWE-bench Pro:GLM-5.2为62.1,Opus 4.8为69.2,GPT-5.5为58.6
Terminal-Bench 2.1:GLM-5.2为81.0,Opus 4.8为85.0
FrontierSWE:GLM-5.2为74.4,Opus 4.8为75.1,GPT-5.5为72.6
这三组数字放在一起,结论其实很清楚:GLM-5.2还没有全面超过Opus,但已经稳稳进入了顶级模型所在的区间。
特别是FrontierSWE,只差0.7个百分点。对于修复真实代码问题、理解大型代码仓库这类任务来说,这已经不是"能不能用"的差别,而更像是稳定性、速度和使用习惯上的选择。
Terminal-Bench的提升也很明显。
GLM-5.1在这项测试中的成绩是63.5,GLM-5.2提高到了81.0,一代模型提升了17.5分。对一个已经处在高分段的模型来说,这种幅度并不常见。
竞技场成绩同样亮眼
在Arena.ai的盲测中,GLM-5.2在Code Arena拿到1595分,位列公开榜单第二;在Design Arena拿到1360分,排名第一。
Design Arena测试的不只是代码能不能运行,还涉及页面结构、视觉效果以及模型对产品需求的理解。
这意味着GLM-5.2的优势不只体现在后端代码和命令行任务上。做网页、产品原型和前端界面时,它同样有很强的竞争力。
不过,排行榜高并不代表所有任务都能无脑替代Opus。
它很强,但还没有全面追平
换一组项目级测试,差距依然存在:
NL2Repo:GLM-5.2为48.9,Opus 4.8为69.7
DeepSWE:GLM-5.2为46.2,Opus 4.8为58.0
ProgramBench:GLM-5.2为63.7,Opus 4.8为71.9
SWE-Marathon:GLM-5.2为13.0,Opus 4.8为26.0
所以,更准确的说法不是"GLM-5.2已经全面追平Opus",而是:
在部分长程编程任务上,两者已经非常接近;但面对陌生技术栈、冷门第三方库以及特别复杂的工程细节时,Opus仍然更稳。
一些内测用户也提到了类似问题:GLM-5.2能够很快找到解决方向,但遇到小众API、缺失文档或者需要大量搜索官方资料的任务时,偶尔会被工程细节绊住。
这种差距并不容易体现在一张排行榜里,却会直接影响真实使用体验。
数学能力比预想得更强
除了编程,GLM-5.2的数学和科学推理成绩也很突出。
在智谱公布的评测中:
AIME 2026:99.2
IMOAnswerBench:91.0
GPQA-Diamond:91.2
其中,Opus 4.8在GPQA-Diamond上的成绩为93.6,仍然领先GLM-5.2约2.4分;但在部分数学测试上,GLM-5.2已经取得了更高的公开成绩。
当然,数学跑分高不等于软件工程能力一定强。
但在算法设计、复杂逻辑分析和系统建模等任务里,更扎实的数学推理能力确实会给模型带来帮助。至少可以确定,GLM-5.2并不是一款只针对代码数据进行强化的"偏科模型"。
真正让人心动的,可能还是价格
如果只看综合能力,Opus依然是更稳妥的选择。
但一旦把价格放进来,情况就不一样了。
按官方标准价格计算,每使用100万tokens:
也就是说,Opus的输入价格约为GLM-5.2的4.3倍,输出价格约为6.1倍。
对于需要模型连续工作几个小时、反复读取代码仓库的Agent任务来说,输出token往往不少。这时,28元和170元之间的差距,会非常直接地体现在账单上。
不过,GLM-5.2并不是最便宜的选择。
DeepSeek V4 Pro的缓存未命中输入价格只有GLM-5.2的37.5%,输出价格约为其21%。缓存命中后,DeepSeek的输入价格还会进一步下降到0.025元/百万tokens。
所以GLM-5.2真正有吸引力的地方,不是"市场最低价",而是在接近顶级闭源模型能力的同时,把价格控制在了更容易接受的区间。
开放权重,才是它的另一张牌
GLM-5.2以MIT协议开放权重,可以下载、本地部署,也允许商业使用和二次开发。
这和API便宜并不是一回事。
API价格再低,模型仍然运行在别人的服务器上;而开放权重意味着企业可以把模型部署在自己的环境里,控制数据流向、服务策略和推理成本。
据官方披露,GLM-5.2的训练也使用了华为昇腾算力。
这件事的意义不必拔得太高,但至少说明:从训练算力到模型权重,一条相对完整的国产技术路线正在形成。
开发者实际用下来怎么样?
从目前公开的体验来看,评价大致可以分为两类。
正面反馈主要集中在几个方面:
保留意见则主要集中在:
这些反馈其实比一句"能不能替代Opus"更有价值。
GLM-5.2已经足够强,但它仍然有清晰的能力边界。能否替代现有工具,取决于你的项目类型,而不是某一张排行榜。
和DeepSeek V4 Pro相比
GLM-5.2和DeepSeek V4 Pro都是开放权重模型,但它们的强项并不完全相同。
GLM-5.2更偏向项目工程和长程Agent:
DeepSeek V4 Pro Max则更擅长算法和高强度推理:
价格方面,DeepSeek V4 Pro的缓存未命中输入为3元/百万tokens,输出为6元/百万tokens;GLM-5.2则分别为8元和28元。
DeepSeek明显更便宜,尤其是输出价格只有GLM-5.2的约五分之一。
可以简单理解为:
不是谁全面压过谁,而是应该把不同任务交给不同模型。
该怎么选?
END
GLM-5.2最值得关注的地方,不是某一个榜单超过了谁。
而是开放权重模型正在跨过一道更重要的门槛:从"能不能用",走向"哪些任务值得切过来"。
它还没有全面超过Opus,在工程稳定性、小众知识覆盖和复杂任务收尾上,差距依然存在。
但FrontierSWE只差0.7分、Terminal-Bench达到81.0、Design Arena排名第一,再加上更低的API价格和开放权重,这些因素放在一起,已经足够让开发者认真考虑把它加入自己的工作流。
GLM-5.2不一定能完全替代你现在使用的编程工具。
但它已经证明,顶级编程模型不再只有闭源这一条路。

