大数跨境

GLM-5.2杀进全球第一梯队:这次,开源模型真能替代Opus了吗?

GLM-5.2杀进全球第一梯队:这次,开源模型真能替代Opus了吗? MaxMindAI
2026-06-22
0
导读:100万上下文,开源编程模型进入新阶段!

6月17日,智谱正式发布并开源新一代旗舰模型GLM-5.2。

这次它瞄准的不是普通聊天,也不是"帮我写一个排序函数",而是更难的长程任务:读完整个代码仓库、持续工作数小时、修改多个文件,最后把一个复杂工程真正跑起来。

最引人注意的一项成绩是FrontierSWE:GLM-5.2拿到74.4分,Claude Opus 4.8为75.1分,两者只差0.7分。

差距确实还在,但已经小到了不能再简单用"国产模型还在追赶"来概括。

编程能力:已经进入第一梯队

先看几项比较有代表性的编程测试:

SWE-bench Pro:GLM-5.2为62.1,Opus 4.8为69.2,GPT-5.5为58.6
Terminal-Bench 2.1:GLM-5.2为81.0,Opus 4.8为85.0
FrontierSWE:GLM-5.2为74.4,Opus 4.8为75.1,GPT-5.5为72.6

这三组数字放在一起,结论其实很清楚:GLM-5.2还没有全面超过Opus,但已经稳稳进入了顶级模型所在的区间。

特别是FrontierSWE,只差0.7个百分点。对于修复真实代码问题、理解大型代码仓库这类任务来说,这已经不是"能不能用"的差别,而更像是稳定性、速度和使用习惯上的选择。

Terminal-Bench的提升也很明显。

GLM-5.1在这项测试中的成绩是63.5,GLM-5.2提高到了81.0,一代模型提升了17.5分。对一个已经处在高分段的模型来说,这种幅度并不常见。

竞技场成绩同样亮眼

在Arena.ai的盲测中,GLM-5.2在Code Arena拿到1595分,位列公开榜单第二;在Design Arena拿到1360分,排名第一。

Design Arena测试的不只是代码能不能运行,还涉及页面结构、视觉效果以及模型对产品需求的理解。

这意味着GLM-5.2的优势不只体现在后端代码和命令行任务上。做网页、产品原型和前端界面时,它同样有很强的竞争力。

不过,排行榜高并不代表所有任务都能无脑替代Opus。

它很强,但还没有全面追平

换一组项目级测试,差距依然存在:

NL2Repo:GLM-5.2为48.9,Opus 4.8为69.7
DeepSWE:GLM-5.2为46.2,Opus 4.8为58.0
ProgramBench:GLM-5.2为63.7,Opus 4.8为71.9
SWE-Marathon:GLM-5.2为13.0,Opus 4.8为26.0

所以,更准确的说法不是"GLM-5.2已经全面追平Opus",而是:

在部分长程编程任务上,两者已经非常接近;但面对陌生技术栈、冷门第三方库以及特别复杂的工程细节时,Opus仍然更稳。

一些内测用户也提到了类似问题:GLM-5.2能够很快找到解决方向,但遇到小众API、缺失文档或者需要大量搜索官方资料的任务时,偶尔会被工程细节绊住。

这种差距并不容易体现在一张排行榜里,却会直接影响真实使用体验。

数学能力比预想得更强

除了编程,GLM-5.2的数学和科学推理成绩也很突出。

在智谱公布的评测中:

AIME 2026:99.2
IMOAnswerBench:91.0
GPQA-Diamond:91.2

其中,Opus 4.8在GPQA-Diamond上的成绩为93.6,仍然领先GLM-5.2约2.4分;但在部分数学测试上,GLM-5.2已经取得了更高的公开成绩。

当然,数学跑分高不等于软件工程能力一定强。

但在算法设计、复杂逻辑分析和系统建模等任务里,更扎实的数学推理能力确实会给模型带来帮助。至少可以确定,GLM-5.2并不是一款只针对代码数据进行强化的"偏科模型"。

真正让人心动的,可能还是价格

如果只看综合能力,Opus依然是更稳妥的选择。

但一旦把价格放进来,情况就不一样了。

按官方标准价格计算,每使用100万tokens:

GLM-5.2:输入8元,输出28元
Claude Opus 4.8:输入折合人民币约34元,输出约170元
DeepSeek V4 Pro:缓存未命中输入3元,输出6元

也就是说,Opus的输入价格约为GLM-5.2的4.3倍,输出价格约为6.1倍。

对于需要模型连续工作几个小时、反复读取代码仓库的Agent任务来说,输出token往往不少。这时,28元和170元之间的差距,会非常直接地体现在账单上。

不过,GLM-5.2并不是最便宜的选择。

DeepSeek V4 Pro的缓存未命中输入价格只有GLM-5.2的37.5%,输出价格约为其21%。缓存命中后,DeepSeek的输入价格还会进一步下降到0.025元/百万tokens。

所以GLM-5.2真正有吸引力的地方,不是"市场最低价",而是在接近顶级闭源模型能力的同时,把价格控制在了更容易接受的区间。

开放权重,才是它的另一张牌

GLM-5.2以MIT协议开放权重,可以下载、本地部署,也允许商业使用和二次开发。

这和API便宜并不是一回事。

API价格再低,模型仍然运行在别人的服务器上;而开放权重意味着企业可以把模型部署在自己的环境里,控制数据流向、服务策略和推理成本。

据官方披露,GLM-5.2的训练也使用了华为昇腾算力。

这件事的意义不必拔得太高,但至少说明:从训练算力到模型权重,一条相对完整的国产技术路线正在形成。

开发者实际用下来怎么样?

从目前公开的体验来看,评价大致可以分为两类。

正面反馈主要集中在几个方面:

处理大型代码仓库的能力明显提升
生成的代码结构比较干净
前端页面和产品原型表现突出
长任务中不容易过早放弃
综合体验已经接近Opus级别

保留意见则主要集中在:

深度思考模式等待时间偏长
小众技术栈的知识覆盖不够稳定
第三方库API偶尔会使用错误
个别任务方向正确,但最后的工程收尾不够完整

这些反馈其实比一句"能不能替代Opus"更有价值。

GLM-5.2已经足够强,但它仍然有清晰的能力边界。能否替代现有工具,取决于你的项目类型,而不是某一张排行榜。

和DeepSeek V4 Pro相比

GLM-5.2和DeepSeek V4 Pro都是开放权重模型,但它们的强项并不完全相同。

GLM-5.2更偏向项目工程和长程Agent:

SWE-bench Pro:62.1
FrontierSWE:74.4
BenchLM:91

DeepSeek V4 Pro Max则更擅长算法和高强度推理:

Codeforces:3206
LiveCodeBench:93.5
BenchLM:88

价格方面,DeepSeek V4 Pro的缓存未命中输入为3元/百万tokens,输出为6元/百万tokens;GLM-5.2则分别为8元和28元。

DeepSeek明显更便宜,尤其是输出价格只有GLM-5.2的约五分之一。

可以简单理解为:

GLM-5.2更像工程师,擅长理解代码仓库、修改真实项目以及持续推进复杂任务。
DeepSeek V4 Pro更像算法选手,擅长数学推理、编程竞赛以及边界明确的高难度问题。

不是谁全面压过谁,而是应该把不同任务交给不同模型。

该怎么选?

日常编程、中小型项目或者网页开发:GLM-5.2已经很有竞争力。能力够强,价格明显低于Opus,还能本地部署。
超大型项目、冷门技术栈或者容错率很低的复杂重构:Opus 4.8依然更稳,尤其是在知识广度和工程收尾方面。
算法竞赛、数学推理或者对API成本极其敏感:DeepSeek V4 Pro可能更合适。
数据合规和私有部署:GLM-5.2与DeepSeek都可以考虑,并不只有一个选择。
预算有限但又希望模型能长期处理真实代码仓库:GLM-5.2可能是目前能力、成本和开放性之间比较均衡的方案。

END

GLM-5.2最值得关注的地方,不是某一个榜单超过了谁。

而是开放权重模型正在跨过一道更重要的门槛:从"能不能用",走向"哪些任务值得切过来"。

它还没有全面超过Opus,在工程稳定性、小众知识覆盖和复杂任务收尾上,差距依然存在。

但FrontierSWE只差0.7分、Terminal-Bench达到81.0、Design Arena排名第一,再加上更低的API价格和开放权重,这些因素放在一起,已经足够让开发者认真考虑把它加入自己的工作流。

GLM-5.2不一定能完全替代你现在使用的编程工具。

但它已经证明,顶级编程模型不再只有闭源这一条路。



Max Mind

你的AI加油站


【声明】内容源于网络
0
0
MaxMindAI
1234
内容 41
粉丝 0
MaxMindAI 1234
总阅读24
粉丝0
内容41