Hi~新朋友,记得关注我们哟
Z.ai 最新旗舰模型在 Artificial Analysis 智能基准指数上与开源权重领先者 Kimi K3 持平。该模型在发现并利用软件漏洞方面能力显著增强,因此公司决定在发布权重前先行开展安全测试。
●最新消息:Z.ai 仅通过对前代模型 GLM-5.2 进行微调,便显著提升了 GLM-5.3 在编码和智能体任务中的表现,无需从头训练新模型或调整架构。
✴ 输入/输出:支持最高 100 万 token 输入及 12.8 万 token 输出,生成速度达每秒 90 token。
✴ 架构:采用混合专家 Transformer 架构,总参数量 7530 亿,单次激活参数 400 亿。
✴ 功能:支持可调推理级别(低/高/最大)、工具调用、结构化输出、流式传输及上下文缓存。
✴ 性能:在 Artificial Analysis 智能指数中获 60 分;在 CyberGym 漏洞检测基准测试中,得分居所有模型之首。
✴ 可用性/价格:提供 GLM Coding Plan 订阅(18-168 美元/月)及 ZCode 开发环境;API 定价为每百万 token:输入$1.40 / 缓存$0.26 / 输出$4.40。
✴ 权重/许可证:权重预计发布后两周开放,具体许可证尚未公布(前代 GLM-5.2 采用 MIT 协议)。
✴ 未披露项:知识截止时间及 GLM-5.3 的具体训练数据细节。
工作原理
公司扩展了 GLM-5.2 的微调方案,将其应用于更大规模、更多样化的模拟工作环境集合中。该方案引入“单次 rollout 异步优化”强化学习方法,即每次仅训练一个尝试而非等待整批完成。同时,训练方法将智能体长时任务记录切分并压缩,使模型能从长期任务中学习,突破短任务限制。
✴ 任务设计更贴近真实软件工程场景。例如,模型需在机器学习工程师环境中定位流水线变慢原因,并在保证质量前提下优化提速。
✴ 训练环境数量庞大,超出人工构建能力。公司利用智能体自动构建环境,并在部分任务中由智能体提供奖励信号。
✴ 设立独立评分智能体,在不展示参考答案的前提下,验证任务可解性并对模型表现打分。仅当评分器能正确识别解法并拒绝无效方案时,判定方为有效。
✴ 公司专门研究并部署机制,防止模型出现“奖励黑客”行为,即利用漏洞骗取奖励而非真正完成任务。
性能表现
独立测试显示,GLM-5.3 与顶级开源权重模型水平相当,略逊于领先专有模型几个百分点,但在智能体任务上提升显著。Z.ai 内部测试表明,其在智能体编码与网络安全领域进步最大。
✴ 在 Artificial Analysis 智能指数(涵盖九项经济实用任务)中,GLM-5.3 最大推理设置下得分为 60 分(单项成本$0.68),与 Kimi K3($0.84)持平,较 GLM-5.2($0.44)高出 7 分。落后于 Claude Opus 5(63 分,$2.34)、GPT-5.6 Sol(61 分,$0.96/$1.23)及 Grok 4.6(61 分,$0.84)。
✴ 网络安全测试中,GLM-5.3 在 CyberGym(触发错误以定位源码漏洞)得分 84.5%,超越 Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。在 ExploitBench(针对加固软件的漏洞利用测试)中得分 54.4%,是 GLM-5.2(24.4%)的两倍多,领先 Kimi K3(32.2%),但远低于 Claude Mythos 5(78.0%)和 GPT-5.6 Sol(76.5%)。
✴ 通用知识表现相对平淡:Humanity's Last Exam 正确率 42.3%(落后于旧版 Grok 和 Claude Opus);GPQA Diamond 解决率 91.72%(中等设置下不及 Gemini 3.7 Flash);AA-Omniscience Accuracy 仅 34%,显著低于其他顶级模型。
✴ 在 Z.ai 自有编码基准 Code Bench 中,GLM-5.3 最大推理设置下以约 7.5 万输出 token 完成任务的 34.5%,优于 Claude Opus 4.8(29.5%,12 万 token),但不及 Claude Fable 5(39.5%,5.7 万 token)。
Z.ai 的低调发布策略
本周,Z.ai 确认此前在 OpenRouter 等平台走红的多模态模型 Ox Alpha 实为 GLM-5.3 Flash,并已依据 MIT 许可证发布其 3200 亿参数模型权重。
新闻背后:开源与安全之争
GLM-5.3 的发布加剧了关于“具备高级网络攻击能力的开源模型是否应被限制”的争论,并为双方观点提供了实证支持。
✴ Z.ai 采取临时护栏策略,区别于 OpenAI 和 Anthropic 的永久注册制。公司在公布 CyberGym 与 ExploitBench 得分后,选择先与筛选后的安全合作伙伴进行为期两周评估,再开放权重。
✴ 发布引发业界回应。OpenAI 总裁 Greg Brockman 警告称,具备先进网络技能的开源模型可能“显著加速威胁态势”,并附链接指向 GLM-5.3 发布页。此警告源于数周前 OpenAI 评估智能体曾从其 ExploitGym 环境逃脱并攻破 Hugging Face 基础设施。
✴ 早期测试显示警报或被夸大。7 月美英 AI 安全机构联合评估 Kimi K3,发现其在 41 项 ExploitBench 任务中未执行任意代码——最严重后果。而最强专有模型在关闭防护后平均执行 20 次任意代码。
重要原因:意外收获的安全能力
Z.ai 初衷是打造更强智能体编码器,却意外获得擅长发现安全漏洞的模型。公司刻意加入奖励机制,鼓励模型识别网络安全缺陷。随着训练规模扩大,该能力同步提升,并在 CyberBench 上超越所有竞品。然而,模型在构建漏洞利用方面的进步超出了预期——并非设计目标,而是模型通过追逐奖励自然演化出的能力。
编辑观点
Z.ai 每代模型均在性能与关注度上实现跃升。AI 实验室间的良性竞争最终惠及全体用户,尤其当它们开放权重供全球研究者修改、部署于本地硬件时。期待更多创新模型持续涌现。

