大数跨境

刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness

刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness 智东西
2026-08-14
16
导读:编程与智能体能力接近Claude Fable 5。

编程与智能体能力逼近 Claude Sonnet 5,智谱发布 GLM-5.3 并宣布两周后开源。
作者 | 陈骏达
编辑 | 心缘
8 月 14 日,智谱正式发布最新一代旗舰模型 GLM-5.3,并宣布该模型将在两周内开源。作为拥有 7430 亿参数的超大模型,GLM-5.3 延续了系列在编程领域的优势,多项主流基准测试成绩位居开源及即将开源模型之首,其编程与智能体任务能力已逼近 Claude Sonnet 5、GPT-5.6 Sol 等海外顶尖水平。
在国内模型对比中,GLM-5.3 与 Kimi K3 在编程和智能体领域互有胜负,且在绝大部分基准测试中领先 DeepSeek-V4-Pro-0813。尤为突出的是,GLM-5.3 在网络安全能力上展现出显著优势,超越了其他两款国产竞品。

此外,GLM-5.3 在能力与 Token 效率之间取得了更优平衡。在相同的高档位思考预算下,其准确率达到 31.5%,优于 Claude Opus 4.8 的 29.5%;而任务平均输出约 5 万 Token,仅为 Opus 4.8 的一半,大幅降低了推理成本。

智东西在发布前获得内测资格,实测显示:GLM-5.3 搭配 ZCode 不仅能从 0 到 1 开发一款基于真实地图数据复刻上海陆家嘴至外滩区域的 3D 开放世界驾驶游戏,还能“裸考”DeepSeek 刚开源的 Harness 框架——在零先验条件下读懂超 7000 个文件的代码仓库,并按其规范打造“人格插件”。

除编程外,GLM-5.3 经充分预训练后涌现出强大的网络安全能力。在与国内高校及企业的合作中,该模型两周内揪出 2436 个漏洞。在白盒代码审查与漏洞推理等安全任务中,其表现接近 Claude Mythos 5。
目前,GLM-5.3 已上线智谱 AI 编程工具 ZCode、效率工具 AutoClaw,支持通过 GLM Coding Plan 使用,并在 TraeWork、WorkBuddy、Qoder、OpenCode 等平台开放抢先体验。API 即将上线,开源前将完成安全评估与加固,以限制潜在攻击能力,保留防御价值。

01. 拿真实数据 1:1 复刻外滩建筑群,打造开放世界驾驶游戏

本次测试采用智谱最新 ZCode 搭配 GLM-5.3, tasked with 基于真实 OpenStreetMap 数据,开发一款上海陆家嘴至外滩区域的 3D 开放世界驾驶游戏。需求文档明确要求:地图解析、坐标转换和游戏逻辑等关键模块须由模型“手写”,仅允许使用 Three.js 底层渲染能力。为检验长任务记忆可靠性,测试方还在文档中埋入两条“陷阱条款”:凌晨两点至四点外滩建筑灯光熄灭一半,以及地图边缘需设置带提示的软性阻挡。

GLM-5.3 接收需求后,首先编写脚本从 Overpass API 拉取 8 万多个 OSM 节点进行数据勘查,确认完整性后才启动开发。整个开发过程历经多轮迭代,最终交付约 4900 行代码,覆盖数据管线、车辆物理、音效、导航、昼夜循环及存档系统,两条“陷阱条款”均通过验收。
调试过程中,GLM-5.3 展现出清晰的排查思路。面对页面卡死问题,它未盲目改码,而是为本地服务器添加请求探针,通过面包屑日志精准定位故障点。

定位问题后,修复效率显著提升。例如针对相机视角穿模问题,GLM-5.3 从模糊描述出发,统计分析 6300 多栋建筑中约四成轮廓环绕方向与墙面法线约定相反,仅修改数行代码即解决问题。

因测试环境无法目检画面,GLM-5.3 甚至自编零依赖 PNG 解码器,通过像素统计客观验证水面、标线及夜间灯光渲染正确性。
值得称道的是,搭配 ZCode 使用时,对话平均缓存命中率超 99%,显著降低调用成本。

测试亦暴露短板:GLM-5.3 工程能力出色,但审美判断仍有提升空间。建筑贴图与道路标线经四轮人工反馈仍显简陋,未能完全达到预期效果。
总体而言,GLM-5.3 搭配 ZCode 可独立完成用户交付的开发任务,但仍需人工反馈辅助打磨,以产出更高质量的成果。

02. 读懂超 7000 个文件,连夜打造 DeepSeek Harness“人格插件”

若驾驶游戏考验从零创造能力,第二项测试则聚焦于对陌生大型代码仓库的理解与改造能力。测试对象为 DeepSeek 昨日刚开源的智能体框架 DeepSeek Harness,其 monorepo 包含 40 多个顶层包、200 多个工作区项目、7400 多个文件。
对 GLM-5.3 而言,这是一次真正的“裸考”:由于仓库发布仅一天,其训练数据中无任何相关信息,所有认知必须依靠现场摸索构建。

首项任务是仓库级理解:询问执行 dsh web 后,从进程启动到第一条消息抵达模型所经模块、插件加载机制及出错兜底策略。面对庞杂代码,GLM-5.3 派出 4 个并行探索子智能体,分别追查 CLI 入口、插件机制、模型契约与消息通路,汇总链路报告并逐条核对关键代码,成功建立跨文件关联。
报告核心结论包括:插件装配依赖 YAML 清单逐行登记,无自动扫描;锁定 LlmAdapter 作为通用模型契约;启动失败采取快速失败策略而非静默跳过。

在此基础上,测试方要求 GLM-5.3 开发“人格插件”,使 AI 回复可在文言文、东北话与猫语间切换,且须满足“零侵入”要求:功能生效不影响原框架行为,插件关闭立即复原。

GLM-5.3 先派 2 个子智能体通读仓库,5 分钟后提交报告;研究交互方案时增派第 3 个,合计消耗约 690 万 Token。最终选定系统提示注册表作为注入点:指令随系统层下发,用户消息不变;插件卸载后注册表自动清理。
交付结果显示,插件交互体验原生,可与其他插件共存于同一菜单栏,语言风格切换符合预期。
具体执行层面,初版交付涉及 20 个文件,净增 560 行代码,含双语文档配对记录与重生成依赖图。配套 11 条单元测试一次通过,覆盖开启注入、关闭复原及三人格路由等功能。

全量回归测试中出现小插曲:771 个测试文件中 6 个失败。GLM-5.3 主动撤下改动,在干净基线重跑用例,确认问题源于本机环境而非新增代码。解决环境问题后,复用既有命令机制将人格切换接入网页端,前端基本无新增代码,28 项文档门禁与 937 对双语文档检查全部通过。

本轮实测凸显 GLM-5.3 长板:任务拆解、跨包溯源、代码引用能力出色,对陌生工程规范理解深刻且遵循严谨,对照实验处置方式科学。
但也发现不足:ZCode 在长任务执行期间偶有反馈延迟,易被误判中断;部分低风险修改仍触发完整检查流程,可能造成不必要 Token 消耗。

03. 能力提升来自后训练 Scaling,网安能力显著涌现

据智谱官方博客,GLM-5.3 基座模型与 GLM-5.2 一致,性能跃升主要源于后训练阶段的 Scaling:更长任务环境、更丰富场景类型、更久训练时长共同促成能力突破。
随着任务环境拓展,GLM-5.3 涌现出超预期网络安全能力。在白盒源代码安全基准 CyberGym 中得分 84.5%,超越 GLM-5.2(77.2%)、Claude Mythos 5(83.8%)及 GPT-5.6 Sol(83.6%)。在 ExploitGym 漏洞利用测试中,2 小时内完成 105 项任务,达 Mythos 5 的 58%,较 GLM-5.2 的 29 项提升显著。

发布前两周,智谱联合清华大学、南开大学及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队开展密集红队测试,累计发现并经初筛去重确认漏洞 2436 个,其中 1097 个为中高危,最早可追溯至 45 年前,覆盖系统内核、操作系统、浏览器引擎等 269 个项目。所有漏洞均已报送国家 CNNVD/CNVD 库,智谱同步建立 Z.ai 安全披露账本,全程记录漏洞发现、确认与修复过程。

效率方面,自 GLM-5.2 引入 effort level(思考档位)控制后,GLM-5.3 在相近 Token 预算下实现了任务质量、执行速度与使用成本的更优平衡。

04. 结语:智谱、DeepSeek 等重押后训练,不换基座也能换代

实测表明,GLM-5.3 已具备在真实工程场景中交付完整产品的能力,审美判断等短板或将成为下一轮后训练优化重点。
后训练路线近期惠及多家厂商:DeepSeek-V4 正式版能力大幅提升同样得益于此。随着预训练数据与算力红利渐趋见顶,后训练正成为头部模型厂商性能突破的关键路径,其潜力远未被充分挖掘。

9 月 20-21 日,由智东西主办的 2026 全球 AI 芯片峰会将在上海举行,设开幕式及大模型 AI 芯片、Agent 推理芯片、具身智能芯片三场高峰论坛,另举办 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 五场技术研讨会。

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读199.1k
粉丝0
内容11.8k