搜索
首页
大数快讯
大数活动
服务超市
文章专题
出海平台
流量密码
出海蓝图
产业赛道
物流仓储
跨境支付
选品策略
实操手册
报告
跨企查
产业带
导航
知识体系
工具箱
产业园
更多
百科
找货源
跨境招聘
DeepSeek
首页
>
刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
>
刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
智东西
2026-08-14
16
导读:编程与智能体能力接近Claude Fable 5。
编程与智能体能力逼近 Claude Sonnet 5,智谱发布 GLM-5.3 并宣布两周后开源。
作者 |
陈骏达
编辑 |
心缘
8 月 14 日,智谱正式发布最新一代旗舰模型 GLM-5.3,并宣布该模型将在两周内开源。作为拥有 7430 亿参数的超大模型,GLM-5.3 延续了系列在编程领域的优势,多项主流基准测试成绩位居开源及即将开源模型之首,其编程与智能体任务能力已逼近 Claude Sonnet 5、GPT-5.6 Sol 等海外顶尖水平。
在国内模型对比中,GLM-5.3 与 Kimi K3 在编程和智能体领域互有胜负,且在绝大部分基准测试中领先
DeepSeek
-V4-Pro-0813。尤为突出的是,GLM-5.3 在网络安全能力上展现出显著优势,超越了其他两款国产竞品。
此外,GLM-5.3 在能力与 Token 效率之间取得了更优平衡。在相同的高档位思考预算下,其准确率达到 31.5%,优于 Claude Opus 4.8 的 29.5%;而任务平均输出约 5 万 Token,仅为 Opus 4.8 的一半,大幅降低了推理成本。
智东西在发布前获得内测资格,实测显示:GLM-5.3 搭配 ZCode 不仅能从 0 到 1 开发一款基于真实地图数据复刻
上海
陆家嘴至外滩区域的 3D 开放世界驾驶游戏,还能“裸考”DeepSeek 刚开源的 Harness 框架——在零先验条件下读懂超 7000 个文件的代码仓库,并按其规范打造“人格插件”。
除编程外,GLM-5.3 经充分预训练后涌现出强大的网络安全能力。在与国内高校及企业的合作中,该模型两周内揪出 2436 个漏洞。在白盒代码审查与漏洞推理等安全任务中,其表现接近 Claude Mythos 5。
目前,GLM-5.3 已上线智谱 AI 编程
工具
ZCode、效率工具 AutoClaw,支持通过 GLM Coding Plan 使用,并在 TraeWork、WorkBuddy、Qoder、OpenCode 等平台开放抢先体验。API 即将上线,开源前将完成安全评估与加固,以限制潜在攻击能力,保留防御价值。
01. 拿真实数据 1:1 复刻外滩建筑群,打造开放世界驾驶游戏
本次测试采用智谱最新 ZCode 搭配 GLM-5.3, tasked with 基于真实 OpenStreetMap 数据,开发一款上海陆家嘴至外滩区域的 3D 开放世界驾驶游戏。需求文档明确要求:地图解析、坐标转换和游戏逻辑等关键模块须由模型“手写”,仅允许使用 Three.js 底层渲染能力。为检验长任务记忆可靠性,测试方还在文档中埋入两条“陷阱条款”:凌晨两点至四点外滩建筑灯光熄灭一半,以及地图边缘需设置带提示的软性阻挡。
GLM-5.3 接收需求后,首先编写脚本从 Ov
erp
ass API 拉取 8 万多个 OSM 节点进行数据勘查,确认完整性后才启动开发。整个开发过程历经多轮迭代,最终交付约 4900 行代码,覆盖数据管线、车辆物理、音效、导航、昼夜循环及存档系统,两条“陷阱条款”均通过验收。
调试过程中,GLM-5.3 展现出清晰的排查思路。面对页面卡死问题,它未盲目改码,而是为本地
服务
器添加请求探针,通过面包屑日志精准定位故障点。
定位问题后,修复效率显著提升。例如针对相机视角穿模问题,GLM-5.3 从模糊描述出发,统计分析 6300 多栋建筑中约四成轮廓环绕方向与墙面法线约定相反,仅修改数行代码即解决问题。
因测试环境无法目检画面,GLM-5.3 甚至自编零依赖 PNG 解码器,通过像素统计客观验证水面、标线及夜间灯光渲染正确性。
值得称道的是,搭配 ZCode 使用时,对话平均缓存命中率超 99%,显著降低调用成本。
测试亦暴露短板:GLM-5.3 工程能力出色,但审美判断仍有提升空间。建筑贴图与道路标线经四轮人工反馈仍显简陋,未能完全达到预期效果。
总体而言,GLM-5.3 搭配 ZCode 可独立完成用户交付的开发任务,但仍需人工反馈辅助打磨,以产出更高
质量
的成果。
02. 读懂超 7000 个文件,连夜打造 DeepSeek Harness“人格插件”
若驾驶游戏考验从零创造能力,第二项测试则聚焦于对陌生大型代码仓库的理解与改造能力。测试对象为 DeepSeek 昨日刚开源的智能体框架 DeepSeek Harness,其 monorepo 包含 40 多个顶层包、200 多个工作区项目、7400 多个文件。
对 GLM-5.3 而言,这是一次真正的“裸考”:由于仓库发布仅一天,其训练数据中无任何相关信息,所有认知必须依靠现场摸索构建。
首项任务是仓库级理解:询问执行 dsh web 后,从进程启动到第一条消息抵达模型所经模块、插件加载机制及出错兜底策略。面对庞杂代码,GLM-5.3 派出 4 个并行探索子智能体,分别追查 CLI 入口、插件机制、模型契约与消息通路,汇总链路
报告
并逐条核对关键代码,成功建立跨文件关联。
报告核心结论包括:插件装配依赖 YAML 清单逐行登记,无自动扫描;锁定 LlmAdapter 作为通用模型契约;启动失败采取快速失败策略而非静默跳过。
在此基础上,测试方要求 GLM-5.3 开发“人格插件”,使 AI 回复可在文言文、东北话与猫语间切换,且须满足“零侵入”要求:功能生效不影响原框架行为,插件关闭立即复原。
GLM-5.3 先派 2 个子智能体通读仓库,5 分钟后提交报告;研究交互方案时增派第 3 个,合计消耗约 690 万 Token。最终选定系统提示注册表作为注入点:指令随系统层下发,用户消息不变;插件卸载后注册表自动清理。
交付结果显示,插件交互体验原生,可与其他插件共存于同一菜单栏,语言风格切换符合预期。
具体执行层面,初版交付涉及 20 个文件,净增 560 行代码,含双语文档配对记录与重生成依赖图。配套 11 条单元测试一次通过,覆盖开启注入、关闭复原及三人格路由等功能。
全量回归测试中出现小插曲:771 个测试文件中 6 个失败。GLM-5.3 主动撤下改动,在干净基线重跑用例,确认问题源于本机环境而非新增代码。解决环境问题后,复用既有命令机制将人格切换接入网页端,前端基本无新增代码,28 项文档门禁与 937 对双语文档检查全部通过。
本轮实测凸显 GLM-5.3 长板:任务拆解、跨包溯源、代码引用能力出色,对陌生工程规范理解深刻且遵循严谨,对照实验处置方式科学。
但也发现不足:ZCode 在长任务执行期间偶有反馈延迟,易被误判中断;部分低风险修改仍触发完整检查流程,可能造成不必要 Token 消耗。
03. 能力提升来自后训练 Scaling,网安能力显著涌现
据智谱官方博客,GLM-5.3 基座模型与 GLM-5.2 一致,性能跃升主要源于后训练阶段的 Scaling:更长任务环境、更丰富场景类型、更久训练时长共同促成能力突破。
随着任务环境拓展,GLM-5.3 涌现出超预期网络安全能力。在白盒源代码安全基准 CyberGym 中得分 84.5%,超越 GLM-5.2(77.2%)、Claude Mythos 5(83.8%)及 GPT-5.6 Sol(83.6%)。在 ExploitGym 漏洞利用测试中,2 小时内完成 105 项任务,达 Mythos 5 的 58%,较 GLM-5.2 的 29 项提升显著。
发布前两周,智谱联合清华大学、南开大学及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队开展密集红队测试,累计发现并经初筛去重确认漏洞 2436 个,其中 1097 个为中高危,最早可追溯至 45 年前,覆盖系统内核、操作系统、浏览器引擎等 269 个项目。所有漏洞均已报送国家 CNNVD/CNVD 库,智谱同步建立 Z.ai 安全披露账本,全程记录漏洞发现、确认与修复过程。
效率方面,自 GLM-5.2 引入 effort level(思考档位)控制后,GLM-5.3 在相近 Token 预算下实现了任务质量、执行
速度
与使用成本的更优平衡。
04. 结语:智谱、DeepSeek 等重押后训练,不换基座也能换代
实测表明,GLM-5.3 已具备在真实工程场景中交付完整产品的能力,审美判断等短板或将成为下一轮后训练优化重点。
后训练路线近期惠及多家厂商:DeepSeek-V4 正式版能力大幅提升同样得益于此。随着预训练数据与算力红利渐趋见顶,后训练正成为头部模型厂商性能突破的关键路径,其潜力远未被充分挖掘。
9 月 20-21 日,由智东西主办的 2026 全球 AI 芯片峰会将在上海举行,设开幕式及大模型 AI 芯片、Agent 推理芯片、具身智能芯片三场高峰论坛,另举办 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 五场技术研讨会。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容
11763
粉丝
0
关注
在线咨询
智东西
各类跨境出海行业相关资讯
总阅读
199.1k
粉丝
0
内容
11.8k