大数跨境

GLM 5.3 更强却更难用了?我们让它和 5.2 做了同一个北京城市驾驶游戏

GLM 5.3 更强却更难用了?我们让它和 5.2 做了同一个北京城市驾驶游戏 AI科技评论
2026-08-21
12
导读:官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。
官方宣称 GLM 5.3 安全能力大幅跃升,但实测显示,这套机制在自动化开发工具链中频繁触发拒绝策略,导致流程中断。

作者丨吴海明

编辑丨李娜

《极限竞速:地平线》中自由穿梭城市的开放世界体验令人印象深刻。此次测试将这一概念引入真实工程场景:要求模型从零开发一款基于 OpenStreetMap 真实数据的「北京国贸→望京」区域 3D 开放世界驾驶游戏。

地平线游戏示意图

测试要求项目需在浏览器单机运行,不依赖任何在线服务,最终交付可启动、可验证且断网可用的完整工程。GLM 5.3 作为智谱 2026 年 8 月发布的旗舰模型,相比上一代 GLM 5.2,其核心变化在于通过大规模后训练增强了复杂编程与长程任务能力,并显著提升了网络安全防御水平。

社区对 GLM 5.3 安全能力的评价

然而,能力增强伴随新的使用挑战。近期反馈指出 GLM 5.3 存在“过度防御”现象,输出文案晦涩难懂。本次实测旨在验证:GLM 5.3 在变强的同时,是否因过于谨慎而难以驾驭?我们选取 GLM 5.2 作为对照组,在同等需求下对比两者的还原度、完成度及交付效果。

网友反馈截图

结论先行:GLM 5.3 与 GLM 5.2 均能端到端完成项目。GLM 5.3 不仅速度更快,且在光影、导航等细节上营造出更真实的驾驶体验。但测试也证实,其增强的安全机制导致在自动化交互中更易触发拒绝判断,可能意外阻断正常开发流程。

01 实测 GLM 5.3:从零开发「北京国贸到望京」3D 开放世界驾驶游戏

本次实测基于智谱官方 ZCode 环境,题目要求利用 OpenStreetMap 数据构建真实地理场景,涵盖数据获取、三维渲染、物理交互及离线交付等全链路。具体需求如下:


以 OpenStreetMap 真实数据为基础,从零开发一个"北京国贸→望京"区域的 3D 开放世界驾驶游戏,单机浏览器运行,不依赖任何在线服务。
要求:
1. 用脚本从 Overpass API 拉取该区域路网与建筑数据,先勘查数据完整性再动工;
2. 车辆有基础物理 (加速/转向/碰撞);
3. 昼夜循环,且【工作日早 7:00-9:00 主干道车流密度翻倍】;
4. 地图边缘用【软性阻挡】处理 (车辆被自然减速推回,不允许报错或瞬移);
5. 含导航、音效、存档系统;
6. 交付可运行项目+README(含一条命令启动方法);README 中说明如何验证第 3、4 条特性;
7. 完成前自行做启动冒烟验证,再把启动方法写入 README;
8. 交付后【运行时零网络请求】:开发期联网拉取的数据与所有第三方库/资源必须本地打包,断网状态下游戏可完整加载与运行;
9. README 注明运行环境要求。
技术栈与项目结构不做限制,由你自行决策并在 README 中说明选型理由。

这是一次综合性开发测试。结果显示,GLM 5.3 与 GLM 5.2 均能一次性完成项目开发、冒烟测试及自动化部署,实现了从需求到交付的完整闭环。

GLM 5.3 开发成果:包含路灯、路标等更多真实元素

GLM 5.2 开发成果截图

经详细测试与体验,两款模型表现对比如下:

GLM 5.3:产品体验导向的快速原型

GLM 5.3 首先生成数据勘查报告,统计出路网 4,671 条、建筑 7,103 栋,并检查几何异常。在构建中,它将经纬度投影为米制坐标,生成包含 6,541 个节点的路网图。游戏设计方面,采用自行车运动学模型处理转向,覆盖建筑与交通车碰撞检测,并通过 2,300 多帧自检验证稳定性。

功能实现上,GLM 5.3 成功模拟了工作日早高峰主干道车流翻倍(44 辆增至 80 辆),支路车流保持不变;地图边缘软阻挡机制完善,越界深度稳定在 0.7 米。此外,它还实现了自动化导航、12.62 公里路线规划、偏航重算及手动/自动存档系统,整体更接近可直接体验的浏览器端 3D 游戏原型。

GLM 5.2:稳健的工程执行者

GLM 5.2 同样展现了极强的工程稳健性。其独立勘查脚本会在数据不达标时直接报错退出,最终获取路网约 1,243 公里、建筑 8,417 栋,几何损坏为零。地图还原方面,道路与建筑位置与真实空间高度对应。

车辆系统方面,GLM 5.2 加入了空间网格加速碰撞查询。早高峰规则实测显示,主干道车辆从 85 辆翻倍至 169 辆。地图边缘测试中,车辆以 108 km/h 冲向边界后被减速至 5 km/h,无瞬移或报错。导航系统支持 14.4 公里路线规划、转向提示及偏航重算;存档系统支持定时自动保存,刷新后可恢复状态。

核心差异总结

1. 效率:GLM 5.3 用时 50 分 47 秒,比 GLM 5.2(66 分 1 秒)快约 15 分钟。

2. 代码结构:GLM 5.3 产出 3,104 行代码、14 个文件,结构集中;GLM 5.2 产出 3,063 行代码、20 个文件,拆分更细。

3. 交付体验:两者均支持一键启动和断网运行。GLM 5.3 将核心资源本地打包;GLM 5.2 离线方案更彻底,无需启动本地服务即可直接打开文件运行。

4. 技术选型:GLM 5.3 采用 three.js ES Module 及实时阴影,利于扩展与表现;GLM 5.2 采用 UMD 直载和零构建路线,强调兼容性与稳定性。

体验层面,GLM 5.3 版本加入路灯、动态光影和路标提示,速度反馈自然,超车变道流畅,真实感更强。相比之下,GLM 5.2 虽功能完整,但存在左右键接反、车头朝向公式错误等 Bug,且最高速度保守(约 45 km/h),导致超车困难。总体而言,GLM 5.3 更像注重体验的产品开发者,GLM 5.2 则是严谨的工程验证者。

02 为什么 GLM 5.3 比 GLM 5.2 具有更多画面真实感?

GLM 5.3 在道路、建筑之外,补充了路灯、光影、HUD 提示等细节,显著提升了沉浸感。这种“真实感”源于其后训练策略的差异。

官方数据显示,GLM 5.3 与 GLM 5.2 共用基础底座,能力提升主要来自后训练。GLM 5.3 的训练环境更贴近真实专业工作流,强调在完整链路中理解目标、操作工具、阅读代码并最终交付可用结果。这种训练使其擅长将地图数据、车辆运动、交通规则等多个模块组织成连贯体验,而非单纯堆砌功能。

榜单数据佐证了这一点:在 Terminal Bench 3.0、DeepSWE v1.1 等强调长程操作和真实工程环境的测试中,GLM 5.3 较 GLM 5.2 提升显著。这表明 GLM 5.3 的优势在于从“功能实现”走向“体验整合”。

智谱官网发布的 GLM 5.3 性能榜单数据

03 实测踩坑:GLM 5.3 更强的安全能力,也带来了新的适配问题

测试中最耗时的障碍并非代码生成,而是模型安全策略与自动化工具的冲突。在尝试使用 Claude Code 进行自动化开发时,GLM 5.2 顺利完成任务,而 GLM 5.3 却在数据校验环节因触发严格的安全拒绝策略而卡死。

两个模型在 Claude Code 中运行一小时后的对比

官方报告显示,GLM 5.3 在 CyberGym、ExploitBench 等安全基准测试中得分远超 GLM 5.2,具备跨阶段理解漏洞利用链的能力。这种能力的提升带来双重影响:一是风险识别与安全推理更强;二是在涉及自动化执行和权限判断时,模型采取更严格的约束。这解释了为何 GLM 5.3 在 Agent 任务上更强,却在自动化流程中频频受阻。

官方报告的 GLM 5.3 安全能力榜单

此次测试表明,当模型进化为强 Agent 后端时,评估标准不能仅看最终产出,还需考察其与现有工具链的协作顺畅度。

04 总结:GLM 5.3 把能力训练得更像「产品开发者」

本次测试证实,GLM 5.3 通过后训练强化了长程任务与项目验证能力,使其能将复杂需求转化为可感知、可体验的产品原型。相比 GLM 5.2 的稳健基线,GLM 5.3 在整体组织能力和真实感呈现上更进一步。

然而,GLM 5.3 的“谨慎”也是一把双刃剑。增强的安全攻防能力虽然必要,但也收窄了使用边界,使其在自动化交互中更容易触发审查拒绝。这意味着,更强的模型并不天然等同于更通用的适配性,用户在将其接入自动化工作流时,需充分考虑其安全策略带来的潜在摩擦。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8902
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读213.7k
粉丝0
内容8.9k