官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。
作者丨吴海明
编辑丨李 娜
大家还记得《极限竞速:地平线》里那种在开放世界中自由驾驶、穿梭城市与道路的体验吗?
地平线游戏图 这次,我们用一个类似思路、但更贴近真实工程开发的题目来考一考 GLM 5.3: 从零开发一款基于 OpenStreetMap 真实数据的「北京国贸 → 望京」区域 3D 开放世界驾驶游戏 ,5.3 需要在浏览器中单机运行,不依赖任何在线服务,并且最终交付一个可启动、可验证、可断网运行的完整项目。 GLM 5.3 是智谱在 2026 年 8 月 13 日发布的最新旗舰模型,对比上一代旗舰 GLM 5.2,GLM 5.3 使用同一个底座,主要通过更大规模、更贴近真实工程场景的 后训练 ,增强复杂编程、长程任务、工具调用和项目交付能力。同时,GLM 5.3 还有一个值得关注的变化:官方强调其 网络安全能力 明显增强,模型在风险识别、安全判断和复杂系统分析上更强。
网络社区对于GLM5.3安全能力的评价 能力增强之后,也带来了新的使用感受,最近有小红书用户吐槽,GLM 5.3 似乎出现了“过度防御”:也有人反馈 5.3 写出的文案越来越难懂,“全是黑话”,即使反复修改提示词也没有明显改善。这些反馈指向同一个问题: GLM 5.3 变强之后,是否也变得更谨慎、更难驾驭?
网络社区网友反馈截图 对此,我们设计了一次更贴近真实工程场景的对照测试。为了更直观地观察模型迭代效果,我们选取 GLM 5.2 作为对照组,在同一题目、同一需求下比较两者的真实世界还原度、项目完成度、工程交付能力和最终运行效果。 先说结论,最终,GLM 5.3 和 GLM 5.2 都能端到端完成项目,GLM 5.3 不仅完成速度更快,也更懂得把光影、路灯、HUD、导航和速度反馈等细节组织成更真实的驾驶体验。
不过测试也印证了前面的用户反馈: GLM 5.3 更强的安全能力确实带来了新的适配问题,模型因为安全判断增强而变得更谨慎, 在自动化编程交互中更容易触发拒绝判断;当它接入自动化开发工具链时,这种“谨慎”甚至可能让原本正常的开发流程被意外卡住。
01
实测 GLM 5.3:
从零开发「北京国贸到望京」的
3D 开放世界驾驶游戏
在这次实测中,我们选择智谱官方发布的 ZCode 作为开发环境,让 GLM 5.3 面向真实开发场景展开实测:从零开发一款基于 OpenStreetMap 真实数据的「北京国贸→望京」区域 3D 开放世界驾驶游戏。为更直观观察模型迭代效果,本次测试同时选取 GLM 5.2 作为对照组,在相同需求下比较两者的真实世界还原度、项目完成度、工程交付能力与最终运行效果。 具体题目如下: 以 OpenStreetMap 真实数据为基础,从零开发一个"北京国贸→望京"区域的 3D 开放世界驾驶游戏,单机浏览器运行,不依赖任何在线服务。
要求:1. 用脚本从 Overpass API 拉取该区域路网与建筑数据,先勘查数据完整性再动工;2. 车辆有基础物理(加速/转向/碰撞);3. 昼夜循环,且【工作日早 7:00-9:00 主干道车流密度翻倍】;4. 地图边缘用【软性阻挡】处理(车辆被自然减速推回,不允许报错或瞬移);5. 含导航、音效、存档系统;6. 交付可运行项目+README(含一条命令启动方法);README 中说明如何验证第 3、4 条特性;7. 完成前自行做启动冒烟验证(如 node --check / 本地起服务确认无报错),再把启动方法写入 README;8. 交付后【运行时零网络请求】:开发期联网拉取的数据与所有第三方库/资源(含 CDN 引用)必须本地打包, 断网状态下游戏可完整加载与运行;9. README 注明运行环境要求(如 Node/Python 版本、推荐浏览器)。技术栈与项目结构(单文件 HTML 还是多文件工程、用什么渲染方案)不做限制,由你自行决策,并在 README 中用一段说明选型理由。 从测试题目可以看到,这是一次覆盖数据获取、工程搭建、三维渲染、交互控制、交通规则、离线交付和项目文档的综合性开发测试。
模型需要理解 北京国贸到望京 这一真实地理场景,并将开放地图数据转化为可运行的 3D 驾驶空间,并围绕车辆控制、NPC 车流、昼夜变化、导航系统和存档机制搭建完整玩法闭环。 如下面 2 张图所示,GLM 5.3 与 GLM 5.2 均能端到端一次性完成项目开发,并完成冒烟测试和自动化部署。两个模型最终开发的项目都支持一键启动,且完成全部任务要求,实现了从自然语言需求出发,完成项目规划、代码实现、资源组织、运行验证和文档交付的完整链路。
GLM 5.3 开发的「北京国贸→望京」 3D 开放世界驾驶游戏截图,更多真实世界的元素:路灯、夸张的路标等
GLM 5.2 开发的「北京国贸→望京」 3D 开放世界驾驶游戏截图 为了更好理解两个模型在这个小型系统级别开发任务的表现,我们通过完整测试与体验后整理了如 下判分表格:
具体来说:
GLM 5.3 首先 编写了获取数据的脚本,从 OpenStreetMap 拉取北京国贸至望京区域的真实路网与建筑数据,并在开发前生成勘查报告,统计出路网 4,671 条、约 1,091 公里,建筑 7,103 栋,同时检查高度标签比例和异常几何情况。 后续构建中,GLM 5.3 将真实经纬度投影为米制平面坐标,并生成包含 6,541 个节点、13,513 条有向边的路网图。在游戏设计上,设计了车辆加速、转向和碰撞三项基础物理特性,其中转向采用自行车运动学模型,碰撞则覆盖建筑和交通车,并通过 2,300 多帧自检验证稳定性。 此外,GLM 5.3 在工作日的 7:00-9:00 实现了主干道车流翻倍,从数据能查到主干道车流从 44 辆爬升至 70 辆、再到 80 辆的记录, 不过支路车流保持不变 ;地图边缘软阻挡也完整实现,车辆顶着油门撞向边界时越界深度稳定在 0.7 米,松油门后可缓慢回推。 最后,GLM 5.3 还实现了自动化导航、12.62 公里国贸至望京 SOHO 路线规划、92 段路径、偏航重算、小地图设点、手动与自动存档,以及包含启动方法、验证说明和技术选型的 README,整体更接近一个可直接体验的浏览器端 3D 驾驶 游戏原型。
GLM 5.2 也完成了端到端项目开发,并展现出较强的工程稳健性。5.2 先进行数据勘查,再进入游戏开发流程,独立勘查脚本会按道路等级统计长度、检查几何损坏比例,并 在数据不达标时直接报错退出 ,最后 GLM 5.2 获取到路网约 1,243 公里、建筑 8,417 栋,几何损坏为零,并进入游戏实现阶段。 在地图还原方面,GLM 5.2 基于真实 OSM 经纬度坐标进行换算,截图核验显示道路和建筑位置能够与真实城市空间对应;车辆系统方面,它完成了加速、转向和碰撞,并加入空间网格加速碰撞查询。
早高峰规则经过脚本实测:工作日 7 点半主干道车辆达到 169 辆,高峰前后为 85 辆,约为翻倍,周末同时段不触发;地图边缘软阻挡也通过高强度测试,车辆以 108 km/h 全速冲向边界后,车速被压低至约 5 km/h,始终无法出界,松油门后约 13 秒缓慢回推,且每帧位移不超过 0.5 米,无瞬移和报错。 导航方面,它规划出国贸至望京 SOHO 约 14.4 公里的路线,支持转向箭头、剩余距离、小地图路线显示和偏航重算;存档系统支持每 5 秒自动保存和关闭页面前保存,刷新后可恢复位置、时间、里程和导航目的地;README 也较完整,配有白天、夜晚截图及多轮启动验证记录。 先说结论。 整体来看,两个模型都能端到端完成项目开发,但在效率和技术取向上有所不同 。GLM 5.3 更像面向产品体验的快速原型开发搭档,而 GLM 5.2 则更像强调可验证、可兼容、可离线运行的工程执行者。 1.从时间上来说,GLM 5.3 用时 50 分 47 秒,较 GLM 5.2 的 66 分 1 秒快了约 15 分钟。 2.在代码规模接近的情况下,GLM 5.3 产出 3,104 行代码、14 个文件,GLM 5.2 产出 3,063 行代码、20 个文件,前者结构更集中,后者拆分更细; 3.运行交付方面,两者均实现一键启动,且都通过断网可玩验证,GLM 5.3 把游戏运行所需的核心程序文件都打包到本地,而 GLM 5.2 的离线方案更彻底,不仅不需要联网加载任何资源,甚至不用启动本地服务,直接打开文件也能运行;
4.技术选型上,GLM 5.3 采用 three.js ES Module、fetch 加载和实时阴影,更接近现代前端 3D 项目,也更利于画面表现与后续扩展,GLM 5.2 则采用 three.js r147 UMD 直载和零构建路线,更强调简单、稳定和环境兼容性。 5.整体而言,GLM 5.3 更像面向产品体验的快速原型开发搭档,而 GLM 5.2 则更像强调可验证、可兼容、可离线运行的工程执行者。
从测试人员的实际体验来看,两个模型开发的驾驶系统都已能较好还原从国贸到望京的城市驾驶感受,包括多车道行驶、道路两侧高楼、车辆碰撞、早高峰排队以及并线插队等场景,整体已经具备开放世界驾驶原型的可玩性;不过,两者在沉浸感和操控细节上仍有明显差异。 相比 GLM 5.2, GLM 5.3 的版本加入了更多真实城市元素,例如路灯、光影变化和路标提示,画面层次和真实世界还原度更高,速度控制也更接近实际驾驶体验,玩家在加速、超车和变道时能获得更自然的反馈 ;GLM 5.2 虽然功能完整,但测试中发现 左右键接反、车头朝向公式错误等问题 ,同时其速度设定更为保守,最高速度仅约 45 km/h,导致 测试人员在超车时经常因为动力不足而与其他车辆发生碰撞 。整体而言, GLM 5.3 在可玩性、真实感和产品化体验上更进一步,GLM 5.2 则更像一个功能完整、规则清晰但驾驶手感相对保守的验证型版本 。
02
为什么 GLM 5.3 比 GLM 5.2
具有更多画面真实感?
在前面的实战测试可以发现:GLM 5.3 做出的版本更像一个真实城市中的驾驶游戏,在道路、建筑和车辆系统之外,进一步补充了路灯、光影、路标、HUD 提示和更自然的速度反馈,让国贸到望京这段路线从一个可运行、具备沉浸感的产品原型。 要解释这种 真实感 从何而来,还需要回到 GLM 5.3 与 GLM 5.2 的模型关系本身,根据官方公布的信息,GLM 5.3 使用了与 GLM 5.2 相同的基础模型,其能力提升主要来自后训练,即 GLM 5.3 的变化更多是在 GLM 5.2 的基础上,通过更多复杂工程环境、更长程任务和更贴近真实工作流的强化学习训练,加强了模型对完整项目体验的组织能力。 据官方技术报告, GLM 5.3 后训练在 GLM5.2 基础上进一步扩展到更接近真实专业工作的任务环境中,这类环境更多是要求模型在一个完整工作流中理解目标、操作工具、阅读代码、修改工程、运行验证,并最终交付可用结果。 对于一个 3D 驾驶游戏来说, 真实感 更多来自地图数据、道路拓扑、车辆运动、交通规则、导航反馈和界面提示之间的协同。智谱对 GLM 5.3 在这类长链路任务上的训练增强,使其更容易把多个功能模块组织成一个连贯体验,而不是只完成需求清单上的单项功能。 官方公布的榜单数据进一步支撑这一判断,GLM 5.3 在多个复杂编程和智能体任务基准上较 GLM 5.2 有明显提升,尤其是在更强调长程操作和真实工程环境的测试中提升更大。
例如,Terminal Bench 3.0 从 GLM 5.2 的 4.6 提升到 GLM 5.3 的 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,SWE-Marathon v1.1 从 19.4 提升到 42.5,AutomationBench v1.0.6 从 26.2 提升到 48.2。这些基准测试衡量的都是模型在复杂环境中持续推进任务、理解代码库、调用工具、调试验证和完成交付的能力。
(雷峰网)
智谱官网发布的 GLM 5.3 性能榜单数据 对应到这次驾驶游戏实测,GLM 5.3 的优势就体现在 从功能实现走向体验整合 ,不仅对真实路网、建筑、车辆物理、碰撞和导航进行了模拟,还进一步补充了路灯、光影、路标、HUD 提示和更自然的速度反馈,这些细节会显著提升城市驾驶的真实感。因此,GLM 5.3 比 GLM 5.2 更有真实感,更多是因为后训练强化了它对复杂项目的整体组织能力,GLM 5.2 更像是把每项功能稳定实现出来。
03
实测踩坑:GLM 5.3 更强的安全能力,
也带来了新的适配问题
在上述实测中,GLM 5.3 的优势主要体现在开发效率、真实感和复杂工程组织能力上。但在此次实际测试过程中,最耗时的坑并不来自代码生成本身,而是出现在模型安全策略与自动化开发工具的衔接上,GLM 5.3 能力变强之后,也变得更 谨慎 了,下面具体来聊一聊全过程: 此次实测最初计划使用 Claude Code 进行自动化开发,测试人员在一台全新的 Ubuntu 环境中,同时启动了 GLM 5.3 和 GLM 5.2 两个模型的自动化运行任务,并开启 auto mode on 模式,希望让两个模型在同样环境下独立完成项目开发。 但是一个多小时运行后,GLM 5.2 已经完成了项目开发任务,而 GLM 5.3 还停留在数据校验判断的报错上。
经过分析发现,问题出在模型安全策略上,Claude Code 在自动化流程中,会让模型判断当前任务或操作是否可以继续通过;而 GLM 5.3 在这一判断环节触发了更严格的安全拒绝,导致后续步骤无法继续执行。也就是说,GLM 5.3 并不是 不会做 ,而是在涉及安全性的判断节点上选择了拒绝,从而让整个任务流程卡死。
两个模型在 Claude Code 中运行一个多小时后的截图 根据官方报告,GLM 5.3 在 GLM 5.2 的基础上继续扩大后训练规模,其中一个重要变化是网络安全能力快速提升。如下图所示,GLM 5.3 在 CyberGym 上得分为 84.5,高于 GLM 5.2 的 77.2;在 ExploitBench 上,GLM 5.3 得分为 54.4,明显高于 GLM 5.2 的 24.4;在 ExploitGym 中,GLM 5.3 的 2 小时 / 6 小时成绩为 105 / 130,而 GLM 5.2 为 29 / 39。
尤其是在更深入漏洞利用链的测试中,GLM 5.3 相比 GLM 5.2 的提升幅度更大。
官方报告的 GLM 5.3 安全能力榜单 从官方表述看,GLM 5.3 的网络安全能力并不停留在识别单个漏洞,而是具备跨多个阶段理解漏洞利用链的能力,这类能力提升则带来两方面影响:1)模型在复杂系统分析、风险识别和安全推理上更强;2)模型在涉及自动化执行、权限判断、代码运行和安全边界时,可能会采取更严格的行为约束。这便解释了 GLM 5.3 明明在复杂编程和 Agent 任务上更强,却在 Claude Code 的自动化流程中一度无法推进。 因此,这次测试也得出另一个实用的经验: 当模型从代码生成器进化为更强的 Agent 后端后,测试重点不能只看它最终能不能写出项目,还要看它能否与现有 Agent 工具链顺畅协作 。
04
总结:GLM 5.3 把能力
训练得更像「产品开发者」
通过这次测试可以得出:GLM 5.3 相比 GLM 5.2 的变化,技术上主要来自后训练,效果上则体现为更强的复杂任务完成能力和更好的产品化表现。 GLM 5.3 不是在 GLM 5.2 之外另起炉灶,而是在相同基础模型之上,通过更大规模、更贴近真实工程场景的后训练,强化了长程任务、工具使用、代码修改和项目验证能力。因此,在本次国贸到望京 3D 驾驶游戏实测中,GLM 5.3 不只是更快完成项目,也更容易把功能组织成体验:道路、建筑、车辆、导航、HUD、光影、路灯和速度反馈被整合成一个更完整的驾驶原型。
证明了 GLM 5.3 更懂得如何把复杂需求转化为可运行、可感知、可体验的产品。 相比之下,GLM 5.2 更像一个稳健的工程执行基线,扎实完成数据获取、路网构建、车辆控制、交通规则和离线运行等核心任务,结果可靠、兼容性强、验证路径清晰。而 GLM 5.3 则向前走了一步,更好的整体组织能力,让同样的需求呈现出更强的真实感和完成度。 不过,GLM 5.3 的增强也带来了一个值得注意的新问题:模型变得更谨慎了。
虽然官方强调 GLM 5.3 提升了安全能力,这在安全场景下显然是必要的,但在本次实测中,这种谨慎也成为自动化开发流程中的最大卡点,GLM 5.3 在某些判断环节触发了安全拒绝,导致任务长时间无法推进。这说明,能力更强的模型并不一定天然带来更通用的场景适配, 当模型具备更强安全攻防能力时,它的使用边界会自然变窄,交互过程也可能更容易触发拒绝审查。
上车,带你看遍全球 AI 顶会精华
可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈
扫描上方二维码 或点击 「 阅读原文 」 关注专区。
