智谱发布7430亿参数GLM - 5.3模型两周内开源,实测编程与网安能力双强! 📅 2026/8/16 16:20:16 拿真实数据1:1复刻外滩建筑群还做了个开放世界驾驶游戏此次测试用到智谱更新的ZCode搭配旗舰模型GLM - 5.3。交给GLM - 5.3的第一个任务是按真实OpenStreetMap数据开发上海陆家嘴至外滩区域的3D开放世界驾驶游戏。文档要求地图解析等关键模块让模型“手写”只用Three.js底层渲染能力。为测模型长任务记忆可靠性在文档中部设两条“陷阱条款”。GLM - 5.3拿到需求后验证数据形态编写脚本拉取8万多个OSM节点勘查数据确认完整后开发。开发持续多轮最终交付约4900行代码覆盖多系统两条埋雷条款验收通过。开发中GLM - 5.3排查问题思路清晰修复bug效率高。比如相机视角问题它统计建筑轮廓环绕方向找出原因改几行代码就修复。因测试环境无法目检画面它还自己写了零依赖的PNG解码器证明渲染正确。搭配ZCode使用对话平均缓存命中率超99%。不过开发中也发现GLM - 5.3审美判断有提升空间建筑贴图和道路标线观感经四轮人工反馈仍未达预期。总体看GLM - 5.3搭配ZCode能完成开发任务但需用户提供反馈打磨交付物。读懂超7000个文件连夜打造DeepSeek Harness“人格插件”第二项实测考察GLM - 5.3面对陌生大型代码仓库的能力。测试对象是DeepSeek刚开源的DeepSeek Harness包含40多个顶层包、200多个工作区项目、7400多个文件。对GLM - 5.3是“裸考”。第一项任务是仓库级理解询问用户执行dsh web后相关流程GLM - 5.3派4个并行探索子智能体追查汇成链路报告并核对关键代码得出关键结论。在此基础上要求GLM - 5.3开发“人格插件”实现AI回复语言切换且要“零侵入”。GLM - 5.3派3个探索子智能体摸清规范选定注入口。最终交付的插件交互体验原生符合要求。初版交付涉及20个文件、净增560行单元测试通过。全量回归时部分测试文件失败GLM - 5.3排查确认问题源于本机环境。解决环境问题后它复用命令机制将人格切换接入网页端文档检查通过。结果显示GLM - 5.3长板是任务拆解等不过ZCode在长任务中反馈不足GLM - 5.3对低风险修改检查测试消耗token多。能力提升来自后训练Scaling网安能力涌现智谱在博客中介绍GLM - 5.3基座模型与GLM - 5.2一致能力提升源于后训练Scaling它经历更长任务环境、更多环境类型后训练时间加长。随着任务环境丰富GLM - 5.3涌现网络安全能力。如在白盒源代码安全基准测试中得分超GLM - 5.2等模型在ExploitGym测试中完成任务数相比GLM - 5.2提升明显。GLM - 5.3发布前两周智谱联合多家安全团队开展红队测试与安全评估2周内发现2436个漏洞部分为中高危相关漏洞报送国家漏洞库智谱建立安全披露账本记录过程。执行效率上GLM - 5.3在任务完成质量等方面取得更好平衡。结语智谱、DeepSeek等纷纷重押后训练不换基座也能换代实测显示GLM - 5.3能在真实工程现场交付成果审美判断等短板可在后训练中打磨。后训练让不止智谱受益DeepSeek - V4能力提升也与后训练有关。预训练红利见顶后后训练成头部模型厂商提升性能关键方向潜力待挖掘。