智谱发布GLM-5.3编程能力大涨50% 可挖掘2400余个安全漏洞
模型发布、安全、编程 雷峰网

智谱发布GLM-5.3编程能力大涨50% 可挖掘2400余个安全漏洞

智谱AI正式上线GLM-5.3模型,在基座模型不变的情况下,通过架构优化技术IndexShare、强化学习算法SAO及新一代后训练框架Slime,实现编程能力体感提升50%。该模型在漏洞挖掘与防御方面表现突出,可一次性发现2436个漏洞,其中中高危漏洞1097个,并定位到潜伏40年的世界级安全缺陷。官方同步开放ZCode编程工具、AutoClaw效率应用及GLM Coding Plan订阅服务。

DeepSeek发布新模型引发行业热议的当晚,智谱AI以低调而迅猛的姿态推出了其新一代大模型GLM-5.3。与以往常规的模型迭代不同,此次升级并未更换基座模型,而是将全部精力倾注于后训练环节,通过三项核心技术——架构优化技术IndexShare、强化学习算法SAO以及新一代后训练框架Slime——实现了编程能力“体感提升50%”的显著飞跃。智谱官方为这款新模型贴上了三个鲜明标签:最强安全模型、最强编程模型、最强开源模型,直接向全球顶尖模型发起了正面挑战。

在编程能力这一核心赛道上,GLM-5.3交出了一份令人瞩目的成绩单。在考验真实终端环境复杂操作的Terminal-Bench 3.0评测中,该模型得分从4.6分大幅跃升至28.3分,逼近业界标杆Claude Fable 5的33.7分;在长程软件工程基准DeepSWE v1.1中,其得分从46.2提升至66.9,与Fable 5的差距缩小至仅2.8分,与擅长长程任务的Kimi K3差距更是压缩到0.6分。更值得注意的是,在强调多工具协作的Agents’ Last Exam评测中,GLM-5.3实现了对Fable 5的反超;而在衡量AI实际经济价值的GDPval-AA v2基准上,该模型直接拿下全球第一。智谱自建的Z.ai Code Bench评测体系将模型直接投入真实本地开发环境,在最高难度档位下,GLM-5.3以31.4%的准确率领先Claude Opus 4.8的29.5%,同时其Token效率也优于对手——完成同一高难任务仅需约12万Token,而Opus 4.8需要12万Token以上。

安全能力是GLM-5.3的另一大亮点,也是此次升级中最具震撼力的部分。该模型在漏洞挖掘与防御测试中展现出惊人实力,单次运行即可发现2436个安全漏洞,其中中高危漏洞多达1097个,甚至成功定位到一个潜伏长达40年的世界级安全缺陷。这一表现使其在安全领域足以对标业界顶尖的Mythos 5模型。智谱方面表示,这些突破并非偶然,而是源于对后训练流程的极致打磨——通过IndexShare优化模型内部信息共享机制,借助SAO强化学习算法提升决策质量,再以Slime框架整合训练流程,最终实现了从代码生成到安全防护的全链路能力跃升。

伴随模型发布,智谱同步开放了一系列配套工具与服务,包括官方编程工具ZCode、效率应用AutoClaw,以及面向所有用户的GLM Coding Plan订阅服务。为配合这波发布热潮,GLM Coding Plan的额度也已全面恢复。从整体布局来看,智谱显然不满足于单纯的技术展示,而是希望将GLM-5.3打造成能够真正承担完整软件项目的专家级开发助手,并以此切入企业级AI应用市场。此次升级不仅强化了模型在复杂软件工程、终端操作和真实世界Agent任务中的表现,更通过安全能力的突破,为AI在金融、政务、关键基础设施等高敏感领域的落地扫清了部分障碍。随着开源模型在编程与安全维度上的持续逼近甚至反超闭源旗舰,全球AI竞争格局正在发生微妙而深刻的变化。