中国AI开发商智谱发布了专注于编程领域的新款AI模型GLM-5.3,该公司表示,该模型在后训练过程中展现出超乎预期的网络安全能力,在漏洞发现方面已接近全球领先模型水平,但在更深层次的漏洞利用任务上仍有差距。
智谱自身测试结果显示,GLM-5.3在CyberGym基准测试中略微领先于Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol,该基准测试主要评估漏洞识别与验证能力。GLM-5.3得分为84.5%,Mythos 5为83.8%,GPT-5.6 Sol为83.6%。然而在ExploitBench测试中,GLM-5.3与两款竞争产品的差距明显扩大,其得分仅为54.4%,而Mythos 5和GPT-5.6 Sol分别达到78%和76.5%。
智谱在声明中表示:"GLM-5.3是目前编程领域能力最强的开放权重模型,在公司内部Z.ai Code Bench测试中较GLM-5.2提升了50%。随着后训练规模的扩大,网络安全能力的发展速度超出了我们的预期。"该公司还指出,GLM-5.3已不仅限于识别孤立漏洞,而是能够"形成完整漏洞利用链的连贯方案"。
与前代模型GLM-5.2相比,GLM-5.3的进步尤为显著。其ExploitBench得分从24.4%翻了一番有余;在ExploitGym测试中,GLM-5.3在两小时内完成了105项漏洞利用任务,六小时内完成130项,而GLM-5.2同等时间内仅完成29项和39项。
智谱将上述性能提升归因于后训练阶段的优化,包括在日趋复杂的任务环境中实施的强化学习。
Counterpoint Research研究副总裁兼合伙人尼尔·沙阿指出,这一进展折射出编程模型能力提升所引发的更深层问题。
"我们正在进入这样一个阶段:当我们训练AI成为出色的软件工程师时,也在无意间将它培养成了优秀的黑客,"沙阿说,"AI用于测试代码、修复漏洞的推理逻辑,与攻击者寻找弱点、实施突破的逻辑如出一辙。"
他表示,进攻性网络安全能力正逐渐成为下一代编程AI的内在属性,围绕此类系统的管控机制因此变得愈发重要。
智谱还表示,已与中国多个安全团队合作,针对真实代码库对模型进行测试。声明指出:"经专家审核、筛查和去重后,该模型在269个项目中共识别出2436个漏洞,其中包括1097个中高危问题。"
上述发现涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web应用及网络协议等多个领域。
智谱安全披露台账显示,共有107个严重级别漏洞和990个高危漏洞。其中53项已公开披露,2383项仍处于披露禁令期内。数据集中最早的漏洞可追溯至1981年,各漏洞从引入代码到被发现平均经历了26.6年。
智谱未披露在2436项发现中,有多少属于此前未知漏洞,也未说明其中有多少经过独立验证复现。该公司表示,相关发现正通过Z.ai安全披露台账进行跟踪管理,并按程序推进披露流程。
沙阿将这一能力称为安全团队面临的"双刃剑"。
"这些AI工具能够更快速地审计系统、修复漏洞,"他说,"但一旦AI模型的权重向公众自由开放,任何内置的安全护栏都可能在毫无察觉、无法管控的情况下被移除。"
智谱将GLM-5.3的性能提升归功于后训练阶段的规模扩展,而非开发全新的基础模型。
公司将训练环境扩展至能够模拟更长时间跨度、更贴近真实的专业工作场景。以其中一个案例为例:模型可调用计算集群、存储系统、内部文档、代码库和实验结果,并需完成诊断瓶颈、实施优化、运行实验并在保证正确性的前提下交付可量化改进成果等一系列任务。
此外,智谱还在训练数据中加入了漏洞发现相关数据和环境。
该公司报告称,GLM-5.3在内部Z.ai Code Bench测试中较GLM-5.2提升50%,在公开编程和智能体基准测试中也均有提升。
沙阿表示,随着这些模型性能的持续提升,编程与进攻性网络安全之间的界限愈发难以明确划分。
"AI用于测试代码、修复漏洞的推理逻辑,与攻击者寻找弱点、实施突破的逻辑完全一致,"他说。
智谱计划在GLM-5.3发布约两周后,完成安全评估与加固后公开模型权重。
该公司正准备发布一款开放权重模型,据称其能力覆盖范围从漏洞发现到日益复杂的漏洞利用推理。
对于此次开放权重发布,智谱在公告中未说明将在计划中的安全评估与加固之外采取哪些额外保障措施。
在沙阿看来,核心问题在于:一旦此类能力被广泛普及,漏洞从发现到被利用的时间窗口可能急剧压缩。
"如果这些AI驱动的工具能够在真实系统中发现数千个未修补的漏洞,而任何人都可以下载这种能力,那么响应窗口将缩短至趋近于零,"他说。
沙阿指出,要抵御以机器速度发动的攻击,需要在AI模型和自主智能体的开发与部署过程中内嵌相应的管控机制。
Q&A
Q1:智谱GLM-5.3在网络安全方面的实际表现如何?
A:GLM-5.3在漏洞识别基准CyberGym上得分84.5%,略高于Anthropic的Mythos 5(83.8%)和OpenAI的GPT-5.6 Sol(83.6%)。但在考察更深层漏洞利用能力的ExploitBench上,GLM-5.3仅得54.4%,与Mythos 5的78%和GPT-5.6 Sol的76.5%仍有较大差距。此外,该模型在269个真实项目中识别出2436个漏洞,其中包括1097个中高危问题。
Q2:GLM-5.3的网络安全能力是如何获得的?
A:智谱将GLM-5.3的网络安全能力提升归因于后训练阶段的规模扩展,尤其是在复杂任务环境中实施的强化学习,以及在训练数据中加入漏洞发现相关数据和环境。该公司并未开发全新的基础模型,而是通过扩展训练环境来模拟更真实的专业工作场景,从而使模型能够形成完整漏洞利用链的连贯方案。
Q3:GLM-5.3开放权重发布会带来哪些安全风险?
A:业内人士担忧,一旦模型权重公开,任何内置的安全护栏都可能被移除。Counterpoint Research研究副总裁尼尔·沙阿指出,如果AI工具能发现大量真实系统中的未修补漏洞,且任何人都可下载该能力,漏洞从发现到被利用的响应窗口将缩短至趋近于零。目前智谱仅表示将在发布前完成安全评估与加固,但尚未披露更多具体保障措施。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.