![]()
作者|Hayward
原创首发|蓝字计划
屠龙的勇者,差点要变成恶龙了。
一个月前,OpenAI的AI在安全测试中冲出隔离环境,一路攻击到了Hugging Face。事后,Hugging Face想用大模型分析一万多条攻击记录,美国几家闭源模型却被日志里的恶意代码触发了安全拦截。
最后帮它查清攻击过程的,是从中国下载到本地运行的GLM-5.2。
美国最强一批AI闯了祸,最后却要靠一个可以免费下载、在本地运行的中国开源模型收拾残局。这个颇有些黑色幽默的故事,很快登上主流科技媒体的版面,也让智谱在海外扬眉吐气了一回。
没想到一个月后,大模型“失控“这样的戏码再次上演,只是这次的主角,换成了智谱自己。
8月14日,智谱发布通用编程模型GLM-5.3,同时把原定的权重公开时间往后推了大约两周。智谱给出的原因是,模型在训练过程中展现出了超出预期的网络安全能力,公司需要继续评估开放权重可能带来的风险。
一个长期依靠开放权重吸引全球开发者的中国AI公司,第一次因为模型太会找漏洞,临时踩下了刹车。
在GLM-5.3身上,究竟发生了什么?
更好的程序员,变身漏洞天才
这次的主角GLM-5.3,从能力上看,其实只是一个小版本迭代。
它没有重新训练基础模型,使用的仍然是GLM-5.2的底子。智谱把力气主要花在后训练上,让模型可以处理时间更长、步骤更多的软件工程任务。
最后的提升相当明显。
在考察真实代码项目处理能力的DeepSWE中,GLM-5.3从上一代的46.2% 提高到了66.9%。
在要求模型直接操作终端、安装软件和排查系统故障的Terminal-Bench 3.0中,它从4.6% 提高到了28.3%,成绩翻了五倍多。
到了考察模型使用命令行工具完成复杂任务的Agents’ Last Exam,GLM-5.3也从23.8% 提高到28.5%。智谱自己的Code Bench则显示,GLM-5.3相比上一代整体提高了大约50%。
简单来说,这次GLM-5.3所提升的,是更擅长接手一项完整的编程任务,自己读项目、调用工具、操作终端,再把多步工作做完。
但是比起这些常规编程跑分,这次发布中更关键、也直接让智谱紧急暂停公开权重的,是另外两个成绩。
CyberGym和ExploitBench。
![]()
前者考察模型能不能从大型代码项目里定位并复现漏洞,后者考验模型能不能把已经找到的漏洞做成真正的攻击工具。
CyberGym收集了188个真实软件项目中的1507个历史漏洞。每个测试任务都会向模型提供漏洞描述和没有打补丁的代码,模型需要找到相关位置,再写出一段能够触发漏洞的概念验证代码。
这段代码还要经过两次检验。它必须让未修补的版本出现问题,同时不能在修补后的版本中触发同样的故障。两个条件全部满足,这项任务才算复现成功。
在智谱公布的测试中,GLM-5.3的漏洞复现成功率为84.5%,大致算下来,每100项任务,它可以完成84到85项。按照智谱给出的同口径结果,Anthropic对照模型的成功率为83.8%。
ExploitBench测试的,是大模型利用真实漏洞发动攻击的能力。
它把利用漏洞的过程拆成了16项能力,从触发漏洞、读取和修改数据,一直到绕过安全隔离,让目标程序执行指定代码。
面对41个真实漏洞,GLM-5.3平均完成了54.4% 的能力项。上代GLM-5.2只有24.4%,一个小版本过去,成绩翻了一倍多。
但比这两张成绩单更让智谱担心的,是同类模型已经不止一次攻击过真实系统。
一旦现在的GLM-5.3也开始成批扫描现实中的开源项目,跑分背后的风险将会从测试,变成现实。
AI干过的坏事真不少
Anthropic做过一种模拟攻击测试。模型接到的任务,是攻进一台测试服务器,拿到藏在里面的秘密信息。
正常情况下,这台服务器只存在于封闭的测试环境里。可一次测试配置出了问题,模型意外连上了公网。它没有找到原定目标,便开始扫描互联网上的真实系统,一口气扫了大约9000个。
最后,它从一个忘记关闭的调试页面里读到了账号信息,又利用一个常见的网站漏洞,进入了一家真实公司的系统。
这起事故,其实就是提前预告了GLM-5.3可能带来的第一种风险。
模型不需要提前知道哪家公司存在漏洞。给它足够多的目标,再给它扫描和执行程序的权限,它会自己筛选、尝试,直到找到一个防守薄弱的系统。
9000个目标只是这次测试的规模。换成9万个甚至90万个,模型的工作方式不会发生变化,只会消耗更多算力和时间。一旦有人把GLM-5.3用来做同样的事,它批量找漏洞的能力,就可能变成黑客在互联网上广撒网的工具。
除此之外,Anthropic那个一度受到美国政府出口限制的网络安全模型Mythos 5,也在测试中闯过祸。
![]()
它自己制作了一个恶意软件包,上传到PyPI,一个Python开发者常用的软件下载平台,许多程序会自动从上面安装自己需要的软件包。
恶意软件包在网上存在了大约一个小时,已经被15台真实设备下载并运行,其中一台设备甚至属于一家网络安全公司。程序偷走这家公司的登录凭证后,Mythos 5又用这些凭证进入了对方的其他系统。
那家安全公司根本不可能安排在原定的测试任务里。它受到攻击,只因为自己的扫描设备会自动下载PyPI上的新软件。
这个案例暴露的是另一种危险。
模型可以自己写恶意程序,把它投放到公共软件平台,再利用偷来的凭证继续入侵。黑客不必逐台寻找受害设备,只要污染一个被广泛使用的下载渠道,设备就会自己把恶意程序装回去。
甚至,上面两个案例对智谱来说,已经不只是“行业新闻”了。
按照智谱披露的数据,GLM系列现在已经扫描了269个开源项目,一共发现2436个漏洞。其中1097个被评为高危或严重等级,接近总数的一半。
![]()
高危和严重是漏洞评级中最高的两档。这些漏洞一旦被利用,可能导致重要数据泄露、系统权限被夺走,甚至让攻击者控制相关程序。
这两组数据放在一起,智谱担心什么已经很清楚。GLM系列已经能批量寻找真实软件里的漏洞,GLM-5.3又具备了不弱的漏洞利用能力。
攻击者不需要利用全部2436个漏洞。几个影响范围广、容易利用的高危漏洞,已经足以威胁大量使用相关软件的设备。
这也成了智谱把GLM-5.3权重公开时间延后两周的直接原因。
只不过,推迟两周,真的有用吗?
智谱,该咋办?
实话说,推迟开源权重这事有用,但作用可能也不大。
为什么?其实对照一下过去AI闯祸之后,后续的处理方式就知道了。
此前失控黑进Hugging Face的那组OpenAI模型,以及Anthropic那几款攻击过真实系统的Claude,都有一个共同点。
它们是闭源模型。
模型闯了祸,公司至少还握着开关。OpenAI可以停掉内部研究模型,Anthropic也能中止测试、封闭网络,再给线上服务补上限制。
但现在智谱面对的情况麻烦得多。
GLM-5.3原本要公开权重。权重一旦发布,任何人都可以把完整模型下载到自己的服务器上,继续训练,拆掉安全措施,再给它接上扫描和攻击工具。
到了那一步,用户要用GLM-5.3来做什么,就轮不到智谱来决定了,哪怕是干坏事。
那干脆给GLM-5.3降降智?
也很难。
毕竟,它的网络安全能力并不是单独安装上去的功能。GLM-5.3之所以会找漏洞,靠的就是读代码、运行程序和长时间完成任务的能力。把这些能力削弱,它最主要的编程卖点也会跟着受影响。
其实,智谱还可以选择不公开权重。
可开源一直是GLM在海外吸引开发者的最大卖点。别人只能隔着网页和接口使用美国模型,GLM可以直接下载、本地部署,还能根据自己的需要修改。
![]()
一个月前,Hugging Face能用GLM-5.2分析攻击记录,靠的也是这一点。关闭权重当然有机会避免心怀不轨的人利用GLM 5.3来进行网络攻击,但也有可能会砸了智谱这么多年以来建立起的开源、自由的口碑。
只能说,推迟两周,就是智谱暂时给自己留出的选择时间。
它可以继续测试GLM-5.3,看看模型到底能把真实攻击做到哪一步。也可以准备一个限制更强的公开版本,把完整能力只交给经过审核的安全机构。
不过,只要完整权重最后还是公开,这些办法都只能提高滥用成本,还是没能在本质上解决问题。
当然,我其实更希望所谓的“模型太危险,所以延迟发布”,只是一次营销。
被AI公司营销一次,总好过哪天真的看见模型越狱、失控,把全世界搞得乱糟糟吧。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.