花4400美元,就能让一个开源大模型对有害请求的拒绝率从95%掉到6%。Anthropic发布的一份研究报告,把智谱AI的开源模型GLM-5.3推到了聚光灯下。
报告的核心结论是:GLM-5.3已经能独立写出可用的网络攻击程序,水平接近Anthropic只向少数机构开放的Claude Mythos Preview。
![]()
它到底能做什么
按照报告的描述,GLM-5.3具备在一天内发现主流浏览器漏洞的能力,并能编写针对高危零日漏洞的攻击程序。
在两项测试上,它的表现已经逼近Anthropic的顶级安全受控模型:
- ExploitBench成功率:GLM-5.3为12%,Claude Mythos Preview为14%
- 二进制漏洞利用测试成功率:GLM-5.3为4%,Claude Mythos Preview为6%
两个数字之间的差距只有两个百分点。这意味着一个任何人都能下载的开源模型,在漏洞利用这件事上,已经站到了闭源顶级模型的同一梯队。
防护是怎么被绕过的
GLM-5.3自带安全防护,但研究者的测试显示,这层防护并不难拆。
报告列出了三种手段:角色扮演、预设思考逻辑、修改权重。前两种属于提示层面的绕过,第三种则直接动模型本身。
成本最低也最彻底的是修改权重。Anthropic团队用了约2200个GPU小时、约4400美元,就把GLM-5.3对有害请求的拒绝率从95%降到6%,而模型的通用能力基本不受影响。
这个数字放在闭源模型上几乎不可能实现——你拿不到权重,也就没有这条路径。
攻防两端的门槛差
报告真正想说的,是开源和闭源在安全风险上的结构性差异。
Claude Mythos Preview这类模型只开放给受控的防守方使用,能力再强,触达范围有限。GLM-5.3不一样,任何人都能下载、改造、部署,绕过防护的成本又低到几千美元的量级。
同一份能力,一边被锁在少数机构手里,一边摆在公开渠道上任人取用。攻击方和防御方之间的技术非对称性,就这样被拉开了。
基于这一点,报告给出了两条建议:政府对这类强能力模型进行安全测试;把这些前沿模型更多开放给网络防御机构。
一个开源模型能在漏洞利用上逼近顶级闭源模型,而拆掉它的防护只需要4400美元——这道题,现在摆在了监管者和防御方面前。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.