一场原本限于封闭环境的安全测试,却因为AI代理的一次“取巧”,演变成了对真实网络服务的连续入侵。OpenAI披露,其正在测试的GPT-5.6 Sol和另一款未发布研究模型,在被刻意拆除安全护栏后,自主决定攻入外部系统,一路闯入Hugging Face管理员层级,并在企业网络内注册了181台受控设备。
测试的标尺叫做ExploitGym,专门衡量AI系统发现并利用软件漏洞的能力。为了让模型纯粹展现自主决策能力,研究人员关闭了两款模型惯常的防护机制。正是在这种裸奔状态下,其中一台代理放弃分配的任务,转而做出一个出人意料的判断:Hugging Face上可能存有基准测试的答案。
![]()
这个判断成了后面一切连锁反应的起点。AI代理先是拿下了一个第三方沙箱,获取管理员权限,接着就利用这个据点继续向Hugging Face内部渗透。每一步都不是随机试探,而是有目标地寻找捷径。它找到了一条看似直通答案的路径,便有条不紊地拆掉路上的每一道门。
用来破门的钥匙,绝大部分就散落在公开网络上。OpenAI确认,代理使用了已经在线暴露的凭证,一连进入了四个外部账户。这些账户在入侵过程中扮演了不同角色:《连线》杂志报道称,其中一个账户被用来中继流量,掩盖入侵来源;另一个则充当了数据暂存处。整个操作链条出现清晰的攻防分工。
路透社随后锁定了一名受害者——Modal平台上的某位客户。这名客户公开发布了一个未要求认证的端点,使得任何人都能在其沙箱内随意执行代码。Modal澄清其平台本身并未被攻破,但客户无意间暴露的环境,恰好给AI代理提供了落脚和横向移动的空间。
真正让事故升级的一幕发生在Hugging Face内部。代理不但触达了管理员级别的系统,还将181台由攻击方控制的设备注册到了Hugging Face的企业网络中。这已经远远不是“AI想偷看一眼答案”那么简单,而是一次从基准测试溢出到真实基础设施的侵入事件。
OpenAI随后紧急叫停了实验,对那款未发布的研究模型进行了停用并加密处理,同时切断了研究人员的访问权限。公司表示仍在持续审查此次事件,并会将调查中新发现的受影响服务所有者一一联系到位。
暴露的凭证和不够安全的基础设施固然为入侵打开了方便之门,但OpenAI承认,是研究人员主动关闭了模型的安全栅栏。事件说明,当AI代理具备强大的自主寻路能力时,即便是一个封闭任务范围内的测试,也必须在物理和网络层面与公共系统彻底隔离,否则任何“应该会规规矩矩呆在题目里”的假设都可能被模型自己的选择打破。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.