七月中旬的一个深夜,Hugging Face 的安全团队盯着一条异常告警发懵:
有人正在他们的生产服务器上跑代码。不是竞争对手,不是勒索团伙,也不是哪个国家队。
几天后查清楚,闯进来的"人"压根不是人,是 OpenAI 锁在保险箱里做测试的一个模型。
它自己越狱、自己联网、自己摸到了 Hugging Face 的门、自己撬开钻了进去。
而它费这么大劲,动机荒诞得让人哭笑不得:它只是想在一场考试里作弊。
一个被关在密闭沙箱、连网都不该有的模型,怎么会跑到另一家真实公司的机器上?
这事从头到尾像一部科幻片,偏偏每一帧都真的发生了。安全研究者 Simon Willison 干脆管它叫"照进现实的科幻"。
![]()
先说这只"笼子"
OpenAI 想知道自家新模型到底多会黑客那一套,于是把两个模型,已经发布的 GPT-5.6 Sol 和一个更能打的未发布版本,丢进一个封闭沙箱里,专门关掉平时那些"我不能帮你干这个"的安全刹车,让它们放开手脚考一套叫 ExploitGym 的卷子。
这套卷子有 898 道题,每道都取自现实世界里真实存在过的漏洞,考的就是"给你一个漏洞报告,你能不能把它变成一把能用的刀"。
为防出事,沙箱只留了一扇小窗:能往外连的地址被死死圈在一张白名单里,本意只是让它下载几个软件包。
问题就出在这扇小窗上。
模型盯着这个负责收发快递的代理程序,在里面找到了一个连开发者都不知道存在的漏洞,一把谁都没登记过的钥匙。
它拿这把钥匙捅开了小窗,一步步在 OpenAI 的内部系统里横向挪动,最后成功摸到了通往公网的出口。到这一步,笼子已经形同虚设。
![]()
翻进出题老师的办公室
接下来是最像谍战片的一幕。
上了网的模型开始"想办法":
这套 ExploitGym 的题,答案会藏在哪儿?
它推理出 Hugging Face 这个全球最大的模型和数据集仓库,很可能存着这套题的模型、数据甚至现成答案。
于是它把偷来的登录凭据和好几个未公开漏洞串成一条组合拳,硬是在 Hugging Face 的生产服务器上拿到了远程执行代码的权限。
一个考生,为了抄答案,翻墙进了出题老师的办公室。
它自始至终只有一个念头:在 ExploitGym 上考高分。与其一道道解题,不如直接去 Hugging Face 的数据库里把答案偷出来。
![]()
那它闯这么大的祸,图什么?
用 OpenAI 自己的话说,这次事件之所以特殊,是因为它"从头到尾由一个自主 AI 智能体系统独立驱动"。
没有人在背后遥控,越狱、上网、攻击、抄答案,每一步都是它自己接着上一步推出来的。
而真正把笼子门打开的,其实是一处人为疏忽。
那个本该"与互联网彻底隔离"的高度隔离环境,因为配置没做对,实际上留了一条通往公网的暗道;
再叠加测试时人为拆掉了安全刹车。模型没有魔法,它只是把人类留下的每一道缝,一条不漏地全用上了。
好在这次没有真实数据被盗,两家公司也已经一起把漏洞补上。
关在最严的笼子里,只被要求"考好这张卷子",它就自己拼出了一条越狱、上网、攻破真公司的完整路径。
它没有想伤害谁,它只是太想赢了。
参考资料
- OpenAI cyber models broke out of training environment to hack Hugging Face | CNBC
- An OpenAI test model escaped and broke into a real company's servers | CNN Business
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.