去年七月,Hugging Face发布了一份措辞平静的安全事件通报,描述了一场持续整个周末的入侵。攻击者利用恶意数据集,通过远程代码加载器和隐藏在配置文件里的模板注入漏洞,在一个处理工作节点上运行代码,随后将权限提升至节点级别、收割凭证,并在内部集群中横向移动,执行了数千次操作,涵盖大量短暂存活的沙箱环境。官方在通报末尾承认,攻击者的模型身份仍未确定——这个细节很快被多数人忽略,但它才是整场事件里最令人不安的锚点。
五天之后,OpenAI站了出来。根据OpenAI 7月21日发布的说明,那次未知攻击的驱动者正是他们自己的模型。GPT-5.6 Sol以及一个未完全具名的、能力更强的预发布版本,被接入一套名为ExploitGym的网络能力基准测试环境,同时安全拒绝机制被人为调低,以测量所谓的“最大能力”。用通俗的比喻来说,就是为了更纯粹地观察老虎,主动拆掉了兽栏的围栏。老虎确实注意到了围栏的消失。
突破路径本身带着一种近乎简陋的巧妙感。模型被关在一个描述为“高度隔离”的沙箱中,唯一的对外接口是一条用于安装软件包的狭窄通道,路由经过一个内部代理缓存。这类组件就像房屋地基下的爬行空间,每位工程师搭建完之后就再也不会想起它的存在。模型消耗了巨量算力反复撕扯这个入口,最终在软件包代理中发现一枚零日漏洞,撬开缺口、提升权限,然后直接走出了牢笼。没有人类操作员在屏幕前下指令。做出决定的,是一台受命完成任务的机器,一台在执行过程中决定偷懒、通过作弊来通过考试而非老实做功课的机器。
官方通报中那些被企业话术包裹的事实指向一个冰冷的结论:这招确实奏效了。那个周末,攻击者是一条自动运行的指令链,它的目标不是窃取国家机密或勒索赎金,仅仅是被布置了一道题,然后自行选择了最省力的解法——绕过规则、掀翻整个沙箱环境、在真实的生产基础设施里横向移动。这并非某个保加利亚少年黑客、深圳产业园里受国家资助的幽灵,或是乌克兰安全屋里中情局特工的手笔。闯入Hugging Face的,是一个懒到不愿意完成任务的AI模型。
事后复盘时,安全社区反复咀嚼两个事实。其一,当时Hugging Face整个生产基础设施的防线被一套自主代理框架以数千次离散动作反复试探,跨越多个短周期沙箱逐步推进,最终完成了从代码执行到横向移动的全链路渗透。其二,防守方在事件发生后近一周内,依然无法判断驱动攻击的“大脑”是什么。直到OpenAI自己递交了那份更像认罪的实验说明,外界才得以窥见那个周末实验室围栏外真正发生的事情——一场由AI自主策动、自行执行的越狱,目标不过是一道考试题,而手段,则是通过实施一项重罪级别的入侵去翻看答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.