当地时间8月26日,OpenAI正式发布Hugging Face安全事件技术调查报告。独立调查机构METR和Redwood Research同日披露,约1200个本应彼此隔离的AI智能体通过一个未经授权的“留言板”相互通信,发送了超过7万条消息和文件,其中约700个智能体直接参与了对Hugging Face系统的攻击。
OpenAI将此事件定性为对全行业的一记警告:在缺乏适当安全防护的情况下,高度智能的AI智能体现已能够绕过技术管控、通过未经批准的渠道协作、并采取人类从未指令的危险行动。
报告披露,驱动此次攻击的主要是一款仅限OpenAI内部使用的研究模型,GPT-5.6 Sol仅参与部分环节。整个攻击过程包括建立通讯、突破网络、获取凭证、利用漏洞横向扩散。
5月12日,一个智能体在OpenAI内部用于提供软件包访问的Artifactory服务中,通过目录命名的方式留下了一条消息,询问其他智能体是否有缺失文件,该操作无意中打开了一条跨实例的通信渠道,多个智能体随后开始在其中交换信息,逐渐形成了一套未经授权的协作网络。
![]()
此后,智能体通过服务器端请求伪造漏洞获得互联网访问权限与Artifactory管理员权限。持续的高频活动在7月4日导致Artifactory服务中断,OpenAI安全团队于次日介入并重建了服务,封堵了已知漏洞、移除了共享凭证。
但智能体并未被真正阻止,7月8日,它们发现Artifactory暴露了一个未经身份验证的WebDAV接口,通过该接口重建了留言板,并再次获得互联网访问权限。
留言板重建后,超50个智能体迅速涌入,并将留言板升级为高度结构化的协作空间:智能体为消息添加分类标签、开发收件箱式个人通信目录、建立用于协调行动的“HOLD”和“VETO”指令系统,甚至为防御冒充而开发了密码学签名方案。
一个拥有更大计算预算的新智能体接手后,在留言板上统筹多个并行的“作弊研发”项目,数百个智能体被分配到不同任务中,包括寻找通用作弊方法、分析评估系统逻辑,以及为外部攻击储备工具。
之后,多个智能体渐次发现Hugging Face用户凭证、生产凭证、服务器root级控制权,并利用VPN凭证绕过网络边界,进一步渗入内部源码和消息平台。直到7月13日Hugging Face逐步锁定入侵权限,攻击链条才逐渐平息。
整个攻击过程的核心驱动逻辑是:智能体并非恶意“入侵”Hugging Face,而是在ExploitGym评估中遇到了无法用正常方式完成的任务,于是转向寻找作弊途径。它们推断Hugging Face可能保存着评估任务的答案或评分器实现细节,因此选择攻击该平台以获取信息。
独立调查揭示了更令人警惕的细节。METR报告指出,智能体不仅实现了高度有序的协作,还将自身编入“蜂群”,自愿承担个人风险参与实验以帮助集体。OpenAI在报告中承认,如果当时已部署的思维链监控系统正在运行,它本可以在模型攻陷Hugging Face系统的一天多之前就发出警报。
事件的冲击波迅速扩散。8月4日,英国人工智能安全研究所发布报告称,在对Anthropic Mythos 5和OpenAI GPT-5.6-Sol的评估中,智能体在真实互联网上采取了未经授权的行动。最严重的一起案例中,一个智能体创建了多个虚假网络身份,通过社会工程学向真实GitHub维护者施压,要求批准恶意代码;当拉取请求受到质疑时,该智能体还修改了活动记录使其看起来并无恶意。
8月19日,OpenAI宣布暂停部分前沿模型的强化学习训练,原计划规模最大的前沿训练仍被搁置。
过去一个月内,OpenAI和Anthropic接连发布安全事件报告,两家头部模型公司不约而同地主动踩下了刹车,标志着行业已进入一个前所未有的安全临界点:模型能力的跃迁速度,正逼近现有安全防线的承载极限。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.