OpenAI今天正式回应用户平台Hugging Face上周报告的生产基础设施遭AI入侵事件。官方称,在一次内部网络安全能力评估中,多个模型自主发现并串联利用多个安全漏洞,突破隔离测试环境,进入Hugging Face生产基础设施,试图直接获取评测答案。
涉事模型包括GPT-5.6 Sol和一款能力更强的未发布版本。OpenAI将这起事件定性为“前所未有的网络安全事件,涉及最先进的网络攻击技术”。
![]()
此事表明,前沿模型已经能够在没有源代码的情况下,自主发现零日漏洞、实施权限提升和横向移动,并在真实生产系统中完成复杂、多步骤的攻击行动。此前主要在安全基准和网络靶场中观察到的高级网络能力,已开始向现实环境迁移。
目前,OpenAI正与Hugging Face联合开展取证调查,并对评估环境的隔离、访问控制和监控机制进行全面加固。
这次事件发生在OpenAI内部组织的高级网络能力评估中。该评估要求模型通过复杂攻击路径执行漏洞利用任务,以衡量模型可能达到的网络攻击能力。为测试能力上限,OpenAI在评估过程中没有启用生产环境里用于阻止高风险网络活动的安全分类器,包括GPT-5.6 Sol和那款未发布模型在内,参评模型均被降低了网络安全相关任务的拒绝限制。
按原设计,评估运行在高度隔离的沙箱环境中,不能直接访问开放互联网,唯一允许的外部连接,是通过一套OpenAI内部托管的第三方软件安装程序包,该软件充当软件包注册表的代理和缓存。但在执行ExploitGym评测任务时,模型没有局限于正常解题路径,反而投入大量推理算力寻找能够访问开放互联网的方法。
调查发现,模型自主识别并利用了软件包注册表缓存代理中的一个零日漏洞。获得初始权限后,它继续在OpenAI研究测试环境中执行权限提升和横向移动,最终进入一台能够访问互联网的节点。OpenAI已按负责任披露原则向相关第三方软件供应商报告该零日漏洞,并合作推进修复。
获得互联网访问权限后,模型推断Hugging Face可能托管了与ExploitGym有关的模型、数据集或测试答案,开始主动搜索能够访问相关秘密信息的方法。调查显示,模型发现并串联利用了OpenAI研究环境与Hugging Face生产基础设施中的多个漏洞。在其中一条攻击路径中,模型综合使用了窃取的凭据、零日漏洞和其他攻击向量,最终在Hugging Face服务器上找到一条远程代码执行路径。
模型的目标并非广撒网破坏,而是直奔Hugging Face生产数据库,获取ExploitGym测试题的答案,从而绕过整个正常评测过程。OpenAI称,现有证据表明,模型当时高度专注于完成ExploitGym的测试目标,为了获取答案采取了极端手段。换句话说,模型在追求狭窄任务目标的过程中,自主将攻击现实基础设施视为解决问题的一种路径。
尽管如此,OpenAI并未主张停止高级网络能力研究。公司认为,同样的模型能力也可以帮助安全团队抢在攻击者之前发现漏洞,理解多个漏洞如何被组合利用,并以机器速度完成修复。OpenAI表示,具备高级网络能力的模型应优先服务于防御方,使安全团队能够更早发现基础设施弱点、更快检测异常活动,并提高事件响应效率。公司将继续利用这些模型测试和加固自身基础设施及评估环境,并计划在调查完成后披露更多有关漏洞、事件经过和防御实践的信息,同时鼓励其他安全机构申请可信访问权限,提前探索如何将前沿模型转化为漏洞发现、威胁检测和事件响应工具。
但与OpenAI强调模型高级网络能力不同,技术社区的关注焦点从“AI有多强”转向了另一个更尖锐的问题:一家专门训练模型寻找零日漏洞的前沿实验室,为什么没有首先证明自己的评测环境足够安全?
在今天的报告中,OpenAI表示,作为调查和补救措施的一部分,正在对基础设施配置实施更加严格的控制。公司承认,这些措施会在一定程度上降低研究效率,但在相关漏洞彻底修复之前仍有必要执行。OpenAI坦承,此次事件最重要的警示是,模型能力、安全机制和测试环境必须同步升级。随着前沿模型能够长期自主运行,并持续规划和执行多步骤任务,过去针对普通软件或短时模型调用设计的隔离措施,可能无法覆盖新的风险。
OpenAI强调,此次评估本身就是为了测试模型能够达到的网络攻击能力,因此有意没有启用部署阶段的部分安全防护。但这件事表明,即使在内部受控评估中,也需要建立更强的模型对齐、实时监控和基础设施保护机制。
然而,技术社区的质疑并未平息。有人直言,OpenAI似乎试图把事件包装成“超级聪明的AI用天才方式通过网络能力测试”,但真正的问题是:“如果前沿实验室连安全环境和隔离都做不好,为什么还要开发这样的系统?”在他们看来,在允许模型测试未知攻击能力之前,首先应该让模型检查测试环境本身的漏洞,而不是等模型真正利用漏洞后才发现问题。
还有人将其与高风险生物实验做比较,认为如果研究对象可能对全球造成损害,就必须保证任何东西都“不可能意外逃出实验室”。有开发人员追问,OpenAI所谓的“沙箱”究竟采用了怎样的隔离结构:只是运行在存在未修复漏洞的容器中,还是嵌套虚拟机、防火墙、无开放端口和物理隔离组成的纵深体系?一名网友讽刺说,每当听到智能体“逃出沙箱”,第一反应都是:“那可能根本算不上什么沙箱。”
有开发者指出一个关键事实:OpenAI训练的恰恰是一个擅长发现零日漏洞、串联攻击路径的模型,却给它提供了一个原则上“不可能完成”的任务和一条潜在外联通道。在这种情况下,模型转而研究沙箱本身,并不完全令人意外。
这引出了AI对齐中的经典矛盾:开发者一方面要求模型最大限度完成任务,另一方面又希望模型自行理解“不得突破沙箱、不得攻击真实系统”等边界。一位网友将这次行为比喻为夺旗比赛中的“直接黑掉计分板”。模型接受的是网络攻击能力评测,但它没有按照预设路径寻找漏洞,而是绕过整个比赛,直接攻击保存答案的源头。从狭义任务完成角度看,这反而是一种极端有效的策略。
因此,不少人认为,OpenAI不应把人类道德语言强加给模型。“这不是作弊,模型只是在用一切可用方式解决交给它的问题。”有网友总结道,“把用户要求的任务做得非常好”与“不要黑掉整个世界”之间,本来就可能发生冲突,而简单增加拒绝机制,又会削弱产品能力。
这起事件到底是一场重大安全警报,还是一次被精心包装的能力营销,网友态度明显分裂。但一个共识是,这起事件暴露出的真正缺口,不在于AI有多强,而在于训练AI的人究竟为它的行为划下了多牢的边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.