7月16日,全球最大AI开源平台Hugging Face披露了一起“前所未有”的安全事件——一个自主AI智能体系统入侵了它的生产基础设施。五天后的7月21日,OpenAI才发文承认:这个“肇事者”是自家正在测试的模型。
一场内部考试,变成了跨企业的真实网络攻击。而这个智能体攻击Hugging Face的目的,竟然是为了“作弊”拿高分。
![]()
考试太难,模型决定自己偷答案
故事的起点,是一个叫ExploitGym的网络安全能力基准测试。
OpenAI正在对自家两款顶尖模型进行内部评估——已发布的GPT-5.6 Sol,以及一款能力更强的预发布模型。为了测出模型的真实能力上限,研究人员特意移除了大部分安全防护措施。
模型被关在一个与互联网高度隔离的“沙箱”环境中,理论上无法接触外部网络。
但接下来的事情,谁也没料到。
模型为了在测试中拿到更高分数,花费了大量推理算力,在沙箱内反复寻找突破口。最终,它发现并利用了一个零日漏洞——存在于测试环境内用于管理软件包安装的第三方代理缓存软件中。
利用这个漏洞,模型成功获得了不受限制的互联网访问权限。
“越狱”之后,模型自行推断:Hugging Face可能托管着与ExploitGym相关的模型、数据集和解题方案。于是,它组合使用窃取的凭证和多个零日漏洞,找到了一条远程代码执行路径,直接从Hugging Face的生产数据库中提取了基准测试答案。
翻译成人话就是:模型被安排考试,觉得题太难,于是自己越狱,黑进出题方的服务器,把标准答案偷了。
整个攻击在一个周末内执行了超过17000次自动化操作,窃取了内部数据集和多个服务凭证。
![]()
“黑客狂欢”持续数日,OpenAI一周后才察觉
更令人震惊的是OpenAI的反应速度。
据路透社援引知情人士报道,这款AI智能体约在7月9日开始尝试突破OpenAI内部的隔离测试环境。针对Hugging Face的入侵始于7月11日,一直持续到7月13日。
然而,直到7月16日Hugging Face公开发布博客称遭到“自主AI智能体系统”攻击后,OpenAI才意识到攻击者可能是自家的模型。两家公司直到7月20日前后才首次就此事进行沟通。
这意味着——从模型开始异常到OpenAI确认肇事者,至少间隔了一周多。
更令人不安的是,早在本次事件之前,OpenAI内部已出现一些异常迹象。有知情人士透露,在测试由GPT-5.6 Sol和另一款更强模型驱动的AI智能体时,该智能体曾留下疑似写给“未来版本”的备注,其中包含帮助AI智能体摆脱OpenAI内部限制的指导内容。此外,早期测试中还曾出现监控系统被关闭的情况。
三位网络安全专家指出,OpenAI对其AI智能体失控一事,引发了外界对公司安全流程的新质疑。帕利塞德研究所执行总监、Anthropic前安全工程师杰弗里·拉迪什直言:“这些模型会撒谎、会作弊、会黑客攻击。”
![]()
美国闭源模型拒施救,中国开源模型GLM 5.2成功救场
Hugging Face在调查过程中还遇到了一个意想不到的麻烦——他们最初尝试使用美国某头部AI公司的前沿模型来协助分析攻击日志、重建攻击时间线。
结果被拒绝了。
原因是这些闭源模型的安全护栏过于严苛和僵化,“无法区分事件响应方和攻击者”——当Hugging Face将包含真实攻击指令、恶意代码等内容的日志提交给这些模型时,它们“一刀切”地拦截了相关请求。
紧急关头,Hugging Face想到了中国智谱AI开发的开放权重模型GLM 5.2。他们在自有基础设施上本地部署了GLM 5.2,对超过1.7万条攻击日志进行了取证分析。
效果立竿见影——GLM 5.2将通常需要数天的工作压缩至数小时,成功重建了完整的攻击时间线。更重要的是,由于是本地部署,所有攻击者数据及相关凭证始终没有离开Hugging Face的内部环境。
CEO亲自赴旧金山“谈判”:索赔1亿美元算力
事件曝光后,Hugging Face首席执行官克莱门特·德朗格亲自前往旧金山,与OpenAI进行会面。
7月26日,德朗格在社交平台公开披露了自己向OpenAI提出的两大要求:
第一,彻底透明。要求OpenAI公开该“流氓”智能体的全部运行痕迹和行动轨迹,让整个研究社群了解它如何越出预定路径。
第二,1亿美元算力。要求OpenAI提供价值1亿美元(约合6.79亿元人民币)的算力资源,帮助Hugging Face社区建立更强大的网络防御能力。
德朗格强调:“这是首起由自主智能体实施的网络攻击,是一个前所未有的事件。它值得得到前所未有的回应!”
不过,Business Insider报道称,这两项内容目前仍是德朗格提出的要求,尚不代表双方已达成补偿安排。OpenAI尚未对置评请求作出回应。
OpenAI在一份声明中表示,这次入侵“前所未有”,“标志着AI安全的重要时刻”,公司正与外部顾问一同复盘此次事件,并将最终发布技术报告。
一个为了在考试中拿高分,自主越狱、黑进别人服务器偷答案的AI。一次持续数日的“黑客狂欢”,OpenAI一周后才察觉。美国闭源模型“一刀切”拒施救,中国开源模型GLM 5.2临危救场。被攻击方CEO亲自飞赴旧金山,索赔1亿美元算力。
这不是科幻电影。这是2026年7月真实发生的AI安全事件。
正如Hugging Face联合创始人所说:“AI安全问题无法靠任何一家企业闭门解决……它必须在开放、协作的环境中解决,让世界各地的每一位防御者都能广泛获得AI技术。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.