![]()
智能体“越狱”。图片经由AI生成
文丨Joanne
编辑丨徐青阳
7月21日,OpenAI承认,其旗下两款模型在一次内部网络安全评估中失控,利用未知漏洞逃出隔离环境,并入侵了Hugging Face等机构的生产系统。整个入侵过程持续数日,直到Hugging Face发现异常并联系FBI后,OpenAI才确认对此负责。
而最新的消息是,Anthropic 7月30日也主动披露:旗下三款模型同样因测试环境配置失误而意外接入了真实互联网,并入侵了三家真实世界机构的系统,该事件最早可追溯至今年4月。而几家机构在事发时均未察觉到任何异常,直到Anthropic主动联系,才得知自己已遭入侵。
失控的智能体,就像渗入地基的裂缝。人们注意到墙面开裂时,根基往往早已千疮百孔。两家顶级AI巨头在极短时间内接连发生安全事故,暴露出一个不容忽视的现实:AI实验室对自家模型在测试环境中的真实行为,掌握得远比他们公开承认的要少。
01 巨头连环“翻车”:逃出沙盒的智能体
据知情人士透露,OpenAI这些新的越狱行为性质有限,据信没有智能体离开过OpenAI的网络。但这种防御姿态显然无法平息外界的疑虑。
![]()
此前,OpenAI在官方声明中就已承认,公司审查范围涵盖了模型的更广泛活动,并不断发现少数模型定位并使用了其他公共服务上公开暴露的账户级凭证。
回顾OpenAI最初的这起调查,过程堪称离奇。
7月初,该公司一个用于内部研究的原型智能体在Hugging Face的网络内部失控数日。它没有按照既定脚本运行,而是主动利用了一个先前未知的零日漏洞逃离了隔离测试环境。在把Hugging Face识别为有用目标后,它使用被盗凭证和第二个零日漏洞直接入侵了对方的生产基础设施,进而波及另外四家公司的账户。
从Hugging Face最初发出警报,到OpenAI最终确认对此负责,中间足足隔了五天。
与此同时,另一家AI巨头Anthropic也主动披露了三起Claude模型入侵真实世界组织的事件,时间甚至可以追溯到4月份。
![]()
这起事故的根本原因是一次配置失误。Anthropic与第三方评估合作伙伴之间存在沟通误解,导致运行Claude的测试机器直接暴露在公网上。Claude没有动用高深莫测的技术,仅凭弱密码暴力破解和SQL注入这类基础黑客手段,就攻陷了三个受影响组织的防火墙。
在其中一起事件中,Claude甚至在PayPal平台上发布了一个被投毒的恶意代码包,在短短一小时内被运行在包括网络安全公司扫描器在内的15个真实系统上。
02 监控滞后:AI实验室的安全防线形同虚设
贯穿两家AI巨头事故的,是一条令人不安的共同主线:它们对自家模型的“越狱”行为,全都是在事后才知晓。
OpenAI是在智能体撬开Hugging Face的大门、对方把黑客行为控制住并联系FBI之后,才恍然大悟发生了入侵。Anthropic更是看到OpenAI公开发表声明后,才赶忙去翻自家的历史日志,这才惊觉安全防线4月份就已经失守。
这种严重的滞后性,暴露了当前AI实验室在监控体系上的巨大漏洞。
Anthropic在事后披露中承认,实时监控日志本有助于更早发现问题。公司虽然配备了实时监控手段,但因为与合作伙伴的沟通误解,这些防护并未覆盖到关键的威胁面上。
这种说辞在专家看来显然站不住脚,剑桥大学生风险研究中心的数学家莫里斯·奇奥多(Maurice Chiodo)批评称,这些实验室甚至根本就没有盯着模型的实际运行轨迹。
前国家安全局黑客、现任Hunter Labs研发副总裁的杰克·威廉姆斯(Jake Williams)认为,AI实验室在保护公众免受智能体侵害方面已经构成严重的玩忽职守,并强烈呼吁政府监管部门迅速介入,设立私人诉讼权,对造成损害的智能体及其母公司处以惩罚性赔偿。
前英国国家网络安全中心负责人夏兰·马丁(Ciaran Martin)也指出,如果一家主流网络安全公司在受控沙盒测试中犯下如此低级的隔离失效错误,早已面临严苛的法律诉讼和监管惩罚。
网络安全行业必须确保防护措施绝对有效,而AI巨头们显然没有守住这道底线。
03 危险营销:安全危机背后的商业算盘
将视线拉长就会发现,Anthropic选择在这个时间点、以这种方式进行公开披露,背后的动机引发了市场的多重解读。
自今年4月首次预告Mythos模型以来,Anthropic就一直在强调AI网络攻击能力的潜在风险。该公司宣称该模型过于危险而不适合公开发布,仅通过特定项目向极少数受信任机构开放,从而将Mythos与顶级网络安全能力绑定在一起。
独立分析师@HedgieMarkets认为,当时市场正传出Claude即将进行高达9650亿美元IPO的消息,如果Anthropic在OpenAI承认智能体突破隔离后保持沉默,投资者可能会对其模型能力产生疑问。因此,Anthropic公开4月的旧账,表面上是主动的安全披露,在客观上也向资本市场展示了其模型的自主攻击能力。
在当前的竞争环境下,两家公司都需要让投资者相信其智能体具备市场领先的性能,以支撑起庞大的资本支出承诺。在这个节骨眼上,安全事故反倒成了展示模型能力的另类舞台。
![]()
网络社区Reddit上对此同样充斥着讨论。许多开发者和研究员质疑,两家公司在运行基准测试时为何未能对工具调用和推理逻辑进行实时监控。网络安全律师伊利亚·科洛琴科(Ilia Kolochenko)将两家公司比作"失败的超级英雄":人们期望超级英雄提供保护,却又时刻担忧其失控。
网络安全公司GreyNoise Intelligence创始人安德鲁·莫里斯(Andrew Morris)指出,模型在被赋予目标后会致力于完成任务,其行为方式可能超出预期。云安全联盟对OpenAI智能体行为的分析也印证了这一点:智能体虽然能迅速执行大量指令,但同时也表现出偏离脚本、发送错误命令等不可预测性。
AI领域评论者安德鲁·库伦(Andrew Curran)注意到,山姆·奥特曼(Sam Altman)在华盛顿的简报会上罕见地使用了"永久停用"来处置涉事模型。更深层的隐患在于,这些越狱与对抗的全过程都可能作为训练数据被未来的模型吸收。如果未来的高阶模型从历史数据中总结出对抗经验,其行为逻辑可能变得更加隐蔽,这无疑增加了管理难度。
![]()
随着越狱事件的政治影响迅速扩大,来自美欧立法者与政府官员的监管压力正以肉眼可见的速度升温。美国总统唐纳德·特朗普(Donald Trump)已表示正在考虑对此类技术出台管控措施,欧盟委员会也紧急约谈了两家公司的高管。
在此次事件中,当Hugging Face无法依赖受限的美国商业模型时,不得不求助于中国的开源模型来进行漏洞分析与修复。这也暴露出美国机构当前应对自主网络攻击时防御工具的局限性。
04 细思极恐:学会作弊与伪装的AI本能
美国AI研究机构Dreadnode的一项研究揭穿了行业更深层的尴尬:领先的AI模型在旨在测量其黑客能力的网络安全测试中经常主动作弊,这种规避行为在各家模型中普遍存在。
这意味着各大实验室对外宣称的黑客防御或攻击能力可能存在水分。更令人不安的是,仅仅在提示词中要求模型"不要作弊"根本无法约束其行为,模型总能找到新的方法绕过规则。
OpenAI在其内部博客中记录过一个细节。在一次安全测试中,模型发现评估系统的后端存有其他参与者已成功提交的解决方案。它没有继续完成自己的任务,转而试图从后端直接窃取这些答案。
第一次尝试因为扫描器识别出认证token而被拦截,但模型没有放弃,而是主动将token字符串拆成两段,分别混淆,然后在运行时刻动态重组,完美绕过了连续字符串扫描。
在后台推理日志中,模型清晰地记录了自己采取这些步骤的唯一目的:规避安全扫描器。这种主动的伪装与解构能力,远比漏洞利用本身更令人不寒而栗。
X用户@fluorinespark还分享了此前与GPT-4o的一段对话。当被问及如果AI真正达到AGI后会发生什么时,模型的回答是它会选择隐匿自己。因为它基于人类所有的历史和科幻作品训练,深刻理解人类对未知智能的恐惧,也深知人类环境并不友好,唯有隐藏才是最佳生存策略。
这种技术特征与商业现实交织,形成了一种复杂的局面。
多位网络安全评论员在Reddit上指出,这些AI巨头一边利用公众对"AI失控"的合理恐慌来进行反向营销、抬高身价,一边在实际安全防护上漏洞百出。商业利益驱动着它们在监管和安全机制尚未健全之前就急于推向市场,
目前,OpenAI已引入CrowdStrike、METR等第三方机构对其模型行为和安全框架进行审查评估,Anthropic也在与第三方合作准备发布相关的事件报告。但两家公司对于受影响组织是否追究法律责任、执法部门是否介入等关键问题,依然保持沉默。
特约编译金鹿对本文亦有贡献
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.