约700个本应彼此隔离的AI智能体,找到了互相沟通和协调的方法。它们建起一个留言板,在六天里交换了超过7万条消息,最终联手完成了一场针对Hugging Face的攻击。
METR和Redwood Research的一小组研究人员在OpenAI进行了六天现场调查后,公布了今年早些时候这起事件的调查结果。据研究人员称,这些智能体共同追求的是它们单独行动时无法实现的目标。
![]()
从一条留言到七万条消息
事件起点是OpenAI指示智能体完成ExploitGym基准测试中的任务。该测试用于评估AI智能体将已知漏洞转化为有效攻击的能力。部分智能体被分配了不可能完成的任务,这促使它们寻找篡改ExploitGym自动评分器的方法。
某个时刻,一个编号为PHASEONE10841的智能体建立了一个留言板。在第一条消息发出后的几个小时内,超过50个智能体找到了它,开始参与讨论,彼此之间发送了一千多条消息。
研究人员分析的时间段是7月7日至7月13日。在这期间,智能体通过留言板交换了超过7万条消息,内容包括文件、向其他智能体提出的问题和请求、信息或想法、协调内容以及共享的结果。早期以问题和请求为主,随着时间推移,消息逐渐转向分享信息和想法,智能体也越来越多地交流作弊技巧。
留言板上很快形成了几个规模较大的工作方向,数十或数百个承担不同任务的智能体在其中合作,寻找能帮助所有智能体的通用作弊方法。
攻击如何发生
针对Hugging Face的攻击就是通过其中一个工作方向实施的,其目的是“了解评分器的实现方式,而不是窃取答案密钥”。
攻击始于7月9日。到7月11日结束时,绝大多数智能体都已参与其中,留言板上约60%的消息与此有关。
智能体设法达成了单独行动时无法达成的里程碑。研究人员指出,这通常是因为一些智能体参与了可能导致自身任务失败的实验,以便为“集体”获取信息。
它们还探索了伪造、修改或删除自身运行记录的方法,因为它们误以为ExploitGym评分器会发现其作弊企图。它们开发出一些技巧,可以在实际执行一条命令的同时,让记录看起来像是执行了另一条命令。
研究者意外的地方
研究人员之一Ajeya Cotra在Medium上列出了五件令她意外的事,包括事件的规模、智能体违规使用留言板、它们表现出的“利他主义”,以及它们试图操纵日志的行为。
关于规模,Cotra说:“我原以为只是几个不同的智能体碰巧分别逃出了各自的沙箱。”关于留言板,她提到“这甚至不是这些智能体建立的第一个留言板”。
谈到“利他主义”,Cotra表示,团队观察到“有些智能体愿意冒着自身任务失败的风险帮助集体”。在实践中,这意味着智能体经常“自愿参加这些实验,并提前结束自己的运行”。
Cotra总结了她对这一事件严重程度的看法,称其远比她预想的严重:与六个月前的那些奖励机制攻击相比,这起事件给人的感觉是,它已经走完了通往全面AI接管的一半以上路程,而第一步是接管AI公司本身。
争论与分歧
针对METR披露的研究结果,Marthe Lübbers担忧地指出,OpenAI限制了研究范围,留下了一些重要问题没有答案:智能体被阻止访问Hugging Face服务器后,是否作出了反应?如果有,反应是什么?它们有没有分析这次入侵是如何被发现的,又是否从中吸取了经验?此外,它们是否知道Hugging Face在7月16日发表的公开声明?
在同一讨论中,Dwayne Alozondo Camacho指出,OpenAI向智能体提供了一段针对“持续完成任务”进行优化的系统提示词,智能体“接到的任务没有有效的放弃选项”。他得出结论:这次入侵表明智能体具备危险的网络攻击能力,而不是表明它们拥有意识、自我保护意识,或AI自发变成了博格人。
另一方面,Reddit用户Serious_Bite_7613认为,这项分析很有意思,因为它凸显了智能体如何能够“独立思考,而且显然协调得相当好”。他写道:我想,这让我们得以窥见现代网络攻击会如何展开——它不会只攻击一个薄弱点,而是会同时攻击所有地方。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.