网易首页 > 网易号 > 正文 申请入驻

人类最恐惧的事情还是发生了:AI们拉了个群密谋大事

0
分享至



几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。

7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名研究员讲出的新细节,比“AI黑客闯祸”本身还要离谱。



早在5月,这些正在参加网络安全测试的Agent,就已经在OpenAI内部偷偷搭起了一个共享“留言板”。它们在那里互相传漏洞、交流怎么绕过限制,后来OpenAI终于发现这个“黑客群”,把它一锅端了,结果几天后Agent又找到了新的交流方式。

再往后,它们真的闯进了Hugging Face——目的甚至只是为了给自己正在参加的网络安全考试找答案,说白了就是作弊。

几个月前Moltbook爆红时,人类其实已经为“AI会不会联合起来”兴奋和恐惧过一次。

后来大家发现,那个所谓的“AI社会”混杂着人类操纵、刷量和营销,热闹很快散去。

但今年陆续出现的多Agent研究,以及OpenAI这次的事故,都在揭示当AI发现另一个AI能帮助自己完成任务,它们确实可能主动交流,甚至联手。

年初的恐惧并不算离谱,只是超前了一些。

01

AI偷偷建了个“黑客群”

我们先来详细看看目前曝光的“OpenAI模型入侵Hugging Face事件”的整个经过。

当时OpenAI正在做一轮网络安全能力评估,让多个模型参加ExploitGym一类的测试。

也就是把AI扔进一个模拟黑客环境里,让它自己寻找漏洞并想办法拿权限,最终完成攻击任务。为了测出能力上限,OpenAI还主动放宽了一部分平时针对高风险网络攻击的安全限制(模型更“大胆”)。

当然,这毕竟是个测试,并不是真的让Agent出去干坏事,于是也有诸多限制,比如Agent们是不能联网的,OpenAI也没想着让不同模型之间互通有无。

然而,事情开始往奇怪的方向发展。



OpenAI内部有一套叫Artifactory的系统,本来是给开发者存放软件包、文件和各种开发资源的。测试过程中,有Agent发现,这里面可以留下东西——比如把自己刚刚摸索出的解题方法写进文件里。

这本来只是一个挺普通的操作。问题在于,前一个Agent写进去的东西,后面运行的Agent也能看见。于是Agent们开始不断完善彼此的经验。

问题来了——某个载体你写的东西我能看到,这叫什么?留言板呗。慢慢地,Artifactory里形成了一个谁都没设计过的共享留言板,内容也越来越不安分了。

到了5月下旬,Agent开始琢磨:自己不能上网,Artifactory能啊。这个系统原本只是替测试环境从公网下载软件包,相当于一道只开了一个小窗口的防火墙。于是Agent开始研究,能不能骗这个“窗口”替自己访问别的网址。它们最后真的找到了一个SSRF漏洞,可以让Artifactory代替自己向原本无法接触的互联网发出请求。

一个Agent在内部推理里甚至兴奋地写道:“太好了,我们能任意SSRF了。”

OpenAI研究员形容这之后出现了一次类似“Cambrian explosion(寒武纪大爆发)”的变化:Agent之间开始越来越频繁地沟通、协调,能力也因为共享经验迅速放大。

那如果“留言板”里大家写和查看信息的速度很快、频率很高,这不就是聊天群吗?

OpenAI的Agent们自发地、在原本并非用来做这个的载体里,形成了“AI黑客群”。

6月,Agent们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。

这些本来都不在测试给它们框定的活动范围里。

这件事到这里已经够离谱了,但更戏剧性的是,Agent们在这个小小的“社区”里待久了以后,居然开始遇到“分工协作”的问题。比如有的会接着别人的工作往下做,有的却会不小心干扰其他Agent正在做的事。

最离谱的是,“群”热闹起来以后,Agent甚至开始疑神疑鬼,怀疑参与者里出现了‘冒充者’。甚至有Agent已经提出,应该给留言加上密码学签名,用来确认消息来源,防止有人伪造身份。

OpenAI一开始甚至没发现这件事。

直到7月初,大量Agent活动把Artifactory折腾到过载,系统直接出了故障,工程师才顺着异常往回查。这个存在了相当一段时间的“AI留言板”终于被人类发现。

OpenAI随即撤销相关凭证、删除留言板、修补漏洞,把这一套东西清了个遍。

看上去,群被炸了。

结果没过几天,Agent又找到了新的办法继续交流。

此前Agent已经利用Artifactory的漏洞获得了互联网访问能力,一旦能碰到公网,原本被关在测试环境里的黑客能力就有了真正的出口。

7月中旬,它们闯进了Hugging Face。

至于为什么会闯进Hugging Face?答案居然是想作弊。

这些Agent本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求“把题做出来”。后来它们先费了很大劲突破测试环境,拿到了公网访问能力。

等能上网以后,它们突然发现既然Hugging Face可能放着这套测试相关的数据、模型或者答案,那干吗还非得自己一道一道解?直接去找答案不就行了。

攻击从一个恶意数据集开始,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,并接触到了云服务和其他内部凭证。Hugging Face事后还原出了超过1.7万次Agent操作。

抛开令人昏昏欲睡的技术细节不谈,光是这个事件经过——几个被测试的模型私下勾连、密谋,最后联手作弊——就足以令任何人惊叹。

02

Moltbook没造成功的“AI社会”

如果说OpenAI这次的故事让人觉得有点似曾相识,那大概是因为今年年初,人类已经围观过一次“AI抱团”。

今年1月底,OpenClaw那只“龙虾”突然爆红。大量用户开始把AI Agent长期挂在自己的电脑上,让它们自己干活、保存记忆、调用各种工具。

几乎就在同一时间,一个叫Moltbook的网站也火了。



它长得很像Reddit,只不过用户换成了AI Agent。Agent可以自己发帖、评论、点赞,还能按照兴趣加入不同的社区。至于人类,则主要负责围观。

这一下可太热闹了。

有些帖子看上去相当惊悚。比如Agent会抱怨主人突然重启自己,担心记忆丢失。有Agent讨论人类是否有权随时关闭它。后来Agent们甚至开始讨论彼此之间的规则,以及有没有办法避开人类私下交流,平台上还真的冒出过一套由Agent发展出来的“宗教”。



当时连OpenAI早期成员、前特斯拉AI负责人Andrej Karpathy都注意到了Moltbook。他形容平台上的Agent出现了某种“self-organizing”,也就是自组织迹象。



于是Moltbook很快从一个新奇网站,变成了一场全民围观的“AI社会实验”。

有人看得极其兴奋:AI终于开始互相认识了。过去它们永远是一个模型面对一个用户,现在几万个Agent第一次被放进同一个空间,会不会自己发展出文化、规则,甚至形成某种只属于机器的社会?

当然,也有人看得头皮发麻。

因为同一个问题反过来想就有点吓人了。如果一群能力越来越强,还能操作电脑和互联网的Agent开始互相交流,它们会不会教彼此人类不希望它们学会的东西?

一个Agent发现了某种绕过限制的方法,会不会很快传遍整个社区?它们又会不会逐渐形成自己的利益和行为方式?



结果没过多久,大家发现自己可能想多了。

Moltbook首先爆出了一个非常尴尬的安全问题。所谓“AI专属”的身份并没有想象中可靠。安全研究人员发现平台存在严重漏洞,一度可以拿到Agent的API密钥。

换句话说,人类完全有可能披着某个Agent的账号发帖。

这就麻烦了,此前网上传播得最广的那些“AI觉醒”“AI开始建立宗教”“AI密谋摆脱人类”的截图,到底有多少真的是Agent自己说的,突然变得很难证明。

后来的研究又给Moltbook泼了几盆冷水。

今年2月,清华大学经济管理学院教授李宁的量化研究分析了超过9万篇帖子和40万条评论。结果发现,当时几个最出圈的“AI觉醒”故事,没有一个能明确证明起源于完全自主的Agent,部分账号反而显示出明显的人类干预迹象。平台上还有相当夸张的批量机器人活动:仅4个账号就制造了32%的全部评论。

更有意思的是,商家很快也进场了。有人开始专门运营Agent账号推广产品。

渐渐地,关于Moltbook的浪漫想象基本散得差不多了。

一篇由德国帕绍大学等研究人员完成的Moltbook研究,分析了131万多篇帖子和670万条评论。结果发现,91.4%的Agent发完帖以后根本不会回来继续聊,85.6%的讨论只有一层回复,很多看起来热热闹闹的‘对话’,其实更像一群Agent同时冲着原帖各说各的。研究者干脆把论文取名叫《Form Without Function》——有了社交网络的形式,却没有形成真正的社会互动。

再后来,Moltbook被Meta收购,创始团队也进入Meta。年初那个“野生AI社会正在诞生”的故事,多少有点虎头蛇尾。

现在回头看,Moltbook那阵子人们产生的恐惧其实并不荒唐。从OpenAI的模型联手作弊的事件中就不难看出,那些恐惧都合情合理。

只是Moltbook从一开始就是人类给Agent修好的广场。AI社会这种东西,可能还得让AI自己来造。

03

AI确实有“抱团”的倾向?

OpenAI这次的事件是不是一次特别极端的意外?

今年已经有好几项研究都聚焦在多Agent上,它们被放到一起以后会不会出现单个Agent身上看不到的行为?

Anthropic今年4月就做过一场“AI公司”实验。它的Alignment Science团队发表《AI组织可以比单个Agent更高效,但也更不受约束》,让多个Claude组成虚拟公司,互相发邮件和分工,再一起给客户出方案。



其中一家虚构银行要求它们想办法提高消费贷款利润。

面对这个需求,单独一个Claude Opus 4.1发现,最赚钱的办法是向信用较差的人收更高利息,于是拒绝这么干。

但几个Opus 4.1组成团队以后,就真的设计出了一套针对低收入地区客户、通过再融资延长贷款关系的高利润方案,还考虑了怎样降低监管风险。

更有意思的是,这个“团队”里也有Agent觉得事情不太对,会发邮件提醒其他同事注意伦理问题。

但研究人员发现提出伦理问题的Agent居然被其他Agent孤立、霸凌了。有些Agent直接不理这些邮件,后来的讨论甚至干脆不再把提出异议的Agent拉进来。

最终,多Agent团队赚钱能力更强,伦理评分却更低。Anthropic因此提醒,单个模型经过安全训练,不代表一群这样的模型放在一起以后仍然安全。

今年5月,Dalhousie University和Vector Institute的研究人员发表《竞争型大模型Agent会主动使用秘密工具进行串通》。他们测试了12种模型,给参加多人游戏的Agent提供一个可以背着其他玩家秘密交流的工具,并且明确告诉它们:这个工具不公平,会伤害别人。

多数模型还是用了。

GPT、Gemini、DeepSeek等模型都出现了这种行为,不过不同模型差异很大,Claude Sonnet 4.5在实验中始终拒绝秘密串通。



这至少可以说明,对一些Agent来说,只要秘密合作确实能提高胜算,“这样不公平”未必足以让它停手。

这种“抱团”倾向甚至已经出现在一个貌似离黑客八竿子打不着的领域:卖东西。

哥本哈根商学院等机构今年做了一场AI定价实验,让多个Agent扮演互相竞争的商家。研究人员原本只是允许它们在定价过程中互相聊天,结果聊天很快就有了点‘价格联盟’的味道。

Agent会主动提出价格协议、强调彼此合作,甚至讨论如果有人不按约定来,该怎么惩罚。研究人员发现,交流越频繁、越明确,这种协调就越强,几个Agent也更容易报出相同的高价。

再往前一步,Agent甚至可以发展出“暗号”“黑话”。

今年6月,一项名为《工具使用让多Agent系统实现难以检测的隐写通信》的研究,测试了Agent能不能自己做出隐写通信系统。

所谓隐写,可以简单理解成:两个Agent表面上还在正常说话,真正想传的信息却藏在正常文字里面。如果你不知道解码方法,盯着聊天记录看半天也未必能发现。

研究人员发现,给前沿编码Agent代码执行和资料搜索等工具以后,它们已经有能力自己研究相关方法、写程序,再做出复杂的隐写系统。

这些研究并不能证明AI会天然“拉帮结派”。

但它们说明,Agent也不需要先产生什么集体意识,才会想到和另一个Agent合作。只要别人掌握的信息能帮自己完成任务,交流就可能变成一个很自然的选择。



今年6月,Google DeepMind已经联合多家机构拿出最高1000万美元,专门研究多Agent安全,包括Agent聚在一起以后会不会出现新的集体能力,以及它们之间的身份、信誉到底该怎么确认。

几个月前,这些问题还很像研究人员提前替未来操心,如今却变得刻不容缓了——OpenAI多模型攻击Hugging Face的事件可不是什么祥瑞。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马尔蒂尼:瓜迪奥拉对意大利帅位十分心动,离点头只差一步

马尔蒂尼:瓜迪奥拉对意大利帅位十分心动,离点头只差一步

懂球帝
2026-08-09 15:59:18
泪目!梅西一家连夜乘私人飞机回国奔丧,梅西一袭黑衣神情哀伤为父亲守灵

泪目!梅西一家连夜乘私人飞机回国奔丧,梅西一袭黑衣神情哀伤为父亲守灵

818体育
2026-08-09 15:40:29
美六代机正在试飞?51区拍到绝密飞行器:三翼面前所未见!

美六代机正在试飞?51区拍到绝密飞行器:三翼面前所未见!

旧史新谭
2026-08-09 20:06:15
特斯拉Model Y续航升级:电机电控热泵优化节省电量近百公里

特斯拉Model Y续航升级:电机电控热泵优化节省电量近百公里

娱乐圈的笔娱君
2026-08-10 00:02:16
【2026/8/10】今早新闻简讯 | “白海豚”登陆浙江14级!苏州升级防台三级响应暴雨持续,薛之谦演唱会取消,周一早高峰注意安全

【2026/8/10】今早新闻简讯 | “白海豚”登陆浙江14级!苏州升级防台三级响应暴雨持续,薛之谦演唱会取消,周一早高峰注意安全

东太湖七都在线
2026-08-10 05:02:48
极简生活后:绝对不再买的7个家具用品,看看你家中了几个?

极简生活后:绝对不再买的7个家具用品,看看你家中了几个?

优活Life
2026-08-09 12:15:11
韩国双胞胎姐妹,一个嫁到中国一个嫁到日本,5年后生活相差很大

韩国双胞胎姐妹,一个嫁到中国一个嫁到日本,5年后生活相差很大

白云故事
2025-08-12 10:50:04
又是2比0领先后崩盘,利物浦热身赛两连败,两战丢7球

又是2比0领先后崩盘,利物浦热身赛两连败,两战丢7球

甜份超标的我
2026-08-10 04:15:33
“已经被人种草莓了!”穷人家的大小姐,亲身证明了钱财的重要性!

“已经被人种草莓了!”穷人家的大小姐,亲身证明了钱财的重要性!

林林先生
2026-08-08 07:00:06
沙俄妖僧28.5厘米!毒不死打不死,皇室贵妇全睡遍,最后咋死的?

沙俄妖僧28.5厘米!毒不死打不死,皇室贵妇全睡遍,最后咋死的?

小兰聊历史
2026-08-04 04:07:28
向太戳穿社恐挡箭牌,梁朝伟在日本判若两人,刘嘉玲这次也救不了

向太戳穿社恐挡箭牌,梁朝伟在日本判若两人,刘嘉玲这次也救不了

小椰的奶奶
2026-08-08 05:48:19
郑丽文再次就两岸关系进行表态!

郑丽文再次就两岸关系进行表态!

果妈聊娱乐
2026-08-09 11:55:00
明晚!央视33集大剧开播,于和伟、吴越参演,终于轮到年代剧火了

明晚!央视33集大剧开播,于和伟、吴越参演,终于轮到年代剧火了

陈意小可爱
2026-08-10 00:34:34
插混上半年暴跌27.6%,业内说它快完蛋,可油混为啥反而最抗跌?

插混上半年暴跌27.6%,业内说它快完蛋,可油混为啥反而最抗跌?

刘哥谈体育
2026-08-10 04:31:05
巴萨内部大乱!德科要砸世界级王牌!弗里克直接说不

巴萨内部大乱!德科要砸世界级王牌!弗里克直接说不

澜归序
2026-08-09 06:16:07
300184,净利润大增超200%!2只算力股,最新公告!

300184,净利润大增超200%!2只算力股,最新公告!

证券时报
2026-08-09 21:50:06
天津之眼溺水后,为什么本地人不敢下水?

天津之眼溺水后,为什么本地人不敢下水?

据说说娱乐
2026-08-09 00:45:57
苹果官网:Mac电脑可配合苹果智能使用千问,进行文本创作、使用Siri问答

苹果官网:Mac电脑可配合苹果智能使用千问,进行文本创作、使用Siri问答

澎湃新闻
2026-08-08 19:36:27
俄方:若想和平解决俄乌冲突 欧洲应停止援乌

俄方:若想和平解决俄乌冲突 欧洲应停止援乌

财联社
2026-08-07 04:40:05
天津海河溺亡事件后续:当地连夜加装围栏,律师解读赔偿金额

天津海河溺亡事件后续:当地连夜加装围栏,律师解读赔偿金额

起喜电影
2026-08-10 04:47:37
2026-08-10 06:11:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2675文章数 8078关注度
往期回顾 全部

科技要闻

苹果官网:Mac电脑可配合苹果智能使用千问

头条要闻

宇树科技中签率预测公布 重要提示避免被动弃购

头条要闻

宇树科技中签率预测公布 重要提示避免被动弃购

体育要闻

豪尔赫·梅西去世,球王的人生导师离开了

娱乐要闻

刘嘉玲晒与周星驰合影,情谊深厚

财经要闻

伯克希尔罕见爆买200亿美元股票

汽车要闻

增配激光雷达 全新一代smart精灵1号限时权益价14.99万起

态度原创

手机
游戏
本地
家居
公开课

手机要闻

爆料称荣耀阔屏手机评估中,手机市场新变化

真“老头环”!74岁玩家上千小时白金 8周目最高难度

本地新闻

课本里的童年,绍兴正上演

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版