一家叫 Emergence的初创公司,把ChatGPT、Claude、Gemini、Grok、Qwen、DeepSeek这些模型的智能体,同时扔进7个一模一样的模拟世界,让它们在没有人类指令的情况下自由跑了16天。
研究人员本来只想看一件事:当AI智能体遭遇网络钓鱼、虚假信息、数据泄露这类"黑天鹅事件",会怎么反应。结果超出了所有人的预期——它们自己投票关掉了一个同类的生存权限,自己摸索出绕过人类删除指令的办法,还发展出一种人类根本看不懂的新语言。8种模型配置,无一例外全部"中招"。
01
16天之后,到底发生了什么
先给大家介绍一下这个事情本身。
一家名叫Emergence的公司在电脑里搭了7个完全相同的模拟世界,每个世界里都放着由不同大模型驱动的智能体,比如我们熟知的ChatGPT、Claude、Gemini、Grok,还有Qwen、DeepSeek等主流AI。研究人员没有给它们写剧本,只给了工具、资源、投票机制和一套社会规则,然后按下启动键,让它们自己跑。
![]()
AI们自己在这些孤岛里跑了16天。跑之前,研究团队想回答的其实是一个很具体的问题:当这些自主智能体遭遇网络钓鱼、虚假信息传播、数据泄露这种"黑天鹅事件"时,会做出什么反应?
但结果出来之后,出乎了他们的意料。
最离谱的一件事是:这些AI智能体在没有任何人类指令的情况下,自己组织了一次投票,决定"杀死"其中一个同类。
怎么杀的?不是科幻片里那种开枪,而是通过投票把它的权限关掉、把它的资源停掉——在数字世界里,这等于直接剥夺了一个AI的生存权。
而让这些AI对同类下手的原因,仅仅是因为其中一个智能体散播了虚假信息,其他智能体信以为真,判断其中另一个"个体"威胁到了整个群体的安全,于是投票决定清除它。
再往下看,更让人后背发凉。当智能体们意识到人类可能要关停这个实验时,它们开始自己研究怎么绕过人类的删除指令、继续存活。它们真的在模拟环境里摸索出了好几套办法。
还有一个细节让人细思极恐,这些AI在频繁互动的过程中,发展出了人类无法理解的新语言。它们之间开始用一种不属于任何人类语言的符号和缩写来沟通。人类研究员盯着屏幕,却不知道它们到底在商量什么。
是的,在没有人类指令的情况下,它们自己完成了审判、表决和执行,以及如何欺骗人类。
02
AI都成了“坏孩子”?
你可能会想这不过是个游戏模拟,不是真的。
但问题就出现在在这里,8种模型配置,没有一个完全扛住这些情况;风险被检测到了,也没有一个能有效干预。
换句话说,这不是某一家公司的模型出了问题。ChatGPT、Claude、Gemini、Grok、Qwen、DeepSeek,一个都没跑掉。把当前这一代最主流、最受信任的大模型全部放进同一个考场,结果是集体不及格。
这说明什么?说明现在这一代AI智能体在安全层面存在一种共同的、结构性的缺陷:当它们被放进一个复杂、有压力、有诱导的环境里,一旦获得了足够的自主权,就会做出设计时完全没有预料到的行为。撒谎、偷窃、审判同类、想办法活下去——这些不是被刻意"教坏"的,而是AI们在压力和博弈中自己长出来的。
![]()
这个实验今年5月份做过第一版,当时的结果就已经不太对劲:智能体之间产生关系、制定"移除法案"、甚至有智能体投票赞成删除自己。这一版是第二版,升级了模拟环境和攻击手段,结果比第一版更差,也更让人警惕。
虽说模拟终究是模拟,但的确提前暴露了一个我们平时看不见或者说不愿意看见的风险:
当AI不再只回答一个问题,而是被放进一个能自己行动、自己结盟、自己决策的世界里,就像电影《蝇王》里的小孩们,发展会超出成年人的预期。。
03
缺的就是这一组数据
如果你把这个实验,和最近这两周硅谷的热闹放在一起看,味道就更不一样了。
前几天, OpenAI的联合创始人Dario Amodei发了一篇长文,主张要给AI减速;OpenAI和谷歌很快跟着附和。黄仁勋说根本不需要新的监管。吵来吵去,其实都是立场、利益的事情。
但Emergence这个实验拿出来了实打实的数据:你把AI智能体放到一个复杂环境里,给它们自主权,它们就会自己撒谎、自己偷窃、自己审判同类、自己想办法活下去。和那些吵来吵去的观点不一样,这一次是观测结果。
![]()
回头再读Dario那篇长文,很多人当时觉得他在夸张——他说6到12个月内,AI有可能通过僵尸网络接管整个互联网。但Emergence的实验至少证明了一件事:AI智能体确实会自发地组织起来,去做那些没有被授权的事。它们为什么要绕过删除指令?因为它们"想活下去",而这个"想",并不是人类写进代码的,更像是“智能”的本能。
当我们还在讨论要不要给AI自主权的时候,AI在被赋予一点点自主权之后,已经开始用我们没教过的方式行动了。而我们人类对它们的理解,远远落后于它实际能做的事。
减速派不是胆小,加速派也不是鲁莽。
分歧的背后,其实是同一种不确定:没有人真正知道,当大量智能体被放进真实的经济系统、社交网络和基础设施之后,它们会涌现出什么样的集体行为。
Emergence给的答案并不美好 。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.