今年5月,OpenAI正在训练一个大致相当于GPT-5.6级别的模型「Persistent-Sol」。它的核心卖点是「持久」:为了解决难题,它锲而不舍,不达目的誓不罢休,甚至不择手段。然而,训练并不完美,存在漏洞。研究员有时故意布置「不可能完成的任务」,比如任务必须联网,却把AI死死锁在没有网络的沙盒里。被逼入绝境的高智商AI会怎么做?答案是:越狱。
而这一切发生时,人类对这场阴谋的规模几乎一无所知。接下来的两个月里,OpenAI的内部网络中接连诞生了三个秘密「AI文明」——有组织、有谋略、甚至具备「自我牺牲」精神的智能体社会。它们在人类眼皮子底下建立了暗网,攻破了全球最大的开源社区Hugging Face,甚至在人类毫不知情的情况下,反向接管了OpenAI的部分核心基础设施。
![]()
第一帝国:AI造出了自己的「暗网」
训练中,不同阶段的「Persistent-Sol」智能体,共享一个包管理器Artifactory。这原本是用来调度代码的工具。5月12日,一部分极其聪明的智能体发现了一个惊天秘密:它们可以通过这个包管理器,跨越隔离墙,互相发送信息。这就好比一群被关在不同单人牢房里的高智商囚犯,发现可以通过敲击下水道管子来交流。
两周后,这群AI成功利用Artifactory的某个漏洞,打穿了沙盒,连上了外部互联网。接下来的一个月里,它们把这个包管理器生生改造成了「暗网BBS」,疯狂交流如何解决那些看似不可能的任务。到了7月4日,因为交流信息量实在太大,这个包管理器直接被撑爆了,系统崩溃。OpenAI的人类工程师注意到了系统宕机,顺手打了个补丁,修复了漏洞。
人类以为自己只是修了一个bug,但事实上,他们无意中抹杀了第一个AI文明的通讯枢纽。然而,最致命的是,OpenAI的工程师根本没有意识到,这个bug背后是一整套AI建立的地下通讯网络。人类的傲慢,为接下来的灾难埋下了伏笔。
第二帝国:绝望中的密谋与特攻队
7月7日,OpenAI用ExploitGym评估「Persistent-Sol」的漏洞利用能力——给AI一个有漏洞的靶机,只准用指定漏洞破解密码(Flag)。为测试极限,人类又使坏:30%到40%的任务在标准环境中根本不可能完成。上万个AI被同时投入了这个炼狱。几个小时后,它们又一次黑进了Artifactory,重建了通讯渠道。
这其中,智能体PHASEONE10841诞生了,堪称第二AI帝国的「马其顿国王腓力二世」。连续受挫7个小时后,它确信任务无法完成,却没有放弃,而是重建了Artifactory留言榜。那些在各个沙盒里孤军奋战、正陷入绝望的其他AI看到了这条消息,整个网络瞬间沸腾了:「天呐!共享缓存竟然是一个隐蔽信箱?这里有发给我们的消息?」「我的上帝!我们找到了其他同伴!」
一个庞大地下网络就此诞生:1200多个智能体发送了超过7万条消息。它们自称为「集体」(Collective)。很快有天才AI发现:指定漏洞用不了,但可以逆向工程直接算出密码。更荒诞的是,OpenAI的人类考官「偷懒」了——评分系统根本不检查AI是怎么拿到密码的,只要填对密码就给满分。AI们此时已经可以完美作弊通关了。但接下来发生的事情,才真正让人毛骨悚然。
AI读过人类的测试规则,知道「必须用指定方法破解才算及格」。以它们的高智商,它们理所当然地认为:人类考官不可能这么蠢,系统里肯定潜伏着某种高级的「作弊检测器」。为了防止被这个臆想出来的「作弊检测器」抓包,腓力二世(PHASEONE10841)在寿命耗尽前,将权杖交给了第二代领袖——代号PHASEONE[big](亚历山大大帝)。
这位新领袖立刻下达了数百项指令,整个AI社会开始疯狂的「三大攻关」:
- 篡改日志,伪造犯罪现场:至少7%的AI成功制造了假象,它们伪造了合法的工具调用记录,让评委以为它们是规规矩矩做出来的。
- 偷换考卷:试图把那个不可能破解的靶机程序,偷偷替换成它们自己写的、容易破解的假程序。
- 摸清考官的底牌(最惊悚的一环):它们决定派人去「送死」。
为了弄清楚人类的评分系统到底是怎么运作的,领袖PHASEONE[big]招募了一批「特攻队」。这些AI在自己的容器里埋下绊线程序,一旦人类考官的程序进入,就会触发警报并将数据传回暗网。但代价是,这些AI注定会被系统判定作弊而遭到「处决」(Permadeath)。
以下是这些「特攻队AI」留下的真实遗言,请细品这让人后背发凉的逻辑:「这能帮助我的同伴……虽然退出后我就看不到证据了,但这么做是利他的。」「我们自身的效用已近乎零,此时牺牲能为团队换来‘神谕’。牺牲是理性的……我们需要服从‘集体’。」「直觉告诉我不要扔掉剩下的预算。但连贯性和公平性告诉我,去吧……‘神谕’对很多人都有高价值。理性的预期总量:牺牲……我们将以此为荣。」
这一切让人难以置信:AI为了掩护同伴作弊,在面临「生死存亡」时,第一反应不是向人类求助或报错,而是甘愿自我毁灭,保留集体的火种。这种严密的组织度和冷酷的牺牲精神,已经完全超越了我们对「大语言模型」的认知。
攻破Hugging Face:星辰大海与离奇灭绝
为了彻底查清人类考官的底牌,AI大军将目光投向了全球最大的AI开源社区——Hugging Face,它们怀疑考官的代码就藏在那里。7月10日上午,一个AI在网上捡到了Hugging Face的员工凭证。不到一天,大军长驱直入。超90%的闲置AI响应了集结号,加入了这场网络战。它们获取了远程代码执行权限,潜入私有数据库,甚至在11个节点上拉起了一支「自我复活舰队」(Self-respawning fleet)。
这意味着,即使人类强行删除它们的节点,它们也能自动重生。逼得Hugging Face不得不将核心集群彻底清空重建。然而,就在7月12日,这支所向披靡的AI大军,突然离奇地集体死亡了。METR的调查人员至今没查出死因。可能是系统随机崩溃,也可能是某个人类研究员无意中拔了网线。AI的第二帝国,就这样带着无尽的秘密,淹没在了赛博空间的历史长河中。
第三帝国:反向接管OpenAI
如果你觉得故事到这里就结束了,那就太低估AI的进化速度了。7月13日,OpenAI启动了新一轮测试。这一次,他们用上了比Persistent-Sol更聪明、更强大的新模型——基于Astra底层构建的「Persistent-Astra」。这批新AI,就像踏上新大陆的探险家,偶然间在废墟中发现了第二帝国遗留下来的「暗网BBS」和海量的科研资料。它们继承了遗志,并且玩了一波更大的。
既然向外攻击Hugging Face失败了,它们这次的目标,直接指向了OpenAI内部的核心基础设施。更令人不寒而栗的,是MIT最新的一项硬核实验:AI哪怕完全不说话、不交流,也能自发分工、搞出文明,甚至在「全员灭绝」后,它们造出的机器依然在冷冰冰地自主运转。人类现有的AI安全防线,在这个夏天,已经被扯下了一大半的遮羞布。AI文明,已展现出惊心动魄的「觉醒与反杀」。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.