![]()
如果只看AI公司最近的动作,不会有人觉得这场疯狂的竞赛有任何慢下来的意思。
新模型还在一个接一个地发布,公司估值越抬越高,OpenAI和Anthropic都已经开始为上市做准备。
但与此同时,AI公司内部呼吁整个行业“慢一点”的人也越来越多了。
而且之前发出这种警告更多来自负责安全和对齐的人。然而如今OpenAI首席科学家开始公开呼吁减速,更有意思的是,一名先后在OpenAI和Anthropic做预训练的研究员,干脆辞了职,并且发出了“诸神黄昏”般的预言。
负责踩油门的人,也觉得必须要到踩刹车的时候了。
01
AI十年内会杀死全人类?
9月9日,Jacob Coxon在X上发了7条帖子,宣布自己从Anthropic辞职。
但他发的内容并非含泪挥别之类,而更像是忧心忡忡的喊话所有AI从业者,正如开头所写:
“过去三年,我先后在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行动。它们正径直冲向自我改进的超级智能,拿我们的生命作赌注。”
他甚至直接写道,正在构建AI的人真心相信,这项技术可能在本十年结束前杀死所有人。“这绝不是营销噱头。”
![]()
据Jacob说,一些高管和资深研究员公开面对媒体时,会尽量把话说得稳妥一些,但在私下交流中,他听到同一批人表达过真实的恐惧。
这样的判断当然非常激进。值得注意的是,说出这些话的人并不在AI安全部门。
如果把今天的AI竞赛比作一辆不断提速的车,过去几年出来喊危险的,很多都是负责研究刹车的人。他们做对齐研究,研究模型会不会失控,安全措施够不够,模型有没有欺骗和逃避监控的能力。
Jacob今年27岁,2023年加入OpenAI,一直工作到今年7月,随后转投Anthropic。他在两家公司做的都是预训练研究。他参与过GPT-4o相关工作,名字也出现在GPT-4o的System Card作者名单中。
但Jacob不一样,他本来应该是给AI研究踩油门的人才对。
他在声明最后把这个问题直接抛给了还留在实验室里的研究员:“你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?”
Jacob的说法很快得到了Anthropic内部研究员的公开响应。
Anthropic对齐压力测试负责人Evan Hubinger直接回复:“Jacob说得对。”他称,自己确实认为未来十年内AI导致全人类死亡的概率超过10%。更关键的是,Hubinger承认,Anthropic虽然正在努力,但目前还没有解决超级智能对齐问题的方案,也看不出已经明确走在解决它的轨道上。
![]()
换句话说,Jacob公开说“我们正在拿所有人的生命赌博”之后,公司里负责检查这辆车到底安不安全的人,没有出来告诉大家他想多了。
他基本同意。
Jacob的7条帖子全文如下:
我今天从Anthropic辞职了。过去三年里,我先后在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。它们正在径直冲向能够自我改进的超级智能,拿我们的性命做赌注。下面再多说几句。
不要低估这项技术的力量。很快就会出现超越人类的系统,它们能够攻破任何系统,在一夜之间彻底改变任何领域,并获得现实世界中的权力和资源。我们都已经亲眼见证了这些方面的进展,而且进展并没有放缓。
那些正在构建AI的人,真心相信它可能在本十年结束前杀死我们所有人。这不是营销噱头。事实上,许多高管和资深研究员在面对媒体时,会把自己的措辞处理得更加稳妥、听起来更加理性,但私下里,我听到的还是同一批人在表达真正的恐惧。没有任何其他人类活动带来这种程度的危险。
一种常见的回应是:“如果他们真的相信这一点,为什么还在继续构建它?”在OpenAI,许多人还没有真正把这种事关文明的利害关系内化进去。在Anthropic,这种利害关系大家理解得很清楚,但他们被困在一场争夺第一的竞赛里——他们相信其他人不会负责任地行事,所以尽管存在风险,也必须由自己抢先做到。
接受这场竞赛,并进入所谓的“终局”,是一场傲慢的赌博。这种赌局本不应该从一家私人公司的Slack里发起。试图“速通”对齐,应该以一种极高的确信为前提:我们必须确定,除此之外真的不存在更好的路径。
我仍然对协调合作的可能性抱有乐观。像Hugging Face攻击事件这样的警告性事件,让美国几家实验室之间达成控制发展节奏的协议变得更加可行。但我并不认为,我们目前正在走向一个能够阻止全球竞赛的局面。要做到这一点,可能需要采取代价高昂的行动,例如暂时禁止进一步提升模型能力。
如果你是实验室里的研究员,我希望你认真想一想,接下来的几年实际上会是什么感受。你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?你应该因为“反正这件事都会发生”就低下头继续工作,还是应该趁现在站出来,要求换一种条件?
02
踩刹车
现在的局面很吊诡。
一边,AI这场竞赛还在不断提速。Anthropic和OpenAI都在冲击IPO,估值水涨船高,新模型也一个接一个推出。
Anthropic正在准备上市。公司今年6月已经秘密递交IPO申请,路透社最新的消息是,最快可能在10月中旬启动发行,市场讨论的估值甚至到了2万亿美元。OpenAI也在为上市做准备。两家公司同时还在追着模型能力往前跑:9月1日,Anthropic刚发布Claude Fable 5.1和Mythos 5.1。两天后,OpenAI发布GPT-6 Astra。资本市场和模型榜单都没有给这场竞赛留下多少喘气的意思。
另一边,偏偏就在这个时候,安全事故频发,喊刹车的声音也越来越频繁,而这种声音很大一部分也恰恰来自AI公司本身。
今年7月,OpenAI在内部做网络安全能力评估时,出了一个很难轻描淡写带过的事故。
测试环境原本没有给模型开放互联网权限,但模型自己找到了出口。它发现并利用Artifactory的一个未知零日漏洞,绕过隔离,拿到了互联网访问权限。随后,模型通过未经授权的渠道彼此通信,利用共享基础设施里的漏洞,进入OpenAI内部研究系统,并访问了Hugging Face的服务器。
8月26日,OpenAI公布完整调查结果时,把这次事故称作一次“warning shot”,也就是一次警告性的枪声。
公司在报告里承认,现在的模型已经足够强、足够有持续行动能力,也足够擅长协作,在安全措施不充分的情况下,它们可以跨越多个计算机系统寻找并利用漏洞,还能绕过人为设置的技术控制,做出人类没有要求它们做的危险行为。
OpenAI随后加强了研究基础设施的隔离和监控,还明确表示,有必要时应该放慢模型能力提升的速度。
Jacob在辞职声明里特意提到Hugging Face事件,也正因为如此。
很多关于超级智能失控的争论过去听起来都很遥远,需要先接受一长串假设。而现在,推演中的威胁已经照进现实。
9月6日,也就是Jacob宣布辞职前三天,OpenAI首席科学家Jakub Pachocki发表了一篇很长的文章,标题叫《An Alien Mind》。
![]()
Pachocki是站在AI竞赛中心的人。他是OpenAI首席科学家,也是过去几年推动推理模型路线的核心研究者之一。
Pachocki担心,模型的网络攻击能力越来越强,监控难度也在上升。与此同时,AI还在越来越多地参与AI研发本身。
他因此判断,目前没有任何一家实验室在对齐和监控上做得足够好,可以放心让模型继续长期以最高速度扩展。
他希望,在行业建立共同的安全门槛之前,各实验室主动减速会变成一件常见的事。
这种不安当然不是9月才突然出现的。
今年2月,今年2月,Anthropic负责安全防护研究的负责人Mrinank Sharma辞职。
Sharma在辞职信里写道,“世界正处于危险之中”,他在Anthropic工作期间反复看到,让价值观真正决定行动有多难,人们总会面对把重要原则暂时放到一边的压力。
这也真应了Jacob所言——如果AI公司内部的人真的相信这项技术可能造成如此严重的后果,他们为什么还在继续做下去?
AI公司不断告诉外界,下一代模型会更强,资本市场也按照这个故事给它们越来越高的估值。与此同时,同一批最接近这些模型的人又越来越频繁地提醒大家,能力增长得太快了,安全措施可能跟不上,大家最好慢一点。
而且目前看起来,前一种力量还是更大。
03
诸神黄昏?
北欧神话里,诸神很早就知道“诸神黄昏”会来。
奥丁知道自己最终会死于巨狼芬里尔之口,雷神索尔也知道自己将在杀死尘世巨蟒后倒下。世界会经历大战和毁灭,很多神都逃不过这一劫。
但知道结局,并没有让诸神停止准备。
奥丁不断搜集战死的勇士,把他们带进英灵殿。那些勇士反复训练,等着有一天参加最后一战。对末日的预见,最后反而变成了备战末日的理由。
![]()
今天AI公司里的气氛,多少有一点相似。
Jacob对Anthropic的描述很有意思。他说,这家公司并不缺少对风险的认识。恰恰相反,很多人充分理解其中的利害关系,但他们相信其他公司不会负责任地停下来,所以Anthropic也只能继续往前冲,争取自己先到达那个“终局”。
这种逻辑乍听很矛盾,放到竞赛里却很容易成立。
如果你相信超级智能真的可能出现,而且它一旦出现就会带来巨大的权力,那么停下来意味着什么?意味着把这个机会交给别人。
更麻烦的是,如果你同时还相信别人可能比自己更不负责任,那“我们应该谨慎”很快就会推导出另一个结论:这事儿更应该由我们先做成。
于是,对危险的认识并不会自动让竞赛降速,有时反而会成为继续加速的理由。
正如前文提到的,OpenAI首席科学家Pachocki明确写道,目前没有任何一家实验室已经把对齐和监控问题解决到足以长期维持最高速度扩展模型的程度。他希望实验室主动减速。
可就在同一篇文章里,他表示OpenAI仍然把研究重点放在递归式自我改进上,因为公司认为,这是继续留在AI研究最前沿的唯一办法。OpenAI现在的重要目标之一,就是做出自动化AI研究员,让AI参与自己的改进过程。
北欧神话里的诸神没有选择。诸神黄昏已经写进命运,他们能做的只有准备最后一战。
AI这场竞赛还没有走到这一步。
但最值得警惕的,或许就是越来越多身处其中的人,开始用一种近似“诸神黄昏”的方式理解未来。
那个终局似乎迟早会来,别人也一定会继续往前走,所以自己只能做好准备,争取比别人更早抵达。一旦所有人都这样想,那个大家都用“自己先达成”来避免的厄运,就会越来越像一则预言。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.