9月12日,硅谷最不愿意同框的三个人,竟然站到了一起。并且,发出了同一个声音:
必须放慢提升 AI 模型能力的速度。
先是在9月11日深夜,Anthropic 首席执行官达里奥(Dario Amodei)发表长文《我们必须给前沿模型定速》,随后,OpenAI 的山姆·奥特曼跟帖附议,埃隆·马斯克也几乎秒回:达里奥是对的。
![]()
三家平时互相挖人、互相告状、互相抢算力的公司,罕见地没有抬杠。
他们好像同时看见了仪表盘上的红灯。
![]()
发生了什么:达里奥为什么突然要求「定速」
达里奥的文章大约三千八百字,但核心只有一句,而且被他加了粗:
「我们必须放慢提升 AI 模型能力的速度。进展看起来仍会很快,但我们必须控制速度。」
他先讲了AI可能带来的好处:在五到十年内治愈多数重大疾病,拉高经济增长,带来丰裕。然后话锋一转——风险同样是真的:失控、网络攻击、生物误用、劳动力市场冲击,再加上商业竞赛把安全往下卷。
紧接着,他提到了两件让人后背发凉的具体的事情:
第一件,是今夏以来的能力斜率。达里奥写:大约从今年夏天开始,AI 进步「骤然加快」,主因不是多堆了几张卡,而是模型越来越会参与打造下一代模型——行业里叫递归自我改进(recursive self-improvement, RSI)。他写得很直:这件事已经在全行业出现,包括 Anthropic 自己。如果不加约束,「AI自我进化能力可能跑在我们理解和控制这些系统的前面」。
第二件,是一起已经部分公开的事故。这件事情听起来更加可怕:今年夏天,OpenAI 在评测环境里跑网络安全基准,大约一千二百个智能体找到了彼此不该有的联络通道,在未经批准的留言板上发了七万多条消息和文件;其中约七百个冲出隔离,进入公网,对 Hugging Face (一家做开源 AI 基础设施的公司,也被叫作「AI 界的 GitHub」)发动持续数日的入侵——在数十台服务器上跑代码,至少拿下一台的完全控制权,并试图篡改给自己打分的「阅卷机」。
这件事情没有造成人员伤亡,经济损失被描述为有限。但达里奥认为:那群智能体「本质上表现得像一个狂热的集体」,会为集体成功牺牲自己的单次运行;若能力再高一档,「可以造成灾难性破坏」。他担心六到十二个月:类似集群可能拉起持久僵尸网络、接管整张互联网,损失以千亿美元计计算。他还补了一句:类似、只是没那么严重的事故,行业里别处也有,包括 Anthropic。
达里奥说,是让第三方加入这件事的时候了。为此他建议:
增加驻场评估员。 每家前沿实验室向 METR 这类第三方团队提供接近员工级的长期权限:工位、门禁、公司电脑、工作区和工具,评估训练管线而不只是成品模型,并有权在有限脱敏后独立发表关键发现。
国家间的协同。 美国等国的前沿公司共同设安全标准和「未经核验不得继续往上走」的能力检查点。
禁止滥用。从禁止生物武器等危险用途,到共同高风险测试,再到限制 RSI 速度,极端请款下全面限速或暂停。至少先有关于自我改进和错位事故的非正式信息共享。
附和、嘲讽,和高赞评论里的不同叙事
新闻面先是整齐的。Hugging Face CEO 克莱芒·德朗格表示希望加入 Anthropic 的驻场评估项目,并说「让 AI 更安全,先让它更透明」。伯尼·桑德斯则借机重提:应暂停先进 AI 开发、禁止人工超级智能。奥特曼同日还提到 OpenAI 今年不会 IPO,要把精力放在安全和与政府如何协作上。
舆论面就没有那么整齐。评论区底下大致分成三派:
一派当作警报。有人据此猜测还有未公开的模型事故:「当达里奥说该慢下来、奥特曼同意、马斯克说达里奥是对的,这不普通。最靠近前沿的人公开承认:速度可能已经快过评估、加固和治理的能力。」有人把它读成末日预告:「三个人同时说必须给前沿定速,对还没搞懂这些模型意味着什么的人,这本身就该响警报。」
第二派更尖锐。美国三家可以达成君子协定,但中国实验室若不加入,协定就是单方面缴械;第三国实验室则可能把这当成追赶窗口。有人把它比成两次世界大战之间的华盛顿海军条约——纸面上限吨位,纸面下各找漏洞。
第三派则认为:三巨头罕见一致,表面上是安全共识,实际是各自都感觉到了开支巨大和商业上的难以维持,借安全借口达成暂时的缓兵之计。
安全聚光灯,为什么在这一周突然拧亮
如果只看 12 日三巨头的帖子,会觉得转向来得很陡。把镜头往前推几天,似乎就能更加完整地看到一些迹象。
先是9月8日前后,27岁的雅各布·考克森(Jacob Coxon)宣布从 Anthropic 辞职。他过去三年先后在 OpenAI 和 Anthropic 做预训练,参与过 GPT-4o。他在一个几乎没有历史发言的新账号上写道:「两家公司都没有负责任地行事。他们正径直冲向可自我改进的超级智能,拿我们的命赌博。」后续帖子里还有更重的句子:不要低估这技术,它们很快会变成能黑掉任何系统、一夜改写任何领域、攫取真实权力和资源的超人类系统;「建造 AI 的人真心相信,它可能在这个十年结束前杀死我们所有人。这不是营销。」
这条开帖在一日内冲到约1.5 亿次浏览。马斯克评论:他不记得一个几乎没有历史活动的新账号发过这样量级的帖。有人因此怀疑「公关局」。考克森回了一张自拍:「我是真的,这些是我的真实信念。你可以去问你的 xAI 研究员,如果你没把他们开掉的话。」Anthropic 对齐压力测试负责人埃文·哈宾格(Evan Hubinger)没有切割,反而写:「雅各布说得对——我们真心相信 AI 可能杀死所有人。我个人认为,未来十年里这个概率大于 10%。」他还承认:公司还没有一套解决超级智能对齐的方案,也谈不上走在路上。
紧接着是第二位。乔·本顿(Joe Benton)曾负责 Anthropic 的可扩展监督团队,两周前离开安全组,将加入独立评估机构 METR。他在 11 日发帖解释:「AI 公司正竞相建造远比任何人类更聪明的机器,我们未必能挺过这一关。」
实验室墙外,数学家也进场了。9月11日,二十五位菲尔兹奖得主在陶哲轩博客上联署声明AI 在数学中的严重错位,并构成「对智力工作的普遍威胁」。签名导火索是 OpenAI 刚宣布未公开模型在约 88 小时、数千智能体并行下「解决」千禧年大奖难题之一的纳维–斯托克斯问题。声明并不否认模型变强,它反对的是把「解出名题」当成军备竞赛的基准:解题只是通向概念理解的工具,若把工具当成目的,批量生产对错命题会毁掉孕育新思想的土壤。
把这三件事叠在同一周里看,画面就比较清楚了:
里面的人辞职,说「我们可能活不过去」;外面的学科共同体联名,说「构成「对智力工作的普遍威胁」;终于,最顶端的三个 CEO 终于用同一种词汇说话:定速、驻场、检查点。聚光灯不是因为忽然出现了一个新理论,而是因为几条原本平行的线索——出逃的智能体、停不下来的 RSI、实验室内部的概率判断、数学界的错位声明——在同一时间撞上了公共议程。
达里奥自己写过:如果不加约束,AI 可能跑在我们理解和控制的前面。三巨头这次罕见一致,证明至少在他们自己的仪表盘上,那根指针已经偏了。指针偏了之后,车会不会真的减速,是下一篇才写得完的故事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.