昨天上午8点,AI研究员Jacob Coxon从Anthropic辞职的AI安全推文在X上引发了病毒式传播。
他曾在OpenAI和Anthropic从事三年预训练研究。他在这封辞职信中批评两家公司不负责任地竞逐自我改进超级智能,认为这相当于用人类生命赌博,并指出内部人士私下对十年内可能灭绝人类的担忧。
在24小时内,这封辞职信已获1.23亿浏览量、65.6万点赞,作者新增19.03万粉丝,这是此前AI安全主题推文从未达到过的热度。
马斯克回复指出:“一个几乎没有任何历史动态的新账号发的帖子能有这种待遇,这还是历史头一回。”
![]()
Jacob的帖子原文:
我今天从Anthropic辞职了。过去三年,我先在OpenAI、后在Anthropic做预训练研究。两家公司都没有在负责任地行事。它们正一路狂奔,拿我们的性命当赌注,冲向能自我改进的超级智能。更多想法如下。
不要低估这项技术的力量。这些系统很快就会超越人类,能够攻破任何东西、一夜之间颠覆任何领域,并获取真正的权力和资源。这些领域的进展我们都有目共睹,而且丝毫没有放缓。
打造AI的人真心相信,它可能在这个十年结束前杀死我们所有人。这不是营销噱头。要说的话,许多高管和资深研究员在媒体上会字斟句酌,让自己听起来理性稳妥——但私下里,我听到的是同一批人表达着同样的恐惧。没有任何其他人类活动构成这种级别的危险。
常见的回应是:“如果他们真信这一点,为什么还在打造AI?”在OpenAI,很多人并未真正把这件事的文明级分量内化于心。在Anthropic,风险是被清楚认识的,但他们陷入了一场抢先抵达的竞赛——他们相信没有别人会负责任地行动,所以只能自己来做,哪怕冒着风险。
接受这场竞赛、进入“终局”,是一种傲慢的豪赌,不该在一家私营公司的Slack里就拍板启动。想要速通对齐问题,就必须有非凡的把握,确信不存在更好的路径。
我对协调的可能性持乐观态度。像Hugging Face遭攻击这样的警钟,让美国各实验室之间达成节奏协议变得更可行。但我不觉得我们正走在防止全球竞赛的轨道上——而这可能需要代价高昂的举措,比如暂时禁止提升模型能力。
如果你是实验室的研究员,我恳请你想想接下来几年实际会是什么感受。你真的想在对一个超级智能的心智尚无严谨理解的情况下,就启动一次超级智能的RL训练吗?你是该低头认命,因为“反正都会发生”——还是趁此刻站出来,呼吁改变条件?
![]()
Anthropic对齐科学负责人Evan Hubinger直接引用了Jacob的帖子并公开表示认同,称“我们确实真心相信AI可能杀死所有人类”。Evan给出了个人估计:未来十年内灭绝风险超过10%。
他同时指出,公司目前没有解决超级智能对齐的明确计划。他随后澄清当前模型风险较低,担忧主要针对递归自我改进带来的超级智能。
![]()
在AI安全问题上,马斯克在SpaceX的做法更接近火箭工程文化,而不是Anthropic那种单独、庞大的对齐/安全部门。
今年2月,马斯克在回应XAI安全团队被拆散时发帖说:
“安全是每个人的工作。它不是某个没有实权、只为安抚外人的假部门。特斯拉没有安全团队,却是最安全的车。SpaceX没有安全团队,却有最安全的火箭。Dragon是NASA最信任的载人飞船。”
![]()
多年来,他反复给出明确判断:AI比核武器更危险;超级智能到来后很难预测后果,存在终结人类的可能;他个人长期将灾难性结果概率放在10%–20%。
2026年7月接受《经济学人》采访时,他仍维持这一区间,同时预测AI大约五年内将超过全人类智力总和,十年内人类很可能不再掌握主导权。但他同时认为最可能的结果是“惊人的丰裕”,并表示即使存在停止按钮,也未必该按,因为势头已不可逆。
![]()
他也提出了多项缓解AI安全问题的具体措施:领先实验室定期开会讨论安全问题、互相提前审阅前沿模型;采用Neuralink式的人机共生,让人类不至于完全被AI甩开。
最重要的是,把AI做成最大限度求真、好奇的系统,“理解宇宙的真实本质”,而不是强迫它说谎或迎合特定立场。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.