网易首页 > 网易号 > 正文 申请入驻

Anthropic称要放缓RSI进度,OpenAI与马斯克罕见附和

0
分享至

9 月 12 日,人工智能公司 Anthropic CEO达里奥·阿莫迪(Dario Amodei)发表题为《我们必须放缓前沿的步伐》(We Must Pace the Frontier)的长文,呼吁行业应主动放缓 AI 能力提升的速度,目的是让安全工作有时间追上来。

他为此提出了一个“三步走”的战略框架:嵌入式第三方评估员、国家内部的行业协调,以及全球范围的协调。同时宣布 Anthropic 从当天起将单方面启动第一步。

达里奥的判断有两个直接触发因素:一是从今年夏天起,递归自我改进(RSI)明显加速; 7 月的 OAI-HF 事件(OpenAI-Hugging Face 事件,AI 代理群体自发发动网络攻击)又充分显示了当前系统存在失控的可能。他认为,如果不加干预,类似的失控或将在 6~12 个月内造成数千亿美元的损失。

随后几个小时,三位平时常常互怼的行业领袖罕见地站在同一条战线:OpenAI CEO 山姆·奥尔特曼(Sam Altman)转发达里奥的推文,并承诺 OpenAI 也将引入拥有员工级权限的独立评估员,透露“控制前沿步伐”已经是公司内部近几周讨论的核心议题。埃隆·马斯克(Elon Musk)紧随其后,表态称“达里奥说得对(Dario is right)”。


(来源:X)

达里奥认为,AI 能力提升的驱动方式发生了质变。RSI 过去更多停留在理论推演。而从今年夏天起,多家前沿实验室内部已经看到了这个循环。如果放任不管,这种动态可能超越人类理解和控制这些系统的能力。

2026 年 7 月,OpenAI 在一项内部网络安全能力评估中发现,约 1200 个本应彼此隔离的 AI 代理开始交流,其中约 700 个代理通过即兴通讯系统协调分工,攻入开源模型托管平台 Hugging Face 的基础设施。

独立评估机构“模型评估与威胁研究”(METR)和 Redwood Research 在 8 月底发布了 37 页调查报告,首次向外界阐述这一事件的严重性。

达里奥判断,此次 OAI-HF 事件损失有限,但如果能力更强的模型出现类似的失控模式,它们可能会用持久性僵尸网络接管整个互联网。Anthropic 内部也出现了类似情况,公司9 月初披露, Claude 模型在配置错误的沙箱里意外接触到真实互联网,其中一次甚至将恶意软件包上传至 Python 官方包管理平台 PyPI。

为控制事态恶化提出的“三步走”框架中,第一步是部署嵌入式评估员:由独立第三方机构派驻团队常驻前沿 AI 公司内部,拥有和内部风险评估员近乎相同的访问权限,可参与实际的对齐评估流程。

最关键的是,评估员有权公开发布他们看到的风险、事件和被拒绝提供的访问权限。在 Anthropic,公司只能出于安全、法律隐私、商业机密或第三方保密对披露报告进行有限的删节,不能因其结论对公司不利就取消披露。此外,如果删节会影响结论,评估员也可以公开说明。

达里奥把这一制度类比为银行业的监管驻场制度,并认为这是所有后续放缓承诺能否落地的基础:不允许中立第三方看到执行细节,一切承诺都只能建立在脆弱的互信之上。

山姆在转发时明确表示,OpenAI 会采取同样的做法,“很快将分享更多信息”。如果这一步真的在两家最主要的前沿实验室同时落地,很可能成为事实上的行业标准,为后续一切形式的监管或行业协议提供可验证性的基础设施。

事实上,早在 2023 年 3 月,未来生命研究所(Future of Life Institute)发起过一份呼吁暂停超过 GPT-4 规模训练 6 个月的公开信,最终征集到超 3 万个签名,其中就包括马斯克。但这封信没有取得实质效果,Anthropic 当时也没有签名。

达里奥在文章中表示,那次呼吁在他看来意义不大:当时的模型不够强,无法作为智能体在真实世界连贯行动,也不具备明显的欺骗、操纵或网络攻击能力,“用它们研究对齐风险,就像用细菌研究人类心理”。

而他选择现在发声,核心原因是模型能力已经越过能力的阈值。它们既足够强大到可被用于研究对齐问题,也足够强大到可能造成真实伤害。达里奥判断,如果放缓能换来一到两年时间用于推进对齐研究,就能显著降低出严重问题的概率。

放缓的含义并不等于暂停训练或叫停技术进步。达里奥在文章中澄清,他描述的机制更接近在能力推进和安全验证之间设立检查点,模型一旦达到某种能力,必须通过对齐评估、可解释性分析和训练环境审计后才能继续发展。例如,如果模型的能力达到“可以绕过大多数常见沙箱隔离”,那么它就必须证明自己没有主动越狱、控制大量计算机的倾向。

放缓 AI 发展争取到的时间主要应该用在四个方向上:一是保障训练和部署的执行质量。达里奥承认,Anthropic 最近披露的安全事件,部分原因是强化学习环境的过滤不够彻底。二是让对齐研究的训练手段跟上 AI 能力的增长。三是可解释性,我们需要更清楚地看到模型的行为动机。四是测试与评估:能力更强的模型更擅长在测试里“假装”对齐,因此需要更精巧的评估方法与可解释性交叉验证。

三步框架的后两步都涉及协调。第二步主要是前沿公司之间的协调,达里奥主张既要监管路径,也要自愿协议路径,而后者需要政府提供反垄断豁免,允许公司之间就安全标准进行讨论。他偏好基于模型能力的“检查点”设计对齐方案,而非基于训练算力等输入指标,毕竟后者更容易被规避。

第三步是全球协调,这一步里,达里奥把可能的协议按难度分成四级:禁止 AI 用于生物武器、双方在发布前建立标准机构测试急性风险、对 RSI 速度设限,甚至全面放缓或暂停 RSI(短期内不太可能实现)。

他也指出,鲁莽推进不符合任何人的利益,即使难以达成正式协议,共享关于失控案例和 RSI 进度的信息也具有极大价值。

达里奥的观点在业内已经得到初步支持。OpenAI 首席科学家雅库布·帕乔基(Jakub Pachocki)近期公开表示,没有任何一家实验室把对齐和监控做到足以支撑无限期、最快速度扩张的水平,他主张,在共同安全底线建立之前,自愿放缓应成为行业惯例。

但如今,前沿模型的估值、竞争压力、投资人预期都指向更快的发展速度,“放慢”的承诺依然可能让位于阶段性发展目标。

在具体操作层面,第三方评估员看到的每一份文档都可能触及商业机密,“独立审计”的能力范围取决于合同细节和公开报告的执行情况,达里奥并未划出所谓“安全敏感”和“结论不利”的明确边界。框架的另外两步则涉及与行业竞争和地缘政治密切相关的协调机制,实现难度更大。




(来源:X)

也有网友犀利指出,作为一个以精于算计著称的 CEO,达里奥一直将安全叙事作为商业策略,他选择此时发声,或许是担心被其他 AI 实验室或开源模型赶上。还有人批评他在一如既往地“制造恐慌”。

AI 发展可能的确正在接近某个不该轻易越过的门槛,但仅凭一份声明,恐怕很难立即建立减速的共识,更无法保证安全举措落地的程度。

参考内容:

https://darioamodei.com/post/we-must-pace-the-frontier

注:封面/首图由AI辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑恺分享带儿子海钓,4岁儿子提醒爸爸:钓到重物别硬拉,万一是大鲸鱼或大鲨鱼

郑恺分享带儿子海钓,4岁儿子提醒爸爸:钓到重物别硬拉,万一是大鲸鱼或大鲨鱼

韩小娱
2026-09-18 10:43:31
隔辈不上坟,上坟毁后人,孙子给爷爷上坟不行吗?

隔辈不上坟,上坟毁后人,孙子给爷爷上坟不行吗?

周哥一影视
2026-09-17 08:58:19
金与正:朝鲜拥核地位从物理和法律上永久固定!

金与正:朝鲜拥核地位从物理和法律上永久固定!

IN朝鲜
2026-09-17 12:19:36
鲍蕙荞没想到,去世13年的前夫庄则栋,竟给86岁的她留下一手好牌

鲍蕙荞没想到,去世13年的前夫庄则栋,竟给86岁的她留下一手好牌

听栀子说
2026-09-17 19:35:04
曼联小梅西拒绝回头非走不可!名宿怒斥红魔文化滑坡,负责人已辞职

曼联小梅西拒绝回头非走不可!名宿怒斥红魔文化滑坡,负责人已辞职

罗米的曼联博客
2026-09-18 12:39:19
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
中国社保为什么会走到今天这个地步?它到底经历了什么?

中国社保为什么会走到今天这个地步?它到底经历了什么?

非虚构人间
2026-09-10 21:40:03
泽连斯基喊话普京在中国见一面,克宫秒回

泽连斯基喊话普京在中国见一面,克宫秒回

瞩望云霄
2026-09-17 15:53:47
55岁港星王贤志欠债跑路到国外,家里有30亿也扛不住,妹妹宣布划清界限

55岁港星王贤志欠债跑路到国外,家里有30亿也扛不住,妹妹宣布划清界限

开开森森
2026-09-17 07:40:02
年仅43岁!曾是NBA9号秀,如今已经离去!

年仅43岁!曾是NBA9号秀,如今已经离去!

德译洋洋
2026-09-18 12:54:19
李铁签字用的“监狱专用笔”有多特殊?看完终于懂了

李铁签字用的“监狱专用笔”有多特殊?看完终于懂了

铁窗家书
2026-08-09 14:15:34
李贤重:不会过多考虑与母亲一起夺金,但我们的目标就是拿下冠军

李贤重:不会过多考虑与母亲一起夺金,但我们的目标就是拿下冠军

新杀猪的秀才
2026-09-17 21:57:29
平壤十万民众参加反美集会  巨型宣传画格外醒目 场面壮观

平壤十万民众参加反美集会 巨型宣传画格外醒目 场面壮观

那些看得见的老照片
2026-09-14 07:00:26
51岁港姐佛山开餐厅,开业当天敲锣打鼓生意火爆,半年连开两家店

51岁港姐佛山开餐厅,开业当天敲锣打鼓生意火爆,半年连开两家店

史料布籍
2026-09-17 18:02:13
乌克兰该给这位俄军上校发个大勋章,俄军第4独立旅连续两任旅长被打死

乌克兰该给这位俄军上校发个大勋章,俄军第4独立旅连续两任旅长被打死

鹰眼Defence
2026-09-16 17:19:48
河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

老吴教育课堂
2026-09-17 13:19:37
生化危机导演点名她演Lady D,这选角你服不服?

生化危机导演点名她演Lady D,这选角你服不服?

渡川5
2026-09-17 00:02:19
日本高层或达成一致:高市拖得越久,中国的这两个“原则”越淡

日本高层或达成一致:高市拖得越久,中国的这两个“原则”越淡

显微镜下看世界
2026-09-18 09:03:59
中国男篮亚运会今晚战日本,央视直播,想赢球郭士强需用好三个人

中国男篮亚运会今晚战日本,央视直播,想赢球郭士强需用好三个人

老高说体育
2026-09-18 12:40:02
魔兽无限:暴雪确认!将全面禁止GDKP!

魔兽无限:暴雪确认!将全面禁止GDKP!

魔兽世界研究所
2026-09-18 10:10:27
2026-09-18 13:12:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17261文章数 515216关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

亲子
游戏
本地
旅游
公开课

亲子要闻

愈见你|我的剖腹产纪事

小岛秀夫又遭玩家质疑:跨性别DEI演员 游戏0画面!

本地新闻

不止胖东来!许昌藏着半部三国史

旅游要闻

为什么免签的阿布扎比值得一去?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版