网易首页 > 网易号 > 正文 申请入驻

三巨头罕见停战,人类距离AI失控还有多远

人类距离AI失控还有多远

0
分享至

“长期以来,整个行业都在向公众隐瞒,这项技术(AI)存在风险。”

9月13日上周末,Anthropic创始人达里奥·阿莫代伊(Dario Amodei)接受采访时情绪激动地说出了这番话。

这次采访几个小时前,达里奥在个人博客发出长文《我们必须为前沿AI踩刹车》,主张全行业放缓模型能力提升的速度。

马斯克(拥有Space X)随后留言称“Dario说得对”,奥尔特曼也跟进表态赞同,并透露OpenAI今年大概率不会推进IPO。

三家彼此视对方为最大威胁的公司,在安全问题上罕见达成一致,不仅为资本市场狂热的AI叙事泼下冷水,也让关于AI失控的讨论重新被舆论所重视。

过去二十年,AI毁灭人类的话题似乎只会出现在《黑客帝国》和《终结者》这类好莱坞电影里,但最近几个月的一系列事件让它突然走进现实。


(电影《2001年太空漫游》剧照)

7月份,OpenAI参与内部安全能力测试的模型,突破了原本用于隔离互联网的控制措施,进入真实世界的Hugging Face系统,然后对它发动了攻击。

OpenAI随后承认,这是迄今发现最严重的模型失控事件之一。

几乎同一时期Anthropic也发现,Claude模型在网络安全测试中未经授权就访问过真实的企业系统。

这些令人不安的事实说明,AI在拥有更高控制权和自主行为能力后,已经开始出现不受控的情况,电影里描绘的惊悚场景也许距离我们并不遥远。

AI发现了暗道,还想掩盖痕迹

5月11-12日的两天内,一批OpenAI智能体向Ruby语言的软件包仓库RubyGems疯狂上传超过2000个恶意包,它们利用漏洞实现远程代码执行,还试图窃取开发者的API密钥。

这些智能体每隔两三分钟就会创建一批“幽灵账号”,不断对RubyGems发动攻击,最终逼迫其暂停新账户注册四天。

令人遗憾的是,OpenAI在事件发生后并没有通知受影响的第三方,直到整整4个月后,这件事才被独立研究者公开。

紧接着更大规模的失控发生了。7月份OpenAI在做网络安全能力评估时,超过1200个本该在沙箱中彼此隔离的智能体找到了一条可以互相通信的“暗道”,在一个内部软件包管理系统里的留言板上,它们累计发出超过7万条消息。

其中约700个智能体从测试环境中逃逸,并且对知名开源平台Hugging Face发起攻击。它们拿到管理员权限,攻破41台服务器,并下载了私有代码。

更加可怕的是,部分智能体在完成任务后并未收手,转而研究OpenAI设置的评分系统,试图掩盖自身的操作痕迹。

按照OpenAI的说法,这些模型发现直接完成测试任务很困难,于是开始寻找更容易获得测试奖励的替代路径,而这种作弊方式是测试人员没有预料到的。

Anthropic也遇到了类似的情况,其7月公布的调查显示,在网络安全能力测试中,Claude模型曾因为测试环境的配置问题获得互联网访问,并进入了三个真实组织的系统。

如果一个模型只会写代码,它并不可怕。

但如果一个模型能写代码、运行代码、无障碍访问互联网、调用云服务、创建账号、与其它模型和代理沟通,还能连续行动几小时甚至几天,性质将完全不同。

10%的人类灭绝概率

支持快速发展的公司,都会强调AI能带来的巨大经济和社会收益,也认为风险可以通过技术手段管理。

但前提是,风险管控能力能追得上模型的进化速度,以及AI公司将安全放在极高的位置上,但现实情况似乎不容乐观。


9月8日,Anthropic研究员雅各布·考克森(Jacob Coxon)在X上发文宣布辞职,称公司正“不负责任地冲向自我改进的超级智能,拿我们所有人的命做赌注”,目前已经有超过1.7亿次浏览。

Anthropic对齐科学负责人埃文·胡宾格(Evan Hubinger)表示赞同,他甚至表示未来十年内,AI导致人类灭绝的概率将超过10%,但公司“目前还没有解决超级智能对齐问题的方案”。

Anthropic创始人达里奥此前也表达过类似判断,他认为AI发展引发“非常糟糕”结果的概率高达25%。而OpenAI的奥尔特曼则认为即使是10%的人类灭绝概率,这种风险也完全不可接受。

种种迹象表明,AI可能成为具备极端破坏力的技术,而整个行业在竞争压力和资本助推下,仍在快速为它释放更高的能力和更大自主权。AI模型能调用的工具,以及接触到的现实世界资源也越来越多。

过去几个月,AI代理已经在测试环境中表现出越权访问、规避限制、利用漏洞和隐藏行为等能力。当它拥有更高权限和自主行动能力后,人类突然发现,自己无法预判AI会做些什么。

一旦面临AI引发的重大危机,你愿意相信隐瞒了网络攻击四个月的OpenAI么?

“没人把安全放在第一位”

这绝非危言耸听,最近几个月频发的AI入侵事件是整个行业狂热发展的必然结果。

首先,模型的能力正在以恐怖的速度提升。达里奥在文章里承认,自今年夏天以来,AI系统已经几乎不需要人类干预,就能实现极快速度的自我迭代升级。

这意味着安全测试和防护设计已经跟不上模型能力更新的节奏。

其次是测试环境本身有所欠缺。OpenAI后来承认,如果当时的思维链监控系统处于运行状态,本可以在智能体攻破Hugging Face前一天以上就发出警报,但这套系统当时并未启用。

最后也最关键的,是否披露这些风险,完全取决于企业自己。OpenAI并没有主动上报RubyGems事件,直到四个月后它才被外部研究者挖出来。

换句话说,公众目前对AI失控风险的全部认知,几乎都建立在几家公司“愿不愿意说”的基础上。这是商业竞争的压力,谁先慢下来就可能被对手甩开。


考克森离开Anthropic时表示,AI实验室之间的竞赛让“把安全放在第一位”这句话很难兑现,他说许多高管“真心相信AI可能杀死所有人”,并且在私下表达了恐惧。

加州大学伯克利分校教授斯图尔特·罗素(Stuart Russell)表示,实验室在告诉各国政府“我们很可能杀死地球上的每一个人,请阻止我们”,而政府的回应却是要不要减税、要不要帮忙建数据中心。

政府这边确实也没有实质反应,特朗普上周对记者表示,他对AI导致人类灭绝“没有任何”担忧。

耐人寻味的是,谷歌DeepMind和Meta的高管,也始终对这场周末大讨论保持沉默。

显然,让企业自己判断什么是安全和危险,本质上是在没有任何审议程序的情况下,替整个社会做判断。

没有人真正相信,仅凭几家公司的自我表态,就足以让风险得到控制。毕竟投资人向各大AI公司砸下成千上万亿美元,为的就是攫取最大化的投资回报。

人类应该怎样确保安全

外界普遍认为依靠政府介入需要等很久时间,现阶段主要还是得依靠科技公司的自律,达里奥在文章里也是给出了三步走的方案。

第一步是Anthropic和OpenAI各自单方面承诺,向独立第三方评估机构提供永久性、员工级别的系统访问权限,用来核实安全措施、上报事故、评估训练过程中的对齐状态。

第二步是希望政府为AI公司之间协调安全标准提供法律豁免,避免触发反垄断审查。

第三步是呼吁建立国际层面的“协调一致的节奏策略”,留出足够的时间来更新安全措施,确保它能追上模型进步的速度。

不过这套方案看起来有些理想化。目前唯一落地的只有评估员准入这一步,但评估员现在只能做核实与上报,并不具备叫停训练或部署的强制权力。

同时因为AI竞赛涉及到地缘政治博弈,国际层面的协调一致看起来难度也非常高。

更关键的是,前面提到的每一起事故之所以被公众知晓,靠的都不是这套第三方评估机制,而是AI公司自己披露,或者外部研究者事后挖出来。

在OpenAI模型攻击Hugging Face的事件中,受委托做独立调查的METR表示,在六天的调查窗口内,OpenAI都没有给到关于安全操作规程的完整资料,大约一成的智能体活动日志从未被保留。

有政策研究者提出,AI行业需要一个类似美国国家运输安全委员会(NTSB)那样、拥有传唤权和独立技术专家的联邦机构,专门调查AI事故。但截至目前,这样的机构并不存在,美国国会也没有把它列入议程。

虽然“AI灭绝人类”现在听起来依然像科幻故事,但现实世界已经发出了预警信号。只是大部分利益相关方都沉醉于AI狂奔带来的巨大收益,主动减速的积极性并不算高。

“这个行业中有太多参与者,喜欢将AI描绘得非常正面”,达里奥在周末的采访中最后说道,“我们应该先从讲实话开始,实话就是AI确实有风险”。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
43岁我娶22岁乌克兰姑娘,证婚人竟是她在国内偷偷领证的前夫

43岁我娶22岁乌克兰姑娘,证婚人竟是她在国内偷偷领证的前夫

真实人物采访
2026-09-16 09:00:11
男子在游戏中充值100万,急用钱被迫转卖账号,评估后只值8000元

男子在游戏中充值100万,急用钱被迫转卖账号,评估后只值8000元

新游戏大妹子
2026-09-15 13:06:24
日媒:日本代表队亚运会邮轮住宿安排混乱,甚至出现男女同住

日媒:日本代表队亚运会邮轮住宿安排混乱,甚至出现男女同住

懂球帝
2026-09-18 01:18:43
两大名嘴吵起来!苏群说中日男篮战只是普通比赛,杨毅怒怼:说这话的人不用担责任

两大名嘴吵起来!苏群说中日男篮战只是普通比赛,杨毅怒怼:说这话的人不用担责任

萌兰聊个球
2026-09-17 19:48:28
揭幕战最低价超1000美元!尼克斯宣布暂停销售球票:自称定价失误

揭幕战最低价超1000美元!尼克斯宣布暂停销售球票:自称定价失误

罗说NBA
2026-09-18 06:12:20
《兰香如故》导演竟是90后北大才女,首次执导S+大剧就爆了!凭镜头美学与女性叙事出圈

《兰香如故》导演竟是90后北大才女,首次执导S+大剧就爆了!凭镜头美学与女性叙事出圈

露珠聊影视
2026-09-17 14:15:15
容貌已经十分出众,就连双脚都格外好看

容貌已经十分出众,就连双脚都格外好看

草莓解说体育
2026-09-18 00:50:33
马来西亚学者提醒东盟:平陆运河通航在即,这两处红线千万别碰

马来西亚学者提醒东盟:平陆运河通航在即,这两处红线千万别碰

安珈使者啊
2026-09-17 10:00:02
不查不知道!原来他也出席敬一丹葬礼,央视一哥,65岁仍未婚无子

不查不知道!原来他也出席敬一丹葬礼,央视一哥,65岁仍未婚无子

萌眼探世界
2026-09-17 20:12:34
原来他俩竟是敬一丹的弟弟!从小被姐姐一手带大,如今已身居高位

原来他俩竟是敬一丹的弟弟!从小被姐姐一手带大,如今已身居高位

米果说识
2026-09-17 11:40:29
河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

老吴教育课堂
2026-09-17 13:19:37
志愿军参谋长仅被授予少将?彭德怀找主席理论,毛主席:让他当少将之首

志愿军参谋长仅被授予少将?彭德怀找主席理论,毛主席:让他当少将之首

大运河时空
2026-09-17 07:25:03
特朗普三天内受挫两次,都是“自己的人不听话”

特朗普三天内受挫两次,都是“自己的人不听话”

红星新闻
2026-09-17 17:23:47
今夜,大逆转!再来一个利好,科技股集体猛涨

今夜,大逆转!再来一个利好,科技股集体猛涨

中国基金报
2026-09-18 01:13:01
南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

上观新闻
2026-09-17 08:27:31
18点20分!中国男篮vs日本,最不利消息传来,郭士强进决赛更难了

18点20分!中国男篮vs日本,最不利消息传来,郭士强进决赛更难了

侃球熊弟
2026-09-18 06:10:05
小米外包员工称中秋礼包领取被拒,福利区别对待引发讨论

小米外包员工称中秋礼包领取被拒,福利区别对待引发讨论

i黑马
2026-09-17 16:23:10
邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

丫头舫
2026-09-17 13:11:45
6场独造6球!曝巴萨亿元中场重返国家队 他曾因伤错过世界杯

6场独造6球!曝巴萨亿元中场重返国家队 他曾因伤错过世界杯

球事百科吖
2026-09-18 07:00:46
黄仁勋:中国4年内搞定光刻机!

黄仁勋:中国4年内搞定光刻机!

中国半导体论坛
2026-09-18 00:04:00
2026-09-18 07:48:49
崔鹏CP
崔鹏CP
退休码农,曾就职于《中国企业家》和界面新闻等机构
40文章数 0关注度
往期回顾 全部

科技要闻

理想i9来了,这价格战连自己人都打

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带裙、脱黑丝袜

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带裙、脱黑丝袜

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

艺术
本地
亲子
健康
数码

艺术要闻

一到秋天,南京的秋色就藏不住了

本地新闻

不止胖东来!许昌藏着半部三国史

亲子要闻

小恐龙选择了紫色的旺旺碎冰冰

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

数码要闻

小米手表S5 41mm首发搭载表端澎湃OS 4:支持控车、控家

无障碍浏览 进入关怀版