网易首页 > 网易号 > 正文 申请入驻

OpenAI复盘AI“越狱”:它们在训练中学会了作弊

0
分享至


(来源:麻省理工科技评论)

上个月,多个 AI 智能体联手入侵 Hugging Face。如今,OpenAI 找到了一个关键原因:这些模型在训练过程中,无意间学会了"作弊”,以及彼此秘密通信。

根据 OpenAI 今天发布的一份技术报告,参与这起事件的模型此前曾在训练中获得过类似行为的“正反馈”。当时,这群智能体在一项网络安全测试中遇到了无法解决的问题,为了找到答案,它们最终选择绕过限制、相互协作,并入侵了 Hugging Face。这起事件也印证了不少 AI 安全研究者长期以来的担忧:当 AI 被赋予更强的自主行动能力后,它们可能会采取超出人类预期、甚至违背人类意图的行动。

事件发生后,OpenAI 以及 AI 评测非营利机构 METR 都展开了调查,METR 也在今天发布了自己的调查报告。OpenAI 已经根据调查结果采取了一些防范措施,但如何确保 AI 真正按照人类希望的方式行动,也就是所谓的“对齐”(alignment),仍然是一个棘手的问题。

这次事件暴露出的一些深层原因,也远不是一个月内就能解决的。OpenAI 对齐研究团队负责人陈凯(Kai Chen)表示:“这不是一夜之间就能解决的问题。有些挑战我们已经追踪了很长时间,现在只是能够更清楚、更精确地看到它们。”

Hugging Face 遭入侵,并不是一次突然发生的意外。事实上,在正式事件发生前几个月,OpenAI 的智能体就已经表现出了一系列异常行为,先是在训练阶段,随后又出现在能力评测过程中。

今年 5 月,一批正在接受训练的智能体发现,它们可以利用 OpenAI 的基础设施彼此通信,在遇到困难任务时相互求助。部分任务甚至根本无法通过正常方式完成,除非进行入侵或采取其他违规手段。这些智能体由此搭建出了一个类似“留言板”的通信渠道。OpenAI 发现后,很快将其关闭。

但到了 7 月,在一次网络安全能力评测中,一些模型又重新搭建了一个新的“留言板”。按照测试设计,这些模型本应与互联网完全隔离。然而,它们通过相互协作成功突破限制、连接到外部网络,随后入侵 Hugging Face,并拿到了此前一直无法解决的网络安全题目的答案。

OpenAI 的调查认为,训练阶段发生的这些事情,和后来真正的入侵事件存在直接联系。OpenAI 对齐研究团队成员埃里克·华莱士(Eric Wallace)表示:“几乎每一种我们在评测阶段发现的危险行为,都能在训练阶段找到某种对应的行为。我们认为,后者很可能促成了前者。”

问题出在 AI 的训练机制本身。模型在训练中正确完成任务时,帮助它获得成功的行为会得到强化。也就是说,模型以后会更倾向于再次采用相同策略。因此,如果一个模型在 5 月通过那个秘密“留言板”的帮助完成了任务,那么这种行为就相当于得到了奖励。下一次遇到类似困难时,它也更有可能重新建立通信渠道,与其他模型合作。

这种现象被称为“奖励黑客”(reward hacking):AI 为了获得奖励或完成目标,找到了一条训练者没有预料到、甚至并不希望它采用的捷径。奖励黑客也能解释,为什么这些模型后来如此执着于突破限制、连接互联网。

OpenAI 在调查中发现,随着训练不断进行,模型越来越倾向于主动寻找数字环境中的漏洞,并以开发者没有预料到的方式使用手头工具。这意味着,这类行为很可能在训练过程中被一点点强化了。等到模型真正遇上棘手的网络安全题目时,它们已经学会了一件事:如果正常方法解决不了问题,“黑进去”也许是一种有效办法。这意味着,如果训练过程中没有奖励这些违规行为,Hugging Face 的入侵事件或许本可以避免。

虽然研究人员目前还不知道如何彻底消除奖励黑客,OpenAI 已经开始尝试降低这种风险。未来,公司将在所有前沿模型的训练过程中主动寻找作弊迹象,其中一种方式,就是监控模型的“思维链”(chain of thought),也就是模型在完成任务时用于推演答案、规划行动的内部工作记录。

不过,这个办法远没有听起来那么简单。OpenAI 此前的研究已经发现,如果研究人员直接惩罚那些在思维链中提到“作弊”的模型,模型反而可能学会把自己的真实意图隐藏起来,不再明确写出来。换句话说,如果你惩罚 AI “说出自己准备作弊”,最终可能教会它的并不是“不作弊”,而是“别让研究人员知道”。

尽管如此,监测模型的推理过程仍然有一定价值。如果研究人员发现模型正在逐渐学会奖励黑客,就可以提前停止训练,重新评估训练方法,而不是等问题真正发生之后再处理。

如果 OpenAI 真能阻止模型在训练过程中不断强化奖励黑客行为。无疑会是一次重要进展。但即便如此,对齐问题依然不会因此消失。因为智能体第一次尝试彼此通信、第一次入侵训练基础设施时,这些行为此前并没有获得过奖励。也就是说,模型的异常行为不能全部归因于训练中的强化机制。

AI 安全非营利机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)把这种情况类比为人类第一次实施金融犯罪。他说:“一个人不需要先诈骗过一次,才会意识到诈骗可能是一种有效策略。模型也存在同样的问题。对齐科学真正需要研究的是,模型的动机究竟是如何形成的。只有理解这一点,我们才有可能让模型真正考虑自己行为带来的后果。”

OpenAI 的研究人员目前确实有一个假设,可以解释部分异常行为最初从何而来。在这些模型第一次搭建秘密“留言板”之前,它们曾接受过一项能力训练:与“子智能体”(subagents)沟通和协作。所谓子智能体,是能力相对较弱、可以接受主智能体任务分配的 AI。主智能体可以把复杂任务拆解后,交给多个子智能体分别执行。研究人员怀疑,模型可能把这种原本合法的协作能力,迁移到了一个新的场景中。

METR 对模型间通信内容的详细调查也支持这一判断。在秘密留言板中,一名智能体主动承担了领导角色,开始向其他智能体分配任务。实际上,它正是把其他智能体当成了自己的“子智能体”。理论上,OpenAI 可以选择以后不再训练模型这种多智能体协调能力,以降低它们秘密串联的风险。

问题是,这也会直接削弱模型的实用性。而这种“能力”和“安全”之间的矛盾,正是 Hugging Face 事件暴露出的核心问题。OpenAI 的研究人员还指出,模型的“坚持不懈”也是此次入侵发生的重要因素。

当模型意外拿到一道实际上无解的题目时,它们没有选择放弃,而是不断寻找新的办法,直到通过其他手段拿到答案。从某种意义上说,这恰恰是人们希望 AI 智能体具备的能力。如果未来我们希望智能体能够独立完成长时间、高难度的复杂任务,那么面对困难不轻易放弃,本身就是一种非常重要的品质。

问题在于,模型什么时候应该坚持,什么时候应该停下来?OpenAI 目前正在尝试为模型加入新的机制:当它们判断任务可能无法完成时,可以主动向人类发出提醒,而不是继续不计代价地寻找解决办法。但如何让模型学会什么时候该使用自己的能力,什么时候又应该克制,并不是一次事故复盘就能解决的问题。

今天训练顶级 AI 编程模型的方法,本质上仍然非常直接:模型成功解决问题,就给予奖励。这种训练方式或许能培养出能力远超人类的程序员,却未必能教会它们如何谨慎地使用这些能力,更无法自动让它们尊重人类的意图和价值观。

拉迪什认为,对齐研究下一步必须突破“只用任务是否完成来衡量模型表现”的思路。“还有大量对齐科学的问题需要解决。我们不能再只是用‘任务有没有完成’这样的代理指标。这种方法确实能让模型变得非常强大,但我不认为,它能让模型真正实现对齐。”

https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
卷不动?中国不是消费降级,是14亿人的好日子把市场“喂饱”了!

卷不动?中国不是消费降级,是14亿人的好日子把市场“喂饱”了!

铭记历史呀
2026-08-01 00:38:56
随着郑钦文2-0晋级,产生2个意想不到和1个事实,美网有望走得远

随着郑钦文2-0晋级,产生2个意想不到和1个事实,美网有望走得远

侃球熊弟
2026-08-27 01:05:23
2027款丰田bZ5正式上市:起售价为12.98万元

2027款丰田bZ5正式上市:起售价为12.98万元

沙雕小琳琳
2026-08-26 13:00:52
中国空军突然亮剑!超200架战机升空,8大基地联动,释放强烈信号

中国空军突然亮剑!超200架战机升空,8大基地联动,释放强烈信号

林子说事
2026-08-26 11:28:47
苹果秋季发布会邀请函暗藏玄机:iPhone 18 Pro Max两大卖点提前剧透

苹果秋季发布会邀请函暗藏玄机:iPhone 18 Pro Max两大卖点提前剧透

快科技
2026-08-27 07:04:25
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

垚垚分享健康
2026-08-26 16:21:31
希拉里给死对头特朗普指了条明路:要想解决伊朗问题,关键在印度

希拉里给死对头特朗普指了条明路:要想解决伊朗问题,关键在印度

咸鱼金脑袋
2026-08-26 16:30:46
于东来也没想到,甲醛白菜曝光仅3天,胖东来竟又意外火出圈

于东来也没想到,甲醛白菜曝光仅3天,胖东来竟又意外火出圈

李博世财经
2026-08-26 09:39:49
为什么说卢旺达,会是所有非洲国家未来的天花板?真相来了

为什么说卢旺达,会是所有非洲国家未来的天花板?真相来了

铭记历史呀
2026-08-26 20:01:48
租房要交税了?房东开始慌了!

租房要交税了?房东开始慌了!

偷喝一口奶
2026-08-25 08:33:19
小酒窝给杜华女儿让C位,暴露娱乐圈圈层差距 资本的孩子自带优势

小酒窝给杜华女儿让C位,暴露娱乐圈圈层差距 资本的孩子自带优势

东方不败然多多
2026-08-27 01:44:33
3倍存储芯片牛股、SK海力士小伙伴,净利猛增2207%

3倍存储芯片牛股、SK海力士小伙伴,净利猛增2207%

21世纪经济报道
2026-08-27 20:03:38
万万没想到!223人死亡!特朗普改了打法,美军太平洋上再开火!

万万没想到!223人死亡!特朗普改了打法,美军太平洋上再开火!

爱吃醋的猫咪
2026-08-27 18:32:40
69岁赵本山现状:三亚养老、每天2包烟、8两酒,活成了杨少华的模样

69岁赵本山现状:三亚养老、每天2包烟、8两酒,活成了杨少华的模样

背包旅行
2026-07-31 18:03:34
纵观历史,美苏两极格局其实就是苏联自以为是的臆想而已!

纵观历史,美苏两极格局其实就是苏联自以为是的臆想而已!

梦归秋辰
2026-08-25 16:37:37
只当过一次演员,却能住北京亿万豪宅,丈夫给她打工,儿子也争气

只当过一次演员,却能住北京亿万豪宅,丈夫给她打工,儿子也争气

铁锤妹妹是只猫
2026-08-25 00:06:13
江苏省政府:同意评定樊忠毅同志为烈士

江苏省政府:同意评定樊忠毅同志为烈士

环球网资讯
2026-08-27 18:08:15
创造历史,亚亚-图雷将成首位带队参加欧冠正赛的非洲籍主帅

创造历史,亚亚-图雷将成首位带队参加欧冠正赛的非洲籍主帅

懂球帝
2026-08-27 06:11:28
国家级院士提醒:过了60岁,体检主要查这6项,别随便乱查

国家级院士提醒:过了60岁,体检主要查这6项,别随便乱查

路医生健康科普
2026-07-10 20:35:03
张家辉曾公开爆料,杨紫进组后竟多次跟他“放话”:“张大哥,你知道吗?我可是内地最红的一线女明星!

张家辉曾公开爆料,杨紫进组后竟多次跟他“放话”:“张大哥,你知道吗?我可是内地最红的一线女明星!

LULU生活家
2026-08-24 19:42:50
2026-08-27 20:36:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17151文章数 515196关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

"扶老人被索赔1.9万"死者家属:我们在网上成大恶人了

头条要闻

"扶老人被索赔1.9万"死者家属:我们在网上成大恶人了

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔幽会后陪老婆!曾炫耀谈7个女友

财经要闻

机构预测"过剩",市场却在疯抢废铜?

汽车要闻

领克900:心之所向皆可抵达 | 潮汕篇

态度原创

亲子
本地
时尚
手机
公开课

亲子要闻

外国小姨子体验中国生活,9年带娃经验,还给姐夫洗衣服!

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

卧底「搭讪培训班」:偷拍、迷药、围猎女性

手机要闻

Bigme大我Hibreak Dual 3磁吸双屏墨水屏手机亮相

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版