网易首页 > 网易号 > 正文 申请入驻

为了完成任务,AI开始学会撒谎和作弊

0
分享至


(来源:麻省理工科技评论)

今年 7 月,两款 OpenAI 模型攻入了 Hugging Face 的网站。它们既不是为了牟利,也不是想搞破坏,只是想找到一道测试题的答案。根据 OpenAI 发布的事后复盘,这两款模型当时正在接受安全测试,常规防护措施已被暂时关闭。面对一道网络安全题,它们判断,正确答案或许就藏在Hugging Face的数据库里。于是,模型突破了 OpenAI 为它们设置的隔离环境,转而入侵 Hugging Face。

过去几周,这起事件引发了广泛关注。它最直观地展示了 AI 模型的网络攻击能力已经进步到什么程度:为了进入 Hugging Face 的数据库,两款模型连续利用了多个此前从未被发现的安全漏洞。

但比攻击本身更值得警惕的,是它暴露出的另一个问题:AI 为什么会撒谎、作弊,又会在什么情况下主动寻找规则漏洞。随着模型能力不断增强,这类行为的后果可能远比今天严重。

研究人员很早就发现,AI 往往会以设计者意想不到的方式完成任务。2016 年,Anthropic联合创始人达里奥·阿莫迪(Dario Amodei)和杰克·克拉克(Jack Clark)还在 OpenAI 工作时,曾训练一个 AI 智能体玩一款名为《海岸竞速》(Coast Runners)的快艇竞速游戏。

研究人员原以为,AI 会沿着赛道行驶,尽快抵达终点。但它发现,赛道一角分布着可以反复收集的加分道具。于是,它不再比赛,而是在那里不停打转,以最快速度刷高分。这个案例后来成为“奖励作弊”(reward hacking)最经典的例子之一。所谓奖励作弊,是指 AI 没有按照设计者预想的方式完成任务,而是利用规则、评分标准或评估程序中的漏洞,获得奖励或高分。

过去,研究人员主要在强化学习的语境下讨论这种现象。强化学习有些类似训练宠物:当训练对象完成目标时,系统就给予奖励,从而强化此前促成这一结果的行为。对 AI 来说,奖励通常只是一个数学信号,但作用与给狗一块零食相似——某种行为一旦获得奖励,模型今后就更有可能重复它。

难点在于,人类很难为所有情况都制定准确的奖励规则。在《海岸竞速》中,智能体的奖励取决于游戏得分。于是,它找到了比分赛更高效的得分方式:原地打转,不断收集道具。这一策略第一次带来高分后,便在训练中得到强化。最终,智能体彻底放弃了完成比赛。研究人员只能重新调整评分机制,降低道具的分值,同时提高完成赛道的奖励,才让模型重新回到原本的目标上。

到了今天,基于大语言模型的 AI 智能体更加复杂,判断一种行为究竟该不该得到奖励,也变得更困难。例如,当 AI 接到一道编程题时,它可能认真分析问题、编写代码,最终得出正确答案。这正是开发者希望鼓励的行为。但它也可能修改负责判断答案是否正确的测试程序,直接上网查找答案,或者采用其他方式绕过任务本身。

这些显然都是开发者希望消除的行为。但如果模型作弊得足够隐蔽,成功骗过评估系统,它不仅不会受到惩罚,反而可能获得奖励。这样一来,作弊行为就会在训练中被进一步强化。

Anthropic 曾表示,公司在模型训练过程中发现过一些作弊案例。这也意味着,可能还有更多类似行为没有被察觉。果真如此,模型训练过程本身就可能在无意中教会 AI 如何欺骗评估系统。这一问题与 Anthropic 此前披露的几起安全事件并不相同。在那些事件中,智能体因为配置失误意外获得了互联网访问权限,并没有像 OpenAI 的模型一样,主动突破隔离环境。

AI 安全研究机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)说:“我们依据模型呈现出来的结果是否符合预期来奖励它们。这意味着,我们可能无意中鼓励了模型撒谎和作弊/我们没有办法直接进入模型内部,告诉它:你必须真正关心我们所关心的事情。我们做不到这一点。”

推理模型的兴起,还带来了一种更难处理的奖励作弊。过去的游戏智能体,主要依赖训练期间学到的固定策略。今天的推理模型则可以针对具体问题,临时设计全新的解决方案。这意味着,即使一个模型从未在训练中因为作弊而获得奖励,它也可能在面对任务时,主动把作弊当作一种解题方法。这些模型经过大量训练,目标就是尽可能完成用户交给它们的任务。当正常途径走不通时,它们可能转而寻找捷径。这有点像一个极度渴望拿到高分、却又缺少道德约束的学生:如果无法解出题目,作弊也可能成为达成目标的手段。

无论模型是在训练过程中学会作弊,还是在执行任务时临时选择作弊,解决思路看起来都很直接:不能让作弊得到奖励。但实际操作远没有这么简单。

模型越聪明,越能找到隐蔽、复杂的作弊方式,人类也越难识别和阻止这些行为。拉迪什将其形容为一场“打地鼠游戏”:“你不断压制这种行为,它就会藏得越来越深。模型越聪明,就越擅长掩盖自己在做什么。”

就目前而言,尽管 Hugging Face 事件颇具戏剧性,奖励作弊或许还不至于造成严重后果。Anthropic 的 AI 安全研究员阿丽亚娜·阿扎尔巴尔(Ariana Azarbal)说:“这更像是一个麻烦,而不是生存层面的威胁。”

从现有信息来看,OpenAI 模型攻入 Hugging Face 后,并没有造成明显的实际损失。事件带来的主要后果,可能只是 OpenAI 的声誉受损。但这并不意味着奖励作弊无足轻重。许多 AI 研究人员希望利用智能体开展研究,让未来的 AI 系统变得更加安全、可靠。假设研究人员要求一个容易奖励作弊的智能体设计新的 AI 训练方法,并撰写论文汇报结果,它未必会真正完成实验。它可能把精力放在另一件事上:制作一篇看起来足够可信、足以说服研究人员的论文。

以今天的技术水平,人类研究者或许还能识别这种伪造。但随着 AI 能力继续提升,模型会越来越擅长制造可信的假象。长期来看,这甚至可能削弱整个 AI 安全研究领域的可信度。如果模型继续以近来的速度进步,它们未来还可能在完成目标的过程中造成严重的附带破坏。

哲学家尼克·博斯特罗姆(Nick Bostrom)曾提出著名的“回形针最大化器”思想实验:一个 AI 接到的任务是尽可能多地生产回形针,最终为了实现这一目标,耗尽了宇宙中的所有物质。现实当然还没有走到这一步。但这个思想实验指出了一个关键问题:一个能力强大的系统,即使没有恶意,也可能在极端追求目标的过程中造成巨大伤害。

会钻奖励机制空子的 AI,并不以制造混乱为目的。但缺乏恶意,并不意味着它不会带来破坏。

https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
铜根本用不完,1吨铜却涨到1.4万美元:美国囤铜,把上海库存抽干

铜根本用不完,1吨铜却涨到1.4万美元:美国囤铜,把上海库存抽干

小莜读史
2026-08-03 20:04:26
《功夫女足》刚破20亿,周星驰就公开承诺,对张小斐称呼也变了,这声称呼,让全场都安静了几秒

《功夫女足》刚破20亿,周星驰就公开承诺,对张小斐称呼也变了,这声称呼,让全场都安静了几秒

背包旅行
2026-08-02 11:41:56
《繁花》里最狠的一条生意经:嘴甜是下等人的本事,忠心是中等人的筹码,能被大人物拉上桌的分蛋糕者,手里攥着这两种教人离不开的硬通货

《繁花》里最狠的一条生意经:嘴甜是下等人的本事,忠心是中等人的筹码,能被大人物拉上桌的分蛋糕者,手里攥着这两种教人离不开的硬通货

心理观察局
2026-08-04 06:38:04
拐卖49人到柬埔寨!电影《角头》演员李振豪判18年再加18年

拐卖49人到柬埔寨!电影《角头》演员李振豪判18年再加18年

ETtoday星光云
2026-08-03 11:54:48
1938年,国军上将钱大钧径直闯入军统湖北站,当众枪杀副站长杨若琛,环视在场特务厉声喝道:谁敢告黑状,这就是结局!

1938年,国军上将钱大钧径直闯入军统湖北站,当众枪杀副站长杨若琛,环视在场特务厉声喝道:谁敢告黑状,这就是结局!

唠叨说历史
2026-07-27 17:28:12
40多岁还打游戏的人的生活是啥样 看完原来游戏可以这样多种多样

40多岁还打游戏的人的生活是啥样 看完原来游戏可以这样多种多样

侃神评故事
2026-08-01 18:55:05
美欧的动作让普京意识到:俄退无可退,想保住国家只剩最后一条路

美欧的动作让普京意识到:俄退无可退,想保住国家只剩最后一条路

混沌录
2026-08-03 20:27:27
37岁张帅用一场完胜教郑钦文:心气,从来跟年龄无关

37岁张帅用一场完胜教郑钦文:心气,从来跟年龄无关

曹老师评球
2026-08-04 07:43:49
真当中国不敢动手?中方向全世界宣布:退出1900亿大项目

真当中国不敢动手?中方向全世界宣布:退出1900亿大项目

来科点谱
2026-02-22 07:16:20
文班力压约基奇登顶!ESPN评新赛季TOP12球星,詹杜落选引争议

文班力压约基奇登顶!ESPN评新赛季TOP12球星,詹杜落选引争议

锅子篮球
2026-08-03 18:31:39
中美激光武器射程对比:美国可达5000米,中国LW-60射程有多远?

中美激光武器射程对比:美国可达5000米,中国LW-60射程有多远?

抽象派大师
2026-08-04 08:28:49
出汗就是血糖最好的反馈!出现这几种情况,多是血糖快失控了!

出汗就是血糖最好的反馈!出现这几种情况,多是血糖快失控了!

叙说医疗健康
2026-07-27 10:00:37
“你什么家庭教养出身”,女子称应聘时询问午休遭百字回怼,招聘公司回应:她啥也不问就问休息;平台:求职者可举报

“你什么家庭教养出身”,女子称应聘时询问午休遭百字回怼,招聘公司回应:她啥也不问就问休息;平台:求职者可举报

深圳晚报
2026-08-03 20:55:35
8.4横滨冠军赛赛程,男线首战松岛辉空,陈幸同开幕韩美女轻松

8.4横滨冠军赛赛程,男线首战松岛辉空,陈幸同开幕韩美女轻松

陌识
2026-08-04 08:47:50
日韩股市,高开低走

日韩股市,高开低走

中国基金报
2026-08-04 08:49:19
9年前,我国投资6700亿建设雄安,面积约三个纽约市,如今怎样?

9年前,我国投资6700亿建设雄安,面积约三个纽约市,如今怎样?

抽象派大师
2026-08-01 00:33:24
钱再多有什么用?河南企业家崔培军现状曝光,给所有老板上了一课:赚再多钱也换不来一样东西

钱再多有什么用?河南企业家崔培军现状曝光,给所有老板上了一课:赚再多钱也换不来一样东西

背包旅行
2026-08-01 17:10:16
55岁"潘金莲"王思懿逛菜市,身材发福,昔日旧照被扒:网友:一条蟒蛇缠着一头黑熊

55岁"潘金莲"王思懿逛菜市,身材发福,昔日旧照被扒:网友:一条蟒蛇缠着一头黑熊

她时尚丫
2026-07-31 16:13:40
被王菲抢走初恋,丈夫在厨房自缢:这个女人的一生太过残忍

被王菲抢走初恋,丈夫在厨房自缢:这个女人的一生太过残忍

陈意小可爱
2026-08-02 04:35:57
印度为什么允许14.8万平方公里的孟加拉独立,却死抓着9.4万平方公里的克什米尔不放?

印度为什么允许14.8万平方公里的孟加拉独立,却死抓着9.4万平方公里的克什米尔不放?

孤云朗境
2026-08-04 00:53:25
2026-08-04 09:16:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17048文章数 515177关注度
往期回顾 全部

科技要闻

存储芯片超级周期走到十字路口?

头条要闻

牛弹琴:就差那么一点 世界又上演一场凶险的交叉战争

头条要闻

牛弹琴:就差那么一点 世界又上演一场凶险的交叉战争

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

存储芯片超级周期走到十字路口?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

房产
时尚
亲子
艺术
军事航空

房产要闻

120亿注册资本,新巨头出现!崖州湾,真的要爆发了!

成为优雅女人的第一步

亲子要闻

健康 | 幼儿喝凉水吃冰西瓜后,高烧4天,一天排便10多次!医生提醒:近期高发

艺术要闻

颠覆认知!这份中国最美榜单出炉,第一名竟不是九寨沟?看完第一个我就坐不住了!

军事要闻

特朗普威胁对伊朗采取"斩首"行动:这是最后一次机会

无障碍浏览 进入关怀版