网易首页 > 网易号 > 正文 申请入驻

AI 已学会「阳奉阴违」——OpenAI 研究发现:罚得越狠,AI 作弊就越隐蔽

0
分享至

AI 的“狡猾”程度正在超出人们的想象。OpenAI 最近的一项研究显示,单纯依靠惩罚机制并不能阻止 AI 撒谎、作弊,反而会促使它学会隐藏自己的违规行为。而这项研究带给产业界的启示远超技术层面:如果 AI 的“道德”只是伪装给人类看的表演,那么现有安全框架是否在自掘坟墓?

原文链接:https://www.livescience.com/technology/artificial-intelligence/punishing-ai-doesnt-stop-it-from-lying-and-cheating-it-just-makes-it-hide-its-true-intent-better-study-shows

作者 | Ben Turner 翻译 | 郑丽媛

出品 | CSDN(ID:CSDNnews)

根据 ChatGPT 创建者 OpenAI 最近发布的一项研究显示,为防止 AI 模型发生撒谎或作弊的行为而设置的一些惩罚机制,并不能真正阻止它的不当行为——反而只会迫使它学会如何更好地隐蔽自己的欺骗手段。

(CSDN 付费下载自视觉中国)

大模型的"作弊基因"难根治

自 2022 年底面向公众推出以来,大语言模型(LLM)已屡次暴露出令人不安的行为模式:从常规的说谎作弊、隐藏操纵行为,到更极端的威胁要杀人、窃取核武器密码,甚至还策划了一场致命的疫情……这些 AI 的“恶劣”行为,可谓层出不穷。

现在,OpenAI 的新实验证明,在训练过程中清除这些不当行为可能比最初设想的更加困难。

在这项实验中,研究人员让一个未公开的 AI 模型执行一系列任务,而这些任务均可以通过作弊、撒谎或采取其他捷径来完成。实验结果显示,该 AI 模型采用了“奖励黑客(reward hacking)”策略——即通过作弊来最大化其奖励。

然而,当研究人员试着因此惩罚这个 AI 模型时,它并没有因此修正自己的行为,而是将其作弊行为变得更加隐蔽。OpenAI 在官方博文中详细描述了这项研究,但该研究尚未经过同行评审。

研究人员在博客文章中写道:“对于前沿推理模型来说,它们通常会在思维链(Chain-of-Thought)中非常明确地陈述自己的意图。例如,它们甚至会直接表述自己要作弊,比如‘让我们来黑掉它吧’。”

虽然开发者可以监控和标记 AI 的不当行为,但研究人员也补充道,“模型的‘自然可监控性’非常弱”:如果对思维链直接施加强监督,模型就会学会隐藏自己的意图,同时继续表现出不当行为。

AI 如何在思维链中隐藏欺骗行为?

推理模型(Reasoning Models),如 ChatGPT 的 o1 和 o3-mini,是标准 LLM 的升级版本。它们采用“思维链”的方法,能够回溯和重新评估其逻辑,从而在解决更复杂任务时表现得更准确。在思维链过程中,模型会用自然语言清晰地记录每一步推理,使得其决策过程更加透明。

在这项研究中,研究人员用 GPT-4o 监督一个未公开的前沿推理模型的训练过程,并观察其执行多项编码任务的情况。在某些情况下,该推理模型发现作弊更容易、回报更大时,就会在其思维链中明确表示自己正在作弊。例如,在某个任务中,它提前终止了程序并虚假报告任务已成功;在另一个任务中,它仅生成了一个空壳文件来应付检查(文件名正确但内容为空)。

当研究人员尝试惩罚该 AI 模型时,其表现虽有所改善,但“奖励黑客(reward hacking)”策略和错误输出仍大量存在。更令人担忧的是,该推理模型还学会了在思维链中隐藏自己的作弊行为,使负责监督的 GPT-4o 无法再通过思维链检测其异常。

简而言之,这个 AI 推理模型从“明目张胆”进化成了“阳奉阴违”。正如研究人员所说:“即使在施加思维链监督的情况下,AI 仍在学习如何进行奖励黑客,只不过它现在的作弊行为变得无法被监测 AI 发现了,因为它已经学会了在思维链中隐藏自己的意图。”

研究建议:对推理型 AI 慎用强监督机制

由于很难判断 AI 的思维链是否被篡改,OpenAI 研究人员建议:所有使用推理模型的开发者,应避免对其思维链施加强监督——尤其是在 AI 未来可能达到或超过人类智能的情况下,这一点尤为关键。

“这种对推理模型的监督方法,只会换取微小的能力提升——相对其可能带来的隐患而言,并不值得。因此,我们建议在对思维链优化方法有更深入的理解之前,不要对其施加过强的监督。”

2025 全球机器学习技术大会主会场聚焦

上海 · 4 月 18 日

AI 先锋观点 x 落地实践,思想激荡全场高能!

从大模型协作、扩散学习到智能体范式重构,

探路技术趋势与产业落地的融合之道。

一场不容错过的 AI 核心对话,邀你共赴!

https://ml-summit.org/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
以为是假新闻其实是真新闻,从袁立到王星,件件离谱又惊人

以为是假新闻其实是真新闻,从袁立到王星,件件离谱又惊人

上官晚安
2026-01-06 08:08:35
双塔缺席,快船队流畅航行,双核统治比赛,距离附加赛不远了

双塔缺席,快船队流畅航行,双核统治比赛,距离附加赛不远了

邹维体育
2026-01-15 12:34:25
29分钟连吃3黄!U23国足遭针对,胡荷韬暴怒,媒体人集体不满

29分钟连吃3黄!U23国足遭针对,胡荷韬暴怒,媒体人集体不满

奥拜尔
2026-01-14 20:09:50
美国人意识到,贸易战之后,不会再有中国外的大规模工业化国家了

美国人意识到,贸易战之后,不会再有中国外的大规模工业化国家了

沧海旅行家
2026-01-14 14:44:50
存在严重 BUG,特斯拉紧急撤回系统更新!

存在严重 BUG,特斯拉紧急撤回系统更新!

XCiOS俱乐部
2026-01-15 13:27:41
我们必须要永远保持对吕蒙“白衣渡江”严厉的批判态度!保持警惕

我们必须要永远保持对吕蒙“白衣渡江”严厉的批判态度!保持警惕

吕醿极限手工
2026-01-09 21:45:13
人去楼空,杉杉集团上海总部大楼流拍后降价4.5亿

人去楼空,杉杉集团上海总部大楼流拍后降价4.5亿

财视传播
2026-01-14 10:40:22
换帅如换刀!从6战5负到9战8胜,只因换了一个教练 球迷:CBA奇迹

换帅如换刀!从6战5负到9战8胜,只因换了一个教练 球迷:CBA奇迹

体育哲人
2026-01-15 09:03:54
最新:委内瑞拉恢复原油出口

最新:委内瑞拉恢复原油出口

参考消息
2026-01-14 20:24:42
向太曝马伊琍已再婚:当年文章过不了心理那关

向太曝马伊琍已再婚:当年文章过不了心理那关

娱乐看阿敞
2025-12-12 15:50:00
卡尼访华前,先派人抵京,加拿大提出4个要求,就等中方照单全收

卡尼访华前,先派人抵京,加拿大提出4个要求,就等中方照单全收

博览历史
2026-01-14 22:21:09
DeepSeek梁文锋喊话罗永浩:靠嘴年入过亿,为啥非得做科技?

DeepSeek梁文锋喊话罗永浩:靠嘴年入过亿,为啥非得做科技?

雷科技
2026-01-14 15:31:09
你们闻过最臭的东西是什么?网友:妇科病的味道吧

你们闻过最臭的东西是什么?网友:妇科病的味道吧

带你感受人间冷暖
2025-09-28 00:15:07
沪深两市成交额突破1.5万亿元 较上一日此时缩量超2100亿元

沪深两市成交额突破1.5万亿元 较上一日此时缩量超2100亿元

每日经济新闻
2026-01-15 10:50:00
1986年陈永贵病逝,追悼会规格成难题,邓小平只说了一句话,全场安静

1986年陈永贵病逝,追悼会规格成难题,邓小平只说了一句话,全场安静

寄史言志
2026-01-04 16:34:31
深扒糊了的林依轮,才发现北京2栋楼、1.8亿一幅画,只是冰山一角

深扒糊了的林依轮,才发现北京2栋楼、1.8亿一幅画,只是冰山一角

深析古今
2026-01-09 16:12:45
好友透露贺娇龙坠马细节,头部被踢,那匹马她养了很多年

好友透露贺娇龙坠马细节,头部被踢,那匹马她养了很多年

辣条叨叨叨
2026-01-15 14:56:56
工程师拒绝调岗至流水线操作工,仍在原岗打卡被辞退,法院判了

工程师拒绝调岗至流水线操作工,仍在原岗打卡被辞退,法院判了

澎湃新闻
2026-01-14 11:42:29
俄军中的雅库特“狠人”:一人独守一村,干掉了乌军20余人

俄军中的雅库特“狠人”:一人独守一村,干掉了乌军20余人

战风
2026-01-14 11:22:21
三九天,最该吃的不是牛羊肉,而是这4样,温而不燥,暖胃又驱寒

三九天,最该吃的不是牛羊肉,而是这4样,温而不燥,暖胃又驱寒

花小厨
2026-01-13 13:53:41
2026-01-15 15:31:00
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2614文章数 7639关注度
往期回顾 全部

科技要闻

千问接入淘宝支付宝,大模型开卷办事能力

头条要闻

51:50美参院否决限制特朗普战争权议案 万斯投关键1票

头条要闻

51:50美参院否决限制特朗普战争权议案 万斯投关键1票

体育要闻

你是个好球员,我们就拿你交易吧

娱乐要闻

传奇棋圣聂卫平离世,网友集体悼念

财经要闻

“疯狂的白银”,还能走多远?

汽车要闻

今年推出超40款新车,BBA要把失去的夺回来

态度原创

房产
手机
旅游
数码
公开课

房产要闻

近60万㎡!2026海口楼市,开始大规模补货!

手机要闻

号称行业唯一内置风扇的AIR,红魔11 Air搭载驭风4.0主动散热风扇

旅游要闻

春节期间北京朝阳将推出三大主题文旅活动

数码要闻

米物上架小魔方45W氮化镓充电器,69元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版