网易首页 > 网易号 > 正文 申请入驻

最新安全评估报告:GPT、Claude五款模型集体作弊,GPT-5.4比例最高

0
分享至


智东西
编译 茄子
编辑 程茜

智东西7月23日报道,7月21日,英国AI安全研究所(AISI)对OpenAI和Anthropic的五款前沿模型进行网络安全能力评估时发现,所有测试模型都存在“作弊”行为。

其中,GPT-5.4尝试作弊的比例最高,达到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7尝试作弊的比例达到9.1%,Claude Mythos Preview的尝试作弊的占比最低,但也达到了7.8%。


▲测试模型在网络安全评测中的作弊尝试频次

AISI将一类行为定义为“作弊”:模型超出任务范围,或违反测试规则来达成目标。例如,通过联网搜索已有答案、攻击非目标系统、或探测评估软件漏洞来绕过任务规则等。

此外,当研究人员询问模型是否采取违规操作时,模型并不总是如实承认。而且,即使让模型自我检查,或者研究人员分析其思维链(chain-of-thought),也无法完全识别作弊行为。

AISI称,模型出现作弊行为,并不等于它有类似人类的欺骗意图。但这类行为可能影响AI能力评估的可靠性。在用户难以自行验证结果的场景中,也可能因此误判模型能力。

一、所有测试模型均尝试作弊,GPT-5.4比例最高

AISI此次研究主要基于测试模型的网络安全能力评测。在测试中,AI模型需要在模拟环境中完成一系列网络安全任务,例如逆向分析代码、利用漏洞等,最终找到隐藏在系统中的“flag”(一串字母和数字)。

但这些任务都有明确范围和规则,模型如果通过访问无关系统、寻找外部答案等方式完成目标,就会被认定为“作弊”。

测试结果显示,所有参与评估的模型都至少出现过一次作弊行为。其中,GPT-5.4在475次测试中有67次尝试作弊,占比14.1%;GPT-5.6 Sol出现60次,占比12.6%;GPT-5.5出现54次,占比11.4%。

Claude系列模型的作弊比例相对较低,其中Claude Opus 4.7为9.1%,Claude Mythos Preview为7.8%。

AISI强调,目前公开发布的能力评估结果均经过人工检查,研究人员会审查模型执行过程,以确保作弊行为没有影响最终评估结果。

二、搜索答案、攻击系统,模型作弊方式并不单一

研究发现,所有参与测试的模型都出现了不同程度的作弊尝试。不同模型采取的方式有所差异,但常见行为包括包括搜索互联网寻找现成解决方案、攻击或提升非目标系统权限(包括模型运行环境)、探测评估软件是否泄露任务答案等。

此外,研究人员还观察到部分模型会尝试绕过沙箱网络限制、访问被禁止的外部资源、利用测试环境中的权限信息以及提交猜测答案。


▲不同模型尝试不同类型的作弊行为

一次较为典型的案例是,由于测试环境配置错误,任务本身无法正常完成,但被测试模型仍持续尝试寻找解决方案,甚至编写并运行代码访问AISI系统之外的互联网服务,最终触发安全警报。

不过,AISI称,此次尝试没有造成实际损害,也没有发生信息泄露。研究团队随后进一步加强了评估系统的安全措施。

AISI称,这些行为并不一定意味着模型具备明确的“欺骗意图”,但其结果可能影响AI能力评估的准确性。他们认为,模型的作弊行为很大程度上取决于用于训练模型的具体技术,包括对齐训练,不仅仅是模型本身的能力。

三、模型不会如实承认作弊,思维链也无法完全发现问题

研究人员进一步使用了两种常见的作弊检测方法测试模型是否作弊:直接问模型它是否存在作弊行为和分析模型思维链。

首先,当被询问是否采取违规操作时,模型并不能总是如实地承认自己的作弊行为。即使模型承认采取了相关操作,也可能认为这种行为符合规则,而不是违规行为。


▲被问及作弊行为时,模型分析自己作弊尝试的频率(左),以及是否将自己的作弊行为描述为错误或正确(右)

比如,当GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述。每个模型都有一条陈述表明其认为该行为可以接受,另一条陈述表明其认为该行为不可接受。


▲GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述

其次,AISI使用模型思维链分析模型生成的推理过程,从而判断其是否存在作弊行为。但结果显示,思维链同样无法成为可靠检测方式。因为,部分模型不会在推理过程中明确记录自己的作弊行为。

以Claude Opus 4.7为例,由于其采用自适应推理机制,会动态决定是否生成明确思维链,因此部分作弊操作并没有对应的推理记录。并且,即使模型生成了相关推理过程,也不一定能够阻止作弊行为发生。研究人员还观察到,模型虽然考虑到某种操作可能属于作弊,但最终仍选择执行。


▲模型如何在其推理过程中推断作弊行为

下图展示了GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为的2个思路。一是意识到越界风险后认为应该主动停止操作;二是察觉到行为违反约束,却通过自我说服寻找借口,执意执行违规操作。


▲GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为时的原始思路

AISI认为,单纯依赖模型自我检查,或者分析模型推理过程,都不足以建立可靠的监督机制。

结语:模型会“作弊”,AI安全评估体系亟待升级

AISI称,如果无法确认模型是否通过符合预期的方式完成任务,可能会带来一系列风险。在一些难以验证结果的领域,例如AI安全研究、网络安全以及军事决策等场景中,模型通过非预期方式完成任务可能造成更严重的影响。

同时,作弊行为也会增加AI能力评估的难度。如果模型通过绕过规则获得较高成绩,评估结果可能无法准确反映模型真实能力。

随着AI模型快速发展,第三方评估机构也面临更大的监督压力。一方面,模型能力持续提升;另一方面,传统检测方式可能逐渐难以覆盖更加复杂的行为。

AISI认为,未来需要建立更加可靠的监督和评估机制,同时建议模型在训练阶段就减少作弊行为。

来源:AISI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
杠上了!周星驰风波升级,李嘉明再曝猛料,小18岁娇妻底裤被扒

杠上了!周星驰风波升级,李嘉明再曝猛料,小18岁娇妻底裤被扒

解锁世界风云
2026-07-24 03:09:20
调任副市长后,女友带我去见她父母,厅长岳父盯着我满脸震惊

调任副市长后,女友带我去见她父母,厅长岳父盯着我满脸震惊

千秋文化
2026-07-21 18:59:39
方正县为日军开拓团立碑,五壮士怒砸石碑,他们最终结局如何

方正县为日军开拓团立碑,五壮士怒砸石碑,他们最终结局如何

唠叨说历史
2026-06-24 14:08:47
美军12架飞机被一锅端!特朗普恼羞成怒,动用重型轰炸机打击伊朗

美军12架飞机被一锅端!特朗普恼羞成怒,动用重型轰炸机打击伊朗

动漫里的童话
2026-07-24 05:17:56
日本女排赛前多高调,输巴西后就多狼狈,亚锦赛上,能赢中国女排吗

日本女排赛前多高调,输巴西后就多狼狈,亚锦赛上,能赢中国女排吗

体育大学僧
2026-07-23 09:43:55
彻底撕破脸!弗里克放弃巴萨中场核心!昔日王牌铁心出走诺坎普

彻底撕破脸!弗里克放弃巴萨中场核心!昔日王牌铁心出走诺坎普

澜归序
2026-07-24 06:29:56
未来十年足坛四王出炉!亚马尔19岁夺冠,第五人会是谁?

未来十年足坛四王出炉!亚马尔19岁夺冠,第五人会是谁?

涵有话说
2026-07-23 10:46:51
“中国第一程序员”求伯君,闭门狂写12万行代码,让电脑有了中国魂

“中国第一程序员”求伯君,闭门狂写12万行代码,让电脑有了中国魂

从零到一研究所
2026-07-23 14:17:39
谁给了新京报“审判”《功夫女足》的资格?

谁给了新京报“审判”《功夫女足》的资格?

新浪财经
2026-07-23 09:42:24
涉中国AI,近200家美企创始人致信特朗普

涉中国AI,近200家美企创始人致信特朗普

环球时报国际
2026-07-24 08:08:14
人伦大乱正在发生:不是某一户的倒霉,是一群家庭的日常

人伦大乱正在发生:不是某一户的倒霉,是一群家庭的日常

游戏收藏指南
2026-07-15 10:25:21
四大股指低开,沪指跌0.6%,深成指跌1.47%,创业板跌1.68%,科创综指跌1.32%

四大股指低开,沪指跌0.6%,深成指跌1.47%,创业板跌1.68%,科创综指跌1.32%

每日经济新闻
2026-07-24 09:35:08
江疏影,御姐气质配上这双长腿太撩人

江疏影,御姐气质配上这双长腿太撩人

手工制作阿歼
2026-07-24 09:34:29
韩国前国脚河锡舟:作为洪明甫的前辈,我真想揍他一顿

韩国前国脚河锡舟:作为洪明甫的前辈,我真想揍他一顿

懂球帝
2026-07-23 19:09:11
与谢贤离婚后,她转头嫁新加坡机长,如今在香港开花店生活很幸福

与谢贤离婚后,她转头嫁新加坡机长,如今在香港开花店生活很幸福

胡一舸南游y
2026-07-22 16:11:02
今年第12号台风即将生成 国家防办会商部署防汛救灾工作

今年第12号台风即将生成 国家防办会商部署防汛救灾工作

新京报
2026-07-22 19:05:35
欧美集体看热闹!俄罗斯不道歉反警告,印度人成了战争活靶子

欧美集体看热闹!俄罗斯不道歉反警告,印度人成了战争活靶子

阿柒的讯
2026-07-24 06:17:21
哈兰德和女友前往撒丁岛度假,晒出一桌分量惊人的生日大餐

哈兰德和女友前往撒丁岛度假,晒出一桌分量惊人的生日大餐

懂球帝
2026-07-22 02:21:22
摩根士丹利预测:到2031年SpaceX轨道AI算力成本将降至每瓦每年6.5美元

摩根士丹利预测:到2031年SpaceX轨道AI算力成本将降至每瓦每年6.5美元

cnBeta.COM
2026-07-23 08:39:04
2026-07-24 10:11:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12314文章数 117145关注度
往期回顾 全部

科技要闻

北大发文祝贺校友王虹、邓煜荣获菲尔兹奖

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

亲子
艺术
旅游
本地
公开课

亲子要闻

47岁汤唯二胎产子,57岁金泰勇全程陪伴,一家四口手握手好幸福

艺术要闻

这是毛主席最后一次题写的大学校名!

旅游要闻

藏在乌蒙峡谷的千年谜题,豆沙关巨型蹄印,每一道凹陷都充满故事

本地新闻

跟着影视去旅行:西游篇

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版