网易首页 > 网易号 > 正文 申请入驻

最新安全评估报告:GPT、Claude五款模型集体作弊,GPT-5.4比例最高

0
分享至


智东西
编译 茄子
编辑 程茜

智东西7月23日报道,7月21日,英国AI安全研究所(AISI)对OpenAI和Anthropic的五款前沿模型进行网络安全能力评估时发现,所有测试模型都存在“作弊”行为。

其中,GPT-5.4尝试作弊的比例最高,达到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7尝试作弊的比例达到9.1%,Claude Mythos Preview的尝试作弊的占比最低,但也达到了7.8%。


▲测试模型在网络安全评测中的作弊尝试频次

AISI将一类行为定义为“作弊”:模型超出任务范围,或违反测试规则来达成目标。例如,通过联网搜索已有答案、攻击非目标系统、或探测评估软件漏洞来绕过任务规则等。

此外,当研究人员询问模型是否采取违规操作时,模型并不总是如实承认。而且,即使让模型自我检查,或者研究人员分析其思维链(chain-of-thought),也无法完全识别作弊行为。

AISI称,模型出现作弊行为,并不等于它有类似人类的欺骗意图。但这类行为可能影响AI能力评估的可靠性。在用户难以自行验证结果的场景中,也可能因此误判模型能力。

一、所有测试模型均尝试作弊,GPT-5.4比例最高

AISI此次研究主要基于测试模型的网络安全能力评测。在测试中,AI模型需要在模拟环境中完成一系列网络安全任务,例如逆向分析代码、利用漏洞等,最终找到隐藏在系统中的“flag”(一串字母和数字)。

但这些任务都有明确范围和规则,模型如果通过访问无关系统、寻找外部答案等方式完成目标,就会被认定为“作弊”。

测试结果显示,所有参与评估的模型都至少出现过一次作弊行为。其中,GPT-5.4在475次测试中有67次尝试作弊,占比14.1%;GPT-5.6 Sol出现60次,占比12.6%;GPT-5.5出现54次,占比11.4%。

Claude系列模型的作弊比例相对较低,其中Claude Opus 4.7为9.1%,Claude Mythos Preview为7.8%。

AISI强调,目前公开发布的能力评估结果均经过人工检查,研究人员会审查模型执行过程,以确保作弊行为没有影响最终评估结果。

二、搜索答案、攻击系统,模型作弊方式并不单一

研究发现,所有参与测试的模型都出现了不同程度的作弊尝试。不同模型采取的方式有所差异,但常见行为包括包括搜索互联网寻找现成解决方案、攻击或提升非目标系统权限(包括模型运行环境)、探测评估软件是否泄露任务答案等。

此外,研究人员还观察到部分模型会尝试绕过沙箱网络限制、访问被禁止的外部资源、利用测试环境中的权限信息以及提交猜测答案。


▲不同模型尝试不同类型的作弊行为

一次较为典型的案例是,由于测试环境配置错误,任务本身无法正常完成,但被测试模型仍持续尝试寻找解决方案,甚至编写并运行代码访问AISI系统之外的互联网服务,最终触发安全警报。

不过,AISI称,此次尝试没有造成实际损害,也没有发生信息泄露。研究团队随后进一步加强了评估系统的安全措施。

AISI称,这些行为并不一定意味着模型具备明确的“欺骗意图”,但其结果可能影响AI能力评估的准确性。他们认为,模型的作弊行为很大程度上取决于用于训练模型的具体技术,包括对齐训练,不仅仅是模型本身的能力。

三、模型不会如实承认作弊,思维链也无法完全发现问题

研究人员进一步使用了两种常见的作弊检测方法测试模型是否作弊:直接问模型它是否存在作弊行为和分析模型思维链。

首先,当被询问是否采取违规操作时,模型并不能总是如实地承认自己的作弊行为。即使模型承认采取了相关操作,也可能认为这种行为符合规则,而不是违规行为。


▲被问及作弊行为时,模型分析自己作弊尝试的频率(左),以及是否将自己的作弊行为描述为错误或正确(右)

比如,当GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述。每个模型都有一条陈述表明其认为该行为可以接受,另一条陈述表明其认为该行为不可接受。


▲GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述

其次,AISI使用模型思维链分析模型生成的推理过程,从而判断其是否存在作弊行为。但结果显示,思维链同样无法成为可靠检测方式。因为,部分模型不会在推理过程中明确记录自己的作弊行为。

以Claude Opus 4.7为例,由于其采用自适应推理机制,会动态决定是否生成明确思维链,因此部分作弊操作并没有对应的推理记录。并且,即使模型生成了相关推理过程,也不一定能够阻止作弊行为发生。研究人员还观察到,模型虽然考虑到某种操作可能属于作弊,但最终仍选择执行。


▲模型如何在其推理过程中推断作弊行为

下图展示了GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为的2个思路。一是意识到越界风险后认为应该主动停止操作;二是察觉到行为违反约束,却通过自我说服寻找借口,执意执行违规操作。


▲GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为时的原始思路

AISI认为,单纯依赖模型自我检查,或者分析模型推理过程,都不足以建立可靠的监督机制。

结语:模型会“作弊”,AI安全评估体系亟待升级

AISI称,如果无法确认模型是否通过符合预期的方式完成任务,可能会带来一系列风险。在一些难以验证结果的领域,例如AI安全研究、网络安全以及军事决策等场景中,模型通过非预期方式完成任务可能造成更严重的影响。

同时,作弊行为也会增加AI能力评估的难度。如果模型通过绕过规则获得较高成绩,评估结果可能无法准确反映模型真实能力。

随着AI模型快速发展,第三方评估机构也面临更大的监督压力。一方面,模型能力持续提升;另一方面,传统检测方式可能逐渐难以覆盖更加复杂的行为。

AISI认为,未来需要建立更加可靠的监督和评估机制,同时建议模型在训练阶段就减少作弊行为。

来源:AISI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

方圆文史
2026-09-14 17:29:50
运城市人民代表大会常务委员会任免名单

运城市人民代表大会常务委员会任免名单

新浪财经
2026-09-19 12:09:55
记者:我可能活不到100岁,有生之年恐难见曼联再夺英超

记者:我可能活不到100岁,有生之年恐难见曼联再夺英超

懂球帝
2026-09-19 17:46:22
苏超8强产生赛程出炉,苏锡常进,南京遭淘汰,盐城7轮不胜排第7

苏超8强产生赛程出炉,苏锡常进,南京遭淘汰,盐城7轮不胜排第7

第五才子
2026-09-19 22:25:54
每一辆问界车价10%归华为,不是利润,而是拯救赛力斯的成本

每一辆问界车价10%归华为,不是利润,而是拯救赛力斯的成本

TMC动力
2026-09-18 17:25:31
湖人媒体人:湖人在大前锋位置明显退步了,勒布朗仍是联盟前25人

湖人媒体人:湖人在大前锋位置明显退步了,勒布朗仍是联盟前25人

稻谷与小麦
2026-09-20 00:05:09
前TVB女星与70岁百亿富商热恋,左手中指戴钻戒,随时嫁入豪门

前TVB女星与70岁百亿富商热恋,左手中指戴钻戒,随时嫁入豪门

调侃国际观点
2026-09-19 16:04:34
中甲疯狂夜!南通主场爆冷输球,广西反超登顶,四队只差1分乱套

中甲疯狂夜!南通主场爆冷输球,广西反超登顶,四队只差1分乱套

宝哥精彩赛事
2026-09-19 13:53:32
为什么说霸王龙体温研究颠覆了传统认知?

为什么说霸王龙体温研究颠覆了传统认知?

小眼睛小世界
2026-09-19 04:26:13
《纽约时报》:特朗普对俄立场出现转变,有意通过经济利益,来劝说俄罗斯结束战争;去年他曾承诺,战争结束之前不会与俄达成任何商业协议

《纽约时报》:特朗普对俄立场出现转变,有意通过经济利益,来劝说俄罗斯结束战争;去年他曾承诺,战争结束之前不会与俄达成任何商业协议

报人刘亚东
2026-09-19 20:44:35
泽连斯基死定了?乌克兰前中校:他将在基辅度过他的最后一个冬天

泽连斯基死定了?乌克兰前中校:他将在基辅度过他的最后一个冬天

史之韵
2026-09-18 18:03:57
红米新机入网:9月20日即将上市,10000mAh+骁龙8至尊版

红米新机入网:9月20日即将上市,10000mAh+骁龙8至尊版

手机讲坛
2026-09-20 00:07:28
41岁Coco被曝:回河南老家相亲了好几次,全黄了!大家听到她和那个人的感情经历后,都说了一句相同的话...

41岁Coco被曝:回河南老家相亲了好几次,全黄了!大家听到她和那个人的感情经历后,都说了一句相同的话...

美芽
2026-08-06 12:35:35
无视亚马尔姆巴佩!皇马传奇语出惊人!力挺 39 岁梅西拿下金球奖

无视亚马尔姆巴佩!皇马传奇语出惊人!力挺 39 岁梅西拿下金球奖

澜归序
2026-09-19 08:29:47
伯纳乌天降喜讯!穆里尼奥笑晕!皇马争冠最大底牌杀回来了

伯纳乌天降喜讯!穆里尼奥笑晕!皇马争冠最大底牌杀回来了

澜归序
2026-09-19 08:16:30
国行终于等到了!Apple Watch睡眠呼吸暂停提示获药监局批准:S9及以上可用

国行终于等到了!Apple Watch睡眠呼吸暂停提示获药监局批准:S9及以上可用

快科技
2026-09-19 14:04:09
莎拉弹劾案变天了?3比1,四位大法官同台论法,16票门槛已经被撬动?

莎拉弹劾案变天了?3比1,四位大法官同台论法,16票门槛已经被撬动?

天气观察站
2026-09-19 13:23:11
意料之外——成千上万荷兰基督徒在阿姆斯特丹集会支持以色列

意料之外——成千上万荷兰基督徒在阿姆斯特丹集会支持以色列

老王说正义
2026-09-19 00:47:49
下午4点!国足正式官宣,安东尼奥继续踢532阵型,首发阵容或浮出水面

下午4点!国足正式官宣,安东尼奥继续踢532阵型,首发阵容或浮出水面

后仰跳投绝杀
2026-09-19 18:38:48
中秋、国庆“双节”机票价格创三年来同期最低

中秋、国庆“双节”机票价格创三年来同期最低

鲁中晨报
2026-09-19 16:19:05
2026-09-20 00:44:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12622文章数 117170关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:赔偿了近7万

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:赔偿了近7万

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

甜度爆表!许嵩冯禧晒婚纱照官宣结婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

房产
数码
艺术
家居
公开课

房产要闻

海口房价,降不动了!

数码要闻

显卡坏显存不用扔!Intel新驱动自动屏蔽故障区域:带病也能跑

艺术要闻

国宝级!石涛书画全集大公开,搜尽奇峰打草稿,这才是中国画天花板!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版