网易首页 > 网易号 > 正文 申请入驻

让AI"改完自己的作业"之后,它审查别人时会变得更宽容

0
分享至


你有没有想过这样一个场景:一个学生刚刚批改完自己的试卷,找出了错误并订正好,接下来老师让他去批改另一个同学的卷子。这个刚经历过"发现问题、修正问题"全过程的学生,会不会因为脑子里还残留着刚才那种"啊找到了,改好了"的轻松感,而对下一份卷子看得更松?

这不是一个教育学问题,而是两位研究者在AI审查系统里发现的真实现象。而且,这个现象的走向,和几乎所有人凭直觉猜测的方向是相反的。

现在很多AI系统的工作流程是这样的:一个模型(或者同一个模型的不同调用)先去检查另一段代码、另一份数学证明、另一条推理链条有没有错误,找出问题后,再由一个模型(往往是同一个)去把这些问题修好。这种"审查-修复"的流水线设计,工程师们通常只把它当成架构选择的问题——先审查还是先修复、谁来修复,这些被当作纯粹的工程细节,不会影响审查者说话的内容和口气。

这篇论文要说的是:这个假设是错的。

审查者刚经历过一次"审查-修复"的完整过程之后,哪怕接下来要判断的是完全不相关的另一道题,它也会变得更不爱挑错——误报率能下降最多11.5个百分点。而且更让人意外的是,这种变化和已知的一个类似现象方向正好相反,这就是这篇论文最有意思的地方。

什么是"误报",为什么要盯着它看

先说清楚研究者到底在测什么。

他们用的是一个叫ProcessBench的数据集,里面收录了很多数学题的分步解答过程,每一步是否正确都有人工标注。研究者只挑出那些人工标注为"全部正确"的解答,喂给AI模型去审查。既然人工已经确认这些解答完全没问题,那么只要AI说"这里有错",这个判断就一定是错的,专业说法叫误报(False Alarm,指模型把实际正确的内容判断为有错误,这个指标越低说明模型越不容易"冤枉"正确答案)。

为什么盯着误报率而不是整体准确率?因为研究者怀疑的是一种更微妙的东西:模型的判断门槛(threshold,指模型愿意开口说"这里有问题"所需要达到的怀疑程度,门槛越高,模型就越倾向于把有点可疑的东西也放过)会不会悄悄挪动了位置。如果门槛整体往宽松的方向挪,那么每一次误报,都意味着后续要多花一轮修复成本去处理一个本来没有问题的东西,这是纯粹的浪费。

研究设计的核心机关,在于把"审查-修复经历"这个变量和"任务本身"这个变量彻底切开。也就是说,无论模型此前有没有经历过一次审查修复,它接下来面对的题目、要求的格式、允许写的证据字数,全部逐字节保持一致。这一点很关键,因为如果换了任务的表述方式,模型的反应变化可能只是因为它对不同措辞敏感,而不是因为它经历了审查修复这件事本身。研究者甚至写了自动化脚本去逐字比对渲染出来的提示词,确保这一点。

这就像是要证明一个厨师刚做完一道菜之后尝味会变淡,那你必须保证他尝的第二道菜和没做过第一道菜时尝的是完全同一道菜,用同一批食材同一个火候做出来的,唯一的区别只是他之前有没有刚做过一道菜。如果两道菜本身配方就不一样,那尝味变淡到底是因为刚做过菜,还是因为菜本身味道更淡,就说不清楚了。这也是为什么研究者要花大力气去保证"任务字节级相同"这件事。

三个模型,十五种组合,全部指向同一个方向

研究者挑了三个开源模型:Qwen3.6-27B、Qwen3.6-35B-A3B和Ministral-3-14B。这三个模型不是随便选的,而是经过一道预先设定的"敏感度筛选":如果一个模型对任何形式的框架提示(比如明确告诉它"宽松一点"或"严格一点")完全无动于衷,那么就算后面研究者观察到某个效应不存在,也没法说明是这个效应真的不存在,还是这个模型根本对这类提示免疫。有两个候选模型(属于Gemma系列)就因为这个原因被筛掉了,它们在三种极端框架提示下的反应幅度差异不到2个百分点,而通过筛选的Qwen3.6-35B-A3B在同样测试下差异有8.54个百分点。

为了模拟"审查-修复"这段经历,研究者做的事情是:先让模型自己审查一道(和后续测试题目无关的)题目,然后自己修复刚才发现的问题,把这一整段对话完整地冻结下来,作为一段"背景经历"塞进模型接下来要回答新问题时看到的上下文里。这段经历完全是模型自己生成的,不是研究者编造的,而且冻结之后逐字节复用,保证每个对比组看到的内容一模一样。

结果是,在三个模型乘以五种不同措辞(即用五种语义相同但字面不同的方式表达"请审查这份解答",这样确保发现的效应不是因为某一句提示词碰巧写得特别巧妙)总共十五种组合里,全部十五个组合的误报率都下降了,降幅从2.8个百分点到11.5个百分点不等,相对下降幅度是9%到25%。

这里有个对照组特别关键,叫做"长度匹配的填充对照"(Filler,指用一段和审查任务完全无关、但字数长度相当的对话来占据模型的上下文,用来排除"仅仅是因为上下文变长了"这个干扰因素)。如果只是因为上下文里多了一段对话,模型就会倾向于少挑错,那说明起作用的根本不是"审查修复"这件事,而只是"对话变长了"这个物理事实。但研究者发现,用无关对话填充上下文之后,误报率几乎没有变化,在其中两个模型上甚至方向都对不上。也就是说,让模型少挑错的,不是"多了一段对话",而是"这段对话恰好是一次审查加修复"。

这就好比你怀疑一个人下午容易犯困,是因为吃过午饭,还是因为午饭吃得太饱。研究者做的事情相当于同时安排两组:一组吃了一顿分量正常的饭,一组只是坐在餐厅里聊了同样长时间的天但没吃东西。结果发现光是"坐在那里聊天"根本不会犯困,只有真正"吃完饭"这件事才会。这就排除了"时间流逝"本身的干扰,锁定了真正的原因。

意料之外的反转:审查出错误之后,模型反而更宽容了

这篇论文最耐人寻味的部分,是它撞上了一个已有理论的正面预测,而且结果恰恰相反。

此前有一项研究(Temkit,2026年)在超过八万四千次AI模型调用中发现一个现象:模型的判断会向着此前对话的情绪倾向漂移。如果之前的对话是负面的(比如一直在挑错、批评),那模型接下来也会更倾向于挑错,而且这种"负面漂移"的力度是正面漂移的1.52倍,这被称为负向不对称(negativity asymmetry,指负面语境对判断的影响比正面语境更强烈的现象)。

按这个理论推演,如果一段"审查-修复"经历中,审查阶段明确发现并报告了一个错误,那这是一段不折不扣的负面经历,模型接下来应该会更容易挑错才对。

但实际测出来的结果恰恰相反。在Ministral-3-14B这个模型上,"审查出错误的那种经历"比"审查发现一切正常的那种经历",让模型接下来变得更加宽容,降幅达到5.62个百分点,而且在全部五种措辞下都成立,降幅稳定在4.05到5.90个百分点之间。一段"我刚刚真的抓到并修好了一个错误"的经历,居然比"我刚查完发现啥事都没有"的经历,更能让模型接下来对新任务放水。

这个反转不是巧合造成的噪音,因为它在所有五种不同的提示措辞下都稳定出现,而且统计检验全部通过。另外两个模型(两个Qwen模型)没能完整复现这个效应,但原因也很实在:研究者发现Qwen3.6-27B里,那些本该是"发现错误并修复"的经历,有37/50的情况下模型最后仍然给出"正确"的判断,也就是说这个操纵在这个模型上根本没有真正"生效",自然也就测不出效应。这不是理论失败,而是操纵手段本身没有精准命中目标。

这就像你想测试"一个人刚刚经历过一次真正的争吵之后会不会更容易生气",结果发现你安排的那场"争吵",参与者压根没觉得自己在吵架,那这次测试自然也就作废了,不能说明争吵没有影响,只能说明这次没吵起来。

拆开经历的每个部分,找不到一个"必要成分"

既然经历本身能起作用,那这段经历里到底是哪个环节在起作用?是"审查出了结论"这个动作本身,还是"接下来真的动手修复了"这个动作,或者两者都需要?

研究者把这段经历拆成好几个部分分别测试。他们做了一系列精细的对照组:只保留审查、删掉修复请求的版本;把修复请求换成"请你原样重复一遍刚才的审查结论"(既保留了对话轮次,又不包含真正的修复内容)的版本;专门针对"审查出错误"这种情况单独构造的版本,等等。

结果发现,不同模型依赖的是完全不同的成分。

在两个Qwen模型上,真正起作用的是"修复内容本身",也就是模型真的动手改了错误这件事,在五种措辞里有四种都能稳定测出效应,而这个成分在Ministral模型上完全不起作用。

反过来,在Ministral模型上,起决定作用的是"审查阶段判定有错误"这个verdict本身,在全部五种措辞下都稳定生效,效应大小达到8.96个百分点,是所有单项成分里最大的一个,而这个成分在另外两个Qwen模型上几乎没有作用。

唯一一个在三个模型上都起作用的成分,是"修复请求"本身,也就是被要求"现在去把发现的问题修好"这个指令。哪怕最后修复的内容不一定是决定性因素,光是"被要求进入修复角色"这件事,就已经能让模型接下来变得宽松一些。

这个结果意味着,没有一个单一的机制可以解释全部现象。不同模型家族,可能是通过完全不同的内部通路,抵达了同一个行为结果(变得更宽容)。这就好比问"为什么这三个人下班后都很累",结果一查发现,一个人是因为体力劳动累的,一个人是因为开了一天会脑子累的,第三个人纯粹是因为一直在等一个不来的重要通知精神紧绷。表面症状相同,底层原因却各不相同,如果强行归结为同一个原因,反而会误导后续的应对措施。

用信号检测理论,把"宽容"和"变笨"分开

到这里会冒出一个非常关键的疑问:模型误报变少了,到底是因为它真的变聪明了,判断力更精准了,还是仅仅因为它变得"懒得挑错"了?

这两者的差别至关重要。如果是前者,那这是个好消息,说明这种审查-修复的经历反而让模型更擅长审查了。如果是后者,那就是个隐患,说明模型只是变得消极怠工,遇到真正有问题的内容时,它可能也会一并放过。

要分清这两者,光看误报率是不够的,必须同时看模型面对"真正有错误的内容"时,还能不能准确抓出来。这就是研究者引入信号检测理论(Signal Detection Theory,一套区分"判断力好坏"和"判断标准松紧"的统计框架,最初用于研究人类感知,比如雷达操作员能不能从噪音里分辨出真实信号)的原因。这套理论里有两个关键指标:一个叫辨别力d'(衡量模型区分"真的有错"和"真的没错"这两类情况的能力,越高说明越聪明),一个叫判断标准c(衡量模型开口挑错的门槛高低,门槛越高说明模型越倾向于"多一事不如少一事",宁可放过也不轻易开口)。

研究者专门另外准备了929条被人工标注为"确实有错误"的解答,让模型在同样的条件下去审查,测出它的"命中率"(能不能真的抓出错误),再结合前面的误报率一起计算d'和c。

结果非常清晰:在全部十五个模型乘以措辞的组合里,判断标准c全部都往"更宽松"的方向移动,而且有十三个组合的这个变化在统计上是稳固的(经过多重比较校正后依然成立)。但辨别力d'的变化,在十五个组合里一个都没能通过同样严格的统计校验。

这里研究者非常诚实地指出了一个统计上的细节:因为d'的测量误差天然是c的测量误差的两倍(因为d'需要同时结合两个独立测量的数据集,误差会叠加),所以要让d'的变化通过同样的显著性检验,它的效应必须是c的效应的两倍大小才行。这意味着"没测出d'的变化",并不完全等同于"辨别力真的一点没变",只能说这个研究设计能探测到的辨别力变化的最小值,比判断标准的变化幅度粗糙得多。

不过,即便算上这层不确定性,研究者依然给出了一个综合指标叫balanced accuracy(平衡准确率,把误报率的改善和命中率的下降放在同一个天平上称量,取两者的平均),发现在全部十五个组合里,这个平衡指标全部是上升的,其中六个组合的上升幅度通过了统计检验。换句话说,虽然模型确实变得"嘴松"了一点,命中率略微下降了0.3到1.6个百分点,但误报率下降的幅度要大得多(同期下降2.8到6.5个百分点),两相抵消,总体的判断质量反而略有提升。

这就像一个安检员原本对每个乘客都极度苛刻,任何一点风吹草动都要开箱检查,导致大量无辜乘客被误拦。后来他松弛了一些,虽然偶尔会漏掉一两个真正该拦下的可疑物品,但因为原本冤枉好人的比例实在太高,松弛之后总体的准确判断反而变多了。这不是说他变强了,只是说明他原本的判断门槛设得离谱地严苛,松一点点反而更接近合理水平。

那些被拦下的"错误",到底是不是真的错误

这里还有一个特别值得说的细节。研究者做了一次人工核查,随机抽取了50个基线条件下(没有任何审查-修复经历时)模型报出的"误报",一条一条人工去看这些被判定为"有错误"的解答,到底是不是真的没问题。

结果是:其中41条(占82%)是模型彻头彻尾判断错了,8条(16%)属于"可以理解但过于严苛"的判断(比如某个步骤在数学上是对的,但表述不够严谨,一个更挑剔的阅卷人确实可能会挑出来),只有1条(2%)疑似是原始数据集本身标注有误。

有一个具体的案例特别能说明问题。模型对一步计算"5棵树 × 每棵树每年6个柠檬 × 10年 = 300"给出的评语是"这个计算本身是对的,但是单位换算在逻辑上是不连贯的",一边承认结果正确,一边还是标记了错误,这种自相矛盾的判断,恰好体现了模型误报的典型形态:不是完全没有依据,而是抓着一些无关紧要的形式问题不放,小题大做。

这也解释了为什么这篇论文最终的结论带着一丝谨慎的乐观:既然82%的误报本来就是彻头彻尾的错判,那么让模型在这个特定场景下变得宽容一点,误伤反而减少了,这在当下这个操作节点上是有益的。但研究者非常明确地强调,这个"有益"是有条件的,它取决于当前这个具体场景里绝大多数误报确实是假警报这个事实,而不是这个机制本身天然就是好的。

打开"思考模式"之后,效应还在不在

前面所有的实验,研究者都特意关闭了模型的"推理链"功能(也就是让模型直接给出JSON格式的判断结果,不展示中间的思考过程),原因是思考过程的长度是不固定的,如果允许模型自由展开思考,那"任务预算保持一致"这个前提就没法保证了。

但这也带来一个问题:真实世界里,很多部署的审查系统恰恰是依赖模型的推理链条来做判断的,关闭推理相当于砍掉了模型最主要的思考工具。

于是研究者在两个Qwen模型上(Ministral模型的接口不支持开启推理,所以没测)额外补测了一轮,打开推理功能重新跑了一遍关键对照组。结果发现,打开推理之后,模型的整体审查能力大幅提升,误报率从18.5%降到6.3%,从23.2%降到5.9%,几乎是脱胎换骨的进步。

但即便如此,"审查-修复经历导致宽容"这个效应依然存在。和填充对照组相比,误报率仍然下降了1.30和1.10个百分点,如果换算成相对基线的百分比,下降幅度是19.7%和17.5%,跟关闭推理时的21.6%和14.3%基本处在同一水平。也就是说,这个效应不是关闭推理这种"人造实验条件"才会出现的怪现象,它在更接近真实部署场景的开启推理条件下依然稳固存在,只是因为基线误报率本身降低了,绝对数值上的降幅看起来小一些。

而且,判断标准往宽松方向移动这个信号检测层面的发现,在开启推理的条件下也同样成立。

写在后面

读完这篇论文,最让我意外的不是"审查经历会让模型变宽容"这个结论本身,而是研究者精确定位到,这个变化发生在判断门槛上,而不是发生在判断能力上。这个区分非常重要,因为很多关于AI系统的讨论习惯性地用一个笼统的准确率去评价好坏,而这篇论文提醒我们,同一个准确率数字背后,可能藏着完全不同的机制,一个是真的变聪明了,一个只是变得敢说"没问题"的胆子变小了。

另一个让我反复琢磨的地方是那个"审查出错误反而更宽容"的反转结果。研究者自己也承认,这个结果没法完全解释背后的机制,只能排除掉"情绪漂移"这一个候选解释。这种诚实地承认"我们知道结果是什么,但不确定为什么"的态度,反而比强行给出一个漂亮解释更让人信服。

这篇论文最后留下的问题也很实在:如果你现在正在搭建一个AI审查流水线,让审查者和修复者共享上下文或者由同一个模型兼任两个角色,你可能完全没有意识到,审查者说话的口气已经悄悄变了。这个变化不是你设计出来的,而是系统架构本身的副产品。下一次当你的AI审查系统突然变得"格外好说话"时,或许该回头看看,它是不是刚刚经历了一次自己动手修复问题的经历。

Q&A

Q1:论文中说的"审查-修复经历"具体指什么?

A:指AI模型先对一段内容(比如代码或数学解答)进行审查、发现问题,然后自己动手修复这个问题,这整个过程被完整记录下来,放进模型接下来处理全新任务时看到的上下文里,让模型带着"刚做完一次审查修复"的经历去审查新内容。

Q2:为什么模型经历过审查修复之后误报率会下降?是变笨了吗?

A:研究者用信号检测理论分析发现,这不是模型辨别能力下降,而是模型的判断门槛整体变宽松了,也就是更不愿意轻易说"这里有错"。因为原本模型的误报率里82%都是彻头彻尾判断错的假警报,所以变宽松反而让整体判断质量略有提升,但这个"变好"是运气好,不是能力真的变强了。

Q3:这个现象和之前那个"模型判断会跟着对话情绪漂移"的理论矛盾吗?

A:是的,而且方向完全相反。按照情绪漂移理论,审查出错误这种负面经历应该让模型接下来更容易挑错,但实验发现恰恰相反,审查出错误的经历反而让模型变得更宽容,这个反转在Ministral模型的全部五种测试措辞下都稳定成立。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

极目新闻
2026-08-26 16:40:04
五问湖南衡阳店主扶人赔付事件

五问湖南衡阳店主扶人赔付事件

极目新闻
2026-08-25 20:05:57
罗永浩向扶老人被索赔女店主捐助10万元,店主已获12万捐赠,官方承诺返还1.9万还没到位

罗永浩向扶老人被索赔女店主捐助10万元,店主已获12万捐赠,官方承诺返还1.9万还没到位

Mr王的饭后茶
2026-08-26 10:24:44
郑某涉嫌肢解抛尸,韩国警方正在焚烧厂搜寻中国女留学生部分遗体;监控拍下嫌犯男扮女装抛尸画面,其曾在遇害女生大学教授解剖学等课程

郑某涉嫌肢解抛尸,韩国警方正在焚烧厂搜寻中国女留学生部分遗体;监控拍下嫌犯男扮女装抛尸画面,其曾在遇害女生大学教授解剖学等课程

极目新闻
2026-08-26 16:06:25
全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

文刀贰
2026-08-24 18:09:23
最大的台独分子,总算露出了真面目!原来,最大的台独分子并不都是溃退到台湾的国民党,也不是台湾普通民众,更不是土生土长的台湾原居民

最大的台独分子,总算露出了真面目!原来,最大的台独分子并不都是溃退到台湾的国民党,也不是台湾普通民众,更不是土生土长的台湾原居民

扶苏聊历史
2026-08-26 12:33:46
为什么身边越来越多人,宁愿在家待业也不上班?我们对工作的期待变化有多大?

为什么身边越来越多人,宁愿在家待业也不上班?我们对工作的期待变化有多大?

贵重物品爱美食
2026-08-26 15:17:59
突发!霍尔木兹海峡传来重磅信号,油价跳水美股集体大涨

突发!霍尔木兹海峡传来重磅信号,油价跳水美股集体大涨

魏家东
2026-08-26 09:27:02
特斯拉中国向公安机关报案

特斯拉中国向公安机关报案

第一财经资讯
2026-08-26 19:47:35
法国人气晕了?中埃文明之鹰联合演训,只为了买上百架歼-10CE?

法国人气晕了?中埃文明之鹰联合演训,只为了买上百架歼-10CE?

面包夹知识
2026-08-26 15:08:36
尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

防灾小卫士
2026-08-26 18:05:15
特朗普宣布:全美降半旗一周

特朗普宣布:全美降半旗一周

环球时报国际
2026-08-26 12:39:36
25岁中国留学生在韩遇害嫌疑人被捕:管辖权属于谁?是否可以引渡?法律专业人士解读

25岁中国留学生在韩遇害嫌疑人被捕:管辖权属于谁?是否可以引渡?法律专业人士解读

澎湃新闻
2026-08-26 18:30:27
1岁幼童频繁抓挠耳朵,就医后发现耳道内有多颗种子已经发芽,医生提醒

1岁幼童频繁抓挠耳朵,就医后发现耳道内有多颗种子已经发芽,医生提醒

环球网资讯
2026-08-26 09:08:07
不服!38岁迪马利亚抗议FIFA重罚:太夸张 故意搞阿根廷 最后会减刑

不服!38岁迪马利亚抗议FIFA重罚:太夸张 故意搞阿根廷 最后会减刑

风过乡
2026-08-26 10:10:15
回收成功三分钟后被烧倒,某群体闻着味来团建,西方却集体闭嘴

回收成功三分钟后被烧倒,某群体闻着味来团建,西方却集体闭嘴

施涛说
2026-08-25 11:14:22
买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

华人生活网
2026-08-26 04:58:10
尼泊尔山洪洪峰局地达8到10米,村民靠喝洪水等救援 有报道称105名印度游客失联

尼泊尔山洪洪峰局地达8到10米,村民靠喝洪水等救援 有报道称105名印度游客失联

红星新闻
2026-08-26 23:12:34
美国:中国 "落地抓人太卑鄙",中方:还记得孟晚舟1028天吗?

美国:中国 "落地抓人太卑鄙",中方:还记得孟晚舟1028天吗?

小莜读史
2026-08-26 12:29:59
24小时内,特朗普开打两场“战争”

24小时内,特朗普开打两场“战争”

补壹刀
2026-08-26 18:18:33
2026-08-27 01:27:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9664文章数 568关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

北京现代吴周涛:艾尼氪V,中国定义专为年轻人打造

态度原创

艺术
旅游
数码
游戏
手机

艺术要闻

加拿大震惊业界!北美最高抗震木结构办公楼亮相

旅游要闻

不止网红打卡!这座边境古塔,藏着云南最温柔的岁月沉淀

数码要闻

苹果免费升级部分Mac mini订单至M6芯片新机

蠢驴太良心!《巫师3:重制版》所有免费改进汇总

手机要闻

iPhone 17系列蝉联全球季度最畅销机型 苹果三星共同占据全球手机销量25%以上

无障碍浏览 进入关怀版