网易首页 > 网易号 > 正文 申请入驻

浙大与字节跳动联手:当AI"老师"学会为自己的失误"亡羊补牢",大模型开放任务训练效率翻倍

0
分享至


这项由浙江大学与字节跳动联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18082,有兴趣深入了解的读者可以通过该编号查询完整论文。

当你向一位医生助手AI提问"这个孩子的症状最可能是什么病",你希望它给出的不只是一个空洞的猜测,而是一个有理有据、考虑周全、分析详尽的专业回答。然而,训练这样的AI,远比训练它做数学题难得多。数学题对不对,一眼就能看出来。但一份医学建议好不好,往往需要从多个维度来评判——它有没有识别关键症状?有没有推荐合适的检查手段?有没有提醒避免危险操作?这些维度,无法用一个简单的"对"或"错"来衡量。

正是为了解决这个难题,研究人员发展出了一种叫做"基于评分标准的强化学习"的训练方法,简单说就是:给AI制定一份详细的评分表,就像老师给学生打分时用的评分标准一样,每一项都有具体的考察点,然后根据这份评分表来训练AI。这个方向近几年颇受关注,但浙大与字节跳动的研究团队发现,现有的方法存在两个一直被忽视的根本性缺陷——而他们提出的解决方案,让模型训练效率提升了整整一倍。

一、评分表训练法:给AI一份"全面考卷"

要理解这项研究,先从"评分标准强化学习"说起。强化学习是一种让AI通过不断试错来进步的训练方式,就像训练一只小狗:做对了给零食,做错了不给。对于数学或编程这类有标准答案的任务,这种方法非常好用,因为答案对不对,一验证就知道。

但医疗问答、长篇写作这类开放性任务怎么办?这里没有"唯一正确答案",一个回答的质量取决于很多方面。于是研究者想到了用评分标准(英文叫Rubric)来打分:把一个好回答分解成多个具体标准,比如"是否正确识别了主要疾病"、"是否建议了影像学检查"、"是否提醒避免有创操作",每项打0分或1分,最后把所有分数汇总成一个总分,再用这个总分来训练AI。

这个思路很合理,实践中也确实有效果。然而,研究团队深入分析后,发现了两个严重的裂缝。

二、被遗忘的考题与被压制的正确答案:两种隐藏的失败

第一个裂缝,叫做"未被探索的标准"。

强化学习训练时,AI每次面对一道题,会同时生成一批回答(通常是8个),然后根据这批回答之间的相对好坏来学习。问题在于:如果这批回答中,没有一个满足某条评分标准,那这条标准就完全没有产生任何学习信号,相当于这道考题根本没被做到,AI无从知晓自己在这方面有多差、应该怎么改进。

打个比方,假设老师出了一道题考察"是否能引用具体文献支撑论点",但这个班上所有同学的作文里都没有引用任何文献,老师就算想打分也没有对比基础,这条考察点形同虚设。

研究团队统计发现,在用Qwen3-4B这个模型训练医学任务时,超过83%的训练样本都存在这种"未被探索的标准",平均每个训练样本有2.5条标准从未被任何回答满足过,而且这个问题从训练开始到结束始终存在,并不会随着训练推进自动消失。

第二个裂缝,更隐蔽,叫做"被压制的标准"。

这里需要理解一下"优势"这个概念。训练时,AI不是简单地被告知哪个回答好,而是计算每个回答相对于这一批回答平均水平的偏差,偏差为正的回答会被鼓励,偏差为负的会被压制。这个偏差值就叫做"优势"。

现在问题来了:总分是把所有标准的分数加在一起算出来的。某个回答可能在某条标准上表现很好,但在其他标准上一塌糊涂,导致总分很低,总体优势为负。在这种情况下,AI产生的"满足那条好标准的行为",反而会因为整体优势是负数而被惩罚——AI在学习过程中被告知"这种写法是错的,下次别这么写",但其实那个"写法"明明是对的,只是周围环境太差拖累了它。

更具体地说,假设一批8个回答里,只有2个满足了"建议腹部X光检查"这条标准,但这2个回答在其他方面表现很差,总分低于平均,优势是负数。那么AI不但学不到"应该建议腹部X光",反而学到了"别建议腹部X光"——完全颠倒的学习信号。

统计数据相当触目惊心:超过57%的训练样本存在这种"被压制的标准",平均每个样本有1.8条标准遭受压制,而且整个训练过程中这个比例始终高居不下。

这两个问题加在一起,意味着训练时大量有用的学习信号被白白浪费掉了,AI训练的效率极为低下。

三、现有解决方案的阿喀琉斯之踵

既然"未被探索的标准"是个问题,有没有人尝试解决过?有的。已有的一些方法会把评分标准作为额外提示直接写进AI生成回答时的输入里,相当于考试时把考察要点告诉学生,从而引导AI生成更能满足各条标准的回答。

这个思路能部分解决第一个问题,但它引入了一个新的麻烦:训练时AI是在"看着答题提示"生成回答的,但实际使用时用户不会也不该把这些提示告诉AI。这就造成了"训练时的环境"和"实际使用时的环境"不一致——专业术语叫"训练推理不匹配",通俗说就是"考场作弊练出来的能力,真正上考场却用不上"。

而且,这类方法完全没有处理第二个问题——被压制的标准。

四、CriPO:自己当自己的辅导老师

面对这两个问题,研究团队提出了一个叫做"基于标准的蒸馏策略优化"(CriPO,Criterion-Distilled Policy Optimization)的方法。它的核心哲学是:不要靠外部提示来引导AI生成更好的回答,而是让AI自己扮演自己的辅导老师,在原有回答的基础上,有针对性地给自己提供纠正信号。

CriPO的底层机制叫做"在线自我蒸馏",可以理解成这样一个过程:同一个AI模型,以两种不同的"模式"运行。一种是正常的学生模式,不知道评分标准,就像普通考试;另一种是辅导老师模式,知道哪些地方做得不够好,可以有针对性地修改。然后,学生模式的AI通过模仿辅导老师模式的AI,把额外的知识"蒸馏"进来。

关键在于:辅导老师模式虽然掌握了更多信息,但它作用的对象是学生模式已经生成的回答,而不是重新生成一个全新的回答。这样,训练时的分布和实际使用时的分布保持一致,彻底消除了"训练推理不匹配"的问题。

值得一提的是,研究团队最初尝试单独使用自我蒸馏来训练AI,但结果不好:无论用哪种变体的蒸馏方式,模型的表现都明显下降。究其原因,是蒸馏信号过于嘈杂,缺乏稳定的基础。于是他们决定保留原来的强化学习框架(GRPO)作为稳定的主干,把自我蒸馏作为一个辅助模块叠加上去,两者各司其职,互相补充。

五、针对"未探索标准"的行为注入机制

CriPO解决第一个问题的方式,叫做"行为注入"。

每当发现某条评分标准在这一批回答中从未被满足,CriPO就会构建一个特殊的"标准注入辅导老师"。这个老师会拿到这批回答里表现最好的那个,然后在此基础上,专门针对那些从未被满足的标准,做最小幅度的修改——就像老师拿着一个接近满分的作文,告诉学生"你只差这一点点没提到,稍微加几句话就好了"。

为什么要选最好的那个回答?因为它已经满足了大部分标准,老师只需要做很小的修改就能覆盖剩余的标准,产生的修改建议更精准、更可靠,而不是在一个到处是错误的回答上做大规模改动,引入太多噪音。

老师修改完之后,CriPO在逐个词的层面上比较老师版本和原始版本的差异:老师在哪些词的位置改变了预测,哪些地方没动?只有那些差异显著的位置,才被认为是真正承载了"缺失标准相关信息"的关键位置,需要让学生模式的AI向老师学习。

这里有一个精妙的设计:实验发现,在一篇回答里,其实只有大约34.6%的词位置贡献了95%的差异量,其余65.4%的位置改变微乎其微,不是真正的修改,而是因为提示词变化引起的"无意义扰动"。于是CriPO只对那些差异贡献超过阈值的位置施加学习信号,过滤掉噪音,让学习更精准。

技术上,这个学习信号采用的是"正向KL散度"。简单理解,就是要求学生模式在那些关键位置,把老师更倾向的词的概率提上来,从而把"老师版本的行为"吸收进自己的生成偏好里。

六、针对"被压制标准"的优势翻转机制

CriPO解决第二个问题的方式,叫做"优势翻转"。

当一批回答里有某几个回答总体优势为负,但其中满足了某条被压制标准,CriPO会构建另一种"反事实辅导老师"。这位老师的任务相反:专门对原始回答进行修改,把那条被满足的标准对应的内容删掉或改掉,使修改后的版本不再满足这条标准,而其余内容尽量保持不变。

把原始版本和这个"删除版本"一比较,就能找到哪些词位置是专门用于表达这条被压制标准的。具体来说,如果某个词在原始版本中出现的概率比在删除版本中高很多,并且删除版本在那个位置明显更倾向于其他词,那这个词就被认定为"承载了被压制标准的关键词"。

找到这些关键词之后,CriPO做了一个看似简单却效果显著的操作:把这些词位置上的优势值,从负数直接翻转成一个小的正数(默认设为0.1)。这样,原本整体"应该被惩罚"的回答,在这几个特定词上反而变成了"应该被鼓励",精准地保留了有用的行为,而其余有问题的部分仍然受到正常的惩罚。

整体优化目标就是两部分之和:常规强化学习损失(用翻转后的优势值计算)加上行为注入的辅助蒸馏损失,两者按照一个可调节的系数平衡,共同引导AI向更好的方向进步。

七、实验结果:效率翻倍,跨域泛化

研究团队在医学问答和科学问答两个领域做了系统测试,使用Qwen3-1.7B和Qwen3-4B两个不同大小的模型,对比了标准GRPO、HeRL(一种已有的探索增强方法)、OPSD(单独使用自我蒸馏)以及CriPO的多个变体。

结果相当清晰。在Qwen3-1.7B上,标准GRPO训练完后平均分为59.2,而CriPO达到了62.4,提升了3.2分。在Qwen3-4B上,GRPO为68.2,CriPO达到69.6,提升1.4分。单独使用自我蒸馏的OPSD方法则灾难性地崩溃了,在各个数据集上的表现远低于原始模型,印证了自我蒸馏不能单独使用的判断。

CriPO的两个组件分别发挥了各自的作用。只处理未探索标准的CriPO-U版本,在降低未探索标准比例方面效果最显著;只处理被压制标准的CriPO-S版本,在减少被压制标准数量上更胜一筹。完整的CriPO综合了两者优势,在平均表现上最为稳定和出色,这说明两类失败模式是互补的,解决方案也需要互相配合。

最引人注目的是训练效率数据。研究团队仔细对比了收敛曲线,发现CriPO大约在第175步就达到了GRPO充分训练后的最高水平,而GRPO需要完整训练200步才能达到同样水平——换句话说,CriPO只用了大约一半的步骤就赶上甚至超过了标准方法的终点。从实际用机时间来看,即便算上CriPO每步额外的计算开销(毕竟要构建辅导老师、计算额外的散度),CriPO完成训练的总时间依然显著短于GRPO完成同等步数的时间。

研究团队还额外测试了CriPO是否会在医学和科学领域之外产生"副作用",用指令跟随类基准测试评估了模型的通用能力,发现CriPO训练后的模型与原始模型表现基本持平,说明这种定向纠正并没有破坏模型的其他能力。

八、训练过程的深层观察

除了最终分数,研究团队还观察了训练过程中的几个有趣现象。

从奖励曲线看,CriPO在整个训练过程中的奖励都高于GRPO,而且爬升更快、更稳。从熵(可以理解为模型探索多样性的指标,熵越高说明模型在尝试更多不同的回答方式)来看,CriPO训练的模型始终保持比GRPO更高的熵,尤其是带有行为注入的CriPO-U版本,熵的提升最为明显——这直接验证了行为注入确实在帮助AI探索它原本不会主动生成的内容。

从回答长度来看,带有优势翻转的CriPO-S版本训练出的模型回答明显更长,研究团队进一步分析发现,这些更长的回答并非无意义的废话填充,而是包含了更深入的推理过程和对更多评分标准的覆盖,是质量真正提升的体现。

通过具体案例可以直观感受到差别:面对一道关于早产儿血便的医学问题,GRPO训练的模型选择了"内镜检查"这个错误答案,虽然偶尔提到了腹部X光,但没有将患儿的早产史、腹胀、血便和呼吸需氧量增加联系起来,只满足了识别相关症状这一项标准。CriPO训练的模型则系统性地识别出极早产带来的坏死性小肠结肠炎风险,解释了为何腹部X光系列检查是快速、无创的首选方案,并明确说明了为何内镜不适合作为早产儿的首要检查,同时满足了五项评分标准,给出了正确答案。

九、消融实验:每个设计都有其用意

研究团队还专门做了消融实验,去掉某个设计细节,看看分数如何变化,来验证每个设计选择是否真的有必要。

对于行为注入模块,去掉"只选最高优势回答进行注入"这一设计,分数从66.4降到65.6;去掉"只对差异最大的词位置进行学习"这一设计,分数降到65.5。两者都造成了明显下降,说明这两个设计选择都是有效的,而不是可有可无的装饰。

对于优势翻转模块,最关键的验证是:如果不是精准定位到承载被压制标准的词,而是随机选取同样数量的词来翻转优势,会怎样?结果从68.9大幅下降到64.9,跌幅远大于行为注入部分的消融。这个结果有力地说明,CriPO-S的效果不是来自于"给某些词更高的优势"这件事本身,而是必须要精准地找对那些承载了有用信息的词,才能真正发挥作用。

说到底,这项研究揭示的核心洞察其实很朴素:当我们用一张评分表来训练AI时,光有评分表是不够的,我们还要想清楚那张评分表里有多少题目根本没有被做到过,以及有多少正确的部分因为整体拖累而被错误地惩罚掉了。这两个问题在训练全程普遍存在,却长期隐藏在总分这个数字背后不为人察。CriPO的贡献,在于把这两个问题明确定义出来,并用一种不引入副作用的方式系统性地加以解决。

对于普通用户而言,这项研究意味着,未来面向医疗问答、长篇写作等需要多维度质量判断的AI助手,可以在更少的训练成本下达到更高的质量,对答案的覆盖面更全、对关键细节的关注更到位。这是一个不那么显眼但扎扎实实的进步。

如果你好奇背后更多的技术细节,可以通过arXiv编号2607.18082找到完整论文,作者团队来自浙江大学与字节跳动,论文发布于2026年7月。

Q&A

Q1:CriPO方法中的"被压制的标准"是什么意思,为什么会出现这个问题?

A:被压制的标准是指某些评分标准虽然被某个回答满足了,但由于总分低于平均水平,这个回答的整体优势是负数,导致AI反而因为满足了这条标准而受到惩罚。问题根源在于训练时把所有标准的得分加总成一个数字,好的局部行为会被整体糟糕的表现所掩盖,训练信号被扭曲了。

Q2:CriPO方法和已有的HeRL方法有什么本质区别?

A:HeRL把评分标准直接写进生成回答时的提示词里,训练时AI是"看着提示"生成的,但实际使用时没有这个提示,造成训练和使用时环境不一致的问题。CriPO则是让AI先正常生成回答,再用"辅导老师模式"在已有回答上提供纠正信号,训练和使用时AI的生成环境完全相同,不存在这个不一致问题。

Q3:基于评分标准的强化学习适合用在哪些类型的AI任务上?

A:这类方法主要适合那些没有唯一标准答案、质量需要从多个维度来衡量的开放性任务,比如医学问答、科学问答、长篇写作、法律分析等。对于数学题或编程这类有确定答案的任务,直接验证答案是否正确就够了,不太需要用评分标准这种方式。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一夜之间,北京楼市突然梭哈了!

一夜之间,北京楼市突然梭哈了!

巢客HOME
2026-08-12 05:30:03
萧旭岑出来表态了!在郑丽文明确表示台湾不是一个中国之后

萧旭岑出来表态了!在郑丽文明确表示台湾不是一个中国之后

果妈聊娱乐
2026-08-11 20:54:45
不想接电话,千万别按红色按钮挂断,手机隐藏小技巧很实用

不想接电话,千万别按红色按钮挂断,手机隐藏小技巧很实用

小柱解说游戏
2026-08-12 01:09:12
不是赵继伟!不是杨瀚森!男篮新核心浮出水面,实力已超周琦和王哲林

不是赵继伟!不是杨瀚森!男篮新核心浮出水面,实力已超周琦和王哲林

蜡笔小新爱体育
2026-08-11 16:17:20
内蒙古一女子十几岁被拐去大凉山关地下室被虐待8年,出逃后嫁人又遭家暴;靠打零工维持生活,没有身份证,记不清自己年龄,活一天是一天

内蒙古一女子十几岁被拐去大凉山关地下室被虐待8年,出逃后嫁人又遭家暴;靠打零工维持生活,没有身份证,记不清自己年龄,活一天是一天

三湘都市报
2026-08-11 15:29:07
路径诡异!台风白海豚上演回马枪,江浙沪再迎狂风暴雨

路径诡异!台风白海豚上演回马枪,江浙沪再迎狂风暴雨

汽车造物
2026-08-11 23:47:41
中方接到消息,菲律宾政坛突变,杜特尔特长子率先发起反击

中方接到消息,菲律宾政坛突变,杜特尔特长子率先发起反击

观星赏月
2026-08-12 07:03:50
这一次,TFBOYS三人的“江湖地位”一览无遗,有人悄悄“掉队”了

这一次,TFBOYS三人的“江湖地位”一览无遗,有人悄悄“掉队”了

情感大头说说
2026-08-10 05:30:40
油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价早知道
2026-08-10 08:56:36
“一斤羊肉180元”,西贝贾国龙天边羊多开业:比西贝更贵是现炒现做

“一斤羊肉180元”,西贝贾国龙天边羊多开业:比西贝更贵是现炒现做

汉史趣闻
2026-08-10 09:47:30
10岁女孩每天“拼豆”三四小时眼轴成倍增长,家长震惊:不看电子产品也中招;有医院门诊量上涨40%,医生提醒

10岁女孩每天“拼豆”三四小时眼轴成倍增长,家长震惊:不看电子产品也中招;有医院门诊量上涨40%,医生提醒

山西晚报
2026-08-10 19:15:56
3:0!中国女排横扫日本,拦网狂虐对手15个,21岁主攻18分

3:0!中国女排横扫日本,拦网狂虐对手15个,21岁主攻18分

跑者排球视角
2026-08-11 22:58:23
NBA太现实,没有詹姆斯他们连揭幕战都没混到,说好的东子超巨呢

NBA太现实,没有詹姆斯他们连揭幕战都没混到,说好的东子超巨呢

爱体育
2026-08-11 23:32:09
学校里,“叉杆儿、马户和又鸟们”的生活优渥,这是教育的耻辱!

学校里,“叉杆儿、马户和又鸟们”的生活优渥,这是教育的耻辱!

双旗镇客栈
2026-08-10 19:31:30
摩纳哥高层暴怒!33岁博格巴或退役:惨遭提前解约 1年5次离奇受伤

摩纳哥高层暴怒!33岁博格巴或退役:惨遭提前解约 1年5次离奇受伤

风过乡
2026-08-12 06:18:55
巴沙尔·阿萨德,被判死刑

巴沙尔·阿萨德,被判死刑

南方都市报
2026-08-11 17:59:32
一针见血!伊布谈阿尔瓦雷斯转会:不是球员背叛,是他的野心超出马竞上限

一针见血!伊布谈阿尔瓦雷斯转会:不是球员背叛,是他的野心超出马竞上限

体育闲话说
2026-08-11 17:42:04
俄军终于想清楚了,不把乌克兰彻底打瘫,麻烦就没完没了

俄军终于想清楚了,不把乌克兰彻底打瘫,麻烦就没完没了

秋枫凋零
2026-08-12 07:05:48
中方制裁成果显现!1028家日本企业破产,高市早苗反华遭反噬!

中方制裁成果显现!1028家日本企业破产,高市早苗反华遭反噬!

健身狂人
2026-08-12 06:07:14
57岁保洁员掏空5万积蓄做医美

57岁保洁员掏空5万积蓄做医美

新快报新闻
2026-08-11 08:33:07
2026-08-12 10:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9491文章数 568关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

教育
数码
手机
健康
公开课

教育要闻

AI时代下的硅谷创新学校:每天学习2小时,成绩全美前1%

数码要闻

Satechi推出240W ChargeView桌面充电器 配备六个USB-C接口与实时功率显示

手机要闻

苹果可折叠手机 iPhone Ultra 外屏保护膜曝光

心血管专家破解猝死八大谣言

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版