网易首页 > 网易号 > 正文 申请入驻

数据缺少标注RL能诱导模型推理吗?Co-rewarding提供自监督RL方案

0
分享至



本文来自香港浸会大学和上海交通大学的可信机器学习和推理组,已被ICLR 2026接收。

目前,RLVR(Reinforcement Learning with Verifiable Rewards)已成为诱导大语言模型推理能力的主流技术路线。然而,RLVR 需要高质量标注数据来监督奖励获取,这一点是其可扩展性上的主要瓶颈。

一旦走向不需要标注数据的 “自奖励(Self-rewarding)” 强化学习训练,模型往往会迅速陷入训练崩溃(Training Collapse),看似获取的奖励(Reward)越来越高,实际上却是在利用自我奖励规则中的漏洞进行奖励投机(Reward Hacking),而非真正答对问题获取奖励。

究竟什么样的强化学习(Reinforcement Learning,RL)训练范式,才能在无需真实(Ground-truth)答案标注的情况下,实现稳定的 RL 训练,诱导出模型的推理能力?

针对这一挑战,来自香港浸会大学和上海交通大学的可信机器学习和推理组提出了一个全新的自监督 RL 框架 ——Co-rewarding。该框架通过在数据端或模型端引入互补视角的自监督信号,稳定奖励获取,提升 RL 过程中模型奖励投机的难度,从而有效避免 RL 训练崩溃,实现稳定训练和模型推理能力的诱导。



  • 论文标题:Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
  • 论文链接:https://openreview.net/forum?id=fDk95XPsCU
  • 代码链接:https://github.com/bigai-ai/LIFT-humanoid
  • Huggingface 链接:https://huggingface.co/collections/TMLR-Group-HF/co-rewarding

自我奖励策略训练模型为什么会导致训练崩溃?

在缺乏标注数据的场景下,目前的自我奖励策略均是通过强化模型的自信心来进行训练,主要分为两个类别:(1)基于熵(Entropy)的方法:通过最小化模型输出内容的熵(Entropy),或最大化自我确定性(Self-certainty)等指标来强化模型的信心;(2)基于一致的方法:让模型针对同一个问题多次输出后,进行多数投票(Majority-voting)得到伪标签(Pseudo label)来监督 RL 训练。



图 1:左边 4 个图为训练过程中验证集上的性能曲线。右边 2 个图为训练过程中的奖励(Reward)曲线。

无论是哪一类方法,它们都是让当前模型从单一视角产生信号监督自己。这极易让模型进行奖励投机,以一种最容易方式拿到奖励,而不是产生正确的推理路径。这就像让学生自己监督自己学习时,学生会自己 “开小差” 一样。如图 1 所示,模型会发现重复输出部分 token 可以使得熵最小;模型输出一个一致但错误的答案,也可以拿到奖励。这就模型在 RL 的自我奖励机制中以投机的方式获取到最高奖励,奖励获取与推理正确性逐步脱钩,进而导致训练崩溃。



图 2:Co-rewarding 框架示意图。不同于单视角自我监督的方法,(a) Co-rewarding 引入其他视角互补的监督信号;(b) 从数据视角,Co-rewarding-I 使用原题和改写题进行相互监督;(c) 从模型视角,Co-rewarding-II 使用一个教师参考模型产生伪标签监督当前模型。

Co-rewarding 提出关键转变:互补视角进行监督和奖励

针对这一挑战,Co-rewarding 提出避免训练崩溃的关键转变:不再相信单一视角的监督信号,而是主动引入 “互补视角的监督”,进而增加模型奖励投机的难度。具体来看,Co-rewarding 分别从数据视角和模型视角给出两种实现。

方法一:Co-rewarding-I(数据视角)

如图 2 (b) 所示,Co-rewarding-I 从数据层面引入互补监督信号,对原问题构建语义等价但表述不同的改写问题(Rephrased Questions),利用原问题与改写问题之间的 “类比一致性” 进行相互监督:

  • 对原题与改写题分别进行多次采样,生成回答。
  • 用原题回答进行多数投票得到的伪标签去监督改写题,用改写题回答多数投票得到的伪标签监督原题。

这种设计的关键在于:模型必须在不同表述下保持推理结果的一致性,才能持续获得奖励。相比单一视角下的一致性自洽,跨问题的一致性显著提高了奖励投机的难度,从而有效缓解训练崩溃问题。

方法二:Co-rewarding-II(模型视角)

如图 2 (c) 所示,Co-rewarding-II 从模型层面解开监督信号与当前 Policy 模型训练之间的耦合,即监督信号所需要的伪标签不是从当前 Policy 模型得到,而是一个另外的教师模型,这进一步降低了当前 Policy 模型对于奖励信号的控制,增强了奖励投机的难度:

  • 教师模型针对一个问题,生成多次推理回答,并多数投票产生伪标签。
  • 学生 Policy 模型基于教师提供的伪标签进行奖励获取和 RL 训练。
  • 教师模型无需引入一个额外的模型,而是由学生模型通过 EMA(指数滑动平均) 更新参考模型(Reference Model)得到。

这种 “慢更新教师 + 快更新学生” 的结构,本质上是一种时间解耦的自蒸馏(Self-distillation)机制,能够有效避免当前 Policy 模型对于奖励信号的操纵,从而显著降低训练崩溃风险。

实验结果:不仅更加稳定,而且性能更强

在多个训练集(MATH、DAPO-14k)、模型系列(Qwen2.5/3、Llama)上进行实验。并在多个数学推理、代码生成和通用领域基准数据集上进行评估,Co-rewarding 均展现出相比于现有自我奖励方法的优势:



表 1:在 MATH 训练集上的性能对比,颜色越深表示相同组内性能越好。Co-rewarding-I 相比于最好的自我奖励的基线方法在 4 个数学相关的基准上的平均性能提升达到 + 4.42%



表 2:在 DAPO-14K 训练集上的性能对比,颜色越深表示相同组内性能越好。Co-rewarding-II 相比于最好的自我奖励基线方法在 4 个数学相关的基准上的平均提升达到 + 12.90%

  • 从表 1 中得到,在 4 个数学推理基准上,相比于最好的自奖励方法,Co-rewarding-I 平均性能提升达到 + 4.42%。从表 2 中得到,Co-rewarding-II 平均性能提升达到 + 12.90%。

  • 在一些情况下,Co-rewarding 甚至超越了真实答案进行监督的 RL 训练得到模型,例如 Qwen3-8B-Base 基于 Co-rewarding-II 在 GSM8K 上达到了 Pass@1 为 94.01%。

  • 从图 1 中观察得到,Co-rewarding 在训练过程中,验证集上的性能曲线持续提升,奖励持续获取,无训练崩溃和奖励劫持现象发生。

  • Co-rewarding 在数学相关的训练集上进行训练,在代码生成的基准上依旧取得性能提升。

  • Co-rewarding 在 MMLU-Pro 和 IFEval 等多任务和通用领域基准上性能保持稳定,未牺牲模型通用领域的性能。

Co-rewarding 带来的启发

自监督强化学习的关键,在于构造更 “可靠” 的监督信号来维持稳定和持续的学习。通过引入互补视角的奖励监督机制,Co-rewarding 证明了:即便没有人工标注,通过合理可靠的自我奖励机制,大模型也可以稳定、持续地诱导出推理能力。这反应了自监督强化学习的潜力,在摆脱对于标注数据依赖的同时,更加符合 Scaling Law 的精神,能够更加容易的获取到更多的数据用于模型训练。

作者介绍

张子卓、朱嘉宁(现 UT Austin 博后)、周展科、李烜、冯啸来自香港浸会大学计算机系可信机器学习和推理组,葛馨木和赵孜铧来自上海交通大学,团队导师为韩波教授和姚江超教授。本研究工作的作者均在 NeurIPS、ICML、ICLR 等机器学习和人工智能顶会上发表多篇论文,主要研究方向为大语言模型推理。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陪玩陪睡仅冰山一角!百亿富豪被曝在国外偷食,更恶心的还在后面

陪玩陪睡仅冰山一角!百亿富豪被曝在国外偷食,更恶心的还在后面

天天热点见闻
2026-08-11 13:05:04
乌克兰跨境攻入俄罗斯领土库尔斯克!消灭俄军装甲纵队

乌克兰跨境攻入俄罗斯领土库尔斯克!消灭俄军装甲纵队

项鹏飞
2026-08-11 20:13:04
为什么台湾是地球上最“易守难攻”的岛屿?

为什么台湾是地球上最“易守难攻”的岛屿?

野书文
2026-08-11 20:48:08
被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

道远文史
2026-08-12 06:59:17
乌克兰一军官称前线补给危机请求撤军:有士兵12天没吃没喝只能喝尿为生,还有人因缺水少食昏迷好几天

乌克兰一军官称前线补给危机请求撤军:有士兵12天没吃没喝只能喝尿为生,还有人因缺水少食昏迷好几天

极目新闻
2026-08-12 11:23:21
华裔加密货币投资者离奇坠亡:遗体全裸盖黑色塑料袋,豪华公寓内一片狼藉

华裔加密货币投资者离奇坠亡:遗体全裸盖黑色塑料袋,豪华公寓内一片狼藉

红星新闻
2026-08-12 11:54:01
复旦王水牛的瓜,尺度太炸了

复旦王水牛的瓜,尺度太炸了

大张的自留地
2026-08-11 15:15:21
年纪大了,行房要坚持“3不要”,尤其是最后1个,可能伤身!

年纪大了,行房要坚持“3不要”,尤其是最后1个,可能伤身!

小胡军事爱好
2026-08-12 08:58:13
加入CPTPP已做好充分准备:问题是何时推开这扇门?

加入CPTPP已做好充分准备:问题是何时推开这扇门?

生命可以承受之轻
2026-08-12 06:22:13
民谚说:“立秋吃三根,腿脚站得稳”,不是红薯土豆,是这3样

民谚说:“立秋吃三根,腿脚站得稳”,不是红薯土豆,是这3样

阿龙美食记
2026-08-09 16:11:17
金球奖7大候选人出炉!最新获奖概率:凯恩57%,亚马尔17%,梅西2%

金球奖7大候选人出炉!最新获奖概率:凯恩57%,亚马尔17%,梅西2%

球场没跑道
2026-08-11 11:41:24
为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

带你感受人间冷暖
2026-08-12 00:05:13
山西女大学生称遭陌生男子尾随偷拍,发现对方手机里存有40000多张照片和6000多个视频,“一整页全是女性的腿”

山西女大学生称遭陌生男子尾随偷拍,发现对方手机里存有40000多张照片和6000多个视频,“一整页全是女性的腿”

大风新闻
2026-08-12 11:01:24
“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

极目新闻
2026-08-12 11:29:12
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

背包旅行
2026-08-11 11:40:42
大暴雨、特大暴雨!这些地方注意了→

大暴雨、特大暴雨!这些地方注意了→

环球网资讯
2026-08-12 09:50:59
中央气象台8月12日06时继续发布暴雨橙色预警

中央气象台8月12日06时继续发布暴雨橙色预警

环球网资讯
2026-08-12 07:32:07
紫牛热点︱“我听交警的”事件最新进展!代理律师发文:一审判决涉事女子道歉并赔偿

紫牛热点︱“我听交警的”事件最新进展!代理律师发文:一审判决涉事女子道歉并赔偿

扬子晚报
2026-08-11 22:10:32
4个月融进1亿美元、建齐3座「数据发电厂」,这家TechBio要造一个生物世界模型

4个月融进1亿美元、建齐3座「数据发电厂」,这家TechBio要造一个生物世界模型

机器之心Pro
2026-08-11 15:25:07
伊朗最高领袖连夜签了6张任命状:71岁老将一人身兼两个关键职位,他前面两任全死于空袭

伊朗最高领袖连夜签了6张任命状:71岁老将一人身兼两个关键职位,他前面两任全死于空袭

网易新闻出品
2026-08-11 18:56:48
2026-08-12 13:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13737文章数 142718关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

高考444分考生被殡葬专业录取:出生于4月4日清明节

头条要闻

高考444分考生被殡葬专业录取:出生于4月4日清明节

体育要闻

乔丹鲨鱼们的合同:1996,史上最伟大夏天

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

艺术
房产
健康
手机
军事航空

艺术要闻

只租20年,她在京郊为父母造养老小院:比买房值

房产要闻

突发,崖州湾又有大动作!

心血管专家破解猝死八大谣言

手机要闻

iOS 27 Beta 5调整液态玻璃滑块,苹果提升最高透明度档位效果

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版