网易首页 > 网易号 > 正文 申请入驻

RL微调,关键在前10%奖励!基于评分准则,Scale AI等提出新方法

0
分享至

新智元报道

编辑:KingHZ

【新智元导读】大模型强化学习总是「用力过猛」?Scale AI联合UCLA、芝加哥大学的研究团队提出了一种基于评分准则(rubric)的奖励建模新方法,从理论和实验两个维度证明:要想让大模型对齐效果好,关键在于准确区分「优秀」和「卓越」的回答。这项研究不仅揭示了奖励过度优化的根源,还提供了实用的解决方案。

让大模型按照人类意图行事,一直是AI领域的核心挑战。目前主流的强化学习微调(RFT)方法虽然有效,但存在一个致命弱点:奖励过度优化(reward over-optimization)。

奖励过度优化是大模型对齐的「阿喀琉斯之踵」。

简单来说,就是模型学会了「钻空子」——它们不是真正变得更好,而是学会了如何在奖励模型上刷高分,实际输出质量反而下降。这就像考试时学生死记硬背标准答案来应付老师,而不是真正理解知识。

Scale AI的最新研究直击这一痛点,从理论层面揭示了问题的根源,并提出了创新的解决方案。

论文链接:https://arxiv.org/abs/2509.21500

代码开源:https://github.com/Jun-Kai-Zhang/rubrics

数据开源:https://huggingface.co/datasets/JunkaiZ/Rubrics

理论突破

高分区才是关键战场

来自Scale AI、UCLA和芝加哥大学的研究团队,首次从理论上给出了明确答案:

奖励过度优化的根源,在于奖励模型在高分区的不准确性

  • 高奖励区域的准确性决定一切:当代理奖励在高分区域出现偏差时,模型性能会随着训练进程急剧崩溃;而低分区域的误差影响微乎其微。

  • 只需要准确识别Top 2响应:即使只能正确排序前10%的优质回答,模型性能就能接近最优,效果几乎与完美奖励模型相当。

这意味着:我们不需要在所有回复上都准确,需要准确区分「优秀」和「卓越」!

方法创新

用评分准则捕捉「卓越」

理论清晰了,但新问题来了:如何获得高质量样本来训练奖励模型?这里存在一个悖论:

从基础模型采样?太低效了——高分样本本来就稀少。

用更强模型生成?又会引入分布偏移——奖励模型可能学到的是表面特征而非真实能力。

研究团队提出了基于评分准则(rubric)的解决方案。评分准则是一组衡量回答好坏的明确准则,每个准则都有相应权重。比如对于医疗诊断问题,可能包括:

高权重准则:「正确识别疾病」「标明紧急程度」

低权重准则:「提及治疗方案」

Rubric的核心优势在于

  • 将评分分解为多个可验证的具体标准

  • 每个标准都是二元判断(满足/不满足)

  • 最终得分是满足标准的加权平均

更重要的是,Rubric天然具有分布不变性——它关注的是回复本身的质量特征,而非生成来源。

两大原则:如何构建有效的Rubric

为了让Rubric真正捕捉高分区的差异,研究团队提出两大关键原则:

  • 原则1:区分「优秀」与「卓越」通过对比两个都很好的回答,识别它们的细微差异,将这些差异编码为新的评分准则。

  • 原则2:在多样化的优质回答中寻找差异扩大候选池,从16个顶尖模型中采样,确保覆盖不同的优秀回答模式。

实验验证

全面碾压基线方法

研究在通用和医疗两个领域进行了大规模实验:

性能提升明显

  • 使用优质样本改进的评分准则,胜率从31.3%提升至39.7%

  • 医疗领域的HealthBench得分从0.3004提升至0.3513

有效缓解奖励过度优化
  • 初始评分准则训练的模型在60步后性能急剧下降

  • 改进后的评分准则将崩溃点推迟到160步,延长了近3倍

高奖励区域准确率大幅提升

评分准则改进后,在高奖励区域的准确率提升显著,而低奖励区域的准确率基本不变,完美验证了理论预测。

质的飞跃:优秀样本带来更深层的改进

研究团队还分析了不同质量样本带来的Rubric改进类型:

优秀样本驱动的改进

  • 添加惩罚项,避免明显错误

  • 放宽过于严格的标准

  • 纠正错误或对齐预期标准

卓越样本驱动的改进

  • 将复杂标准分解为子标准

  • 增强验证和证据标准

  • 明确范围、边界和约束

  • 纳入风险分析和安全约束

以医疗案例为例:

初始Rubric只要求「提到正确诊断」和「说明紧急性」——两个优秀回复都满足。

精炼后的Rubric新增标准:「明确指出需要紧急影像学检查(如增强CT或MRI/MRV)来确认诊断」,成功区分出了更好的那个。

这就是质的飞跃:从表面判断到深层验证标准。

产业意义与展望

这项研究为大模型对齐提供了全新视角:

  1. 理论指导实践:明确了奖励建模的优化方向——聚焦高奖励区域

  2. 方法可操作性强:基于评分准则的方法易于实施和解释

  3. 领域适应性好:在医疗等专业领域表现尤其出色

当然,研究也指出了当前的局限:

  • 简单的加权平均可能不是最优的分数聚合方式

对于大模型从业者来说,这项工作提供了一个清晰的方向:

不要试图在所有地方都完美,专注于准确区分顶尖回复,这才是对齐的关键。

参考资料:

https://arxiv.org/abs/2509.21500

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
商业地震!41岁老詹太恐怖!票房暴跌!湖人后悔吗?

商业地震!41岁老詹太恐怖!票房暴跌!湖人后悔吗?

篮球盛世
2026-07-23 16:38:54
中美俄意见一致,宁可让日本从地球上消失,也坚决不允许它拥核!

中美俄意见一致,宁可让日本从地球上消失,也坚决不允许它拥核!

兵鉴史
2026-07-21 18:43:52
不只有芯片交易与投资承诺:AMD将在内部应用Anthropic Claude

不只有芯片交易与投资承诺:AMD将在内部应用Anthropic Claude

全栈遛狗员
2026-07-23 09:30:51
签了签了!3年1500万!凯尔特人续约无眉大侠

签了签了!3年1500万!凯尔特人续约无眉大侠

篮球教学论坛
2026-07-24 10:03:33
心理学发现:好多人都搞反了,不是你有钱,才生孩子,而是普通人家不生孩子,人生的后半截都撑不下去

心理学发现:好多人都搞反了,不是你有钱,才生孩子,而是普通人家不生孩子,人生的后半截都撑不下去

心理观察局
2026-07-24 07:06:03
格里兹曼首秀破门 莱万哑火 梅西缺阵迈阿密仍赢球

格里兹曼首秀破门 莱万哑火 梅西缺阵迈阿密仍赢球

赛场名场面
2026-07-24 01:47:58
德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

山河路口
2026-07-22 12:33:55
贾平凹被批“阉割红色文化”,莫言被移花接木成“秦桧跪像”,这是“文革”重来的前奏吗?

贾平凹被批“阉割红色文化”,莫言被移花接木成“秦桧跪像”,这是“文革”重来的前奏吗?

壹家言
2026-07-22 13:07:39
詹姆斯+浓眉!被拒!詹姆斯的下家,基本确定了...

詹姆斯+浓眉!被拒!詹姆斯的下家,基本确定了...

詹姆斯吧
2026-07-23 15:15:29
鲁比奥在马尼拉突然变脸:逢中必反的鹰派,怎么开始说软话了?

鲁比奥在马尼拉突然变脸:逢中必反的鹰派,怎么开始说软话了?

菁菁子衿
2026-07-23 12:32:25
极目深度丨七旬老母一审被判替女还债百万,通话录音成为呈堂证供,当事人喊冤“那是女儿捏着嗓子冒充我”,二审未宣判

极目深度丨七旬老母一审被判替女还债百万,通话录音成为呈堂证供,当事人喊冤“那是女儿捏着嗓子冒充我”,二审未宣判

极目新闻
2026-07-23 16:40:07
中国外长缺席,日本外相被王毅晾一边,中方早看穿了他的小心思

中国外长缺席,日本外相被王毅晾一边,中方早看穿了他的小心思

健身狂人
2026-07-23 18:35:18
惨烈的校招现状:年薪600万的博士抢不到,月薪6千的计算机没人要

惨烈的校招现状:年薪600万的博士抢不到,月薪6千的计算机没人要

慧翔百科
2026-07-22 17:45:42
3大功勋老将让贤后,国足还有1人该主动让位,邵佳一最好别再用他

3大功勋老将让贤后,国足还有1人该主动让位,邵佳一最好别再用他

零度眼看球
2026-07-24 07:14:18
李嘉诚撤了,长和高层巨震

李嘉诚撤了,长和高层巨震

蒋东文
2026-07-23 20:06:59
29.5万!奥迪新车正式公布,年轻人的第一款豪华车来了

29.5万!奥迪新车正式公布,年轻人的第一款豪华车来了

科技堡垒
2026-07-23 12:02:17
哀悼!南开大学张义德教授逝世

哀悼!南开大学张义德教授逝世

双一流高校
2026-07-24 01:43:44
查了下王菲的资产,不查不知道,一查真得闭嘴了。

查了下王菲的资产,不查不知道,一查真得闭嘴了。

静若梨花
2026-07-22 11:20:40
心理学上说:那些敢吵架、敢冲突、敢强势、敢不礼貌、敢不要脸的人,才是真正有能力的人,他们有冲突的能力,更有收拾残局的能力

心理学上说:那些敢吵架、敢冲突、敢强势、敢不礼貌、敢不要脸的人,才是真正有能力的人,他们有冲突的能力,更有收拾残局的能力

心理观察局
2026-07-24 06:55:09
自食恶果!印尼逼走中企选择印度,合同签了不到10天,报应来了

自食恶果!印尼逼走中企选择印度,合同签了不到10天,报应来了

近代风云传
2026-07-22 23:19:07
2026-07-24 10:56:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15773文章数 66966关注度
往期回顾 全部

科技要闻

北大发文祝贺校友王虹、邓煜荣获菲尔兹奖

头条要闻

菲尔兹奖得主王虹:16岁就考入北大 曾常被"挂黑板"

头条要闻

菲尔兹奖得主王虹:16岁就考入北大 曾常被"挂黑板"

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

陈妍希姐姐到场追星张凌赫

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

本地
艺术
数码
旅游
公开课

本地新闻

跟着影视去旅行:西游篇

艺术要闻

这是毛主席最后一次题写的大学校名!

数码要闻

必看!2026垃圾处理器推荐5款主流机型对比

旅游要闻

岱庙听雨 一院烟雨消尽盛夏尘嚣

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版