网易首页 > 网易号 > 正文 申请入驻

训练奖励太稀疏?港中文联合美团给Agent加上「过程分」

0
分享至



在很多大模型和 Agent 的训练里,最常见的一种做法就是只看结果:最后答案对了就给奖励,错了就当 0 分。

在单轮问答里,这样「只看结果」还勉强能用;可一旦换成 Agent 这种要多轮对话、搜索、刷网页、写代码、读文件的长链任务,就变成用一个 bit 去概括一整条复杂轨迹。

结果就是:差一点就做成功的过程,和从第一步就跑偏的过程,在奖励眼里没区别;训练看不出哪种失败更有价值,手写规则或人工细粒度打分又很难覆盖开放环境、多模态这些复杂情况。

港中文和美团在这篇工作里,盯上的就是这个核心矛盾:

Agent 需要长程、细粒度的反馈,但我们手里大多只有终局对错这样的粗粒度奖励。



  • 论文标题:Exploring Reasoning Reward Model for Agents
  • 论文链接:https://arxiv.org/pdf/2601.22154
  • 项目地址:https://github.com/kxfan2002/Reagent

为了解决这个矛盾,作者先造了一个「懂推理、看得懂工具调用」的评审器,给 Agent 的整条轨迹打「过程分」和「评语」,再把这份反馈喂回训练。

这也是 Reagent 框架的核心出发点:让 Agent 不再只看结果,而是也要为自己的思考和工具调用过程负责。

给 Agent 的思路打个分

这篇工作最重要的一步,就是不再只看 Agent 最后有没有把题做对,而是开始认真给整个思考过程打分。

研究团队先搭了一套专门面向智能体的「思考评分类」数据:里面收集了各种真实的 Agent 轨迹,有推理顺畅但执行失误的,有一路乱猜却刚好蒙对的,也有工具用得乱七八糟的。每一条轨迹,都被标注成一份「阅卷意见」,既指出思路哪里站得住脚、哪里明显跑偏,也给出一个 0~1 之间的整体分数。

基于这套数据,他们训练了一个专门的「思考评分模型」——Agent-RRM。它不会只看最后一行答案,而是把整个过程从头看到尾,然后输出三样东西:一段内部分析、一小段给 Agent 看的批评意见,再加上一个综合分数。

举个简单的例子:

  • 两条轨迹最后都答对了,但一条逻辑跳跃严重、工具乱用,只是误打误撞到达正确答案,那 Agent-RRM 可能只给个 0.3;
  • 另一条从一开始就分析清楚、什么时候该搜、什么时候该点进网页、怎么利用信息都说得明明白白,这种思路就可能拿到 0.9。

就像老师改卷,不是只看「A/B/C/D」选了啥,还会看你中间的演算过程,给「过程分」。这一招的目标很明确:

教会 Agent「怎么想」「怎么用工具」,而不是教它「怎么猜对答案」。

统一文本批评和奖励信号:Reagent 框架

有了会打「思维分」的 Agent-RRM,还要想清楚怎么把这些反馈喂回给 Agent。这就是 Reagent 框架要解决的事情:把「文字点评」和「分数奖励」统一起来,用在智能体训练里。



作者设计了三种用法,可以理解成三档「加持程度」:

① 只加点评,不改模型(Reagent-C)

最轻的一种:不动 Agent 参数,只在推理时多一步「听老师讲评」。

大致流程就是:Agent 先做一遍题,Agent-RRM 看完给一小段 critique,指出关键问题,然后让 Agent 在这段点评的基础上重做一遍。这相当于给任何现成的大模型,外挂一个「老师帮你看一眼再交卷」的过程。

② 给奖励加一条「过程分」(Reagent-R)

再往上走一步,就是把 Agent-RRM 打出来的分数,当成额外奖励加进来。

以前的训练只看「做对 / 做错」那一分,现在变成「结果对错 + 过程好坏」两条线一起算:哪怕最后没完全做对,只要思路清晰、工具用得合理,也不会被当作垃圾样本一票否决。这对长链、多工具的任务特别重要,可以缓解那种「一不小心就全是 0 分」的奖励稀疏问题。

③ 把「第一次想」和「批评后再想」一起训(Reagent-U)

最强的一档,是这篇文章重点强调的 Reagent-U。它一口气把两种反馈都用上:

  • 一方面,让 Agent 学会第一次就少犯低级错误;
  • 另一方面,也教它「听完批评以后,怎样更聪明地改答案」。

训练时,同一个问题会有「首答」和「听完点评后的再答」两条轨迹,它们都拿到「结果奖励 + 过程分数」,一起放进同一个训练循环里优化。这样做的好处是:模型不会只在某一种模式上刷分,而是整体上把「想清楚」「用好工具」「能根据反馈修正自己」这几件事,一起学进去。

实际部署时,Reagent-U 又不用再依赖外部的 Agent-RRM 提点评,直接就能像普通 Agent 一样用 —— 那些「老师改卷时说过的话」,已经被揉进模型参数里了。

这套设计带来了什么提升?

在实验里,作者主要看了三件事:文字点评本身有没有用、过程分数能不能帮 RL 学得更好、统一之后是不是有效提升。





先看最轻量的那种:只加一段文本点评、不改模型参数。结果表明,在不少数学和搜索任务上,「听完一段 Agent-RRM 的批评再答一次」,确实能稳定把正确率拉上去。

再把过程分数加进训练里之后,Agent 不是只会去迎合最后那一个对错信号,而是更愿意走那些「虽然这次没完全做成,但整体思路是对的」的方向。

最后,当文本批评和奖励分数在 Reagent-U 里统一起来时,提升就更直观了:

在 GAIA 这个通用 Agent 基准的文本子集上,基于 8B 模型的 Reagent-U,可以把平均成绩拉到43.7%,基本追上甚至部分超过了一些更大参数量的开源 Agent。在 WebWalkerQA、HLE、xbench 等其他复杂任务上,也普遍比「只看终局奖励」的版本更稳,更不容易被「瞎蒙对」或者「瞎忙活」带偏。

作者还测试了模型在 GAIA 全集上的表现,面对多模态的通用 agent 任务,Reagent-U 也依然能打。



港中文联合美团这套 Reagent 框架,把「老师给过程打分」这件事,真正搬进了 Agent 训练里。结果证明,只要能看懂、能评价思考过程,8B 级别的 Agent 也有机会在很多复杂任务上打出和大模型一样好看的成绩单。

更多细节请参考论文原文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大跳水!Shams:詹姆斯若加盟勇骑热等任意一队 都只能拿老将底薪

大跳水!Shams:詹姆斯若加盟勇骑热等任意一队 都只能拿老将底薪

醉卧浮生
2026-07-24 08:34:23
以色列曝光12名加沙球星,甩出铁证怒揭加沙体坛老底:全参与过恐怖袭击?

以色列曝光12名加沙球星,甩出铁证怒揭加沙体坛老底:全参与过恐怖袭击?

全球吃瓜现场
2026-07-23 12:03:30
扎心了!“我生君未富”,一博主举出大厂大量现实案例,评论沸腾

扎心了!“我生君未富”,一博主举出大厂大量现实案例,评论沸腾

另子维爱读史
2026-07-23 20:38:26
名记:詹姆斯没在等待浓眉交易发生再做决定

名记:詹姆斯没在等待浓眉交易发生再做决定

体坛周报
2026-07-24 09:20:11
王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

呼呼历史论
2026-07-24 03:38:04
“还不如贾浅浅!这分明是一篇日记啊”!汤家凤怒批海南作协副主席的现代诗,引热议

“还不如贾浅浅!这分明是一篇日记啊”!汤家凤怒批海南作协副主席的现代诗,引热议

火山詩话
2026-07-23 07:57:53
巴萨暴怒!29岁队长重伤休战6个月:带伤踢世界杯 无脑上“屠宰场”

巴萨暴怒!29岁队长重伤休战6个月:带伤踢世界杯 无脑上“屠宰场”

风过乡
2026-07-24 07:23:33
甄珍哭着说:谢贤去年就认不得人了,反复问同一个问题,连老朋友都叫不出名字

甄珍哭着说:谢贤去年就认不得人了,反复问同一个问题,连老朋友都叫不出名字

情感大头说说
2026-07-23 17:39:55
3岁中国籍男童在日本独自横穿马路时被货车撞击身亡,52岁肇事司机涉嫌过失驾驶致伤罪被当场逮捕,其称“没有注意到小男孩突然冲到车前”

3岁中国籍男童在日本独自横穿马路时被货车撞击身亡,52岁肇事司机涉嫌过失驾驶致伤罪被当场逮捕,其称“没有注意到小男孩突然冲到车前”

都市快报橙柿互动
2026-07-23 01:43:43
黄渤不甘2亿亏损,集结17星力战周星驰新片

黄渤不甘2亿亏损,集结17星力战周星驰新片

孤傲何妨初
2026-07-22 05:38:58
危险的非洲大蜗牛正在扩张,北方也可能失守

危险的非洲大蜗牛正在扩张,北方也可能失守

南风窗
2026-07-23 15:07:43
总决赛用人引发巨大争议!张籽萱失势,教练组的选择该如何解读

总决赛用人引发巨大争议!张籽萱失势,教练组的选择该如何解读

金毛爱女排
2026-07-24 00:00:06
随着朱芳雨卸任,广东宏远新的总经理,99%在以下三人之间产生

随着朱芳雨卸任,广东宏远新的总经理,99%在以下三人之间产生

砚底沉香
2026-07-24 04:55:49
新疆旅行生图流出,倪妮文艺穿搭翻车,辛芷蕾赢麻了,高叶的鞋子更是让人一言难尽

新疆旅行生图流出,倪妮文艺穿搭翻车,辛芷蕾赢麻了,高叶的鞋子更是让人一言难尽

动物奇奇怪怪
2026-07-23 16:48:06
红姐,咱以后尽量少说点话,1995年的3万元存款是普通职工不吃不喝5年多的全部工资呢。

红姐,咱以后尽量少说点话,1995年的3万元存款是普通职工不吃不喝5年多的全部工资呢。

问道求真
2026-07-23 01:28:34
告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

风过乡
2026-07-24 06:29:03
694万悬赏背后:从射日英雄到失信人,寇占文输掉的到底是什么?

694万悬赏背后:从射日英雄到失信人,寇占文输掉的到底是什么?

记录生活日常阿蜴
2026-07-24 03:57:00
安徽进出口股份有限公司第一事业部副总经理王青峰接受纪律审查和监察调查

安徽进出口股份有限公司第一事业部副总经理王青峰接受纪律审查和监察调查

界面新闻
2026-07-23 16:01:11
“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

小鱼爱鱼乐
2026-07-15 12:14:00
连续轰炸大型物流中心,原来背后牵涉到克里姆林宫和俄罗斯经济

连续轰炸大型物流中心,原来背后牵涉到克里姆林宫和俄罗斯经济

鹰眼Defence
2026-07-23 15:30:21
2026-07-24 10:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13588文章数 142699关注度
往期回顾 全部

科技要闻

北大发文祝贺校友王虹、邓煜荣获菲尔兹奖

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

家居
艺术
健康
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

这是毛主席最后一次题写的大学校名!

我是不是中风高风险人群?快速自测

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

"镐山"之后美再威胁袭伊基础设施 伊朗:将以牙还牙

无障碍浏览 进入关怀版