训练一个能在多种交互环境里通用的LLM智能体,是眼下不少团队盯着的方向。但真把模型丢进多个环境里联合训练,麻烦很快就来了:不同环境的学习速度不一样,同一批数据里,可能既有全部失败的轨迹组,也有全部成功的轨迹组。
问题出在奖励上。当一组轨迹的奖励完全相同时,组内相对奖励就失去了对比信号——全对和全错的数据,在标量奖励这个维度上,提供不了任何区分度。而现有的课程学习和数据选择策略,大多是在环境层面分配训练资源,或者优先看局部奖励信号,并没有显式考虑当前不同环境之间的轨迹关系。
![]()
标量奖励的两个盲区
这篇论文把多环境强化学习里只依赖标量奖励的局限,归结为两点。
- 它无法提供跨环境关系的信息——不同环境之间的轨迹有什么关联,标量奖励说不清楚。
- 当组内奖励完全一致时,它提供不了组内对比——全失败组和全成功组,在数值上没有任何差别。
这两个盲区指向同一个需求:需要更丰富的文本反馈来引导学习,比如描述轨迹行为的评分标准(rubrics)。
把评分标准从奖励变成筛选器
研究团队的做法,是把评分标准从单纯的奖励用途里拿出来,重新用于在线数据选择和策略监督。
具体来说,一个LLM评判器会用一套预定义的、跨环境共享的评分标准词表,给每条轨迹打上标签。这些标签形成的画像,会用来挑选数据:既要和混合环境批次整体的行为构成保持一致,又要限制与已选数据之间的重叠。
与此同时,评分标准还承担了另一重角色。描述期望行为的正向评分标准,被用作在策略自蒸馏教师的特权上下文,提供额外的token级监督;描述不期望行为的负向评分标准,则用来引导后续的轨迹生成,避开反复出现的失败模式。
这些组件合在一起,构成了RISED。
每个环境里都排进前二
论文给出的结果是:在不同的模型骨干上,RISED在跨环境的平均通过率上都是最高的,并且在每一个单独环境里都排在第一或第二。
基于评分标准的分析,还能进一步刻画这些性能提升背后伴随的行为变化。
论文作者包括Jingtan Wang、Sirajul Salekin、Young mok Jung、Javier Movellan、Bryan Kian Hsiang Low、Manjot Bilkhu。其中Jingtan Wang与Bryan Kian Hsiang Low隶属新加坡国立大学,部分工作是在Apple期间完成的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.