强化学习训练智能体时,一条轨迹里每个动作的重要性并不相同。但GRPO给轨迹中每个token分配相同的advantage,无法区分哪一步才是决定性的。
ProVer的做法
![]()
ProVer提出一种信用分配方法:先用LLM judge定位轨迹中的关键片段,再由rollout决定该步信用的大小。两步配合,把"哪一步关键"和"这一步值多少"分开处理。
LLM judge负责找出关键片段,rollout负责量化该步的信用大小。这样,轨迹中不同步骤就能拿到不同的信用,而不是被平均对待。
这套方法针对的正是GRPO的短板:同一条轨迹里,每个token拿到相同的advantage,决定性步骤和普通步骤被一视同仁。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.