PRM-as-a-Judge 1.5:从二值成功率到机器人执行全过程评估
![]()
我爱计算机视觉
近日,PRM-as-a-Judge研究团队发布了 PRM-as-a-Judge 1.5 ,提出一套面向机器人操作任务的过程评测框架。
现有评测框架,通常使用rule-based的过程得分,用二元成功率反馈任务是否完成。但同样失败的轨迹,可能在任务刚开始就崩溃,也可能离成功只差最后一步;同样成功的轨迹,可能非常丝滑顺畅,也可能经历了多次停滞和回撤。
这些差异会直接影响数据补充、策略优化和部署判断,却很难仅仅通过二元成功率看出来。
PRM-as-a-Judge1.5 将评测范围从最终结果扩展到了完整执行过程。
框架把 rollout 视频转换为随时间变化的进度曲线,并据此生成过程指标和模型评估报告。曲线记录机器人何时推进、何时停滞、何时回撤,以及回撤后能否恢复。
从 rollout 视频到进度曲线
Process Reward Model(PRM)能够根据任务和观测,估计机器人当前处于怎样的完成进度。以往,这类信号主要用于奖励建模、轨迹筛选和策略优化;在 PRM-as-a-Judge 中,它被用于评测已经发生的执行过程。
在这套框架中,PRM 作为评判器,用于估计任务进度,PRM-as-a-Judge 则负责检验评判器,并将进度信号用于统计和诊断。
最终报告将视频、进度曲线和单条轨迹指标对齐。
新增 FNS、DRR、SQS 三项指标
三张曲线图可以改成折叠/滑动框形式,不用同时展示
为了让进度曲线能够用于模型比较,1.5 版本进一步将曲线归纳为便于统计的过程指标。
PRM-as-a-Judge 1.5 沿用了 OPD(Outcome-Process-Diagnosis)框架,Outcome 层回答 “推进到了哪里”,Process 层回答 “推进得怎么样”,Diagnosis 层回答 “如果没做好,问题主要出在哪里”。此外,新增的 FNS、DRR、SQS 三项条件化指标,则分别关注失败样本离成功有多近、回退后恢复了多少,以及成功样本完成得是否顺畅。
FNS(失败接近度)
只观察失败样本,综合最大进度以及 50%、75% 两个阶段节点的到达情况,回答“离成功有多近”的问题。它能够区分“刚开始就失败”和“只差最后一步”的两类轨迹。
DRR(回撤恢复率)
衡量最大回撤发生后,机器人重新找回了多少进度。接近 1 表示基本恢复,接近 0 则说明回撤后没有重新建立有效进展。对真实机器人而言,完全避免失误并不现实;能否重新抓取、修正姿态并继续推进,同样是一项重要能力。
SQS(成功质量)
只评价成功样本,综合观察执行效率、稳定性、回退和停滞。两台机器人都完成任务,并不意味着它们完成得同样好;一次顺畅执行和一次反复试错后的成功,需要被区别对待。
三项新增指标与原有的阶段覆盖、最高进度和停滞指标一起使用,共同描述模型的执行过程。
TODO:Analysis
PRM-as-a-Judge 1.5在18个真机任务、42个仿真任务上执行测评,不仅能判断模型是否完成任务,也能进一步比较模型的任务达成能力、执行质量和环境适应性。
成功率之外,还能看出什么
成功率用于判断任务最终是否完成,过程指标则补充说明推进深度、失败位置、恢复能力和成功质量。
这些信号组合起来,可以形成更具体的模型画像:
- 阶段覆盖较高但成功率偏低,则问题可能集中在“最后一公里”,比如X-VLA;
- 停滞较多或恢复能力较弱,体现为DRR较低,通常说明关键交互阶段的闭环修正不足,比如Xiaomi-Robotics-0;
- 成功率较高但轨迹质量偏低,说明模型能完成任务,但尚不适合部署,尤其是对于仿真任务。
这些结果既可用于模型比较,也能为数据补充、策略训练、控制优化和失败复盘提供依据。
技术报告中的几项观察
技术报告基于 RoboDojo 公开的真实与仿真 rollout 视频,对多类具身模型进行了统一评估。结果显示,不同过程指标下的模型排名并不一致,成功率也无法充分反映 FNS、SQS 等指标所表征的能力。
- 在多项指标的综合排名中,VLA 整体比 WAM 更有竞争力;
- 参数规模与具身表现没有清晰的正相关,更大的模型不一定更强;
- 开放词汇任务最具挑战,长时序任务则最能拉开不同模型的差距;
- 仿真与真实场景的排名仅呈弱正相关,在精确对齐和复杂接触任务上,真实部署的性能下降更明显。
随着机器人任务变得更长、更复杂,单纯的二元成功率很难完整表现模型能力。将 rollout 视频、进度曲线和过程指标结合在一起,可以进一步看到机器人如何推进、在哪里停滞,以及回撤后能否恢复。
PRM-as-a-Judge 1.5 将这些信息汇总为可复核的轨迹诊断,新增指标补充了失败接近度、回撤恢复能力和成功执行质量。
评测结果由此从单一的成功或失败,扩展为对完整执行过程的描述。
每一次 rollout 都能留下可回放、可核查的过程记录,为后续训练和部署分析提供依据。
项目同步开放了评测基准、指标实现、可视化工具和使用指南,为失败样本筛选、数据补充、策略训练和部署前诊断提供更直接的线索。
- PRM-as-a-Judge 1.0 论文:https://arxiv.org/abs/2603.21669
- PRM-as-a-Judge 1.5 论文:https://arxiv.org/abs/2608.14284
- GitHub 代码仓库:https://github.com/YuyangLiu2003/PRM-as-a-Judge
- 项目主页:https://prm-as-a-judge.github.io/index.html
- 用户手册:https://prm-as-a-judge.github.io/doc.html
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.