PRM-as-a-Judge 1.5:机器人过程评估工具包 PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment
把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力
前置知识
过程奖励模型(PRM, Process Reward Model)
源自 LLM 领域的过程奖励思想,在机器人中指能对每一帧或每个时间步预测任务完成进度($p_t \in [0,1]$ 标量)的模型。按输入形式分两类:Pair 式比较前后两帧(如 Robo-Dopamine 预测帧间进度增量),Sequence 式联合处理多帧或整段视频(如 RoboMeter 从完整轨迹估计帧级进度)。把整条轨迹的预测按时间连起来就得到进度曲线。
本文整个评估框架的原料就是 PRM 输出的进度曲线,OPD 三层全部九个指标都定义在这条曲线上;不理解 PRM 就无法理解评估结果从何而来、其误差如何传播到指标。
VLA 与 WAM 两大模型范式
VLA(视觉-语言-动作模型)把视觉观测与语言指令直接映射为机器人动作,代表如 $\pi_0$、$\pi_{0.5}$、GR00T-N1.7、X-VLA;WAM(世界-动作模型)额外内建世界模型,通过预测/想象未来状态来辅助动作生成,代表如 X-WAM、AHA-WAM、Fast-WAM。两者是当前具身模型竞争的两条主要技术路线。
本文评测对象就是这两类模型,Finding 1 专门用过程指标比较 VLA 与 WAM 的强弱(Top-3 中 VLA 占 27%、WAM 占 0%),是论文最有传播度的结论之一。
二值成功率(SR)及其信息损失
SR 是机器人操作评测的事实标准:整条轨迹只记成功/失败 0/1,汇报成功比例。它把平滑直接的成功与反复纠正、犹豫后才成功的轨迹同等对待,也把第一步就失败与差最后一步失败同等对待;人工规则打分虽更细,但每个任务都要手工设计阶段、阈值与权重,费时且评分因人而异。
本文的全部动机建立在 SR 的信息损失之上,只有理解「0 分的失败可能差 99% 完成、1 分的成功可能极其低效」,才能理解 FNS/DRR/SQS 三个新指标分别解决什么问题。
进度曲线(Progress Curve)
对 rollout 均匀采样视频帧(1 FPS),用 PRM 逐帧预测进度 $p_t \in [0,1]$ 并与时间步对齐,得到序列 $p_{0:T}$;计算指标前先做高斯平滑抑制预测噪声。曲线上可以直接读出推进、停滞(STR)、回退(CRA/DRR)与恢复等执行模式,值越接近 1 表示越接近任务完成。
进度曲线是本文方法的「心电图」:MP/MC 看最高点和里程碑、PPL 看路径效率、CRA/STR/FNS/DRR/SQS 看回退、停滞、近似成功与恢复,理解曲线形态与指标含义的对应是读懂全文的关键。
Macro-F1
对每个类别分别计算 F1(精确率与召回率的调和平均),再对各类别取算术平均。与整体 Accuracy 不同,它不受类别样本量失衡影响,少数类表现差会直接拉低分数。在 Rising/Falling 区间数量不均衡的标注数据上,Macro-F1 比准确率更能反映模型对少数类的识别能力。
RoboPulse++ 用 Macro-F1 评估 PRM 判断进度上升/下降的可靠性:Robo-Dopamine (Forward) 的 0.77 对 Gemini 3.1 Pro 的 0.58 是「专用 PRM 优于通用 VLM」结论的核心证据。
Sim-to-Real 差距
机器人在仿真环境中评测的表现与现实部署之间的性能落差,来源包括物理保真度不足、视觉外观差异、传感器噪声与接触动力学失配。通常定性讨论,缺乏跨指标的量化刻画;对需要精确对齐和复杂接触的任务(如插管、挂杯子)差距尤其明显。
Finding 5 用过程指标把这一差距量化了:仿真与现实排名的 Spearman 相关仅 $\rho = 0.18\text{–}0.58$,平均 MP 差距 $-16.5$ 个百分点,是本文对「仿真结果能否代表真机」这一社区问题的直接回答。
研究动机
当前机器人操作评测几乎被二值成功率(SR)统治(LIBERO、SimplerEnv、RoboTwin 等主流基准都以 SR 为核心报告指标),近期工作改为人工规则打分,但每个任务都要单独设计阶段、阈值和权重,费时费力且人类评分彼此不一致;依赖物体位姿、关节状态等特权信息的辅助状态指标(如 RoboEval)又需要环境内部信号,难以用于真机黑盒部署。信息损失带来两个具体问题:其一,失败 rollout 的能力差异巨大——有的开局即失败,有的已完成大部分任务却在最后一步失败,SR 却给同样的 0 分(真实案例:Spirit v1.5 在 RoboDojo-RealWorld 上 SR 为 0.00%,但 66.67% 的轨迹推进到了 25% 里程碑,FNS 达 14.85);其二,成功 rollout 质量参差——有的平滑直达目标,有的靠低效纠正、犹豫和恢复才完成,SR 却给同样的 1 分。随着具身模型从短程孤立操作走向长时程多任务环境,执行更复杂、失败模式更多样,这种粒度已无法支撑失败归因和模型迭代。前作 PRM-as-a-Judge 1.0 已能将视频转为进度曲线并计算 MC、STR 等指标,但对「失败得多接近成功」「最大挫折后恢复了几成」「成功是否高效稳定」这三类最关键的诊断问题仍缺乏针对性度量。
本文的目标是本文要把机器人过程评估升级为「医生式体检」:给定任意具身模型的 rollout 视频加任务指令,自动产出稠密进度曲线、一套覆盖可达性/效率/诊断的细粒度指标、以及可视化评估报告,全程不需要特权状态、不需要人工规则。具体目标有三:(1) 在 1.0 版 OPD(Outcome–Process–Diagnosis)指标体系上新增三个条件化指标——失败侧的 Failure Near-Success(FNS)、恢复侧的 Drawdown Recovery Ratio(DRR)、成功侧的 Success Quality Score(SQS),分别回答上述三个诊断问题,使 OPD 体系覆盖可达性、效率、停滞、失败侧进度、恢复与成功侧质量六个方面;(2) 基于 RoboDojo 基准(冻结于 2026-07-03 的榜单)公开的 rollout 视频,对 9 个真实世界模型和 16 个仿真模型做大规模过程评估,产出超越官方 SR 排名的模型体检报告与关键发现;(3) 发布 RoboPulse++ 基准检验 PRM 裁判本身判断进度上升/下降的可靠性,并开源整套工具链(基准、指标实现、可视化组件与用户指南),把透明、过程化、可复现的评估确立为下一代具身智能的基础设施。
与已有工作不同的是,本文的独特切入角度有三点。第一,评估对象从「轨迹结果」转向「过程曲线」:不是给整条轨迹打一个综合分,而是先把视频变成逐帧进度信号,再在曲线上定义指标族。这个接口只需要任务描述加视频,与人工规则打分(需逐任务设计)和特权状态指标(需物体位姿等内部信号)都不同,天然跨本体、跨仿真器、跨真机。第二,「条件化指标」设计:FNS 只在失败 rollout 上计算、DRR 只在发生回撤的 rollout 上计算、SQS 只在成功 rollout 上计算,把诊断拆成三个互斥人群分别度量,而不是把所有轨迹混进一个平均分里稀释信息。第三,对评估器本身做元评估:社区开始用 PRM 当裁判,但裁判可靠吗?RoboPulse++ 意识到绝对完成百分比在不同机器人任务间缺乏一致真值,于是改标每个时间区间的进度方向(Rising/Falling),用 2,244 个人工标注区间检验 10 个专业 PRM 和 4 个通用 VLM;这种「方向标注代替绝对值」的协议是对裁判可靠性问题的务实回应,也是与 1.0 版最大的方法论差异。
核心方法
整体直觉是把「评估机器人」变成「给病人做体检出报告」:心电图就是进度曲线,各项生理指标就是 OPD 指标,诊断报告就是最终输出。技术上是一条四段流水线。(1) 输入层:把每次 rollout 组织成含唯一 Case ID、任务指令、rollout 视频的记录,可选附加其他视角。(2) PRM 层:用过程奖励模型对每帧/时间戳估计任务完成度 $p_t \in [0,1]$,串联成进度曲线 $p_{0:T}$,计算前做高斯平滑抑制预测噪声;本文默认裁判是 Robo-Dopamine (Forward),其可靠性由 RoboPulse++ 背书。(3) 指标层:在曲线上计算 OPD 三层九指标——Outcome 层的 MC@25/50/75 与 MP 衡量「能走多远」,Process 层的 PPL 衡量「走得是否高效」,Diagnosis 层的 CRA/STR 度量回退与停滞,新增的 FNS/DRR/SQS 分别只在失败、发生回撤、成功三类轨迹子集上计算。(4) 报告层:自动生成包含失败位置、回退分析、轨迹探索的评估报告,并把 rollout 视频与逐帧进度曲线同步展示(交互式轨迹浏览器)。整个系统对被评模型零侵入——只用公开的 rollout 视频,不做任何微调或修改。
核心创新是把 OPD 指标体系从「描述性统计」升级为「条件化诊断」。1.0 版指标(MC、MP、PPL、CRA、STR)描述曲线总体形态,但答不了三个最常被问的诊断问题;1.5 版三个新指标各绑定一个条件人群。FNS 只算失败轨迹:$\mathrm{FNS} = 0.5\,\mathrm{MP} + 0.3\,\mathrm{MC@75} + 0.2\,\mathrm{MC@50}$,融合最大进度与里程碑结构,刻画「失败前推进了多深」,如 $\pi_{0.5}$ 在插充电器任务上失败但 FNS 达 99.5,而 $\pi_0$ 反复抓取失败仅 2.7。DRR 只算经历回撤的轨迹:先定义回撤 $d_t = \max_{0\le i\le t} p_i - p_t$、找到最大回撤点 $t^\star \in \arg\max_t d_t$,再算 $\mathrm{DRR} = \min\left(1, \frac{\max_{t^\star \le t \le T} p_t - p_{t^\star}}{d_{t^\star}}\right)$,度量「最大挫折恢复了几成」(1 为完全恢复),如挂杯子任务上 $\pi_{0.5}$ 跌到近零后完全恢复(DRR=1.0),Xiaomi-Robotics-0 回撤后再未追回(DRR=0.1)。SQS 只算成功轨迹:$\mathrm{SQS} = 0.5\,\mathrm{PPL} + 0.3(1-\mathrm{CRA}) + 0.2(1-\mathrm{STR})$,惩罚成功过程中的低效、回退与犹豫,如立瓶子任务上 InternVLA-A1 干净利落(SQS=97.9),$\pi_{0.5}$ 经历失败尝试与回退(SQS=76.2)。与已有方法的另一本质区别是元评估意识:RoboPulse++ 用 2,244 个 Rising/Falling 区间为裁判建立基准,使「过程评估」本身有了可复现的可靠性检验;再用 6,076 条 rollout 证明 PRM 派生 SR 能复原官方 SR(MAE 仅 1.32–1.57 个百分点),说明细粒度化没有丢失结果层信息。
方法步骤详情
完整流程分五步。第一步,构造进度曲线:rollout 视频按 1 FPS 均匀采样,PRM 逐帧输出进度并与时间步对齐得到 $p_{0:T}$($p_t \in [0,1]$),再做高斯平滑去噪。第二步,Outcome 层:$\mathrm{MP} = \max_{0 \le t \le T} p_t$;$\mathrm{MC@}q = \mathbb{I}[\mathrm{MP} \ge q/100]$($q \in \{25,50,75,100\}$),在 rollout 集合上汇报到达各里程碑的比例,揭示模型常停在哪一阶段。第三步,Process 层:$\mathrm{PPL} = \mathrm{MP} \cdot \frac{\mathrm{MP}}{\sum_{t=1}^{T} |p_t - p_{t-1}|}$,第一个 MP 用最高进度加权,第二个分式用「所需进度除以进度曲线总变差」衡量路径效率(分母为 0 时置 0),值越高代表回溯和重复纠正越少。第四步,Diagnosis 层:CRA $= \frac{1}{(T+1)\,\mathrm{MP}} \sum_{t=0}^{T} \left( \max_{0 \le i \le t} p_i - p_t \right)$ 度量偏离历史最优的累积面积(越小越好);STR $= \frac{1}{T} \sum_{t=1}^{T} \mathbb{I}[|p_t - p_{t-1}| < \epsilon]$ 统计停滞步比例;随后按条件分流——失败轨迹算 FNS,发生回撤($d_{t^\star}>0$)的轨迹算 DRR,成功轨迹算 SQS。第五步,聚合与报告:连续指标在任务/模型级取符合条件 rollout 的中位数,MC@q 与 SR 取比例;自动生成含失败位置、回退分析、轨迹探索的报告,视频与曲线同步。并行地,RoboPulse++ 构建四步:从 9 个公开数据源汇集 700 条轨迹(275 任务、17,052 帧);标注者通读全轨迹后切出 2,244 个时间区间并按任务相关状态变化标 Rising(+1)/Falling(−1);把各裁判输出统一到方向预测空间(绝对进度做差 $d_t = p_t - p_{t-1}$、增量直接用、类别直接映射,连续输出做 5 帧因果滑动平均后取符号);以 Macro-F1 与 Accuracy 汇总,剔除每个区间首尾各 2 个采样步以降低边界歧义。
技术新颖性
技术新颖性体现在四个层面。其一,指标设计上的「条件化」是新的:把诊断问题形式化为「在特定子集上定义专门指标」,FNS/DRR/SQS 的 0.5/0.3/0.2 加权组合虽然简单,但分别绑定失败、回撤、成功三种语义,比单一平均分可解释得多;DRR 借鉴金融回撤(drawdown)概念的恢复比率在机器人评估中少见,恰好填补了「恢复行为」这一此前无指标可量的空白。其二,评估接口上,「任务描述 + 视频」的极简输入区别于需要特权状态的 RoboEval 类方法和人工规则打分法,可无缝用于真机黑盒部署,且跨本体、跨仿真器通用。其三,元评估上,RoboPulse++ 的方向标注协议绕开了「绝对进度百分比缺乏跨任务一致真值」的根本困难,把 Pair 式与 Sequence 式 PRM、专用与通用 VLM 放进同一协议,并系统揭示了结构性盲区:Falling 判别最好 F1 仅 0.63 对 Rising 的 0.92,且回归识别依赖序列上下文(RoboMeter 在上下文依赖场景 Falling 准确率 0.901 对 Pair 式的 0.408)。其四,验证闭环上,论文用 6,076 条 rollout 验证 PRM 派生 SR 与官方 SR 的一致性(Spearman 0.88/0.96、MAE 1.57/1.32pp),为「细粒度指标不牺牲结果可比性」提供量化背书,这种对裁判自身的严谨校验在评估方法论文里并不多见。
实验结果
实验分四块。第一,RoboDojo 主榜单:真实世界 9 模型中 $\pi_{0.5}$ 全面领先——SR 17.06%、MC@25 85.29、MC@50 60.59、MC@75 38.82、MP 59.90、PPL 28.93、FNS 45.39、DRR 100.00、SQS 82.08,CRA 5.22 与 STR 21.81 也较低;而 SR 榜第二名 InternVLA-A1 仅 4.71%,差距悬殊。更有信息量的反例:Spirit v1.5 的 SR 为 0.00% 但 MC@25 达 66.67、FNS 14.85,说明其经常推进却总在收尾失败;GR00T-N1.7 的 SR 仅 0.63% 却有较好的 CRA(10.15)。SR 排名与 SQS/DRR/FNS 排名明显不一致,直接证明只看 SR 不够。仿真榜 16 模型中 $\pi_{0.5}$ 以 11 项指标平均名次第 1 居首(SR 8.68%,SR 第 1 的是 Hy-Embodied-0.5-VLA 11.46%)。第二,五条关键发现:(F1) VLA 整体强于 WAM,Top-3 中 VLA 占比 27% 对 WAM 的 0%,Top-5 为 36% 对 20%;(F2) 规模与性能无正相关——4B 的 Spatial Forcing(平均第 3)胜过多个 5B/6B 模型,中位数分割的四个象限各有 n=1/7/4/4 个模型;(F3) $\pi_{0.5}$ 综合最强;(F4) 模型最擅长 Precision 任务,Open-Vocabulary 最难(分数聚在低端),Long-Horizon 方差最大、最能区分模型(共 24 Generalization/8 Precision/8 Long-Horizon/8 Open-Vocabulary 任务条件);(F5) 仿真与现实仅弱相关——9 个共享模型上 SR 的 Spearman $\rho=0.58$、MP 仅 0.18、FNS 0.22;6 个共享任务的 MP 热力图显示平均差 $-16.5$ 个百分点,Fill pen holder 反而 +8.5,Classify objects 最差 $-31.5$,Hang mugs $-24.5$、Insert tubes $-27.6$,说明精确对齐与复杂接触是真机主要瓶颈。第三,RoboPulse++:Robo-Dopamine (Forward) 最优(Macro-F1 0.77、Accuracy 0.84),显著超过最强通用 VLM 设置 Gemini 3.1 Pro Pair 式(0.58/0.63);Falling 最好 F1 仅 0.63 对 Rising 0.92,短板在召回;155 个 Falling 错误样本中交互关系失败占 78.1%(121 个)、任务顺序失败 21.9%(34 个);上下文依赖场景下 Sequence 式 RoboMeter 大幅领先(Falling 0.901 对 0.408,Overall 0.940 对 0.746)。第四,效率与一致性:单张 H100 处理 100 段视频(约 2.1 小时素材)Robo-Dopamine-4B 需 29.3 分钟(批量推理降至 7.8 分钟),RoboMeter 仅 46 秒,PRIMO (w/ CoT) 需 19.6 小时;PRM 派生 SR 与官方 SR 一致性极好——仿真 MAE 1.57pp/$\rho=0.88$,真实世界 MAE 1.32pp/$\rho=0.96$。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RoboPulse++ 进步方向判断(700 条轨迹、2,244 个标注区间) | Macro-F1 / Accuracy | 专用 PRM 最好:Robo-Dopamine (Forward) 0.77 / 0.84 | 最强通用 VLM:Gemini 3.1 Pro (Pair) 0.58 / 0.63;GPT-5.4 (Pair) 仅 0.38 / 0.33 | Macro-F1 +0.19,Accuracy +0.21 |
| RoboPulse++ Falling(回退)区间识别 | Falling F1 | 0.63(Robo-Dopamine Backward),Rising 最好 F1 为 0.92 | 通用 VLM 最好 0.37(Gemini 3.1 Pro Pair);多数 PRM 低于 0.5(如 PRIMO 仅 0.08) | 相对通用 VLM +0.26,但暴露回退识别是全行业短板 |
| RoboDojo-Sim 具身模型综合排名(16 模型、11 项指标) | 平均名次 | π0.5 平均第 1(SR 8.68%、MC@25 73.61、DRR 87.46、FNS 21.03) | SR 第 1 的 Hy-Embodied-0.5-VLA 平均第 2(SR 11.46%);最差 Spirit v1.5 平均第 16(SR 1.74%) | 过程指标给出的排名与 SR 排名显著不同(π0.5 SR 仅列第 2) |
| RoboDojo-RealWorld 模型评估(9 模型) | SR / MC@50 / FNS | π0.5:SR 17.06%、MC@50 60.59、FNS 45.39、DRR 100.00 | 第二名 InternVLA-A1 SR 仅 4.71%;Spirit v1.5 SR 0.00% 但 MC@25 66.67 | SR 领先第二名约 3.6 倍;过程指标揭示 SR 无法区分的失败深度差异 |
| PRM 派生 SR 与官方 SR 的一致性(6,076 条 rollout) | MAE / Spearman ρ | 仿真:MAE 1.57pp、ρ=0.88;真实世界:MAE 1.32pp、ρ=0.96 | 以 RoboDojo 官方报告 SR 为参照(16 仿真模型 / 9 真实模型) | 证明进度曲线可无损复原传统成功率,细粒度化不丢结果信息 |
| 仿真-现实性能相关性(9 个共享模型 / 6 个共享任务) | Spearman ρ / 平均 MP 差距 | SR ρ=0.58、MP ρ=0.18、FNS ρ=0.22;平均 MP 差距 −16.5pp(Fill pen holder +8.5,Classify objects −31.5) | 若仿真可代表现实,应 ρ 接近 1、差距接近 0 | 量化证明仿真性能不能代表真机,精确对齐类任务落差最大 |
局限与改进
作者承认的局限:其一,Falling(回退)判别是所有被评裁判的主要短板——最好 Falling F1 仅 0.63 而 Rising 达 0.92,差距主要由低召回驱动,即裁判对「任务状态倒退」不敏感,而这恰是 CRA/DRR 等诊断指标最依赖的信号;其二,真实世界设置下多数模型 SR 过低,SQS 无法可靠估计,图 5 的真机雷达图中 SQS 被统一画成公共半径未参与比较;其三,为保证公平,所有分析只基于 RoboDojo 冻结榜单(2026-07-03)公开的 rollout 视频,未微调被评模型,覆盖面受限于该基准的任务集。我自己的观察:FNS/SQS 的 0.5/0.3/0.2 权重与 STR 的噪声阈值 $\epsilon$、平滑窗宽均为手工设定,论文未做敏感性分析或与人类偏好的对齐验证;条件化指标存在可比性陷阱——FNS 只在失败子集、SQS 只在成功子集上聚合,而不同模型子集大小悬殊($\pi_{0.5}$ 真实 SR 17.06% 对 Spirit v1.5 的 0%,后者 SQS 直接无定义/为 0),小样本上方差极大且不可比;DRR 剔除无回撤轨迹后,「从不犯错」的稳定模型反而完全不计入恢复能力评估;默认裁判 Robo-Dopamine (Forward) 是 Pair 式,在上下文依赖的 Falling 场景准确率仅 0.408,用它统一裁判所有模型可能系统性低估「跌落后恢复」类行为的质量——裁判误差恰好与被测能力相关。此外全部结论来自 RoboDojo 一个基准,跨基准泛化(如 LIBERO、SimplerEnv 全量任务)未验证,移动操作、双臂、灵巧手等更复杂形态也未覆盖。
独立分析的弱点
独立分析有五个弱点。第一,裁判误差与被测能力耦合:Robo-Dopamine (Forward) 在上下文依赖的 Falling 场景准确率仅 0.408(Table 8),而这类「完成子目标后又 Undo」的场景正是 DRR 指标的目标人群——用在此场景上偏弱的裁判去度量恢复能力,会产生系统性偏差,DRR 的模型间差异可能部分反映的是裁判缺陷而非模型差异。改进方向:按任务特征自适应切换 Pair/Sequence 裁判,或对 DRR 输出置信区间、用多裁判集成投票。第二,超参缺乏校准:FNS/SQS 的固定权重、STR 阈值 $\epsilon$、高斯平滑与 5 帧滑动平均窗宽都没有和人类评估偏好对齐的证据。改进方向:收集专家对轨迹对的偏好数据,用学习排序(learning-to-rank)校准权重,并报告指标对扰动的稳健性曲线。第三,条件指标的可比性问题:成功子集大小悬殊使 SQS 在弱模型上无定义或高方差,任务/模型级取中位数的聚合方式也未报告样本量。改进方向:报告 bootstrap 置信区间,或对小样本模型采用贝叶斯收缩估计。第四,计算成本跨度两个数量级:RoboMeter 46 秒处理 100 段视频而 PRIMO (w/ CoT) 要 19.6 小时,实际部署者会倾向便宜但 Falling 判别更弱的裁判,形成「越便宜越不准」的逆向激励。改进方向:把强裁判蒸馏为轻量模型,或缓存帧级特征复用。第五,覆盖面单一:所有评估基于 RoboDojo,未在其他基准上展示指标区分度,也未涉及移动操作、双臂协同、形变物体等场景;FNS 用固定的 25/50/75 里程碑假设任务进度可均匀切分,对非线性的长时程任务未必合理。
未来方向
作者提出的方向有三组。第一,更强的 PRM:(1) 时序上下文建模——同一局部动作在不同执行历史下可能意味着进步或倒退,序列式建模更自然,离线评估还可同时利用过去与未来观测;(2) 负进度监督——进步容易从成功/专家轨迹定义,回退后损失多少进度常是模糊的,需要更多真实失败轨迹与更好的负监督;(3) 低成本适配——新任务、新视角、新本体不断出现,基础裁判应支持免全量重训练的快速适配;(4) 更丰富监督——仅用标量进度目标对时序动态的监督有限,未来状态预测、视频预测等时序目标可提供额外信号。第二,更丰富的诊断证据:把进度曲线与视觉、状态、接触、语义证据结合,让报告对执行模式的解释更可解释。第三,打通评估-数据-训练闭环:用过程诊断发现的失败模式指导失败定向的数据采集、重加权与目标设计。基于本文成果还可延伸:把 DRR/FNS 直接用作强化学习的奖励整形信号或 GRPO 式组内比较的依据,让过程评估反哺训练;建立跨 PRM 的持续更新公开排行榜;研究指标对裁判校准误差的敏感性并做不确定性量化;把方向标注协议推广为社区通用的裁判标注标准;扩展到家庭长时程任务与多机器人协作场景的过程画像。
复现评估
复现条件总体较好,属于中等偏易。开源情况:论文配套完整评估套件——基准、指标实现、可视化工具与用户指南,官网 prm-as-a-judge.github.io,报告与交互式轨迹浏览器均自动生成。数据方面成本很低:评测对象是 RoboDojo 公开榜单的 rollout 视频(共 6,076 条对齐:4,606 仿真 + 1,470 真实,覆盖 42 个仿真任务与 18 个真实任务),RoboPulse++ 的 700 条轨迹、2,244 个标注区间来自 9 个公开数据源(LIBERO、RoboCasa、SimplerEnv、RoboTwin 2.0、RoboChallenge-Table30 等),无需自己采集。算力非常友好:默认裁判 Robo-Dopamine-4B 在单张 H100 80GB 上峰值显存仅 11 GiB,100 段视频(256×256、平均 75 秒、共约 2.1 小时素材、1 FPS 采样)29.3 分钟,批量推理降至 7.8 分钟;RoboMeter 仅需 12 GiB、46 秒,24GB 消费级显卡应可运行多数裁判。难点有三处:需自行下载并对齐 RoboDojo 各模型的 rollout 视频与官方 SR(论文用了冻结榜单快照);指标链路含若干超参(平滑窗宽、STR 阈值 $\epsilon$、区间首尾各剔除 2 个采样步的规则)需按用户指南设置,否则数值会有出入;若复现 RoboPulse++ 的标注协议,人工标注 2,244 个区间的工作量不小。指标计算本身都是曲线上的初等运算,代码复现门槛低。
论文图表
展示了机器人评估范式的四阶段演化:从只看二值结果(任务成功?是/否?得 0.3 还是 0.5 分?),到 PRM-as-a-Judge 1.0 引入过程曲线与 MC/STR/PPL/CRA 等 1.0 指标,再到 1.5 版新增 FNS/DRR/SQS 并生成模型评估报告,右端是配套的开放工具包、网站与评估套件。
一图读懂全文定位:论文处于「从结果评估到过程评估」的演化路线上,明确了 1.5 版相对 1.0 版的增量(三个条件化指标 + 评估报告)与交付物(开源套件)。
收纳笔记本电脑与耳机任务:AHA-WAM 已放好耳机、合上笔记本,只在最后放置电脑时失败(FNS=99.4),Fast-WAM 反复抓取失败停在起点(FNS=5.2)。
第二个 FNS 案例,与 Figure 14 一起说明该指标在不同任务上的一致行为,证明「失败深度」度量的通用性。
自动生成的网页版评估报告界面:模型排行榜总览、指标结果可视化、成功/失败条件画像、失败进度与恢复分析,以及视频与逐帧进度曲线同步的交互式轨迹浏览器。
展示工具的最终交付形态,说明论文不只是指标定义,而是包含可视化与探查环节的完整评估套件,直接关系其实用性与复现体验。