← 返回 2026-08-17

PRM-as-a-Judge 1.5:机器人过程评估工具包 PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng 📅 2026-08-14 👍 14 2026-08-22 18:30
VLA模型 具身智能 机器人操作评估 评测基准 过程奖励模型

把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力

前置知识

过程奖励模型(PRM, Process Reward Model)

源自 LLM 领域的过程奖励思想,在机器人中指能对每一帧或每个时间步预测任务完成进度($p_t \in [0,1]$ 标量)的模型。按输入形式分两类:Pair 式比较前后两帧(如 Robo-Dopamine 预测帧间进度增量),Sequence 式联合处理多帧或整段视频(如 RoboMeter 从完整轨迹估计帧级进度)。把整条轨迹的预测按时间连起来就得到进度曲线。

本文整个评估框架的原料就是 PRM 输出的进度曲线,OPD 三层全部九个指标都定义在这条曲线上;不理解 PRM 就无法理解评估结果从何而来、其误差如何传播到指标。

VLA 与 WAM 两大模型范式

VLA(视觉-语言-动作模型)把视觉观测与语言指令直接映射为机器人动作,代表如 $\pi_0$、$\pi_{0.5}$、GR00T-N1.7、X-VLA;WAM(世界-动作模型)额外内建世界模型,通过预测/想象未来状态来辅助动作生成,代表如 X-WAM、AHA-WAM、Fast-WAM。两者是当前具身模型竞争的两条主要技术路线。

本文评测对象就是这两类模型,Finding 1 专门用过程指标比较 VLA 与 WAM 的强弱(Top-3 中 VLA 占 27%、WAM 占 0%),是论文最有传播度的结论之一。

二值成功率(SR)及其信息损失

SR 是机器人操作评测的事实标准:整条轨迹只记成功/失败 0/1,汇报成功比例。它把平滑直接的成功与反复纠正、犹豫后才成功的轨迹同等对待,也把第一步就失败与差最后一步失败同等对待;人工规则打分虽更细,但每个任务都要手工设计阶段、阈值与权重,费时且评分因人而异。

本文的全部动机建立在 SR 的信息损失之上,只有理解「0 分的失败可能差 99% 完成、1 分的成功可能极其低效」,才能理解 FNS/DRR/SQS 三个新指标分别解决什么问题。

进度曲线(Progress Curve)

对 rollout 均匀采样视频帧(1 FPS),用 PRM 逐帧预测进度 $p_t \in [0,1]$ 并与时间步对齐,得到序列 $p_{0:T}$;计算指标前先做高斯平滑抑制预测噪声。曲线上可以直接读出推进、停滞(STR)、回退(CRA/DRR)与恢复等执行模式,值越接近 1 表示越接近任务完成。

进度曲线是本文方法的「心电图」:MP/MC 看最高点和里程碑、PPL 看路径效率、CRA/STR/FNS/DRR/SQS 看回退、停滞、近似成功与恢复,理解曲线形态与指标含义的对应是读懂全文的关键。

Macro-F1

对每个类别分别计算 F1(精确率与召回率的调和平均),再对各类别取算术平均。与整体 Accuracy 不同,它不受类别样本量失衡影响,少数类表现差会直接拉低分数。在 Rising/Falling 区间数量不均衡的标注数据上,Macro-F1 比准确率更能反映模型对少数类的识别能力。

RoboPulse++ 用 Macro-F1 评估 PRM 判断进度上升/下降的可靠性:Robo-Dopamine (Forward) 的 0.77 对 Gemini 3.1 Pro 的 0.58 是「专用 PRM 优于通用 VLM」结论的核心证据。

Sim-to-Real 差距

机器人在仿真环境中评测的表现与现实部署之间的性能落差,来源包括物理保真度不足、视觉外观差异、传感器噪声与接触动力学失配。通常定性讨论,缺乏跨指标的量化刻画;对需要精确对齐和复杂接触的任务(如插管、挂杯子)差距尤其明显。

Finding 5 用过程指标把这一差距量化了:仿真与现实排名的 Spearman 相关仅 $\rho = 0.18\text{–}0.58$,平均 MP 差距 $-16.5$ 个百分点,是本文对「仿真结果能否代表真机」这一社区问题的直接回答。

研究动机

当前机器人操作评测几乎被二值成功率(SR)统治(LIBERO、SimplerEnv、RoboTwin 等主流基准都以 SR 为核心报告指标),近期工作改为人工规则打分,但每个任务都要单独设计阶段、阈值和权重,费时费力且人类评分彼此不一致;依赖物体位姿、关节状态等特权信息的辅助状态指标(如 RoboEval)又需要环境内部信号,难以用于真机黑盒部署。信息损失带来两个具体问题:其一,失败 rollout 的能力差异巨大——有的开局即失败,有的已完成大部分任务却在最后一步失败,SR 却给同样的 0 分(真实案例:Spirit v1.5 在 RoboDojo-RealWorld 上 SR 为 0.00%,但 66.67% 的轨迹推进到了 25% 里程碑,FNS 达 14.85);其二,成功 rollout 质量参差——有的平滑直达目标,有的靠低效纠正、犹豫和恢复才完成,SR 却给同样的 1 分。随着具身模型从短程孤立操作走向长时程多任务环境,执行更复杂、失败模式更多样,这种粒度已无法支撑失败归因和模型迭代。前作 PRM-as-a-Judge 1.0 已能将视频转为进度曲线并计算 MC、STR 等指标,但对「失败得多接近成功」「最大挫折后恢复了几成」「成功是否高效稳定」这三类最关键的诊断问题仍缺乏针对性度量。

本文的目标是本文要把机器人过程评估升级为「医生式体检」:给定任意具身模型的 rollout 视频加任务指令,自动产出稠密进度曲线、一套覆盖可达性/效率/诊断的细粒度指标、以及可视化评估报告,全程不需要特权状态、不需要人工规则。具体目标有三:(1) 在 1.0 版 OPD(Outcome–Process–Diagnosis)指标体系上新增三个条件化指标——失败侧的 Failure Near-Success(FNS)、恢复侧的 Drawdown Recovery Ratio(DRR)、成功侧的 Success Quality Score(SQS),分别回答上述三个诊断问题,使 OPD 体系覆盖可达性、效率、停滞、失败侧进度、恢复与成功侧质量六个方面;(2) 基于 RoboDojo 基准(冻结于 2026-07-03 的榜单)公开的 rollout 视频,对 9 个真实世界模型和 16 个仿真模型做大规模过程评估,产出超越官方 SR 排名的模型体检报告与关键发现;(3) 发布 RoboPulse++ 基准检验 PRM 裁判本身判断进度上升/下降的可靠性,并开源整套工具链(基准、指标实现、可视化组件与用户指南),把透明、过程化、可复现的评估确立为下一代具身智能的基础设施。

与已有工作不同的是,本文的独特切入角度有三点。第一,评估对象从「轨迹结果」转向「过程曲线」:不是给整条轨迹打一个综合分,而是先把视频变成逐帧进度信号,再在曲线上定义指标族。这个接口只需要任务描述加视频,与人工规则打分(需逐任务设计)和特权状态指标(需物体位姿等内部信号)都不同,天然跨本体、跨仿真器、跨真机。第二,「条件化指标」设计:FNS 只在失败 rollout 上计算、DRR 只在发生回撤的 rollout 上计算、SQS 只在成功 rollout 上计算,把诊断拆成三个互斥人群分别度量,而不是把所有轨迹混进一个平均分里稀释信息。第三,对评估器本身做元评估:社区开始用 PRM 当裁判,但裁判可靠吗?RoboPulse++ 意识到绝对完成百分比在不同机器人任务间缺乏一致真值,于是改标每个时间区间的进度方向(Rising/Falling),用 2,244 个人工标注区间检验 10 个专业 PRM 和 4 个通用 VLM;这种「方向标注代替绝对值」的协议是对裁判可靠性问题的务实回应,也是与 1.0 版最大的方法论差异。

核心方法

整体直觉是把「评估机器人」变成「给病人做体检出报告」:心电图就是进度曲线,各项生理指标就是 OPD 指标,诊断报告就是最终输出。技术上是一条四段流水线。(1) 输入层:把每次 rollout 组织成含唯一 Case ID、任务指令、rollout 视频的记录,可选附加其他视角。(2) PRM 层:用过程奖励模型对每帧/时间戳估计任务完成度 $p_t \in [0,1]$,串联成进度曲线 $p_{0:T}$,计算前做高斯平滑抑制预测噪声;本文默认裁判是 Robo-Dopamine (Forward),其可靠性由 RoboPulse++ 背书。(3) 指标层:在曲线上计算 OPD 三层九指标——Outcome 层的 MC@25/50/75 与 MP 衡量「能走多远」,Process 层的 PPL 衡量「走得是否高效」,Diagnosis 层的 CRA/STR 度量回退与停滞,新增的 FNS/DRR/SQS 分别只在失败、发生回撤、成功三类轨迹子集上计算。(4) 报告层:自动生成包含失败位置、回退分析、轨迹探索的评估报告,并把 rollout 视频与逐帧进度曲线同步展示(交互式轨迹浏览器)。整个系统对被评模型零侵入——只用公开的 rollout 视频,不做任何微调或修改。

核心创新是把 OPD 指标体系从「描述性统计」升级为「条件化诊断」。1.0 版指标(MC、MP、PPL、CRA、STR)描述曲线总体形态,但答不了三个最常被问的诊断问题;1.5 版三个新指标各绑定一个条件人群。FNS 只算失败轨迹:$\mathrm{FNS} = 0.5\,\mathrm{MP} + 0.3\,\mathrm{MC@75} + 0.2\,\mathrm{MC@50}$,融合最大进度与里程碑结构,刻画「失败前推进了多深」,如 $\pi_{0.5}$ 在插充电器任务上失败但 FNS 达 99.5,而 $\pi_0$ 反复抓取失败仅 2.7。DRR 只算经历回撤的轨迹:先定义回撤 $d_t = \max_{0\le i\le t} p_i - p_t$、找到最大回撤点 $t^\star \in \arg\max_t d_t$,再算 $\mathrm{DRR} = \min\left(1, \frac{\max_{t^\star \le t \le T} p_t - p_{t^\star}}{d_{t^\star}}\right)$,度量「最大挫折恢复了几成」(1 为完全恢复),如挂杯子任务上 $\pi_{0.5}$ 跌到近零后完全恢复(DRR=1.0),Xiaomi-Robotics-0 回撤后再未追回(DRR=0.1)。SQS 只算成功轨迹:$\mathrm{SQS} = 0.5\,\mathrm{PPL} + 0.3(1-\mathrm{CRA}) + 0.2(1-\mathrm{STR})$,惩罚成功过程中的低效、回退与犹豫,如立瓶子任务上 InternVLA-A1 干净利落(SQS=97.9),$\pi_{0.5}$ 经历失败尝试与回退(SQS=76.2)。与已有方法的另一本质区别是元评估意识:RoboPulse++ 用 2,244 个 Rising/Falling 区间为裁判建立基准,使「过程评估」本身有了可复现的可靠性检验;再用 6,076 条 rollout 证明 PRM 派生 SR 能复原官方 SR(MAE 仅 1.32–1.57 个百分点),说明细粒度化没有丢失结果层信息。

方法步骤详情

完整流程分五步。第一步,构造进度曲线:rollout 视频按 1 FPS 均匀采样,PRM 逐帧输出进度并与时间步对齐得到 $p_{0:T}$($p_t \in [0,1]$),再做高斯平滑去噪。第二步,Outcome 层:$\mathrm{MP} = \max_{0 \le t \le T} p_t$;$\mathrm{MC@}q = \mathbb{I}[\mathrm{MP} \ge q/100]$($q \in \{25,50,75,100\}$),在 rollout 集合上汇报到达各里程碑的比例,揭示模型常停在哪一阶段。第三步,Process 层:$\mathrm{PPL} = \mathrm{MP} \cdot \frac{\mathrm{MP}}{\sum_{t=1}^{T} |p_t - p_{t-1}|}$,第一个 MP 用最高进度加权,第二个分式用「所需进度除以进度曲线总变差」衡量路径效率(分母为 0 时置 0),值越高代表回溯和重复纠正越少。第四步,Diagnosis 层:CRA $= \frac{1}{(T+1)\,\mathrm{MP}} \sum_{t=0}^{T} \left( \max_{0 \le i \le t} p_i - p_t \right)$ 度量偏离历史最优的累积面积(越小越好);STR $= \frac{1}{T} \sum_{t=1}^{T} \mathbb{I}[|p_t - p_{t-1}| < \epsilon]$ 统计停滞步比例;随后按条件分流——失败轨迹算 FNS,发生回撤($d_{t^\star}>0$)的轨迹算 DRR,成功轨迹算 SQS。第五步,聚合与报告:连续指标在任务/模型级取符合条件 rollout 的中位数,MC@q 与 SR 取比例;自动生成含失败位置、回退分析、轨迹探索的报告,视频与曲线同步。并行地,RoboPulse++ 构建四步:从 9 个公开数据源汇集 700 条轨迹(275 任务、17,052 帧);标注者通读全轨迹后切出 2,244 个时间区间并按任务相关状态变化标 Rising(+1)/Falling(−1);把各裁判输出统一到方向预测空间(绝对进度做差 $d_t = p_t - p_{t-1}$、增量直接用、类别直接映射,连续输出做 5 帧因果滑动平均后取符号);以 Macro-F1 与 Accuracy 汇总,剔除每个区间首尾各 2 个采样步以降低边界歧义。

技术新颖性

技术新颖性体现在四个层面。其一,指标设计上的「条件化」是新的:把诊断问题形式化为「在特定子集上定义专门指标」,FNS/DRR/SQS 的 0.5/0.3/0.2 加权组合虽然简单,但分别绑定失败、回撤、成功三种语义,比单一平均分可解释得多;DRR 借鉴金融回撤(drawdown)概念的恢复比率在机器人评估中少见,恰好填补了「恢复行为」这一此前无指标可量的空白。其二,评估接口上,「任务描述 + 视频」的极简输入区别于需要特权状态的 RoboEval 类方法和人工规则打分法,可无缝用于真机黑盒部署,且跨本体、跨仿真器通用。其三,元评估上,RoboPulse++ 的方向标注协议绕开了「绝对进度百分比缺乏跨任务一致真值」的根本困难,把 Pair 式与 Sequence 式 PRM、专用与通用 VLM 放进同一协议,并系统揭示了结构性盲区:Falling 判别最好 F1 仅 0.63 对 Rising 的 0.92,且回归识别依赖序列上下文(RoboMeter 在上下文依赖场景 Falling 准确率 0.901 对 Pair 式的 0.408)。其四,验证闭环上,论文用 6,076 条 rollout 验证 PRM 派生 SR 与官方 SR 的一致性(Spearman 0.88/0.96、MAE 1.57/1.32pp),为「细粒度指标不牺牲结果可比性」提供量化背书,这种对裁判自身的严谨校验在评估方法论文里并不多见。

Overall pipeline of PRM-as-a-Judge 1.5
Figure 2: Overall pipeline of PRM-as-a-Judge 1.5
Task-semantic coverage of RoboPulse++
Figure 9: Task-semantic coverage of RoboPulse++

实验结果

实验分四块。第一,RoboDojo 主榜单:真实世界 9 模型中 $\pi_{0.5}$ 全面领先——SR 17.06%、MC@25 85.29、MC@50 60.59、MC@75 38.82、MP 59.90、PPL 28.93、FNS 45.39、DRR 100.00、SQS 82.08,CRA 5.22 与 STR 21.81 也较低;而 SR 榜第二名 InternVLA-A1 仅 4.71%,差距悬殊。更有信息量的反例:Spirit v1.5 的 SR 为 0.00% 但 MC@25 达 66.67、FNS 14.85,说明其经常推进却总在收尾失败;GR00T-N1.7 的 SR 仅 0.63% 却有较好的 CRA(10.15)。SR 排名与 SQS/DRR/FNS 排名明显不一致,直接证明只看 SR 不够。仿真榜 16 模型中 $\pi_{0.5}$ 以 11 项指标平均名次第 1 居首(SR 8.68%,SR 第 1 的是 Hy-Embodied-0.5-VLA 11.46%)。第二,五条关键发现:(F1) VLA 整体强于 WAM,Top-3 中 VLA 占比 27% 对 WAM 的 0%,Top-5 为 36% 对 20%;(F2) 规模与性能无正相关——4B 的 Spatial Forcing(平均第 3)胜过多个 5B/6B 模型,中位数分割的四个象限各有 n=1/7/4/4 个模型;(F3) $\pi_{0.5}$ 综合最强;(F4) 模型最擅长 Precision 任务,Open-Vocabulary 最难(分数聚在低端),Long-Horizon 方差最大、最能区分模型(共 24 Generalization/8 Precision/8 Long-Horizon/8 Open-Vocabulary 任务条件);(F5) 仿真与现实仅弱相关——9 个共享模型上 SR 的 Spearman $\rho=0.58$、MP 仅 0.18、FNS 0.22;6 个共享任务的 MP 热力图显示平均差 $-16.5$ 个百分点,Fill pen holder 反而 +8.5,Classify objects 最差 $-31.5$,Hang mugs $-24.5$、Insert tubes $-27.6$,说明精确对齐与复杂接触是真机主要瓶颈。第三,RoboPulse++:Robo-Dopamine (Forward) 最优(Macro-F1 0.77、Accuracy 0.84),显著超过最强通用 VLM 设置 Gemini 3.1 Pro Pair 式(0.58/0.63);Falling 最好 F1 仅 0.63 对 Rising 0.92,短板在召回;155 个 Falling 错误样本中交互关系失败占 78.1%(121 个)、任务顺序失败 21.9%(34 个);上下文依赖场景下 Sequence 式 RoboMeter 大幅领先(Falling 0.901 对 0.408,Overall 0.940 对 0.746)。第四,效率与一致性:单张 H100 处理 100 段视频(约 2.1 小时素材)Robo-Dopamine-4B 需 29.3 分钟(批量推理降至 7.8 分钟),RoboMeter 仅 46 秒,PRIMO (w/ CoT) 需 19.6 小时;PRM 派生 SR 与官方 SR 一致性极好——仿真 MAE 1.57pp/$\rho=0.88$,真实世界 MAE 1.32pp/$\rho=0.96$。

Overview of the OPD Metric Suite
Table 1: Overview of the OPD Metric Suite
Comparisons on RoboDojo-RealWorld
Table 2: Comparisons on RoboDojo-RealWorld
Comparisons on RoboDojo-Sim
Table 3: Comparisons on RoboDojo-Sim
Rankings on RoboDojo-Sim
Table 4: Rankings on RoboDojo-Sim
Data statistics of RoboPulse++ across different sources
Table 5: Data statistics of RoboPulse++ across different sources
Progress-direction performance of judge models on RoboPulse++ (700 episodes)
Table 6: Progress-direction performance of judge models on RoboPulse++ (700 episodes)
Failure-type distribution of Falling intervals
Table 7: Failure-type distribution of Falling intervals
Accuracy of representative Pair Style and Sequence Style PRMs on context-dependent task patterns
Table 8: Accuracy of representative Pair Style and Sequence Style PRMs on context-dependent task patterns
Computational cost of representative progress judge models
Table 9: Computational cost of representative progress judge models
Model-level consistency between PRM-derived and benchmark-reported RoboDojo SR
Table 10: Model-level consistency between PRM-derived and benchmark-reported RoboDojo SR
Proportion of VLAs and WAMs ranked within the Top-3, Top-5, and Top-10 on RoboDojo-Sim
Figure 3: Proportion of VLAs and WAMs ranked within the Top-3, Top-5, and Top-10 on RoboDojo-Sim
Model size versus overall ranking on RoboDojo-Sim
Figure 4: Model size versus overall ranking on RoboDojo-Sim
Performance comparison across different metrics in RoboDojo
Figure 5: Performance comparison across different metrics in RoboDojo
Task-category process profiles on RoboDojo-Sim
Figure 6: Task-category process profiles on RoboDojo-Sim
Simulation-to-real changes in performance ranking for the shared model set
Figure 7: Simulation-to-real changes in performance ranking for the shared model set
Simulation-to-real performance gaps in Max Progress (MP)
Figure 8: Simulation-to-real performance gaps in Max Progress (MP)
Drawdown recovery on the hang mugs task
Figure 10: Drawdown recovery on the hang mugs task
Drawdown recovery on the sort nesting dolls by size task
Figure 11: Drawdown recovery on the sort nesting dolls by size task
Successful-trajectory quality on the stand up bottles task
Figure 12: Successful-trajectory quality on the stand up bottles task
Successful-trajectory quality on the put bottles into dustbin task
Figure 13: Successful-trajectory quality on the put bottles into dustbin task
Failure proximity on the plug in charger task
Figure 14: Failure proximity on the plug in charger task
查看结构化数据
任务指标本文基线提升
RoboPulse++ 进步方向判断(700 条轨迹、2,244 个标注区间) Macro-F1 / Accuracy 专用 PRM 最好:Robo-Dopamine (Forward) 0.77 / 0.84 最强通用 VLM:Gemini 3.1 Pro (Pair) 0.58 / 0.63;GPT-5.4 (Pair) 仅 0.38 / 0.33 Macro-F1 +0.19,Accuracy +0.21
RoboPulse++ Falling(回退)区间识别 Falling F1 0.63(Robo-Dopamine Backward),Rising 最好 F1 为 0.92 通用 VLM 最好 0.37(Gemini 3.1 Pro Pair);多数 PRM 低于 0.5(如 PRIMO 仅 0.08) 相对通用 VLM +0.26,但暴露回退识别是全行业短板
RoboDojo-Sim 具身模型综合排名(16 模型、11 项指标) 平均名次 π0.5 平均第 1(SR 8.68%、MC@25 73.61、DRR 87.46、FNS 21.03) SR 第 1 的 Hy-Embodied-0.5-VLA 平均第 2(SR 11.46%);最差 Spirit v1.5 平均第 16(SR 1.74%) 过程指标给出的排名与 SR 排名显著不同(π0.5 SR 仅列第 2)
RoboDojo-RealWorld 模型评估(9 模型) SR / MC@50 / FNS π0.5:SR 17.06%、MC@50 60.59、FNS 45.39、DRR 100.00 第二名 InternVLA-A1 SR 仅 4.71%;Spirit v1.5 SR 0.00% 但 MC@25 66.67 SR 领先第二名约 3.6 倍;过程指标揭示 SR 无法区分的失败深度差异
PRM 派生 SR 与官方 SR 的一致性(6,076 条 rollout) MAE / Spearman ρ 仿真:MAE 1.57pp、ρ=0.88;真实世界:MAE 1.32pp、ρ=0.96 以 RoboDojo 官方报告 SR 为参照(16 仿真模型 / 9 真实模型) 证明进度曲线可无损复原传统成功率,细粒度化不丢结果信息
仿真-现实性能相关性(9 个共享模型 / 6 个共享任务) Spearman ρ / 平均 MP 差距 SR ρ=0.58、MP ρ=0.18、FNS ρ=0.22;平均 MP 差距 −16.5pp(Fill pen holder +8.5,Classify objects −31.5) 若仿真可代表现实,应 ρ 接近 1、差距接近 0 量化证明仿真性能不能代表真机,精确对齐类任务落差最大

局限与改进

作者承认的局限:其一,Falling(回退)判别是所有被评裁判的主要短板——最好 Falling F1 仅 0.63 而 Rising 达 0.92,差距主要由低召回驱动,即裁判对「任务状态倒退」不敏感,而这恰是 CRA/DRR 等诊断指标最依赖的信号;其二,真实世界设置下多数模型 SR 过低,SQS 无法可靠估计,图 5 的真机雷达图中 SQS 被统一画成公共半径未参与比较;其三,为保证公平,所有分析只基于 RoboDojo 冻结榜单(2026-07-03)公开的 rollout 视频,未微调被评模型,覆盖面受限于该基准的任务集。我自己的观察:FNS/SQS 的 0.5/0.3/0.2 权重与 STR 的噪声阈值 $\epsilon$、平滑窗宽均为手工设定,论文未做敏感性分析或与人类偏好的对齐验证;条件化指标存在可比性陷阱——FNS 只在失败子集、SQS 只在成功子集上聚合,而不同模型子集大小悬殊($\pi_{0.5}$ 真实 SR 17.06% 对 Spirit v1.5 的 0%,后者 SQS 直接无定义/为 0),小样本上方差极大且不可比;DRR 剔除无回撤轨迹后,「从不犯错」的稳定模型反而完全不计入恢复能力评估;默认裁判 Robo-Dopamine (Forward) 是 Pair 式,在上下文依赖的 Falling 场景准确率仅 0.408,用它统一裁判所有模型可能系统性低估「跌落后恢复」类行为的质量——裁判误差恰好与被测能力相关。此外全部结论来自 RoboDojo 一个基准,跨基准泛化(如 LIBERO、SimplerEnv 全量任务)未验证,移动操作、双臂、灵巧手等更复杂形态也未覆盖。

独立分析的弱点

独立分析有五个弱点。第一,裁判误差与被测能力耦合:Robo-Dopamine (Forward) 在上下文依赖的 Falling 场景准确率仅 0.408(Table 8),而这类「完成子目标后又 Undo」的场景正是 DRR 指标的目标人群——用在此场景上偏弱的裁判去度量恢复能力,会产生系统性偏差,DRR 的模型间差异可能部分反映的是裁判缺陷而非模型差异。改进方向:按任务特征自适应切换 Pair/Sequence 裁判,或对 DRR 输出置信区间、用多裁判集成投票。第二,超参缺乏校准:FNS/SQS 的固定权重、STR 阈值 $\epsilon$、高斯平滑与 5 帧滑动平均窗宽都没有和人类评估偏好对齐的证据。改进方向:收集专家对轨迹对的偏好数据,用学习排序(learning-to-rank)校准权重,并报告指标对扰动的稳健性曲线。第三,条件指标的可比性问题:成功子集大小悬殊使 SQS 在弱模型上无定义或高方差,任务/模型级取中位数的聚合方式也未报告样本量。改进方向:报告 bootstrap 置信区间,或对小样本模型采用贝叶斯收缩估计。第四,计算成本跨度两个数量级:RoboMeter 46 秒处理 100 段视频而 PRIMO (w/ CoT) 要 19.6 小时,实际部署者会倾向便宜但 Falling 判别更弱的裁判,形成「越便宜越不准」的逆向激励。改进方向:把强裁判蒸馏为轻量模型,或缓存帧级特征复用。第五,覆盖面单一:所有评估基于 RoboDojo,未在其他基准上展示指标区分度,也未涉及移动操作、双臂协同、形变物体等场景;FNS 用固定的 25/50/75 里程碑假设任务进度可均匀切分,对非线性的长时程任务未必合理。

未来方向

作者提出的方向有三组。第一,更强的 PRM:(1) 时序上下文建模——同一局部动作在不同执行历史下可能意味着进步或倒退,序列式建模更自然,离线评估还可同时利用过去与未来观测;(2) 负进度监督——进步容易从成功/专家轨迹定义,回退后损失多少进度常是模糊的,需要更多真实失败轨迹与更好的负监督;(3) 低成本适配——新任务、新视角、新本体不断出现,基础裁判应支持免全量重训练的快速适配;(4) 更丰富监督——仅用标量进度目标对时序动态的监督有限,未来状态预测、视频预测等时序目标可提供额外信号。第二,更丰富的诊断证据:把进度曲线与视觉、状态、接触、语义证据结合,让报告对执行模式的解释更可解释。第三,打通评估-数据-训练闭环:用过程诊断发现的失败模式指导失败定向的数据采集、重加权与目标设计。基于本文成果还可延伸:把 DRR/FNS 直接用作强化学习的奖励整形信号或 GRPO 式组内比较的依据,让过程评估反哺训练;建立跨 PRM 的持续更新公开排行榜;研究指标对裁判校准误差的敏感性并做不确定性量化;把方向标注协议推广为社区通用的裁判标注标准;扩展到家庭长时程任务与多机器人协作场景的过程画像。

复现评估

复现条件总体较好,属于中等偏易。开源情况:论文配套完整评估套件——基准、指标实现、可视化工具与用户指南,官网 prm-as-a-judge.github.io,报告与交互式轨迹浏览器均自动生成。数据方面成本很低:评测对象是 RoboDojo 公开榜单的 rollout 视频(共 6,076 条对齐:4,606 仿真 + 1,470 真实,覆盖 42 个仿真任务与 18 个真实任务),RoboPulse++ 的 700 条轨迹、2,244 个标注区间来自 9 个公开数据源(LIBERO、RoboCasa、SimplerEnv、RoboTwin 2.0、RoboChallenge-Table30 等),无需自己采集。算力非常友好:默认裁判 Robo-Dopamine-4B 在单张 H100 80GB 上峰值显存仅 11 GiB,100 段视频(256×256、平均 75 秒、共约 2.1 小时素材、1 FPS 采样)29.3 分钟,批量推理降至 7.8 分钟;RoboMeter 仅需 12 GiB、46 秒,24GB 消费级显卡应可运行多数裁判。难点有三处:需自行下载并对齐 RoboDojo 各模型的 rollout 视频与官方 SR(论文用了冻结榜单快照);指标链路含若干超参(平滑窗宽、STR 阈值 $\epsilon$、区间首尾各剔除 2 个采样步的规则)需按用户指南设置,否则数值会有出入;若复现 RoboPulse++ 的标注协议,人工标注 2,244 个区间的工作量不小。指标计算本身都是曲线上的初等运算,代码复现门槛低。