机器人学习中的进度奖励建模:一份全面综述 Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
统一框架梳理机器人学习进度奖励模型:接口、构造机制、数据与评测
前置知识
终端成功信号 (Terminal Success Signal)
机器人学习中常用的稀疏奖励,只在任务最终完成时给出一个二值信号(成功/失败),例如是否抓到物体、是否放到位。它不解释执行过程中间发生了什么,在长程任务中尤其稀缺。
理解这篇综述的核心动机就是理解终端信号的缺陷:它无法区分'前进、停滞、倒退',从而引出对密集'进度奖励'的需求。
进度奖励 / 进度模型 (Progress Reward / Progress Model)
在任务执行过程中持续给出反馈的信号,描述当前状态在整条任务执行轨迹中前进了多少。可以理解为对潜在、历史相关的任务状态 $s_t$ 的标量估计 $p_t \in [0,1]$ 或相对增量 $\Delta_t = p_{t+1} - p_t$,可用于强化学习的稠密奖励、轨迹重排、失败检测等。
这是全文的中心研究对象;区分'进度'与'成功'是把握本文分类体系的前提。
视觉语言模型 (VLM / Video-Language Model)
在大规模图文/视频-文本对上预训练的基础模型(如 CLIP、各类 VLM),能同时理解图像帧与语言指令。本文中它们被用作冻结的语义打分器,或经指令微调后显式预测进度。
近年进度奖励方法的爆发(图1中2017→2026的演进)很大程度上由 VLM 驱动,第3章的四大范式中有两类直接依赖 VLM。
奖励建模与信用分配 (Reward Modeling & Credit Assignment)
将人类偏好、时序结构等弱监督转化为可学习标量奖励 $R_\theta(x_t)$ 的过程;信用分配指把最终的稀疏回报合理归因到中间动作。稠密进度奖励正是为了缓解长程任务中信用分配困难。
进度奖励本质是一种解决信用分配的手段,理解这一点才能看懂第4章为何要区分'保真度'与'下游效用'两类评测。
研究动机
当前机器人学习绝大多数依赖一个终端成功信号:它只告诉机器人任务最终是否完成(如成功率为 0/1),却无法解释某个动作是在推进任务、毫无变化,还是在撤销之前的进度。问题在长程任务里尤其严重——成功结局罕见,机器人在拿到任何有用反馈前要做大量决策(论文反复强调长视野任务的稀疏性)。与此同时,近年进度奖励研究快速爆发:图1 沿 2017→2022→2023→2024→2025→2026 列出了约 40 个方法(Unsup-PR、VIP、RL-VLM-F、GVL、ProgressLM、Robometer、RoboReward、ARM、VLAC、Robo-Dopamine 等),但文献高度碎片化。不同方法使用不同的观测、目标描述、输出信号、监督来源与评测协议,名字相近却解决不同问题,难以横向比较,也无法判断报告的结果到底验证了什么。
本文的目标是本文的目标是为这个碎片化的领域提供一个统一视图。作者把进度奖励建模组织为三个相互衔接的步骤:第2章研究进度模型的'接口'(模型从外部接收什么信息、产出什么形式的进度信号),第3章打开黑盒研究'构造机制'(信号从哪来、如何转化为可用奖励),第4章把方法连到支撑它们的'数据与基准'。三步对应'模型是什么、怎么造、质量如何验证'。在此基础上,作者进一步总结当前方法的主要局限并讨论未来方向,使整个领域能在共同框架下被比较与理解。
与已有工作不同的是,与把所有奖励模型当作单一类别的既有综述不同,本文的独特切入角度是聚焦'进度/任务推进'这一具体语义:它研究方法如何定义、构造、监督和评测任务推进,而不是笼统的奖励。作者的核心创新是'基于接口的视图'——用任务状态表示、目标说明、输出形式三个维度把架构迥异的方法放进同一输入-输出结构来比较;并把数据构造管线(人工→人在回路→全自动)与评测协议(保真度/鲁棒性/下游效用)显式挂钩,指出一个能提升策略的奖励未必忠实代表进度、而准确的进度估计也未必适合闭环控制这一关键张力。
核心方法
作为综述,本文的方法是'分析性框架构建'而非新算法。直觉上,作者认为要比较异质方法,必须先统一它们被描述的方式。技术路线分三层:第一层(第2章)把每个进度模型看作任务条件下的黑盒 $f(\cdot)$,从'当前状态如何表示、任务目标如何说明、输出取什么形式'三个正交维度刻画接口;第二层(第3章)按信号的来源与转化机制把构造方法归纳为 4 大范式;第三层(第4章)按人工参与程度组织数据构造,按'保真度—鲁棒性—下游效用'组织评测。三层之间用图2、图3、图4 三张概念图串联,最终在第5章回收为局限与未来方向。
核心创新是把'进度'重新定义为'潜在的、历史依赖的任务状态',而不是图像/帧可直接观测的属性——同一观测在不同任务下可能代表完全不同的进度,而进度还可能依赖已完成子目标、之前进度是否被撤销。由此作者主张用统一的接口视角(而非架构)来比较方法,并用 4 类输出(状态标量、进度增量 $\Delta_t$、排序偏好、可执行奖励函数)与 4 类构造范式(冻结基础模型打分、时序/相对监督、指令微调、程序化构造)建立双坐标分类。这与既有按网络结构或按任务场景分类的做法本质不同:它强调'进度是什么'先于'用什么模型算'。
方法步骤详情
具体步骤对应四章。§2 接口:状态表示含单观测、时序上下文(在线短窗/离线整条轨迹)、对比式(前后对比给$\Delta_t$、初始-当前、目标条件)、状态访问接口;目标说明含语言/视觉/结构化三类;输出含标量分$s_t\in\mathbb{R}$、增量$\Delta_t=s_{t+1}-s_t$、排序$\tau_i\succ\tau_j$、奖励函数四类。§3 方法分4范式:(1)冻结FM打分(CLIP相似度、TOPReward用'true'token概率、GVL帧序);(2)时序/相对监督(VIP、RL-VLM-F/PEARL/Rank2Reward);(3)指令微调(Robometer、RoboReward、Robo-Dopamine、VLAC、ProgressLM);(4)程序化(Text2Reward、Eureka、Code as Reward、ELEMENTAL)。§4 数据按人工→人在回路→全自动;评测按5类保真度+鲁棒性(泛化/视角/跨具身/非单调)+下游效用(在线RL/离线/重排/规划)。§5 回收为局限。
技术新颖性
技术新颖性体现在'把分类做成可比较的坐标系'。传统综述常列举方法,本文给出三个可对齐的轴:(接口三问)×(构造四范式)×(数据/评测三层),使任一方法都能被定位到一个可比较的单元,并显式暴露其假设。例如指出冻结 FM 打分本质是'语义先验'而非校准奖励(需归一化/阈值/差分),时序监督隐含'进度随时间匀速增长'的错误假设,程序化方法的奖励可能'对实现精确但对意图失准'。再把评测细分为保真度(验证校准/时序/接地)与下游效用(验证RL/重排/规划),点出二者不可互替——这是既有综述未明确区分的关键洞察。
实验结果
作为综述,本文的核心'发现'是领域结构与若干判读。第一,文献沿时间线快速演进:图1 显示早期(2017-2022)靠演示与时序学目标邻近度,2023 年转向基础模型相似度与语言条件奖励,2024 年出现偏好学习与LLM自动生成奖励,2025-2026 年大量系统用大 VLM 估计进度/成功(GVL、ProgressLM、Robometer、RoboReward 等约 40 个方法被纳入)。第二,4 大构造范式各有取舍:冻结范式零样本可用但需后处理;时序/相对监督易获取却不直接给标量;指令微调把进度预测做成显式能力(如 Robometer 联合训练进度/成功/偏好,ProgressLM 先推理再打分);程序化构造可解释但依赖状态可访问。第三,评测高度异质且常混淆:时序排序、标量误差、偏好准确率、成功率验证的是不同性质,一个能提升策略的奖励未必忠实代表进度。第四,作者识别出当前方法的 4 大瓶颈:粗粒度(多模型用稀疏采样帧/离散进度桶)、固定速率假设、VLM 推理延迟限制在线部署、长程记忆不足。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 标量校准 (Scalar Calibration) | 回归误差 / 相关系数 | 综述归类:RoboReward、ProgressLM、Robo-Dopamine 等用百分比/评分量表/hop 值作参考 | (综述无单一基线对比) | 提供进度最直接的绝对估计证据,但仅覆盖有显式参考标签的方法 |
| 时序一致性 (Temporal Consistency) | 排序准确率 / 秩相关 / 单调性 | 综述归类:GVL、OpenGVL、Chen 等(2026a)、VLAC 等评测成功轨迹中后期帧是否得分更高 | (综述无单一基线对比) | 主要衡量时序一致性,而非绝对校准——易被'随时间递增'的捷径满足 |
| 下游效用 (Downstream Utility) | 成功率 / 样本效率 / 学习稳定性 | 综述归类:RoboReward、ARM、VLAC、Text2Reward、Eureka 等用于在线 RL | (综述无单一基线对比) | 策略性能提升不能反证奖励忠实代表进度,受探索/策略架构/环境动力学影响 |
局限与改进
作者明确承认四点:(1)粗粒度——多数模型用稀疏帧、短clip、离散进度桶或粗任务阶段,会漏掉精细对齐、轻微物体位移、不稳定抓取等小而关键的变化;(2)固定速率假设——用时序顺序或归一化时间戳作监督会鼓励进度随时间平滑增长,但真实进度常突变(达成子目标骤增)或长期停滞;(3)推理延迟——大 VLM 要处理多帧、解读指令、推理后才出奖励,难以在每个控制步使用;(4)长程记忆不足——重复动作(如多次抓取)在视觉上几乎相同但完成计数不同,无记忆模型会给相似进度,短观测窗抓不到窗外关键事件。我额外观察:本文是综述无实验,所有'结论'来自文献综合而非可控对照;且跨方法比较仍缺统一基准,作者也指出名字相近的方法解决不同问题,使任何定量横评都难以成立。
独立分析的弱点
独立分析下,第一弱点是评测可信度:综述归纳出的 5 类保真度基准彼此不互通,且多数方法只在'成功+单调'演示上评测,无法暴露对失败/倒退/重试的误判(作者在 §4.3 也承认这是最苛刻却最必要的设置)——改进方向是建立含非单调执行的统一基准,强制报告任务接地(反事实指令)与可答性(遮挡/视角不全)。第二弱点是工程假设脆弱:时序监督隐含进度匀速、状态访问假设符号变量可获取,在真实物理场景常不成立——改进是引入力/触觉/本体感知多模态融合与自适应时间建模。第三弱点是延迟与记忆的工程鸿沟:作者提出'轻量模型频繁更新、大模型仅在关键转换调用'的分层方案,但未给出具体算力/延迟预算——改进是蒸馏与流式编码器落地。第四弱点是综述本身缺定量横评与可复现榜单。
未来方向
作者提出的方向集中在 §5:更高时空分辨率的细粒度进度(融合本体感知/力/触觉)、时间自适应进度模型(按任务事件与阶段难度调节进度增量幅度,并显式表示停滞与倒退)、降低在线延迟(流式编码器、缓存任务表征、蒸馏、分层查询),以及维护紧凑任务记忆(记录已完成/待办/失效子目标以定位当前观测在整条执行中的位置)。基于本成果可延伸的方向还包括:把进度信号用于偏好学习的自动标注与数据筛选规模化、把跨具身迁移(人类/网络视频→机器人)做成显式进度对齐、以及构建一个对标 ImageNet 的'进度基准'以缓解横评缺失。
复现评估
本文是综述,本身不涉及实验复现,但作者提供了配套资源仓库 https://github.com/sterzhang/Awesome-Progress-Models 用于追踪所综述的方法与基准,便于读者按接口/范式/数据三层定位复现任一具体方法。综述所引约 40 个方法多数本身有论文与部分开源代码(如 RL-VLM-F、Eureka、Text2Reward、Code as Reward 等),复现难度因方法而异:冻结 FM 与程序化方法算力门槛低(主要成本在策略训练侧),而指令微调范式(Robometer、ProgressLM 等)需大规模带标签轨迹与 VLM 微调算力。整体可复现性中等偏上:框架清晰、资源齐全,但缺统一评测脚手架,跨方法定量对比仍需读者自行搭建。
论文图表
时间轴图,沿 2017-2022→2023→2024→2025→2026 展示进度奖励建模方法的演进,把约 40 个方法排成 5 列。早期是目标邻近度与表征学习(VIP、R3M、LOReL、Unsup-PR),2023 转向 CLIP/语言条件(CLIP-ZS、CLIP-Reward、Text2Reward),2024 出现偏好与LLM生成(RL-VLM-F、Eureka、CodeAsReward、Rank2Reward),2025-2026 大量 VLM 进度系统涌现(GVL、OpenGVL、ProgressLM、Robometer、RoboReward、ARM、VLAC、Robo-Dopamine、ProgressLM 等)。
这张图是整篇综述的'地图',一图说明为什么领域需要被统一框架组织:方法数量爆发式增长且术语混乱,读者可据此定位任何具体方法。