RL²-VLA:视觉-语言-动作模型的自适应RL潜在组合式引导与测试时扩展 RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
在VLA预测失败时用RL策略组合式引导动作流,OOD任务成功率最高提升17.3%
前置知识
视觉-语言-动作模型(Vision-Language-Action, VLA)
VLA 是一类以视觉图像、语言指令和机器人本体感知为输入,直接输出机器人动作(通常是未来若干步的动作块 $a_{t:t+H}$)的通用策略模型。它借助大规模机器人示教数据和视觉-语言模型(VLM)的强先验,能跨任务、跨物体泛化。代表工作有 OpenVLA(自回归式)、π0/π0.5(流匹配式)。本文以这些 VLA 为冻结的「底座」,在其之上做推理时引导。
整篇论文都是围绕如何在不重训 VLA 的前提下,在部署时「矫正」它的动作输出,理解 VLA 的输入输出与训练范式是理解所有引导方法的前提。
流匹配(Flow Matching)策略
流匹配是扩散类生成模型的一种形式,把生成过程建模为从噪声分布到数据分布的连续流(一个 ODE),模型学习的是速度场 $v(o, a, \ell, k)$,沿 $k$ 从 1 到 0 逐步把初始噪声样本传输为合法动作轨迹。π0/π0.5 的动作头就是流匹配头。本文的关键操作「组合式引导」正是通过加权平均两条速度场来实现的。
理解流匹配的速度场概念,才能看懂 RL² 的核心操作 $v_{ ext{comp}} = w v_{ ext{VLA}} + (1-w) v_{ ext{RL}}$ 是如何在去噪过程的每一步混合两个策略的。
测试时扩展(Test-Time Scaling, TTS)
TTS 指在推理阶段投入更多算力(采样更多候选、更深的推理)来提升性能,而不改动模型权重。在 VLA 领域,RoboMonkey 提出反复采样动作块再用验证器选最好的范式,并首次刻画了「样本数 vs 动作误差」的幂律缩放;CoVer 进一步用语言指令改写来增加样本多样性。本文扩展了这条线,并首次区分成功/失败两种状态下的缩放规律。
本文最核心的科学发现就是「成功态与失败态下的测试时缩放规律本质不同」,这是 RL² 自适应设计的理论依据。
Q-learning with Adjoint Matching(QAM)离线强化学习
训练流匹配 actor-critic 时,直接从 critic $Q(s,a)$ 反传梯度穿过策略的多步去噪过程在数值上不稳定。QAM 用一个伴随状态 $\tilde{g}_t$ 作为时间相关的引导信号,从终端动作 $a_1$ 出发反向解一个 ODE 计算得到,再让策略的速度场 $f_\theta$ 去匹配这个信号,从而收敛到行为正则化的最优分布 $\pi(a|s) \propto \pi_\beta(a|s)\exp(\tau Q(s,a))$。本文用它训练「引导策略」。
QAM 是 RL² 的「how to steer」部分的训练引擎,理解它能明白为什么一个轻量级离线 RL 策略能在不在线交互的情况下产生超越示教分布的动作多样性。
保形预测(Conformal Prediction, CP)
保形预测是一种分布无关的统计框架,能为任意预测器构造有有限样本覆盖率保证的预测区间/集合。本文采用单侧时变 CP:给定失败分数序列 $s_{1:T}$ 和显著性水平 $\alpha$,用成功 rollout 校准出阈值带 $\delta_t = \mu_t + h_t$,使得任何新的成功 rollout 以至少 $1-\alpha$ 的概率满足 $s_t < \delta_t$,超过即触发引导。
CP 是 RL² 的「when to steer」触发器,把一个连续的失败概率分数转化为有时序覆盖保证的二元干预决策,是自适应设计的统计基础。
研究动机
VLA 模型虽然在域内任务上表现出色,但在 OOD 场景下成功率急剧下降:如图 2 所示,域内语言指令下成功率 38.2%,OOD 指令跌到 14.2%;域内环境 70.2%,OOD 环境只剩 36.0%。为在不重训的前提下弥补这种退化,现有方法分两条线,但都有硬伤。其一是推理时引导:离散动作选择(采样多候选 + 验证器选优,如 V-GPS、RoboMonkey、CoVer)虽保留了策略学到的动作分布,但样本都来自同一个 VLA,会继承相关的失败模式——改写指令往往只是产生同一个失败的变体;可微引导(如 DynaGuide、VLS、VLA-Pilot)依赖外部 VLM 评分或世界模型,但 VLM 缺乏物理接地、世界模型有预测误差且推理昂贵。其二是测试时扩展,反复采样或改写本质上仍是同一个策略的再抽样。更根本的是,所有现有方法都用固定的干预策略、在每个时间步都施加同样的干预,完全不分「底座此刻本来就要成功」还是「此刻快要失败」——这种一刀切既浪费算力,又会在动作已经正确时反而把它扰坏。
本文的目标是本文要构建一个自适应的推理时引导框架,同时回答两个问题:怎样引导(how to steer)和何时引导(when to steer)。对「怎样」,目标是在不修改冻结 VLA 的前提下,注入超越模仿学习动作分布的真正行为多样性,把大规模 IL 的强行为先验和离线 RL 的探索多样性结合起来。对「何时」,目标是只在底座 VLA 被预测为将要失败的时间步激活引导,而不是沿整条轨迹无差别施加。可量化的指标包括:在 SIMPLER、PolaRiS 等基准的域内和 OOD 任务上,相对最强 TTS 基线取得约 +10% 到 +17% 的成功率提升,同时只引入可忽略的额外推理延迟。框架还必须模块化,兼容不同 VLA(自回归的 OpenVLA、流匹配的 π0/π0.5)、不同 RL 配方(QAM、CQL)和不同验证器(RoboMonkey、CoVer)。
与已有工作不同的是,本文的独特切入角度是一种「以失败为中心、类人」的视角。现有方法是无差别的、且局限在策略内部——要么从同一策略多采样,要么每步都扰动。作者观察到人类并非如此:伸手拿桌上显眼杯子时直接抓、不加思索,但杯子被遮挡时才会主动拓宽备选方案(换角度、先移开障碍)。这暗示「多样性只在默认行为可能失败时才有用,成功时反而是多余扰动」。为量化这一点,作者首次建立了区分成功态与失败态的测试时缩放规律,发现归一化动作误差与样本数呈指数幂律,且组合式引导在失败元组上缩放最优、在成功元组上却最差——这一实验洞见直接催生了自适应设计。第二个被忽视的点是引导的「来源」:不依赖外部 VLM/世界模型(缺物理接地),也不从同一 VLA 多采样(相关失败),而是用一个训练在 VLA 潜在表示上的轻量级离线 RL 策略,诱导出真正多样、能避开失败模式的行为。
核心方法
直觉上,可以把 VLA 看作「值得信任的默认技能」、把轻量级 RL 策略看作「仅在默认技能出岔子时才请教的顾问」——像一位资深外科医生,常规操作自信完成,遇到意外才寻求第二意见。技术上,RL² 在冻结 VLA 外围组合了三个协同模块。第一,潜在 RL 策略(顾问)离线训练在与 VLA 相同的示教数据上,但采用 RL 范式,条件化于从 VLA 动作专家提取的丰富内部潜在表示。第二,推理时若未检测到失败,系统直接从底座 VLA 采样候选;一旦检测到失败,就在每一个流匹配步把 RL 策略的速度场与 VLA 速度场加权平均(组合),得到融合了 IL 先验和 RL 多样性的候选动作。第三,验证器给所有候选打分,执行得分最高的。整个流水线只增加很少延迟,因为 RL 策略和失败检测器都很轻量且都作用在 VLA 潜在上——表 IV 显示在 RTX5090 上 QAM 仅 12–48ms、SAFE 仅 1–2ms,而 π0 本身要 232–3093ms。
最核心的一个想法是发现并利用「测试时缩放的不对称性」:引导对失败态有利、对成功态有害,因此应当自适应施加。这一想法由首次形式化的、区分两种状态的缩放规律分析支撑(第 IV 节)。技术载体是「组合式引导」——用高斯权重采样做流速度混合 $v_{\text{comp}} = w\,v_{\text{VLA}} + (1-w)\,v_{\text{RL}}$,$w \sim \mathcal{N}(0.5, 0.25)$ 并截断到 $[0,1]$。它与既有方法有本质区别:不像反复采样/改写那样从同一策略抽样,而是借助一个独立训练的 RL 分布,打破「相关失败模式」陷阱;不像可微引导那样依赖外部 VLM/世界模型,避免了它们的物理接地误差;不像残差/在线 RL 策略那样需要在线交互。多样性来自离线 RL 把行为推到示教主导模式之外(图 12 的 PCA 验证:VLA 动作簇远离真值,RL² 把簇整体推向真值)。从高斯分布抽样组合权重,让每个候选探索不同的 IL/RL 折中,给验证器一张真正多样的菜单——这就是「IL 行为先验 + RL 探索多样性」可控、模块化融合的本质。
方法步骤详情
步骤 1(潜在 RL 策略训练):冻结 VLA,把每个离线元组过 VLA 提取动作专家潜在 $e_i$,将 BridgeV2/DROID 扩成带潜在的版本。对 π0/π0.5 用 QAM 训流匹配 actor,对 OpenVLA 训 CQL 价值策略;QAM 通过反向解 ODE 算出伴随状态作为引导信号、让策略速度场去匹配它,从而稳定收敛到行为正则化的最优动作分布。步骤 2(失败检测 + CP):训练以 VLA 潜在为输入的 LSTM 输出失败分数 $s_t$(每任务采 100 条 rollout×3 种子,BCE 损失),再用成功 rollout 校准时变 CP 带 $\delta_t=\mu_t+h_t$,用平衡准确率启发式从 top-3 $\alpha$ 选最优。步骤 3(推理):提取潜在、预测 $s_t$;若超过阈值,抽 $N$ 个高斯组合权重,每个候选跑 $T$ 步流匹配、每步把 $v_{\text{VLA}}$ 与 $v_{\text{RL}}$ 加权混合,否则直接从 VLA 抽 $N$ 个候选;验证器打分后执行最优。对自回归 VLA 改用高斯扰动。
技术新颖性
新颖性体现在四个维度。(1)概念上:首次为 VLA 引导在成功态与失败态下分别建立测试时缩放规律,把「多样性助失败、害成功」的不对称性形式化为指数幂律——此前 TTS 工作(RoboMonkey、CoVer)把所有状态混为一谈。(2)架构上:把引导 RL 策略条件化在 VLA 动作专家的潜在表示上,而非原始观测——消融显示这带来高达 +38.8% 的差距,因为动作专家特征比 ResNet 等小编码器表达力强得多。(3)组合方式上:用高斯权重抽样做流速度组合,在每个样本上混合 IL 与 RL 分布,区别于残差策略加法(Policy Decorator、PLD)或噪声输入引导(DSRL),且无需在线交互。(4)触发机制上:用潜在条件化的多任务失败检测器(SAFE)配合保形预测作为引导触发器,比「VLM 当检测器」(CoVer)高最多 +3.5%,比全程引导高最多 +16.7%(任务级)。基于平衡准确率的 $\alpha$ 选择启发式也是一项实用新贡献。
实验结果
RL² 在 OOD 鲁棒性上稳定提升。SIMPLER 域内(OpenVLA)平均比 Repeated 高 +7.5%、任务级最高 +19.4%;OOD 语言提示(π0)平均 +10.1%(最高 +14.7%);OOD 环境(π0)平均 +8.5%(最高 +14.6%)。PolaRiS OOD(π0.5,表 I)上自适应 RL² 平均成功率 42.7%(±2.3),对 Rephrase 31.8%(±3.4) 平均 +10.9%,Move Latte Cup 从 48.7% 提到 66.0%(+17.3%,全文最大单项提升)。缩放规律(图 4)是科学骨架:失败元组上组合式引导随样本数缩放最优、成功元组上反而最差,证明自适应触发必要。消融确认组件有效:RL 优于 BC、潜在优于原始观测(+38.8%)、SAFE 触发优于 CoVer-VLM(+3.5%)且优于全程引导(+16.7% 任务级),$\alpha$ 启发式能从 top-3 恢复 88.5% 最大性能。真实硬件 PiperX 上自适应 RL² 平均比 Rephrase 高 +17.5%、比非自适应 RL² 高 +14.2%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| PolaRiS OOD — Move Latte Cup(π0.5) | 成功率 S(%) | 66.0% | 48.7%(Rephrase) | +17.3%(全文最大单项提升) |
| PolaRiS OOD 三任务平均(π0.5) | 成功率 S(%) | 42.7% (±2.3) | 31.8% (±3.4)(Rephrase) | +10.9% |
| PolaRiS OOD 三任务平均(π0.5) | 进度率 P(%) | 63.0% (±3.4) | 55.2% (±1.4)(Rephrase) | +7.8% |
| SIMPLER OOD 语言提示(π0),Spoon on Towel | 任务成功率 | 自适应 RL² | Rephrase | +14.7% |
| SIMPLER 域内(OpenVLA) | 任务成功率 | 自适应 RL² | Repeated | 平均 +7.5%,最高 +19.4% |
| 真实硬件 PiperX 四个 OOD 任务平均 | 成功率 | 自适应 RL² | Rephrase | +17.5%(对比非自适应 RL² 再 +14.2%) |
| 消融:潜在 vs 原始观测(OpenVLA+CQL) | 成功率 | 用 VLA 动作专家潜在 | 用原始观测 | +38.8% |
局限与改进
作者承认三点。引导函数:只测了轻量级引导函数,尚未与大模型可微引导(VLM、其他 VLA)对比。失败检测:平衡准确率 $\alpha$ 启发式需要额外的测试时评估,可能存在比平衡准确率更好的度量(如检测时效性);失败检测器目前依赖在线 rollout 采集训练,限制了泛化——事实上真实世界的 SAFE 模型无法从仿真迁移、不得不在真实 rollout 上重训,这是个不可忽视的工程负担。验证器:假设存在一个鲁棒的验证器,在真正新颖的场景下未必成立。我自己的观察:(a)所有提升都是在准神谕级验证器(RoboMonkey/CoVer)下测得的,验证器一旦失败会把误差传导下去,若验证器把坏候选排第一,RL² 也救不了;(b)在最难任务上绝对成功率仍然不高(如 Tape into Container 仅 28.7%);(c)框架只用离线 RL,多样性的上限受限于离线数据——BridgeV2/DROID 里没出现过的真正新颖恢复动作无法被「发明」;(d)CP 带是按任务、按种子校准的,暗示每次新部署都有一定的调参成本。
独立分析的弱点
(1)验证器依赖是最软的软肋:框架假设有可靠验证器选最优候选,但验证器恰好在 OOD 场景(RL² 的目标场景)泛化差,一旦把坏候选排第一 RL² 也救不了。改进:把 RL 引导策略与验证器协同训练(作者已列为未来工作),或学习内部自验证信号。(2)离线数据束缚的多样性:引导来自训练在 BridgeV2/DROID 上的离线 RL 策略,多样性受限于这些数据;对真正未见过的物体(如工具箱里的胶带)RL 策略并无相关经验。改进:按部署做在线/轻量微调引导头,或引入小规模世界模型 rollout。(3)按任务校准 CP 的开销:$\alpha$ 启发式虽把搜索砍到 top-3,但每个新任务仍要采 rollout、校准 CP。改进:元学习 CP 带或用单一全局带配自适应阈值。(4)最难任务上绝对性能仍有限:即使 +17.3%,Move Latte Cup 也只到 66%、Tape into Container 28.7%。改进:把 RL² 与思维链推理或分层规划器叠加。(5)高斯组合权重是启发式设计,一个可学习、随状态上下文调节的 IL/RL 混合调度器可能更优。
未来方向
作者提出:(a)与来自大 VLM/VLA 的可微引导对比;(b)用比平衡准确率更好的度量(如检测时效性)改进 $\alpha$ 选择;(c)在大规模离线数据上训练失败检测器而非在线 rollout,以提升泛化并消除数据采集步骤;(d)把 RL 引导策略与验证器协同训练,放松「强验证器」假设。基于成果可延伸的方向:成功/失败不对称的缩放规律是一条通用原理,可移植到其他测试时扩展领域(LLM 推理、扩散图像生成)——「只在卡住时多想」普遍适用;潜在条件化的 RL 顾问模式可推广到其他需要在部署时自适应的冻结基础模型(如用小 RL 头引导 LLM 工具使用);把 RL² 与具身思维链(ECoT)规划器结合,是长时程任务的自然下一步,那里既需要推理又需要恢复。
复现评估
可复现性中上。作者声明论文最终版会发布代码并提供项目主页(rl2-vla.github.io)。超参给得很全:QAM(batch 256、critic 集成 10、流步 10、π0/π0.5 分别 500k/1M 步)、CQL($\alpha=1.0$);SAFE LSTM 给出每个 VLA 的聚合方式与 ROC-AUC(π0 仿真 90.4%、π0.5 82.0%、真实世界 85.4%)。算力:2× NVIDIA L40s 做训练(流式 4.5–9 小时)。数据:公开的 BridgeV2 和 DROID,外加按任务采集的 rollout(SAFE 每 100 条/种子 × 3 种子)。外部依赖多数开源(RoboMonkey/CoVer 给了 HuggingFace 链接),但 π0.5 权重与 PolaRiS 仿真的可获取性可能限制完整复刻。主要摩擦:按任务采 rollout 校准 CP、以及真实世界 SAFE 需重训。难度中等——一支有 2 张 L40、能拿到底座 VLA 的团队,数周内可复现仿真结果。
论文图表
左图是缩放规律:绿色(RL 组合式引导)在失败态下降动作误差最有效,但会不必要地扰动已经准确的成功态,从而 motivating 自适应引导。右图是部署示例:RL² 先用底座 VLA(橙色)准确抓起胶带,在检测到即将失败后切换到组合式引导(绿色),生成把胶带举得足够高、能成功放进工具箱的动作候选。
这张图是整篇论文的电梯演讲:一图说清「为什么需要自适应」和「自适应长什么样」。左半的缩放规律是核心科学发现的预告,右半的真实部署示例把抽象方法落到具体机器人行为上,是理解全文动机的最佳入口。
上半行是域内语言指令(如“把拿铁杯放到砧板上”)和域内环境,给出 38.2% 与 70.2% 的成功率;下半行是 OOD 改写指令(如“把杯子移到板中央”)和 OOD 环境(橙汁、玩具恐龙、胶带等未见物体),成功率跌到 14.2% 与 36.0%。
这张图定义了本文要解决的问题——VLA 的 OOD 退化,并用具体数字量化了退化的严重程度。所有后续方法设计和实验都围绕缩小这个 24 个百分点(指令)和 34 个百分点(环境)的差距展开。
横轴是生成的动作样本数,纵轴是归一化动作误差(NRMSE),分失败元组(上)和成功元组(下)两组曲线。失败态下组合式引导(RL²)和 RBF 缩放最优、误差最低;成功态下它们却是最差的方法之一,普遍劣于 Rephrase 基线。
这是全文最重要的科学图,是「自适应」设计的实证基石。它把「多样性在失败时有用、成功时有害」从一个直觉论断变成了可测量的幂律曲线,直接论证了为什么不能全程引导、必须只在失败时引导。读懂这张图就读懂了 RL² 一半。