← 返回 2026-08-03

RL²-VLA:视觉-语言-动作模型的自适应RL潜在组合式引导与测试时扩展 RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti 📅 2026-07-30 👍 8 2026-08-08 18:30
失败检测 机器人操作 流匹配 测试时扩展 离线强化学习 视觉-语言-动作模型

在VLA预测失败时用RL策略组合式引导动作流,OOD任务成功率最高提升17.3%

前置知识

视觉-语言-动作模型(Vision-Language-Action, VLA)

VLA 是一类以视觉图像、语言指令和机器人本体感知为输入,直接输出机器人动作(通常是未来若干步的动作块 $a_{t:t+H}$)的通用策略模型。它借助大规模机器人示教数据和视觉-语言模型(VLM)的强先验,能跨任务、跨物体泛化。代表工作有 OpenVLA(自回归式)、π0/π0.5(流匹配式)。本文以这些 VLA 为冻结的「底座」,在其之上做推理时引导。

整篇论文都是围绕如何在不重训 VLA 的前提下,在部署时「矫正」它的动作输出,理解 VLA 的输入输出与训练范式是理解所有引导方法的前提。

流匹配(Flow Matching)策略

流匹配是扩散类生成模型的一种形式,把生成过程建模为从噪声分布到数据分布的连续流(一个 ODE),模型学习的是速度场 $v(o, a, \ell, k)$,沿 $k$ 从 1 到 0 逐步把初始噪声样本传输为合法动作轨迹。π0/π0.5 的动作头就是流匹配头。本文的关键操作「组合式引导」正是通过加权平均两条速度场来实现的。

理解流匹配的速度场概念,才能看懂 RL² 的核心操作 $v_{ ext{comp}} = w v_{ ext{VLA}} + (1-w) v_{ ext{RL}}$ 是如何在去噪过程的每一步混合两个策略的。

测试时扩展(Test-Time Scaling, TTS)

TTS 指在推理阶段投入更多算力(采样更多候选、更深的推理)来提升性能,而不改动模型权重。在 VLA 领域,RoboMonkey 提出反复采样动作块再用验证器选最好的范式,并首次刻画了「样本数 vs 动作误差」的幂律缩放;CoVer 进一步用语言指令改写来增加样本多样性。本文扩展了这条线,并首次区分成功/失败两种状态下的缩放规律。

本文最核心的科学发现就是「成功态与失败态下的测试时缩放规律本质不同」,这是 RL² 自适应设计的理论依据。

Q-learning with Adjoint Matching(QAM)离线强化学习

训练流匹配 actor-critic 时,直接从 critic $Q(s,a)$ 反传梯度穿过策略的多步去噪过程在数值上不稳定。QAM 用一个伴随状态 $\tilde{g}_t$ 作为时间相关的引导信号,从终端动作 $a_1$ 出发反向解一个 ODE 计算得到,再让策略的速度场 $f_\theta$ 去匹配这个信号,从而收敛到行为正则化的最优分布 $\pi(a|s) \propto \pi_\beta(a|s)\exp(\tau Q(s,a))$。本文用它训练「引导策略」。

QAM 是 RL² 的「how to steer」部分的训练引擎,理解它能明白为什么一个轻量级离线 RL 策略能在不在线交互的情况下产生超越示教分布的动作多样性。

保形预测(Conformal Prediction, CP)

保形预测是一种分布无关的统计框架,能为任意预测器构造有有限样本覆盖率保证的预测区间/集合。本文采用单侧时变 CP:给定失败分数序列 $s_{1:T}$ 和显著性水平 $\alpha$,用成功 rollout 校准出阈值带 $\delta_t = \mu_t + h_t$,使得任何新的成功 rollout 以至少 $1-\alpha$ 的概率满足 $s_t < \delta_t$,超过即触发引导。

CP 是 RL² 的「when to steer」触发器,把一个连续的失败概率分数转化为有时序覆盖保证的二元干预决策,是自适应设计的统计基础。

研究动机

VLA 模型虽然在域内任务上表现出色,但在 OOD 场景下成功率急剧下降:如图 2 所示,域内语言指令下成功率 38.2%,OOD 指令跌到 14.2%;域内环境 70.2%,OOD 环境只剩 36.0%。为在不重训的前提下弥补这种退化,现有方法分两条线,但都有硬伤。其一是推理时引导:离散动作选择(采样多候选 + 验证器选优,如 V-GPS、RoboMonkey、CoVer)虽保留了策略学到的动作分布,但样本都来自同一个 VLA,会继承相关的失败模式——改写指令往往只是产生同一个失败的变体;可微引导(如 DynaGuide、VLS、VLA-Pilot)依赖外部 VLM 评分或世界模型,但 VLM 缺乏物理接地、世界模型有预测误差且推理昂贵。其二是测试时扩展,反复采样或改写本质上仍是同一个策略的再抽样。更根本的是,所有现有方法都用固定的干预策略、在每个时间步都施加同样的干预,完全不分「底座此刻本来就要成功」还是「此刻快要失败」——这种一刀切既浪费算力,又会在动作已经正确时反而把它扰坏。

本文的目标是本文要构建一个自适应的推理时引导框架,同时回答两个问题:怎样引导(how to steer)和何时引导(when to steer)。对「怎样」,目标是在不修改冻结 VLA 的前提下,注入超越模仿学习动作分布的真正行为多样性,把大规模 IL 的强行为先验和离线 RL 的探索多样性结合起来。对「何时」,目标是只在底座 VLA 被预测为将要失败的时间步激活引导,而不是沿整条轨迹无差别施加。可量化的指标包括:在 SIMPLER、PolaRiS 等基准的域内和 OOD 任务上,相对最强 TTS 基线取得约 +10% 到 +17% 的成功率提升,同时只引入可忽略的额外推理延迟。框架还必须模块化,兼容不同 VLA(自回归的 OpenVLA、流匹配的 π0/π0.5)、不同 RL 配方(QAM、CQL)和不同验证器(RoboMonkey、CoVer)。

与已有工作不同的是,本文的独特切入角度是一种「以失败为中心、类人」的视角。现有方法是无差别的、且局限在策略内部——要么从同一策略多采样,要么每步都扰动。作者观察到人类并非如此:伸手拿桌上显眼杯子时直接抓、不加思索,但杯子被遮挡时才会主动拓宽备选方案(换角度、先移开障碍)。这暗示「多样性只在默认行为可能失败时才有用,成功时反而是多余扰动」。为量化这一点,作者首次建立了区分成功态与失败态的测试时缩放规律,发现归一化动作误差与样本数呈指数幂律,且组合式引导在失败元组上缩放最优、在成功元组上却最差——这一实验洞见直接催生了自适应设计。第二个被忽视的点是引导的「来源」:不依赖外部 VLM/世界模型(缺物理接地),也不从同一 VLA 多采样(相关失败),而是用一个训练在 VLA 潜在表示上的轻量级离线 RL 策略,诱导出真正多样、能避开失败模式的行为。

核心方法

直觉上,可以把 VLA 看作「值得信任的默认技能」、把轻量级 RL 策略看作「仅在默认技能出岔子时才请教的顾问」——像一位资深外科医生,常规操作自信完成,遇到意外才寻求第二意见。技术上,RL² 在冻结 VLA 外围组合了三个协同模块。第一,潜在 RL 策略(顾问)离线训练在与 VLA 相同的示教数据上,但采用 RL 范式,条件化于从 VLA 动作专家提取的丰富内部潜在表示。第二,推理时若未检测到失败,系统直接从底座 VLA 采样候选;一旦检测到失败,就在每一个流匹配步把 RL 策略的速度场与 VLA 速度场加权平均(组合),得到融合了 IL 先验和 RL 多样性的候选动作。第三,验证器给所有候选打分,执行得分最高的。整个流水线只增加很少延迟,因为 RL 策略和失败检测器都很轻量且都作用在 VLA 潜在上——表 IV 显示在 RTX5090 上 QAM 仅 12–48ms、SAFE 仅 1–2ms,而 π0 本身要 232–3093ms。

最核心的一个想法是发现并利用「测试时缩放的不对称性」:引导对失败态有利、对成功态有害,因此应当自适应施加。这一想法由首次形式化的、区分两种状态的缩放规律分析支撑(第 IV 节)。技术载体是「组合式引导」——用高斯权重采样做流速度混合 $v_{\text{comp}} = w\,v_{\text{VLA}} + (1-w)\,v_{\text{RL}}$,$w \sim \mathcal{N}(0.5, 0.25)$ 并截断到 $[0,1]$。它与既有方法有本质区别:不像反复采样/改写那样从同一策略抽样,而是借助一个独立训练的 RL 分布,打破「相关失败模式」陷阱;不像可微引导那样依赖外部 VLM/世界模型,避免了它们的物理接地误差;不像残差/在线 RL 策略那样需要在线交互。多样性来自离线 RL 把行为推到示教主导模式之外(图 12 的 PCA 验证:VLA 动作簇远离真值,RL² 把簇整体推向真值)。从高斯分布抽样组合权重,让每个候选探索不同的 IL/RL 折中,给验证器一张真正多样的菜单——这就是「IL 行为先验 + RL 探索多样性」可控、模块化融合的本质。

方法步骤详情

步骤 1(潜在 RL 策略训练):冻结 VLA,把每个离线元组过 VLA 提取动作专家潜在 $e_i$,将 BridgeV2/DROID 扩成带潜在的版本。对 π0/π0.5 用 QAM 训流匹配 actor,对 OpenVLA 训 CQL 价值策略;QAM 通过反向解 ODE 算出伴随状态作为引导信号、让策略速度场去匹配它,从而稳定收敛到行为正则化的最优动作分布。步骤 2(失败检测 + CP):训练以 VLA 潜在为输入的 LSTM 输出失败分数 $s_t$(每任务采 100 条 rollout×3 种子,BCE 损失),再用成功 rollout 校准时变 CP 带 $\delta_t=\mu_t+h_t$,用平衡准确率启发式从 top-3 $\alpha$ 选最优。步骤 3(推理):提取潜在、预测 $s_t$;若超过阈值,抽 $N$ 个高斯组合权重,每个候选跑 $T$ 步流匹配、每步把 $v_{\text{VLA}}$ 与 $v_{\text{RL}}$ 加权混合,否则直接从 VLA 抽 $N$ 个候选;验证器打分后执行最优。对自回归 VLA 改用高斯扰动。

技术新颖性

新颖性体现在四个维度。(1)概念上:首次为 VLA 引导在成功态与失败态下分别建立测试时缩放规律,把「多样性助失败、害成功」的不对称性形式化为指数幂律——此前 TTS 工作(RoboMonkey、CoVer)把所有状态混为一谈。(2)架构上:把引导 RL 策略条件化在 VLA 动作专家的潜在表示上,而非原始观测——消融显示这带来高达 +38.8% 的差距,因为动作专家特征比 ResNet 等小编码器表达力强得多。(3)组合方式上:用高斯权重抽样做流速度组合,在每个样本上混合 IL 与 RL 分布,区别于残差策略加法(Policy Decorator、PLD)或噪声输入引导(DSRL),且无需在线交互。(4)触发机制上:用潜在条件化的多任务失败检测器(SAFE)配合保形预测作为引导触发器,比「VLM 当检测器」(CoVer)高最多 +3.5%,比全程引导高最多 +16.7%(任务级)。基于平衡准确率的 $\alpha$ 选择启发式也是一项实用新贡献。

RL² 框架(流匹配 VLA):从冻结 VLA 动作专家提取潜在,喂给 RL 流匹配引导策略产出引导速度,与 VLA 流速度在每步组合;同时潜在送入失败检测模块决定是否启用引导。
Fig. 5: RL² 框架(流匹配 VLA):从冻结 VLA 动作专家提取潜在,喂给 RL 流匹配引导策略产出引导速度,与 VLA 流速度在每步组合;同时潜在送入失败检测模块决定是否启用引导。
动作样本可视化(π0):失败时用改写的 VLA 动作往往偏离任务物体或扑向干扰物,导致振荡;RL² 用组合式引导把样本引向任务物体以成功抓取。
Fig. 11: 动作样本可视化(π0):失败时用改写的 VLA 动作往往偏离任务物体或扑向干扰物,导致振荡;RL² 用组合式引导把样本引向任务物体以成功抓取。

实验结果

RL² 在 OOD 鲁棒性上稳定提升。SIMPLER 域内(OpenVLA)平均比 Repeated 高 +7.5%、任务级最高 +19.4%;OOD 语言提示(π0)平均 +10.1%(最高 +14.7%);OOD 环境(π0)平均 +8.5%(最高 +14.6%)。PolaRiS OOD(π0.5,表 I)上自适应 RL² 平均成功率 42.7%(±2.3),对 Rephrase 31.8%(±3.4) 平均 +10.9%,Move Latte Cup 从 48.7% 提到 66.0%(+17.3%,全文最大单项提升)。缩放规律(图 4)是科学骨架:失败元组上组合式引导随样本数缩放最优、成功元组上反而最差,证明自适应触发必要。消融确认组件有效:RL 优于 BC、潜在优于原始观测(+38.8%)、SAFE 触发优于 CoVer-VLM(+3.5%)且优于全程引导(+16.7% 任务级),$\alpha$ 启发式能从 top-3 恢复 88.5% 最大性能。真实硬件 PiperX 上自适应 RL² 平均比 Rephrase 高 +17.5%、比非自适应 RL² 高 +14.2%。

PolaRiS OOD 提示评估:用 π0.5,自适应 RL² 在 OOD 语言指令下任务级成功率最高 +17.3%、进度率最高 +12.4%,超过 Rephrase 基线。
Table I: PolaRiS OOD 提示评估:用 π0.5,自适应 RL² 在 OOD 语言指令下任务级成功率最高 +17.3%、进度率最高 +12.4%,超过 Rephrase 基线。
消融:RL 训练与 VLA 潜在表示都能增强组合式引导。
Table II: 消融:RL 训练与 VLA 潜在表示都能增强组合式引导。
真实机器人实验结果:自适应 RL² 相对 Rephrase 平均 +17.5%,相对非自适应 RL² 平均 +14.2%。
Fig. 13: 真实机器人实验结果:自适应 RL² 相对 Rephrase 平均 +17.5%,相对非自适应 RL² 平均 +14.2%。
查看结构化数据
任务指标本文基线提升
PolaRiS OOD — Move Latte Cup(π0.5) 成功率 S(%) 66.0% 48.7%(Rephrase) +17.3%(全文最大单项提升)
PolaRiS OOD 三任务平均(π0.5) 成功率 S(%) 42.7% (±2.3) 31.8% (±3.4)(Rephrase) +10.9%
PolaRiS OOD 三任务平均(π0.5) 进度率 P(%) 63.0% (±3.4) 55.2% (±1.4)(Rephrase) +7.8%
SIMPLER OOD 语言提示(π0),Spoon on Towel 任务成功率 自适应 RL² Rephrase +14.7%
SIMPLER 域内(OpenVLA) 任务成功率 自适应 RL² Repeated 平均 +7.5%,最高 +19.4%
真实硬件 PiperX 四个 OOD 任务平均 成功率 自适应 RL² Rephrase +17.5%(对比非自适应 RL² 再 +14.2%)
消融:潜在 vs 原始观测(OpenVLA+CQL) 成功率 用 VLA 动作专家潜在 用原始观测 +38.8%

局限与改进

作者承认三点。引导函数:只测了轻量级引导函数,尚未与大模型可微引导(VLM、其他 VLA)对比。失败检测:平衡准确率 $\alpha$ 启发式需要额外的测试时评估,可能存在比平衡准确率更好的度量(如检测时效性);失败检测器目前依赖在线 rollout 采集训练,限制了泛化——事实上真实世界的 SAFE 模型无法从仿真迁移、不得不在真实 rollout 上重训,这是个不可忽视的工程负担。验证器:假设存在一个鲁棒的验证器,在真正新颖的场景下未必成立。我自己的观察:(a)所有提升都是在准神谕级验证器(RoboMonkey/CoVer)下测得的,验证器一旦失败会把误差传导下去,若验证器把坏候选排第一,RL² 也救不了;(b)在最难任务上绝对成功率仍然不高(如 Tape into Container 仅 28.7%);(c)框架只用离线 RL,多样性的上限受限于离线数据——BridgeV2/DROID 里没出现过的真正新颖恢复动作无法被「发明」;(d)CP 带是按任务、按种子校准的,暗示每次新部署都有一定的调参成本。

独立分析的弱点

(1)验证器依赖是最软的软肋:框架假设有可靠验证器选最优候选,但验证器恰好在 OOD 场景(RL² 的目标场景)泛化差,一旦把坏候选排第一 RL² 也救不了。改进:把 RL 引导策略与验证器协同训练(作者已列为未来工作),或学习内部自验证信号。(2)离线数据束缚的多样性:引导来自训练在 BridgeV2/DROID 上的离线 RL 策略,多样性受限于这些数据;对真正未见过的物体(如工具箱里的胶带)RL 策略并无相关经验。改进:按部署做在线/轻量微调引导头,或引入小规模世界模型 rollout。(3)按任务校准 CP 的开销:$\alpha$ 启发式虽把搜索砍到 top-3,但每个新任务仍要采 rollout、校准 CP。改进:元学习 CP 带或用单一全局带配自适应阈值。(4)最难任务上绝对性能仍有限:即使 +17.3%,Move Latte Cup 也只到 66%、Tape into Container 28.7%。改进:把 RL² 与思维链推理或分层规划器叠加。(5)高斯组合权重是启发式设计,一个可学习、随状态上下文调节的 IL/RL 混合调度器可能更优。

未来方向

作者提出:(a)与来自大 VLM/VLA 的可微引导对比;(b)用比平衡准确率更好的度量(如检测时效性)改进 $\alpha$ 选择;(c)在大规模离线数据上训练失败检测器而非在线 rollout,以提升泛化并消除数据采集步骤;(d)把 RL 引导策略与验证器协同训练,放松「强验证器」假设。基于成果可延伸的方向:成功/失败不对称的缩放规律是一条通用原理,可移植到其他测试时扩展领域(LLM 推理、扩散图像生成)——「只在卡住时多想」普遍适用;潜在条件化的 RL 顾问模式可推广到其他需要在部署时自适应的冻结基础模型(如用小 RL 头引导 LLM 工具使用);把 RL² 与具身思维链(ECoT)规划器结合,是长时程任务的自然下一步,那里既需要推理又需要恢复。

复现评估

可复现性中上。作者声明论文最终版会发布代码并提供项目主页(rl2-vla.github.io)。超参给得很全:QAM(batch 256、critic 集成 10、流步 10、π0/π0.5 分别 500k/1M 步)、CQL($\alpha=1.0$);SAFE LSTM 给出每个 VLA 的聚合方式与 ROC-AUC(π0 仿真 90.4%、π0.5 82.0%、真实世界 85.4%)。算力:2× NVIDIA L40s 做训练(流式 4.5–9 小时)。数据:公开的 BridgeV2 和 DROID,外加按任务采集的 rollout(SAFE 每 100 条/种子 × 3 种子)。外部依赖多数开源(RoboMonkey/CoVer 给了 HuggingFace 链接),但 π0.5 权重与 PolaRiS 仿真的可获取性可能限制完整复刻。主要摩擦:按任务采 rollout 校准 CP、以及真实世界 SAFE 需重训。难度中等——一支有 2 张 L40、能拿到底座 VLA 的团队,数周内可复现仿真结果。