← 返回 2026-07-30

πR²:反应式实时流匹配策略 πR^2: Reactive Real-time Flow Policies

Sungjae Park, Shubham Tulsiani 📅 2026-07-28 👍 4 2026-08-04 18:30
反应式控制 扩散强制 机器人操作 模仿学习 流匹配 视觉-语言-动作模型

让大规模VLA流匹配策略实时闭环,重规划提速约4倍,成功率提升最高30%

前置知识

流匹配(Flow Matching)

一种生成式建模方法,学习一个速度场 $v_\theta(x_t, t)$ 把样本从噪声分布 $p_0=\mathcal{N}(0,I)$ 沿条件插值 $x_t=(1-t)\epsilon+t x_1$ 传输到数据分布 $p_1=p_{data}$,训练目标为 $\mathcal{L}_{FM}=\mathbb{E}\|v_\theta(x_t,t)-(x_1-\epsilon)\|^2$。它和扩散类似,但路径是直线、采样更高效。

πR² 的动作头就是流匹配,理解 $K$ 步去噪、噪声水平 $t$ 是读懂其延迟瓶颈和单步推理改造的前提。

动作分块(Action Chunking)

策略不预测单个动作而是预测一个包含 $H$ 个未来动作的块 $x_1=(a_t,\dots,a_{t+H})$,由 $K$ 步去噪联合生成,执行前 $h\le H$ 个动作后重规划。它提升时间一致性、提供更丰富的训练信号,但执行期间是开环的,无法响应中途到达的观测。

πR² 正是为了解决动作分块开环执行导致反应性丧失这一问题,整个方法围绕块长 $H$、执行视界 $h$ 展开。

扩散强制(Diffusion Forcing)

对流匹配的推广:给块的每个位置 $p\in\{0,\dots,H-1\}$ 分配独立的噪声水平 $\tau_p\in[0,1]$,模型 $v_\theta(x_\tau,\tau,o)$ 预测逐位置速度 $x_{\tau,p}=(1-\tau_p)\epsilon_p+\tau_p a_p$。位置的噪声水平可不同,使连续去噪步能基于逐步更新的观测。

πR² 的楼梯型调度和单步发出干净动作的能力都建立在扩散强制的逐位置噪声自由度上,是方法的数学基础。

视觉-语言-动作模型(VLA)

通用机器人基础模型,用大型预训练视觉-语言模型(VLM)作为骨干处理图像和语言、抽取可泛化的表示,再接一个条件化于机器人本体感觉的流匹配/扩散动作头预测动作,如 GR00T-N1.7、$\pi_0$ 等。

πR² 的目标是让这类大规模 VLA 反应式实时,它的快慢通道解耦正是利用了 VLA 内部模态处理代价的不对称。

修复条件化(Inpainting Conditioning)

把一部分已知/已确定的动作夹紧为干净值,作为条件去引导其余位置的去噪生成,从而保证输出与历史动作平滑衔接。RTC/Train-Time RTC 用它锚定块边界,πR² 用它处理进行中的动作。

πR² 把进行中(in-flight)的 $d$ 个动作当作修复条件夹紧为干净,这是延迟自适应调度的关键机制。

研究动机

当前主流的通用机器人操作策略(generalist manipulation policies)普遍采用三件套设计:大型预训练视觉-语言模型(VLM)作为骨干、扩散/流匹配这样的表达性多模态策略头、以及动作分块一次性预测多个未来动作。这三者带来了泛化能力与可扩展性,却严重牺牲了反应性和实时性。具体来说,一个动作块在执行时是开环的,策略无法对执行期间陆续到达的传感器输入做出响应。理论上可通过只执行很小的子块(极限情况下只执行一个动作)并频繁重规划来恢复反应性,但感知到动作的预测管线开销巨大:以 GR00T-N1.7 为例,图像预处理加 VLM 前向约 $60$ ms,$K=4$ 步 DiT 去噪约 $80$ ms,单次调用合计约 $140$ ms,在 $50$ Hz 控制频率下相当于约 $7$ 个控制周期。这一计算瓶颈带来两个根本性问题:反应性降低(一大块动作必须开环执行而下一块在算)、以及延迟增加(预测动作依赖过时的感官输入),使这类基础模型难以胜任需要快速、平滑、反应式控制的动态操作。

本文的目标是本文的目标是在不牺牲三大设计原则——大型预训练骨干网络、表达性多模态策略、多动作预测——的前提下,让大规模流匹配策略实现反应式、实时的闭环推理。具体而言,作者希望策略能在每个控制周期都基于最新感官观测来预测动作,而不是把一大块动作提交开环执行后稀疏重规划。在 GR00T-N1.7 这类 VLA 上,目标闭环重规划要比基线快约 $4$ 倍,在 A5000 GPU 上达到 $25$ Hz,每 $40$ ms 基于新鲜观测动作一次。同时希望方法只需对现有架构做最小改动,能直接从预训练 VLA 微调而来,复用已有强大语义骨干,并在仿真与真实接触丰富的灵巧操作任务上显著超越最强基线(仿真成功率提升最高 $23\%$、真机最高 $30\%$)。

与已有工作不同的是,本文的独特切入角度在于重新审视 VLA 已暴露的一个不对称性:本体感觉(proprioception,关节位置、速度、力矩、接触力)的处理速度可比图像与文本快好几个数量级,而且对动态任务,本体感觉足以支撑局部的反应式修正(如响应意外接触、补偿物体滑移),视觉和语言只提供粗略的全局上下文。已有工作如 RTC、Train-Time RTC、Streaming Diffusion Policy、FASTER 虽关注动作块的平滑执行或扩散强制,却都没解决反复对大型语义骨干进行条件化所带来的延迟——FASTER 每块骨干只前向一次、所有动作基于单一固定观测,改善了延迟和平滑度却不改善对执行期间到达的感官输入的反应性。作者抓住这个被忽视的快慢分离切入点,把动作去噪的条件解耦成异步更新的慢通道与始终最新的快通道,在大型 VLA 骨干背后恢复闭环控制——这是一个此前未被充分探索的 regime。

核心方法

πR² 的整体思路是:与其让昂贵的大型骨干网络拖慢每个控制周期,不如把必须每 tick 都新的本体感觉和可容忍几 tick 延迟的视觉-语言特征解耦。直觉上操作任务本身就有这种结构——视觉/语言提供粗略空间与任务指引,新鲜本体感觉驱动精细运动修正。技术上 πR² 构建在扩散强制的逐位置噪声调度之上(每位置 $p$ 独立噪声水平 $\tau_p$),再做两件正交的事:其一把 DiT 动作头条件拆成慢通道(VLM 与图像/文本特征,缓存异步刷新)和快通道(本体感觉,每 tick 全新),动作头每次只跑一个去噪步、基于最新本体感觉和缓存慢特征条件化,慢通道在后台线程异步处理;其二是延迟自适应的楼梯型流调度,把进行中动作当作修复条件,每调用一个去噪步就发出一个或多个干净动作,单模型自适应不同硬件延迟。整体每调用仅一次 NFE、独立于骨干大小,把 GR00T-N1.7 单次延迟从约 $140$ ms($\sim7$ ticks)压到约 $40$ ms($1\sim2$ ticks)。

核心创新有两个且彼此正交。第一是本体感觉反应式扩散强制:VLA 内部模态处理代价差异巨大——图像预处理+VLM 约 $60$ ms 而本体感觉只需一个小 MLP,于是把 DiT 条件显式拆成异步刷新慢通道和每 tick 全新快通道,训练时对慢通道施加随机延迟 $d_{vlm}\sim\text{Uniform}\{0,\dots,d^{max}_{vlm}\}$ 并用学习的整数延迟嵌入加入慢表示以容忍有界视觉陈旧度。与已有方法本质区别在于:RTC/FASTER 骨干每块只前向一次、所有动作基于单一固定观测,改善延迟与平滑度却不改善对执行期间到达的感官输入的反应性;πR² 则在块内刷新本体感觉条件化。第二是延迟自适应楼梯型调度,三区域——前部 $[0,d)$ 夹紧干净作进行中动作修复条件、内部 $[d,H-d)$ 干净到噪声的线性斜坡、尾部 $[H-d,H)$ 纯噪声——可视为 Train-Time RTC 的扩散强制泛化:二者都夹紧 $d$ 个干净前部,但 RTC 对剩余 $H-d$ 位置施加单一共享噪声,楼梯换成斜坡内部加纯噪声尾以支持单步发出。

方法步骤详情

方法分四步。预热:回合开始用标准流匹配(从纯噪声对全部 $H$ 位置去噪)暖启动缓冲区,再重新加噪匹配实测延迟 $d$ 对应的 $\tau^{\star,d}$。慢通道异步:图像预处理与 VLM 前向在后台线程跑(约 $60$ ms)后刷新缓存视觉-语言特征;快通道每 tick 取最新本体感觉经小 MLP 编码。单步去噪:每调用按 $x_p\leftarrow x_p+\Delta\tau_p v_\theta$、$\tau_p\leftarrow\tau_p+\Delta\tau_p$ 更新各位置,$\Delta\tau_p$ 使调度右移 $d$ 槽,位置 $[d,2d)$ 达 $\tau=1$ 被发出,缓冲区滑动 $d$ 位置、尾部追加 $d$ 个纯噪声槽使调度精确复现。训练:每批采样 $d\sim\text{Uniform}\{1,\dots,d_{max}\}$ 构建 staircase,前部 $d$ 槽填真实动作并用掩码 $m_p=1[p\ge d]$ 排除出损失,内部尾部按楼梯噪声贡献逐位置 MSE;架构上只需把 AdaLN 由整块共享 $(\gamma,\beta)$ 改为逐位置 $(\gamma_p,\beta_p)$,其余不变。

技术新颖性

技术新颖性体现在三点。其一,快慢通道解耦与异步处理:首次把 VLA 的感知延迟瓶颈通过本体感觉极廉价、视觉/语言可陈旧这一不对称性来绕开,使动作头每次只付出一次 NFE 代价、独立于骨干网络大小,从而在大骨干背后恢复闭环控制。其二,楼梯型噪声调度:把 Train-Time RTC 的夹紧干净前部加共享噪声剩余推广为夹紧前部加斜坡内部加纯噪声尾部的三区域结构,从而在扩散强制下单步发出干净动作,并通过对 $d$ 训练时随机化让单一模型自适应实测延迟,配合对称抖动吸收单次波动。其三,架构兼容性极强:整套流程只需把 AdaLN 的逐块调制改成逐位置调制(每位置一组 $(\gamma_p,\beta_p)$),注意力、MLP、预训练骨干、快慢特征路径一律不变,因此能从任意预训练 VLA(如 GR00T-N1.7)直接微调而不触碰骨干,最小化对现有架构的修改。作者还指出该框架对 world-action models 同样适用,因为只需一个条件化于重型骨干的流匹配动作头。

Overview of πR2
Figure 1: Overview of πR2
Inference cycle, one call
Figure 2: Inference cycle, one call

实验结果

实验分仿真与真机。仿真用 MuJoCo Playground 的 Leap Cube Reorientation。零延迟执行视界扫描(图3左)显示标准流性能随 $h\in\{1,2,4,8\}$ 增大而退化,πR² 以每调用 $1$ NFE、每次发一个动作即匹配标准流 $h\in\{1,2\}$,证明更频繁用新鲜观测有益且摊销去噪不损质量。VLA 级延迟部署(图3右)中 πR² w/ async 有效延迟仅 $0.25d_0$(基线 $1.75d_0$),在 $d_0\in\{1,2,3\}$ 都胜(成功率 $0.43/0.42/0.45$),击败 Train-time RTC($0.36/0.32/0.19$),延迟越大优势越大。真机在 xArm6+XHand 微调 GR00T-N1.7(A5000,基线 $d\in\{4,5\}$、πR² $d\in\{1,2\}$ ticks,$25$ Hz),四个接触丰富灵巧任务上全面超越最强基线,反应性关键任务绝对提升达 $20\sim30\%$(逐任务数字见 benchmarks 表)。图5机制证据:πR² 据实时力反馈稳夹持约 $50$ N,RTC 过冲到约 $120$ N 夹坏书,印证反应性是增益来源。

Real World Results
Table 1: Real World Results
Simulation results
Figure 3: Simulation results
Real-world manipulation tasks
Figure 4: Real-world manipulation tasks
πR2 reacts to proprioception, while baselines run a stale plan (Tidy Up Book)
Figure 5: πR2 reacts to proprioception, while baselines run a stale plan (Tidy Up Book)
查看结构化数据
任务指标本文基线提升
Leap Cube Reorientation(仿真,VLA级推理延迟) 成功率(3个seed均值) πR² w/ async 在 d0=1/2/3 下分别 0.43/0.42/0.45 Train-time RTC 0.36/0.32/0.19;naive-async 0.33/0.29/0.22 绝对提升约 7~23 个百分点,延迟越大优势越明显
Don't Spill(真机灵巧操作) 成功率 / 进度分 10/20 (SR),55/80 (Prog) Train-Time RTC 9/20,45/80 SR +5pp,Prog +10/80
Tidy Up Book(真机灵巧操作) 成功率 / 进度分 12/20 (SR),24/40 (Prog) Train-Time RTC 8/20,18/40 SR +20pp(绝对)
Insert Box(真机灵巧操作) 成功率 / 进度分 16/20 (SR),68/80 (Prog) Train-Time RTC 10/20,53/80 SR +30pp(绝对)
Catch Book(真机灵巧操作) 成功率 11/20 (SR) Train-Time RTC 5/20 SR +30pp(绝对)
闭环重规划速度(GR00T-N1.7,A5000) 重规划频率 / 单次延迟 约 25 Hz,d=1~2 ticks(≈40ms),每 tick 基于新鲜观测 基线策略约 7 Hz,d=4~5 ticks(约140ms) 比基线快约 4×

局限与改进

作者承认两点局限:第一,πR² 不处理模型外部的延迟源,例如推理服务器与机器人客户端之间的通信延迟(远程推理设置下的以太网往返),而这在云端/远程部署中往往是主要瓶颈;第二,他们保持基线策略架构不变,若专门设计架构以更强烈地强调本体感觉特征(例如为本体感觉 token 配备专用注意力头),可能进一步放大反应性,这是作者留待未来的方向。我自己的观察还补充几点:本体感觉慢通道随机延迟 $d_{vlm}$ 在训练时的最大值 $d^{max}_{vlm}$ 需要谨慎选取以覆盖部署时的实际视觉延迟,若实测延迟超出训练范围模型可能失效;楼梯调度在延迟 $d$ 持续抖动时虽能通过对称抖动吸收,但在延迟剧烈突变场景(如负载突增)下的鲁棒性未经充分验证;此外所有任务对本体感觉依赖较强,对于本体感觉信息贫乏的纯视觉引导任务,快慢分离的收益可能受限;仿真仅用一个相对简单的状态基任务验证,更复杂的视觉主导仿真基准尚未覆盖。

独立分析的弱点

弱点一:方法高度依赖本体感觉富含信息且处理廉价这一假设;对以视觉为主导、本体感觉贫乏或不可靠的任务(远距离非接触操控、视觉伺服抓取未见物体),慢通道陈旧度容忍会显著损害性能,可引入模态可信度自适应。弱点二:楼梯调度有效延迟范围 $[1,d_{max}]$ 训练时固定,部署时实测延迟超 $d_{max}$(网络拥塞、降级硬件)缺乏外推能力,可用连续延迟嵌入或在线延迟适配。弱点三:所有实验仅基于 GR00T-N1.7 一个 VLA 和 xArm6+XHand 一个平台,跨平台/跨骨干泛化性未验证,应在更多 VLA($\pi_0$、OpenVLA、RDT)和更多平台系统对比。弱点四:未处理推理服务器与机器人间的通信延迟,这在远程/云端部署中是主要瓶颈,可结合预测-执行解耦或网络感知调度。弱点五:真机每任务仅 $20$ 次试验,成功率置信区间较宽,$10/20$ 与 $9/20$ 差异未必显著,应增大试验次数并报告置信区间。

未来方向

作者明确提出的未来方向是设计专门强调本体感觉的架构,例如为本体感觉 token 配备专用注意力头,从而在源头放大反应性,而不必保持骨干架构不变。基于本文成果可延伸的研究方向包括:把快慢通道异步解耦的思想推广到其他延迟不均匀的模态(如触觉皮肤、事件相机),构建多速率的多快慢通道层级;将楼梯型延迟自适应调度与连续延迟嵌入结合,实现对外部通信延迟的在线适应与外推;在 world-action models 和更多 VLA 家族成员($\pi_0/\pi_0.5$、OpenVLA、RDT 等)上验证 πR² 的普适性,并扩展到移动操作、双臂协作、人形全身控制等更长视界、更复杂动力学的场景;探索把快慢分离用于安全关键场景下的可证明反应性边界,以及与力/触觉闭环的更深度融合,甚至把延迟自适应思想迁移到视频生成、世界模型等其他扩散/流匹配应用中以缓解大骨干的采样延迟。

复现评估

复现评估:论文提供项目主页 https://pi-r2-flow.github.io/ ,但正文未明确提及代码或检查点开源,关键资源(GR00T-N1.7 权重、四个真机任务的遥操作示教数据 $200/300/300/100$ 条、仿真轨迹)部分依赖 NVIDIA 的 GR00T 生态和作者自有硬件,门槛较高。算力上训练与推理均在单张 RTX A5000 上,基线单次约 $140$ ms、πR² 闭环节奏约 $40$ ms,硬件成本中等但需真实 xArm6+XHand 灵巧手平台才能复现真机结果。关键超参(块长 $H=16$、$d_{max}$、抖动 $j$、warm-start 概率 $0.2$、训练延迟采样分布)和楼梯调度公式(公式3,三区域 $\tau^{\star,d}$)描述较清晰,理论有迹可循;但异步后台线程实现、缓冲区滑动管理工程细节、多 seed 训练(仿真用 $3$ seed)方差信息披露有限。整体方法可复现性中等偏上,但真机 $20\sim30\%$ 提升的完整复现需相当工程投入与硬件,缺乏灵巧手平台的团队难以独立验证。