← 返回 2026-05-27

在潜在空间学习高频连续动作块 Learning High-Frequency Continuous Action Chunks in Latent Space

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding 📅 2026-05-24 👍 6 2026-07-13 08:36
动作块 异步推理 机器人控制 模仿学习 潜在表示

用VAE潜在空间+RTR策略实现高频机器人平滑控制

前置知识

Action Chunking

动作块是一种模仿学习范式,策略不是预测单个时间步的动作,而是预测一个动作序列(动作块)。例如,策略可以预测未来H步的动作A_t = [a_t, a_{t+1}, ..., a_{t+H-1}]。这种方法有助于缓解非马尔可夫伪影(如演示数据中的短暂颤动或暂停),改善对复杂轨迹和长时程依赖关系的建模。在VLA模型如OpenVLA-OFT和PI0.5中,动作块被用于联合学习感知、语言理解和物理交互。

本文的核心方法就是基于动作块的,理解动作块的基本概念是理解为什么需要解决高频动作块学习问题的基础

变分自编码器(VAE)

VAE是一种生成模型,由编码器E和解码器D组成。编码器将输入x映射到潜在表示z,解码器从z重构输出x̂。VAE通过KL散度约束潜在分布接近先验(如高斯分布),学习连续的潜在空间。在本文中,动作块A_t ∈ ℝ^{H×c}被编码器下采样到潜在z ∈ ℝ^{h×d},其中h = H/f是潜在视野,f是下采样率(本文用f=4),d是潜在维度。解码器将z重构为高频动作块Ã_t = D(z)。

VAE是本文方法的核心,通过将高频动作块压缩到低频连续潜在空间,显著降低了学习难度并提高了轨迹平滑性

异步推理

在实时机器人执行中,策略推理(通常需要数十到数百毫秒)与动作执行并行进行,以隐藏推理延迟。具体来说,当机器人在执行当前动作块时,策略已经在计算下一个动作块。但存在一个问题:当新动作块推理完成时,前几个动作可能已经过时。例如,推理从t+3开始,在t+5完成,产生7步的动作块,那么前2步在执行时已经过时。这会导致chunk边界的不连续性,引起可见的停顿或回滚。

本文提出的Reuse-then-Refine策略正是为了解决异步推理中chunk边界不连续性的问题,理解异步推理的挑战是理解RTR动机的关键

Jerk(加加速度)

Jerk是轨迹平滑度的度量,定义为位置的三阶有限差分:j_t = (x_{t+3} - 3x_{t+2} + 3x_{t+1} - x_t) / Δt^3。Jerk越大,表示加速度变化越剧烈,运动越不平滑。在机器人控制中,过大的jerk可能导致机械磨损、执行器饱和或安全 violations。论文中报告的jerk值通常在0.4-5.2之间,越低表示运动越平滑。例如,在Peel Cucumber任务上,OFT-Original的jerk为4.367,而OFT-Latent为0.486,降低了约89%。

Jerk是本文评估高频动作平滑性的核心指标,所有实验结果都用jerk量化轨迹质量,理解这个指标有助于判断方法的有效性

研究动机

现代机器人策略越来越依赖action chunking来执行复杂的现实世界任务。然而,action chunking的有效性严重依赖于动作频率。在相对低的频率下,action chunking能够保持时序一致性,但在高频率(如60 Hz)下,直接在动作空间训练的策略往往产生不精确且高度抖动的轨迹。论文的实验显示(Fig. 4),当从15 Hz提升到60 Hz时,OFT的jerk从约1.0急剧增加到约3.5,位置偏差(deviation)也显著增加。低频动作会导致明显的速度损失和断断续续的运动(stop-and-go motion),而高频动作理论上能够实现连续平滑的控制,但学习难度极大。此外,在异步推理部署中,连续动作块之间存在对齐问题,导致边界处出现大间隙,引起可见的停顿和回滚,进一步降低执行质量。

本文的目标是本文的目标是实现高频(60 Hz)动作块的精确和平滑学习,使机器人能够执行复杂接触密集型任务时减少停顿和抖动。具体而言,论文希望解决两个核心问题:一是如何在高频动作空间中学到精确且平滑的动作块,而不是像传统方法那样产生jittery的轨迹;二是如何在异步推理部署中保证连续动作块之间的连续性,避免chunk边界处的突变和回滚。通过解决这两个问题,论文希望使机器人能够以稳定速度连续执行任务,避免重复的加减速,实现更自然、更高效的物理交互。

与已有工作不同的是,本文的独特切入角度是将高频动作学习从原始动作空间转移到潜在空间,而不是像现有方法那样直接在动作空间训练或通过插值提升频率。现有工作(如RT-C)通过条件前一个chunk来改善chunk-level连续性,但都是在原始动作空间操作,从未探索过潜在空间的连续性问题。论文发现直接将RT-C应用到潜在空间是无效的,甚至会降低连续性。此外,现有VLA方法主要操作在中等动作频率,将action chunking扩展到高频 regimes——这是实现平滑连续执行所必需的——仍然很大程度上未被探索。本文提出的Reuse-then-Refine(RTR)策略是第一个专门为潜在空间策略设计的训练无关的执行策略,明确改善chunk-level连续性。

核心方法

本文方法分为两个核心组件:潜在空间策略学习和Reuse-then-Refine(RTR)执行策略。整体思路是先用VAE将高频动作块压缩到低频连续潜在空间,使策略更容易学习平滑的运动模式;然后在推理时,针对异步推理引入的chunk边界不连续性,提出RTR策略重用已执行动作并与新动作合并,再通过VAE重构,确保chunk间的无缝过渡。这种方法实现了表示和执行的协同设计:潜在空间学习保证了单个chunk内部的精度和平滑性,RTR保证了chunk间的连续性。

核心创新点有两个:一是将高频动作块通过VAE编码器时序下采样到低频潜在空间进行学习,每个潜在步总结了多个相邻时间步的主导运动趋势,而不是让策略接触原始高频轨迹中的每个微小波动,KL正则化还鼓励这些运动模式位于更平滑、更规则的潜在流形上;二是提出训练无关的RTR策略,在异步推理中重用推理窗口期间已执行的动作,与新产生的chunk中非过时的动作拼接,然后通过VAE重构,利用潜在空间的时序和空间连续性平滑不一致性。这与RT-C等现有方法的本质区别在于:RT-C是基于flow-matching或扩散模型的生成方法,通过条件前一个chunk来生成,而RTR是执行时策略,直接利用VAE的重构能力保证连续性,且专门为潜在空间设计。

方法步骤详情

方法包含三个主要步骤。第一步是训练VAE:给定高频动作块A_t ∈ ℝ^{H×c}(H是预测视野,c是动作维度,包含位置xyz、姿态rpy、夹爪宽度),编码器E将A_t映射到潜在z = E(A_t),通过KL散度正则化到高斯先验;解码器D从z重构动作块Ã_t = D(z)。编码器时序下采样f=4倍,产生潜在z ∈ ℝ^{h×d},其中h = H/f是潜在视野。第二步是训练潜在策略:用训练数据中每个高频动作块的潜在表示训练策略π_θ(z_t | o_t),其中o_t是观测(视觉输入、任务相关输入、本体感觉状态),VAE在策略训练期间保持固定。第三步是RTR执行策略:在异步推理时,新chunk推理从t+3开始,在t+5完成,产生7步动作。前2步已过时,RTR先重用前一个chunk在推理窗口期间已执行的动作,与新chunk中非过时的动作拼接,形成时序错位的中间chunk;然后将拼接的chunk输入VAE编码器得到压缩潜在表示,再用VAE解码器重构,产生精炼的动作块。由于VAE推理仅约2ms,对整体延迟影响可忽略。

技术新颖性

本文的技术新颖性体现在多个方面。首先,首次系统研究了高频动作块学习的挑战,并提出了基于VAE的潜在空间解决方案,这在机器人模仿学习领域是开创性的。其次,RTR是第一个专门为潜在空间策略设计的训练无关的chunk-level连续性策略,与现有的基于生成的方法(如RT-C)有本质区别。第三,通过联合设计和评估潜在空间表示(VAE vs VQ-VAE)和执行策略(RTR vs RT-C),论文提供了表示和执行协同设计的重要见解。第四,广泛的消融实验(Fig. 8)表明,适度压缩(如f=4)能同时改善精度和平滑性,而过度压缩会两者皆降,这为实践提供了重要指导。最后,论文在三个真实接触密集型任务上验证了方法的有效性,提供了从数据集基准到真实机器人执行的完整评估链。

(a) Original policy (b) Latent policy (c) Reuse-then-Refine
Figure 2: (a) Original policy (b) Latent policy (c) Reuse-then-Refine
(a) Naïve asynchronous inference (b) Reuse-then-Refine
Figure 5: (a) Naïve asynchronous inference (b) Reuse-then-Refine

实验结果

论文在三个真实接触密集型任务(Peel Cucumber、Wipe Vase、Write Board)上进行了全面评估。在同步推理下(Table 1),潜在策略相比原始动作空间方法在jerk和exceed count上显著降低。例如,对于OFT在Peel Cucumber任务上,成功率从28%提升到74%,jerk从4.367降低到0.486(降低约89%),exceed count从32.7降低到3.1;对于PI0.5在Write Board任务上,jerk从2.509降低到0.673。在数据集基准测试中(Table 2),潜在策略在几乎所有指标上都优于原始方法,尤其是O improvement最为明显:xyz的deviation从7.59降低到1.47,jerk从3.50降低到0.02。在异步推理下(Table 3),结合RTR的潜在策略表现最佳:对于PI0.5在Peel Cucumber上,成功率从72%提升到80%,jerk从4.124降低到1.601;对于OFT在Write Board上,成功率从66%提升到100%,jerk从7.868降低到1.245。Table 4显示RTR在chunk-level连续性上显著优于RT-C:对于PI0.5,boundary gap的xyz从5.636降低到4.069。Table 5显示高频策略在端到端延迟上始终低于低频策略:DP在Peel Cucumber上,高频Latent+RTR延迟14.59秒,而低频Original需39.65秒。

Real-world execution results under synchronous inference across policies and methods
Table 1: Real-world execution results under synchronous inference across policies and methods
Dataset-based benchmarking results across policies and methods
Table 2: Dataset-based benchmarking results across policies and methods
Real-world asynchronous execution results across policies and methods
Table 3: Real-world asynchronous execution results across policies and methods
Chunk-to-chunk continuity under asynchronous inference
Table 4: Chunk-to-chunk continuity under asynchronous inference
End-to-end latency under asynchronous inference
Table 5: End-to-end latency under asynchronous inference
VAE inference latency
Table 6: VAE inference latency
Comparison of action-chunk trajectories under different action representations of OpenVLA-OFT
Figure 3: Comparison of action-chunk trajectories under different action representations of OpenVLA-OFT
Real-world whiteboard writing under synchronous execution
Figure 6: Real-world whiteboard writing under synchronous execution
Real-world whiteboard writing under asynchronous execution with PI0.5 using different chunk-level continuity strategies
Figure 7: Real-world whiteboard writing under asynchronous execution with PI0.5 using different chunk-level continuity strategies
Precision and smoothness of VAE and VQ-VAE under different temporal downsampling ratios
Figure 8: Precision and smoothness of VAE and VQ-VAE under different temporal downsampling ratios
查看结构化数据
任务指标本文基线提升
Peel Cucumber (同步推理) Success Rate 74% 28% (OFT-Original) +46个百分点
Peel Cucumber (同步推理) Jerk 0.486 4.367 (OFT-Original) 降低89%
Write Board (异步推理) Success Rate 100% 66% (OFT-Original) +34个百分点
Write Board (异步推理) Jerk 1.245 7.868 (OFT-Original) 降低84%
Peel Cucumber (端到端延迟) Latency (seconds) 14.59 39.65 (低频Original) 降低63%

局限与改进

作者在论文中承认了一些局限性。首先,虽然RTR在改善chunk-level连续性方面有效,但它是一个训练无关的执行策略,可能无法充分利用所有可能的学习优化机会。其次,论文主要在60 Hz频率下评估,更高频率(如100 Hz以上)的行为尚未探索,可能需要调整潜在空间设计或RTR策略。第三,论文在三个接触密集型任务上验证,但在非接触任务或更复杂的长时程任务上的泛化性有待验证。我观察到论文中PI0.5在xyz deviation上潜在策略(1.32)反而比原始方法(1.24)稍高,虽然差异不大,但表明潜在空间学习并非在所有指标上都绝对优于原始方法。此外,RTR策略需要访问已执行动作的历史,这在某些部署场景中可能受限。最后,论文未详细讨论VAE训练失败或不收敛的情况,实际部署时这可能是一个工程挑战。

独立分析的弱点

论文的一个主要弱点是RTR策略假设可以访问已执行动作的历史,这在某些分布式或远程部署场景中可能不可用,导致策略无法应用。一个改进方向是设计不需要历史访问的chunk-level连续性方法,例如通过学习预测chunk间的过渡模式。另一个潜在弱点是论文主要在60 Hz下评估,更高频率下VAE的重构误差可能增加,导致性能下降。可以考虑自适应地调整压缩率f,在精度和计算效率之间权衡。此外,论文中PI0.5在xyz deviation上潜在策略略逊于原始方法,表明当前VAE设计可能不是最优的,可以探索更先进的架构(如diffusion-based VAE或normalizing flows)来改善重构精度。最后,RTR虽然简单有效,但它是启发式策略,可能无法保证全局最优,可以考虑将chunk-level连续性作为训练目标,端到端优化。

未来方向

作者在结论中提到希望激发关于学习平滑精确高频动作块的进一步研究,推动现实环境中连续可靠机器人控制的发展。基于论文成果,可延伸的未来研究方向包括:探索更高的动作频率(如100 Hz以上)和自适应频率控制,根据任务复杂度动态调整频率;扩展到更多样的任务类型,如非接触操作、动态环境交互、多机器人协作;研究其他潜在表示方法(如diffusion latent、discrete latent codes)和架构(如transformer-based VAE);将chunk-level连续性作为训练目标,端到端优化而非仅依赖执行时策略;结合其他模态(如力觉反馈、触觉信息)提升接触密集型任务的鲁棒性;探索在更少演示数据下的学习,提高数据效率;研究潜在空间的可解释性,理解策略学到的运动模式。

复现评估

论文声称代码和数据将在https://github.com/tars-robotics/RTR上公开,这提供了良好的复现基础。然而,论文未详细报告实验所需的硬件配置(如GPU型号、内存、机器人硬件),也未提供VAE训练的超参数细节(如学习率、batch size、训练轮数),这可能增加复现难度。实验涉及真实机器人执行,需要特定的硬件设置(Franka Emika Panda等),这在资源有限的实验室中可能难以获得。数据集基准测试部分应该相对容易复现,但真实机器人实验需要精确的环境配置和安全措施。论文报告了VAE推理延迟约2ms,但未说明推理硬件(CPU/GPU),这可能影响异步推理的实时性评估。总体而言,代码和数据的公开承诺是积极的,但更详细的技术报告和Docker环境将进一步提高复现性。