← 返回 2026-08-28

TacForcing:融合执行时触觉反馈的流式动作生成 TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng 📅 2026-08-26 👍 6 2026-09-01 18:30
Flow Matching VLA 机器人操作 流式生成 触觉感知

让VLA逐块流式生成动作并实时注入触觉反馈,消除执行中的触觉时间错配

前置知识

VLA(视觉-语言-动作)模型

VLA是一类接收图像观测和自然语言指令、直接输出机器人动作序列的多模态大模型,通常由VLM骨干提供语义理解、由动作专家(Action Expert)负责生成连续动作。代表作如π0、π0.5、GR00T N1.7,已在多种操作任务上展现出跨任务的泛化能力,是当前通用机器人操作的主流范式。

本文的全部改造对象就是VLA的动作专家部分:理解TacForcing替换了什么、保留了什么,前提是知道标准VLA'一次观测→整块动作'的生成范式。

Action Chunking(动作分块预测)

指策略每次决策不是输出单步动作,而是一次性预测未来H个控制步的整段动作块并依次执行(如ACT、π0系列)。好处是动作平滑、时间一致性强、摊薄推理开销;代价是块内所有动作都基于块开始前的观测生成,执行中途感知到的任何变化都无法影响剩余动作。

Action Chunking正是本文要解决的时间错配问题的根源:整块动作共享同一次触觉观测,触觉条件在执行中必然变得陈旧。

Flow Matching(流匹配)

一种连续时间生成建模方法:学习一个速度场,把高斯先验$x_0 \sim \mathcal{N}(0, I)$沿线性插值路径$x_\tau = (1-\tau)x_0 + \tau x_1$输运到数据分布$x_1$,训练目标是拟合目标速度$u^\star = x_1 - x_0$的均方误差。相比扩散模型它路径更直、采样更少,π0等动作模型用它生成连续动作。

TacForcing的动作专家就是流匹配专家,其核心改造(块级流时间调度)直接建立在流时间τ的概念上,不懂流匹配就看不懂方法节。

触觉形变图(Tactile Deformation Map)

指尖触觉传感器(如GelSight类视触觉)输出的接触形变图像,能反映力的大小、分布和滑移等接触状态。本文中M个指尖的形变图各自经共享触觉编码器$f_{tac}$独立编码为token,作为VLA的触觉条件输入,编码器初始化自FTP-1的预训练权重。

论文用余弦距离定量展示触觉表征在1.17秒内漂移约0.55而视觉仅0.005,这是全文动机的实证基础,也是触觉反馈需要在块间刷新的原因。

加性注意力掩码(Additive Attention Mask)

Transformer注意力的一种实现技巧:直接在注意力logits上加一个掩码矩阵,允许的位置加0(不影响计算),禁止的位置加$-\infty$(softmax后权重为零)。常用于因果语言模型防止看到未来token,本文借它控制哪些动作token可以看到哪些触觉token。

EATA的实现就是一个精心设计的加性掩码$M_i^{(k)}$:只有下一个待执行块的动作token能注意到最新触觉token,理解掩码才能理解触觉条件如何与执行时刻对齐。

研究动机

视觉-语言-动作(VLA)模型普遍采用分块预测:每收到一次观测就一次性生成整段动作块再逐步执行。这在抓取等粗粒度任务上有效,但在精密装配、插件、注液等接触密集任务中,触觉状态会在单个动作块的执行期间剧烈演化,而视觉往往变化很小。作者用一个滴管挤压任务做了定量测量:在40步动作(约1.17秒)的时域内均匀采样8次,末端触觉表征相对初始时刻的平均余弦距离高达约0.55,而视觉表征几乎不动(约0.005)。也就是说,用执行前那一次触觉观测去条件整段动作,随着执行推进,触觉输入与真实接触状态的错配会越来越大。现有的触觉反应式方案(如RDP的慢-快分层)靠外挂一个高频触觉控制器来补救,但这引入了独立的第二套系统,增加架构与训练复杂度,且与主流VLA范式割裂。

本文的目标是本文的目标是:在不引入任何独立高频反应控制器的前提下,让同一个动作生成模型在动作块执行过程中持续吸收刚获取的触觉反馈,从机制上消除触觉采集与动作执行之间的时间错配。具体来说,作者希望把整块一次性生成改造为逐块流式生成——近期动作先完成并下发执行,远期动作保留流匹配中间状态;每当一个动作块执行完毕,就用新编码的触觉观测继续精炼剩余未完成的动作块。最终在UniVTAC六个仿真任务和三个真实接触密集任务上,把平均成功率显著推过视觉-only、触觉条件化和触觉反应式三类共五种基线。

与已有工作不同的是,已有把扩散/流模型做流式化的工作(Diffusion Forcing及其后继)主要关心生成延迟和推理流水线,回答的是如何更快出动作,而不是动作时域内接触反馈的时序对齐;触觉VLA工作(如FTP-1)则把触觉当作一次性条件,从未处理后续触觉观测应该如何作用于一个已部分生成的动作时域这一问题。TacForcing的独特切入是同时占据两个空隙:一方面把位置相关的流时间调度从扩散模型搬到流匹配动作专家上,实现生成与执行交错的块级流水线;另一方面提出EATA注意力掩码,强制每份最新触觉反馈只直接条件下一个即将执行的动作块,从机制上保证触觉新鲜度与动作执行时刻严格对齐,并且训练阶段就施加同样的可见性约束,保证训练-推理一致。

核心方法

直觉上,TacForcing把整段动作一次成型改造成流水线生产:任务上下文(视觉、本体感觉、语言)只编码一次并全程复用;动作专家把长度H的动作块切成K个含B个动作的小块,用位置相关的流时间调度让第k个块在第kS个采样步恰好达到完成态,流时间为$\lambda_k^{(n)} = \min(n/n_k, 1)$,先完成先执行。每当一个块下发执行后,机器人新采集的指尖形变图经共享编码器得到触觉token,流式专家从保留的中间状态继续推进其余未完成块,同时EATA掩码保证这份新触觉只被下一个待执行块直接注意到,远期块等到自己临近执行时再接收更新的触觉。训练时按随机进度p采样块级中间状态,并配对该执行阶段本可获得的触觉反馈,损失只施加在未完成动作位上,与流式推理过程严格对齐,避免训练-推理分布漂移。

核心创新是流式动作专家与Execution-Aware Tactile Attention(EATA)的组合。与RDP等慢-快分层方法有本质区别:TacForcing没有第二个控制器,触觉反馈直接写回同一个流匹配动作专家的中间状态,被修正的后续动作自动继承完整的语义上下文。EATA解决了一个微妙问题:若不加约束,注意力会让所有未完成块都看到最新触觉token,但对第k+2块来说,第k块的触觉到它执行时早已过时(论文实测触觉表征在1.17秒内漂移约0.55,视觉仅0.005)。EATA用加性掩码实现硬约束:$M_i^{(k)} = 0$ 当且仅当动作位置i属于下一个待执行块(即块索引$\tilde{b}(i) = k$),否则为$-\infty$,使触觉条件的作用域与执行时刻严格对齐。消融显示仅这一项就把仿真平均成功率从51%提升到60%、真实世界从48%提升到69%。

方法步骤详情

整体流程分四步。第一步,上下文编码:视觉观测$V_t$、本体状态$s_t$与语言指令$\ell$一次性编码为上下文$C_t = f_{ctx}(c_t)$,整个动作块生成期间复用,不再更新。第二步,块级流式生成:把H个动作分成K个块(仿真H=50、K=10,真实世界H=40、K=8,块大小均为B=5),第n个采样步时各块流时间为$\lambda_k^{(n)} = \min(n/n_k, 1)$,学习到的速度场只推进未完成块,已完成的块固定不变并下发执行,未完成块的中间状态被保留。第三步,触觉反馈注入:第k块执行完毕后,M个指尖的新形变图$T_t^{(k)}$独立经共享编码器编码为触觉token $Z_t^{(k)}$,用于精炼剩余块;EATA掩码$M_i^{(k)}$限制这份触觉只直接条件第k+1块。第四步,训练:对演示动作块$A_t$采样高斯噪声$\epsilon$与归一化进度$p \sim U([0,1))$,构造块级插值状态$\hat{A}_t$,选用该阶段可用的触觉$Z_t^{(k^\star-1)}$与掩码$M^{(k^\star)}$,损失为 $\mathcal{L}_{train} = \mathbb{E}\left[\frac{1}{|U(p)|}\sum_{i \in U(p)} \|\hat{v}_{\theta,i}(p) - (a_{t+i-1} - \epsilon_i)\|_2^2\right]$,其中$U(p)$是流时间小于1的未完成动作位置集合,与推理时每步真正被更新的位置完全一致。

技术新颖性

技术新颖性体现在三处。其一,把Diffusion Forcing一族的位置相关噪声调度移植到基于流匹配的动作专家(初始化自π0.5/GR00T N1.7),使生成与执行交错第一次在触觉VLA框架内自然成立,而不需要独立的反应回路。其二,EATA首次显式提出并回答了一个此前文献没有处理的问题——在部分生成的动作时域内,相继到达的触觉观测应各自条件哪些动作;答案是用与执行调度耦合的注意力掩码做硬对齐,且训练时施加同一约束,避免流式推理时的训练-推理不一致。其三,训练目标只在未完成动作位上计算损失(以$U(p)$为指标集),精确匹配推理时每一步真正被更新的位置。与FTP-1的统一触觉token共享专家、RDP的外挂高频控制器、以及显式预测未来接触的预测式方法都不同,TacForcing既不做触觉预测也不拆分控制器,是到目前为止与主流VLA架构最兼容的执行时触觉融合方案。

Overview of TacForcing
Figure 1: Overview of TacForcing

实验结果

仿真实验:在UniVTAC六个接触密集任务上(每任务100次rollout),TacForcing平均成功率65%,全面领先——比视觉-only的π0.5(51%)高14个百分点,比触觉反应式RDP(42%)高23个百分点,比触觉条件化FTP-1(59%)高6个百分点,比UniVTAC-ACT(37%)高28个百分点;六个任务中五个取得最高或并列最高(Lift Bottle 90%、Pull-out Key 48%、Put Bottle in Shelf 43%、Insert Hole 69%、Insert Tube 79%),唯一失手是Lift Can(63%对FTP-1的66%)。真实世界:三个任务各16次独立试验,平均成功率69%,领先FTP-1(52%)17、GR00T N1.7(42%)27、π0.5(27%)42个百分点;在Stand Bottle和Transfer Liquid上均最高,Wipe Board与FTP-1并列最高;Transfer Liquid优势最悬殊,TacForcing达50%而所有基线不超过19%,说明需要在执行中精确调节接触的任务从执行时触觉反馈中获益最大。消融实验(3个仿真任务Pull-out Key/Lift Can/Insert Hole + 3个真实任务):Base(标准专家、无触觉)仿真平均43%/真实42%;Fixed Tactile(全程用初始触觉)仿真42%/真实31%,说明一次性触觉条件几乎无用甚至有害;去掉EATA的流式版本仿真51%/真实48%;完整TacForcing仿真60%/真实69%,证明执行时触觉更新与EATA各自贡献显著,且EATA在全部六个消融任务上都带来提升。

Results on the UniVTAC simulation benchmark
Table 1: Results on the UniVTAC simulation benchmark
Ablation results for four configurations
Table 2: Ablation results for four configurations
Real-world tasks and evaluation results
Figure 3: Real-world tasks and evaluation results
查看结构化数据
任务指标本文基线提升
UniVTAC 仿真六任务平均(Lift Bottle / Pull-out Key / Lift Can / Put Bottle in Shelf / Insert Hole / Insert Tube) 成功率(每任务100次rollout) 65% 最佳基线 FTP-1 59%;π0.5 51%;RDP 42%;UniVTAC-ACT 37% 对最佳基线+6pp,对π0.5 +14pp,对RDP +23pp
真实世界三任务平均(Stand Bottle / Transfer Liquid / Wipe Board) 成功率(每任务16次独立试验) 69% FTP-1 52%;GR00T N1.7 42%;π0.5 27% 对FTP-1 +17pp,对GR00T N1.7 +27pp,对π0.5 +42pp
Transfer Liquid(转移液体,真实世界最难任务) 成功率 50% 所有基线不超过19% 领先至少31pp
消融:流式+执行时触觉更新(无EATA) 平均成功率(仿真 / 真实) 51% / 48% Fixed Tactile 42% / 31% +9pp / +17pp
消融:完整TacForcing(流式+EATA) 平均成功率(仿真 / 真实) 60% / 69% 无EATA版本 51% / 48% +9pp / +21pp

局限与改进

作者明确承认的局限:为平衡响应速度与计算效率,触觉更新被限制在块级(每B=5个动作刷新一次)而非每个控制步,这对极快的接触瞬态(如滑移发生的一两步内)可能仍不够快;块大小B与分块数K是手工设定的超参数,未探索自适应调度。我自己的观察:其一,真实世界每任务仅16次试验,69%对52%的优势在统计上不算特别牢靠(样本量下的置信区间很宽),反倒是Transfer Liquid的50%对19%最有说服力;其二,方法依赖两个大型预训练底座(仿真用π0.5、真实用GR00T N1.7)和FTP-1预训练触觉编码器,冷启动成本高,且论文未报告流式推理相对标准整块生成引入的额外时延、显存与算力开销;其三,全部实验使用指尖形变映射触觉,未验证对全手分布式触觉阵列或其他传感器模态的适配;其四,缺少失效模式分析——当执行中途触觉反馈变差(如传感器噪声)时,被逐块修正的动作是否可能比原整块更差,以及相邻块修正累积是否引起轨迹抖动,均未讨论。

独立分析的弱点

独立分析三点弱点。第一,块级触觉更新的粒度问题:B=5意味着两次触觉注入之间存在5个控制步的盲区,对滑移抑制这类对毫秒级延迟敏感的控制场景仍可能漏检;改进方向是自适应块调度——用触觉token的余弦漂移速率在线触发提前注入反馈,或把固定的块级流时间调度替换为连续可学习的调度。第二,EATA只约束了动作token对触觉token的直接注意,远期块仍通过共享的中间隐状态间接携带旧触觉信息,掩码并不能完全杜绝陈旧触觉的泄漏;改进方向是对中间状态的触觉通路做正交化或门控衰减,显式抑制过时接触信息的传播。第三,评测规模偏小且任务域集中(插拔、注液、擦板),未覆盖动态接触(投掷、工具敲击)与高感知不确定性场景;同时缺少成功率-推理时延的权衡曲线,块数K增大虽提升触觉刷新频率但会直接推高计算量,改进方向是给出帕累托分析,并在六轴力传感器、全手电子皮肤等更多触觉形态上检验编码器的可迁移性。

未来方向

作者方向上,论文隐含的延伸是把流式框架推广到更多模态与更细粒度:目前视觉上下文只编码一次,未来可让视觉与触觉都在执行中途更新,把块级调度与模型预测控制式的前瞻结合。基于本文成果可延伸的方向包括:(1)自适应流时间调度——按触觉/视觉表征漂移速度动态调整各块的完成节奏,把何时注入反馈变成可在线优化的问题;(2)把EATA从硬掩码放松为软时间衰减核,允许触觉影响随执行距离平滑衰减并做系统消融;(3)触觉预测与流式修正结合——用当前触觉预测未来接触状态的分布,为远期块提供条件先验,兼顾反应性与前瞻性;(4)多指、全身触觉阵列下的token规模扩展与注意力成本控制(局部注意力、稀疏化);(5)跨传感器、跨本体迁移实验,检验除FTP-1预训练特征外其他触觉表征是否同样有效;(6)理论与实证分析逐块修正对轨迹一致性的影响,设计防止修正累积产生抖动的正则化手段。

复现评估

复现条件较好但非开箱即用。有利因素:项目网站 https://88runaway.github.io/tacforcing/ 已公开;仿真采用公开的UniVTAC基准(每任务100次rollout,协议明确);全部底座均为开源模型——仿真初始化自π0.5、真实世界初始化自GR00T N1.7,触觉编码器取自FTP-1的预训练权重,均可在HuggingFace获取;论文附录A/B/C给出了训练与平台细节,关键超参数齐全(块大小B=5、仿真H=50/K=10、真实H=40/K=8、每块间隔S个采样步、训练时随机进度p采样、损失仅在未完成位置计算等)。不利因素:正文未明确声明代码与模型权重的开源(论文文本所见仅有项目主页);真实世界部分需要双指触觉灵巧手平台,普通实验室难以复现每任务16次独立试验的硬件评测;流匹配专家的微调需要可观的GPU算力。总体判断:仿真部分中等偏易、可复现性高;真实世界部分高难度,依赖专门硬件。