N0-VTLA:用潜在触觉Token扩展视觉-触觉-语言-动作模型 N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
首个大规模触觉预训练VTLA模型,把触觉当作预测目标并配ALTER离线强化学习。
前置知识
视觉-语言-动作模型(VLA)
VLA是一类以预训练视觉-语言骨干为基础、能直接输出机器人动作序列的通用操作策略。它把相机视图、语言指令、机器人状态作为前缀输入,再通过自回归动作token或流匹配等连续生成头输出动作块。代表系统有RT-2、OpenVLA、π0/π0.5等,强调跨任务、跨场景、跨本体泛化。
N0-VTLA正是在π0.5这一VLA骨干上扩展触觉通路,理解VLA的动作块生成与统一动作空间是读懂本文架构的前提。
流匹配(Flow Matching)
流匹配是一类连续动作生成方法,通过把噪声沿一条流逐步去噪到目标动作分布来建模动作块。相比扩散策略,它生成连续低层指令、可捕捉多模态动作序列。本文动作专家在32维动作容器上以去掩码的流匹配目标预测H=50步的动作块。
本文动作专家沿用π0.5的流匹配目标,且ALTER离线学习也保持同一损失,理解流匹配才能理解动作如何生成与改进。
InfoNCE对比损失
InfoNCE是一种对比学习目标,通过把锚点与正样本的相似度相对一批负样本最大化来学表征。本文Stage 1用对称InfoNCE,让预测的潜在触觉token $z$ 与其匹配的未来触觉目标 $z^*$ 在批内拉近,把其余目标当作负样本,并在两个检索方向上对称化。
Stage 1接地预测器依赖InfoNCE让 $z$ 学会检索正确的未来接触,这是后续动作专家对齐与92.3% top-1检索率的基础。
优势条件化离线强化学习
离线RL从固定的离线数据集(无额外环境交互)学习策略;优势条件化指用相对优势(哪些状态-动作比同类更优)作为条件信号筛选或重加权样本,把不完美轨迹转化为策略学习信号。RECAP即把二值优势作为VLA训练条件。
本文ALTER正是优势条件化离线RL,把部署阶段的掉落事件、人工纠正、阶段进度转化为阶段相对的二值优势标签追加到任务prompt。
DINOv2自监督视觉编码器
DINOv2是Meta提出的自监督视觉Transformer,在无标注图像上预训练得到强通用视觉特征。本文把它冻结,加一个可训练线性投影,把接触差分图像编成10个token(1类token+3×3池化的9空间token)。
冻结DINOv2保留自监督表征、降低训练显存,并使新传感器可通过仅训轻量投影上线,是触觉编码通路的设计核心。
研究动机
现有视觉-语言-动作(VLA)模型虽已能跨任务、跨场景、跨本体泛化,但触觉这一关键感知通道长期缺位,使策略在接触密集型操作上存在持续弱点。已有的触觉扩展方案只在任务规模数据集上训练,最多几十小时、覆盖少数技能,无法支撑通用预训练。此外,整合触觉的两条主流路径都有根本缺陷:其一,把触觉token拼接到视觉-语言前缀、当作'又一个摄像头'对待,可触觉信号稀疏、非接触时近乎为空,在为信息密集视图设计的前缀里几乎买不到收益;其二,把当前触觉读数注入动作通路引导去噪,这错配了触觉的角色——触觉帧记录的是已发生动作产生的接触,单凭它几乎无法预判下一步动作将要造成的接触,策略因此始终落后于自身的接触事件一个步长。精插孔、抓取滑移等任务正需要预接触预判,而反应式信号到达时往往为时已晚。
本文的目标是本文目标是构建首个在大规模触觉数据上预训练的VTLA(视觉-触觉-语言-动作)基础模型,使其能完成两类任务:(1) 借助触觉感知与触觉反馈控制的精细接触密集型操作;(2) 从已存储的部署数据中离线改进策略。为此作者构建了NeoData——一个跨单臂、双臂及UMI手持夹爪的大规模视觉-触觉机器人数据集,并用统一32维跨本体动作空间把多平台数据训成同一个模型。同时作者希望找到比'拼接进前缀'或'注入当前触觉'更优的触觉整合方式,并通过ALTER方法把部署阶段的失败轨迹、人工纠正、掉落事件转化为离线策略学习的优势标签,让策略在固定部署语料上无需额外环境交互即可持续进步。
与已有工作不同的是,本文的独特切入角度是:把触觉从'观测上下文'重新定义为'预测目标'。N0-VTLA(读作NeoVTLA)不让触觉token进入视觉-语言前缀,而是训练一个小型预测器,让它读取当前触觉token与场景-指令上下文,蒸馏出潜在触觉token $z$,用以估计未来一个动作块($H=50$步)内的净接触变化,并直接以 $z$ 条件化动作专家。这样策略基于'即将发生的接触'而非'已发生的接触'来决策,抓住了预负载、滑移捕捉等真正决定成败的预接触瞬间。该思路源自联合嵌入预测原则(如I-JEPA、V-JEPA),但目标是触觉这种稀疏、近乎为空的信号,并配合三阶段训练配方把全新初始化的通路稳定挂载到预训练VLA上而不破坏其稳定性。
核心方法
N0-VTLA整体思路是'先预测、再反应'。直觉上,决定一个50步动作块成败的是该块自身将要造成的接触,而当前帧编码并不包含这一信息,因此让模型显式估计未来接触的净变化、再据此条件化动作生成。技术路线分三部分:基础策略采用PaliGemma视觉-语言骨干加流匹配动作专家(继承π0.5权重),动作块视野 $H=50$,统一在32维跨本体动作容器中预测,单臂、双臂数据共享同一固定宽度目标;新增的潜在触觉通路位于感知与动作之间——冻结的DINOv2编码器加可训练线性投影把每个夹爪手指的接触差分图像编成10个token(1类token+3×3池化的9空间token),一个轻量预测器把它们连同上下文蒸馏成 $z$;动作专家直接以 $z$ 为条件,触觉绝不进入视觉-语言前缀。辅以三阶段配方与ALTER离线策略学习。
核心创新点是'潜在触觉token作为预测目标'。与已有方法的本质区别在于:传统做法要么把触觉当作第N个摄像头塞进前缀,要么把当前触觉读数注入动作通路做反应式去噪。N0-VTLA走第三条路——触觉从不进入视觉-语言前缀,动作专家只条件化在对未来接触的预测 $z$ 上。预测器的训练目标是未来触觉目标 $z^*=\frac{1}{n}\sum_k f_{enc}(\text{tac}_{k,\tau+H}-\text{tac}_{k,\tau})$,即对每路视图未来 $H$ 步触觉变化做编码再平均。监督采用对称InfoNCE对比损失把预测潜变量拉近匹配的未来触觉目标,辅以对粗粒度未来触觉差分场的L1重建。如此 $z$ 承载的是预测性而非描述性信息:Stage 1后它在约32个候选中以92.3%的top-1准确率命中匹配的未来触觉目标,远超3.2%的随机基线,也高于仅用当前触觉编码检索的57%。
方法步骤详情
方法步骤如下。**触觉编码**:对视图 $k$,当前帧减去episode起始零接触基线帧得接触差分,冻结 $f_{enc}$ 加可训练投影输出 $g_k\in\mathbb{R}^{10\times d}$,n路拼为 $g$。**Stage 1(接地预测器)**:冻结基础策略,仅训预测器与投影,用对称InfoNCE把 $z$ 拉向 $z^*$、辅以L1重建项,总损失 $\mathcal{L}_1=\mathcal{L}_{NCE}+\lambda_{rec}\mathcal{L}_{rec}$。**Stage 2(对齐专家)**:冻结触觉感知栈,仅训潜在到专家投影与动作专家;掩掉视觉-语言前缀的key/value,迫使降损失只能经 $z$。**Stage 3(端到端)**:解除掩码,除冻结触觉编码骨干外全部解冻,用动作目标联合训练。**ALTER**:冻结成对进度模型 $A_\theta(x_a,x_b)$ 生成全局进度 $\hat\phi_t$ 与局部长程变化 $\hat r_t$,分阶段排序取前 $\rho=0.3$ 标正,把二值优势追加到prompt做离线学习,部署恒用positive。
技术新颖性
技术新颖性体现在四点。第一,据作者所知这是首个在大规模触觉数据上预训练的VTLA模型,此前触觉扩展最多在数十小时的任务级数据上训练。第二,触觉作为预测目标而非观测上下文或反应信号,预测器估计动作块视野内的净接触变化并直接条件化动作专家,这一归纳偏置契合预负载、滑移捕捉等预接触行为——论文用反事实探针证明触觉通路恰在接触关键时刻改变动作、在自由空间中保持静默。第三,三阶段配方把困难的联合优化拆成课程:先固定 $z$ 的含义、再固定专家如何使用 $z$、最后从已接地已接线的初始化联合训练,使随机初始化的触觉通路能稳定嫁接到预训练VLA上而不破坏其稳定性。第四,ALTER把触觉检测的掉落事件、人工纠正偏好、密集阶段进度统一进成对进度模型,产出阶段相对的二值优势标签做离线策略学习,无需额外环境交互。
实验结果
核心发现:**NeoReal(9个真实机器人任务)**N0-VTLA每任务成功率击败最强基线,平均47.2%对π0.5的29.4%,进度分56.8对42.3,ACT无一成功仅10.2;Socket Plugging达85%对60%,能从失败插入恢复。**UniVTAC仿真(8任务)**平均83.1%,领先最强外部基线InternVLA-A1的67.1%,Insert Hole 95%、Insert Tube 99%、抓取分类100%。**NeoSim(12任务)**平均50.8%对π0.5的45.8%;单臂四任务73.8%、双臂八任务仅39.4%,专家基线塌缩到个位数(双臂仅1.0%)。**二十任务总体**63.8%对π0.5的44.0%。**ALTER**:π0.5+ALTER三长程任务90%/75%/60%,N0-VTLA+ALTER达95%/80%/75%。**表征分析**:Stage 1后 $z$ 以92.3% top-1命中未来触觉目标(随机3.2%、仅用当前触觉57%);换触觉输入使 $z$ 移动约0.9而换RGB+prompt仅约0.2。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| NeoReal 9任务真实机器人平均成功率 | 成功率(%) | 47.2% | π0.5 29.4% | +17.8个百分点,9任务全胜 |
| UniVTAC 8任务仿真 | 平均成功率(%) | 83.1% | InternVLA-A1 67.1%(最强外部基线) | +16.0个百分点 |
| NeoSim 12任务仿真 | 平均成功率(%) | 50.8% | π0.5 45.8% | +5.0个百分点 |
| 二十任务仿真总体 | 平均成功率(%) | 63.8% | π0.5 44.0%(最强总体基线) | +19.8个百分点 |
| 潜在触觉token未来目标检索 | Stage1后top-1准确率(%) | 92.3%(约32候选池) | 随机3.2% / 仅用当前触觉编码57% | 预测性潜变量显著超过反应式与随机基线 |
| ALTER离线策略学习(三长程任务) | 成功率(%) | N0-VTLA+ALTER 95/80/75 | π0.5+ALTER 90/75/60 | 更强VTLA骨干在相同离线RL下保持5–15点优势 |
局限与改进
作者承认双臂任务仍是短板:NeoSim八个双臂任务平均仅39.4%,明显低于单臂的73.8%,双臂接触协调难度大,多个专家基线甚至塌缩到个位数。此外作者指出当前只在接触密集操作上验证,ALTER的泛化仍需在更广任务族上检验。从我观察看:第一,触觉完全依赖自研的基于图像的视觉触觉传感器,更换其他模态(力/低维力信号)的硬件需重做通路;第二,触觉通路虽设计为可'上线'新传感器(仅训轻量投影),但类图像触觉的带宽与同步成本不低;第三,ALTER依赖人工纠正日志与掉落事件检测,标注与数据管线成本高;第四,所有对比虽'对齐协议',但基线多为内部复现而非原始作者版本,公平性有限;第五,检索92.3%是在约32候选的within-pool率,非全语料检索,外推到大候选池的表现尚需更多证据。
独立分析的弱点
独立分析的弱点:(1) 双臂性能瓶颈——NeoSim双臂任务39.4%,且Unstack Bowl仅17%、Cup Handover 22%等偏低,部分任务相对π0.5提升有限。改进方向是把潜在触觉token扩展到双手相对接触建模,显式建模两手间的接触协调。(2) 触觉预测目标 $z^*$ 训练时需未来 $H=50$ 步触觉帧,依赖未来帧;free-latent变体虽免去但效果未充分对比,可深入研究纯动作梯度塑形 $z$ 的极限。(3) 触觉传感器为自研、未开源硬件设计,端到端复现门槛高,可推动标准化触觉接口。(4) ALTER的优势阈值 $\rho=0.3$ 与阶段切分为固定超参,对任务结构敏感,可做自适应或学习式阈值。(5) 反事实探针仅展示单episode,统计鲁棒性证据不足,应补充跨任务、跨样本的群体统计。
未来方向
作者明确提两个方向:一是free-latent与监督变体仅是触觉表征学习设计空间的两个点,'预测性潜变量'(用紧凑的未来净接触变化估计条件化动作生成,而非原始触觉token)值得在比本文特定预测器架构更广的范围探索;二是ALTER可扩展到更广任务族以研究其在不同操作设置下的有效性。基于成果可延伸的方向包括:把潜在触觉token推广到力觉、低维力信号等多模态接触感知;研究更长动作块视野 $H$ 对预测目标质量的影响;将ALTER的阶段相对优势框架与在线RL结合做离线到在线迁移;把成对进度模型与世界模型结合做显式未来接触建模;探索双臂场景下的相对接触预测以突破双臂瓶颈。
复现评估
复现评估:代码已开源(https://github.com/neoteai/N0-VTLA)并提供项目网站,是重要的复现基础。但存在明显障碍:(1) 核心触觉数据NeoData的完整组成仅在'配套数据报告'中描述,是否公开及许可证未在本文明确;(2) 关键硬件——自研基于图像的视觉触觉传感器——硬件设计未开源,更换其他传感器需重训触觉通路,难以端到端复现;(3) 预训练在集群规模(cluster scale)进行,算力门槛极高,普通研究者难以复现大规模触觉预训练;(4) 诸多超参($\lambda_{rec}$、$\lambda_{event}$、$m$、$\rho=0.3$、$H=50$、对比温度等)部分仅在附录给出,需查阅配套报告;(5) 基线多为内部对齐协议复现,非原始作者版本。综合看,算法思路与小规模SFT/ALTER阶段较易复现,大规模预训练与硬件端到端复现困难。
论文图表