N0-TWAM:面向接触密集操作的规模化触觉原生世界-动作模型 N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
首个大规模触觉原生世界-动作模型,联合预测视觉、触觉与动作
前置知识
World-Action Model (WAM) / 世界-动作模型
世界-动作模型把策略学习重新表述为「先生成未来,再从未来读出动作」。它在一个网络里同时学两件事:把机器人即将看到/感觉到的未来状态向前滚动生成出来,再从这个预测的未来里回归出动作,区别于直接把观测映射到动作的 VLA。
N0-TWAM 的核心架构就是 WAM,理解「预测-再-动作」这条因果链是看懂全文方法部分的前提。
Mixture-of-Transformers (MoT) / 混合 Transformer
MoT 把骨干网络拆成若干「按模态分组」的专家(本文分 video/action/tactile 三个),每个专家保留独立的权重、归一化和 FFN,但所有专家在每一层共享同一个 self-attention。这样不同模态既能保留专属容量,又能在统一的注意力通道里相互交换信息。
N0-TWAM 用 MoT 让视觉和触觉既相互完全可见又互不污染,是「触觉原生」得以在不破坏视觉先验的前提下实现的关键机制。
Flow Matching / 流匹配
流匹配是一种连续生成式建模目标,回归从干净数据 $x$ 到高斯噪声 $\epsilon$ 的直线路径速度 $u = \epsilon - x$。训练时给每个 token 独立采样噪声水平 $\sigma$,推理时沿学习到的速度场反向去噪得到生成样本,是扩散生成的一种简洁替代。
N0-TWAM 用 flow matching 同时训练视频、触觉、动作三种模态的生成目标,看懂它才能理解公式 (2)(3) 的多模态损失。
Vision-based Tactile Sensor / 视觉式触觉传感器
视觉式触觉传感器(如 GelSight、InTac S1)本质上是一台给柔软凝胶表面拍照的小相机:凝胶在接触时形变,相机拍下形变的彩色图像,于是「触觉」其实就是一路特殊的 RGB 视频流。本文据此让触觉和场景视频共享同一个 VAE 编码器与潜在空间。
这正是 N0-TWAM 能把触觉和视觉放进同一潜在空间、用同一个生成目标预测它们的根本前提。
Diffusion Forcing / 扩散强制
Diffusion Forcing 是 teacher forcing 在连续 token(潜变量)上的推广:训练时每个时间组独立采样噪声水平,模型对真实历史做 teacher forcing、只去噪当前 chunk,从而把自回归视频生成与扩散去噪统一在同一个掩码里。
N0-TWAM 的「预测-再-动作」级联完全由一个帧位因果掩码实现,Diffusion Forcing 是它统一的训练范式。
研究动机
接触密集操作(拧螺丝入位、从一摞杯子里剥出一个、夹住软物体)的成败取决于指尖接触状态而非全局场景布局——而外部相机几乎看不清这种状态,力/触觉传感器却能直接报告。但两条主流路线都缺一个要素:VLA 模型给大预训练视觉-语言模型加一个动作头,把丰富的当下视觉压成一个低维动作,根本没有对「下一刻会发生什么」的显式建模[8];视频世界模型则学会向前滚动未来,并被世界-动作模型耦合上动作[45,82],但它们预测的未来几乎全是纯视觉的。触觉目前沿三条不完整的路径进入控制:触觉策略只把触觉当输入、从不预测它[36];第二类用一个外挂的(常冻结)触觉预测器,预测发生在动作网络之外[80,87];并发的触觉感知世界-动作模型则把触觉放进网络但隔着一层——通过门控或掩码来保护视觉流[52,70,94]。在每一条路径上,触觉都不属于模型「预测」的对象,因此策略无法预见接触,只能对当下帧被动反应。
本文的目标是本文要做一个把触觉当作「被预测未来」一等公民的世界-动作模型,并让策略从「视觉+触觉联合预测的未来」里读出动作。具体目标有三:第一,在同一 flow-matching 目标、同一因果步上,把未来视觉与未来触觉联合生成出来,而不是把触觉当边输入;第二,在大规模真实机器人语料(六种本体、450 个任务、30000+ 小时)上预训练,使触觉表示与视觉表示在同一潜在空间里共同学习,而不是每个任务临时拟合;第三,在仿真与真机接触密集基准上成为整体最强方法,并用消融验证两条触觉路径(预测+观测)都各自有贡献、性能随预训练数据量增长、在分布偏移下优雅退化。
与已有工作不同的是,本文抓住的是一个被三条触觉路径共同忽视的点:触觉与视觉应当在「同一目标、同一因果步」上被联合预测。已有工作要么只读不预测、要么把预测器外挂、要么用注意力掩码把触觉隔离——本质上都把触觉当成「需要被保护/被隔离」的稀疏信号。N0-TWAM 反其道而行:不在注意力里限制触觉,而是把容量隔离到权重里——每个模态有自己的专家,视觉与触觉既完全相互可见又各有专属容量;同时让触觉承担双重角色,既作为前瞻目标被生成,又作为当下观测被条件化,这一双重设计是其他并发工作都没有的。
核心方法
可以把它想象成一个会「提前摸到」未来的机器人:在每个控制周期里,模型先想清楚下一刻场景会长什么样、指尖会碰到什么,再根据这个被想象出来的「视觉+触觉」未来决定怎么动。技术上,N0-TWAM 把骨干重组为 Mixture-of-Transformers:视频、动作、触觉各有一个专家,三者在每一层只通过一个共享 self-attention 交互。一个帧位因果调度(frame-id causal schedule)把这次前向传播变成「预测-再-动作」的级联——在一个 chunk 内,视频和触觉专家协同去噪出未来场景和未来接触,动作专家再以这两份刚预测出来的量为条件去噪动作。为了不让最大组件的成本翻三倍,作者用非对称设计:视频专家保留原始全宽(隐藏维度 $d_v=3072$,约 5B 参数),动作和触觉专家走窄路($d_a=d_t=1024$),从零训练、只通过共享注意力间接拿到视觉先验;这样总可训练参数约 7.16B,相比全宽方案(约 15B)几乎减半,且推理时一旦预测出视频+触觉,其 K/V 被缓存,每个动作去噪步只重跑轻量动作专家。
核心创新是「触觉与视觉同等重要地被预测,并通过一个掩码被自然地组织进动作生成的因果链」。具体来说三点最关键:第一,触觉不是边输入,而是与视频在同一个 flow-matching 目标、同一个因果步上被联合生成——即模型真正预测「未来接触」而不只是「未来像素」;第二,容量隔离在权重而非注意力里:每个模态有自己的专家权重,但共享一个 self-attention,所以视觉和触觉既相互完全可见,又互不污染(并发工作正是靠门控/掩码把触觉隔离,反而损害了视频与动作);第三,触觉双路径——预测的触觉活在 VAE 潜空间里作为前瞻目标(且以残差形式 $\Delta t_i = x_{t_i} - x_{t_0}$ 预测,因为触觉在非接触时近常量),观测的触觉用力空间读出(NeoForce 三轴表面力图 $[f_x, f_y, f_z]$)经零初始化交叉注意力接入动作专家。这三点合起来构成了「让触觉成为世界-动作模型一等公民」的本质区别。
方法步骤详情
完整流程分五步。(1)数据准备:NeoData 30000+ 小时语料的多视图 RGB 与同步指尖触觉被冻结 Wan2.2 VAE(4× 时间、16× 空间压缩)编码为潜变量,语言用冻结 umT5 编码;每条 episode 切成 33 潜帧窗口、步长 24、约 27% 重叠。动作统一到 20 维双臂末端空间(每臂 3D 位置 + 6D 旋转 + 1D 夹爪),用 chunk 起点锚定的 delta 表示。(2)预训练:128 块 H800 上 AdamW $\mathrm{lr}=10^{-4}$、batch 512、bf16 训练 30000 步(约 2.2 epoch),仅启用预测触觉通路;视频专家从 LingBot-VA 暖启动,触觉/动作专家从零训练,三模态 flow-matching 损失 $\mathcal{L}$ 权重 1:1:1,每个潜帧组独立采样噪声。(3)post-training:开启零初始化的观测触觉通路,NeoForce 力编码器经 chunk-causal 交叉注意力把当前触觉注入动作流;语言/触觉条件各以 0.1 概率 dropout(触觉用「整段不传」),让模型同时学到纯视觉-动作退化策略。(4)推理:流式滚动,chunk 内先去噪视频+触觉并缓存 K/V,每个动作去噪步只重跑轻量动作专家,相邻 chunk 异步预测隐藏在执行时间里,骨干可降到 FP8/NVFP4(注意力 QKV、softmax、norm、输出头仍保 bf16)。(5)长程执行:用触觉「标点」在接触事件处把演示切成子任务片段,Gemini 3.5 Flash 生成短指令并人工抽检;推理时一个轻量调度器持子任务队列,预测触觉提前一步触发切换、观测接触事件确认切换。
技术新颖性
相对已有技术的具体区别:相对「外挂触觉预测器」类工作[80,87],本文的预测发生在动作网络内部、与动作共享同一前向传播;相对「门控/掩码触觉」类并发工作[52,70,94],本文把容量隔离到权重里而非限制注意力,视觉与触觉相互完全可见;相对纯视觉世界-动作模型[45,86],本文预测的是「未来接触」而不是从像素里推断接触。此外,触觉用残差形式预测(触觉在非接触时近常量、信息量集中在接触起止的差分上)、观测通路零初始化以「无操作」嫁接到预训练模型上、以及非对称 MoT(视频全宽 + 触觉/动作窄路)让大规模预训练在算力可控的前提下成为可能——这些都是本文独有的设计组合,没有任何单一已有技术同时具备。
实验结果
三套基准都印证「让触觉成为被预测的未来」有效。UniVTAC(8 任务)平均 84.5%,比最强基线 InternVLA-A1(67.1%)高约 17 点;纯视觉世界-动作基线(LingBot-VA 31.4、FastWAM 48.0、GigaWorld-Policy 16.5)甚至落后于 VLA,说明仅预测视觉未来不够、任务由接触定义。NeoSim(12 任务)平均 49.4%,领先 π0.5(45.8),在 Insert USB(100 vs 74)、Plate/Bowl Stack 等接触任务上领先明显;但触觉优势比真机小,因模拟触觉非预训练传感器、观测通路退化为轻量编码器而非 NeoForce 力空间表示。真机八任务平均 46.3%,显著高于 π0.5(30.0)、LingBot-VA(21.9)、FastWAM(14.4),提升最大的是相机看不清隐藏接触的任务:Bottle Standing 70 vs 20、Socket Plugging 70 vs 60、Fruit Collection 60 vs 50、Board Wiping 55 vs 40;在视觉放置主导的 Cup Stacking/Bag Packing 上 π0.5 持平甚至略胜,与「增益来自触觉」一致。泛化上整体最稳健(51.7 平均),视觉扰动时 N0-TWAM 保持 45% 而 π0.5/LingBot-VA 跌到 25/30。消融显示预训练数据量是最大单因子(20% 子集让 UniVTAC 84.5→65.4),两条触觉路径都承重(移除预测→71.8、移除观测→70.5;NeoSim 更尖锐:41.1 与 29.6)。把模拟触觉换成更逼真 gel-rendered 渲染 + NeoForce,UniVTAC 进一步升到 88.1%,证明「触觉看起来像真的」时真机预训练的力编码器可迁移进仿真。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| UniVTAC 仿真(8 任务平均成功率) | success rate (%) | 84.5 | InternVLA-A1 67.1(最强任意类型基线) | +17.4 |
| NeoSim 仿真(12 任务平均成功率) | success rate (%) | 49.4 | π0.5 45.8 | +3.6 |
| 真机八任务(宏平均成功率) | success rate (%) | 46.3 | π0.5 30.0 | +16.3 |
| 视觉扰动泛化(Fruit Collection) | success rate (%) | 45 | π0.5 25 / LingBot-VA 30 | +15~20 |
| Bottle Standing(真机) | success rate (%) | 70 | 20(最强基线) | +50 |
| 消融·预训练规模(UniVTAC) | success rate (%) | 84.5(全量) | 65.4(20% 子集) | +19.1 |
局限与改进
作者承认与观察到的局限:第一,模拟触觉不是预训练所用传感器,导致 NeoSim 上触觉优势变小、观测通路只能退化为从零训练的轻量编码器,无法用 NeoForce 力空间表示,这也是真机增益大于仿真的原因之一;第二,真机每任务仅 20 次试验,二项标准误最高约 11%,单任务差距只能算「指示性」而非统计显著,作者明确说依赖「跨任务一致方向」与任务平均;第三,delta 末端动作在「对齐敏感任务」上会累积漂移,绝对位姿反而更好(Lift Can 24→93、Grasp Chip 38→92、四任务平均 50.0→82.5),说明统一多本体策略为迁移牺牲了精度。我另外观察到:真机基线集有限(主要对比 π0.5、LingBot-VA、FastWAM),缺少与其他最新触觉 VLA 或触觉世界模型(如 DreamTacVLA[80]、文献 52/70/94 的并发工作)的直接横向对比,使「首个大规模触觉 WAM」的领先地位主要是相对纯视觉/无触觉基线而言;同时 NeoSim 是自研基准,可复现性与可比性不如 UniVTAC。
独立分析的弱点
独立来看,几个弱点值得指出并给改进方向。(1)真机评测规模偏小(8 任务 × 20 试验)且成功由人工操作员判定,存在主观性与高方差——可引入自动化成功判定(力阈值 + 位姿检测)并扩到更多任务/试验以降低 SE。(2)触觉传感器绑定单一型号(InTac S1),跨传感器泛化只在仿真里间接验证;建议显式做「预训练用传感器 A、部署用传感器 B」的真实跨传感器迁移实验,呼应作者自己提出的「更广传感器覆盖」方向。(3)观测通路依赖 NeoForce 力估计器 $g_\theta$,而力估计器本身需要校准、可能漂移;可在闭环里加入力估计的不确定性建模或显式失败检测,避免错误力读数污染动作。(4)长程任务的「触觉标点」假设子任务边界总伴随接触事件变化,对纯视觉/运动主导的长程任务(如长距离搬运、视觉对齐)覆盖不全;可融合视觉关键帧与触觉事件做更鲁棒的边界检测。(5)预训练门槛极高(128 H800、30000+ 小时专有数据),社区难以独立复现大规模预训练;可发布中等规模子集 + 蒸馏版基线,降低跟进成本。
未来方向
作者明确给出三个方向:加速单向往复的流式解码以提升控制频率;延长视觉与触觉的预测窗口,让模型更早预判接触事件;训练更多类型/型号的触觉传感器以扩大可迁移本体范围。基于成果可延伸的方向:把触觉前瞻与潜在世界模型(latent world model)结合以进一步降算力;把 NeoForce 力空间表示做成 sim-to-real 桥梁,让仿真训练的触觉策略直接迁移到真机(本文 gel-rendered + NeoForce 已给出 82.4→88.1 的信号);扩展到多指灵巧手(当前最多四路触觉、双臂),触觉事件将更密集、子任务调度更复杂;最后把这套触觉原生 WAM 与基础 VLA 的语义先验融合,既保留 π0.5 在未见物体上的优势,又获得触觉带来的接触稳健性,弥补本文在 unseen object 上落后 π0.5(65 vs 80)的短板。
复现评估
作者承诺代码与权重公开发布(github.com/neoteai/N0-TWAM、research.neoteai.com/n0-twam)。但完整复现门槛很高:预训练依赖 NeoData(30000+ 小时、六本体、450 任务,多数带同步触觉),这是自采集的专有语料,社区几乎拿不到等价数据;预训练硬件需 128 块 H800、bf16 + FSDP2、约 2.2 epoch;NeoForce 编码器也在自有 20000 段演示上预训练(8 块 A100、100000 步)。可复现性较好的部分是 post-training:用 LeRobot 数据格式、单卡/少卡、AdamW lr=1e-4、1000 步即可适配到新任务;评测用的 UniVTAC 是公开基准,NeoSim/NeoReal 为自研需申请。整体属于「方法可借鉴、post-training 可复现、大规模预训练难独立复现」的级别。
论文图表
给出 N0-TWAM 的整体定位:在大规模自采集真机数据(带同步指尖触觉流)上预训练,一个含三个按模态专家(video/tactile/action)的 MoT 先预测未来视觉和触觉、再从它们预测动作,触觉既是被预测的未来、也是被观测的当下;并展示它在仿真与真机接触密集基准上超越先前世界-动作与 VLA 基线。
这张图是理解全文的总览:一眼看清「触觉双路径 + 预测-再-动作级联 + 大规模数据」三要素如何拼到一起。