TANGO:基于全身视觉-语言-动作模型的杂乱环境人形机器人导航 TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
首个直接输出29自由度全身动作的视觉语言导航模型,纯仿真训练即可零样本部署真机。
前置知识
VLA(视觉-语言-动作模型)
一类端到端机器人基础模型,以视觉观测和自然语言指令为输入,直接输出机器人动作(通常是关节角或位姿序列)。典型结构是视觉语言主干(如 Qwen2.5-VL)加动作生成头(扩散或流匹配),通过大规模示范数据训练,让模型隐式学会感知-决策-控制的完整映射,无需人工设计中间模块。
TANGO 本身就是一个 VLA:理解其 Qwen2.5VL-7B 主干加流匹配动作专家的三系统设计,是读懂全文方法部分的前提。
VLN 及其评价指标
视觉语言导航(Vision-Language Navigation)要求智能体根据自然语言指令和第一视角图像走到目标位置。常用指标:SR 成功率(终点距目标小于阈值,本文取 3 米)、SPL(按路径长度加权的成功率,惩罚绕路)、NE 导航误差、OSR Oracle 成功率(轨迹曾进入目标区);杂乱场景还用 CR 碰撞率(至少发生一次碰撞的回合占比)衡量安全。
论文所有实验表(Table 1-5)都用 SR/SPL/NE/OSR/CR 度量,不理解这些指标就无法比较各方法优劣。
流匹配与 MM-DiT
流匹配(Flow Matching)是一类生成模型训练范式:学习一个速度场,把高斯噪声沿概率流 ODE 连续搬运到数据分布,训练目标为均方误差形式的 $\mathcal{L}_{FM}$,相比扩散模型路径更直、采样更高效。MM-DiT 是多模态扩散 Transformer,把文本 token 与动作 token 放进统一的结构联合建模去噪过程。
TANGO 的 system-1 动作专家就是用流匹配训练的 MM-DiT,负责以 30Hz 生成连续的 29 自由度全身动作块。
实时分块执行(RTC)
动作分块(action chunking)指一次预测一段未来动作再流式执行,但新旧块拼接处容易产生不连续抖动。RTC(Real-Time Chunking)在训练时就让模型以随机长度的已提交前缀为条件,对剩余动作做修补式生成,使在线执行时新动作块能无缝接续上一块未执行完的部分,保证运动连续。
消融实验显示去掉 RTC 后杂乱场景 SR 从 43.75% 暴跌到 10.94%,它是本文能稳定流式控制真机的关键设计。
带符号距离场(SDF)与人工势场
SDF 给空间每点一个到最近障碍物表面的带符号距离 $\Phi(\mathbf{p})$,其梯度指向远离障碍的方向;人工势场用斥力场推离障碍、沿路径切向的引力推动前进,把避障写成受力问题。快速推进法(fast marching)可从体素占据栅格高效算出 3D SDF。
数据流水线 PET 的 Edit 阶段正是用 3D SDF 构建势场引导力,经全-body 逆运动学把参考动作编辑成跨步、下蹲、侧移等避障动作。
Sim-to-Real 零样本迁移
指策略只在仿真中训练,不经任何真机数据微调直接部署到真实硬件。成功要素包括逼真的物理与渲染、策略对观测差异的鲁棒性,常用数字孪生(在仿真器中按真实机器人位姿重新渲染观测)、高精度底层跟踪控制器等手段弥合差距。
TANGO 完全用仿真数据训练、在 Unitree G1 上零样本完成 30 米真实导航,这是本文最核心的卖点,理解这一点才能评价其贡献。
研究动机
人形机器人在杂乱室内导航时,其高维铰接身体的几何形状随运动连续变化,能否无碰撞通过取决于手臂、躯干、双腿能否与场景几何协调,这使得导航决策与全身可行性紧密耦合。然而现有方法都无法同时处理两者:主流视觉语言导航(VLN)方法(如 InternVLA-N1、Uni-NaVid、RDP)把导航建模为纯平面问题,输出 2D 路点或离散高层动作,低维动作空间根本无法表达导航决策与全身可行性的关系,遇到窄缝、头顶障碍、地面障碍时只能绕行;人形全身 VLA 基础模型(GR00T-N1.6、$\Psi_0$、WholeBodyVLA)虽然控制能力强,但把导航降级为高层移动指令交给下游控制器,导航过程中无法显式推理全身可通行性;基于强化学习的碰撞感知遍历方法(HumanoidPF)虽然能做避障动作,但依赖任务特定先验和训练分布,难以扩展到长时程语言引导的多样化杂乱场景导航。结果是:规划层面看似可行的动作,到了实体人形机器人身上可能根本执行不了。
本文的目标是本文要构建一个统一的全身视觉语言导航框架:给定自然语言指令、前后双目自我中心 RGB 观测和本体感知状态,模型直接预测 29 自由度的全身关节动作块,让导航意图与身体控制在同一动作空间中联合决策,不再拆分导航模块和控制模块。为了让模型学到既语义多样又物理可行的避障行为,作者还要建立一套全自动的仿真数据合成流水线,无需昂贵的人工动捕就能批量生成带无碰撞全身避障先验的训练轨迹;最终目标是在 VLN 基准和杂乱遍历任务上同时超越现有方法,并把训练好的策略零样本(不做任何真机数据训练)部署到 Unitree G1 人形机器人上验证。
与已有工作不同的是,本文的独特切入点是把导航问题从 2D 平面提升到 29-DoF 全身关节空间:不是先规划路径再让控制器执行,而是让 VLA 模型直接回归可执行的全身动作序列,从训练数据层面内化什么样的身体构型能无碰撞通过复杂 3D 场景。与之配套的关键创新是数据获取方式:不靠人工动捕加重定向(会有动作退化与具身失配),而是提出 Plan-Edit-Track(PET)自动流水线——先用 A* 规划加运动学生成自然步态,再通过势场引导的运动编辑注入避障行为,最后用 RL 跟踪器做可行性过滤——以 211 个 GPU 时的低成本合成 64,633 条轨迹。部署侧则复用预训练的通用运动跟踪器执行模型输出,避免共训控制器,保证架构跨平台可迁移。
核心方法
直觉上,TANGO 认为"导航即全身运动":动作空间必须覆盖整身自由度,模型才能在训练阶段学会规避碰撞。技术路线是三系统架构:system-2 为视觉语言感知主干,用 Qwen2.5VL-7B 实例化并以 InternVLA-N1 权重热启动继承导航先验;前后相机画面垂直拼帧后,用 BATS 按概率 $P(t)=(1-\epsilon)e^{k(t-T)/T}+\epsilon$ 采样历史帧管理长时程记忆,再经 GridPool 空间池化(近期观测细网格、历史粗网格)与语言指令一起编码为潜在上下文 token。system-1 为流匹配训练的 MM-DiT 动作专家,以潜在上下文和本体感知为条件,直接输出动作块 $\mathbf{a}_i=\{\mathbf{q}_{d,i}\in\mathbb{R}^{29}, \mathbf{r}_{b,i}\in\mathbb{R}^6\}$(29 个目标关节角加基座 6D 旋转),并采用稳定化回归目标 $\tilde{\mathbf{a}}_i=\{\mathbf{q}_{d,i},\tilde{\mathbf{r}}_{b,i},\Delta x_i,\Delta y_i,\Delta\psi_i\}$(基座偏航相对块首帧参数化并附加平面位移增量);训练时施加 RTC 保证流式执行连续。system-0 为现成的 SONIC 跟踪器,把动作块转成高频关节指令。数据全部来自 PET 流水线合成的 64,633 条轨迹,联合损失 $\mathcal{L}=\mathcal{L}_{CE}+w_{FM}\mathcal{L}_{FM}$($w_{FM}=20$)在 128 张 A100 上全参训练约 7 小时(896 A100 GPU 时)。
核心创新在于动作表示和数据引擎两点。动作表示上,与解耦式方法(GR00T-N1.6、WholeBodyVLA 只预测上半身、下半身发高层指令)和隐式运动表示方法(LeVERB、HumanoidVLA 用专门解码器解出动作)都不同,TANGO 直接预测可执行的 29-DoF 全身关节动作,交给一个与任务无关的预训练跟踪器执行,从而在导航过程中显式推理全身可通行性。数据引擎上,PET 流水线刻意不用跟踪器重放轨迹作为监督信号——因为那样会把跟踪误差和类人度损失混进标签——而是把经过物理可行性验证的无碰撞参考动作(规划与编辑阶段的产物)作为动作监督,既保留类人运动结构又确保物理可执行。再加上训练时 RTC 对齐离线训练与在线流式执行,这三者共同构成了与已有 VLN 和全身控制工作的本质区别。
方法步骤详情
数据合成按 PET 三阶段进行。Plan:在含障碍占据图上跑 A*,步进代价加障碍感知项 $c(\mathbf{x})=c_{\text{step}}+\lambda\exp(-\Phi_{2D}(\mathbf{x})/d_0)$ 偏向开阔区;规则式航向改写器检测窄通道后把身体朝向改为 $\psi_{\text{body}}=\psi_k\pm\pi/2$ 诱导侧步;轨迹转为速度指令喂 SONIC 生成自然参考步态,再在 IsaacSim 以 2Hz 渲染自我中心 RGB、用 Gemini 2.5 Flash 生成指令。Edit:在宽约 $w_{\text{corr}}\approx0.5$ 米的走廊内用快速推进法建 3D SDF,构造切向推动加障碍排斥的引导场,经 SoftMimic 式伪力转为有界位移 $\Delta\mathbf{p}_\ell=\text{clip}(\kappa\mathbf{f}_\ell,\delta_{\max})$ 作用于肩、肘、腕、躯干等连杆;下蹲用前瞻探测加虚拟头部障碍并耦合腰部俯仰与 CoM 下移;跨步由步态适配模块把落点重定位到障碍远端 $d_{\text{land}}=d_{\text{far}}+m$,摆动轨迹叠加非对称抬脚弧,峰值高度 $h_{arc}$ 逐步求解保证足印全程越障。Track:编辑后轨迹逐帧送 SONIC 在 MuJoCo 闭环验证,丢弃失败或碰撞轨迹,再基于通过验证的轨迹重渲染并更新指令——注意监督信号用的是编辑后的参考动作而非跟踪器重放。训练时对大转弯、侧步、下蹲、跨步等稀有行为上采样并按关节维度加权损失。部署时 VLA 在 RTX PRO 6000 服务器每 0.5 秒推理一次,15 步 30Hz 动作块回传机载 Jetson Orin NX、重采样到 50Hz,由 SONIC 以约 200Hz 闭环执行。
技术新颖性
技术新颖性体现在五个方面。第一,这是首个直接预测 29-DoF 关节空间动作的全身视觉语言导航框架,把'能否通过'内化到动作预测本身,而此前 VLN 只管 2D 路点、全身控制只管执行指令。第二,PET 数据引擎免去了人工动捕:合成 64,633 条轨迹仅需 PET 86 加渲染 125 共 211 个 RTX PRO 6000 GPU 时,其中增广 SAGE-3D 贡献 28,693 条,成本结构清晰可扩展。第三,用编辑后的参考动作而非跟踪器重放轨迹做监督,是一个反直觉但关键的设计,保住了类人运动质量同时确保物理可行。第四,训练时 RTC(对随机已提交前缀做修补式预测)解决了离线分块训练与在线流式执行的错配问题,消融证明其贡献最大(去掉后 SR 掉 32.81 个百分点)。第五,system-0 跟踪器与策略解耦,实验证明可把 SONIC 换成 ScaleBFM 而性能只降不到 3 个点,说明框架平台无关、可跨人形本体复用。
实验结果
主基准 VLNVerse(Table 1):Val Seen 上 SR 54.69%、SPL 40.18、NE 3.90、OSR 70.31%;Val Unseen 上 SR 52.89%、SPL 40.18、NE 3.72、OSR 71.07%,SR 与 NE 全场最佳,超过 InternVLA-N1(unseen SR 45.56%)、Uni-NaVid(45.00%)、RDP(48.60%),且是唯一带底层物理控制的方案(基线均为传送评估),SPL 略低于 RDP 的 42.72 归因于保守跟踪器绕障。杂乱环境(Table 2,增广 VLNVerse-unseen):SR 43.75%、SPL 31.83、CR 9.90%,对比最强基线 InternVLA-N1+HumanoidPF(SR 41.88%、SPL 29.49、CR 15.81%),碰撞率相对下降约 37%,且对手额外使用 LiDAR 而本文纯 RGB。真机实验(Table 3,各 15 次试验):短程 2D 12/15 成功(基线 11/15),长程 2D 8/15、碰撞 1.07(基线 6/15、3.47),杂乱 3D 10/15、碰撞 0.73(基线 6/15、1.93)。动作空间消融(Table 4)最有说服力:平面变体 Ours-2D 传送设定下 SR 45.74%,切到物理执行暴跌至 26.67%(SPL 35.44→8.34),完整 TANGO 物理执行达 52.89%/40.18。组件消融(Table 5):去 RTC 后 SR 崩至 10.94%(-32.81 个百分点)、CR 升至 14.60%;去运动编辑 SR 36.25%、CR 20.60%;换 ScaleBFM 跟踪器仍达 SR 40.94%、CR 9.10%,验证模块可替换。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VLNVerse 仿真导航(Val Unseen,423/825 条轨迹评估) | SR / SPL / NE | 52.89% / 40.18 / 3.72 | InternVLA-N1:45.56% / 34.98 / 4.09;RDP:48.60% / 42.72 / 3.75 | SR 比最强 VLA 基线高 7.33 个百分点,NE 最低;且是唯一在真实物理约束下评估的方法 |
| 杂乱环境遍历(增广 VLNVerse-unseen) | 碰撞率 CR(%) | 9.90%(SR 43.75%、SPL 31.83) | InternVLA-N1 + HumanoidPF:15.81%(SR 41.88%、SPL 29.49) | CR 相对降低约 37%,同时 SR +1.87、SPL +2.34 个百分点,且本文纯 RGB 对比对方带 LiDAR |
| 真实世界杂乱 3D 导航(Unitree G1,3 场景 × 5 次试验) | 成功次数 / 平均碰撞次数 | 10/15 成功,平均碰撞 0.73 次 | InternVLA-N1 + Unitree WBC:6/15 成功,平均碰撞 1.93 次 | 成功次数 +4,碰撞次数减少 62%,零样本 sim-to-real 无任何真机训练数据 |
| 真实世界长程 2D 导航(约 30 米、2-3 个转弯) | 成功次数 / 平均碰撞次数 | 8/15 成功,平均碰撞 1.07 次 | InternVLA-N1 + Unitree WBC:6/15 成功,平均碰撞 3.47 次 | 碰撞次数减少约 69%,长航线全程语言引导无碰撞通过 |
| 动作空间消融(VLNVerse-unseen,物理执行) | SR / SPL(%) | 52.89 / 40.18(29-DoF 全身动作) | Ours-2D 平面动作:26.67 / 8.34;InternVLA-N1:42.37 / 22.50 | 全身动作空间使物理执行下 SR 提升 26.22 个百分点、SPL 提升 31.84 |
| 组件消融:动作块连续性(增广 VLNVerse-unseen) | SR / CR(%) | 43.75 / 9.90(含 RTC) | 去掉 RTC:10.94 / 14.60 | RTC 贡献 32.81 个百分点 SR,是所有组件中影响最大的设计 |
局限与改进
作者明确承认两点局限:一是底层跟踪器能力成为进一步部署的瓶颈,例如无法走上楼梯这类更复杂地形;二是视觉输入仅有 RGB,在视觉歧义、严重杂乱或低光照环境下场景理解受限,深度相机和 LiDAR 预期能带来帮助。除此之外我还有几点观察:真机实验每类设置只有 15 次试验,样本量小、置信区间宽,结论的统计强度有限;真机杂乱场景测试使用的是行为显式指令(prompt 中直接写明'跨过去/蹲下/侧移'),作者也坦承加入避障提示语是经验观察而非受控语言消融,这意味着模型在隐式指令下的真实避障能力尚未被严格检验;数据增广只覆盖跨步、侧移、下蹲三类障碍(比例 44%/15%/41%),模板化资产可能限制对真实世界更多样障碍的泛化;SPL 全面低于部分基线,反映保守跟踪器带来的路径效率损失;另外窄通道侧步依赖规则式航向改写器,超出规则假设的场景行为未知。
独立分析的弱点
第一,规则式航向改写器只在 2D 层面做 ±90° 窄通道处理,遇到斜向极窄通道、连续弯折或动态障碍会失效,改进方向是让动作专家端到端学会步态选择。第二,system-2 每 0.5 秒推理依赖云端 RTX PRO 6000 与约 20ms 网络,一旦延迟抖动破坏 RTC 时序假设全身动作可能失稳,可量化蒸馏到机载算力或预测更长动作块。第三,数据引擎依赖 Gemini 2.5 Flash 生成指令与过滤场景,指令-视觉对齐噪声从未被量化,建议人工校验子集并发布质量报告。第四,Edit 阶段势场参数($\beta$、$\sigma$、$\delta_{\max}$、$w_{\text{corr}}$)均手工整定,迁移到新人形本体需重调,可引入自动参数搜索。第五,碰撞过滤只覆盖仿真已建模几何,真实世界未建模物体(桌下横杆、线缆)会漏检,可在线感知构建局部 SDF 回灌监督。第六,VLN 主基准上基线均为传送评估而本文带物理执行,虽更真实但并非完全对等比较;真机每设置仅 15 次试验,统计强度有限。
未来方向
作者提出的方向:把 TANGO 作为基础模型向更通用的 loco-manipulation(移动操作)基础模型扩展,处理需要全身协调与主动用手的任务;增强底层跟踪器以攻克爬楼梯等更难地形;引入深度相机和 LiDAR 弥补纯 RGB 的场景理解短板。基于本文成果可以自然延伸的方向:将全身导航与操作统一,例如边走边开门、推开椅子等需要手臂与环境交互的任务,PET 流水线可扩展交互式运动编辑;引入长时程任务分解与空间记忆,支撑 30 米以上的多房间导航;利用其可替换的 system-0 接口适配更多人形本体(如全尺寸人形、轮式人形),检验 29-DoF 动作空间定义的跨平台泛化;在真机上做在线适应与自我修正,利用碰撞事件作为负反馈微调策略;以及扩大数据引擎规模(更多场景源、更多障碍类型、动态行人),检验数据驱动的全身导航是否存在规模化增益。
复现评估
复现透明度较高。作者承诺开源五件套:PET 数据流水线、64,633 条轨迹数据集、VLA 框架、模型检查点、部署系统(tango-vla.github.io)。依赖组件基本公开:Qwen2.5VL-7B 与 InternVLA-N1 权重开源,VLNVerse/SAGE-3D 场景公开,IsaacSim、MuJoCo 开源,SONIC 来自 GR00T 系工作、ScaleBFM 亦有公开版本。算力门槛:数据合成约 211 个 RTX PRO 6000 GPU 时(PET 86 + 渲染 125),训练 896 个 A100 GPU 时(16 节点 × 8 卡 × 约 7 小时全参微调),对学术实验室偏重但可及。真机复现难度最高:需 Unitree G1、RTX PRO 6000 服务器、机载 Jetson Orin NX、RealSense D455/D435i 及网络环境与安全场地。综合评估:仿真部分有 GPU 集群即可复现,难度中等;完整真机复现需机器人硬件与运维能力,难度较高,但可先用开源检查点在仿真验证。
论文图表
开篇主图,展示 TANGO 作为全身基础模型在杂乱室内场景的导航能力:在真实杂乱办公室中零样本走完 30 米长航线,并分别演示三类全身避障行为——大步跨越(Stride)地面障碍、下蹲(Squat)通过头顶障碍、侧移(Sidestep)挤过窄道。
这张图一图定义了任务:杂乱环境中的人形全身导航到底指什么行为,也预告了论文要解决的三大挑战类型,是理解全文的起点。
真机三类设置的定量对比(每设置 3 场景 × 5 次试验 = 15 次):短程 2D(约 10 米)TANGO 12/15 成功、平均碰撞 0.40,长程 2D(约 30 米)8/15、碰撞 1.07,杂乱 3D 10/15、碰撞 0.73;基线 InternVLA-N1+Unitree WBC 分别为 11/15 与 1.40、6/15 与 3.47、6/15 与 1.93。
唯一的真机定量证据,用成功次数与每回合平均碰撞数两个维度量化了零样本 sim-to-real 的优势。
动作空间消融:在 VLNVerse-unseen 上对比传送设定与物理执行两种模式。平面策略在传送下表现尚可(Ours-2D 45.74%/35.44),切到 Unitree 物理执行后暴跌至 26.67%/8.34;而完整 TANGO 物理执行下达 52.89%/40.18,显著超过所有配置。
最关键的消融表,直接证明了 29-DoF 全身动作空间是策略在真实物理约束下保持鲁棒的根源。
组件级消融(增广 VLNVerse-unseen):去掉 RTC 后 SR 从 43.75% 崩至 10.94%、CR 升至 14.60%;去掉运动编辑后 SR 36.25%、CR 恶化至 20.60%;把 SONIC 跟踪器换成 ScaleBFM 后仍有 SR 40.94%、SPL 29.65、CR 9.10%,三项指标与默认配置差距在三个点以内。
量化了每个设计决策的贡献:RTC 影响最大、运动编辑次之,同时证明框架对底层跟踪器的可替换性。