τ0-VLA:世界模型引导测试时计算的分层机器人基础模型 τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
高层子任务决策按需触发世界模型束搜索,用测试时算力换长程操作成功率。
前置知识
VLA(视觉-语言-动作模型)
将视觉观测和语言指令映射为机器人动作的多模态模型,通常在预训练视觉语言模型(VLM)骨干上接入动作生成模块,端到端学习\u201c看-想-动\u201d,是当前机器人通用策略的主流范式。本文低层策略由 Qwen3.5-2B 骨干加 Mixture-of-Transformers 动作专家构成,高层四个模型则微调自 Qwen3.5-9B 机器人预训练检查点。
整套 τ0-VLA 建立在 VLA 之上:低层是 VLA,高层是微调 VLM。只有理解 VLA 的输入输出接口(观测+本体状态+语言命令→动作块),才能看懂层级之间如何通过“子任务文本”衔接。
测试时计算(Test-Time Computation)
源自语言模型的思想:不增加参数,而在推理时分配更多算力(多采样、搜索、自我验证)换取更高质量输出,如 o1 式推理或 Best-of-N 选择。核心假设是\u201c算力可换精度\u201d,且增益随算力增加呈边际递减,最终饱和。
本文的核心贡献就是把该思想搬到机器人高层子任务决策:分支因子 $N$、束宽 $B$、深度 $D$ 三个旋钮控制推理预算,Figure 4、5 直接验证了算力与精度的标度关系及其饱和点。
世界模型(World Model)
学习环境动力学、能预测\u201c采取某行为后未来观测会变成什么样\u201d的生成模型,在机器人中常以未来图像/视频预测实现,让策略在执行前\u201c脑内模拟\u201d候选动作的物理后果。
本文世界模型 $W$ 输入当前头部相机图像 $\tilde{o}$ 和候选子任务 $z$,预测子任务完成时的终端图像 $\hat{o}=W(\tilde{o},z)$,是搜索中评估候选的关键部件——没有它就无法在提交前比较不同子任务的后果。
流匹配(Flow Matching)
一类生成式动作解码方法:训练神经网络速度场,把高斯噪声沿(线性)路径输运到动作分布,推理时从纯噪声积分到干净动作。相比离散 token 自回归更适合连续控制,π0 系列模型均采用。
本文低层策略用条件流匹配生成 30 步动作块,并提出掩码流匹配(把本体掩码同时作用于流路径和训练目标)以支持多本体统一动作空间,读懂第 IV-C 节的训练目标需要这一背景。
束搜索(Beam Search)
树状解空间中的启发式搜索:每层从候选扩展中按累积得分保留最好的 $B$ 条路径,逐层深入。计算量由分支因子、束宽、深度三个超参精确控制,以宽度换接近全局最优。
τ0-VLA 的高层测试时计算正是在开放语言子任务空间做束搜索(Algorithm 1):每条分支累积价值模型分数 $S(b\oplus z)=S(b)+v$,全局 TopB 剪枝,$N/B/D$ 就是算力分配接口。
研究动机
长程机器人操作(打扫房间、做一顿饭、泡奶茶)要求机器人既可靠执行单个技能,又在几分钟到十几分钟内把数十个子步骤连贯串接。主流分层 VLA 的高层策略用单次前向传播、固定算力直接输出下一个子任务:既不比较候选方案,也不评估方案会导致的物理后果,错误只能等执行已经改变环境后才被发现,而子任务选错通常无法靠更精细的电机控制挽回——机器人可能\u201c完美地执行了错误的子任务\u201d。论文给出具体例子:番茄鸡蛋炒菜中加盐几乎不引起画面可见变化,只看当前观测的策略无法判断这步是否已完成,直接执行策略因此反复加盐或干脆跳过,两者都违反成功判据;类似地,Clean Room 中跨房间转换后的进度遗忘使失败集中在挂包和后续整理阶段。实测中 GR00T N1.7、LingBot-VLA、π0.5 直接执行四个长程任务的平均成功率仅 0%–22.5%,π0.5 在番茄鸡蛋炒菜上更是 0/10。
本文的目标是本文要把\u201c生成下一个子任务\u201d从固定算力的单次前向传播,改造成推理时可扩展的计算问题:决策不确定时自动触发额外推理,用世界模型想象每个候选子任务完成后的终端图像,用价值模型评分,用束搜索递归展开有希望的分支,再由反思模型综合保留分支生成最终子任务,使算力投入与决策难度匹配。同时系统不牺牲执行能力:低层策略在统一的 40 维状态/动作空间上工作,用 40,115 小时异构真实数据训练,同一套模型支撑固定基座操作、双臂协调与移动全身控制三种本体。最终作者要在真实机器人上验证一条完整因果链:测试时算力 → 下一子任务预测精度 → 闭环任务成功率,并给出算力-精度的定量标度关系。
与已有工作不同的是,已有搜索类工作处在两个极端:动作级搜索(RoboMonkey、VLA-Reasoner、Guo et al. 的动作轨迹 MCTS)在连续动作上分配推理算力,但只能看到局部物理后果;纯语言级推理能比较候选却不落地到物理状态。本文的切入点是\u201c子任务\u201d这一中间粒度——它足够稀疏、值得为每次决策付出额外计算,又时间上足够长、足以引起可区分的环境变化,因此\u201c预测候选子任务的终态图像\u201d是有信息量的评估信号。与最接近的 π0.7 相比顺序被反转:π0.7 的世界模型为高层已生成的子目标补图像,本文的视觉预测发生在提交之前,用于多候选比较与剪枝。此外本文把可纠错的执行记忆(通过扰动训练自动学会修复滞后/超前/错报的记忆)与后果感知搜索耦合,并以反思模型而非简单选择候选收尾,最终输出不受候选集约束。
核心方法
直觉是“先在脑中想清楚,再动手”。系统分两层:高层策略维护执行记忆、决定当前该做什么子任务;低层策略把子任务翻译成动作块。高层由四个模型组成:提案模型 $P$ 基于上下文 $h_t=(\ell,M_{t-1},z^\star_{t-1},o_t)$ 更新记忆并给出直接提案 $z^{\mathrm{dir}}_t$,同时从同一次前向传播的 token 置信度计算路由信号 $g_t$——有把握走快速路直接下发,不确定则触发测试时计算(TTC)。TTC 是“提议-预测-评估”循环:$P$ 对每条保留分支采样 $N$ 个候选子任务,世界模型 $W$ 预测每个候选的终端图像 $\hat{o}=W(\tilde{o},z)$,价值模型 $V$ 打分 $v=V(\ell,z,\hat{o})$,束搜索按累积分数全局保留 top-$B$,递归到深度 $D$;最后反思模型 $F$ 综合保留分支摘要生成最终子任务。低层策略用 Qwen3.5-2B 骨干加 MoT 动作专家,经条件流匹配输出 30 步动作块;部署时高低层异步流水线化,控制频率约 30 Hz。
核心创新有三。第一,把高层子任务生成显式定义为“算力可扩展的推理问题”:路由器复用提案模型已产生的 token logit——全生成 token 的平均概率 $u^{\mathrm{all}}_t$ 与 memory 字段内的平均 logit 间隔 $u^{\mathrm{mem}}_t$——与阈值 $\delta_{\mathrm{all}},\delta_{\mathrm{mem}}$ 比较得到 $g_t$,零额外前向即可决定是否搜索,算力随决策难度自适应分配。第二,候选的评估信号是“预测的物理后果”而非语言自洽性:世界模型生成候选完成时的终端图像,价值模型把它当 5 选 1 的序数 VQA(从明显错误到明显正确,映射到 $[0.05,0.95]$),使搜索比较的是“做下去世界会变成什么样”。第三,可纠错的执行记忆:训练时只扰动输入记忆(滞后、超前、错报进度),正确目标从演示读出,让模型学会对照视觉证据修复记忆,rollback 样本控制在 10–15% 以免教模型不信任正确的记忆,全程零人工标注。
方法步骤详情
闭环推理(Algorithm 1):(1) 观测后构造上下文 $h_t$;(2) 提案模型更新记忆并输出直接提案 $z^{\mathrm{dir}}_t$,同时计算路由 $g_t$;(3) $g_t=0$ 走快速路直接下发;$g_t=1$ 调用 SEARCH:深度 $d=1..D$ 每层对每条保留分支采样 $N$ 个子任务,世界模型预测 $\hat{o}=W(\tilde{o},z)$、价值模型评分 $v$,子分支按累积分数全局 TopB 剪枝;(4) 反思模型 $z^\star_t=F(\bar{h}_t,\mathcal{C}_t)$ 生成最终子任务,可超出候选集;(5) 低层策略以 $z^\star_t$ 为语言命令,经掩码流匹配生成 30 步动作块执行;(6) 真实观测回填记忆闭环。训练侧:低层三阶段(知识隔离共同训练→端到端→任务适配);提案/价值/反思模型自同一 Qwen3.5-9B 检查点微调,世界模型初始化自 Step1X-Edit,用子任务对齐起止帧监督,并以 P/W 交替的离线 rollout 训练价值与反思模型。
技术新颖性
新颖性有四。搜索对象:不同于动作轨迹上的 MCTS 或潜空间动作方案选择,本文在开放语言子任务空间搜索,每个候选通过其预测的终端图像被评估,兼顾语义广度与物理落地。架构分工:提案/世界/价值/反思四模型解耦,且以“反思”而非“选择”收尾——最终子任务由 $F(\bar{h}_t,\mathcal{C}_t)$ 生成,训练时把离线 rollout 候选连同预测状态、分数与真值配对,教模型修复有缺陷的候选而非复制第一个提案。数据工程:高层数据全部从既有任务/阶段/子任务标注自动合成(Gemma4-31B-it 预标注+程序化过滤,弃 11.74% 片段、保留 40.4M 干净样本),五类记忆扰动家族零标注成本。控制接口:40 维统一状态/动作空间加对角掩码 $M$,掩码同时作用于流路径 $a^j_\tau=\tau M\epsilon^j+(1-\tau)Ma^j$ 与损失 $\mathcal{L}_{\mathrm{FM}}$,一个策略覆盖三种本体而无需本体专属输出头。
实验结果
长程四任务(各 10 次真机试验):层级系统平均成功率 45.00%、进度 87.85%,高于直接执行(27.50%)、π0.5(22.50%)、GR00T N1.7(2.50%)与 LingBot-VLA(0%)。最大增益在番茄鸡蛋炒菜:0/10→4/10、进度 65.00%→81.82%,因为记忆显式记录加盐进度,消除加盐重复/遗漏歧义。TTC 闭环(Table III):Make Milk Tea 5/10→7/10,Book Organization 6/10→9/10(进度 66.67%→93.33%),Clean Room 5/10→7/10。开环预测(Fig 4):TTC 四设置全部最高,如 Make Milk Tea 87.3% vs 64.7%;分布偏移的 OOD 书序差距最大(74.0% vs 50.0%)。跨本体(Table II):Collect Laundry 10/10,Tidy Makeup Table 三组 10/10、9/10、10/10 全面领先。算力-精度(Fig 5):精度随算力沿饱和曲线上升后趋平;剩余失败集中在扣盖、插吸管等接触密集操作。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长程四任务(Clean Room/Prepare Ingredients/Stir Fry/Make Milk Tea) | 平均成功率 SR | 45.00%(层级系统,Plan Once) | π0.5 22.50%;τ0-VLA 直接执行 27.50% | +17.5pp,相对 π0.5 翻倍 |
| 长程四任务 | 平均里程碑进度 | 87.85% | π0.5 73.05% | +14.80pp |
| Book Organization(闭环 + TTC) | SR / 进度 | 9/10 / 93.33% | Plan Once 6/10 / 66.67% | +3 次 / +26.66pp |
| Make Milk Tea(闭环 + TTC) | SR / 进度 | 7/10 / 95.38% | Plan Once 5/10 / 91.92% | +2 次 / +3.46pp |
| 开环下一子任务预测(Book Org OOD) | 预测准确率(LLM judge) | TTC 74.0% | Plan Once 50.0%;Best-of-N 57.5% | +24.0pp / +16.5pp |
| 开环下一子任务预测(Make Milk Tea) | 预测准确率(LLM judge) | TTC 87.3% | Plan Once 64.7%;Best-of-N 70.0% | +22.6pp / +17.3pp |
| Collect Laundry(ARX AC One,直接执行) | SR / 进度 | 10/10 / 97.00% | π0.5 9/10 / 88.00% | +1 次 / +9.0pp |
| Tidy Makeup Table(双臂 Franka,三组合计) | SR | 29/30 | π0.5 24/30;GR00T N1.7 25/30 | +5 次 / +4 次 |
局限与改进
作者承认的局限:接触密集的精细操作仍是瓶颈,Make Milk Tea 剩余失败集中在扣盖与插吸管(前期准备均已完成);TTC 增益随算力饱和,Fig 5 显示其最终到达平台期。我的补充观察:每设置仅 10 次真机试验,SR 差 1–2 次时统计功效不足,45% vs 27.5% 的主结论尚稳,但 Clean Room 5/10 vs 4/10 这类差距难以排除噪声;TTC 成本以 PFLOPs/样本计,虽然高低层异步解耦保住 30 Hz 控制,对嵌入式部署仍昂贵;世界模型只预测单张头部相机 RGB,对“加盐”这类视觉显著性极低的状态转变几乎没有分辨力——该任务实际靠文本记忆而非视觉想象解决;路由阈值 $\delta_{\mathrm{all}},\delta_{\mathrm{mem}}$ 需在每任务留出数据上单独校准,跨任务泛化的路由仍是开放问题;评估任务全部来自家庭场景,高层评测 ground truth 由与训练同源的自动标注管线产生,存在同源性偏差风险。
独立分析的弱点
独立分析四个弱点。其一,价值模型输出 5 级离散分数、映射到 $[0.05,0.95]$,无法刻画\u201c扣盖成功但密封不严\u201d这类细粒度质量差异,改进方向是引入回归式或成对偏好的连续奖励,或用真机成败信号做 RL 微调。其二,世界模型输入输出均为单视图 RGB,不建模可变形物体与接触动力学,对低视觉显著性的状态转变(加盐、拧紧)分辨力弱,可扩展到深度、触觉或腕部相机的多模态预测。其三,执行记忆是纯文本,长程任务中物体精确位姿、半开抽屉等空间细节会被压缩丢失,多步之后的错误可能无法从文本恢复,可引入关键帧检索式视觉记忆(如 MEM)互补。其四,束搜索的候选多样性完全依赖提案模型的采样熵,分布外场景下若采样坍缩到单一模式,$N$ 次采样高度相关、搜索收益下降——OOD 书序上 TTC 也只到 74% 而非域内 88% 即是信号,可用多样性正则或温度调度增强候选覆盖。
未来方向
作者方向:把 TTC 的算力-精度标度律(Fig 5 的饱和指数拟合)系统化,回答给定算力预算应分配给分支数、束宽还是深度;扩展任务与本体覆盖。基于成果可延伸:用真机成功/失败信号对价值模型和路由阈值做在线校准或 RL 微调,摆脱逐任务人工标定 $\delta$;将世界模型升级为视频预测以支持多步想象与时序一致性;融合文本记忆与视觉关键帧记忆以保留空间状态;研究路由的跨任务零样本校准;把子任务接口开放给第三方低层策略,验证其通用性;系统研究 TTC 增益与任务结构的标度关系——论文显示无固定执行计划的 Book Organization 增益最大(+26.66pp),暗示搜索对\u201c组合决策\u201d类任务价值最高,值得在更多组合优化式任务上验证;另外五类记忆扰动只覆盖记忆类错误,可加入感知混淆、物体被第三方移动等更丰富的扰动家族。
复现评估
复现难度:高。项目页 tau0-vla.github.io 已公开,论文未声明开放模型权重或训练代码。数据是主要障碍:40,115 小时训练语料中约 23.4K 小时为内部采集(21.9K 小时 AGIBOT G1、585 小时 G2、578 小时 ARX AC One、347 小时 Franka),公开数据约 16.7K 小时(含 9.25K 小时 UMI);高层数据依赖 Gemma4-31B-it 预标注加多级程序化过滤(弃 11.74% 片段),管线描述详细但需自行重建。算力上需训练 9B 级 VLM 的三个模型(提案/价值/反思)加图像编辑模型初始化的世界模型,以及 2B 低层策略的三阶段训练,属工业级投入。真机评估需要 AGIBOT G1(轮式人形)、ARX AC One、双臂 Franka Research 3 及多相机设置,每任务 10 次试验、最长 20 分钟时限,采集与评估人力成本很高。学术团队的可行降级路径:只复现开环子任务预测协议(LLM-as-judge,无需真机)验证 TTC 核心主张,或用开源 VLA 加公开数据在小规模搜索上验证趋势。
论文图表
系统总览图:左侧为预训练数据来源(遥操作、自主 rollouts、UMI 数据),中间展示高层策略的“提议-想象-评分-反思”流程(以 N=3 的单步展开示意,深度 D 的递归束展开省略),以 Make Milk Tea 为例展示候选子任务被价值模型接受或剪枝的过程,右侧标注系统三类能力:长程移动操作、精细操作、跨本体泛化。
一图看懂全文核心思想:在提交执行之前,用世界模型想象候选后果、用价值模型打分、用束搜索保留有希望的分支、用反思模型做最终决定,这正是标题中 world-model-guided test-time computation 的直观呈现。
四任务 × 10 次真机试验的成功率与里程碑进度:GR00T N1.7 平均 SR 2.50%(进度 45.29%)、LingBot-VLA 0%(44.43%)、π0.5 22.50%(73.05%)、τ0-VLA 直接执行 27.50%(80.10%)、τ0-VLA 层级系统(Plan Once)45.00%(87.85%)。层级化带来的最大单任务增益在番茄鸡蛋炒菜:0/10→4/10、65.00%→81.82%。
主结果表:证明子任务接口+执行记忆的层级化本身即带来 +17.5pp 的平均 SR 提升,是所有后续 TTC 实验的对照基线,也定位了各基线的失败模式。
同一低层策略在 ARX AC One(Collect Laundry:10/10、97.00%)与双臂 Franka Research 3(Tidy Makeup Table 三组 Cotton Pad/Eyelash Curler/Makeup Puff:10/10 95.00%、9/10 92.50%、10/10 95.00%)上的直接执行结果,对比 GR00T N1.7、LingBot-VLA、π0.5,全部方法不开高层策略。
证明 40 维统一动作空间+掩码流匹配的跨本体泛化主张;由于该表不含高层策略,它把“底层控制能力”与“高层决策能力”的贡献干净地解耦。
低层策略固定时 Plan Once 与 TTC 的闭环对比:Make Milk Tea 5/10→7/10(进度 91.92%→95.38%)、Book Organization 6/10→9/10(66.67%→93.33%)、Clean Room 5/10→7/10(94.80%→97.60%),Book Organization 使用打乱的书序。
闭环证据:开环的子任务预测精度增益确实转化为真机成功率提升;无固定执行计划的 Book Organization 增幅最大(+26.66pp),说明搜索对组合决策类任务价值最高。
40 维状态/动作向量的通道布局:左右末端位置与朝向(各 9 维,旋转用 Rot6D 编码)、左右夹爪开度、腰部 2 维、平面底盘速度 2 维、左右臂各 8 关节角度;附相对动作编码规则(末端增量在当前末端系表达)与掩码规则(不足 8 关节的本体填前导项并掩蔽剩余)。
跨本体统一接口的具体定义:理解 Table II 的跨本体结果、控制元数据 η 的作用以及掩码流匹配设计的物理基础,都在这张表。
各真机试验的最长时限:Clean Room、Prepare Ingredients、Tomato and Egg Stir Fry 各 20 分钟,Make Milk Tea 10 分钟,Book Organization、Collect Laundry、Tidy Makeup Table(每组)各 5 分钟;超时或场景进入不可恢复状态均判失败。
评估协议的关键公平性约束:足够长的时限防止“慢而稳”的方法被误判为失败,保证 Table I/II/III 中各方法在同一终止条件下比较。
五类记忆扰动训练样本家族及其配比:within-subtask(58%,记忆对齐、正常推进)、transition(15%,子任务完成后切换)、catch-up(10%,记忆滞后于视觉状态时修复)、rollback(12%,记忆超前/过度乐观时回滚重试)、error-think(5%,未察觉的执行失败与恢复),每类给出采样位置、输入→目标记忆、目标子任务与对应部署失败模式。
揭示“可纠错执行记忆”如何在零额外标注下合成训练:只扰动输入记忆、正确目标从演示读出,这一设计是高层策略在长程执行中保持状态一致性的关键机制。