← 返回 2026-08-21

τ0-VLA:世界模型引导测试时计算的分层机器人基础模型 τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou 📅 2026-08-17 👍 15 2026-08-26 18:30
VLA 世界模型 分层策略 机器人基础模型 测试时计算 跨本体 长程操作

高层子任务决策按需触发世界模型束搜索,用测试时算力换长程操作成功率。

前置知识

VLA(视觉-语言-动作模型)

将视觉观测和语言指令映射为机器人动作的多模态模型,通常在预训练视觉语言模型(VLM)骨干上接入动作生成模块,端到端学习\u201c看-想-动\u201d,是当前机器人通用策略的主流范式。本文低层策略由 Qwen3.5-2B 骨干加 Mixture-of-Transformers 动作专家构成,高层四个模型则微调自 Qwen3.5-9B 机器人预训练检查点。

整套 τ0-VLA 建立在 VLA 之上:低层是 VLA,高层是微调 VLM。只有理解 VLA 的输入输出接口(观测+本体状态+语言命令→动作块),才能看懂层级之间如何通过“子任务文本”衔接。

测试时计算(Test-Time Computation)

源自语言模型的思想:不增加参数,而在推理时分配更多算力(多采样、搜索、自我验证)换取更高质量输出,如 o1 式推理或 Best-of-N 选择。核心假设是\u201c算力可换精度\u201d,且增益随算力增加呈边际递减,最终饱和。

本文的核心贡献就是把该思想搬到机器人高层子任务决策:分支因子 $N$、束宽 $B$、深度 $D$ 三个旋钮控制推理预算,Figure 4、5 直接验证了算力与精度的标度关系及其饱和点。

世界模型(World Model)

学习环境动力学、能预测\u201c采取某行为后未来观测会变成什么样\u201d的生成模型,在机器人中常以未来图像/视频预测实现,让策略在执行前\u201c脑内模拟\u201d候选动作的物理后果。

本文世界模型 $W$ 输入当前头部相机图像 $\tilde{o}$ 和候选子任务 $z$,预测子任务完成时的终端图像 $\hat{o}=W(\tilde{o},z)$,是搜索中评估候选的关键部件——没有它就无法在提交前比较不同子任务的后果。

流匹配(Flow Matching)

一类生成式动作解码方法:训练神经网络速度场,把高斯噪声沿(线性)路径输运到动作分布,推理时从纯噪声积分到干净动作。相比离散 token 自回归更适合连续控制,π0 系列模型均采用。

本文低层策略用条件流匹配生成 30 步动作块,并提出掩码流匹配(把本体掩码同时作用于流路径和训练目标)以支持多本体统一动作空间,读懂第 IV-C 节的训练目标需要这一背景。

束搜索(Beam Search)

树状解空间中的启发式搜索:每层从候选扩展中按累积得分保留最好的 $B$ 条路径,逐层深入。计算量由分支因子、束宽、深度三个超参精确控制,以宽度换接近全局最优。

τ0-VLA 的高层测试时计算正是在开放语言子任务空间做束搜索(Algorithm 1):每条分支累积价值模型分数 $S(b\oplus z)=S(b)+v$,全局 TopB 剪枝,$N/B/D$ 就是算力分配接口。

研究动机

长程机器人操作(打扫房间、做一顿饭、泡奶茶)要求机器人既可靠执行单个技能,又在几分钟到十几分钟内把数十个子步骤连贯串接。主流分层 VLA 的高层策略用单次前向传播、固定算力直接输出下一个子任务:既不比较候选方案,也不评估方案会导致的物理后果,错误只能等执行已经改变环境后才被发现,而子任务选错通常无法靠更精细的电机控制挽回——机器人可能\u201c完美地执行了错误的子任务\u201d。论文给出具体例子:番茄鸡蛋炒菜中加盐几乎不引起画面可见变化,只看当前观测的策略无法判断这步是否已完成,直接执行策略因此反复加盐或干脆跳过,两者都违反成功判据;类似地,Clean Room 中跨房间转换后的进度遗忘使失败集中在挂包和后续整理阶段。实测中 GR00T N1.7、LingBot-VLA、π0.5 直接执行四个长程任务的平均成功率仅 0%–22.5%,π0.5 在番茄鸡蛋炒菜上更是 0/10。

本文的目标是本文要把\u201c生成下一个子任务\u201d从固定算力的单次前向传播,改造成推理时可扩展的计算问题:决策不确定时自动触发额外推理,用世界模型想象每个候选子任务完成后的终端图像,用价值模型评分,用束搜索递归展开有希望的分支,再由反思模型综合保留分支生成最终子任务,使算力投入与决策难度匹配。同时系统不牺牲执行能力:低层策略在统一的 40 维状态/动作空间上工作,用 40,115 小时异构真实数据训练,同一套模型支撑固定基座操作、双臂协调与移动全身控制三种本体。最终作者要在真实机器人上验证一条完整因果链:测试时算力 → 下一子任务预测精度 → 闭环任务成功率,并给出算力-精度的定量标度关系。

与已有工作不同的是,已有搜索类工作处在两个极端:动作级搜索(RoboMonkey、VLA-Reasoner、Guo et al. 的动作轨迹 MCTS)在连续动作上分配推理算力,但只能看到局部物理后果;纯语言级推理能比较候选却不落地到物理状态。本文的切入点是\u201c子任务\u201d这一中间粒度——它足够稀疏、值得为每次决策付出额外计算,又时间上足够长、足以引起可区分的环境变化,因此\u201c预测候选子任务的终态图像\u201d是有信息量的评估信号。与最接近的 π0.7 相比顺序被反转:π0.7 的世界模型为高层已生成的子目标补图像,本文的视觉预测发生在提交之前,用于多候选比较与剪枝。此外本文把可纠错的执行记忆(通过扰动训练自动学会修复滞后/超前/错报的记忆)与后果感知搜索耦合,并以反思模型而非简单选择候选收尾,最终输出不受候选集约束。

核心方法

直觉是“先在脑中想清楚,再动手”。系统分两层:高层策略维护执行记忆、决定当前该做什么子任务;低层策略把子任务翻译成动作块。高层由四个模型组成:提案模型 $P$ 基于上下文 $h_t=(\ell,M_{t-1},z^\star_{t-1},o_t)$ 更新记忆并给出直接提案 $z^{\mathrm{dir}}_t$,同时从同一次前向传播的 token 置信度计算路由信号 $g_t$——有把握走快速路直接下发,不确定则触发测试时计算(TTC)。TTC 是“提议-预测-评估”循环:$P$ 对每条保留分支采样 $N$ 个候选子任务,世界模型 $W$ 预测每个候选的终端图像 $\hat{o}=W(\tilde{o},z)$,价值模型 $V$ 打分 $v=V(\ell,z,\hat{o})$,束搜索按累积分数全局保留 top-$B$,递归到深度 $D$;最后反思模型 $F$ 综合保留分支摘要生成最终子任务。低层策略用 Qwen3.5-2B 骨干加 MoT 动作专家,经条件流匹配输出 30 步动作块;部署时高低层异步流水线化,控制频率约 30 Hz。

核心创新有三。第一,把高层子任务生成显式定义为“算力可扩展的推理问题”:路由器复用提案模型已产生的 token logit——全生成 token 的平均概率 $u^{\mathrm{all}}_t$ 与 memory 字段内的平均 logit 间隔 $u^{\mathrm{mem}}_t$——与阈值 $\delta_{\mathrm{all}},\delta_{\mathrm{mem}}$ 比较得到 $g_t$,零额外前向即可决定是否搜索,算力随决策难度自适应分配。第二,候选的评估信号是“预测的物理后果”而非语言自洽性:世界模型生成候选完成时的终端图像,价值模型把它当 5 选 1 的序数 VQA(从明显错误到明显正确,映射到 $[0.05,0.95]$),使搜索比较的是“做下去世界会变成什么样”。第三,可纠错的执行记忆:训练时只扰动输入记忆(滞后、超前、错报进度),正确目标从演示读出,让模型学会对照视觉证据修复记忆,rollback 样本控制在 10–15% 以免教模型不信任正确的记忆,全程零人工标注。

方法步骤详情

闭环推理(Algorithm 1):(1) 观测后构造上下文 $h_t$;(2) 提案模型更新记忆并输出直接提案 $z^{\mathrm{dir}}_t$,同时计算路由 $g_t$;(3) $g_t=0$ 走快速路直接下发;$g_t=1$ 调用 SEARCH:深度 $d=1..D$ 每层对每条保留分支采样 $N$ 个子任务,世界模型预测 $\hat{o}=W(\tilde{o},z)$、价值模型评分 $v$,子分支按累积分数全局 TopB 剪枝;(4) 反思模型 $z^\star_t=F(\bar{h}_t,\mathcal{C}_t)$ 生成最终子任务,可超出候选集;(5) 低层策略以 $z^\star_t$ 为语言命令,经掩码流匹配生成 30 步动作块执行;(6) 真实观测回填记忆闭环。训练侧:低层三阶段(知识隔离共同训练→端到端→任务适配);提案/价值/反思模型自同一 Qwen3.5-9B 检查点微调,世界模型初始化自 Step1X-Edit,用子任务对齐起止帧监督,并以 P/W 交替的离线 rollout 训练价值与反思模型。

技术新颖性

新颖性有四。搜索对象:不同于动作轨迹上的 MCTS 或潜空间动作方案选择,本文在开放语言子任务空间搜索,每个候选通过其预测的终端图像被评估,兼顾语义广度与物理落地。架构分工:提案/世界/价值/反思四模型解耦,且以“反思”而非“选择”收尾——最终子任务由 $F(\bar{h}_t,\mathcal{C}_t)$ 生成,训练时把离线 rollout 候选连同预测状态、分数与真值配对,教模型修复有缺陷的候选而非复制第一个提案。数据工程:高层数据全部从既有任务/阶段/子任务标注自动合成(Gemma4-31B-it 预标注+程序化过滤,弃 11.74% 片段、保留 40.4M 干净样本),五类记忆扰动家族零标注成本。控制接口:40 维统一状态/动作空间加对角掩码 $M$,掩码同时作用于流路径 $a^j_\tau=\tau M\epsilon^j+(1-\tau)Ma^j$ 与损失 $\mathcal{L}_{\mathrm{FM}}$,一个策略覆盖三种本体而无需本体专属输出头。

The hierarchical τ0-VLA architecture.
Fig. 2: The hierarchical τ0-VLA architecture.

实验结果

长程四任务(各 10 次真机试验):层级系统平均成功率 45.00%、进度 87.85%,高于直接执行(27.50%)、π0.5(22.50%)、GR00T N1.7(2.50%)与 LingBot-VLA(0%)。最大增益在番茄鸡蛋炒菜:0/10→4/10、进度 65.00%→81.82%,因为记忆显式记录加盐进度,消除加盐重复/遗漏歧义。TTC 闭环(Table III):Make Milk Tea 5/10→7/10,Book Organization 6/10→9/10(进度 66.67%→93.33%),Clean Room 5/10→7/10。开环预测(Fig 4):TTC 四设置全部最高,如 Make Milk Tea 87.3% vs 64.7%;分布偏移的 OOD 书序差距最大(74.0% vs 50.0%)。跨本体(Table II):Collect Laundry 10/10,Tidy Makeup Table 三组 10/10、9/10、10/10 全面领先。算力-精度(Fig 5):精度随算力沿饱和曲线上升后趋平;剩余失败集中在扣盖、插吸管等接触密集操作。

Representative physical-robot evaluation tasks.
Fig. 3: Representative physical-robot evaluation tasks.
Next-subtask prediction accuracy under different high-level inference methods.
Fig. 4: Next-subtask prediction accuracy under different high-level inference methods.
Relationship between computational cost and subtask-prediction accuracy.
Fig. 5: Relationship between computational cost and subtask-prediction accuracy.
查看结构化数据
任务指标本文基线提升
长程四任务(Clean Room/Prepare Ingredients/Stir Fry/Make Milk Tea) 平均成功率 SR 45.00%(层级系统,Plan Once) π0.5 22.50%;τ0-VLA 直接执行 27.50% +17.5pp,相对 π0.5 翻倍
长程四任务 平均里程碑进度 87.85% π0.5 73.05% +14.80pp
Book Organization(闭环 + TTC) SR / 进度 9/10 / 93.33% Plan Once 6/10 / 66.67% +3 次 / +26.66pp
Make Milk Tea(闭环 + TTC) SR / 进度 7/10 / 95.38% Plan Once 5/10 / 91.92% +2 次 / +3.46pp
开环下一子任务预测(Book Org OOD) 预测准确率(LLM judge) TTC 74.0% Plan Once 50.0%;Best-of-N 57.5% +24.0pp / +16.5pp
开环下一子任务预测(Make Milk Tea) 预测准确率(LLM judge) TTC 87.3% Plan Once 64.7%;Best-of-N 70.0% +22.6pp / +17.3pp
Collect Laundry(ARX AC One,直接执行) SR / 进度 10/10 / 97.00% π0.5 9/10 / 88.00% +1 次 / +9.0pp
Tidy Makeup Table(双臂 Franka,三组合计) SR 29/30 π0.5 24/30;GR00T N1.7 25/30 +5 次 / +4 次

局限与改进

作者承认的局限:接触密集的精细操作仍是瓶颈,Make Milk Tea 剩余失败集中在扣盖与插吸管(前期准备均已完成);TTC 增益随算力饱和,Fig 5 显示其最终到达平台期。我的补充观察:每设置仅 10 次真机试验,SR 差 1–2 次时统计功效不足,45% vs 27.5% 的主结论尚稳,但 Clean Room 5/10 vs 4/10 这类差距难以排除噪声;TTC 成本以 PFLOPs/样本计,虽然高低层异步解耦保住 30 Hz 控制,对嵌入式部署仍昂贵;世界模型只预测单张头部相机 RGB,对“加盐”这类视觉显著性极低的状态转变几乎没有分辨力——该任务实际靠文本记忆而非视觉想象解决;路由阈值 $\delta_{\mathrm{all}},\delta_{\mathrm{mem}}$ 需在每任务留出数据上单独校准,跨任务泛化的路由仍是开放问题;评估任务全部来自家庭场景,高层评测 ground truth 由与训练同源的自动标注管线产生,存在同源性偏差风险。

独立分析的弱点

独立分析四个弱点。其一,价值模型输出 5 级离散分数、映射到 $[0.05,0.95]$,无法刻画\u201c扣盖成功但密封不严\u201d这类细粒度质量差异,改进方向是引入回归式或成对偏好的连续奖励,或用真机成败信号做 RL 微调。其二,世界模型输入输出均为单视图 RGB,不建模可变形物体与接触动力学,对低视觉显著性的状态转变(加盐、拧紧)分辨力弱,可扩展到深度、触觉或腕部相机的多模态预测。其三,执行记忆是纯文本,长程任务中物体精确位姿、半开抽屉等空间细节会被压缩丢失,多步之后的错误可能无法从文本恢复,可引入关键帧检索式视觉记忆(如 MEM)互补。其四,束搜索的候选多样性完全依赖提案模型的采样熵,分布外场景下若采样坍缩到单一模式,$N$ 次采样高度相关、搜索收益下降——OOD 书序上 TTC 也只到 74% 而非域内 88% 即是信号,可用多样性正则或温度调度增强候选覆盖。

未来方向

作者方向:把 TTC 的算力-精度标度律(Fig 5 的饱和指数拟合)系统化,回答给定算力预算应分配给分支数、束宽还是深度;扩展任务与本体覆盖。基于成果可延伸:用真机成功/失败信号对价值模型和路由阈值做在线校准或 RL 微调,摆脱逐任务人工标定 $\delta$;将世界模型升级为视频预测以支持多步想象与时序一致性;融合文本记忆与视觉关键帧记忆以保留空间状态;研究路由的跨任务零样本校准;把子任务接口开放给第三方低层策略,验证其通用性;系统研究 TTC 增益与任务结构的标度关系——论文显示无固定执行计划的 Book Organization 增益最大(+26.66pp),暗示搜索对\u201c组合决策\u201d类任务价值最高,值得在更多组合优化式任务上验证;另外五类记忆扰动只覆盖记忆类错误,可加入感知混淆、物体被第三方移动等更丰富的扰动家族。

复现评估

复现难度:高。项目页 tau0-vla.github.io 已公开,论文未声明开放模型权重或训练代码。数据是主要障碍:40,115 小时训练语料中约 23.4K 小时为内部采集(21.9K 小时 AGIBOT G1、585 小时 G2、578 小时 ARX AC One、347 小时 Franka),公开数据约 16.7K 小时(含 9.25K 小时 UMI);高层数据依赖 Gemma4-31B-it 预标注加多级程序化过滤(弃 11.74% 片段),管线描述详细但需自行重建。算力上需训练 9B 级 VLM 的三个模型(提案/价值/反思)加图像编辑模型初始化的世界模型,以及 2B 低层策略的三阶段训练,属工业级投入。真机评估需要 AGIBOT G1(轮式人形)、ARX AC One、双臂 Franka Research 3 及多相机设置,每任务 10 次试验、最长 20 分钟时限,采集与评估人力成本很高。学术团队的可行降级路径:只复现开环子任务预测协议(LLM-as-judge,无需真机)验证 TTC 核心主张,或用开源 VLA 加公开数据在小规模搜索上验证趋势。