← 返回 2026-07-20

Xiaomi-Robotics-1:基于十万小时真实世界轨迹的视觉-语言-动作模型扩展 Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou 📅 2026-07-16 👍 68 2026-07-25 18:30
UMI数据采集 具身智能 扩散Transformer 数据缩放 机器人基础模型 机器人操作 视觉-语言-动作模型 预训练后训练

用十万小时UMI真实轨迹预训练的VLA基础模型,刷新四大机器人基准SOTA

前置知识

视觉-语言-动作模型(VLA Model)

VLA模型是一类以预训练视觉-语言模型(VLM)为骨干的机器人策略模型,输入当前观测 $o_t$ 和语言指令 $l$,输出动作块 $a_{t:t+H}$。它借助VLM丰富的语义知识来驱动动作预测,使机器人能听懂人类语言指令完成任务,并具备跨环境、跨任务的泛化能力,是当前机器人基础模型的主流范式之一。

本文的核心架构正是VLA范式,理解VLM如何与动作生成模块耦合、如何把语义理解转化为可执行动作,是读懂全文方法与实验设计的基础。

流匹配(Flow Matching)

流匹配是扩散类生成方法的一种变体,把生成过程建模为从噪声分布到数据分布的连续流。训练目标是预测该流的速度场 $v_\theta(o_t, l, s_t, \tilde{a}^\tau_{t:t+H}, \tau)$,其中带噪动作 $\tilde{a}^\tau = \tau a + (1-\tau)\epsilon$,$\tau \sim \text{Beta}(1.5,1)$。推理时从随机噪声出发,经多步Euler积分逐步去噪得到干净动作。相比朴素动作离散化,它训练稳定、能建模连续动作分布。

本文的DiT模块正是通过流匹配生成动作块,时间步采样、adaLN条件注入、5步Euler推理等细节都直接决定了模型的行为,是方法部分的关键。

混合Transformer架构(Mixture-of-Transformers, MoT)

MoT指本文把一个预训练VLM(Qwen3-VL)与一个扩散Transformer(DiT)耦合在一起:VLM编码观测和语言指令并产生KV缓存,DiT在VLM的KV缓存与机器人状态 $s_t$ 条件下生成动作。DiT层数与VLM相同但隐藏维更小以加速推理。两者协同使语义理解与精细动作生成各司其职。

整个方法的核心架构,理解两者如何共享/隔离注意力(如DiT不看动作相关token)是把握论文创新点的关键。

通用操作接口(UMI, Universal Manipulation Interface)

UMI是一种手持式夹爪数据采集设备,配合自拍摄像头,可以在没有实体机器人的情况下采集真实世界操作轨迹。它极大降低了数据采集门槛,使大规模、多样化的真实操作数据采集成为可能,跨越家庭、商业、工业、办公、户外等场景。

本文预训练的100k+小时数据全部来自UMI设备,理解UMI采集范式是理解数据规模为何能突破机器人数据瓶颈的前提。

Choice Policies(选择策略)

Choice Policies是一种在VLM框架内直接做动作生成的辅助监督方法:把机器人状态经MLP编码成token,连同动作查询token和评分查询token附加到视觉-语言序列末尾,输出 $K$ 个候选动作块及其评分。采用赢者通吃(winner-takes-all),只把与真值L1距离最小的候选计入损失,以此加速收敛、引导VLM表征偏向支持动作生成的特征。

这是本文加速训练收敛的关键设计之一,且作者发现若让DiT看到这些动作相关token会触发捷径学习,引出了注意力隔离的重要工程细节。

研究动机

现代大模型的能力根本上由规模驱动——大规模、多样化的训练语料让语言模型和视觉-语言模型性能飞跃。机器人操作领域也出现了VLA模型和世界-动作模型(WAM),并有早期证据表明策略会随数据规模与多样性增长而更通用。但机器人学习被一个独特的数据瓶颈卡住:主流的真实机器人数据采集范式是遥操作,速度慢、成本高、强依赖硬件,难以扩展;而且遥操作数据往往高度冗余,集中在很窄的任务和环境切片上,多样性严重不足。在十万小时这种规模上,传统按任务语义人工分割轨迹、再逐段写语言标注的方式更是不可行,使得高质量、大规模的语言标注成为又一个无法逾越的工程障碍。

本文的目标是本文的目标是打造一个基础级VLA模型 Xiaomi-Robotics-1,使其(1)能直接听从多样语言指令,在从未见过的环境中开箱即用地完成多种移动操作任务;(2)只需极少微调数据就能高效适应新下游任务。为此作者借鉴大语言模型的预训练+后训练范式,构建一套可扩展的两阶段训练配方,并系统性地研究机器人基础模型的缩放规律:数据规模、模型规模在预训练阶段如何影响性能,以及更强的预训练能否迁移到后训练的真实机器人开箱即用表现,最终用四个仿真基准和真实机器人实验全面验证其领先性。

与已有工作不同的是,本文的独特切入角度在于:不依赖昂贵且多样性差的遥操作机器人数据,而是用UMI手持夹爪+自拍摄像头,在真实世界海量场景(家庭、商业、工业、办公、户外)中采集超过100k小时的可扩展轨迹;同时用Qwen3.5-27B构建可扩展的自动标注流水线,为定长轨迹片段生成描述场景状态转移的自然语言,而非依赖人工分割。预训练用状态转移描述、后训练用人类惯用的祈使指令,通过跨本体对齐把UMI夹爪能力迁移到机器人本体——这种把LLM式预训练/后训练范式与UMI大规模数据、自动标注、跨本体对齐全套机制结合的做法,是区别于已有工作的本质所在。

核心方法

整体思路是先用直觉理解:像训练LLM那样,先用海量、可扩展、多样性强的非机器人UMI数据做预训练,让模型获得广泛、可泛化的动作生成表征;再用少量但高质量的跨本体机器人数据做后训练对齐,把语义能力迁移到真实机器人本体和人类祈使指令上。技术路线上,模型采用混合Transformer(MoT)架构,由预训练VLM(Qwen3-VL)与一个层数相同、隐藏维更小的扩散Transformer(DiT)耦合。VLM吃入观测 $o_t$ 和指令 $l$ 产生KV缓存,DiT在KV缓存与机器人本体感觉状态 $s_t$ 条件下,用流匹配生成动作块 $a_{t:t+H}$。模型有2B、5B、10B三个规模变体,参数从2.6B到10.5B不等,预训练数据达100k+小时、后训练数据约10k小时。

核心创新与已有方法的本质区别有四点。其一,用Qwen3.5-27B构建可扩展自动标注流水线,把定长轨迹片段标注为场景状态转移描述,并用生产者-消费者解耦的并行架构(CPU线程切片到内存文件系统、客户端线程维持数百并发标注请求)在约两周内完成100k+小时标注,彻底替代人工分割。其二,两阶段语言条件化:预训练用状态转移描述(把场景从当前态驱动到语言描述的目标态),后训练用人类祈使指令,形成从UMI到机器人、从状态描述到指令的双跨迁移。其三,在VLM上加Choice Policies辅助动作生成监督(赢者通吃)以加速收敛。其四,关键工程发现:把DiT对动作相关token的注意力排除掉,否则DiT会走捷径直接拷贝VLM生成的动作而不去真正grounding视觉与文本语境。

方法步骤详情

方法分四步。步骤一数据采集:用UMI手持夹爪与自拍摄像头采集100k+小时真实轨迹,覆盖家庭、商业、工业、办公、户外等海量环境。步骤二自动标注:把轨迹切成等长片段,用Qwen3.5-27B为每段描述夹爪与交互物体的状态转移,生产者-消费者并行流水线约两周标完全量语料,使模型学会把场景从当前态驱动到语言目标态。步骤三预训练:联合优化 $\mathcal{L}=\mathcal{L}_{Flow}+\mathcal{L}_{Regression}+\lambda\mathcal{L}_{NTP}$($\lambda=0.1$),其中流匹配损失来自DiT、回归损失来自Choice Policies、$\mathcal{L}_{NTP}$ 为保留VLM能力而共训的高质量视觉-语言数据(与UMI按1:9采样);时间步 $\tau$ 由Beta(1.5,1)采样偏重高噪声,推理用5步Euler、步长0.2。步骤四后训练:整理约10k小时跨本体轨迹,统一为相对末端增量位姿与坐标系,按0.5:0.5:0.5:8.5采样,缺失动作维度在损失中mask掉。

技术新颖性

技术新颖性体现在多个层面。数据与标注层面,可扩展的生产者-消费者自动标注流水线首次让十万小时级的真实操作数据获得精确语言监督,且标注的是状态转移而非任务语义,提供了更细粒度的条件。架构层面,MoT把VLM与DiT解耦又耦合:VLM负责语义理解并经Choice Policies(赢者通吃、K个候选+评分)做辅助动作监督,DiT专注流匹配生成;作者通过经验发现并设计注意力隔离,禁止DiT看动作相关token以杜绝拷贝捷径,这是少见的、对捷径学习问题的显式工程对策。训练配方层面,预训练/后训练的状态-指令双跨对齐、Beta时间步偏重、VLM-KV摊销(每样本采4个流匹配时间步打包一次DiT前向)等细节共同支撑了大规模高效训练。动作空间层面,跨本体统一相对末端增量位姿与坐标系,使不同硬件平台的相似运动产生一致动作值。

Overview
Figure 1: Overview
Model Architecture
Figure 2: Model Architecture
Pre-training Dataset
Figure 3: Pre-training Dataset
Post-training Dataset
Figure 4: Post-training Dataset

实验结果

核心发现可逐一拆解。预训练缩放:在5B上做数据缩放(12.5%/25%/50%/100%的约20k小时UMI数据),验证集动作MSE随数据增加单调下降,12.5%和25%出现过拟合而50%、100%单调下降;模型缩放(2B/5B/10B同数据)同样改善但不如数据显著,提示数据量是进一步泛化的主瓶颈。后训练开箱即用:数据缩放下整体成功率从无预训练的26%升到100%预训练数据的75%,鞋类整理这类接触密集任务尤其突出(基线完全失败→75%),用12.5%预训练数据就让基线翻倍(26%→53%);模型缩放下从2B的61%升到5B的75%、10B的79%。下游微调:在手机打包、衣物装载、打印机补纸、装箱四项全新任务上,低数据(每任务平均<10小时)下平均成功率75%、进度90%,远超π0.5的40%/66%。仿真基准全面SOTA:RoboCasa 74.5%(前最佳72.6%)、RoboCasa365平均57.4%(前最佳46.6%,+10.8点)、VLABench平均59.1%、RoboDojo平均分20.07(前最佳13.07)。

Model configurations for different scaling variants
Table 1: Model configurations for different scaling variants
Results on the RoboCasa Benchmark
Table 2: Results on the RoboCasa Benchmark
Results on the RoboCasa365 benchmark
Table 3: Results on the RoboCasa365 benchmark
Results on the VLABench Benchmark
Table 4: Results on the VLABench Benchmark
Results on the RoboDojo Simulation Benchmark
Table 5: Results on the RoboDojo Simulation Benchmark
Scaling of Pre-training
Figure 5: Scaling of Pre-training
Qualitative Results of Pre-training
Figure 6: Qualitative Results of Pre-training
Post-training Evaluation
Figure 7: Post-training Evaluation
Quantitative Results of Post-training
Figure 8: Quantitative Results of Post-training
Downstream Fine-tuning Evaluation
Figure 9: Downstream Fine-tuning Evaluation
Quantitative Results of Downstream Fine-tuning
Figure 10: Quantitative Results of Downstream Fine-tuning
查看结构化数据
任务指标本文基线提升
RoboCasa(24个厨房任务,单臂) 平均成功率(%) 74.5% World2Act 72.6% +1.9个百分点
RoboCasa365(365任务,泛化与组合) 平均成功率(%) 57.4%(组合未见拆分32.1%) ABot-M0.6 46.6%(组合未见7.9%) +10.8个百分点
VLABench(5轨道,语义/分布偏移) 平均成功率(%) 59.1% ERVLA 53.2% +5.9个百分点
RoboDojo(5能力维度,42任务) 平均分(成功率%) 20.07(13.93%) Hy-Embodied-0.5-VLA 13.07(8.80%) +7.0平均分/+5.13点成功率
真实机器人下游微调(4任务,低数据<10h/任务) 平均成功率(%) 75% π0.5 40% +35个百分点
真实机器人开箱即用(4任务,未见环境) 整体成功率(%,100%预训练数据/10B模型) 75%/79% 无预训练 26% +49/+53个百分点

局限与改进

作者承认的局限主要在记忆维度:在RoboDojo评测中未引入历史观测,因此Memory维度得分低于显式建模记忆的Hy-Embodied-0.5-VLA,尽管在其他四个维度均居首。模型缩放收益不如数据缩放显著,作者也据此认为当前数据分布已被数十亿参数规模基本捕获,数据量才是瓶颈——但这同时暗示模型缩放曲线可能尚未进入更大收益区间。从我的观察看还有几处局限:代码与模型权重仅声明"将发布",尚未实际开源,难以独立复现;论文未披露预训练的具体算力规模、训练步数、学习率等关键超参;真实机器人评测任务规模较小(仅4个开箱即用+4个微调任务),对长尾、极端环境的鲁棒性缺乏充分证据;状态转移描述与祈使指令的两阶段对齐引入额外gap,若自动标注的VLM产生噪声或幻觉,会传播到下游。

独立分析的弱点

第一个弱点是仍重度依赖UMI人工手持采集,虽然比遥操作便宜,但100k+小时仍需大量人力,且UMI夹爪与真实机器人本体的运动学差异带来跨本体gap。改进方向是引入更廉价的数据源(如人类自我中心视频+动作重定向、仿真数据、世界模型生成的合成轨迹)来扩充多样性。第二个弱点是自动标注依赖Qwen3.5-27B的质量,状态转移描述若含噪声或幻觉会污染监督信号,且状态描述与人类祈使指令之间存在语义gap需靠后训练弥补。改进方向是引入标注质量过滤、主动学习与人类校验,或直接探索端到端的指令标注。第三个弱点是真实评测规模有限(4+4任务),缺乏对长尾、极端扰动、人机协作等场景的系统评估,且作者承认无历史观测导致记忆能力不足。改进方向是引入显式记忆模块/更长上下文、扩充评测任务谱。第四个弱点是模型缩放收益趋缓,可能受限于数据多样性而非模型容量。改进方向是优先扩大多样化数据采集,并探索不同架构(如更强的时间建模、3D几何先验)。

未来方向

作者明确提出的方向是继续扩大数据与模型规模以延续缩放红利,因为开箱即用表现"没有饱和迹象"(从50%到100%数据仍多6个百分点收益)。基于成果可延伸的方向包括:引入历史观测或显式记忆机制以补齐RoboDojo Memory维度短板;把状态转移自动标注流水线与祈使指令标注统一,减少两阶段gap;融合世界模型/视频生成先验增强长时序一致性;把跨本体统一动作空间扩展到更多形态(腿式、灵巧手、人形);探索把Choice Policies与流匹配更深度耦合的架构改进;研究自动标注的噪声鲁棒性与主动学习;把方法推广到更复杂的房间级、多机器人协作的长时程任务(论文已展示10分钟级行李箱打包,可进一步拓展)。

复现评估

复现难度较高。论文声称代码与模型权重"将发布",并提供项目页(robotics.xiaomi.com/xiaomi-robotics-1.html),但写作时点尚未实际开源,缺乏可下载的checkpoint与训练脚本。数据方面,预训练的100k+小时UMI数据和7200+小时自研机器人数据为私有,未开放;仅后训练引用的Bridge V2、RT-1、DROID为开源数据集。仿真基准(RoboCasa、RoboCasa365、VLABench、RoboDojo)及官方训练集均公开,便于复现仿真部分实验。关键超参(学习率、训练步数、批大小、算力规模、训练时长)论文未充分披露,仅给出损失权重 $\lambda=0.1$、采样比例、Beta(1.5,1)时间步、5步Euler等部分细节。要完整复现100k+小时预训练需要非常可观的算力(论文未量化),对普通研究团队不现实;但基于作者后续开源的checkpoint做下游微调与仿真复现是可行的。