← 返回 2026-07-28

具身操作的数据金字塔 Data Pyramid for Embodied Manipulation

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang 📅 2026-07-27 👍 36 2026-08-02 18:30
世界模型 具身智能 数据金字塔 数据驱动 机器人操作 综述 视觉-语言-动作模型

用五层数据金字塔系统化组织具身智能数据生态

前置知识

具身基础模型 (Embodied Foundation Models)

指在大规模多模态与交互数据上预训练、可用于感知、推理、规划和控制物理机器人的大模型。与纯视觉-语言模型不同,它还必须理解物理状态、动作如何改变环境、并在物理世界执行行为。本文聚焦三类:具身大脑模型(偏感知与高层规划)、视觉-语言-动作模型(VLA,直接生成可执行动作)、世界动作模型(WAM,建模环境随动作的演化)。

整篇综述都是在回答"用什么数据训练这三类具身基础模型",不理解这个统称就无法把握全文主线。

Scalability 与 Robot Alignment(可扩展性与机器人对齐性)

Scalability 指数据源在硬件依赖、人力、环境重置、安全监督、边际生成成本上的扩展效率;Robot Alignment 指其观测、表征、监督信号能在多大程度上直接支撑物理机器人学习与执行。二者处于张力之中:越贴近真机执行的数据越昂贵难扩展,越易扩展的数据对物理交互的监督越间接或不完美。

这两个正交维度正是金字塔排序的根本依据,也是理解每一层权衡取舍的关键。

UMI 数据 (Universal Manipulation Interface)

一类用便携式手持夹爪(可带相机、位姿追踪模块)在无需机器人在环的情况下采集的实操演示数据。它保留了末端执行器运动、夹爪状态、相对 EEF 轨迹等可直接用于策略学习的信号,但丢掉了关节级本体感知,需要通过标定、动作变换、本体感知重定向(retargeting)才能迁移到具体机器人。

它是金字塔第二层,是连接昂贵真机数据与廉价人类视频的中间桥梁,也是近期 VLA 扩展的重要数据来源。

Sim-to-Real Gap(仿真到现实的差距)

仿真数据与真实机器人执行之间的不一致,分为观测不匹配(纹理、光照、深度噪声、触觉响应)和交互不匹配。交互不匹配又细分为运动学差距(本体形态、关节限位、坐标、控制器频率)和动力学差距(执行器延迟、柔顺性、力矩饱和、摩擦、接触、变形)。

理解这个差距才能解释为何仿真层数据"最可扩展但物理保真度最低",以及为何需要域随机化、数字孪生、真机微调。

Cross-Embodiment Action Alignment(跨本体动作对齐)

把不同机器人本体的动作映射到共享接口的技术。结构层有三种策略:本体特定投影(adapter/动作头)、定长零填充接口、语义动作槽(如 Qwen-RobotManip 的 80 维向量含两个 29 维臂块)。几何层有三种坐标约定:机器人中心、相机中心、腕部中心。

没有动作对齐,异构数据集无法联合训练,跨本体迁移也无从谈起——这是第七章分析模型数据配方时的核心。

研究动机

多模态基础模型之所以能"学会看、学会说",靠的是吞下整个互联网的视觉与语言数据。但具身智能体没有这种捷径:它们需要把观测(observations)与物理状态(physical states)、动作(actions)耦合起来的数据——这类信号只能由真实机器人遥操作、仿真、人类第一人称视频、手持夹爪演示等来源提供,且程度不一。问题在于,社区已经积累了大量异构数据源,却没有人系统地理清它们各自的角色、权衡、相互关系与整合策略。更具体地说,近年来 Motus、GR00T 等模型虽然提出了各自的"金字塔"视图,但这些金字塔都是围绕某个特定模型的训练配方设计的,很少在"采集可扩展性、本体依赖、物理保真度、可迁移性、下游效用"等类别级维度上对比分析不同数据源;已有综述又主要聚焦模型架构或某个子问题(如 VLA、世界模型)。结果是:具身数据生态在"类别层面"尚未被系统化组织,具身基础模型对异构数据的使用也缺乏从数据视角的综合分析。

本文的目标是本文要系统回答两个问题:(1) 在可扩展性、机器人对齐性、物理保真度、可迁移性差异巨大的情况下,如何"采集、组织、比较、整合"异构具身数据源?(2) 具身基础模型应如何"选择、组合、利用"这些异构数据?为此,作者希望提供一个类别级的数据分类体系(data-pyramid taxonomy),把五个数据类别按"可扩展性 vs 机器人对齐性"的张力排序,并用质量、多样性、可复用性、物理保真度四个补充维度刻画每一层;进而从数据配方(data recipe)的视角剖析具身大脑模型、VLA、世界动作模型如何使用这些数据;最后给出"该采什么、怎么采、怎么用"的开放挑战与未来方向。

与已有工作不同的是,本文的独特切入角度在于:它不再围绕"某个模型的训练配方"来定义数据金字塔(这是 Motus/GR00T 的做法),而是把数据本身作为一等公民,围绕"可扩展性与机器人对齐性之间的张力"来组织整个具身数据生态。它补上了四个被忽视的类别级维度——质量、多样性、可复用性、物理保真度,把"下金字塔"描述成一个有意识的风险交易过程(每一层都放松一部分与真机执行的耦合以换取覆盖广度)。更重要的是,它从"动作空间对齐"和"几何对齐"两个视角,把异构数据如何被具身基础模型消化这件事讲清楚,并把数据配方与模型能力(感知、推理、规划、动作生成、世界预测)显式联系起来——这是以往偏架构的综述所欠缺的数据中心视角。

核心方法

直觉上,可以把整个具身数据生态想象成一座金字塔:塔尖是最"真"但最贵的数据,塔基是最"广"但最不贴近真机的数据。从塔尖往下走,每下降一层都是在做一次有意识的交易——用一部分与真实物理执行的耦合,换取更大的覆盖广度与采集规模。塔尖是真机数据(动作可直接在本体上执行,但要硬件、操作员、重置);下一层 UMI 数据(去掉机器人但保留末端执行器监督);再往下是人类第一/第三人称视频(去掉夹爪但保留真实物理与日常多样性);再往下是仿真数据(恢复可执行动作与特权标签,但物理是近似);塔基是通用视觉-语言数据(彻底放弃机器人接地,换取网络级语义与推理覆盖)。技术路线上,作者用两条主轴(可扩展性、机器人对齐性)加四个补充维度(质量、多样性、可复用性、物理保真度)刻画每一层,逐层综述数据集、采集范式、本体与传感、规模与多样性、优劣;再从数据配方与动作表征切入分析具身基础模型;最后归纳六大挑战。

核心创新点是"以可扩展性与机器人对齐性的张力作为排序原则,把异构具身数据源组织成五层互补金字塔"。与已有方法最本质的区别在于:已有金字塔(如 GR00T、Motus)是模型配方的副产品,只解释"我这个模型用了哪些数据";本文的金字塔是一个独立的、类别级的组织框架,不依附于任何单个模型,并显式刻画采集可扩展性、本体依赖、物理保真度、可迁移性、下游效用。更关键的是,它把"下金字塔"定义为一个可解释的风险交易——每一层放松真机耦合的具体方式被一一指明(UMI 丢关节本体感知、人类视频丢夹爪但保真实物理、仿真恢复动作但近似物理、通用数据彻底丢接地换语义)。这种张力视角让读者能判断"在什么预算约束下该用哪一层",而非盲目堆数据。

方法步骤详情

综述方法分四步。第一步"定维度":确立可扩展性、机器人对齐性两条主轴,以及质量、多样性、可复用性、物理保真度四个补充维度。第二步"分层刻画":从塔尖到塔基逐一综述五类数据——真机(Table 1)、UMI(Table 2,含采集管线与重定向)、自我中心/他者中心(Table 3,含语义/几何/多模态/机器人导向四类监督构造)、仿真(Table 4 基准+Table 5 大规模数据集+生成范式)、通用(Table 6,含视觉-语言、分割定位、3D、规划、时序、物理/失败推理、抓取七类)。第三步"分析模型":从数据配方(Table 7)与动作表征(结构对齐三策略+几何对齐三坐标)切入,剖析具身大脑、VLA、WAM 如何消化有/无动作标签数据;本体感知与动作常做归一化(MinMax、Q01–Q99、MeanStd)以维持合适数值尺度 $x'=(x-\mu)/\sigma$。第四步"归纳挑战":围绕"采什么/怎么采/怎么用"组织六大方向(触觉、失败与恢复、可扩展采集、跨本体对齐、灵巧手 ego 先验、数据配方)。

技术新颖性

技术新颖性有三处。第一,提出"张力驱动的类别级分类体系"——用可扩展性与机器人对齐性的内在冲突作为排序逻辑,辅以四个补充维度,比按模态或采集设备分类更具解释力。第二,给出"数据配方演化"的纵向分析:通过 Figure 3 和 Table 7 追踪从 2023.3 的 PaLM-E/RT-2 到 2026.7 一系列模型的数据源变化,揭示从"单一真机"走向"五层异构混合"、从"动作中心 VLA"走向"世界-动作统一模型(WAM)"的趋势;其中连续动作生成常用扩散或流匹配目标 $\mathcal{L}=\mathbb{E}_{a,t}?igl\|a-f_ heta(a_t,t,\mathbf{o},\ell)?igr\|^2$($a$ 为干净动作、$a_t$ 为加噪动作、$\mathbf{o}$ 为观测、$\ell$ 为语言指令)。第三,从"动作空间对齐"与"几何对齐"两个正交角度梳理异构数据如何被消化,把零散工程做法(投影/零填充/语义槽、机器人/相机/腕部中心坐标)整理成可比较的设计空间——这是以往综述没有系统做过的。

Visualization of action-trajectory diversity across representative datasets
Figure 4: Visualization of action-trajectory diversity across representative datasets
Overview of General Data Categories
Figure 8: Overview of General Data Categories

实验结果

本文"结果"是跨类别与跨模型的发现。第一,规模演化(Figure 2):五类数据加速扩张——仿真现 Dex1B 的 10 亿抓取;真机从早期单一抓取(Pinto&Gupta 5 万)扩到 RoboMIND 2.0 的 31 万轨迹/739 任务/1000+ 小时、AgiBot World Beta 100 万轨迹/约 3000 小时、Open X-Embodiment 240 万轨迹/22 本体。第二,配方异构化(Figure 3、Table 7):早期几乎只用真机,2026 年普遍多层混合,π 系列很典型(π0 仅真机→π0.5 加通用→π0.7 再加 ego);预训练暴涨——Qwen-RobotManip 约 3.81 万小时、Xiaomi-Robotics-1 在 10 万+ 小时 UMI 上预训练、EgoScale 把 ego 动作标注做到 20854 小时。第三,自我中心数据从辅助变主力(GR-2、GR00T N1、Motus、π0.7 均纳入)。第四,轨迹多样性(Figure 4)揭示"规模≠多样性":仿真的 InternData-A1 关键点高度聚集。第五,动作表征被系统化(结构对齐三策略含语义槽 $\mathbf{a}\in\mathbb{R}^{80}$、几何对齐机器人/相机/腕部三坐标),但哪种最优无定论,且仅用真机的 LingbotVLA、DreamZero 也能强,"更多源更优"尚未确立。

Statistics and key properties of real-robot manipulation datasets
Table 1: Statistics and key properties of real-robot manipulation datasets
Representative VLA and WAM approaches
Table 7: Representative VLA and WAM approaches
Evolution of Data Scale
Figure 2: Evolution of Data Scale
Evolution of Data Utilization
Figure 3: Evolution of Data Utilization
查看结构化数据
任务指标本文基线提升
真机数据规模十年演化 轨迹数 / 任务数 / 小时数 RoboMIND 2.0: 31万轨迹 / 739任务 / 1000+小时; AgiBot World Beta: 100万轨迹 / 约3000小时; Open X-Embodiment: 240万轨迹 / 22本体 早期 Pinto&Gupta 5万抓取(单任务); QT-Opt 58万(单任务); RT-1 13万轨迹/700+任务 从单任务万级到多本体百万级轨迹、千小时级,规模与多样性同步增长约两个数量级
仿真数据规模 抓取/轨迹样本数 DexGraspNet 2.0: 4.27亿抓取; SynGrasp-1B: 1000万轨迹; Dex1B: 10亿抓取 DexGraspNet 初版: 132万抓取; MimicGen: 5万轨迹 抓取类样本从百万级跃升至十亿级,自动化生成使边际成本趋近于零
具身模型预训练语料规模(2026) 预训练小时数 Xiaomi-Robotics-1: >10万小时UMI; Qwen-RobotManip: ~3.81万小时; EgoScale: 2.0854万小时ego OpenVLA/VideoVLA: 主要依赖 Open X-Embodiment 真机演示(数千小时级) 预训练从纯真机数千小时扩展到多源数万至十万小时,自我中心/UMI 数据成为新增主力
异构数据配方覆盖层数 使用的数据金字塔层数 LingbotVA 2.0: 覆盖全部5层; π0.7: 真机+通用+ego; GR00T 系列: 真机+仿真+通用+ego π0: 仅真机; OpenVLA: 仅真机(Open-X); RT-2: 真机+通用VLM预训练 从1–2层异构扩展到全金字塔5层混合,但最优比例仍未确立

局限与改进

作者坦承的局限主要有三。第一,最优数据配方仍是开放问题:论文明确指出"当前证据并未确立纳入更多数据源本质上更优",因为仅用真机的 LingbotVLA、DreamZero 也能取得强性能,且各数据源的贡献"未被系统隔离"。第二,动作表征的选择缺乏受控消融——机器人/相机/腕部中心三种坐标约定、三种结构对齐策略,"是否某种约定在跨数据集跨本体上一致更优"尚不清楚。第三,金字塔排序是"六个维度的综合而非每个属性严格单调递进",带有主观性。我自己补充几点观察:作为综述,它没有提供任何受控、计算匹配的实验来量化各层(或各维度)对最终性能的边际贡献,所有"发现"都是对现有工作的横向归纳,而非因果证据;"质量"维度被反复提及却始终没有给出可测量的度量;对失败/恢复、触觉等"稀缺信号"的讨论偏向呼吁,缺少这些数据当前规模与缺口的具体量化;此外,论文引用了大量 2026 年中发表的工作(时间标注到 2026.07),部分模型尚未经同行充分验证,结论可能随这些模型后续结果变化。

独立分析的弱点

第一个弱点是"有分类无度量":六个维度只有定性描述,没有可操作的量化指标。改进方向是为每维设计基准化度量,例如用轨迹关键点分布熵(呼应 Figure 4)量化多样性、用接触/摩擦/延迟偏差量化物理保真度。第二个弱点是"有配方无消融":Table 7 列出各模型配方,但无计算匹配的受控实验隔离单一数据源贡献。改进方向是推动"固定模型与算力、只变一个数据类别"的标准化消融协议。第三个弱点是"动作对齐无定论":三种结构策略、三种坐标约定的取舍仍是经验判断,改进方向是建跨本体迁移基准,比较相机中心 vs 腕部中心在灵巧手任务上的差异。第四个弱点是"稀缺数据(失败/恢复、触觉)只喊口号":未给 RoboMIND 2.0、Humanoid Everyday 等含触觉数据集的触觉样本占比与任务覆盖统计,也未量化"失败数据缺口"多大;改进方向是先做现状普查,让"该采什么"从呼吁变成可追踪目标。第五个弱点是金字塔隐喻可能掩盖层间可相互替代(高质量仿真可部分替代真机)的事实,改进方向是给出层间可替代性的定量边界。

未来方向

作者的六大方向可归三问。"该采什么":(1) 触觉数据——把接触力、滑移、局部变形、材料属性纳入标准模态,补上当前以 RGB-D 为中心缺失的"接触层";(2) 失败与恢复数据——从"成功专家演示"偏见转向保留失败、近失败、次优轨迹,并提供失败前上下文、类别/原因、恢复动作与结果的结构化标注。"怎么采":(3) 跨层可扩展采集——让头戴 AR/MR、腕部相机、IMU、手套、触觉贴片、EMG 更轻、无线、模块化,支持自动跨设备标定与设备端手物重建。"怎么用":(4) 跨本体状态-动作对齐——把坐标约定、标定参数、控制器模式作为一等元数据,必要时规范到统一参考系;(5) 灵巧手的 ego 先验——把人类视频当作"交互先验(意图、可供性、抓取选择、接触序列、工具使用)"而非精确动作标签,用形态条件策略、接触中心表征、不确定性感知重定向分离可迁移知识与本体相关执行;(6) 数据配方——研究架构感知、阶段相关的混合策略。可延伸方向还有:用世界模型作为可学习的仿真器与数据引擎反哺金字塔,及把 AIGC 本体专属数据(ManiTwin 10 万+ 物体)纳入体系。

复现评估

作为综述,本文的"复现"主要是分类体系与分析框架的可复用性,门槛很低。作者已公开并持续维护两个资源:项目页"Embodied Data Pyramid"与 GitHub 仓库"Awesome Embodied Data Pyramid",按金字塔分类策展代表性数据集与相关资源,这对想快速定位某一层数据集的研究者非常实用。文中的 Tables 1–7 系统整理了真机、UMI、自我中心、仿真、通用数据集与模型数据配方,可作为查阅手册。复现"发现"本身无需算力,但若想验证其趋势(如多层混合优于单层),则需要大规模 VLA 训练资源(数千 GPU 小时级),这正是综述无法提供受控消融的原因。对普通读者,最实际的复现路径是:先用其开源仓库找到所需数据层,再按 Table 7 选择一个相近的模型配方进行小规模复现。综述本身不涉及具体模型权重或训练超参,因此不存在"复现失败"风险,主要价值在于方法论与文献导航。