具身操作的数据金字塔 Data Pyramid for Embodied Manipulation
用五层数据金字塔系统化组织具身智能数据生态
前置知识
具身基础模型 (Embodied Foundation Models)
指在大规模多模态与交互数据上预训练、可用于感知、推理、规划和控制物理机器人的大模型。与纯视觉-语言模型不同,它还必须理解物理状态、动作如何改变环境、并在物理世界执行行为。本文聚焦三类:具身大脑模型(偏感知与高层规划)、视觉-语言-动作模型(VLA,直接生成可执行动作)、世界动作模型(WAM,建模环境随动作的演化)。
整篇综述都是在回答"用什么数据训练这三类具身基础模型",不理解这个统称就无法把握全文主线。
Scalability 与 Robot Alignment(可扩展性与机器人对齐性)
Scalability 指数据源在硬件依赖、人力、环境重置、安全监督、边际生成成本上的扩展效率;Robot Alignment 指其观测、表征、监督信号能在多大程度上直接支撑物理机器人学习与执行。二者处于张力之中:越贴近真机执行的数据越昂贵难扩展,越易扩展的数据对物理交互的监督越间接或不完美。
这两个正交维度正是金字塔排序的根本依据,也是理解每一层权衡取舍的关键。
UMI 数据 (Universal Manipulation Interface)
一类用便携式手持夹爪(可带相机、位姿追踪模块)在无需机器人在环的情况下采集的实操演示数据。它保留了末端执行器运动、夹爪状态、相对 EEF 轨迹等可直接用于策略学习的信号,但丢掉了关节级本体感知,需要通过标定、动作变换、本体感知重定向(retargeting)才能迁移到具体机器人。
它是金字塔第二层,是连接昂贵真机数据与廉价人类视频的中间桥梁,也是近期 VLA 扩展的重要数据来源。
Sim-to-Real Gap(仿真到现实的差距)
仿真数据与真实机器人执行之间的不一致,分为观测不匹配(纹理、光照、深度噪声、触觉响应)和交互不匹配。交互不匹配又细分为运动学差距(本体形态、关节限位、坐标、控制器频率)和动力学差距(执行器延迟、柔顺性、力矩饱和、摩擦、接触、变形)。
理解这个差距才能解释为何仿真层数据"最可扩展但物理保真度最低",以及为何需要域随机化、数字孪生、真机微调。
Cross-Embodiment Action Alignment(跨本体动作对齐)
把不同机器人本体的动作映射到共享接口的技术。结构层有三种策略:本体特定投影(adapter/动作头)、定长零填充接口、语义动作槽(如 Qwen-RobotManip 的 80 维向量含两个 29 维臂块)。几何层有三种坐标约定:机器人中心、相机中心、腕部中心。
没有动作对齐,异构数据集无法联合训练,跨本体迁移也无从谈起——这是第七章分析模型数据配方时的核心。
研究动机
多模态基础模型之所以能"学会看、学会说",靠的是吞下整个互联网的视觉与语言数据。但具身智能体没有这种捷径:它们需要把观测(observations)与物理状态(physical states)、动作(actions)耦合起来的数据——这类信号只能由真实机器人遥操作、仿真、人类第一人称视频、手持夹爪演示等来源提供,且程度不一。问题在于,社区已经积累了大量异构数据源,却没有人系统地理清它们各自的角色、权衡、相互关系与整合策略。更具体地说,近年来 Motus、GR00T 等模型虽然提出了各自的"金字塔"视图,但这些金字塔都是围绕某个特定模型的训练配方设计的,很少在"采集可扩展性、本体依赖、物理保真度、可迁移性、下游效用"等类别级维度上对比分析不同数据源;已有综述又主要聚焦模型架构或某个子问题(如 VLA、世界模型)。结果是:具身数据生态在"类别层面"尚未被系统化组织,具身基础模型对异构数据的使用也缺乏从数据视角的综合分析。
本文的目标是本文要系统回答两个问题:(1) 在可扩展性、机器人对齐性、物理保真度、可迁移性差异巨大的情况下,如何"采集、组织、比较、整合"异构具身数据源?(2) 具身基础模型应如何"选择、组合、利用"这些异构数据?为此,作者希望提供一个类别级的数据分类体系(data-pyramid taxonomy),把五个数据类别按"可扩展性 vs 机器人对齐性"的张力排序,并用质量、多样性、可复用性、物理保真度四个补充维度刻画每一层;进而从数据配方(data recipe)的视角剖析具身大脑模型、VLA、世界动作模型如何使用这些数据;最后给出"该采什么、怎么采、怎么用"的开放挑战与未来方向。
与已有工作不同的是,本文的独特切入角度在于:它不再围绕"某个模型的训练配方"来定义数据金字塔(这是 Motus/GR00T 的做法),而是把数据本身作为一等公民,围绕"可扩展性与机器人对齐性之间的张力"来组织整个具身数据生态。它补上了四个被忽视的类别级维度——质量、多样性、可复用性、物理保真度,把"下金字塔"描述成一个有意识的风险交易过程(每一层都放松一部分与真机执行的耦合以换取覆盖广度)。更重要的是,它从"动作空间对齐"和"几何对齐"两个视角,把异构数据如何被具身基础模型消化这件事讲清楚,并把数据配方与模型能力(感知、推理、规划、动作生成、世界预测)显式联系起来——这是以往偏架构的综述所欠缺的数据中心视角。
核心方法
直觉上,可以把整个具身数据生态想象成一座金字塔:塔尖是最"真"但最贵的数据,塔基是最"广"但最不贴近真机的数据。从塔尖往下走,每下降一层都是在做一次有意识的交易——用一部分与真实物理执行的耦合,换取更大的覆盖广度与采集规模。塔尖是真机数据(动作可直接在本体上执行,但要硬件、操作员、重置);下一层 UMI 数据(去掉机器人但保留末端执行器监督);再往下是人类第一/第三人称视频(去掉夹爪但保留真实物理与日常多样性);再往下是仿真数据(恢复可执行动作与特权标签,但物理是近似);塔基是通用视觉-语言数据(彻底放弃机器人接地,换取网络级语义与推理覆盖)。技术路线上,作者用两条主轴(可扩展性、机器人对齐性)加四个补充维度(质量、多样性、可复用性、物理保真度)刻画每一层,逐层综述数据集、采集范式、本体与传感、规模与多样性、优劣;再从数据配方与动作表征切入分析具身基础模型;最后归纳六大挑战。
核心创新点是"以可扩展性与机器人对齐性的张力作为排序原则,把异构具身数据源组织成五层互补金字塔"。与已有方法最本质的区别在于:已有金字塔(如 GR00T、Motus)是模型配方的副产品,只解释"我这个模型用了哪些数据";本文的金字塔是一个独立的、类别级的组织框架,不依附于任何单个模型,并显式刻画采集可扩展性、本体依赖、物理保真度、可迁移性、下游效用。更关键的是,它把"下金字塔"定义为一个可解释的风险交易——每一层放松真机耦合的具体方式被一一指明(UMI 丢关节本体感知、人类视频丢夹爪但保真实物理、仿真恢复动作但近似物理、通用数据彻底丢接地换语义)。这种张力视角让读者能判断"在什么预算约束下该用哪一层",而非盲目堆数据。
方法步骤详情
综述方法分四步。第一步"定维度":确立可扩展性、机器人对齐性两条主轴,以及质量、多样性、可复用性、物理保真度四个补充维度。第二步"分层刻画":从塔尖到塔基逐一综述五类数据——真机(Table 1)、UMI(Table 2,含采集管线与重定向)、自我中心/他者中心(Table 3,含语义/几何/多模态/机器人导向四类监督构造)、仿真(Table 4 基准+Table 5 大规模数据集+生成范式)、通用(Table 6,含视觉-语言、分割定位、3D、规划、时序、物理/失败推理、抓取七类)。第三步"分析模型":从数据配方(Table 7)与动作表征(结构对齐三策略+几何对齐三坐标)切入,剖析具身大脑、VLA、WAM 如何消化有/无动作标签数据;本体感知与动作常做归一化(MinMax、Q01–Q99、MeanStd)以维持合适数值尺度 $x'=(x-\mu)/\sigma$。第四步"归纳挑战":围绕"采什么/怎么采/怎么用"组织六大方向(触觉、失败与恢复、可扩展采集、跨本体对齐、灵巧手 ego 先验、数据配方)。
技术新颖性
技术新颖性有三处。第一,提出"张力驱动的类别级分类体系"——用可扩展性与机器人对齐性的内在冲突作为排序逻辑,辅以四个补充维度,比按模态或采集设备分类更具解释力。第二,给出"数据配方演化"的纵向分析:通过 Figure 3 和 Table 7 追踪从 2023.3 的 PaLM-E/RT-2 到 2026.7 一系列模型的数据源变化,揭示从"单一真机"走向"五层异构混合"、从"动作中心 VLA"走向"世界-动作统一模型(WAM)"的趋势;其中连续动作生成常用扩散或流匹配目标 $\mathcal{L}=\mathbb{E}_{a,t}?igl\|a-f_ heta(a_t,t,\mathbf{o},\ell)?igr\|^2$($a$ 为干净动作、$a_t$ 为加噪动作、$\mathbf{o}$ 为观测、$\ell$ 为语言指令)。第三,从"动作空间对齐"与"几何对齐"两个正交角度梳理异构数据如何被消化,把零散工程做法(投影/零填充/语义槽、机器人/相机/腕部中心坐标)整理成可比较的设计空间——这是以往综述没有系统做过的。
实验结果
本文"结果"是跨类别与跨模型的发现。第一,规模演化(Figure 2):五类数据加速扩张——仿真现 Dex1B 的 10 亿抓取;真机从早期单一抓取(Pinto&Gupta 5 万)扩到 RoboMIND 2.0 的 31 万轨迹/739 任务/1000+ 小时、AgiBot World Beta 100 万轨迹/约 3000 小时、Open X-Embodiment 240 万轨迹/22 本体。第二,配方异构化(Figure 3、Table 7):早期几乎只用真机,2026 年普遍多层混合,π 系列很典型(π0 仅真机→π0.5 加通用→π0.7 再加 ego);预训练暴涨——Qwen-RobotManip 约 3.81 万小时、Xiaomi-Robotics-1 在 10 万+ 小时 UMI 上预训练、EgoScale 把 ego 动作标注做到 20854 小时。第三,自我中心数据从辅助变主力(GR-2、GR00T N1、Motus、π0.7 均纳入)。第四,轨迹多样性(Figure 4)揭示"规模≠多样性":仿真的 InternData-A1 关键点高度聚集。第五,动作表征被系统化(结构对齐三策略含语义槽 $\mathbf{a}\in\mathbb{R}^{80}$、几何对齐机器人/相机/腕部三坐标),但哪种最优无定论,且仅用真机的 LingbotVLA、DreamZero 也能强,"更多源更优"尚未确立。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 真机数据规模十年演化 | 轨迹数 / 任务数 / 小时数 | RoboMIND 2.0: 31万轨迹 / 739任务 / 1000+小时; AgiBot World Beta: 100万轨迹 / 约3000小时; Open X-Embodiment: 240万轨迹 / 22本体 | 早期 Pinto&Gupta 5万抓取(单任务); QT-Opt 58万(单任务); RT-1 13万轨迹/700+任务 | 从单任务万级到多本体百万级轨迹、千小时级,规模与多样性同步增长约两个数量级 |
| 仿真数据规模 | 抓取/轨迹样本数 | DexGraspNet 2.0: 4.27亿抓取; SynGrasp-1B: 1000万轨迹; Dex1B: 10亿抓取 | DexGraspNet 初版: 132万抓取; MimicGen: 5万轨迹 | 抓取类样本从百万级跃升至十亿级,自动化生成使边际成本趋近于零 |
| 具身模型预训练语料规模(2026) | 预训练小时数 | Xiaomi-Robotics-1: >10万小时UMI; Qwen-RobotManip: ~3.81万小时; EgoScale: 2.0854万小时ego | OpenVLA/VideoVLA: 主要依赖 Open X-Embodiment 真机演示(数千小时级) | 预训练从纯真机数千小时扩展到多源数万至十万小时,自我中心/UMI 数据成为新增主力 |
| 异构数据配方覆盖层数 | 使用的数据金字塔层数 | LingbotVA 2.0: 覆盖全部5层; π0.7: 真机+通用+ego; GR00T 系列: 真机+仿真+通用+ego | π0: 仅真机; OpenVLA: 仅真机(Open-X); RT-2: 真机+通用VLM预训练 | 从1–2层异构扩展到全金字塔5层混合,但最优比例仍未确立 |
局限与改进
作者坦承的局限主要有三。第一,最优数据配方仍是开放问题:论文明确指出"当前证据并未确立纳入更多数据源本质上更优",因为仅用真机的 LingbotVLA、DreamZero 也能取得强性能,且各数据源的贡献"未被系统隔离"。第二,动作表征的选择缺乏受控消融——机器人/相机/腕部中心三种坐标约定、三种结构对齐策略,"是否某种约定在跨数据集跨本体上一致更优"尚不清楚。第三,金字塔排序是"六个维度的综合而非每个属性严格单调递进",带有主观性。我自己补充几点观察:作为综述,它没有提供任何受控、计算匹配的实验来量化各层(或各维度)对最终性能的边际贡献,所有"发现"都是对现有工作的横向归纳,而非因果证据;"质量"维度被反复提及却始终没有给出可测量的度量;对失败/恢复、触觉等"稀缺信号"的讨论偏向呼吁,缺少这些数据当前规模与缺口的具体量化;此外,论文引用了大量 2026 年中发表的工作(时间标注到 2026.07),部分模型尚未经同行充分验证,结论可能随这些模型后续结果变化。
独立分析的弱点
第一个弱点是"有分类无度量":六个维度只有定性描述,没有可操作的量化指标。改进方向是为每维设计基准化度量,例如用轨迹关键点分布熵(呼应 Figure 4)量化多样性、用接触/摩擦/延迟偏差量化物理保真度。第二个弱点是"有配方无消融":Table 7 列出各模型配方,但无计算匹配的受控实验隔离单一数据源贡献。改进方向是推动"固定模型与算力、只变一个数据类别"的标准化消融协议。第三个弱点是"动作对齐无定论":三种结构策略、三种坐标约定的取舍仍是经验判断,改进方向是建跨本体迁移基准,比较相机中心 vs 腕部中心在灵巧手任务上的差异。第四个弱点是"稀缺数据(失败/恢复、触觉)只喊口号":未给 RoboMIND 2.0、Humanoid Everyday 等含触觉数据集的触觉样本占比与任务覆盖统计,也未量化"失败数据缺口"多大;改进方向是先做现状普查,让"该采什么"从呼吁变成可追踪目标。第五个弱点是金字塔隐喻可能掩盖层间可相互替代(高质量仿真可部分替代真机)的事实,改进方向是给出层间可替代性的定量边界。
未来方向
作者的六大方向可归三问。"该采什么":(1) 触觉数据——把接触力、滑移、局部变形、材料属性纳入标准模态,补上当前以 RGB-D 为中心缺失的"接触层";(2) 失败与恢复数据——从"成功专家演示"偏见转向保留失败、近失败、次优轨迹,并提供失败前上下文、类别/原因、恢复动作与结果的结构化标注。"怎么采":(3) 跨层可扩展采集——让头戴 AR/MR、腕部相机、IMU、手套、触觉贴片、EMG 更轻、无线、模块化,支持自动跨设备标定与设备端手物重建。"怎么用":(4) 跨本体状态-动作对齐——把坐标约定、标定参数、控制器模式作为一等元数据,必要时规范到统一参考系;(5) 灵巧手的 ego 先验——把人类视频当作"交互先验(意图、可供性、抓取选择、接触序列、工具使用)"而非精确动作标签,用形态条件策略、接触中心表征、不确定性感知重定向分离可迁移知识与本体相关执行;(6) 数据配方——研究架构感知、阶段相关的混合策略。可延伸方向还有:用世界模型作为可学习的仿真器与数据引擎反哺金字塔,及把 AIGC 本体专属数据(ManiTwin 10 万+ 物体)纳入体系。
复现评估
作为综述,本文的"复现"主要是分类体系与分析框架的可复用性,门槛很低。作者已公开并持续维护两个资源:项目页"Embodied Data Pyramid"与 GitHub 仓库"Awesome Embodied Data Pyramid",按金字塔分类策展代表性数据集与相关资源,这对想快速定位某一层数据集的研究者非常实用。文中的 Tables 1–7 系统整理了真机、UMI、自我中心、仿真、通用数据集与模型数据配方,可作为查阅手册。复现"发现"本身无需算力,但若想验证其趋势(如多层混合优于单层),则需要大规模 VLA 训练资源(数千 GPU 小时级),这正是综述无法提供受控消融的原因。对普通读者,最实际的复现路径是:先用其开源仓库找到所需数据层,再按 Table 7 选择一个相近的模型配方进行小规模复现。综述本身不涉及具体模型权重或训练超参,因此不存在"复现失败"风险,主要价值在于方法论与文献导航。
论文图表
展示论文三部分结构:具身数据金字塔(五层数据源按可扩展性与机器人对齐性分类,并综述数据集、采集管线、本体传感、监督、规模、多样性、可迁移性)、这些异构源如何支撑具身基础模型、以及具身数据的未来方向。底部还给出了五层数据的塔尖-塔基示意。
这是全文的"地图",一张图说清金字塔五层、两条主轴、四个补充维度,以及全文章节安排,是理解后续所有内容的基础。