← 返回 2026-07-21

Open-AoE:面向具身智能的开放第一人称操作数据集与工具链 Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li 📅 2026-07-15 👍 66 2026-07-25 18:30
VLA策略 世界模型 人机迁移 具身智能 开源工具链 第一人称操作数据集

开源2000小时手机采集的第一人称操作数据集及端到端工具链

前置知识

第一人称(egocentric)视频

从操作者自身视角拍摄的视频流,画面中同时包含双手、被操作物体、场景背景和动作进展。与第三人称视角相比,它的感知结构更接近机器人执行时车载或头戴摄像头的观测,因此被视为从人类演示迁移到机器人策略的天然桥梁。

本文整个数据集都建立在第一人称视频这一模态上,理解它的采集方式与机器人视角的对应关系是读懂全文的前提。

MANO 手部参数模型

一种从统计形状空间生成人手网格的参数化模型,用低维姿态参数(本文每只手 45 维)和形状参数描述完整手部几何,可重建 21 个关节关键点。它提供统一的手部表示,便于跨样本对齐并迁移到机器人灵巧手。

论文所有手部标注都以 MANO 为基础,110D 稠密动作表示、重定向到 28-DoF 关节空间、4D 手物重建都依赖它。

跨身体形态重定向(cross-embodiment retargeting)

把人类演示的运动映射到目标机器人可执行运动的过程,常用逆运动学(IK)或物理仿真方法,把腕部与手指轨迹转换成机器人关节角或末端执行器位姿。不同机器人(Unitree G1、Galbot/Galaxea、Sharpa、XHand)需要不同的映射策略。

这是把人类视频变成机器人训练数据的核心环节,也是 Open-AoE 工具链区别于纯数据集的关键卖点。

VLA / WAM / 世界模型三类下游范式

VLA(视觉-语言-动作)策略直接从图像加语言预测动作;WAM(世界动作模型)在观测动力学中联合学习动作变量,常用于无显式机器人动作的场景;世界模型用预测性视频学习可复用的场景与交互动力学。三者对动作表示的需求截然不同(稠密手指、末端目标、隐变量)。

工具链“一套数据、多种表示”的设计完全围绕这三类范式展开,不理解它们就无法理解为何要提供五种动作接口。

机器人化视频(robotized video)

用视频修复(如 E2FGVI、ProPainter)擦除原视频中的人类手臂,再把 MuJoCo 仿真渲染的机器人叠加回原始第一人称场景,生成“同一交互、不同身体形态”的配对观测。它保留真实环境光照与物体,只替换执行者外观。

这是连接人类视觉域与机器人视觉域的关键技术,理解它才能搞懂工具链为何强调配对信号而非替代真实执行。

研究动机

具身基础模型正被真实世界交互数据的规模与质量卡住:和能从互联网海量文本中学习的语言模型不同,机器人学习需要捕捉人类如何感知场景、移动双手、接触物体并完成长时序任务的物理演示,这类数据不仅要量大、要多样,还必须在几何、时间、语义三个维度上结构化才能用于操作学习。然而现有第一人称数据资源存在结构性缺口:高质量数据集(如 EgoDex、EgoLive)依赖专用头戴设备、AR/VR 硬件或受控采集协议,虽能提升位姿与相机传感质量,却显著收窄了采集可及性;而像 EgoScale 那样 20,854 小时规模的大规模被动视频虽易获取,却缺少机器人训练所需的手部运动、相机轨迹、动作边界等物理结构。更要命的是,各家为手部姿态统一、人到机器人迁移、原始视频处理各自造了数据集专属流水线,但这些流水线彼此割裂,没有形成统一基础设施——这恰恰揭示了“发布视频”和“发布能直接用于训练的数据”之间的本质差别。

本文的目标是Open-AoE 的目标不是再发布一个孤立的视频集,而是开放一个可复用的“采集—处理—重建—训练”数据生产闭环。首发版本包含约 2,000 小时真实第一人称人类操作数据,由 500+ 贡献者用 400+ 款消费级智能手机在自然环境中采集,覆盖 400+ 场景和 8,000+ 任务,并提供四类结构化信号:文本描述、基于 MANO 的双手姿态、相机轨迹、以及时间对齐的原子动作段。配套方面,要开源把上传的智能手机片段转换成结构化样本的云端处理流水线(含质量筛查、隐私擦除、时序分割、语义标注、相机轨迹估计、手部重建、原子动作标注、多级质检),以及面向下游的可视化、4D 手物重建、跨身体形态重定向、机器人化视频生成工具链,并把对齐后的信号映射到 VLA、WAM、世界模型三大模型方向的动作表示与训练接口。最终目的是把低成本智能手机采集的人类操作视频变成实用的开放基础设施。

与已有工作不同的是,本文抓住的被忽视点是:社区缺的不是更多第一人称视频,而是能持续采集、系统处理并直接支撑模型训练的开放数据基础设施。已有工作要么“有结构无规模或可及性”(专用硬件、单一机型),要么“有规模无结构”(海量被动视频缺手部、相机、动作边界),要么“有流水线但不统一”(数据集专属、彼此割裂)。Open-AoE 的独特切入是把三件事压成一套协同系统:用消费级手机把采集门槛降到最低、用云端流水线把原始视频升级成结构化样本、用下游工具链把同一份语料同时喂给三类模型方向。它强调的不是任一单项指标(小时数、机型数),而是把“采集—处理—重建—训练”打通并开源,使研究者无需自建后处理栈就能从同一语料出发做检查、重建、重定向、训练。

核心方法

可以把 Open-AoE 理解成“具身智能版的 Hugging Face 数据流水线”:它不是一堆视频,而是一条从手机到模型的工厂线。直觉上它解决两个问题——怎么低成本采到干净数据,以及采到之后怎么变成机器人能用的监督信号。技术路线分两端:生产端是一条四阶段漏斗式处理流水线(设备端在线检测 → 离线质检与场景标注 → 重建与标注 → 质检与交付),逐级把原始手机片段筛成匿名的结构化样本;消费端是工具链(AoE-Visualization 可视化、AoE-Reconstruct-Retarget 重建重定向、AoE-Training-Ready 训练就绪),把对齐后的多模态证据按下游模型需求投影成不同层级的动作表示。核心设计哲学是建立一个统一的“证据层”——把去畸变 RGB、相机内参与轨迹、双手 MANO 网格、有效掩码、原子动作标注对齐到同一条时间线上,再根据具体问题(人手建模、机器人控制、视觉动力学)选择合适粒度的表示,而不是把所有视频压成单一格式。

全文最重要的洞见是:不存在“一种动作向量同时适合人手建模、机器人控制和视觉动力学学习”,因此数据基础设施必须保留源信号的物理含义并按下游问题选择表示层级。为此 Open-AoE 提出“证据层加表示谱”的双层设计:底层是一条时间线上的多模态原始证据(RGB、相机轨迹、双手 MANO、有效掩码、原子动作),上层则是一张从高监督密度到低监督密度的表示光谱——110D 稠密 MANO 状态、48D 腕-指尖、62D Sharpa 机器人关节、20D GR00T 夹爪、22D 状态/隐动作,分别对接 VLA、WAM、世界模型。这与已有数据集“发布视频加单一格式标签”的做法有本质区别:它承认不同范式保持不同的不变量(人手建模要手指铰接、跨形态控制要末端或关节目标、第一人称动力学要分离相机自运动),并据此提供 5 种接口而非一种。这种“同一证据、多种投影”的思路让同一份语料无需重建私有后处理栈就能同时服务三类模型方向。

方法步骤详情

流水线分四阶段。阶段 1 设备端在线检测:端侧视觉模型实时门控录制,做手部可见性(手入框自动开停)、操作与佩戴合规、暗光补光加自动曝光、防抖去模糊加自适应帧率,只把有效且授权片段上传云端。阶段 2 离线质检与场景标注:图像检测用规则器筛掉流损坏、过曝欠曝、解码异常并剔除无手、非第一人称、严重抖动;信息安全擦除人脸与匿名化元数据;再视频切片加帧率固定,长录制切成语义独立 Part;最后 Qwen3.7-Plus 做合规与有效动作检测,闭集下构建 domain/scene/task 加物体的四级标签树。阶段 3 重建与标注:DROID-W(鲁棒核重调参)恢复 6-DoF 相机位姿;AoE 训练双人手检测器给逐帧框并跨帧补全;HaWoR 恢复 3D MANO 网格经 SLAM 度量对齐加滑窗时序一致性;全局光束平差在单一世界系联合优化手部网格与相机轨迹,消除分段尺度漂移;提取 21 关键点并切成英语原子片段,人在回路修幻觉。阶段 4 三道门质检——完整性(重建有效帧率)、正确性(28-DoF IK 失败率低)、一致性(轨迹平滑);随机子集人工复核,精选约 2,000 小时开源发布。

技术新颖性

技术新颖性有三处。其一,重建阶段的全局光束平差:把 HaWoR 手部重建与 DROID-W 动态物体掩码在单一世界坐标系下联合优化,消除分段重建累积的尺度漂移与坐标错配,使度量对齐的双手网格与相机轨迹共处同一参考系。其二,动作表示光谱:110D 稠密 MANO($2\times[\text{valid}(1)+\text{wrist}\,xyz(3)+\text{wrist}\,aa(3)+\text{vel}(3)+\text{MANO}(45)]$)、48D 腕-指尖、62D Sharpa、20D GR00T 夹爪、22D 状态/隐动作五接口对接不同模型方向,平移速度在当前帧相机系($x$ 右、$y$ 下、$z$ 前)下自然包含手部运动与相机自运动两个因果源。其三,端到端开源闭环:对比 Ego4D/EPIC-KITCHENS(无手部、相机轨迹、重定向、训练就绪)、EgoDex/EgoLive(专用硬件单一机型)、OpenEgo/EgoScale(有规模无工具链),Open-AoE 首次把消费机大规模采集与完整标注、重定向、训练就绪工具链整合成一套基础设施。

Open-AoE data processing pipeline.
Figure 2: Open-AoE data processing pipeline.
AoE-Reconstruct-Retarget.
Figure 4: AoE-Reconstruct-Retarget.
AoE-Training-Ready.
Figure 5: AoE-Training-Ready.

实验结果

用约 100 小时随机子集与 OpenEgo、EgoDex、EgoXtreme 四维对比。视觉多样性(Fig. 6,CLIP):3,000 次平衡采样中 Open-AoE 六项指标全夺冠——有效秩 97.43(OpenEgo 76.9)、参与比 40.47、有意义覆盖 19.89、归一化簇熵 0.712、kNN 域混合 0.0775,且前三项 3,000 次试验全第一。语义与时序(Fig. 7):主动作字段含 32,407 条自然语言描述(OpenEgo 26,864、EgoDex 仅 111 类),时间覆盖 99.99%(OpenEgo 50.1%),平均段长 9.64 s,密度 13.97 段/分钟。标注一致性(Fig. 8):Idefics2 序列宏均分 4.583/5(OpenEgo 3.029),85.4% 序列≥4 分。训练产出(Fig. 9):用 $h=2$ s、$f=2$ s、$\Delta=2$ s 步长每小时产 1,760 窗口,达上限 97.8%;手部可用性 98.93%,是唯一五模态近乎全覆盖的发布;边界框均置信 0.947。

Comparison of egocentric manipulation datasets.
Table 1: Comparison of egocentric manipulation datasets.
Action representations exposed by AoE-Training-Ready.
Table 2: Action representations exposed by AoE-Training-Ready.
Open-AoE collection, sensor, and semantic diversity in a random 100-hour sample.
Figure 3: Open-AoE collection, sensor, and semantic diversity in a random 100-hour sample.
High-dimensional CLIP feature analysis.
Figure 6: High-dimensional CLIP feature analysis.
Semantic breadth and temporal annotation characteristics across datasets.
Figure 7: Semantic breadth and temporal annotation characteristics across datasets.
Sequence-level image-annotation consistency across datasets.
Figure 8: Sequence-level image-annotation consistency across datasets.
Training-sample yield and multimodal supervision availability across datasets.
Figure 9: Training-sample yield and multimodal supervision availability across datasets.
查看结构化数据
任务指标本文基线提升
视觉特征多样性 有效秩 Effective Rank 97.43 76.9 (OpenEgo) 六项 CLIP 指标全部第一,3,000 次试验全夺冠
动作标注时间覆盖 时间覆盖率 99.99% 50.1% (OpenEgo) +49.89 个百分点
图像-标注一致性 Idefics2 序列宏均分 (/5) 4.583 3.029 (OpenEgo) +51%,85.4% 序列≥4 分
训练样本产出 历史-未来窗口/小时 (保留率) 1,760 (97.8%) 1,226 (EgoDex, 68.1%) 保留率四者最高
手部信号可用性 至少一只手有效占比 98.93% 66.2% (OpenEgo) +32.7 个百分点

局限与改进

作者承认的局限包括:所有分布统计都来自同一份 100 小时随机样本,而非全部 2,000 小时;相机域多样性的下游收益仍是一个训练假设,应通过受控消融验证;任务计数因各数据集定义不同不可直接比较;词汇量大小反映的是发布监督的广度而非共享本体下的受控比较;图像-标注一致性是共享评估器下的跨数据集审计而非完全受控基准。我自己的观察更尖锐:全文没有任何下游训练结果——“训练就绪、支持 VLA/WAM/世界模型三大方向”这一核心卖点完全未用真实机器人基准验证,多样性指标只是与下游效用相关性未知的代理。此外,质检门可能系统性偏向简单视频:完整性要高有效帧率、正确性要低 IK 失败率(28-DoF)、一致性要平滑相机轨迹,三道门叠加很可能把最有价值的灵巧与手内操作滤掉;MANO 只覆盖双手无全身,限制了人形整体迁移;智能手机 FOV 与成像质量的方差既可能是自然数据增强也可能是噪声源。

独立分析的弱点

独立分析如下。第一,缺乏端到端验证:整篇论文用多样性、一致性、产出率等代理指标证明数据好,却没有训一个 VLA 在真实机器人基准上对比 OpenEgo、EgoDex 报成功率——这是最致命的缺口,多样性高未必等于策略成功率高。改进方向:随数据发布一个基线 VLA(如 H-RDT、GR00T N1.7 适配器)加真实机器人评测分数。第二,质检门偏置简单任务:完整性门要高有效帧率、正确性门要低 IK 失败率、一致性门要平滑相机轨迹,三道门叠加大概率把困难、灵巧、剧烈视角变化的高价值样本排掉。改进:额外发布 raw+ 分级并附带逐样本质量分,让用户自选阈值。第三,仅第一人称双手、无触觉、力觉与全身:对双臂人形整体迁移支持有限,机器人化视频也只能替换双手臂。改进:可选 IMU、腕部相机等多模态扩展。第四,原子动作分割依赖 Qwen 加人在回路:规模化标注成本高,对罕见任务可能有系统性偏差。第五,机器人化视频靠 E2FGVI、ProPainter 修复:修复伪影可能污染视觉域迁移,应报告修复质量及其对下游的影响。

未来方向

作者提出的方向是把 Open-AoE 建成最低门槛的第一人称数据基础设施——由数据贡献者、高校、研究机构、机器人厂商、模型团队共建的开放生态,邀请社区贡献新场景与任务、重建与重定向方法、训练适配器、评测结果,让数据、工具、模型在开放回路中共同演进。基于成果可延伸的方向包括:第一,补齐端到端验证,提供 VLA、WAM、世界模型基线与排行榜,把训练就绪从承诺变成证据;第二,增加力觉、触觉、腕部相机模态,并扩展到全身与双臂人形;第三,用主动学习优先标注稀有场景与任务,主动平衡长尾;第四,把部署机器人的真实回传数据接回采集池,形成在线数据飞轮;第五,把表示光谱从 5 种固定接口扩展到更通用的可微重定向,支持任意新机器人形态即插即用。

复现评估

复现性是 Open-AoE 的强项也是弱项。开源程度很高:GitHub、Hugging Face、ModelScope 三端发布,采集 App(Android 与 iOS)、云端处理流水线、下游工具链全部开源,数据约 2,000 小时公开可下载且经过脱敏。消费侧复现容易——直接下载数据加跑工具链即可上手;但采集侧复现几乎不可能——500+ 贡献者、400+ 机型、400+ 场景是个人实验室无法重建的规模。处理流水线复现可行但需要 GPU:Qwen3.7-Plus 大模型检测、DROID-W 的 SLAM、HaWoR 手部重建都吃算力,且依赖外部模型可用性。下游工具链集成了大量第三方方法(EgoInfinity、Do-as-I-Do、Phantom、SPIDER、MuJoCo),集成复杂度中高。综合判断:数据消费与下游适配复现难度低到中,从零复刻整条采集-处理流水线难度高。建议读者从下载已发布子集加跑训练就绪适配器入手,而非试图自建采集。