← 返回 2026-08-06

Ego2Robot:从第一人称人类操作视频可扩展合成机器人训练数据 Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin 📅 2026-08-03 👍 23 2026-08-11 18:30
具身智能 动作重定向 数据合成 机器人学习 第一人称视频 视觉-语言-动作模型

把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。

前置知识

Vision-Language-Action (VLA) 模型

VLA 是一类以视觉和语言为输入、直接输出机器人动作的端到端模型,如论文所述采用 Qwen3.5-4B 作视觉语言骨干 + Diffusion Transformer 动作头。它通过大规模机器人演示预训练学习通用操作策略,预测多步动作块(本文为 32 步、8 步扩散)。

本文的全部目标就是验证 ego2robot 合成数据能否提升 VLA 的 OOD 泛化,不理解 VLA 的预训练范式就无法理解论文动机。

第一人称(Egocentric)视频

以佩戴者或操作者视角拍摄的视频,画面中人手与物体交互。本文来源包括 ANT、EgoDex(732h)、ViTRA(249h)、EgoVerse(954h),共约 1940 小时,捕捉了机器人遥操作难以企及的物体/环境/任务多样性,但不含机器人本体。

这是论文的数据来源和命名由来,理解其与机器人数据的本体鸿沟是理解转换难点的关键。

动作重定向(Retargeting)

把一种本体的运动轨迹映射到另一种本体的过程。本文把 21 个人手关键点映射为平行夹爪末端位姿,定义虚拟指尖 $p_{vf}=0.7p_{index}+0.3p_{middle}$、TCP $p_{tcp}=(p_{thumb}+p_{vf})/2$,并构建正交抓取系 R=[x y z]。

动作对齐阶段的核心操作,是 ego 视频转化为机器人动作空间的第一步,直接决定后续 IK 可行性。

逆运动学(IK)与基座位姿搜索

逆运动学给定末端位姿反解关节角。本文独特难题是 ego 轨迹本体无关、无参考基座,故建模为优化 $T^*_{base}=\arg\max \frac{1}{|K|}\sum_{k\in K}\mathbb{1}[\text{IK}(T^{-1}_{base}T^k_{ee})\text{ feasible}]$,在 MuJoCo 中网格搜索关键帧可行性最高的基座。

基座位姿搜索是论文的方法核心创新,决定了渲染机器人能否在场景中合法放置,是理解技术新颖性的关键。

解耦泛化评估(Disentangled Generalization)

现有基准把多种扰动(背景、光照、本体、指令)捆绑成单一分数,难以归因。本文扩展 RoboTwin2.0 为 11 个独立设置 + EBench,沿视觉外观、场景布局、本体形态、任务语义四轴独立测试,精确定位收益来源。

这是论文第三大贡献,也是所有实验结论的解释框架,不理解解耦评估就无法读懂 Table 2 的逐项分析。

研究动机

现有 VLA 模型(如论文引用[1-5])通过大规模机器人演示预训练取得进展,但其泛化能力根本上受限于机器人数据的规模与多样性。尽管有 Open X-Embodiment、DROID、AgibotWorld 等大规模数据集,采集机器人演示仍极其昂贵、劳动密集,且受硬件可用性、遥操作成本和有限交互多样性约束。第一人称人手操作视频提供了诱人的替代方案——手部交互可在海量物体、环境和任务变体上大规模采集,蕴含机器人难以单独获取的丰富操作先验。然而人类与机器人本体之间存在巨大鸿沟,直接把 ego 视频转换为机器人训练数据困难重重。先前工作虽在小规模上展示了 retargeting+渲染方法可产生有效的 per-task 策略,但大规模 ego2robot 合成数据能否为 VLA 提供预训练收益(尤其提升 OOD 泛化)基本未被探索。

本文的目标是本文目标是构建端到端可扩展流水线 Ego2Robot,把第一人称人类操作视频转化为特定本体的机器人训练数据,通过动作对齐、视觉对齐和多层质量筛选三个阶段。流水线处理约 1940 小时来自四个来源(ANT、EgoDex、ViTRA、EgoVerse)的标注/无标注 ego 视频,覆盖 15 种机器人本体形态,产出 18561 小时合成机器人训练数据——迄今最大的 ego-to-robot 数据集,实现约 9.6× 放大。同时构建解耦泛化评估基准,沿视觉外观、场景布局、本体形态、任务语义四个独立轴评估,精确定位 ego2robot 数据对哪种扰动最有价值。最终通过仿真和真实机器人(ARX ACone 平台,5 任务)验证联合预训练能否提升 OOD 泛化。

与已有工作不同的是,作者的独特切入角度在于核心假设:尽管本体不同,第一人称操作视频包含可迁移的交互规律,只要适当对齐就能补充机器人数据。与先前只在有限规模或单任务上研究 retarget-and-render 不同,本文把它扩展到 18561 小时×15 本体并系统评估其对 VLA 预训练和 OOD 泛化的价值。另一关键创新是解耦评估协议——现有基准(RoboTwin、LIBERO、CALVIN、RLBench 等)把多种扰动捆绑成单一聚合分数,难以把失败归因到具体因素;本文沿四轴独立测试,揭示 ego2robot 数据主要提升不变性和跨分布鲁棒性,而非单纯增加轨迹覆盖。此外采用相机系相对 EEF 动作表示,避免逐视频标定,自然统一不同来源的动作空间。

核心方法

整体思路是"对齐 + 筛选"。直觉上:ego 视频虽不含机器人,但人手抓取轨迹与机器人末端执行器轨迹在几何上存在对应关系,只要把人手转成夹爪动作、把人臂视觉替换成机器人臂,就能复用其丰富的物体/环境多样性。技术路线分三阶段:(1) 动作对齐——通过 retargeting 把 21 个人手关键点转化为平行夹爪末端轨迹,加时间平滑和速度对齐;(2) 视觉对齐——用 SAM 3 分割人臂、ProPainter 擦除人手还原背景、搜索机器人基座位姿并帧帧 IK 求解、深度感知合成渲染机器人臂;(3) 质量筛选——L1 流水线内部、L2 统计、L3 VLM 一致性三层过滤。流水线支持 Path A(带手姿标注的数据集如 ANT、EgoDex)和 Path B(无标注纯视频,先用 WiLoR 逐帧重建 + DynHaMR 时序优化估计手姿,再用 Qwen3.5 切分子任务)。两条路径在估计手姿后共享统一流程,为 15 种本体并行生成训练数据。

核心创新在于解决了 ego-to-robot 的根本挑战——机器人基座位姿确定。与 robot-to-robot 迁移不同,第一人称手轨迹是本体无关的,没有物理机器人基座可参考。作者将其建模为优化:给定 N 个目标末端位姿 $\{T^i_{ee}\}$ 和最大臂展 $r_{max}$,求解 $T^*_{base}=\arg\max_{T_{base}}\frac{1}{|K|}\sum_{k\in K}\mathbb{1}[\text{IK}(T^{-1}_{base}T^k_{ee})\text{ feasible}]$,其中 K 是覆盖轨迹空间极值(最大位移或朝向变化)的代表关键帧,IK 在 MuJoCo 中求解。通过在轨迹质心周围网格搜索候选位置、每处对全部关键帧验证 IK 可行性,选可行性率最高的基座。此搜索对 15 种本体独立进行——不同臂长和关节配置需不同基座。第二个关键决策是用相机系相对 EEF 动作表示,自然统一不同相机设置和本体,避免逐视频标定产生的不兼容动作空间。这与已有 robot-to-robot 方法(RoviAug、Mirage、OXEAugE)有本质区别。

方法步骤详情

步骤 1 动作对齐:从 21 关键点提取夹爪表示,定义虚拟指尖 $p_{vf}=0.7p_{index}+0.3p_{middle}$,TCP 点 $p_{tcp}=\frac{p_{thumb}+p_{vf}}{2}$,宽度 $w=\|p_{thumb}-p_{vf}\|$。构建正交系 R=[x y z]:z 沿颚线、y 为颚面法向、x=接近轴,用 s=±1 保证左右手一致。用 Savitzky-Golay 滤波位置、高斯加权 SLERP 朝向做时间平滑。速度对齐:ANT/EgoDex 降至 60%、EgoVerse 45%、ViTRA 25%。步骤 2 视觉对齐:SAM 3 分割人臂→ProPainter 时序修复擦除→网格搜索+MuJoCo IK 找基座→帧帧 IK 渲染→深度感知合成 $I_{final}=I_{robot}$ 当 $D_{robot}<D_{scene}$。步骤 3 质量筛选:L1(IK失败/自碰撞/异常)、L2(极端值/突变/无效帧比过高)、L3(VLM 审计语义一致性)。每样本含机器人合成帧+相机系 EEF 动作+相机参数+文本指令。

技术新颖性

技术新颖性体现在三点。第一,首创"基座位姿搜索"优化——此前 retargeting 工作假设已知源基座,而 ego 视频本体无关,作者用关键帧 + IK 可行性最大化的网格搜索填补这一空白,对 15 种本体各自独立搜索以匹配不同臂长与关节配置。第二,规模突破——从先前单任务小规模研究扩展到 18561 小时 × 15 本体,约 9.6× 放大,是迄今最大 ego-to-robot 数据集;相机系相对 EEF 动作表示避免逐视频标定、自然统一多源多本体数据。第三,解耦评估协议——扩展 RoboTwin2.0 为 11 个独立扰动设置 + EBench 7 任务,将捆绑随机化分解为视觉外观(背景/光照/机器人颜色)、场景布局(桌高±4cm/干扰物/相机偏移±5cm)、本体(UR5-WSG/ARX-X5/Franka 零样本跨本体)、任务语义(50 任务未见物体/505 改写指令)四轴,使泛化收益归因到具体因素,这是先前 Colosseum、LIBERO-Plus 等分解基准在单臂设置下未做到的粒度。

Ego2Robot pipeline. Converting egocentric video into 18,561h robot training data across 15 morphologies through action alignment, visual alignment, and quality curation.
Figure 1: Ego2Robot pipeline. Converting egocentric video into 18,561h robot training data across 15 morphologies through action alignment, visual alignment, and quality curation.
Evaluation framework. Four generalization dimensions with 12 evaluation settings.
Figure 2: Evaluation framework. Four generalization dimensions with 12 evaluation settings.

实验结果

Table 1 主结果:1:1 混合在 7 列中 5 列领先,RoboTwin Clean 达 68.1%(+5.9 over 62.2)、Randomized 53.5%(+2.6)、Visual 67.3%(+5.9)、Task 54.1%(+7.9)、EBench 49.8%(+10.2);1:3 收益微弱,3:1 和 1:1 显著。Table 2 逐项(1:1):背景 +3.7、光照 +7.6、颜色 +6.4;ARX 44→51(+7.1)、UR5 在 3:1 达 31(+11.2)、Franka 仍 <7%(kinematic gap 过大);未见物体 29→40(+10.7)、改写指令 63→69(+5.4)。EBench 3:1 最佳(51.7,+12.1)。Figure 3 消融:原始 ego 共训仅 28.1%,经流水线单本体提升至 31.7%(+3.6),15 本体达 33.5,加原始 ego 达 37.3%。Figure 4 真实机器人:Mix+Ego2R Play 在 5 任务全胜,Put Blocks +14、Insert Screw +13。

Main results. Success rates (%) on RoboTwin2.0 and EBench. Green = gain >5% vs. Robot-only.
Table 1: Main results. Success rates (%) on RoboTwin2.0 and EBench. Green = gain >5% vs. Robot-only.
Per-perturbation breakdown. Change vs. Robot-only. Green = gain >5%.
Table 2: Per-perturbation breakdown. Change vs. Robot-only. Green = gain >5%.
Pipeline value and embodiment scaling. Success rate on RoboTwin Randomized.
Figure 3: Pipeline value and embodiment scaling. Success rate on RoboTwin Randomized.
Real robot results. Success rates (%) on five tasks on the ARX ACone platform.
Figure 4: Real robot results. Success rates (%) on five tasks on the ARX ACone platform.
Real robot rollouts. Key frames from five evaluation tasks on the ARX ACone platform.
Figure 5: Real robot rollouts. Key frames from five evaluation tasks on the ARX ACone platform.
查看结构化数据
任务指标本文基线提升
RoboTwin2.0 Clean(50 任务清洁设置) 成功率 (%) Ego2R+Robot 1:1 达 68.1% Robot-only 62.2% +5.9
RoboTwin2.0 Randomized(捆绑随机扰动) 成功率 (%) Ego2R+Robot 1:1 达 53.5% Robot-only 50.9% +2.6
视觉外观(背景/光照/机器人颜色) 成功率 (%) 1:1 分别 70.3/65.8/65.8 Robot-only 66.6/58.2/59.4 +3.7/+7.6/+6.4
本体迁移(ARX 跨本体) 成功率 (%) 1:1 达 51.2 Robot-only 44.1 +7.1
EBench(7 精密桌面任务,高挂相机) 成功率 (%) Ego2R+Robot 3:1 达 51.7% Robot-only 39.6% +12.1
真实机器人(ARX ACone,Put Blocks 任务) 成功率 (%) Mix+Ego2R Play Robot-only 预训练 +14

局限与改进

作者承认三点:(1) retargeting 把手部映射为平行夹爪,丢失精细手指关节,扩展到灵巧多指手可扩大可迁移技能范围;(2) 视觉对齐依赖修复和深度合成,重遮挡或复杂光照下可能引入伪影,用生成式模型可进一步减小域差;(3) 评估局限于 RoboTwin2.0 任务范围,扩展到更广任务和本体配置可增强通用性。我的额外观察:Franka 跨本体始终 <7%,说明相机系动作表示不能完全弥补大 kinematic gap;18561 小时虽大但全部由 1940 小时 ego 经 9.6× 放大,同轨迹多本体重复可能引入冗余而非独立多样性,实际"等效信息量"可能高估;真实机器人仅 5 任务、每任务 20 演示,统计显著性有限;缺少与最新更大规模真实数据集直接对比;流水线对 WiLoR/SAM 3/ProPainter/Qwen3.5 等多个组件质量敏感,任一环节失败会级联影响最终数据质量。

独立分析的弱点

弱点 1 本体迁移不均衡——UR5 在 3:1 达 31% 但 Franka 始终 <7%,因 kinematic gap 过大,相机系动作表示无法完全补偿,改进方向是引入本体条件嵌入或分层迁移策略。弱点 2 数据放大冗余——18561h 由 1940h×9.6× 放大,同轨迹多本体重复,多样性可能高估,可引入本体特异化采样或轨迹增强去冗余。弱点 3 评估闭环不全——解耦评估虽好但仅 RoboTwin2.0+EBench 仿真,缺真实世界四轴扰动验证,可构建真实解耦基准。弱点 4 手部精细化丢失——平行夹爪假设丢弃手指关节,对精细操作(捏取、旋转)不利,可引入混合夹爪或多指手 retargeting。弱点 5 修复伪影——重遮挡下 ProPainter+深度合成可能出错污染训练信号,可用扩散模型生成式渲染替代。弱点 6 算力门槛——8 GPU×20 万步对多数实验室不友好,需更高效训练或蒸馏方案。

未来方向

作者明确提出三方向:(1) 扩展到灵巧多指手,保留手指关节信息;(2) 用生成式模型提升渲染保真度减小视觉域差;(3) 扩展到更广任务和本体配置以增强通用性。基于成果可延伸:(1) 将 ego2robot 思路推广到全身动作(腿式、移动操作),处理步态和全身动力学,覆盖更广操作空间;(2) 解耦评估协议可成为 VLA 评测新标准,推动社区做更精细归因和针对性改进;(3) 流水线可闭环优化——用 VLM 审计反馈迭代改进 retargeting 和渲染参数;(4) 探索在线学习:部署时即时采集 ego 视频并合成训练数据,实现持续适应与个性化;(5) 结合仿真大规模增强与 ego 视频缩小 sim-to-real gap;(6) 引入本体条件化或分层策略,针对性解决大 kinematic gap 本体(如 Franka)的迁移难题。

复现评估

复现评估:作者提供项目页 https://www-ye.github.io/ego2robot_blog/,但未明确是否开源完整代码与 18561h 数据。算力要求高——预训练用 8 GPU、batch 12/GPU、20 万步、bf16,约处理 1920 万帧,对多数实验室不友好。依赖多个外部组件(WiLoR、DynHaMR 手姿估计、SAM 3 分割、ProPainter 修复、MuJoCo IK、Qwen3.5 切分/审计),需逐一部署,工程复杂度高。评估需 RoboTwin2.0 仿真(双臂)和 EBench(Isaac Sim),真实机器人验证需 ARX ACone 平台。数据来源中 ANT 为自研 in-house(仅 7h),EgoDex(732h)/ViTRA(249h)/EgoVerse(954h) 需各自获取授权。公式和参数(关键帧选取、网格搜索范围、速度降采样比例)描述详尽,技术路线清晰,但端到端工程量大、算力门槛高、部分数据/平台依赖外部获取,整体判定为中等偏难复现。