Ego2Robot:从第一人称人类操作视频可扩展合成机器人训练数据 Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。
前置知识
Vision-Language-Action (VLA) 模型
VLA 是一类以视觉和语言为输入、直接输出机器人动作的端到端模型,如论文所述采用 Qwen3.5-4B 作视觉语言骨干 + Diffusion Transformer 动作头。它通过大规模机器人演示预训练学习通用操作策略,预测多步动作块(本文为 32 步、8 步扩散)。
本文的全部目标就是验证 ego2robot 合成数据能否提升 VLA 的 OOD 泛化,不理解 VLA 的预训练范式就无法理解论文动机。
第一人称(Egocentric)视频
以佩戴者或操作者视角拍摄的视频,画面中人手与物体交互。本文来源包括 ANT、EgoDex(732h)、ViTRA(249h)、EgoVerse(954h),共约 1940 小时,捕捉了机器人遥操作难以企及的物体/环境/任务多样性,但不含机器人本体。
这是论文的数据来源和命名由来,理解其与机器人数据的本体鸿沟是理解转换难点的关键。
动作重定向(Retargeting)
把一种本体的运动轨迹映射到另一种本体的过程。本文把 21 个人手关键点映射为平行夹爪末端位姿,定义虚拟指尖 $p_{vf}=0.7p_{index}+0.3p_{middle}$、TCP $p_{tcp}=(p_{thumb}+p_{vf})/2$,并构建正交抓取系 R=[x y z]。
动作对齐阶段的核心操作,是 ego 视频转化为机器人动作空间的第一步,直接决定后续 IK 可行性。
逆运动学(IK)与基座位姿搜索
逆运动学给定末端位姿反解关节角。本文独特难题是 ego 轨迹本体无关、无参考基座,故建模为优化 $T^*_{base}=\arg\max \frac{1}{|K|}\sum_{k\in K}\mathbb{1}[\text{IK}(T^{-1}_{base}T^k_{ee})\text{ feasible}]$,在 MuJoCo 中网格搜索关键帧可行性最高的基座。
基座位姿搜索是论文的方法核心创新,决定了渲染机器人能否在场景中合法放置,是理解技术新颖性的关键。
解耦泛化评估(Disentangled Generalization)
现有基准把多种扰动(背景、光照、本体、指令)捆绑成单一分数,难以归因。本文扩展 RoboTwin2.0 为 11 个独立设置 + EBench,沿视觉外观、场景布局、本体形态、任务语义四轴独立测试,精确定位收益来源。
这是论文第三大贡献,也是所有实验结论的解释框架,不理解解耦评估就无法读懂 Table 2 的逐项分析。
研究动机
现有 VLA 模型(如论文引用[1-5])通过大规模机器人演示预训练取得进展,但其泛化能力根本上受限于机器人数据的规模与多样性。尽管有 Open X-Embodiment、DROID、AgibotWorld 等大规模数据集,采集机器人演示仍极其昂贵、劳动密集,且受硬件可用性、遥操作成本和有限交互多样性约束。第一人称人手操作视频提供了诱人的替代方案——手部交互可在海量物体、环境和任务变体上大规模采集,蕴含机器人难以单独获取的丰富操作先验。然而人类与机器人本体之间存在巨大鸿沟,直接把 ego 视频转换为机器人训练数据困难重重。先前工作虽在小规模上展示了 retargeting+渲染方法可产生有效的 per-task 策略,但大规模 ego2robot 合成数据能否为 VLA 提供预训练收益(尤其提升 OOD 泛化)基本未被探索。
本文的目标是本文目标是构建端到端可扩展流水线 Ego2Robot,把第一人称人类操作视频转化为特定本体的机器人训练数据,通过动作对齐、视觉对齐和多层质量筛选三个阶段。流水线处理约 1940 小时来自四个来源(ANT、EgoDex、ViTRA、EgoVerse)的标注/无标注 ego 视频,覆盖 15 种机器人本体形态,产出 18561 小时合成机器人训练数据——迄今最大的 ego-to-robot 数据集,实现约 9.6× 放大。同时构建解耦泛化评估基准,沿视觉外观、场景布局、本体形态、任务语义四个独立轴评估,精确定位 ego2robot 数据对哪种扰动最有价值。最终通过仿真和真实机器人(ARX ACone 平台,5 任务)验证联合预训练能否提升 OOD 泛化。
与已有工作不同的是,作者的独特切入角度在于核心假设:尽管本体不同,第一人称操作视频包含可迁移的交互规律,只要适当对齐就能补充机器人数据。与先前只在有限规模或单任务上研究 retarget-and-render 不同,本文把它扩展到 18561 小时×15 本体并系统评估其对 VLA 预训练和 OOD 泛化的价值。另一关键创新是解耦评估协议——现有基准(RoboTwin、LIBERO、CALVIN、RLBench 等)把多种扰动捆绑成单一聚合分数,难以把失败归因到具体因素;本文沿四轴独立测试,揭示 ego2robot 数据主要提升不变性和跨分布鲁棒性,而非单纯增加轨迹覆盖。此外采用相机系相对 EEF 动作表示,避免逐视频标定,自然统一不同来源的动作空间。
核心方法
整体思路是"对齐 + 筛选"。直觉上:ego 视频虽不含机器人,但人手抓取轨迹与机器人末端执行器轨迹在几何上存在对应关系,只要把人手转成夹爪动作、把人臂视觉替换成机器人臂,就能复用其丰富的物体/环境多样性。技术路线分三阶段:(1) 动作对齐——通过 retargeting 把 21 个人手关键点转化为平行夹爪末端轨迹,加时间平滑和速度对齐;(2) 视觉对齐——用 SAM 3 分割人臂、ProPainter 擦除人手还原背景、搜索机器人基座位姿并帧帧 IK 求解、深度感知合成渲染机器人臂;(3) 质量筛选——L1 流水线内部、L2 统计、L3 VLM 一致性三层过滤。流水线支持 Path A(带手姿标注的数据集如 ANT、EgoDex)和 Path B(无标注纯视频,先用 WiLoR 逐帧重建 + DynHaMR 时序优化估计手姿,再用 Qwen3.5 切分子任务)。两条路径在估计手姿后共享统一流程,为 15 种本体并行生成训练数据。
核心创新在于解决了 ego-to-robot 的根本挑战——机器人基座位姿确定。与 robot-to-robot 迁移不同,第一人称手轨迹是本体无关的,没有物理机器人基座可参考。作者将其建模为优化:给定 N 个目标末端位姿 $\{T^i_{ee}\}$ 和最大臂展 $r_{max}$,求解 $T^*_{base}=\arg\max_{T_{base}}\frac{1}{|K|}\sum_{k\in K}\mathbb{1}[\text{IK}(T^{-1}_{base}T^k_{ee})\text{ feasible}]$,其中 K 是覆盖轨迹空间极值(最大位移或朝向变化)的代表关键帧,IK 在 MuJoCo 中求解。通过在轨迹质心周围网格搜索候选位置、每处对全部关键帧验证 IK 可行性,选可行性率最高的基座。此搜索对 15 种本体独立进行——不同臂长和关节配置需不同基座。第二个关键决策是用相机系相对 EEF 动作表示,自然统一不同相机设置和本体,避免逐视频标定产生的不兼容动作空间。这与已有 robot-to-robot 方法(RoviAug、Mirage、OXEAugE)有本质区别。
方法步骤详情
步骤 1 动作对齐:从 21 关键点提取夹爪表示,定义虚拟指尖 $p_{vf}=0.7p_{index}+0.3p_{middle}$,TCP 点 $p_{tcp}=\frac{p_{thumb}+p_{vf}}{2}$,宽度 $w=\|p_{thumb}-p_{vf}\|$。构建正交系 R=[x y z]:z 沿颚线、y 为颚面法向、x=接近轴,用 s=±1 保证左右手一致。用 Savitzky-Golay 滤波位置、高斯加权 SLERP 朝向做时间平滑。速度对齐:ANT/EgoDex 降至 60%、EgoVerse 45%、ViTRA 25%。步骤 2 视觉对齐:SAM 3 分割人臂→ProPainter 时序修复擦除→网格搜索+MuJoCo IK 找基座→帧帧 IK 渲染→深度感知合成 $I_{final}=I_{robot}$ 当 $D_{robot}<D_{scene}$。步骤 3 质量筛选:L1(IK失败/自碰撞/异常)、L2(极端值/突变/无效帧比过高)、L3(VLM 审计语义一致性)。每样本含机器人合成帧+相机系 EEF 动作+相机参数+文本指令。
技术新颖性
技术新颖性体现在三点。第一,首创"基座位姿搜索"优化——此前 retargeting 工作假设已知源基座,而 ego 视频本体无关,作者用关键帧 + IK 可行性最大化的网格搜索填补这一空白,对 15 种本体各自独立搜索以匹配不同臂长与关节配置。第二,规模突破——从先前单任务小规模研究扩展到 18561 小时 × 15 本体,约 9.6× 放大,是迄今最大 ego-to-robot 数据集;相机系相对 EEF 动作表示避免逐视频标定、自然统一多源多本体数据。第三,解耦评估协议——扩展 RoboTwin2.0 为 11 个独立扰动设置 + EBench 7 任务,将捆绑随机化分解为视觉外观(背景/光照/机器人颜色)、场景布局(桌高±4cm/干扰物/相机偏移±5cm)、本体(UR5-WSG/ARX-X5/Franka 零样本跨本体)、任务语义(50 任务未见物体/505 改写指令)四轴,使泛化收益归因到具体因素,这是先前 Colosseum、LIBERO-Plus 等分解基准在单臂设置下未做到的粒度。
实验结果
Table 1 主结果:1:1 混合在 7 列中 5 列领先,RoboTwin Clean 达 68.1%(+5.9 over 62.2)、Randomized 53.5%(+2.6)、Visual 67.3%(+5.9)、Task 54.1%(+7.9)、EBench 49.8%(+10.2);1:3 收益微弱,3:1 和 1:1 显著。Table 2 逐项(1:1):背景 +3.7、光照 +7.6、颜色 +6.4;ARX 44→51(+7.1)、UR5 在 3:1 达 31(+11.2)、Franka 仍 <7%(kinematic gap 过大);未见物体 29→40(+10.7)、改写指令 63→69(+5.4)。EBench 3:1 最佳(51.7,+12.1)。Figure 3 消融:原始 ego 共训仅 28.1%,经流水线单本体提升至 31.7%(+3.6),15 本体达 33.5,加原始 ego 达 37.3%。Figure 4 真实机器人:Mix+Ego2R Play 在 5 任务全胜,Put Blocks +14、Insert Screw +13。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RoboTwin2.0 Clean(50 任务清洁设置) | 成功率 (%) | Ego2R+Robot 1:1 达 68.1% | Robot-only 62.2% | +5.9 |
| RoboTwin2.0 Randomized(捆绑随机扰动) | 成功率 (%) | Ego2R+Robot 1:1 达 53.5% | Robot-only 50.9% | +2.6 |
| 视觉外观(背景/光照/机器人颜色) | 成功率 (%) | 1:1 分别 70.3/65.8/65.8 | Robot-only 66.6/58.2/59.4 | +3.7/+7.6/+6.4 |
| 本体迁移(ARX 跨本体) | 成功率 (%) | 1:1 达 51.2 | Robot-only 44.1 | +7.1 |
| EBench(7 精密桌面任务,高挂相机) | 成功率 (%) | Ego2R+Robot 3:1 达 51.7% | Robot-only 39.6% | +12.1 |
| 真实机器人(ARX ACone,Put Blocks 任务) | 成功率 (%) | Mix+Ego2R Play | Robot-only 预训练 | +14 |
局限与改进
作者承认三点:(1) retargeting 把手部映射为平行夹爪,丢失精细手指关节,扩展到灵巧多指手可扩大可迁移技能范围;(2) 视觉对齐依赖修复和深度合成,重遮挡或复杂光照下可能引入伪影,用生成式模型可进一步减小域差;(3) 评估局限于 RoboTwin2.0 任务范围,扩展到更广任务和本体配置可增强通用性。我的额外观察:Franka 跨本体始终 <7%,说明相机系动作表示不能完全弥补大 kinematic gap;18561 小时虽大但全部由 1940 小时 ego 经 9.6× 放大,同轨迹多本体重复可能引入冗余而非独立多样性,实际"等效信息量"可能高估;真实机器人仅 5 任务、每任务 20 演示,统计显著性有限;缺少与最新更大规模真实数据集直接对比;流水线对 WiLoR/SAM 3/ProPainter/Qwen3.5 等多个组件质量敏感,任一环节失败会级联影响最终数据质量。
独立分析的弱点
弱点 1 本体迁移不均衡——UR5 在 3:1 达 31% 但 Franka 始终 <7%,因 kinematic gap 过大,相机系动作表示无法完全补偿,改进方向是引入本体条件嵌入或分层迁移策略。弱点 2 数据放大冗余——18561h 由 1940h×9.6× 放大,同轨迹多本体重复,多样性可能高估,可引入本体特异化采样或轨迹增强去冗余。弱点 3 评估闭环不全——解耦评估虽好但仅 RoboTwin2.0+EBench 仿真,缺真实世界四轴扰动验证,可构建真实解耦基准。弱点 4 手部精细化丢失——平行夹爪假设丢弃手指关节,对精细操作(捏取、旋转)不利,可引入混合夹爪或多指手 retargeting。弱点 5 修复伪影——重遮挡下 ProPainter+深度合成可能出错污染训练信号,可用扩散模型生成式渲染替代。弱点 6 算力门槛——8 GPU×20 万步对多数实验室不友好,需更高效训练或蒸馏方案。
未来方向
作者明确提出三方向:(1) 扩展到灵巧多指手,保留手指关节信息;(2) 用生成式模型提升渲染保真度减小视觉域差;(3) 扩展到更广任务和本体配置以增强通用性。基于成果可延伸:(1) 将 ego2robot 思路推广到全身动作(腿式、移动操作),处理步态和全身动力学,覆盖更广操作空间;(2) 解耦评估协议可成为 VLA 评测新标准,推动社区做更精细归因和针对性改进;(3) 流水线可闭环优化——用 VLM 审计反馈迭代改进 retargeting 和渲染参数;(4) 探索在线学习:部署时即时采集 ego 视频并合成训练数据,实现持续适应与个性化;(5) 结合仿真大规模增强与 ego 视频缩小 sim-to-real gap;(6) 引入本体条件化或分层策略,针对性解决大 kinematic gap 本体(如 Franka)的迁移难题。
复现评估
复现评估:作者提供项目页 https://www-ye.github.io/ego2robot_blog/,但未明确是否开源完整代码与 18561h 数据。算力要求高——预训练用 8 GPU、batch 12/GPU、20 万步、bf16,约处理 1920 万帧,对多数实验室不友好。依赖多个外部组件(WiLoR、DynHaMR 手姿估计、SAM 3 分割、ProPainter 修复、MuJoCo IK、Qwen3.5 切分/审计),需逐一部署,工程复杂度高。评估需 RoboTwin2.0 仿真(双臂)和 EBench(Isaac Sim),真实机器人验证需 ARX ACone 平台。数据来源中 ANT 为自研 in-house(仅 7h),EgoDex(732h)/ViTRA(249h)/EgoVerse(954h) 需各自获取授权。公式和参数(关键帧选取、网格搜索范围、速度降采样比例)描述详尽,技术路线清晰,但端到端工程量大、算力门槛高、部分数据/平台依赖外部获取,整体判定为中等偏难复现。
论文图表