← 返回 2026-09-09

CosmoH2G:面向复杂空间运动物体操作的手到夹爪迁移数据集与基线方法 CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements

Hongxiang Zhao, Mutian Xu, Zeyu Jin, Yiming Hao, Shuguang Cui, Xiaoguang Han 📅 2026-09-07 👍 31 2026-09-12 18:30
人-机器人迁移 扩散模型 数据集 机器人操作 模仿学习

用手持夹爪采集手-爪配对数据,两阶段扩散框架实现复杂空间操作迁移

前置知识

UMI(Universal Manipulation Interface)

一种手持式数据采集夹爪装置,操作者握持夹爪模仿人手动作完成任务,夹爪自身搭载相机记录第一视角视频。它无需真实机器人参与即可低成本、大规模地采集机器人风格的演示数据,本文用它在固定机位深度相机下录制与人手视频逐任务配对的夹爪操作视频。

这是理解本文数据集如何构建的前提:作者用 UMI 让夹爪无缝模仿人手动作,从而天然获得动作级配对数据,是整条数据管线的基石。

6-DoF 位姿与 SE(3)

6 自由度位姿同时描述物体或夹爪在三维空间中的位置(平移 3 维)与朝向(旋转 3 维),数学上属于特殊欧氏群 $SE(3)$,常以齐次变换矩阵或四元数加平移表示。机器人末端执行器的一段动作本质上就是一连串随时间变化的 6-DoF 位姿。

本文用夹爪三个关键点对 $SE(3)$ 位姿重新参数化,两阶段的生成目标与损失函数都建立在这一表示上,不懂它就读不懂方法核心。

扩散模型与 DiT

扩散模型通过逐步给数据加噪、再学习逆向去噪来生成数据,DDPM 使用 $T=1000$ 步的加噪调度(本文为余弦调度),推理时做多步去噪得到干净样本。DiT(Denoising Transformer)将 Transformer 骨干引入扩散框架,本文两阶段生成器均为条件 DiT,以 MSE 为训练目标。

Stage I 与 Stage II 都是基于 DiT 的去噪生成器,损失公式与 500 步 DDPM 推理流程均依赖此概念。

接触图(contact map)

一种逐点标注,指示物体表面哪些区域被手或夹爪接触/抓握。本文将其作为可选的逐点特征通道拼接到物体点云特征中,为抓取位置提供粗粒度几何线索。作者刻意只需粗略接触区域而非精确到手指级别的接触,以容忍现成手部估计器的手指级误差。

接触图是两阶段模型的共同输入条件,位置优化中的接触对齐先验也源于它;消融显示去掉后 GOA 从 7.53° 升至 9.58°。

逆运动学(IK)

给定末端执行器目标位姿,求解机械臂各关节角度使其到达该位姿的过程。由于关节极限、可达空间与奇异位形等约束,通常在目标位姿附近做带正则项的优化求解,惩罚末端残差与关节越限,并让解尽量贴近初始猜测。

本文位置序列优化的第三步用 IK 保证生成的平移轨迹在真实机械臂上运动学可行,是仿真动作能落到真机执行的关键一环。

研究动机

让机器人从人类演示中学习是低成本获取操作数据的重要途径,但已有方法几乎都被限制在简单平面任务上:Robosuite、MimicPlay、RT-1 等主流真机数据集以推、滑动、拿放等平移动作为主,几乎不涉及重新定向。要处理带旋转、翻转的复杂空间任务,现有两条路线都会失效。其一是基于规则的姿态重定向(如 Phantom 假设拇指与食指中点即抓取点),人手与二指夹爪形态差异在大幅旋转时被急剧放大,常直接抓不住物体;其二是轨迹条件化方法(Im2Flow2Act、Track2Act、3DFlowAction),它们依赖点跟踪提取物体轨迹,而大幅旋转造成的严重遮挡会让 CoTracker 等跟踪器漂移到瓶颈处,提取的运动流完全不可靠。即便是构建配对数据的 Human2Robot 也依赖繁琐的遥操作采集,演示局限于干净环境中的简单任务,难以泛化到真实野外演示。

本文的目标是本文的目标是让机器人仅凭一段单目 RGB-D 人手操作视频(深度可来自实测或模型预测),就能复现包含平面内旋转、竖直翻转等复杂空间运动的抓取-放置任务,并对从未见过的物体保持泛化。为此作者做了两件事:其一,建立可规模化的手-夹爪配对数据采集管线,用 UMI 手持夹爪无缝模仿人手,采集了 6,189 条演示、覆盖 1,254 个独特物体的数据集,其朝向变化幅度显著超过现有基准;其二,提出纯数据驱动的两阶段基线方法 CosmoH2G,从配对数据中隐式学习人手到夹爪的迁移映射,在仿真(GalaxeaManipSim + R1 Lite)与真机(Galaxea R1 Lite)上均稳定优于优化式与学习式基线。数据集、管线与算法均承诺开源。

与已有工作不同的是,本文的独特切入体现在两个范式转变。第一,从手工规则到数据驱动:不再用人工设计的运动学启发式把人手关键点映射到夹爪(这类规则在形态差异大时如图 4 所示必然失败),而是让模型从大规模配对数据中隐式学习人手与夹爪间的复杂对应关系。第二,从仅用轨迹到手部位姿引导:物体中心的 2D/3D 轨迹要么无法感知朝向变化,要么靠 SVD 从漂移的点流恢复位姿而在复杂运动下退化,作者主张手部细粒度位姿动力学才是复杂操作不可或缺的线索,因此直接构建配对数据监督手-爪位姿映射。工程上还以解耦策略绕开端到端生成的累积漂移:朝向无简单几何启发式、交给扩散模型学习;平移存在抓取区域对齐的强先验、从手轨迹计算后再优化,兼得表达力与数值稳定性。

核心方法

整体思路分数据与方法两层。数据层:采集者分别用人手和 UMI 手持夹爪完成同一操作任务,录制固定视角配对 RGB-D 视频;协议刻意要求多样化抓握手势、在不同功能区接触物体,并包含由空间标记引导的水平旋转与竖直翻转;随后从原始视频提取统一全局坐标系下的 3D 运动数据——用 ReconViaGen 多视角重建物体网格、SAM2 预测物体掩码、Wilor 逐帧重建手部网格、FoundationPose++ 注册并全程跟踪 UMI 的 6-DoF 位姿序列,最后以 3D 轨迹相似度大于 0.9 筛选配对(均值 0.957、中位数 0.958)。方法层:Stage I 用点云编码器加去噪 Transformer 生成起始与终止两帧夹爪位姿,简化学习目标;Stage II 只生成朝向序列,平移从人手轨迹按抓取区域对齐先验初始化,再经起止帧接触/穿透优化、中间帧平滑优化、逐帧 IK 精修三步得到完整动作。训练在单张 A100 上以 AdamW、学习率 $10^{-4}$、batch 32 进行 2 万步,扩散 $T=1000$ 余弦调度、推理 500 步 DDPM。

核心创新有三处,均区别于已有方法。其一,动作的三关键点表示:不像以往用齐次变换矩阵或四元数加平移表示夹爪 $SE(3)$ 位姿,而是用夹爪中心与左右指尖三个关键点的绝对坐标,使条件(手/物点云)与生成目标共享同一三维点空间,免去跨域映射;三个点直接编码接触区域与朝向,消融中它(GOA 7.53°)明显优于矩阵表示(13.17°)与四元数表示(11.34°)。其二,两阶段分解:直接端到端生成完整位姿序列时,微小轨迹偏差会在复杂动力学下快速复合而失败,先预测稀疏关键帧再条件化生成完整序列,把 GOA 从单阶段最好的 12.36° 降到 7.53°。其三,生成朝向加优化平移的解耦:朝向缺乏简单几何启发式、是人爪形态差异的根本所在,必须从数据隐式学习;平移则依据人手与夹爪抓取区域近似对齐的先验直接计算,从机制上抑制高维位姿生成的累积漂移。

方法步骤详情

完整流程五步。第一步采集:同一物体同一任务分别录人手与 UMI 的 RGB-D 视频,任务由空间标记引导包含水平旋转与竖直翻转,不同功能区采用不同抓握手势,录后核对起止帧物体位姿一致性并剔除错配。第二步 3D 数据提取:取无遮挡首末帧注册,ReconViaGen 重建物体网格、SAM2 预测掩码、Wilor 逐帧重建手网格,FoundationPose++ 以 RGB-D 帧、网格与初始掩码全程注册跟踪 UMI,输出物体点云、手网格序列与 6-DoF 位姿序列,配对按轨迹相似度大于 0.9 过滤。第三步 Stage I:两个 Point Transformer 编码器分别从物体点云(附加接触图通道)与手点云提取 256 维特征 $f_o, f_h$,DiT 去噪生成起止帧三关键点动作,损失 $\mathcal{L}_{MSE}=\mathbb{E}\|a_0-G_{\eta_1}(a_t,t,f_o,f_h)\|_2^2$。第四步 Stage II:以指尖相对中心关键点的坐标表示朝向,逐帧编码为 token 并附加起止位姿 token,训练 $G_{\eta_2}$ 生成朝向序列。第五步推理与优化:平移从手轨迹初始化后,先优化起止帧 $\Delta x^*=\arg\min[\mathcal{L}_{contact}+\lambda_{pen}\mathcal{L}_{pen}+\lambda_{reg}\|\Delta x\|^2]$,再以平滑项加参考曲线项 $\lambda_{smooth}\mathcal{L}_{smooth}+\lambda_{ref}\mathcal{L}_{ref}$ 精修中间帧,最后逐帧 IK 最小化 $\mathcal{L}_{IK}+\lambda_{reg}\|a_i-\bar{a}_i\|^2$ 保证运动学可行。

技术新颖性

技术新颖性体现在表示、架构与数据三个层面。表示上,三关键点参数化让条件与动作同处一个点空间,且三个点直接对应夹爪接触区域与朝向,这是消融中它全面优于矩阵与四元数表示的根源。架构上,稀疏关键帧生成加条件化序列生成的两阶段设计,与生成朝向加优化平移的解耦策略相互配合:前者降低学习难度,后者利用几何先验规避高维位姿空间的优化困难与端到端漂移——消融证明端到端 Direct 变体(SR 81.72%、TOPA 13.23°)与纯几何 Computed 变体(16.83°、26.78°)都不如解耦方案(83.87%、10.27°)。数据上,这是首个聚焦复杂空间运动的手-夹爪配对数据集,采集协议显式把朝向变化范围作为设计目标,并采用只需粗粒度接触区域的接触图设计。作者还专门验证:不输入接触图时本文仍全面领先(GOA 9.58° 仍低于最强基线 Track2Act 的 10.67°),证明增益来自问题公式化本身而非额外输入信息。

Our CosmoH2G is a data-driven framework that transfers human hand motions to robot gripper actions. Given monocular RGB videos of human demonstrations — including hand rotations and object flips in cluttered scenes — it converts observed hand trajectories into executable gripper motions, supporting stable execution even for intricate spatial movements.
Fig. 1: Our CosmoH2G is a data-driven framework that transfers human hand motions to robot gripper actions. Given monocular RGB videos of human demonstrations — including hand rotations and object flips in cluttered scenes — it converts observed hand trajectories into executable gripper motions, supporting stable execution even for intricate spatial movements.
Dataset collection and processing. (L) We record paired RGB-D videos of human hand and gripper manipulation under diverse grasping poses. (R) From RGB-D videos and multi-view object captures, we extract registered 3D motion data — including object point clouds, hand meshes, and gripper actions.
Fig. 5: Dataset collection and processing. (L) We record paired RGB-D videos of human hand and gripper manipulation under diverse grasping poses. (R) From RGB-D videos and multi-view object captures, we extract registered 3D motion data — including object point clouds, hand meshes, and gripper actions.
Overview of the framework. CosmoH2G consists of a two-stage framework: (L) the model generates single-frame action conditioned on given HOI point clouds. (R) the model generates orientation sequence conditioned on object points, hand points sequence and Stage-I generation, combined with the position sequence calculated from the hand sequence.
Fig. 6: Overview of the framework. CosmoH2G consists of a two-stage framework: (L) the model generates single-frame action conditioned on given HOI point clouds. (R) the model generates orientation sequence conditioned on object points, hand points sequence and Stage-I generation, combined with the position sequence calculated from the hand sequence.

实验结果

在 40 个未见物体、186 个测试用例上,仿真与真机结论一致。仿真中:优化式基线 MimicFunc 达 GOA 19.37°、SR 56.45%、TS 0.7673、TOPA 32.47°,3DFlowAction 为 20.84°/44.62%/0.6752/29.17°;学习式基线 Im2Flow2Act 为 29.86°/57.53%/0.7835/50.27°,重训的 Track2Act 为 10.67°/77.42%/0.9015/12.48°;本文以 GOA 7.53°、SR 83.87%、TS 0.9672、TOPA 10.27° 全面最优。真机上本文 SR 70.43%、TS 0.9413、TOPA 19.34°,对 Track2Act(60.22%/0.8732/20.58°)成功率领先约 10 个百分点。消融逐一验证设计:单阶段 DiT、Diffusion Policy、ACT 最好只有 12.36°/58.60%;去掉接触图 GOA 升至 9.58°,去掉终止位姿条件 TOPA 恶化到 21.79%,说明终止位姿对放置朝向精度至关重要;动作表示中矩阵(TOPA 28.47°)与四元数(24.63°)明显落后于关键点(10.27°);Stage II 策略中纯几何计算最差(16.83°/26.78°),端到端次之,解耦方案最好。基线失败源于复杂运动下 CoTracker 跟踪漂移;真机低于仿真的原因是旋转打滑与未完全提起时的摩擦掉落。

Distribution of Object Categories in Data Collection
Table 1: Distribution of Object Categories in Data Collection
Quantitative Comparison to Baselines in Simulation and Real-World Experiments.
Table 2: Quantitative Comparison to Baselines in Simulation and Real-World Experiments.
Ablation Study: Single-Stage Versus Two-Stage (in simulation).
Table 3: Ablation Study: Single-Stage Versus Two-Stage (in simulation).
Ablation Study: Model Condition (in simulation).
Table 4: Ablation Study: Model Condition (in simulation).
Ablation Study: Representation of robot action (in simulation).
Table 5: Ablation Study: Representation of robot action (in simulation).
Ablation on Stage-II Generation Strategy (in simulation).
Table 6: Ablation on Stage-II Generation Strategy (in simulation).
Quantitative Comparison with Baselines in real-robot experiments.
Fig. 7: Quantitative Comparison with Baselines in real-robot experiments.
Quantitative Comparison with Baselines in simulation experiments.
Fig. 8: Quantitative Comparison with Baselines in simulation experiments.
查看结构化数据
任务指标本文基线提升
仿真复杂空间抓取-放置(未见 40 物体、186 用例) GOA(抓取朝向角偏差,越低越好) 7.53° Track2Act 10.67°(最强基线);MimicFunc 19.37° 较最强基线降低 3.14°(约 29%),较优化式基线降低约 12°
仿真复杂空间抓取-放置 SR(成功率) 83.87% Track2Act 77.42%;Im2Flow2Act 57.53% +6.45 个百分点(对最强基线),+26.34 个百分点(对学习式基线)
仿真复杂空间抓取-放置 TOPA(目标放置朝向角误差,越低越好) 10.27° Track2Act 12.48°;MimicFunc 32.47° 较最强基线降低 2.21°,较优化式基线降低 22.2°
真机 Galaxea R1 Lite 复杂空间抓取-放置 SR(成功率) 70.43% Track2Act 60.22%;MimicFunc 43.01% +10.21 个百分点(对最强基线),+27.42 个百分点(对优化式基线)
真机复杂空间抓取-放置 TS(轨迹相似度) 0.9413 Track2Act 0.8732;3DFlowAction 0.7936 较最强基线提升 0.0681
消融:两阶段 vs 单阶段(仿真) GOA / SR 7.53° / 83.87% 单阶段最优 Diffusion Policy 12.36° / 58.60% GOA 降低 4.83°,SR 提升 25.27 个百分点

局限与改进

作者承认的局限:框架目前是开环执行,缺乏实时误差校正与显式碰撞避障;实验限于带未见手部动作的抓取-放置任务,更广任务类型留作未来工作;真机性能低于仿真,主要因大旋转时物体打滑与未完全提起时的摩擦掉落。我的补充观察:其一,数据采集依赖固定视角 RGB-D,而方法声称面向野外人手演示泛化,推理时若深度只能靠模型预测,精度会打折扣;其二,整条管线强依赖 FoundationPose++、Wilor、SAM2、ReconViaGen 等大模型,其误差(尤其手指级接触估计)会传导进配对数据;其三,0.9 的轨迹相似度过滤阈值可能系统性剔除难以配对的更复杂样本,使数据分布偏向易于模仿的运动;其四,仅支持平行二指夹爪,向灵巧手、吸盘等其他末端的迁移未验证;其五,开环执行在更长时序任务中的误差累积没有评估,TS 指标也无法反映中途失败的恢复能力。

独立分析的弱点

独立分析的几个弱点。第一,开环执行与打滑问题互为放大:真机 SR 70.43% 相对仿真 83.87% 的落差主要来自旋转中打滑,加入腕部相机或触觉反馈做在线位姿校正应能显著收窄差距,改进方向是闭环扩散策略或基于力/触觉的重抓取触发。第二,朝向全靠学习、平移全靠几何的解耦在朝向先验明显的场景(如要求工具功能面朝上)浪费了可利用的先验,可引入朝向几何正则的混合目标。第三,配对只保留相似度大于 0.9 的样本,保留对均值高达 0.957,说明数据同质性偏高,模型对低质量、快节奏野外演示的鲁棒性存疑,可改用软对齐或样本加权训练。第四,手部网格由 Wilor 逐帧独立重建而未做时序跟踪,帧间不一致会污染接触图,可换用时序一致的手部跟踪器。第五,物体类别分布偏玩具(33.33%)与装饰品(27.88%),美妆仅 3.64%,对工业零件与柔性物体覆盖不足,制约类别外推。第六,IK 精修逐帧独立进行,可能牺牲全局平滑性,可与平滑项联合优化。

未来方向

作者提出的方向:随着配对数据规模扩大,统一的一阶段直接迁移会逐渐可行,届时可省去关键帧-序列的两阶段设计并简化流程;引入闭环反馈与碰撞感知运动规划,弥补开环执行与避障缺失;同时通过所提管线继续扩充数据集、改进架构以提升泛化。基于其成果可自然延伸的研究:其一,加入触觉与力反馈以检测并补偿旋转中的打滑,直接针对真机成功率损失的主因;其二,把框架扩展到灵巧手或多指夹爪,检验三关键点表示的可扩展性;其三,结合语言指令做任务级组合,把抓取-放置推广到更长时序的操作链;其四,利用数据集的配对性质研究跨具身表征学习,例如手-爪共享潜在空间或动作先验蒸馏;其五,在数据端引入更多任务类型(插拔、倾倒、旋拧)与更泛化的采集视角,摆脱固定机位与桌面场景的限制;其六,探索扩散模型与推理时优化的联合采样,让关键帧与序列生成一次性完成。

复现评估

复现评估:作者明确承诺数据集、采集管线与算法全部开源(项目页 cosmoh2g.github.io),而 6,189 条、1,254 物体的数据集本身就是主要贡献,公开后可大幅降低复现门槛。算力要求不高:两个 DiT 均从零训练,单张 A100、AdamW 学习率 $10^{-4}$、batch 32、2 万步即可完成,常规实验室可以负担。主要难点在数据管线:需要 UMI 夹爪与深度相机采集配对视频,串起 ReconViaGen 多视角重建、FoundationPose++ 跟踪、Wilor 手部重建、SAM2 交互式掩码等多个模型,还需人工标注起止帧并做点击式掩码校正,把规模做到六千条的采集人力成本不小;若只复现方法而不复现数据,直接用其发布的数据集即可。基线方面 Track2Act 无官方适配权重需自行重训,MimicFunc、3DFlowAction、Im2Flow2Act 均有公开实现;真机评估需要 Galaxea R1 Lite 或同类机械臂与 GalaxeaManipSim 仿真环境。综合判断复现难度中等偏上,有开源数据支撑后属于可操作范围。