HiFi-UMI:仅凭高保真手持采集数据学习可部署的机器人操作策略 HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
用高保真手持采集替代遥操作,实现零机器人数据的策略训练与直接部署
前置知识
UMI(Universal Manipulation Interface,通用操作接口)
一种手持式、装有传感器的夹爪,让人在没有机器人参与的情况下,直接用自己的手在自然场景中采集操作演示。夹爪上通常带相机和 IMU,通过视觉-惯性 SLAM 估计末端执行器轨迹,从而获得「可被机器人执行」的动作标签,但成本远低于真机遥操作。
本文的核心命题就是「把 UMI 数据的保真度提得多高,才能彻底摆脱遥操作数据」,不懂 UMI 的基本原理和现有缺陷,就无法理解作者为什么要做这一系列硬件改造。
VLA 与 WAM 两种底层策略范式
VLA(Vision-Language-Action)是纯反应式策略,把当前观测和语言指令直接映射为动作。WAM(World-Action Model)在生成动作之外还显式预测未来视觉状态(未来视频潜在表示),再通过逆动力学模型从「想象出来的未来」解码出动作。两者都是当前操作基础模型的主流路线。
论文在三个 backbones(StarVLA-QwenPI、OpenPI-π0.5 两个 VLA,LingBot-VA 一个 WAM)上验证结论,跨范式一致才能说明结论源于数据而非某一种架构。
Flow Matching(流匹配)动作头
一种连续动作生成方法。给定真实动作块 $a$ 和高斯噪声 $\epsilon\sim\mathcal{N}(0,I)$,构造插值样本 $x_t=(1-t)a+t\epsilon$,训练网络预测从噪声到数据的速度场 $v_\theta(x_t,t)$,损失为 $\mathcal{L}=\mathbb{E}\|v_\theta-(\epsilon-a)\|^2$;推理时用若干步 Euler 积分从纯噪声采样出动作块。
三个 backbone 都用流匹配作为连续动作生成头,理解它的训练目标才能看懂预训练阶段的幂律拟合和动作误差度量。
Stereo-Inertial SLAM 与回环闭合
立体相机加 IMU 联合估计自身位姿的同时建图。回环闭合(loop closure)利用「重新经过旧位置」来消除累积漂移,但前提是世界是静态的;操作任务中场景不断被改变,会破坏这一假设,所以本文特意放弃全局回环,改用局部一致性约束。
理解为什么作者采用「头戴离线立体 SLAM + 主动放弃全局回环 + 局部滑窗约束」,才能体会 3mm 精度和厘米级全局漂移是如何同时被保证的。
遥操作与「真机锚点」(real-robot anchor)
遥操作指人通过主控设备实时控制目标机器人录制演示,得到完美契合机器人本体的轨迹。社区惯例是把机器人无关数据用于大规模预训练,再在任务相关的少量遥操作数据上做后训练,这部分遥操作数据被称为「锚点」,负责把策略落地到具体机器人。
本文要挑战的正是「后训练必须有遥操作锚点」这一惯例,提出 zero-robot post-training 假设。
研究动机
学习可部署的操作策略,瓶颈不在模型容量而在数据。当前主流的真机遥操作虽然轨迹完美契合机器人本体、可直接训练,但扩展成本极高:AgiBot World 在专门的 4000 m² 场地用 100 台双臂人形机器人采集了 2976 小时数据,RoboMIND 跨四种本体采集 305 小时、每种本体都要单独搭一套遥操作硬件。为降低成本,社区转向更便宜的机器人无关数据源,其中 UMI 最突出——一个手持夹爪就能在野外采集演示,成本只有遥操作的零头。但现有手持采集有一系列保真度缺陷:位姿靠在线视觉(-惯性) SLAM 恢复,长时序会漂移、低纹理或运动模糊时会失败;双夹爪之间的相对位姿要靠跨相机共视事后重建,恰恰在最需要精度的协调任务上引入误差;传感器流用软件或无线对齐而非硬件触发;每只手只有一个 155° 鱼眼腕相机,存在盲区和深度线索不足。这些缺陷导致一个普遍现象:机器人无关数据几乎只被当作预训练用,后训练(把策略真正落到部署)仍默认需要遥操作数据。哪怕是最近最激进的方案也没有打破这一分工:ActiveUMI 和 XRZero-G0 把真机比例压到很小但仍非零,RDT2 做到零样本跨本体但部署到具体机械臂时仍要混入少量真机数据。VISTA 用纯手持数据后训练部署成功,但它所有基线都在同一手持数据上训练,并未直接和遥操作对比。
本文的目标是作者要回答一个被悬置的问题:后训练到底是真的需要真机数据,还是仅仅因为迄今为止机器人无关数据的保真度不够高?他们提出一个刻意强硬的假设——zero-robot post-training(零机器人后训练):只要机器人无关数据保真度足够高,仅用它在后训练阶段就能得到可直接部署到真机的策略,而完全不需要任何遥操作真机数据。注意这不是去调「真机/机器人无关」的混合比例,而是把保真度本身作为设计变量提上去,从而彻底移除锚点。为此他们要构建一套端到端为保真度、可重放性和自动策展而设计的便携式数据生产系统 HiFi-UMI,把它做到「轨迹精度、双夹爪相对位姿、时间同步都和遥操作一样可信」。附加目标是验证同一份高保真数据是否还能支撑大规模预训练,进一步抬升后训练的数据效率和上限。
与已有工作不同的是,本文的独特切入角度是「升保真度」而非「降真机比例」。和现有 UMI 系系统相比,作者把保真度作为设计原则贯穿硬件和软件协同:用头戴离线立体-惯性 SLAM 取代易漂移的腕部在线 SLAM;让两个夹爪的标志物立方体同时被头戴相机观测,从而原生测得双夹爪相对位姿而非事后重建;用单一共享 GPIO 硬件触发把所有相机、IMU、编码器对齐到微秒级,而非软件对齐;每只手装两片非平行广角鱼眼覆盖约 200°,而非单 155°。更重要的是,作者第一次把「机器人无关后训练」和「同机器人上的遥操作后训练」在同一机器人、同一部署栈、同一评测协议下直接对峙(此前没有任何手持系统这么做),并把 backbone、初始化、配方固定只换数据源,从而把「数据源」这一单一干预施加到三个不同范式上,用三者的收敛一致性来证明结论是关于数据的、而非关于某个架构的。
核心方法
直觉上,作者把「数据」当作一个系统设计问题而非收集问题:与其等采完再用昂贵的人工审查筛掉坏样本,不如从源头就把保真度焊死。整体技术路线分三层。第一层是穿戴式采集设备 HiFi-UMI Capture,围绕四个需求设计:精确且可扩展的位姿获取、面向操作的夹爪形态、广覆盖多模态感知、在线质量控制。头戴立体相机加 IMU 跑离线立体-惯性 SLAM 给出全局相机轨迹,每只手通过刚性固定的标志物立方体被同一头戴相机定位,把全局头部位姿与两手相对头部的位姿复合,就得到两只手全局一致的轨迹;夹爪采用非对称双指全掌手套形态,更贴近人手自然力分布和接触几何;每只手两片非平行鱼眼覆盖约 200°,配合头戴立体共六相机;所有传感器由统一 GPIO 外触发实现微秒级同步;录制时实时检测过曝、运动模糊、操作过快、手离开视野等失败模式并语音提示操作员纠正。第二层是数据处理飞轮,六阶段:采集上传、轨迹重建与自动清洗、仿真重定向、AI 辅助标注、人工校验、数据分析导出;每阶段都既过滤无效数据又给有效数据加结构化元数据,最终累积可用率约 96%(重建 98% × 重放 98%)。第三层是策略训练与部署,三个 backbone 共享同一物理动作语义(chunk 锚定的相对位姿增量加绝对夹爪开度),但各自保留原生张量化、归一化和时间采样。
核心创新点是把「双夹爪相对位姿」从「事后跨相机重建」变成「头戴相机原生测量」。在 UMI 体系里,双臂协调任务(如折衣服、双手对插)最依赖两夹爪之间的精确相对关系,而过去两只手各自跟踪、再靠跨相机共视拼接相对位姿,误差恰好堆积在最需要精度的地方。HiFi-UMI 让两只手上的标志物立方体同时出现在同一个头戴相机帧里,于是相对位姿和每个夹爪各自的世界位姿一起被原生测出,精度一致;又因为头部运动远小于手部运动,头部锚定的相对跟踪大幅降低累积漂移。另一个本质区别是「离线 SLAM + 主动放弃全局回环」:离线优化能利用未来观测降低漂移,但操作任务不断改变场景、违反回环闭合的静态世界假设,所以作者改用动态滑窗上的局部一致性约束,在厘米级长时全局漂移的同时保住毫米级局部精度。再加上共享 GPIO 把毫秒级软件对齐升级到 40μs 以内的硬件对齐,整套系统首次让机器人无关数据在「轨迹、相对位姿、时间」三个维度都达到与遥操作可比的可信度。
方法步骤详情
完整流程分采集与处理两部分。采集时多传感器由共享 GPIO 硬件触发同步,设备在线检测过曝/运动模糊/操作过快/手离开视野并语音告警,操作员可实时标记子任务边界,数据经 Wi-Fi 实时流到云端。处理飞轮六阶段:①采集上传。②轨迹重建与自动清洗——用离线立体-惯性 SLAM 重建头部轨迹,再在头戴相机里检测两手标志物立方体恢复双手轨迹(输入六路同步视频+IMU+编码器,输出双臂全局 SE(3) 轨迹);刻意不做全局回环,改用动态滑窗局部一致性约束;对 SLAM 偶发失败自动重算并标注残余异常,保留约 98% 轨迹。③仿真重定向——用面向目标本体的全身运动控制算法在仿真中重放每条轨迹,丢弃不可行者,约 98% 通过,累积可用率 ≈96%。④AI 辅助标注——联合推理头戴与手部视角,输出任务/子任务语言描述、时间段边界、被操作物体、候选异常事件并附置信度。⑤人工校验——聚焦自动质检标记和低置信样本,校验语言-视觉一致性与边界准确性。⑥数据分析导出——按任务/场景/物体/动作模式统计分布并据此平衡比例,导出含同步多视角视频、校准双臂轨迹、夹爪状态、语言标注、子任务边界的训练就绪 episode。训练时把 UMI 轨迹转成机器人末端执行器动作约定:相对当前观测位姿的增量 $\Delta T_{j,t_0,h}=T_{j,t_0}^{-1}T_{j,t_0+\delta h}$(姿态用 Rotation6D,夹爪绝对值),每臂 10 通道、双臂共 20 通道;不同 backbone 各自填入原生张量(StarVLA 20 维、OpenPI 32 维、LingBot 30 维)。部署时 VLA 用带时间戳 receding-horizon 控制按 $t_{obs}=t_{now}-\max_s\tau_s^{obs}$ 对齐传感器流;WAM 走 LingBot 块因果流式协议,重置后首调用生成 12 个动作、之后每次预测含 24 动作的两块。
技术新颖性
技术新颖性体现在三个层面。硬件层:第一次把头戴离线立体-惯性 SLAM、原生双夹爪相对位姿测量、共享 GPIO 微秒级同步、~200° 超广角双相机四者同时集成到一个便携、无需外部基站、低成本的手持系统里(见表 1,UMI 是 ~6mm/软件对齐/155°,ActiveUMI/XRZero-G0 是 ~4mm/软件对齐,FastUMI Pro ~3mm 但需基站,HiFi-UMI 是 ~3mm/μs/200°/全掌手套/High 便携)。软件层:基于「操作任务违反静态世界假设」这一观察,刻意放弃全局回环、改用局部滑窗约束,用 98%×98%≈96% 的两道串联门(重建+重放)替代单点审查;并用多视角联合推理做 AI 辅助标注以解遮挡歧义。方法论层:第一次在同一机器人、同一部署栈、同一冻结评测协议下,把机器人无关后训练和遥操作后训练直接对峙,并设计为「单一干预施加三次」(三个 backbone),用范式间的收敛一致性把结论归因到数据而非架构;同时把 4,000 小时预训练的迁移结构解析成「取决于交互动力学覆盖、而非物体是否见过」,给出可操作的数据采集优先级。
实验结果
核心发现在三条评测线上一致成立。第一,zero-robot post-training 成立。在 StarVLA-QwenPI、OpenPI-π0.5、LingBot-VA 三个 backbone 上,纯 HiFi-UMI 后训练与同机器人真机遥操作后训练的聚合成功率差为 −2.5、+3.1、−0.6 个百分点,符号不一致且都在采样噪声内,最强策略 OpenPI-π0.5 在精密插入任务(Remote Insertion)上达 85%。这个对比对 UMI 是保守的:遥操作数据就在评测场景里采,而没有任何一条 HiFi-UMI 轨迹在评测场景里采(场景级分布漂移),且 UMI 用了约 10 倍于遥操作的轨迹数(每任务 3200 vs 300)。具体到 VLA:StarVLA-QwenPI 上 UMI 51.3%(82/160)vs 遥操作 53.8%(86/160),OpenPI-π0.5 上 UMI 77.5%(124/160)vs 遥操作 74.4%(119/160),四个任务(Stain Wiping、Shirt Folding、Remote Insertion、Produce Sorting)方向各异。WAM 上 LingBot-VA 聚合 56.9%(91/160)vs 遥操作 57.5%(92/160);UMI 后训练策略运动幅度更大、更连续自然,但 Remote Insertion 上因重抓恢复弱而略低(42.5% vs 50.0%)。第二,数据量规律。在 Remote Insertion 上做 OpenPI 缩放实验,成功率从 400 条的 37.5% 跃到 800 条的 65.0%,再到 1600 条 70.0%、3200 条 85.0%,之后饱和(6400 条 82.5%)。第三,大规模预训练有效。在 4000 小时多任务 UMI 上预训练 StarVLA-QwenPI(一遍对应 18 万步),保持集动作误差下降 61%,符合幂律 $L_{heldout}(S)=L_\infty+AS^{-\alpha}$,拟合 $\alpha=0.268$、$R^2=0.993$;在 10 个未见任务上 OOD 误差下降 41%,每个任务都改善(餐具/桌面器物最快 $\alpha=0.134$,颗粒转移居中,布料折叠最慢);后训练时仅用 800 条任务数据就超过用 4 倍数据从零初始化的基线,聚合成功率提升 18.1 个百分点(51.3%→69.4%),即用 1/4 的任务数据达到 scratch 基线水平。迁移结构取决于预训练是否覆盖了该任务所需的交互动力学,而非物体是否见过。整套评测共 960 次真机 rollout,每个任务-策略对 40 次,双评估员职责分离、冻结基准、随机化策略顺序、记录终止原因。WAM 的真值视频 oracle 诊断显示,UMI→Real 的 12 步 XYZ RMSE 为 24.33mm、相邻帧 SO(3) 误差 0.65°,相对真随机参考(117.57mm、126.47°)误差降低 79.3% 和 99.5%,与 Real→Real(21.64mm、0.46°)相当,说明位姿解码跨域稳定。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| StarVLA-QwenPI 四任务聚合真机成功率(Remote Insertion 最强单任务 52.5%) | 成功率(160 rollout) | 51.3%(UMI 后训练) | 53.8%(遥操作后训练) | −2.5 个百分点,在采样噪声内持平 |
| OpenPI-π0.5 四任务聚合真机成功率(Remote Insertion 85%) | 成功率(160 rollout) | 77.5%(UMI 后训练) | 74.4%(遥操作后训练) | +3.1 个百分点,UMI 略胜 |
| LingBot-VA(WAM)四任务聚合真机成功率 | 成功率(160 rollout) | 56.9%(UMI 后训练) | 57.5%(遥操作后训练) | −0.6 个百分点,持平 |
| StarVLA-QwenPI 后训练初始化对比(四任务聚合) | 成功率(160 rollout) | 69.4%(UMI 预训练初始化) | 51.3%(Qwen-VL 随机动作头初始化) | +18.1 个百分点;800 条任务数据即超 4 倍数据的 scratch 基线 |
| 10 个未见任务的 OOD 动作预测误差 | 动作 MSE | 4000 小时预训练后 | 预训练起始 checkpoint | 平均下降 41%,每个任务都改善 |
| Remote Insertion 数据缩放(OpenPI-π0.5) | 成功率(40 rollout) | 3200 条 → 85.0% | 400 条 → 37.5% | 3200 条后饱和,6400 条 82.5% |
局限与改进
作者坦承的局限有几方面。一是评测范围:zero-robot 证据只覆盖四个桌面双臂任务、三个 backbone、场景级分布漂移,对其他任务、本体和漂移的普适性未验证;预训练证据更窄,缩放和下游增益只在 StarVLA-QwenPI 上测过。二是任务级统计分辨率有限:每任务-策略对 40 次 rollout,多成功一次就变 2.5 个百分点,几个样本就能反转小差距的方法排序,所以作者只在聚合层面下持平结论,把任务级差异当描述性而非决定性。三是保真度作为整体被验证、没有做受控消融:作者把保真度当作由轨迹精度、相对位姿、同步、视场联合实现的设计原则,没有单独退化某一因素、固定样本量和场景覆盖去量化其边际贡献,因此只能证明「高保真足够」,但给不出「部署到底需要多少每一项」。四是数据效率对比不是样本匹配的:没有预训练时 UMI 后训练用的轨迹数约为遥操作基线的 10 倍,所以这是「实际数据生产管线」对比而非「单条轨迹效率」对比。从我的观察补充:作者把 HiFi-UMI 用于预训练和后训练用的是同一份语料,没有把预训练增益和「同分布后训练」这一混淆拆开;WAM 上的 Remote Insertion 暴露了 UMI 后训练「名义执行流畅但恢复鲁棒性弱」的问题,提示接触纠错和重抓行为的覆盖仍是短板;手套全掌夹爪形态虽更自然,但其与人手/真机夹爪的形态鸿沟在论文中未被量化讨论。
独立分析的弱点
第一个弱点是评测范围与任务多样性。仅四个桌面双臂任务、单一本体(Tianji Marvin M6 双七轴力控臂),难以断言结论能否泛化到单臂、移动平台、高自由度人形或非桌面场景;改进方向是扩展到十几个跨本体、跨场景任务,并引入人形本体做跨本体 zero-robot 验证。第二个弱点是统计功效有限且样本不匹配。UMI 用 ~3200 条、遥操作用 ~300 条,每对 40 rollout,几个样本就能反转小差距;改进方向是在关键持平结论上把 rollout 数提到 100+ 收紧置信区间,并补做样本匹配对比,区分「实际管线效率」与「单条轨迹信息量」。第三个弱点是保真度未做受控消融。读者无法知道 3mm 精度、原生相对位姿、μs 同步、200° 视场各贡献多少;改进方向是固定样本量与场景覆盖,分别把同步从硬件触发退化到软件对齐、视场从双相机退化到单相机、相对位姿从原生测量退化到事后重建,给出「部署所需的最低保真度规格」。第四个弱点是 WAM 在 Remote Insertion 上暴露的恢复鲁棒性不足——UMI 策略名义执行流畅但接触不良时重抓多、效率低;改进方向是刻意加重接触纠错和失败-恢复 episode 比例,并在评测中加入「重抓次数/完成时间」过程指标。第五个弱点是预训练与后训练同源,难分离「同分布后训练红利」与「视觉-运动先验」;改进方向是让预训练语料与后训练任务严格不重叠,并测试 UMI 预训练初始化对遥操作后训练是否同样有益。
未来方向
作者明确点名的未来工作包括:补做保真度的受控消融(cleanly separating fidelity from sample count and scene coverage),把「高保真有用」升级为「部署所需的保真度规格」;扩大任务、本体、backbone 覆盖以确立结论的普适性;研究预训练增益是否随语料增长继续还是饱和,以及 UMI 预训练初始化对遥操作后训练是否同样有效,从而区分「通用可复用初始化」与「同域后训练红利」。基于本文成果可延伸的方向:第一,把 OOD 任务族分析(餐具/桌面器物 $\alpha=0.134$ 最快、布料折叠 $\alpha=0.072$ 最慢)直接闭环成下一轮预训练语料的再平衡策略——给可变形物体补更多衣物拓扑、双手重抓、折叠过渡,给颗粒材料补更多容器几何与填充水平,形成数据-性能的自驱飞轮。第二,把「交互动力学覆盖决定迁移」这一发现形式化为预训练数据选择的目标函数,发展基于交互类型而非物体类别的数据策展方法。第三,把头戴立体这一采集端专用的强信号以蒸馏或辅助任务方式迁移到部署端(部署时只用四路腕视),缩小采集-部署观测鸿沟。第四,把 zero-robot post-training 思路推到更难的本体(人形全身、移动操作)和更长时程任务(多阶段、需要场景记忆的任务),检验保真度门槛是否随之抬高。第五,结合大模型自动标注与人工校验,进一步降低 96% 可用率之外那 4% 的诊断与修复成本。
复现评估
复现性总体较强。数据侧:作者开源 HiFi-UMI-2K——2000 小时、微秒级同步、可重放、超广角的子集,约 48.21 万 episode、110+ 场景,每 episode 含同步六视角视频、校准双臂轨迹、夹爪状态、语言标注、子任务边界和质控元数据,以 CC BY 4.0 许可(允许商用,需署名),人脸已打码,托管在 HuggingFace(simple-world-lab/HiFi-UMI-2K),并带版本号和每样本质控元数据可追溯到批次/设备/审查历史,使实验子集可复现。模型与代码侧:三个 backbone 中 OpenPI-π0.5 和 LingBot-VA 用公开发布的 pi05_base、lingbot-va-base 初始化,StarVLA-QwenPI 基于 Qwen3-VL-4B-Instruct + π 风格 DiT 动作头,作者给出了较详细的训练超参(AdamW,$\beta_1{=}0.9,\beta_2{=}0.95$,预训练全局 batch 2048、180k 步、峰值学习率动作头 $10^{-4}$,后训练 batch 512、50k 步、余弦衰减到 $7\times10^{-7}$,WAM batch 32、3500 步),动作表示和物理语义(chunk 锚定相对位姿 + Rotation6D + 绝对夹爪)写得很清楚。评测协议也规范:冻结任务定义/物体集/语言指令/checkpoint/初始条件库/超时/安全规则,双评估员职责分离,随机化策略顺序,40 rollout/对,共 960 次真机 rollout。复现门槛主要在算力和硬件:4000 小时预训练一遍对应 18 万步、batch 2048,估算需要相当规模的 GPU 集群;端到端复现还需自建或采购 HiFi-UMI 采集设备(六相机 + GPIO 触发 + 头戴立体 + 标志物立方体 + 全掌手套)和 Tianji Marvin M6 双臂平台。部分实现细节(仿真重定向的全身运动控制算法、AI 辅助标注模型)描述较概要,完全复刻数据生产管线需要补足工程。综合看:用开源数据复现后训练和评测是现实可行的,完整复现采集-处理-预训练全链路则工程量大、门槛高。
论文图表
全景图,三栏展示采集(3mm 轨迹精度、40μs 同步、超广六视角)、高保真数据引擎(轨迹重建和重放有效率均 >98%,累计 ~96%,已采 20000+ 小时、释放 2000+ 小时、480+ 场景)、学习与部署(VLA 和 WAM 两条 zero-robot post-training 路线 + 可扩展预训练,含 α=0.268、R²=0.993 的幂律)。
一图抓住全文三大贡献和最关键数字,是理解论文骨架和主张的最佳入口。