ACE-Data-0:以人为中心的环境捕获即具身数据引擎 ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
把真实家庭改造成同步多模态录制棚,构建具身AI的长时程人-物交互数据引擎
前置知识
光学动作捕捉 (Optical Motion Capture)
通过布置在空间中的高速红外相机(本文用 OptiTrack PrimeX 22,60 Hz)追踪贴在被测者关节和物体上的反光标记点,从而获得亚毫米精度的刚体/骨架 6-DoF 位姿。本文用 28 台相机、41 个身体标记点重建全身体态,是整套数据的“真值基准时钟与坐标系”。
ACE 之所以能给视频配上“测量级而非估计级”的人体/物体姿态标注,全靠光学动捕作为时空参考;理解这点才能明白为什么本文标注可以“不加估计模型”地直接投影到每一帧。
第一人称 (Egocentric) vs 第三人称 (Exocentric) 视角
Egocentric 指佩戴在头部的相机(本文 ACE-Ego-Head 四目鱼眼,20 FPS)看到的画面,贴近双手但随头剧烈运动、视野截断;Exocentric 指固定的外部相机(8 路 ZED One/GoPro,30 FPS),画面稳定但手部很小易被遮挡。本文两种视角同时同步录制同一交互。
本文 benchmark 的核心对照实验就是“同一交互、同一真值、只换视角”,视角差异(自运动误差)是理解手部轨迹误差 ego≈100mm vs exo=63mm 这一关键结论的前提。
6-DoF 物体位姿与 6-DoF 轨迹
用 6 个自由度(3 平移 + 3 旋转,$\mathbf{R}\in SO(3),\ \mathbf{t}\in\mathbb{R}^3$)描述物体在统一世界系下的刚体姿态。本文先把每个可交互物体扫描或 2D 高斯泼溅重建网格,把反光标记点绑定到网格,60 Hz 输出位姿轨迹,把精确几何放进场景。
有了物体 6-DoF 真值,才能把手部接触、物体运动、视频画面三者对齐到同一物理时刻,这是模仿学习与世界模型训练最稀缺的监督信号。
手眼标定 (Hand-Eye Calibration) 与 Bundle Adjustment
当相机随佩戴者运动时,相机的真实位姿由固定在头显上的 5 个动捕标记点(刚体)测出,剩下待求的是“每个鱼眼相机相对该刚体的固定变换”,这正是经典手眼标定问题 $AX=XB$。本文先用各相机独立求解,再对 4 个变换、棋盘格位姿、每相机时间偏移做联合光束法平差精修。
理解“相机位姿是被测量而非被估计”这一设计,就能看懂为什么本文的外参重投影误差只有约 2 px、且不会漂移——这是整套数据可被任意视角投影复用的基础。
SMPL-X 与 MANO 参数化人体/人手模型
SMPL-X 是统一的全身参数化模型(含身体、手、脸),MANO 是手部专属的低维参数模型;它们用形状参数与姿态参数生成网格。本文把动捕得到的关节转写成 SMPL-X 运动参数与 MANO 序列,作为 benchmark 中人体姿态和手部姿态估计的统一输出/真值表示。
所有 baseline(22 个人体方法、8 个手势方法)都输出 SMPL-X/MANO,理解这两个模型才能读懂 PA-MPJPE、MPJPE、F@5 等评测指标到底在比什么。
研究动机
具身智能面临根本性数据瓶颈:学会在物理世界行动需要的不止观察“动作长什么样”,而是让模型同时捕获第一人称感知、全身运动、灵巧操控、物体状态、声音与触觉如何随人类追求目标协同演化,而现有数据集把这种经验按视角、模态或空间尺度切散,感知-动作闭环只能被部分观测。作者归纳三大缺口:其一,模态碎片化——大规模第一人称数据集(Ego-Exo4D 1286 小时、EPIC-Kitchens 100 小时)有自然行为却无真值运动和第三人称视角;带动捕的 HOI 数据集(GRAB、ARCTIC、OakInk2、HOT3D)姿态准确却缺第一人称,更几乎都没有音频或触觉。其二,环境不自然——带物理标注的数据集(ContactPose 2.9M 帧、DexYCB 582K 帧)几乎只在实验室采集,稀疏布局恰好抹掉了真实家庭的遮挡与物体多样性。其三,时程过短——绝大多数 HOI 片段只有几秒、只描绘孤立抓取(ARCTIC、DexYCB、H2O),而真实家务是有目标导向、跨分钟到小时、需人在场景中移动的。
本文的目标是本文要打造一套以人为中心的环境捕获数据引擎,把真实家居环境原地改造成“空间已标定、时间已同步”的录制棚,从而首次在 furnished(带家具)的真实家庭中,把第一人称视频、多视角第三人称视频、全身与手指运动、物体 6-DoF 轨迹、多通道音频和触觉信号作为统一的多感官流同步记录下来,且每个时刻都用人-物-接触的真值接地。在此基础上产出 ACE-Data-0:150 小时、17M 帧、200 个任务类别、50 名参与者在 2 个环境、共 75000 个交互片段的大规模长时程家务交互数据集,并配套一套从低层信号到场景组件再到交互估计的分层 benchmark,用以暴露当前最先进方法在接触、遮挡、自运动和长时程条件下的失效模式。
与已有工作不同的是,本文的独特切入在于把“同步的多模态接地”本身当作数据的基本单元,而非把不同来源的标注拼凑起来。具体有三点本质区别:其一,用“两个互补空间尺度”而非单一装置——桌面级(30 m²,8 台 0.3–0.5m 近距相机 + 16 台 OptiTrack)解析精细手指-物体操控,房间级(约 200 m² 整套带厨房/餐厅/客厅/卧室的公寓,8 台宽基线相机 + 12 台 OptiTrack)覆盖全身运动与分布式交互,两者共享同一套同步与标定流水线;其二,绝大部分标注是“测量”而非“估计”——人体/物体状态用动捕直接测得,每个相机都标定,接触由触觉手套直接感知,姿态投影、包围框、运动轨迹都由测得状态经几何投影得到,无估计模型介入;其三,任务设计给的是“目标级”而非“逐步脚本”指令,参与人可自由规划、犹豫、即兴,让真实行为的变异性自然进入数据。
核心方法
直觉上,ACE 的思路是:与其在实验室里追求单一尺度的极致精度,不如把实验室级的传感器搬进真实家庭,并用一套严格的时空对齐流程把十几种异构传感流绑成“同一物理事件的多面描述”。技术路线分三层:先把房间变成录制棚(桌面级 + 房间级两套配置,铺满动捕与外视角相机、佩戴头显与手套);再用“光学时钟 + 标记桥接标定”完成时间同步与空间配准,使所有流共享一个 60 Hz 的动捕时间轴和一个统一世界坐标系;最后把测得的真值状态通过几何投影自动转成每帧、每视角的标注,仅文本描述由 Gemini-3.1-pro-preview 生成并人工校对。每个 take 最终打包成可在任意视角、任意时刻自由组合输入与监督的数据单元,一小时原始数据约 1 TB。
核心创新点有三:一是“测量而非估计”的标注哲学——人体与物体姿态由 OptiTrack 直接测得(sub-mm 级),相机外参由头显上的 5 标记点刚体 60 Hz 测得(重投影误差约 2 px 且不漂移),接触由触觉手套直接感知,姿态投影/包围框/轨迹都由几何投影导出,因此即便在家具遮挡、极端视角、运动模糊这些估计器本会失效的地方,标注依然正确。二是双尺度互补配置同时满足“手指-物体接触要近距离密布传感器”和“跟随人在场景中移动要宽基线全屋覆盖”这对矛盾需求。三是“光学时钟”同步法:动捕主机显示器以纳秒级显示自己的时间(QR 码形式),外视角/第一人称相机拍摄这块“钟”,读出每帧的真实拍摄时刻,再对跨 take 的读数拟合“常数偏移 + 缓慢漂移”直线,最终残差降到毫秒级(标定阶段独立复核的时间偏移 < 4 ms,单帧以内)。
方法步骤详情
流水线分五步:①场景准备,物体放在随机但合理的位置;②参与者装备,穿戴动捕服(41 关节标记点)、ACE-Ego-Head 头显、手套,做 T-pose 把骨架注册进动捕系统;③任务说明,仅口头给目标级指令,怎么做完全由参与者决定;④录制,take 开头先做约 10 秒“看一眼时钟”动作让头显鱼眼对准显示器,随后所有传感器同步持续录制;⑤事后检查同步与追踪质量,失败 take 重拍。同步上,房间级 ZED One 经 GMSL2 接单台 Jetson Orin 由共帧触发锁相,桌面级 GoPro 靠对齐音频流互相同步,触觉手套用其 IMU 与头显 IMU 做一段协同动作模板对齐。标定上,外视角用四角带反光标记的 ArUco 板作“桥接目标”,红外相机先聚合上千个板位姿估计标记点实际位置(mm 级),再给每帧板位姿(sub-mm 一致性),最后对每台 RGB 相机拟合并剔除运动帧与边缘检测、联合精修,留出帧中位重投影误差 < 3 px。标注阶段,除文本(Gemini 看第一人称视频分段生成后人工校正)外,其余全部由测得状态投影/传感得到。
技术新颖性
相对于已有方法,新颖性体现在三个层面。对比纯第一人称数据集(Ego4D、EPIC-Kitchens、Ego-Exo4D),ACE 同时提供真值运动、物体 6-DoF、第三人称视角、音频和触觉,而非只有视频。对比纯动捕人-物交互数据集(GRAB、ARCTIC、OakInk2、HOT3D),ACE 把采集从实验室搬到 furnished 真实家庭,保留遮挡与空间约束,并补齐了第一人称视角。对比长时程数据集(ParaHome、HuMoTo、Nymeria),ACE 用目标级指令产生 20–30 分钟的多子任务链式 HOI,而非逐步脚本;并把“接触级监督 + 示范轨迹 + 第一人称观测”放进同一条时间对齐的流里。技术上,光学时钟同步(绕过网络协议无共享时钟、设备时间戳滞后约 0.29 s 且漂移的问题)与标记桥接标定(解决稀疏相机几乎无共视野的难题)都是针对“家庭级密集传感”这一新场景的工程创新。
实验结果
作者用 10 小时留出测试集评测 30+ 方法,分三层得硬结论。低层信号层(Table 3):PressureVision 几乎无效(C-IoU=0.0007),EgoPressureDiff 时序准确率升到 0.2912 但空间重叠仍差,TouchAnything 四项全优(Temp Acc=0.7095、C-IoU=0.1646、CoP=6.58),说明判断接触远比恢复压力分布容易。场景组件层(Table 4,22 方法):最佳单视角 SMPLest-X 的 PA-MPJPE 仅 55.7 mm;但世界系轨迹误差 WA-MPJPE 大得多(180–306 mm),且局部与全局排名不一致——帧级姿态正确不等于整段轨迹正确;第一人称方法(EgoEgo=159.6)全面落后。交互层(Table 5/6):第三人称 WiLoR 最强(PA-MPJPE=9.1、F@5=0.313),HaPTIC 轨迹仅 63 mm;第一人称 WildHands 局部最佳(11.2 mm)但世界系轨迹达 98–102 mm。跨视角最大差异正在轨迹:exo 63 vs ego≈100 mm,自运动估计为主因。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 第一人称触觉从视觉(Tactile from Vision) | C-IoU / Temp Acc / CoP | TouchAnything: C-IoU=0.1646, Temp Acc=0.7095, CoP=6.5846 | PressureVision: C-IoU=0.0007; EgoPressureDiff: C-IoU=0.0197 | 最强方法相比最弱 C-IoU 提升 235 倍(0.0007→0.1646),CoP 误差下降约 40%(10.98→6.58),但绝对重叠仍很低,说明任务远未解决 |
| 人体姿态估计(单视角第三人称,Procrustes 对齐) | PA-MPJPE (mm) | SMPLest-X: 55.7 mm(时序类); OSX: 59.2 mm(逐帧类最优之一) | Multi-HMR: 110.5 mm; WHAM: 131.1 mm; EgoEgo(第一人称): 159.6 mm | 最强方法把误差从 110+ mm 压到约 55–60 mm,接近标准 benchmark 精度,但世界系轨迹误差仍很大,局部正确不等于全局正确 |
| 人体姿态估计(世界系轨迹) | WA-MPJPE (mm) | 场景感知方法整体更低(如 Human3R=180.2) | WHAM=243.1; EasyMoCap=256.2; EgoEgo=306.2 | 场景感知引入场景几何约束显著降低轨迹误差,但与局部姿态指标排名不一致,揭示全局轨迹恢复仍是开放难题 |
| 手部运动估计(第三人称) | PA-MPJPE (mm) / Traj. err. (mm) | WiLoR: PA-MPJPE=9.1, F@5=0.313, AUCJ=0.819; HaPTIC 轨迹=63.0 | 第一人称世界系方法 Dyn-HaMR 轨迹=98.2, HaWoR=102.1 | 固定相机坐标系使轨迹误差从约 100 mm 降到 63 mm(约 35%),证明自运动估计是第一人称手部重建主要误差源 |
| 数据集规模 | Hours / Frames / Episodes / Tasks | ACE-Data-0: 150 小时, 17M 帧, 75000+ episodes, 200 任务, 50 人, 2 环境 | ARCTIC: 2.1M 帧/实验室; ParaHome: 8.1 小时; OakInk2: 4.0M 帧/桌面 | 首个同时在真实家庭、8 视角、带动捕真值、同步音频+触觉、目标级长时程任务的数据集,填补多模态接地空白 |
局限与改进
作者承认三点局限:一是只有两个场地,因此布局、家具、光照的多样性有限,模型若在这些场地上训练可能过拟合特定视觉线索;二是真值只覆盖被仪表化的实体——可追踪物体必须事先扫描并贴标记,数据集不标注关节机构状态变化、流体或可变形材料;三是动捕服、手套、头显和标记点在画面中可见,可能引入数据集特有的视觉提示(模型可能学到“看到手套就预测手套下的手”这类捷径)。我另外观察到:第一人称视角分辨率(1088×1280)和帧率(20 FPS)低于第三人称(1920×1080@30FPS),且鱼眼边缘畸变让手部常落在畸变区,这本身限制了第一人称手部任务的上限;触觉手套只测压力分布、不测剪切力/滑移,对“捏住滑落”这类事件描述不完整;benchmark 的 10 小时测试集相对 150 小时总量偏小,跨任务/跨人的方差可能未被充分刻画。
独立分析的弱点
第一,场地与人群多样性不足:仅 2 个家庭、50 人,光照/布局/家具风格单一,改进方向是扩展到更多房屋类型(厨房岛 vs 开放式、不同光照色温)与更多人群(左右撇子、不同体型、不同年龄),并引入自然语言指令的跨文化家务变体。第二,真值覆盖有限:未标注铰接物体内部状态、液体、可变形材料(衣物、海绵),改进方向是把可变形体建模(如节点图、FEM)与流体粒子状态纳入真值管线,或对高频出现的可变形物做专门扫描与标记。第三,触觉信号维度单一:只记录掌指压力分布,缺剪切力/滑移/温度,改进方向是引入六轴触觉传感器或高分辨率视触觉(如 GelSight),覆盖抓取稳定性的完整信号。第四,第一人称视觉质量受限:分辨率/帧率低、鱼眼边缘畸变,改进方向是升级为更高分辨率广角或事件相机,并研究如何用稳定的世界系相机先验补偿自运动误差。第五,被测者穿着可见装备形成捷径线索,改进方向是用更隐蔽的可穿戴传感器或在后期做外观归一化/合成去手套处理,并量化模型是否依赖装备线索。
未来方向
作者明示的方向有:把物体 6-DoF 位姿估计纳入 benchmark(当前因可用方法太少未评,但已释放真值)、研究融合第一/第三人称视角与模态的模型、施加物理约束、并从测量级接触与运动监督中学习。基于成果可延伸的方向:其一,把 ACE-Data-0 作为模仿学习与世界模型的训练底座,验证“同一物理时刻对齐的多模态示范”能否显著降低机器人操作策略的样本量,并支持把人手轨迹重定向到机械夹爪;其二,把分层 benchmark 推广为端到端评测——一个具身智能体应能依次完成“感知接触→估计场景状态→掌握手-物协调”,可设计级联指标量化错误在哪一层级累积;其三,扩展到第一人称驱动的 VLA(如 EgoVLA、WholeBodyVLA)训练,研究大规模人类视频与机器人示范混合训练的迁移规律;其四,利用 8 视角 + 真值姿态做神经渲染/3DGS 场景重建,生成可注入仿真的数字孪生家庭以低成本扩增轨迹。
复现评估
复现友好度较高。数据完全开放:项目页与 HuggingFace(ACERobotics/ACE-Data-0)释放原始多模态流、标定与同步表、全部投影标注与文本描述,用户可自由组合任意视角/模态作输入与监督,无需重跑流水线。硬件清单在 Table 2 给得很细(28 台 OptiTrack PrimeX 22、8 台 ZED One、8 台 GoPro、ACE-Ego-Head 四目鱼眼、Manus 手套、ACE-Sense-Glove Lite、Jetson Orin),方法描述了同步(光学时钟、IMU 模板对齐)与标定(ArUco+反光标记桥接、手眼标定+光束平差)的具体步骤与误差(<4 ms、<3 px、约 2 px)。benchmark 上所有 30+ baseline 均用官方预训练权重在统一 10 小时测试集上评测,指标定义清晰,可严格复现。主要门槛是硬件成本(28 台动捕相机 + 自研头显/手套)与算力(每小时约 1 TB 原始数据),对学术小组不低;但仅作数据使用者复现实验门槛很低。
论文图表
概览图,左侧展示 ACE 采集的多模态(第一人称视频、第三人称视频、动捕、触觉、音频)以及它们的时间对齐,右侧展示三类捕获主题(简单 HOI、复杂长时程 HOI 链、人-场景交互 HSI),并强调从多视角采集→时间同步→标注处理→质量检查→结构化数据集→多样性场景→丰富 HOI/HSI 标注→可供具身 AI 研究的完整链条。
一张图讲清了论文的定位、采集的模态种类、任务主题和最终用途,是理解全文贡献的入口。