← 返回 2026-07-31

ACE-Data-0:以人为中心的环境捕获即具身数据引擎 ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu 📅 2026-07-30 👍 43 2026-08-05 19:06
人-物交互 具身智能 动作捕捉 基准评测 多模态数据集 第一人称视频 触觉感知

把真实家庭改造成同步多模态录制棚,构建具身AI的长时程人-物交互数据引擎

前置知识

光学动作捕捉 (Optical Motion Capture)

通过布置在空间中的高速红外相机(本文用 OptiTrack PrimeX 22,60 Hz)追踪贴在被测者关节和物体上的反光标记点,从而获得亚毫米精度的刚体/骨架 6-DoF 位姿。本文用 28 台相机、41 个身体标记点重建全身体态,是整套数据的“真值基准时钟与坐标系”。

ACE 之所以能给视频配上“测量级而非估计级”的人体/物体姿态标注,全靠光学动捕作为时空参考;理解这点才能明白为什么本文标注可以“不加估计模型”地直接投影到每一帧。

第一人称 (Egocentric) vs 第三人称 (Exocentric) 视角

Egocentric 指佩戴在头部的相机(本文 ACE-Ego-Head 四目鱼眼,20 FPS)看到的画面,贴近双手但随头剧烈运动、视野截断;Exocentric 指固定的外部相机(8 路 ZED One/GoPro,30 FPS),画面稳定但手部很小易被遮挡。本文两种视角同时同步录制同一交互。

本文 benchmark 的核心对照实验就是“同一交互、同一真值、只换视角”,视角差异(自运动误差)是理解手部轨迹误差 ego≈100mm vs exo=63mm 这一关键结论的前提。

6-DoF 物体位姿与 6-DoF 轨迹

用 6 个自由度(3 平移 + 3 旋转,$\mathbf{R}\in SO(3),\ \mathbf{t}\in\mathbb{R}^3$)描述物体在统一世界系下的刚体姿态。本文先把每个可交互物体扫描或 2D 高斯泼溅重建网格,把反光标记点绑定到网格,60 Hz 输出位姿轨迹,把精确几何放进场景。

有了物体 6-DoF 真值,才能把手部接触、物体运动、视频画面三者对齐到同一物理时刻,这是模仿学习与世界模型训练最稀缺的监督信号。

手眼标定 (Hand-Eye Calibration) 与 Bundle Adjustment

当相机随佩戴者运动时,相机的真实位姿由固定在头显上的 5 个动捕标记点(刚体)测出,剩下待求的是“每个鱼眼相机相对该刚体的固定变换”,这正是经典手眼标定问题 $AX=XB$。本文先用各相机独立求解,再对 4 个变换、棋盘格位姿、每相机时间偏移做联合光束法平差精修。

理解“相机位姿是被测量而非被估计”这一设计,就能看懂为什么本文的外参重投影误差只有约 2 px、且不会漂移——这是整套数据可被任意视角投影复用的基础。

SMPL-X 与 MANO 参数化人体/人手模型

SMPL-X 是统一的全身参数化模型(含身体、手、脸),MANO 是手部专属的低维参数模型;它们用形状参数与姿态参数生成网格。本文把动捕得到的关节转写成 SMPL-X 运动参数与 MANO 序列,作为 benchmark 中人体姿态和手部姿态估计的统一输出/真值表示。

所有 baseline(22 个人体方法、8 个手势方法)都输出 SMPL-X/MANO,理解这两个模型才能读懂 PA-MPJPE、MPJPE、F@5 等评测指标到底在比什么。

研究动机

具身智能面临根本性数据瓶颈:学会在物理世界行动需要的不止观察“动作长什么样”,而是让模型同时捕获第一人称感知、全身运动、灵巧操控、物体状态、声音与触觉如何随人类追求目标协同演化,而现有数据集把这种经验按视角、模态或空间尺度切散,感知-动作闭环只能被部分观测。作者归纳三大缺口:其一,模态碎片化——大规模第一人称数据集(Ego-Exo4D 1286 小时、EPIC-Kitchens 100 小时)有自然行为却无真值运动和第三人称视角;带动捕的 HOI 数据集(GRAB、ARCTIC、OakInk2、HOT3D)姿态准确却缺第一人称,更几乎都没有音频或触觉。其二,环境不自然——带物理标注的数据集(ContactPose 2.9M 帧、DexYCB 582K 帧)几乎只在实验室采集,稀疏布局恰好抹掉了真实家庭的遮挡与物体多样性。其三,时程过短——绝大多数 HOI 片段只有几秒、只描绘孤立抓取(ARCTIC、DexYCB、H2O),而真实家务是有目标导向、跨分钟到小时、需人在场景中移动的。

本文的目标是本文要打造一套以人为中心的环境捕获数据引擎,把真实家居环境原地改造成“空间已标定、时间已同步”的录制棚,从而首次在 furnished(带家具)的真实家庭中,把第一人称视频、多视角第三人称视频、全身与手指运动、物体 6-DoF 轨迹、多通道音频和触觉信号作为统一的多感官流同步记录下来,且每个时刻都用人-物-接触的真值接地。在此基础上产出 ACE-Data-0:150 小时、17M 帧、200 个任务类别、50 名参与者在 2 个环境、共 75000 个交互片段的大规模长时程家务交互数据集,并配套一套从低层信号到场景组件再到交互估计的分层 benchmark,用以暴露当前最先进方法在接触、遮挡、自运动和长时程条件下的失效模式。

与已有工作不同的是,本文的独特切入在于把“同步的多模态接地”本身当作数据的基本单元,而非把不同来源的标注拼凑起来。具体有三点本质区别:其一,用“两个互补空间尺度”而非单一装置——桌面级(30 m²,8 台 0.3–0.5m 近距相机 + 16 台 OptiTrack)解析精细手指-物体操控,房间级(约 200 m² 整套带厨房/餐厅/客厅/卧室的公寓,8 台宽基线相机 + 12 台 OptiTrack)覆盖全身运动与分布式交互,两者共享同一套同步与标定流水线;其二,绝大部分标注是“测量”而非“估计”——人体/物体状态用动捕直接测得,每个相机都标定,接触由触觉手套直接感知,姿态投影、包围框、运动轨迹都由测得状态经几何投影得到,无估计模型介入;其三,任务设计给的是“目标级”而非“逐步脚本”指令,参与人可自由规划、犹豫、即兴,让真实行为的变异性自然进入数据。

核心方法

直觉上,ACE 的思路是:与其在实验室里追求单一尺度的极致精度,不如把实验室级的传感器搬进真实家庭,并用一套严格的时空对齐流程把十几种异构传感流绑成“同一物理事件的多面描述”。技术路线分三层:先把房间变成录制棚(桌面级 + 房间级两套配置,铺满动捕与外视角相机、佩戴头显与手套);再用“光学时钟 + 标记桥接标定”完成时间同步与空间配准,使所有流共享一个 60 Hz 的动捕时间轴和一个统一世界坐标系;最后把测得的真值状态通过几何投影自动转成每帧、每视角的标注,仅文本描述由 Gemini-3.1-pro-preview 生成并人工校对。每个 take 最终打包成可在任意视角、任意时刻自由组合输入与监督的数据单元,一小时原始数据约 1 TB。

核心创新点有三:一是“测量而非估计”的标注哲学——人体与物体姿态由 OptiTrack 直接测得(sub-mm 级),相机外参由头显上的 5 标记点刚体 60 Hz 测得(重投影误差约 2 px 且不漂移),接触由触觉手套直接感知,姿态投影/包围框/轨迹都由几何投影导出,因此即便在家具遮挡、极端视角、运动模糊这些估计器本会失效的地方,标注依然正确。二是双尺度互补配置同时满足“手指-物体接触要近距离密布传感器”和“跟随人在场景中移动要宽基线全屋覆盖”这对矛盾需求。三是“光学时钟”同步法:动捕主机显示器以纳秒级显示自己的时间(QR 码形式),外视角/第一人称相机拍摄这块“钟”,读出每帧的真实拍摄时刻,再对跨 take 的读数拟合“常数偏移 + 缓慢漂移”直线,最终残差降到毫秒级(标定阶段独立复核的时间偏移 < 4 ms,单帧以内)。

方法步骤详情

流水线分五步:①场景准备,物体放在随机但合理的位置;②参与者装备,穿戴动捕服(41 关节标记点)、ACE-Ego-Head 头显、手套,做 T-pose 把骨架注册进动捕系统;③任务说明,仅口头给目标级指令,怎么做完全由参与者决定;④录制,take 开头先做约 10 秒“看一眼时钟”动作让头显鱼眼对准显示器,随后所有传感器同步持续录制;⑤事后检查同步与追踪质量,失败 take 重拍。同步上,房间级 ZED One 经 GMSL2 接单台 Jetson Orin 由共帧触发锁相,桌面级 GoPro 靠对齐音频流互相同步,触觉手套用其 IMU 与头显 IMU 做一段协同动作模板对齐。标定上,外视角用四角带反光标记的 ArUco 板作“桥接目标”,红外相机先聚合上千个板位姿估计标记点实际位置(mm 级),再给每帧板位姿(sub-mm 一致性),最后对每台 RGB 相机拟合并剔除运动帧与边缘检测、联合精修,留出帧中位重投影误差 < 3 px。标注阶段,除文本(Gemini 看第一人称视频分段生成后人工校正)外,其余全部由测得状态投影/传感得到。

技术新颖性

相对于已有方法,新颖性体现在三个层面。对比纯第一人称数据集(Ego4D、EPIC-Kitchens、Ego-Exo4D),ACE 同时提供真值运动、物体 6-DoF、第三人称视角、音频和触觉,而非只有视频。对比纯动捕人-物交互数据集(GRAB、ARCTIC、OakInk2、HOT3D),ACE 把采集从实验室搬到 furnished 真实家庭,保留遮挡与空间约束,并补齐了第一人称视角。对比长时程数据集(ParaHome、HuMoTo、Nymeria),ACE 用目标级指令产生 20–30 分钟的多子任务链式 HOI,而非逐步脚本;并把“接触级监督 + 示范轨迹 + 第一人称观测”放进同一条时间对齐的流里。技术上,光学时钟同步(绕过网络协议无共享时钟、设备时间戳滞后约 0.29 s 且漂移的问题)与标记桥接标定(解决稀疏相机几乎无共视野的难题)都是针对“家庭级密集传感”这一新场景的工程创新。

Overview of the Ambient Capture Engine. We design two complementary home scenes and capture at two spatial scales.
Figure 2: Overview of the Ambient Capture Engine. We design two complementary home scenes and capture at two spatial scales.
Overall workflow of ACE.
Figure 3: Overall workflow of ACE.
Synchronized modalities captured by ACE.
Figure 4: Synchronized modalities captured by ACE.
Examples of different task categories captured in ACE-Data-0.
Figure 7: Examples of different task categories captured in ACE-Data-0.

实验结果

作者用 10 小时留出测试集评测 30+ 方法,分三层得硬结论。低层信号层(Table 3):PressureVision 几乎无效(C-IoU=0.0007),EgoPressureDiff 时序准确率升到 0.2912 但空间重叠仍差,TouchAnything 四项全优(Temp Acc=0.7095、C-IoU=0.1646、CoP=6.58),说明判断接触远比恢复压力分布容易。场景组件层(Table 4,22 方法):最佳单视角 SMPLest-X 的 PA-MPJPE 仅 55.7 mm;但世界系轨迹误差 WA-MPJPE 大得多(180–306 mm),且局部与全局排名不一致——帧级姿态正确不等于整段轨迹正确;第一人称方法(EgoEgo=159.6)全面落后。交互层(Table 5/6):第三人称 WiLoR 最强(PA-MPJPE=9.1、F@5=0.313),HaPTIC 轨迹仅 63 mm;第一人称 WildHands 局部最佳(11.2 mm)但世界系轨迹达 98–102 mm。跨视角最大差异正在轨迹:exo 63 vs ego≈100 mm,自运动估计为主因。

Comparison of ACE-Data-0 with related datasets, grouped by category.
Table 1: Comparison of ACE-Data-0 with related datasets, grouped by category.
Capture hardware of ACE for synchronized multi-modal recording.
Table 2: Capture hardware of ACE for synchronized multi-modal recording.
Tactile estimation from ego-view on ACE-Data-0.
Table 3: Tactile estimation from ego-view on ACE-Data-0.
Human motion estimation on ACE-Data-0. All metrics in mm.
Table 4: Human motion estimation on ACE-Data-0. All metrics in mm.
Hand motion estimation from ego-view on ACE-Data-0.
Table 5: Hand motion estimation from ego-view on ACE-Data-0.
Hand motion estimation from exo-view on ACE-Data-0.
Table 6: Hand motion estimation from exo-view on ACE-Data-0.
Overview statistics of ACE-Data-0.
Figure 8: Overview statistics of ACE-Data-0.
Three hierarchical benchmark levels.
Figure 14: Three hierarchical benchmark levels.
查看结构化数据
任务指标本文基线提升
第一人称触觉从视觉(Tactile from Vision) C-IoU / Temp Acc / CoP TouchAnything: C-IoU=0.1646, Temp Acc=0.7095, CoP=6.5846 PressureVision: C-IoU=0.0007; EgoPressureDiff: C-IoU=0.0197 最强方法相比最弱 C-IoU 提升 235 倍(0.0007→0.1646),CoP 误差下降约 40%(10.98→6.58),但绝对重叠仍很低,说明任务远未解决
人体姿态估计(单视角第三人称,Procrustes 对齐) PA-MPJPE (mm) SMPLest-X: 55.7 mm(时序类); OSX: 59.2 mm(逐帧类最优之一) Multi-HMR: 110.5 mm; WHAM: 131.1 mm; EgoEgo(第一人称): 159.6 mm 最强方法把误差从 110+ mm 压到约 55–60 mm,接近标准 benchmark 精度,但世界系轨迹误差仍很大,局部正确不等于全局正确
人体姿态估计(世界系轨迹) WA-MPJPE (mm) 场景感知方法整体更低(如 Human3R=180.2) WHAM=243.1; EasyMoCap=256.2; EgoEgo=306.2 场景感知引入场景几何约束显著降低轨迹误差,但与局部姿态指标排名不一致,揭示全局轨迹恢复仍是开放难题
手部运动估计(第三人称) PA-MPJPE (mm) / Traj. err. (mm) WiLoR: PA-MPJPE=9.1, F@5=0.313, AUCJ=0.819; HaPTIC 轨迹=63.0 第一人称世界系方法 Dyn-HaMR 轨迹=98.2, HaWoR=102.1 固定相机坐标系使轨迹误差从约 100 mm 降到 63 mm(约 35%),证明自运动估计是第一人称手部重建主要误差源
数据集规模 Hours / Frames / Episodes / Tasks ACE-Data-0: 150 小时, 17M 帧, 75000+ episodes, 200 任务, 50 人, 2 环境 ARCTIC: 2.1M 帧/实验室; ParaHome: 8.1 小时; OakInk2: 4.0M 帧/桌面 首个同时在真实家庭、8 视角、带动捕真值、同步音频+触觉、目标级长时程任务的数据集,填补多模态接地空白

局限与改进

作者承认三点局限:一是只有两个场地,因此布局、家具、光照的多样性有限,模型若在这些场地上训练可能过拟合特定视觉线索;二是真值只覆盖被仪表化的实体——可追踪物体必须事先扫描并贴标记,数据集不标注关节机构状态变化、流体或可变形材料;三是动捕服、手套、头显和标记点在画面中可见,可能引入数据集特有的视觉提示(模型可能学到“看到手套就预测手套下的手”这类捷径)。我另外观察到:第一人称视角分辨率(1088×1280)和帧率(20 FPS)低于第三人称(1920×1080@30FPS),且鱼眼边缘畸变让手部常落在畸变区,这本身限制了第一人称手部任务的上限;触觉手套只测压力分布、不测剪切力/滑移,对“捏住滑落”这类事件描述不完整;benchmark 的 10 小时测试集相对 150 小时总量偏小,跨任务/跨人的方差可能未被充分刻画。

独立分析的弱点

第一,场地与人群多样性不足:仅 2 个家庭、50 人,光照/布局/家具风格单一,改进方向是扩展到更多房屋类型(厨房岛 vs 开放式、不同光照色温)与更多人群(左右撇子、不同体型、不同年龄),并引入自然语言指令的跨文化家务变体。第二,真值覆盖有限:未标注铰接物体内部状态、液体、可变形材料(衣物、海绵),改进方向是把可变形体建模(如节点图、FEM)与流体粒子状态纳入真值管线,或对高频出现的可变形物做专门扫描与标记。第三,触觉信号维度单一:只记录掌指压力分布,缺剪切力/滑移/温度,改进方向是引入六轴触觉传感器或高分辨率视触觉(如 GelSight),覆盖抓取稳定性的完整信号。第四,第一人称视觉质量受限:分辨率/帧率低、鱼眼边缘畸变,改进方向是升级为更高分辨率广角或事件相机,并研究如何用稳定的世界系相机先验补偿自运动误差。第五,被测者穿着可见装备形成捷径线索,改进方向是用更隐蔽的可穿戴传感器或在后期做外观归一化/合成去手套处理,并量化模型是否依赖装备线索。

未来方向

作者明示的方向有:把物体 6-DoF 位姿估计纳入 benchmark(当前因可用方法太少未评,但已释放真值)、研究融合第一/第三人称视角与模态的模型、施加物理约束、并从测量级接触与运动监督中学习。基于成果可延伸的方向:其一,把 ACE-Data-0 作为模仿学习与世界模型的训练底座,验证“同一物理时刻对齐的多模态示范”能否显著降低机器人操作策略的样本量,并支持把人手轨迹重定向到机械夹爪;其二,把分层 benchmark 推广为端到端评测——一个具身智能体应能依次完成“感知接触→估计场景状态→掌握手-物协调”,可设计级联指标量化错误在哪一层级累积;其三,扩展到第一人称驱动的 VLA(如 EgoVLA、WholeBodyVLA)训练,研究大规模人类视频与机器人示范混合训练的迁移规律;其四,利用 8 视角 + 真值姿态做神经渲染/3DGS 场景重建,生成可注入仿真的数字孪生家庭以低成本扩增轨迹。

复现评估

复现友好度较高。数据完全开放:项目页与 HuggingFace(ACERobotics/ACE-Data-0)释放原始多模态流、标定与同步表、全部投影标注与文本描述,用户可自由组合任意视角/模态作输入与监督,无需重跑流水线。硬件清单在 Table 2 给得很细(28 台 OptiTrack PrimeX 22、8 台 ZED One、8 台 GoPro、ACE-Ego-Head 四目鱼眼、Manus 手套、ACE-Sense-Glove Lite、Jetson Orin),方法描述了同步(光学时钟、IMU 模板对齐)与标定(ArUco+反光标记桥接、手眼标定+光束平差)的具体步骤与误差(<4 ms、<3 px、约 2 px)。benchmark 上所有 30+ baseline 均用官方预训练权重在统一 10 小时测试集上评测,指标定义清晰,可严格复现。主要门槛是硬件成本(28 台动捕相机 + 自研头显/手套)与算力(每小时约 1 TB 原始数据),对学术小组不低;但仅作数据使用者复现实验门槛很低。