HumanTracker:面向全面且符合人类感知的人形运动追踪基准 HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
发布153小时分类人形追踪基准与偏好对齐指标HumanScore,弥合运动学误差与人类感知鸿沟
前置知识
人形运动追踪
给定一段参考运动(通常经重定向映射到机器人骨骼),在物理仿真器(如 MuJoCo)中训练一个反馈策略,逐帧输出动作/电机目标,使机器人在重力、摩擦与动力学约束下闭环复现该运动。代表工作包括 DeepMimic、PHC/UHM、GMT、SONIC、TWIST2、Humanoid-GPT 等,能力可直接支撑遥操作与全身模仿。
本文评测的全部对象就是这类追踪策略的 rollout,理解其闭环控制特性与典型失败模式,是读懂基准设计、成功判据和 HumanScore 动机的前提。
运动学误差指标(MPJPE 等)
将每帧仿真/预测姿态与参考姿态对应关节做差取绝对值,再对关节和时间取平均,如 MPJPE(平均关节误差)、MPJVE(关节速度误差)、关键点位置 MAE。优点是客观、可复现、无需人工;缺点是逐帧独立计算并跨关节平均,会把罕见但致命的接触与支撑错误稀释成很小的数值。
论文的核心论点正是这类指标与人类观感不一致,HumanScore 的价值需要以它们(MPJPE 对齐率 80.49%)为基线来衡量。
Bradley–Terry 模型与偏好学习(RLHF)
成对比较的概率模型:若两个选项的标量奖励为 $r_a, r_b$,则 $a$ 被偏好的概率为 $\sigma(r_a - r_b)$。RLHF(如 InstructGPT)据此用人类成对偏好标注训练奖励模型,再用奖励指导优化。本文用它从“左/右两个追踪哪个更好”的标注中学习 HumanScore。
HumanScore 的损失函数 $\mathcal{L}=-\log\sigma(r_{chosen}-r_{rejected})$、Similar 对的对称损失,以及评测协议(Align Rate)全部建立在该模型之上。
运动重定向(Retargeting)
把以人体参数化模型(如 SMPL)表示的运动映射到机器人骨骼(本文为 29 自由度人形)的过程,需处理肢体长度与关节范围差异,并保证接触关系在机器人形体上仍然合理。本文使用 GMR(General Motion Retargeting)完成重定向,并人工剔除浮空、穿地、接触断裂等伪影片段。
基准中所有被评测方法共享同一 robot-space 参考轨迹与统一评测入口,理解重定向才能理解其标准化协议为什么公平。
足部滑动与接触伪影
物理仿真中常见的不真实接触现象:脚在地面滑动、接触在错误时刻断开或重连、支撑不稳、低质心多接触切换失败等。人眼对这类“物理不合理”极其敏感,但因为它们只占少数帧,逐帧姿态误差平均后可能几乎看不出来。
这些伪影正是运动学指标漏掉、而 HumanScore 借助接触特征与时序上下文学到的核心信号,也是本文论证“指标与感知脱节”的关键证据。
研究动机
现行人形追踪评测几乎完全依赖运动学误差:把 rollout 姿态与参考姿态逐帧对比后对关节和时间取平均(MPJPE、关键点误差等)。作者指出两个具体后果。其一,指标与观感脱节:两个 rollout 的 MPJPE 可以几乎相同,但一个脚底滑动、接触在错误时刻断开又重连、支撑不稳,另一个干净利落——人类观察者会稳定地偏好后者,而逐帧、跨关节的平均把这类罕见的接触/支撑灾难稀释成了小数字,尤其在有接触的场景下问题严重。其二,评测数据过小过窄:尽管存在 PHUMA、SONIC 等大规模数据源,人形追踪最常用的测试集仍然是 AMASS 中仅 140 条序列的子集,缺少接触过渡、非对称平衡、复杂恢复等长尾挑战;且结果常被压缩成单一聚合分数,无法定位追踪器在哪类运动、哪个阶段失败。最终结果是榜单数字与视频里人眼所见严重脱节,制约了遥操作与全身模仿等方向的可比进展。
本文的目标是本文的目标是让人形追踪评测同时做到“与人类感知对齐”和“可扩展、可诊断”,具体拆成三件事。第一,构建大规模、显式分类的光学动捕基准:由 24 位专业表演者(舞蹈教师、健身教练、网球教练、全职动捕演员)在受控摄影棚录制约 153 小时、2.5 万条轨迹,按追踪失败模式组织为 Daily(日常)、Highly Dynamic(高动态)、Interaction(交互)、Ground(地面)四大族群并附自然语言标注,支持分族群细粒度诊断。第二,提出 HumanScore:在 12K 对偏好记录(含镜像,共 24K 条运动)上训练的偏好对齐奖励模型,通过时序 Transformer 输出标量分,直接预测人类对追踪质量的判断,显式惩罚滑步、接触错时、支撑不稳等人眼可见的物理伪影。第三,建立标准化评测协议:统一 29 自由度 qpos 参考表示、统一 MuJoCo 评测入口、统一成功判据与指标,使 GMT、TWIST2、SONIC、Humanoid-GPT 等代表性追踪器首次在同一受控实验条件下可比。
与已有工作不同的是,本文的独特切入有三点。第一,把“评测”本身而非“训练”作为研究对象:以往工作竞相提升追踪能力,但报告结果依赖各自的参考集、仿真器、动作表示、初始化与终止规则,难以横向比较;本文反其道而行——保留各方法原生策略观测与动作接口,只标准化参考表示、rollout 统计口径与指标实现,把评测变成受控实验。第二,偏好学习面向的是“同一参考下两条仿真轨迹的相对质量”,而非生成运动的合理性:与 InstructMotion、MotionCritic 等评估文本生成动作品质的工作不同,HumanScore 评价的是闭环追踪 rollout,且直接以仿真器状态(含测得接触力)而非渲染视频为输入,避免相机视角与渲染风格的偏差。第三,数据组织方式独特:按“失败模式”而非活动类型把运动分成四族群,每个族群对应一种追踪压力——稳态支撑与漂移、冲击与快速换支撑、手-身协调、低质心多接触——天然支持“哪里失败、为什么失败”的细粒度诊断。
核心方法
直觉上,论文回答两个问题:测什么,以及怎么测才像人想的那样。测什么:一个 153 小时、按四族群分类的动捕测试床;怎么测:一个从人类成对偏好中学出来的标量分数 HumanScore。技术路线上,数据侧把多相机光学动捕序列拟合为 SMPL 后经 GMR 重定向到统一的 29 自由度人形 qpos 表示,人工剔除浮空、穿地、接触不连续等伪影,按 9:1 划分训练/测试集(同源运动不跨集),每条片段带族群标签、自然语言描述与 SMPL 拟合。评测侧,四个追踪器(GMT、TWIST2、SONIC、Humanoid-GPT)各自保留原生观测与动作解码栈,但共用同一参考运动列表、同一 MuJoCo 评测入口、50 Hz 状态记录;成功判据沿用 SONIC:骨盆/双踝/双腕的垂直位置误差超过 0.25 m、骨盆旋转误差超过 1 rad、或广义位置/速度出现非有限值即判失败,报告完成率 Succ、29 个驱动关节角的 MPJPE(弧度)与 HumanScore。HumanScore 本身是一个时序 Transformer 奖励模型:以 5 秒(250 帧)窗口的仿真轨迹为输入,输出无界奖励 $r_\theta(\tau)\in\mathbb{R}$,经 sigmoid 映射到 $(0,1)$ 后按帧数加权平均成 0–100 分。
核心创新是把“人类偏好对齐”系统性地引入人形追踪评测,与逐帧运动学误差存在三重本质区别。第一,监督信号来自人对同步 rollout 视频的成对比较而非几何距离:6 位人形机器人方向博士先判断是否失败/失衡,再比较抖动、滑步、步态一致性与整体自然度——这种“事件级”判断恰好覆盖滑步、冲击、支撑切换、恢复等逐帧平均看不见的失败单元。第二,输入是特权仿真状态而非视频:每帧 539 维 token 包含当前参考状态(70 维)与 rollout 侧(469 维)的机器人状态、动作、电机目标、测得接触力、足部加速度、根运动与 14 个关键点位姿,让模型直接感知接触物理,同时不依赖相机视角或渲染风格;条件于当前参考也使模型评估的是“追踪质量”而非单纯的运动合理性。第三,时序整合:双向 Transformer 在最长 250 帧(5 秒)上下文上做注意力,敏感性实验显示上下文从 1 秒延长到 5 秒时对齐率从 0.857 稳步升至约 0.91——滑步、渐进漂移这类演化型伪影必须靠时间累积才能识别,这是任何逐帧指标在结构上做不到的。
方法步骤详情
流程分五步。(1) 数据构建:24 位专业表演者多相机光学动捕,SMPL 拟合后经 GMR 重定向到基准人形,人工剔除浮空、穿地、接触不连续段;最终约 152.67 小时、24,995 条轨迹(训练 22,495 条/24,793,129 帧,测试 2,500 条/2,687,461 帧,9:1,同源运动同集),四族群为 Daily 89.29 h/9,739 条、Interaction 47.78 h/10,940 条、Highly Dynamic 11.01 h/2,676 条、Ground 4.59 h/1,640 条。(2) 标准化评测:参考统一转为 29 DoF qpos,各追踪器经同一 MuJoCo 入口执行,50 Hz 记录 qpos/qvel、动作、电机目标、足接触与力、14 关键点位姿与速度;同一状态历史同时用于常规诊断和 HumanScore,避免后处理差异被误认为追踪器差异。(3) 偏好数据构建:仅用训练集运动,四个追踪器对每条参考产生时间对齐的 rollout,切成 250 帧(5 s)窗口,按族群/源运动/时间位置全局排序索引后等距均匀采样,六种追踪器两两组合均衡分配、展示顺序交替且随机化;6 位标注者输出“左好/右好/相似/无法比较”,6,000 对原始标注经左右镜像翻倍为 12,000 条记录,Cannot compare 剔除,按 motion_id 分组做 80/20 划分并对族群、配对、标签、标注者联合均衡。(4) 模型训练:每帧 539 维特征线性投影加正弦位置编码,送入 4 层、$d_{model}=256$、8 头、FFN 1024 的双向 Transformer,掩码平均池化后由 3 层 MLP 奖励头输出标量;严格偏好对用 Bradley–Terry 损失 $\mathcal{L}^{(i)}_{diff}=-\log\sigma(\Delta_i)$,$\Delta_i=r^{(i)}_{chosen}-r^{(i)}_{rejected}$;Similar 对用对称损失 $\mathcal{L}^{(j)}_{similar}=-\frac{1}{2}\log\sigma(\Delta_j)-\frac{1}{2}\log\sigma(-\Delta_j)$;总损失 $\mathcal{L}=\frac{1}{|D|+|S|}\big(\sum_{i\in D}\mathcal{L}^{(i)}_{diff}+\sum_{j\in S}\mathcal{L}^{(j)}_{similar}\big)$;优化用 AdamW、学习率 $1\times10^{-4}$、余弦退火加 10% 预热、batch 8、20 epoch、float32、种子 42。(5) 推理计分:长 rollout 按 $N=\lceil F/250\rceil$ 切窗,短尾窗右侧补零并用有效性掩码从注意力和池化中排除;窗口奖励 $\rho_\theta(s_i)=\sigma(r_\theta(s_i))\in(0,1)$,最终 $\mathrm{HumanScore}(\tau)=100\sum_{i=1}^{N}\frac{L_i}{F}\rho_\theta(s_i)$,即按窗口实际帧数加权平均,训练分布上 $\rho$ 覆盖 $4\times10^{-8}$ 到 0.99,动态范围充足。
技术新颖性
新颖性可从四个层面分析。数据层面:此前人形追踪最常用的测试集仅是 AMASS 的 140 条序列,PHUMA 虽有 76K 片段/73 小时但无类别标注,HumanTracker 以 152.67 小时、24,995 条轨迹、四族群加文本标注同时提升规模与可诊断性(对照 AMASS >40 h、HumanML3D 28.6 h、PHUMA 73 h)。指标层面:用学到的偏好奖励模型替代单一解析诊断的思路在机器人侧已有 RoboReward、Robo-Dopamine 等先例,但它们面向任务完成度或操作进度;本文首次针对“同一参考下闭环追踪质量”训练偏好模型,并以 90.83% 的对齐率显著超过 MPJPE 80.49%、足接触准确率 78.82% 等任何单一指标,还证明其捕捉的品质无法归结为滑步或漂移这类规则诊断。损失与计分设计层面:为 Similar 对设计对称损失,把弱监督“差不多好”也利用起来而非丢弃;计分时按实际帧数加权、补零位置在注意力与池化中双重掩蔽,保证长短窗口统一处理且无填充伪影。协议层面:对齐率按族群内计算再等权平均,配合按源运动分层的 20,000 次 bootstrap(95% CI [87.36, 93.83]),并从构造上排除分布捷径——同源片段不跨划分、族群等权防止 Daily/Interaction 多数族群主导、六种配对均衡防止配对偏置,使结论在统计上站得住。
实验结果
主结果有四组。第一,零样本追踪评测(Table 3,所有追踪器均未在测试集上训练或微调):Humanoid-GPT 综合最强,在 Daily 和 Highly Dynamic 上三项指标全领先——Daily 上 Succ 94.4%、MPJPE 0.046 rad、HumanScore 54.7,大幅优于 GMT 的 17.0%/0.250/2.4 和 TWIST2 的 60.1%/0.105/10.1;SONIC 是最接近的竞争者,拿下 Interaction 最高完成率 97.6%,并且在 Ground 上 HumanScore 最高(26.5)。值得注意的分化是:Humanoid-GPT 在 Ground 上完成率更高(32.9% vs 20.1%)但 HumanScore 略低(24.9 vs 26.5),即 SONIC 的地面动作虽更常失败、却被人认为更自然稳定——这种“完成 vs 观感”的质量差异正是聚合型传统指标会掩盖、而分族群+偏好指标能揭示的。第二,Ground 是所有追踪器的重灾区:GMT 与 TWIST2 完成率为 0.0%,最好的 Humanoid-GPT 也仅 32.9%、MPJPE 0.216 rad,验证了低质心多接触场景的挑战,也说明 AMASS 140 条这类小测试集根本暴露不了这些失败模式。第三,偏好对齐(Table 4/9):HumanScore 与人类偏好一致率达 90.83%(95% CI [87.36, 93.83],按族群分层、按源运动聚类的 20,000 次 bootstrap),全面超过 MPJPE 80.49%、MPJVE 84.04%、关键点位置 MAE 84.05%、足接触准确率 78.82%、平均关节加速度 69.33%、平均关节 jerk 72.32%——没有任何单一解析诊断接近学习型指标。第四,敏感性分析(Figure 5):去掉测得接触特征后平均对齐率从 0.908 降到 0.867,其中 Ground 跌幅最大(0.879→0.759),证明接触信息对复杂接触过渡至关重要;只保留运动学特征为 0.878;加入未来参考反而略降(0.905 vs 0.908),说明当前+历史状态已足够评估动作质量;可用上下文从 1 秒延长到 5 秒时对齐率从 0.857 稳步升至约 0.91,证实滑步、重复抖动、渐进漂移、失稳恢复等演化型伪影需要长时上下文才能捕捉。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 日常运动(Daily)零样本追踪 | HumanScore(0–100,越高越好) | Humanoid-GPT 54.7 | GMT 2.4 | +52.3 分(约 22 倍);Succ 94.4% vs 17.0%,MPJPE 0.046 vs 0.250 rad |
| 高动态运动(Highly Dynamic)追踪 | Succ 完成率 | Humanoid-GPT 86.9%(MPJPE 0.047 rad,HumanScore 49.2) | TWIST2 39.9%(MPJPE 0.112 rad,HumanScore 16.9) | 完成率 +47.0 个百分点 |
| 地面运动(Ground)追踪 | Succ 完成率 | Humanoid-GPT 32.9%(MPJPE 0.216 rad) | GMT 与 TWIST2 均 0.0% | +32.9 个百分点;SONIC 观感最好(HumanScore 26.5) |
| 交互运动(Interaction)追踪 | Succ 完成率 | SONIC 97.6% | GMT 81.4% | +16.2 个百分点;Humanoid-GPT HumanScore 最高(56.8) |
| 与人类偏好的一致性 | Align Rate(严格偏好测试样本,族群等权平均) | HumanScore 90.83%(95% CI 87.36–93.83) | 最佳单一解析指标:关键点位置 MAE 84.05% | +6.78 个百分点;相对 MPJPE 80.49% 提升 10.34 个百分点 |
| 接触特征消融(Ground 族群) | Align Rate | 完整模型 0.879 | 去除测得接触特征 0.759 | 接触特征在 Ground 上贡献 0.120 的对齐率 |
局限与改进
作者在附录 G 中坦承多重边界:HumanScore 仅在 HumanTracker 训练集运动和四个追踪器的 rollout 上训练,其“运动不相交”的测试只衡量对未见运动的泛化,不保证泛化到未见机器人、仿真器或控制器族;539 维输入包含特权仿真状态(接触力等),真机上不可直接观测,迁移到现实轨迹需要可观测特征集或经验证的状态估计器;每对样本只采集一个主要判断,没有重复独立标注,无法量化偏好本身的不确定性;对比的解析指标都是单一诊断,未测试线性/非线性组合指标的上限;四族群刻意不均衡(Ground 仅 4.59 h,远少于 Daily 89.29 h),且只覆盖一个 29 自由度 embodiment 在 MuJoCo 中的仿真,结果不能解释为对全部人类活动的总体估计,也不是硬件鲁棒性证据。我的补充观察:标注者仅 6 人且全部是人形机器人方向博士,偏好分布可能偏“专家视角”,与普通观众的感知差异未经测量;HumanScore 在训练分布上的 sigmoid 输出范围是 $4\times10^{-8}$ 到 0.99,对分布外轨迹(如全新控制风格)的校准情况未知;5 秒窗口的固定切分也意味着计分粒度是人为选择的,不同窗口长度下的表现只在 1–5 秒上下文消融中部分覆盖。
独立分析的弱点
弱点一:特权信息依赖。接触力、qpos 级状态只在仿真中可得,HumanScore 无法直接用于真机 rollout 的质量监控。改进方向:训练一个仅用量测可观特征(IMU、关节编码器、足底接触开关、估计接触概率)的蒸馏版本,或在真实轨迹上用状态估计器替代并重新验证对齐率。弱点二:训练分布窄。偏好数据只来自四个追踪器的 rollout,面对风格截然不同的新控制器(扩散策略、残差控制等),奖励模型可能系统性偏向熟悉的行为模式。改进:随新追踪器迭代扩充偏好池,或加入跨控制器风格的正则化与外分布检测。弱点三:标注规模与人群单一。6,000 对标注全部来自 6 位同领域博士,成本高且视角单一;“无法比较”样本被直接丢弃也损失了信息。改进:引入非专家众包做跨人群校准、多人重复标注以估计标注者一致性,并对无法比较样本建模序数或拒判结构。弱点四:Ground 族群过小(1,640 条/4.59 h),却恰是区分度最大的族群,其指标方差与类别覆盖都受限。改进:定向补采低质心、多接触、摔倒恢复类动作,或按难度重加权。弱点五:分窗计分假设人类偏好在 5 秒粒度可加,长程编排性失败(整段节奏错位、动作衔接生硬)可能被窗口平均稀释。改进:利用注意力权重做关键失败窗定位,或采用可变长度分段与层次化聚合。
未来方向
作者明确提出:把基准扩展到跨 embodiment(不同自由度与构型的人形)、真实机器人 rollout 和更稀有的接触模式;把 HumanScore 从“评测指标”推进到“RL 奖励”,但强调直接优化学得分数会诱导利用模型缺陷的行为,需要显式正则化与独立的人类评估兜底。基于本文成果还可延伸:其一,做“可观测特征版”HumanScore,作为真机遥操作与全身模仿的在线质量监控器和 early-failure 检测器;其二,把偏好模型反向用于数据筛选——自动挑出“难而有用”的参考片段来改进追踪策略训练(论文相关工作已指出该能力可支撑遥操作数据选择);其三,构建“感知分+定位”的调试链:用注意力或特征消融定位失败窗口,再接解析诊断(足接触一致性、关节加速度等)定位具体误差源,把 HumanScore 与 Succ/MPJPE 组合成互补工具集;其四,在生成式人形控制(如 BeyondMimic 的扩散策略)上检验偏好指标是否仍与人类一致,测试跨控制器泛化;其五,扩大偏好标注人群与规模,建立带标注一致性度量的公开人形追踪偏好数据集。
复现评估
复现条件相当好。代码与基准已开源(GitHub: GalaxyGeneralRobotics/HumanTracker;项目页 dairuliu.github.io/humantracker);数据发布格式完全公开:50 Hz NPZ 归档,每个含 7 个数组(qpos $F\times36$、qvel $F\times35$、14 关键点位姿 $F\times14\times4\times4$、关键点速度 $F\times14\times6$、全局速度与位姿、足接触 $F\times2$),共 24,995 个归档且作者做过全量 schema 扫描;训练/测试 manifest(22,495/2,500 条轨迹)与四族群文本标注齐全。奖励模型训练成本很低:4 层 Transformer、$d_{model}=256$、batch 8、20 epoch、float32、种子 42,单张消费级 GPU 即可复现;附录 Table 6 给出全部超参(AdamW、$10^{-4}$、余弦+10% 预热、梯度范数 1.0 等),可精确重建 checkpoint。主要门槛有两处:偏好数据需要 6 名领域专家标注 6,000 对同步视频,外部团队难以原样重建,但划分与均衡协议(motion_id 分组 80/20、族群/配对/标签/标注者联合均衡)写得足够细,重标后可复现实验设计;追踪器评测需跑通 GMT、TWIST2、SONIC、Humanoid-GPT 四套原生策略栈并接入统一 MuJoCo 评测入口,工程量中等。综合评估:指标与数据复现难度低,完整评测流水线复现难度中等。
论文图表
左半部分展示 HumanScore 的训练流程:从追踪 rollout 中收集人类偏好数据(✗/✓ 对比),用时序 Transformer 处理观测序列输出标量 HumanScore;右半部分展示评测基准:150+ 小时光学动捕数据,覆盖日常、高动态、交互、地面四大类别及接触场景。
一图总览论文两大贡献(偏好对齐指标 + 分类基准),并直观呈现“运动学误差低但人看很差”的动机,是理解全文框架的入口。