← 返回 2026-08-17

HumanTracker:面向全面且符合人类感知的人形运动追踪基准 HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi 📅 2026-08-13 👍 16 2026-08-22 18:30
人形机器人 人类偏好对齐 基准与评测 奖励模型 物理仿真 运动追踪

发布153小时分类人形追踪基准与偏好对齐指标HumanScore,弥合运动学误差与人类感知鸿沟

前置知识

人形运动追踪

给定一段参考运动(通常经重定向映射到机器人骨骼),在物理仿真器(如 MuJoCo)中训练一个反馈策略,逐帧输出动作/电机目标,使机器人在重力、摩擦与动力学约束下闭环复现该运动。代表工作包括 DeepMimic、PHC/UHM、GMT、SONIC、TWIST2、Humanoid-GPT 等,能力可直接支撑遥操作与全身模仿。

本文评测的全部对象就是这类追踪策略的 rollout,理解其闭环控制特性与典型失败模式,是读懂基准设计、成功判据和 HumanScore 动机的前提。

运动学误差指标(MPJPE 等)

将每帧仿真/预测姿态与参考姿态对应关节做差取绝对值,再对关节和时间取平均,如 MPJPE(平均关节误差)、MPJVE(关节速度误差)、关键点位置 MAE。优点是客观、可复现、无需人工;缺点是逐帧独立计算并跨关节平均,会把罕见但致命的接触与支撑错误稀释成很小的数值。

论文的核心论点正是这类指标与人类观感不一致,HumanScore 的价值需要以它们(MPJPE 对齐率 80.49%)为基线来衡量。

Bradley–Terry 模型与偏好学习(RLHF)

成对比较的概率模型:若两个选项的标量奖励为 $r_a, r_b$,则 $a$ 被偏好的概率为 $\sigma(r_a - r_b)$。RLHF(如 InstructGPT)据此用人类成对偏好标注训练奖励模型,再用奖励指导优化。本文用它从“左/右两个追踪哪个更好”的标注中学习 HumanScore。

HumanScore 的损失函数 $\mathcal{L}=-\log\sigma(r_{chosen}-r_{rejected})$、Similar 对的对称损失,以及评测协议(Align Rate)全部建立在该模型之上。

运动重定向(Retargeting)

把以人体参数化模型(如 SMPL)表示的运动映射到机器人骨骼(本文为 29 自由度人形)的过程,需处理肢体长度与关节范围差异,并保证接触关系在机器人形体上仍然合理。本文使用 GMR(General Motion Retargeting)完成重定向,并人工剔除浮空、穿地、接触断裂等伪影片段。

基准中所有被评测方法共享同一 robot-space 参考轨迹与统一评测入口,理解重定向才能理解其标准化协议为什么公平。

足部滑动与接触伪影

物理仿真中常见的不真实接触现象:脚在地面滑动、接触在错误时刻断开或重连、支撑不稳、低质心多接触切换失败等。人眼对这类“物理不合理”极其敏感,但因为它们只占少数帧,逐帧姿态误差平均后可能几乎看不出来。

这些伪影正是运动学指标漏掉、而 HumanScore 借助接触特征与时序上下文学到的核心信号,也是本文论证“指标与感知脱节”的关键证据。

研究动机

现行人形追踪评测几乎完全依赖运动学误差:把 rollout 姿态与参考姿态逐帧对比后对关节和时间取平均(MPJPE、关键点误差等)。作者指出两个具体后果。其一,指标与观感脱节:两个 rollout 的 MPJPE 可以几乎相同,但一个脚底滑动、接触在错误时刻断开又重连、支撑不稳,另一个干净利落——人类观察者会稳定地偏好后者,而逐帧、跨关节的平均把这类罕见的接触/支撑灾难稀释成了小数字,尤其在有接触的场景下问题严重。其二,评测数据过小过窄:尽管存在 PHUMA、SONIC 等大规模数据源,人形追踪最常用的测试集仍然是 AMASS 中仅 140 条序列的子集,缺少接触过渡、非对称平衡、复杂恢复等长尾挑战;且结果常被压缩成单一聚合分数,无法定位追踪器在哪类运动、哪个阶段失败。最终结果是榜单数字与视频里人眼所见严重脱节,制约了遥操作与全身模仿等方向的可比进展。

本文的目标是本文的目标是让人形追踪评测同时做到“与人类感知对齐”和“可扩展、可诊断”,具体拆成三件事。第一,构建大规模、显式分类的光学动捕基准:由 24 位专业表演者(舞蹈教师、健身教练、网球教练、全职动捕演员)在受控摄影棚录制约 153 小时、2.5 万条轨迹,按追踪失败模式组织为 Daily(日常)、Highly Dynamic(高动态)、Interaction(交互)、Ground(地面)四大族群并附自然语言标注,支持分族群细粒度诊断。第二,提出 HumanScore:在 12K 对偏好记录(含镜像,共 24K 条运动)上训练的偏好对齐奖励模型,通过时序 Transformer 输出标量分,直接预测人类对追踪质量的判断,显式惩罚滑步、接触错时、支撑不稳等人眼可见的物理伪影。第三,建立标准化评测协议:统一 29 自由度 qpos 参考表示、统一 MuJoCo 评测入口、统一成功判据与指标,使 GMT、TWIST2、SONIC、Humanoid-GPT 等代表性追踪器首次在同一受控实验条件下可比。

与已有工作不同的是,本文的独特切入有三点。第一,把“评测”本身而非“训练”作为研究对象:以往工作竞相提升追踪能力,但报告结果依赖各自的参考集、仿真器、动作表示、初始化与终止规则,难以横向比较;本文反其道而行——保留各方法原生策略观测与动作接口,只标准化参考表示、rollout 统计口径与指标实现,把评测变成受控实验。第二,偏好学习面向的是“同一参考下两条仿真轨迹的相对质量”,而非生成运动的合理性:与 InstructMotion、MotionCritic 等评估文本生成动作品质的工作不同,HumanScore 评价的是闭环追踪 rollout,且直接以仿真器状态(含测得接触力)而非渲染视频为输入,避免相机视角与渲染风格的偏差。第三,数据组织方式独特:按“失败模式”而非活动类型把运动分成四族群,每个族群对应一种追踪压力——稳态支撑与漂移、冲击与快速换支撑、手-身协调、低质心多接触——天然支持“哪里失败、为什么失败”的细粒度诊断。

核心方法

直觉上,论文回答两个问题:测什么,以及怎么测才像人想的那样。测什么:一个 153 小时、按四族群分类的动捕测试床;怎么测:一个从人类成对偏好中学出来的标量分数 HumanScore。技术路线上,数据侧把多相机光学动捕序列拟合为 SMPL 后经 GMR 重定向到统一的 29 自由度人形 qpos 表示,人工剔除浮空、穿地、接触不连续等伪影,按 9:1 划分训练/测试集(同源运动不跨集),每条片段带族群标签、自然语言描述与 SMPL 拟合。评测侧,四个追踪器(GMT、TWIST2、SONIC、Humanoid-GPT)各自保留原生观测与动作解码栈,但共用同一参考运动列表、同一 MuJoCo 评测入口、50 Hz 状态记录;成功判据沿用 SONIC:骨盆/双踝/双腕的垂直位置误差超过 0.25 m、骨盆旋转误差超过 1 rad、或广义位置/速度出现非有限值即判失败,报告完成率 Succ、29 个驱动关节角的 MPJPE(弧度)与 HumanScore。HumanScore 本身是一个时序 Transformer 奖励模型:以 5 秒(250 帧)窗口的仿真轨迹为输入,输出无界奖励 $r_\theta(\tau)\in\mathbb{R}$,经 sigmoid 映射到 $(0,1)$ 后按帧数加权平均成 0–100 分。

核心创新是把“人类偏好对齐”系统性地引入人形追踪评测,与逐帧运动学误差存在三重本质区别。第一,监督信号来自人对同步 rollout 视频的成对比较而非几何距离:6 位人形机器人方向博士先判断是否失败/失衡,再比较抖动、滑步、步态一致性与整体自然度——这种“事件级”判断恰好覆盖滑步、冲击、支撑切换、恢复等逐帧平均看不见的失败单元。第二,输入是特权仿真状态而非视频:每帧 539 维 token 包含当前参考状态(70 维)与 rollout 侧(469 维)的机器人状态、动作、电机目标、测得接触力、足部加速度、根运动与 14 个关键点位姿,让模型直接感知接触物理,同时不依赖相机视角或渲染风格;条件于当前参考也使模型评估的是“追踪质量”而非单纯的运动合理性。第三,时序整合:双向 Transformer 在最长 250 帧(5 秒)上下文上做注意力,敏感性实验显示上下文从 1 秒延长到 5 秒时对齐率从 0.857 稳步升至约 0.91——滑步、渐进漂移这类演化型伪影必须靠时间累积才能识别,这是任何逐帧指标在结构上做不到的。

方法步骤详情

流程分五步。(1) 数据构建:24 位专业表演者多相机光学动捕,SMPL 拟合后经 GMR 重定向到基准人形,人工剔除浮空、穿地、接触不连续段;最终约 152.67 小时、24,995 条轨迹(训练 22,495 条/24,793,129 帧,测试 2,500 条/2,687,461 帧,9:1,同源运动同集),四族群为 Daily 89.29 h/9,739 条、Interaction 47.78 h/10,940 条、Highly Dynamic 11.01 h/2,676 条、Ground 4.59 h/1,640 条。(2) 标准化评测:参考统一转为 29 DoF qpos,各追踪器经同一 MuJoCo 入口执行,50 Hz 记录 qpos/qvel、动作、电机目标、足接触与力、14 关键点位姿与速度;同一状态历史同时用于常规诊断和 HumanScore,避免后处理差异被误认为追踪器差异。(3) 偏好数据构建:仅用训练集运动,四个追踪器对每条参考产生时间对齐的 rollout,切成 250 帧(5 s)窗口,按族群/源运动/时间位置全局排序索引后等距均匀采样,六种追踪器两两组合均衡分配、展示顺序交替且随机化;6 位标注者输出“左好/右好/相似/无法比较”,6,000 对原始标注经左右镜像翻倍为 12,000 条记录,Cannot compare 剔除,按 motion_id 分组做 80/20 划分并对族群、配对、标签、标注者联合均衡。(4) 模型训练:每帧 539 维特征线性投影加正弦位置编码,送入 4 层、$d_{model}=256$、8 头、FFN 1024 的双向 Transformer,掩码平均池化后由 3 层 MLP 奖励头输出标量;严格偏好对用 Bradley–Terry 损失 $\mathcal{L}^{(i)}_{diff}=-\log\sigma(\Delta_i)$,$\Delta_i=r^{(i)}_{chosen}-r^{(i)}_{rejected}$;Similar 对用对称损失 $\mathcal{L}^{(j)}_{similar}=-\frac{1}{2}\log\sigma(\Delta_j)-\frac{1}{2}\log\sigma(-\Delta_j)$;总损失 $\mathcal{L}=\frac{1}{|D|+|S|}\big(\sum_{i\in D}\mathcal{L}^{(i)}_{diff}+\sum_{j\in S}\mathcal{L}^{(j)}_{similar}\big)$;优化用 AdamW、学习率 $1\times10^{-4}$、余弦退火加 10% 预热、batch 8、20 epoch、float32、种子 42。(5) 推理计分:长 rollout 按 $N=\lceil F/250\rceil$ 切窗,短尾窗右侧补零并用有效性掩码从注意力和池化中排除;窗口奖励 $\rho_\theta(s_i)=\sigma(r_\theta(s_i))\in(0,1)$,最终 $\mathrm{HumanScore}(\tau)=100\sum_{i=1}^{N}\frac{L_i}{F}\rho_\theta(s_i)$,即按窗口实际帧数加权平均,训练分布上 $\rho$ 覆盖 $4\times10^{-8}$ 到 0.99,动态范围充足。

技术新颖性

新颖性可从四个层面分析。数据层面:此前人形追踪最常用的测试集仅是 AMASS 的 140 条序列,PHUMA 虽有 76K 片段/73 小时但无类别标注,HumanTracker 以 152.67 小时、24,995 条轨迹、四族群加文本标注同时提升规模与可诊断性(对照 AMASS >40 h、HumanML3D 28.6 h、PHUMA 73 h)。指标层面:用学到的偏好奖励模型替代单一解析诊断的思路在机器人侧已有 RoboReward、Robo-Dopamine 等先例,但它们面向任务完成度或操作进度;本文首次针对“同一参考下闭环追踪质量”训练偏好模型,并以 90.83% 的对齐率显著超过 MPJPE 80.49%、足接触准确率 78.82% 等任何单一指标,还证明其捕捉的品质无法归结为滑步或漂移这类规则诊断。损失与计分设计层面:为 Similar 对设计对称损失,把弱监督“差不多好”也利用起来而非丢弃;计分时按实际帧数加权、补零位置在注意力与池化中双重掩蔽,保证长短窗口统一处理且无填充伪影。协议层面:对齐率按族群内计算再等权平均,配合按源运动分层的 20,000 次 bootstrap(95% CI [87.36, 93.83]),并从构造上排除分布捷径——同源片段不跨划分、族群等权防止 Daily/Interaction 多数族群主导、六种配对均衡防止配对偏置,使结论在统计上站得住。

Motion taxonomy. HumanTracker groups motions into four families according to their dominant tracking and contact regimes. The taxonomy supports category-level diagnosis rather than only a single aggregate score.
Figure 2: Motion taxonomy. HumanTracker groups motions into four families according to their dominant tracking and contact regimes. The taxonomy supports category-level diagnosis rather than only a single aggregate score.
Preference collection interface. Annotators view two synchronized rollouts of the same reference segment. Display order is randomized and the available responses are Left is better, Right is better, Similar and Cannot compare.
Figure 3: Preference collection interface. Annotators view two synchronized rollouts of the same reference segment. Display order is randomized and the available responses are Left is better, Right is better, Similar and Cannot compare.
HumanScore trajectory reward model. Current reference and simulated state features form one token per frame. A temporal Transformer processes the valid tokens, and masked mean pooling forms a trajectory representation. The diagram shows the Bradley–Terry loss on the unbounded rewards rchosen and rrejected for a strict comparison.
Figure 4: HumanScore trajectory reward model. Current reference and simulated state features form one token per frame. A temporal Transformer processes the valid tokens, and masked mean pooling forms a trajectory representation. The diagram shows the Bradley–Terry loss on the unbounded rewards rchosen and rrejected for a strict comparison.

实验结果

主结果有四组。第一,零样本追踪评测(Table 3,所有追踪器均未在测试集上训练或微调):Humanoid-GPT 综合最强,在 Daily 和 Highly Dynamic 上三项指标全领先——Daily 上 Succ 94.4%、MPJPE 0.046 rad、HumanScore 54.7,大幅优于 GMT 的 17.0%/0.250/2.4 和 TWIST2 的 60.1%/0.105/10.1;SONIC 是最接近的竞争者,拿下 Interaction 最高完成率 97.6%,并且在 Ground 上 HumanScore 最高(26.5)。值得注意的分化是:Humanoid-GPT 在 Ground 上完成率更高(32.9% vs 20.1%)但 HumanScore 略低(24.9 vs 26.5),即 SONIC 的地面动作虽更常失败、却被人认为更自然稳定——这种“完成 vs 观感”的质量差异正是聚合型传统指标会掩盖、而分族群+偏好指标能揭示的。第二,Ground 是所有追踪器的重灾区:GMT 与 TWIST2 完成率为 0.0%,最好的 Humanoid-GPT 也仅 32.9%、MPJPE 0.216 rad,验证了低质心多接触场景的挑战,也说明 AMASS 140 条这类小测试集根本暴露不了这些失败模式。第三,偏好对齐(Table 4/9):HumanScore 与人类偏好一致率达 90.83%(95% CI [87.36, 93.83],按族群分层、按源运动聚类的 20,000 次 bootstrap),全面超过 MPJPE 80.49%、MPJVE 84.04%、关键点位置 MAE 84.05%、足接触准确率 78.82%、平均关节加速度 69.33%、平均关节 jerk 72.32%——没有任何单一解析诊断接近学习型指标。第四,敏感性分析(Figure 5):去掉测得接触特征后平均对齐率从 0.908 降到 0.867,其中 Ground 跌幅最大(0.879→0.759),证明接触信息对复杂接触过渡至关重要;只保留运动学特征为 0.878;加入未来参考反而略降(0.905 vs 0.908),说明当前+历史状态已足够评估动作质量;可用上下文从 1 秒延长到 5 秒时对齐率从 0.857 稳步升至约 0.91,证实滑步、重复抖动、渐进漂移、失稳恢复等演化型伪影需要长时上下文才能捕捉。

Comparison of large-scale humanoid motion datasets. HumanTracker uniquely provides approximately 153 hours of motion trajectories explicitly organized into distinct motion categories for comprehensive evaluation.
Table 1: Comparison of large-scale humanoid motion datasets. HumanTracker uniquely provides approximately 153 hours of motion trajectories explicitly organized into distinct motion categories for comprehensive evaluation.
HumanTracker dataset statistics. The benchmark contains approximately 153 hours and 25K clips across four complementary tracking regimes.
Table 2: HumanTracker dataset statistics. The benchmark contains approximately 153 hours and 25K clips across four complementary tracking regimes.
Zero-shot evaluation on HumanTracker. All trackers are evaluated without training or fine-tuning on the test set. We report completion rate (Succ), mean absolute joint-angle error over 29 actuated joints (MPJPE), and perceptual trajectory quality (HumanScore, 0 to 100).
Table 3: Zero-shot evaluation on HumanTracker. All trackers are evaluated without training or fine-tuning on the test set. We report completion rate (Succ), mean absolute joint-angle error over 29 actuated joints (MPJPE), and perceptual trajectory quality (HumanScore, 0 to 100).
Alignment with human preferences. Align Rate is first computed within each motion family on strict test samples and then averaged across Daily, Highly Dynamic, Interaction and Ground.
Table 4: Alignment with human preferences. Align Rate is first computed within each motion family on strict test samples and then averaged across Daily, Highly Dynamic, Interaction and Ground.
HumanScore input features. Dimensions are reported for one frame.
Table 5: HumanScore input features. Dimensions are reported for one frame.
Settings of the reported HumanScore checkpoint.
Table 6: Settings of the reported HumanScore checkpoint.
HumanTracker statistics by motion family.
Table 7: HumanTracker statistics by motion family.
Kinematic coverage of HumanTracker reference motions. Each entry reports median [first quartile, third quartile] across source motions.
Table 8: Kinematic coverage of HumanTracker reference motions. Each entry reports median [first quartile, third quartile] across source motions.
Uncertainty of preference alignment. We report 95% intervals from a bootstrap stratified by motion family and clustered by source motion.
Table 9: Uncertainty of preference alignment. We report 95% intervals from a bootstrap stratified by motion family and clustered by source motion.
HumanScore sensitivity. Align Rate is computed within each motion family and then averaged across 4 families. Panel a evaluates different input feature sets. Panel b restricts the temporal prefix available to the baseline at inference.
Figure 5: HumanScore sensitivity. Align Rate is computed within each motion family and then averaged across 4 families. Panel a evaluates different input feature sets. Panel b restricts the temporal prefix available to the baseline at inference.
查看结构化数据
任务指标本文基线提升
日常运动(Daily)零样本追踪 HumanScore(0–100,越高越好) Humanoid-GPT 54.7 GMT 2.4 +52.3 分(约 22 倍);Succ 94.4% vs 17.0%,MPJPE 0.046 vs 0.250 rad
高动态运动(Highly Dynamic)追踪 Succ 完成率 Humanoid-GPT 86.9%(MPJPE 0.047 rad,HumanScore 49.2) TWIST2 39.9%(MPJPE 0.112 rad,HumanScore 16.9) 完成率 +47.0 个百分点
地面运动(Ground)追踪 Succ 完成率 Humanoid-GPT 32.9%(MPJPE 0.216 rad) GMT 与 TWIST2 均 0.0% +32.9 个百分点;SONIC 观感最好(HumanScore 26.5)
交互运动(Interaction)追踪 Succ 完成率 SONIC 97.6% GMT 81.4% +16.2 个百分点;Humanoid-GPT HumanScore 最高(56.8)
与人类偏好的一致性 Align Rate(严格偏好测试样本,族群等权平均) HumanScore 90.83%(95% CI 87.36–93.83) 最佳单一解析指标:关键点位置 MAE 84.05% +6.78 个百分点;相对 MPJPE 80.49% 提升 10.34 个百分点
接触特征消融(Ground 族群) Align Rate 完整模型 0.879 去除测得接触特征 0.759 接触特征在 Ground 上贡献 0.120 的对齐率

局限与改进

作者在附录 G 中坦承多重边界:HumanScore 仅在 HumanTracker 训练集运动和四个追踪器的 rollout 上训练,其“运动不相交”的测试只衡量对未见运动的泛化,不保证泛化到未见机器人、仿真器或控制器族;539 维输入包含特权仿真状态(接触力等),真机上不可直接观测,迁移到现实轨迹需要可观测特征集或经验证的状态估计器;每对样本只采集一个主要判断,没有重复独立标注,无法量化偏好本身的不确定性;对比的解析指标都是单一诊断,未测试线性/非线性组合指标的上限;四族群刻意不均衡(Ground 仅 4.59 h,远少于 Daily 89.29 h),且只覆盖一个 29 自由度 embodiment 在 MuJoCo 中的仿真,结果不能解释为对全部人类活动的总体估计,也不是硬件鲁棒性证据。我的补充观察:标注者仅 6 人且全部是人形机器人方向博士,偏好分布可能偏“专家视角”,与普通观众的感知差异未经测量;HumanScore 在训练分布上的 sigmoid 输出范围是 $4\times10^{-8}$ 到 0.99,对分布外轨迹(如全新控制风格)的校准情况未知;5 秒窗口的固定切分也意味着计分粒度是人为选择的,不同窗口长度下的表现只在 1–5 秒上下文消融中部分覆盖。

独立分析的弱点

弱点一:特权信息依赖。接触力、qpos 级状态只在仿真中可得,HumanScore 无法直接用于真机 rollout 的质量监控。改进方向:训练一个仅用量测可观特征(IMU、关节编码器、足底接触开关、估计接触概率)的蒸馏版本,或在真实轨迹上用状态估计器替代并重新验证对齐率。弱点二:训练分布窄。偏好数据只来自四个追踪器的 rollout,面对风格截然不同的新控制器(扩散策略、残差控制等),奖励模型可能系统性偏向熟悉的行为模式。改进:随新追踪器迭代扩充偏好池,或加入跨控制器风格的正则化与外分布检测。弱点三:标注规模与人群单一。6,000 对标注全部来自 6 位同领域博士,成本高且视角单一;“无法比较”样本被直接丢弃也损失了信息。改进:引入非专家众包做跨人群校准、多人重复标注以估计标注者一致性,并对无法比较样本建模序数或拒判结构。弱点四:Ground 族群过小(1,640 条/4.59 h),却恰是区分度最大的族群,其指标方差与类别覆盖都受限。改进:定向补采低质心、多接触、摔倒恢复类动作,或按难度重加权。弱点五:分窗计分假设人类偏好在 5 秒粒度可加,长程编排性失败(整段节奏错位、动作衔接生硬)可能被窗口平均稀释。改进:利用注意力权重做关键失败窗定位,或采用可变长度分段与层次化聚合。

未来方向

作者明确提出:把基准扩展到跨 embodiment(不同自由度与构型的人形)、真实机器人 rollout 和更稀有的接触模式;把 HumanScore 从“评测指标”推进到“RL 奖励”,但强调直接优化学得分数会诱导利用模型缺陷的行为,需要显式正则化与独立的人类评估兜底。基于本文成果还可延伸:其一,做“可观测特征版”HumanScore,作为真机遥操作与全身模仿的在线质量监控器和 early-failure 检测器;其二,把偏好模型反向用于数据筛选——自动挑出“难而有用”的参考片段来改进追踪策略训练(论文相关工作已指出该能力可支撑遥操作数据选择);其三,构建“感知分+定位”的调试链:用注意力或特征消融定位失败窗口,再接解析诊断(足接触一致性、关节加速度等)定位具体误差源,把 HumanScore 与 Succ/MPJPE 组合成互补工具集;其四,在生成式人形控制(如 BeyondMimic 的扩散策略)上检验偏好指标是否仍与人类一致,测试跨控制器泛化;其五,扩大偏好标注人群与规模,建立带标注一致性度量的公开人形追踪偏好数据集。

复现评估

复现条件相当好。代码与基准已开源(GitHub: GalaxyGeneralRobotics/HumanTracker;项目页 dairuliu.github.io/humantracker);数据发布格式完全公开:50 Hz NPZ 归档,每个含 7 个数组(qpos $F\times36$、qvel $F\times35$、14 关键点位姿 $F\times14\times4\times4$、关键点速度 $F\times14\times6$、全局速度与位姿、足接触 $F\times2$),共 24,995 个归档且作者做过全量 schema 扫描;训练/测试 manifest(22,495/2,500 条轨迹)与四族群文本标注齐全。奖励模型训练成本很低:4 层 Transformer、$d_{model}=256$、batch 8、20 epoch、float32、种子 42,单张消费级 GPU 即可复现;附录 Table 6 给出全部超参(AdamW、$10^{-4}$、余弦+10% 预热、梯度范数 1.0 等),可精确重建 checkpoint。主要门槛有两处:偏好数据需要 6 名领域专家标注 6,000 对同步视频,外部团队难以原样重建,但划分与均衡协议(motion_id 分组 80/20、族群/配对/标签/标注者联合均衡)写得足够细,重标后可复现实验设计;追踪器评测需跑通 GMT、TWIST2、SONIC、Humanoid-GPT 四套原生策略栈并接入统一 MuJoCo 评测入口,工程量中等。综合评估:指标与数据复现难度低,完整评测流水线复现难度中等。