← 返回 2026-09-09

SynthGait-19K:面向步态参数估计的物理落地合成视频数据集 SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation

Soroush Mehraban, Xin Lei Lin, Vida Adeli, Majid Mirmehdi, Amirhossein Dadashzadeh, Clint Hansen, Andrea Iaboni, Babak Taati 📅 2026-09-08 👍 20 2026-09-12 18:30
临床运动分析 合成数据集 基准评测 步态分析 视频扩散模型

用MoCap驱动深度条件视频扩散构建1.9万段合成步行视频,证明合成监督可有效迁移到真实步态估计。

前置知识

SMPL 参数化人体模型

SMPL(Skinned Multi-Person Linear model)是最常用的参数化人体网格模型,用形状参数 $\beta$ 和姿态参数 $\theta$ 驱动可微网格,经蒙皮变换得到 3D 顶点。运动序列一旦拟合为 SMPL 参数,就获得统一的关节约定与全身表示,不同标记布局的 MoCap 数据可直接对齐混合。

Gait2Vid 流水线的第一步就是把五个异构 MoCap 数据集统一转换成 SMPL 表示,后续的深度渲染、视频合成和全部六个步态参数标注都从这个 SMPL 运动解析导出,不先理解 SMPL 就无法理解整条数据流水线如何保证一致性。

人体网格恢复(HMR)

人体网格恢复指从单张图像或视频中直接回归 3D 人体姿态与形状(通常以 SMPL 参数形式输出)的方法族,代表工作包括 WHAM、CameraHMR、PromptHMR、FastHMR 等。它们先恢复一个中间人体表示,再从重建出的运动序列推导步长、步宽等时空步态量,因此其优化目标是重建精度而非下游步态精度。

本文基准的一整个类别就是现成 HMR 流水线,而且论文最重要的发现之一——更好的 HMR 重建误差并不必然带来更好的下游步态估计——正是通过给 WHAM 加适配器做对照实验得出的,不懂 HMR 就无法理解这个结论的分量。

力板与光学动作捕捉(MoCap)

力板是嵌在步态实验室走道中的测力台,以约 1000 Hz 采样垂直地面反作用力,$|F_z| \geq 20$ N 判定足部接触,是足跟着地时刻的金标准;光学动捕(MoCap)用体表反光标记以毫米级精度记录 3D 关节轨迹。两者构成临床步态测量参照系,但依赖实验室与专业设备。

本文合成标注质量验证的核心就是把 UnderPressure 从 SMPL 运动检测到的 6,092 次足跟着地与 Bertaux 子集的力板实测接触逐一对时,得到 MAE 2.31 帧(约 77 ms)的结果,这一独立验证是『物理落地』主张的关键证据。

深度条件视频扩散(VACE)

VACE 是构建在 Wan2.1-14B 视频扩散模型上的统一生成与编辑接口,支持用深度图序列等控制信号约束生成内容:给定每帧渲染的深度视频和一段文本提示,扩散模型通过逐步去噪生成与该几何结构一致的 RGB 视频。深度条件保证了人物运动轨迹、相机视角与场景几何的精确可控,而文本提示提供外观多样性。

SynthGait-19K 的全部 19,272 段视频都由 Wan2.1-14B-VACE 在 480×832 分辨率、81 帧、50 步去噪设置下生成,理解这一机制才能明白『physically grounded(物理落地)』是如何通过真实运动驱动合成视频实现的。

六个临床步态参数

步态参数是量化步行功能的临床生物标志物,本文含六项:步频(每分钟步数)、步速(骨盆位移除以时间)、步长(相邻足跟着地间前进位移)、步宽(内外侧位移,反映平衡)、前倾姿势(颈-骨盆水平距离除以腿长)、摆臂(腕部前后活动范围除以腿长)。它们是帕金森病、跌倒风险和康复评估的核心指标。

整个数据集的标注、所有基准表格的指标都按这六个参数逐项报告,而且论文反复强调不同参数对视角、域迁移和遮挡的敏感性截然不同,不熟悉参数定义就无法理解 preferred-view 协议和逐参数分析。

Video ViT 与 V-JEPA2 视频编码器

Video ViT 把视频切成时空 patch 并编码为 token 序列;V-JEPA2 是自监督视频预训练编码器。GaitXFormer 以其初始化 24 层 Video ViT($D$=1024),用 6 个可学习 gait query 经 cross-attention 读取视频 token,每参数一个线性头输出标量估计。

GaitXFormer 是本文提出的直接 RGB 参考模型,也是『合成监督能直接迁移到真实视频』这一核心结论的两个载体之一;消融实验还系统比较了冻结/LoRA/全量微调等编码器适配策略。

Pearson 相关与 Fisher z 变换

Pearson 相关 $r$ 衡量预测与真值在序列间变异上的一致性;Fisher z 变换 $z = \frac{1}{2}\ln\frac{1+r}{1-r}$ 把有界的 $r$ 映到近似正态的实数域,使跨参数平均与置信区间构造在统计上成立。论文还用 10,000 次受试者级 bootstrap 构造 95% 置信区间。

论文所有主表(如 Table 4、Table 5)都用 Fisher z 平均的 Pearson 相关作为头号指标,并用 10,000 次 paired bootstrap 报告差异的置信区间,不理解这套指标体系就无法正确解读结果表。

合成到真实域迁移(synthetic-to-real shift)

指在合成视频上训练的模型能否在真实数据上保持性能。本文用 GPJATK 的真实运动生成合成视频(GPJATK-VACE),与真实 GPJATK 共享完全相同的底层运动和相机配置,只改变视觉外观,从而把视觉域变化与运动分布差异解耦,单独量化前者的影响。

这是论文最能体现合成数据集独特价值的实验:结论是空间类参数(步长、步宽)对视觉域变化更敏感,而步频、步速等时序参数几乎不受影响,这类受控结论在纯真实数据集上原理上无法获得。

研究动机

视觉步态评估有巨大临床需求:步速、步频、步长、步宽、前倾姿势和手臂摆动是诊断帕金森病等神经系统疾病、预测老年人跌倒风险、追踪康复进展的关键生物标志物,但金标准工具(IMU、标记式动作捕捉、测力台)依赖实验室环境与专业设备,难以进入常规临床流程,且受控环境下测得的步态常与日常生活中观察到的步态不一致。基于普通单目视频的方案虽然无侵入、可扩展,但训练通常需要力板或 MoCap 提供监督,大规模采集昂贵;步态数据还含有可识别的生物特征信息,导致数据集难以共享。结果是现有数据集规模小、视角单一、受试者外观多样性有限:本文整合的五个公开 MoCap 源合计仅 437 名受试者、6,427 条序列,而既有的任务专用数据集(针对痴呆、脑瘫或仪器化步态实验室人群)更小。这带来两个后果:一是无法评估方法能否超出其采集环境泛化,二是视角、外观、场景因素在真实数据集中总是同时变化,无法分离研究各自对性能退化的贡献。

本文的目标是本文的目标是构建一个大规模、物理落地(physically grounded)的合成步行视频数据集:每段视频由真实记录的 MoCap 运动驱动,配对统一的 SMPL 运动表示和六个临床相关步态参数的精确标注;相机视角(前/后、左右侧视、随机斜角)和场景外观(200 种室内外模板)可以独立于底层运动而变化,从而支持受控的视角敏感性、训练数据规模和合成-真实域迁移研究。作者还希望以它为公共训练源和基准,把直接 RGB、2D 姿态、HMR 重建、生物力学这四类使用截然不同中间表示的方法放到同一真实评测集(GPJATK)下按统一的步态提取协议比较,并提供一个推理高效的直接 RGB 参考模型 GaitXFormer,用于验证合成监督能否以及如何迁移到真实视频。

与已有工作不同的是,已有合成人体数据工作走的是通用重建路线:SURREAL 从 MoCap 生成 SMPL 合成人,AGORA 和 BEDLAM 扩充了外观、服装、场景和相机的多样性,但它们的目标都是人体网格/姿态估计而非定量步态分析。与本文最接近的 Yamada 等人用模拟的肌肉骨骼步态做医疗应用,但其姿态来自仿真投影而非真实世界的 MoCap 录制,物理真实性有差距。本文的独特切入是把『真实 MoCap 运动的物理真实性』与『合成渲染的视觉多样性』结合起来:运动来自五个公开队列,包括 231 名健康人和 206 名临床受试者(髋关节骨关节炎 106、帕金森病 34、近期中风 23、多发性硬化 21、慢性腰痛 10 等);RGB 通过深度条件视频扩散生成;渲染时用平面地面深度约束保证相机稳定;足跟着地标注用 6,092 次力板实测独立验证。这使同一条运动可以被『重新拍摄』到任意视角和场景——这是真实数据集在原理上做不到的,也是本文能把视角效应与运动效应分离的前提。

核心方法

直觉上,这篇论文把真实 MoCap 当作『运动脚本』,把视频扩散模型当作『虚拟摄影棚』:先给每条行走序列一个统一的 SMPL 表示,再由可控虚拟相机渲染出深度视频,最后让深度条件扩散模型把深度『上色』成多样的 RGB 视频,而步态标注直接从 SMPL 运动解析计算。技术上分四步:第一,异构运动统一——五个来源数据集的标记布局与关节约定不同,各自独立插值并转换到 SMPL 运动结构;第二,相机与场景——每条 SMPL 序列从三种配置渲染深度图:前/后视(仅变 pitch)、左右侧视(仅变 pitch)、随机斜视(yaw 均匀采样 $[0°, 360°]$),pitch 从 $[-5°, 45°]$ 采样,并在行走轨迹下方渲染一块平面地面作为稳定几何参照;第三,视频合成——深度序列加文本提示(性别、国籍与环境描述,环境从 200 个室内外模板采样)条件化 Wan2.1-14B-VACE,配合 TeaCache 加速;第四,标注提取——用 UnderPressure 从 SMPL 运动检测足跟着地,再解析计算六个步态参数。生产 campaign 使用最多 48 块 NVIDIA L40S GPU 并行,约 3,131 GPU 小时,从更大的候选池中最终保留 19,273 段视频。

核心创新是把『配对可控性』引入步态视频数据:同一条底层运动被渲染成多种视角和视觉条件,但拟合运动与步态标签保持不变,因此任何性能差异都可以归因于视角或视觉域的变化——这是真实数据集在原理上无法提供的。第二个关键设计是平面地面深度先验:作者发现只渲染人体深度会让扩散模型产生虚假的相机 pitch 和尺度抖动(Figure 6 中红线标示的地平线失稳),在行走方向上铺一块宽度随机、深度恒定的平面后,生成视频隐式获得静态相机约束,显著提升时间一致性并消除相机漂移。第三,标注链路完全物理化且经独立验证:UnderPressure 检测的足跟着地在 Bertaux 力板子集的 6,092 次实测接触上达到 MAE 2.31 帧(约 77 ms)、82.3%/91.7% 落在 3/5 帧内,使合成标注有可量化的可信度而非『合成即真值』的假设。与之并行的 GaitXFormer 则代表另一个主张:与其先重建中间人体再推导步态,不如让 6 个 gait query 直接从视频 token 中检索证据回归参数。

方法步骤详情

第一步,运动统一:五个 MoCap 数据集的原始标记轨迹各自插值并拟合为 30 FPS 的 SMPL 序列。第二步,深度渲染:从前/后视、左右侧视、随机斜视三种配置渲染深度图(pitch 采样自 $[-5°, 45°]$,斜视 yaw 均匀取 $[0°, 360°]$),并在轨迹下方渲染静态平面地面,输出即扩散模型控制条件。第三步,RGB 合成:深度序列加文本提示(200 个室内外场景模板)条件化 Wan2.1-14B-VACE,480×832、81 帧、50 步去噪、TeaCache 加速。第四步,标注提取:UnderPressure 从 SMPL 运动检测足跟着地,解析计算六参数——步频 $= (N_{HS}-1)/fps \times 60$;步速为首末足跟着地间骨盆位移除以时间;步长、步宽为相邻步间位移 $|z_{i+1}-z_i|, |x_{i+1}-x_i|$ 的均值;前倾姿势 $s = \frac{1}{T}\sum_t \frac{z_{neck}-z_{pelvis}}{L_{leg}}$;摆臂为腕部前后活动范围除以腿长。第五步,验证与划分:Sapiens2 比对生成与真实视频的投影运动学,Bertaux 子集力板验证足跟着地时序,受试者级 80/20 划分。

技术新颖性

技术新颖性有四点。其一,任务导向的合成数据:此前合成人体数据(SURREAL、AGORA、BEDLAM)服务于通用重建,本文首次把深度条件视频扩散用于生成带临床级步态标注的大规模 RGB 数据,并用真实力板实测为标注背书。其二,可控变量分解:同一运动的多种视角/场景渲染把真实数据集中纠缠的视角、外观、场景因素解耦,使论文能报告『空间参数对域迁移更敏感』『前倾姿势只能侧视估计(正/背视 $r$ 仅 0.26/0.24)』这类其他数据集无法得出的结论。其三,几何先验工程:平面地面深度约束解决扩散生成中的相机漂移,是简单但必要的发现。其四,跨表示统一基准与直接模型:以同一提取协议统一评测四类方法,并提出 V-JEPA2 加 gait-query cross-attention 的 GaitXFormer——消融显示 cross-attention 解码器(平均 $r$=0.84)优于平均池化与 Transformer 解码器(均 0.82),全量微调(0.84)优于 LoRA-16/32/64(0.80/0.81/0.80)与冻结(0.76),推理仅 0.27 秒/片段而基线需 1.21–139.10 秒。

Overview of the synthetic video generation pipeline.
Figure 2: Overview of the synthetic video generation pipeline.
Qualitative samples from SynthGait-19K showing the diversity of generated subjects, environments, viewpoints, and walking motions.
Figure 3: Qualitative samples from SynthGait-19K showing the diversity of generated subjects, environments, viewpoints, and walking motions.
GaitXFormer overview.
Figure 4: GaitXFormer overview.
Effect of adding a synthetic ground plane on camera stability.
Figure 6: Effect of adding a synthetic ground plane on camera stability.
Distribution comparison of gait parameters in SynthGait-19K and GPJATK.
Figure 7: Distribution comparison of gait parameters in SynthGait-19K and GPJATK.

实验结果

核心发现:(1) 运动学保真——生成视频 BBox-NMPJPE 2.32% 反优于真实视频的 3.41%,合成未破坏运动;(2) 标注有效——6,092 次力板足跟着地上时序 MAE 2.31 帧(约 77 ms);(3) 真实基准——GPJATK 上 GaitXFormer Fisher 平均 $r$=0.84(步频 0.94、摆臂 0.91)居首,STT†(同源训练)0.82 且步长 0.73 最佳,原版 STT 仅 0.20;(4) 域迁移——合成 0.87 降至真实 0.84,空间参数(步长/步宽 0.74→0.67、0.77→0.67)下降而时序参数稳定;(5) 重建≠步态——WHAM 姿态误差降 7.43%,步态相关却仅升 0.0035(CI 含零);(6) 视角与规模——步频跨视角最稳,前倾只能侧视(0.75 vs 正/背 0.26/0.24),数据 25%→100% 相关 0.79→0.84;(7) 临床迁移——PD4T 上 UPDRS 分类准确率 71.3%→76.0%,步速/步长/摆臂与严重度相关 $\rho$=-0.83/-0.83/-0.75,超 91% 方向一致;(8) 遮挡与统计——上身遮挡使前倾从 0.75 崩至 0.20;对 WHAM 显著优(Δ=0.133),对 STT† 不显著。

Composition of SynthGait-19K and real-video evaluation data.
Table 1: Composition of SynthGait-19K and real-video evaluation data.
Kinematic fidelity of VACE-generated GPJATK videos.
Table 2: Kinematic fidelity of VACE-generated GPJATK videos.
UnderPressure heel-strike validation against force-platform measurements.
Table 3: UnderPressure heel-strike validation against force-platform measurements.
Preferred-view comparison across gait parameters.
Table 4: Preferred-view comparison across gait parameters.
Synthetic-to-real transfer analysis.
Table 5: Synthetic-to-real transfer analysis.
Effect of SynthGait supervision on WHAM.
Table 6: Effect of SynthGait supervision on WHAM.
Viewpoint-wise Pearson correlation (r) of GaitXFormer on GPJATK.
Table 7: Viewpoint-wise Pearson correlation (r) of GaitXFormer on GPJATK.
Effect of training-data scale on gait-estimation performance.
Table 8: Effect of training-data scale on gait-estimation performance.
UPDRS classification on PD4T using frozen video encoders under leave-one-subject-out evaluation.
Table 9: UPDRS classification on PD4T using frozen video encoders under leave-one-subject-out evaluation.
Patient-aware clinical-anchor analysis on PD4T.
Table 10: Patient-aware clinical-anchor analysis on PD4T.
Preferred-view comparison using Mean Absolute Error (MAE).
Table 11: Preferred-view comparison using Mean Absolute Error (MAE).
View-averaged comparison across gait parameters.
Table 12: View-averaged comparison across gait parameters.
Viewpoint-wise Pearson correlation (r) of WHAM on GPJATK.
Table 13: Viewpoint-wise Pearson correlation (r) of WHAM on GPJATK.
Effect of decoder design on gait-estimation performance.
Table 14: Effect of decoder design on gait-estimation performance.
Effect of encoder training strategy.
Table 15: Effect of encoder training strategy.
Effect of input length on gait-estimation performance.
Table 16: Effect of input length on gait-estimation performance.
Controlled occlusion robustness on GPJATK.
Table 17: Controlled occlusion robustness on GPJATK.
Paired participant-bootstrap comparison on GPJATK.
Table 18: Paired participant-bootstrap comparison on GPJATK.
Accuracy–runtime trade-off.
Figure 5: Accuracy–runtime trade-off.
Distribution of PD4T samples across UPDRS severity classes.
Figure 8: Distribution of PD4T samples across UPDRS severity classes.
Confusion matrices for PD4T severity classification using frozen V-JEPA2 and GaitXFormer backbones.
Figure 9: Confusion matrices for PD4T severity classification using frozen V-JEPA2 and GaitXFormer backbones.
Smartphone deployment of GaitXFormer.
Figure 10: Smartphone deployment of GaitXFormer.
Controlled spatial occlusion settings.
Figure 11: Controlled spatial occlusion settings.
Transient occlusion setting.
Figure 12: Transient occlusion setting.
查看结构化数据
任务指标本文基线提升
真实视频步态参数估计(GPJATK,preferred-view 协议) Pearson 相关 $r$(六参数 Fisher z 平均) GaitXFormer 0.84(步频 0.94、步速 0.88、摆臂 0.91) 最佳现成基线 WHAM 0.70(其余 OpenCap-M 0.68、PromptHMR 0.67、PBL 0.60、CameraHMR 0.59、FastHMR 0.54) +0.14(对 WHAM 的配对 bootstrap Δ=0.133,95% CI [0.086, 0.183])
同基准下 2D 姿态架构对照(STT 架构) Pearson 相关 $r$(Fisher 平均) STT†(在 SynthGait-19K 上从头训练)0.82,步长 0.73 为全场最佳 原版发布 STT 0.20(步频 0.20,脑瘫侧视数据训练,跨集迁移差) +0.62,证明数据集价值不依赖于特定模型架构
推理效率(5 秒行走片段,单块 RTX3090) 单片段端到端时延(秒) GaitXFormer 0.27 s(STT 本体 0.32 s 但还需 OpenPose 预处理) 评测基线 1.21–139.10 s(含预处理) 快约 4.5–515 倍,准确率-耗时权衡最优(Figure 5)
帕金森严重度分类(PD4T,1,666 段视频,留一受试者交叉验证) 准确率 / 宏 F1 GaitXFormer 冻结编码器 76.0% / 73.3% V-JEPA2 预训练编码器 71.3% / 69.1% +4.7 / +4.2 个百分点
临床严重度关联(PD4T 受试者内分析) Spearman $\rho$ 与方向一致率 步速 $\rho$=-0.83(97.9% 方向一致)、步长 -0.83(97.9%)、摆臂 -0.75(91.5%),SRM 1.37/1.39/1.24 临床预期方向(指标应随 UPDRS 恶化而下降) 超过 91% 的受试者内比较符合预期临床方向
合成标注有效性验证(Bertaux 力板子集) 足跟着地时序 MAE 2.31 帧(约 77 ms),82.3% 在 3 帧内、91.7% 在 5 帧内(6,092 次接触) 力板实测接触($|F_z| \geq 20$ N 阈值,1000 Hz)作为参照 验证性实验,确立合成标注可信度

局限与改进

作者承认的限制:合成数据未覆盖真实世界全部变化,特别是严重遮挡、助行器具、更广的服装与临床多样性;固定 5 秒窗口无法捕捉冻结步态等长时程现象;评测以 GPJATK 为中心(32 人、608 段视频),PD4T 仅辅助验证。我自己的观察:第一,标注质量上限受 SMPL 拟合与 UnderPressure 约束——作者明确说明拟合 SMPL 不是独立标记级真值,力板只覆盖走道一段,验证的是时序而非步长/步宽的绝对精度(Table 11 显示 GaitXFormer 步长 MAE 达 0.19 m);第二,生成域的人体外观由扩散模型『想象』,极端体型或异常病理步态能否被 VACE 忠实渲染未验证,且临床受试者中骨关节炎占 106/206,神经系统重障偏少;第三,合成域相关整体高于真实域(0.87 vs 0.84)提示残余域差距,空间参数的下降说明深度到 RGB 的纹理/尺度线索仍不完全可迁移;第四,分布分析(Figure 7)显示 SynthGait-19K 覆盖 GPJATK 分布,但超出部分的外推风险未知;第五,与 STT† 的差距置信区间含零,直接 RGB 相对姿态输入并无统计学显著优势,架构结论应谨慎。

独立分析的弱点

独立分析的弱点与改进方向:(1) 空间参数绝对精度差——真实 GPJATK 上步长相关仅 0.67、MAE 0.19 m,持续下身遮挡使步宽从 0.67 崩到 0.27,改进方向是引入尺度/几何自监督(如利用生成时已知的地面平面做度量一致性约束)或放置已知尺寸参照物。(2) 域差距集中在空间参数——GPJATK-VACE 到真实 GPJATK 步长从 0.74 掉到 0.67,可用更强纹理/光照域随机化、少量真实数据微调或域对抗训练收窄。(3) 前倾姿势的单一视角依赖(正/背视 $r$ 仅 0.26/0.24)在自由拍摄场景是硬伤,可做多视角特征融合或跨视角一致性正则。(4) 『重建提升不带来步态提升』暴露了步态指标对 HMR 中间误差的敏感性错配,而本文 WHAM 适配器只精调姿态/形状/尺度、主干完全冻结,可能限制上限,应以六参数损失端到端微调 HMR 主干。(5) 5 秒窗口排除步态时序病理(冻结、起步犹豫),可扩展为滑动窗口聚合或长上下文编码器。(6) 临床有效性仅在 PD4T(30 人、UPDRS 2 仅 35 次试验)横断面验证,缺少前瞻性、多中心、含跌倒等硬终点的纵向研究。

未来方向

作者提出与可延伸的方向。作者明确列出:覆盖更广真实变化(遮挡、助行器、服装、临床多样性)的后续数据;超越 5 秒窗口的长时程步态现象(如冻结步态);在更广泛队列上验证泛化。基于成果可延伸的:(1) 用更快的新一代视频生成骨干替换 Wan2.1-VACE 以降低成本——作者指出 3,131 L40S 小时是当前配置的成本而非 Gait2Vid 的固有需求;(2) 把 Gait2Vid 从平地行走扩展到楼梯、转身、坐站转移等功能性动作;(3) 在提示词中注入临床语义,探索『步态编辑』(如把健康步态可控地改成帕金森化步态)用于反事实数据增强与鲁棒性测试;(4) 步态感知的 HMR 微调:以六参数损失端到端训练 WHAM 类主干,直接检验重建-步态脱钩能否被打破;(5) 跨视角一致性正则与多视角融合,解决前倾姿势等参数的视角脆弱性;(6) 在已有的手机端全流程(iPhone 17 上含 YOLO11n 检测约 8.2 秒完成)基础上开展家庭环境纵向监测,与跌倒风险预测、药物反应评估等下游临床终点对接;(7) 利用合成数据不含可识别个人信息的特点,探索『合成预训练 + 最少真实数据微调』的隐私友好临床部署范式。

复现评估

复现评估:数据源全部公开——五个 MoCap 来源(Schreiber & Moissenet、Santos、Bertaux、Grouvel、Warmerdam)与评测集 GPJATK、PD4T 均为公开数据,法律障碍小;方法组件均为公开模型/代码(SMPL、UnderPressure、Wan2.1-14B-VACE、TeaCache、V-JEPA2、Sapiens2、RTMPose、YOLO11n)。算力门槛中等偏高:视频生成动用最多 48 块 NVIDIA L40S、约 3,131 GPU 小时(含未保留候选),小实验室难以完整重跑,但若作者发布成品数据集则下游无此门槛;GaitXFormer 训练仅需 4 块 L40S、100 epochs、batch 16(AdamW,lr 1e-4),STT† 更轻。透明度良好:补充材料给出六参数完整公式、力板验证细节、架构规格(24 层 ViT、D=1024、T=32、256×192)、全部消融与 10,000 次 paired bootstrap 协议。复现难度:直接训练评测为『容易到中等』;端到端重造生成管线为『昂贵且依赖工程细节』,依赖作者发布数据集与代码。