解码儿童步态行为:从RGB视频实现儿童步态的精细分析 Decoding Children's Gait Behavior
构建CGV儿童步态数据集,提出ChildGait-Video从RGB视频自动评估EVGS
前置知识
EVGS(爱丁堡视觉步态评分)
EVGS 是一种临床观察工具,用于通过冠状面和矢状面视频评估儿童的步态偏差。它对每条腿的 17 个观察性评分项打分,每项采用三点序数量表:0 表示正常(正常均值 ±1.5 个标准差内),1 表示中度偏差(1.5–4.5 个标准差),2 表示显著偏差(>4.5 个标准差)。评分项覆盖初始着地、足跟离地、踝/膝/髋关节角度、骨盆倾斜旋转、躯干姿态等细粒度步态特征,是诊断脑瘫等神经肌肉发育障碍的重要依据。
本文整个任务就是把视频自动映射到 EVGS 的逐项评分上,理解 EVGS 的分项结构(如 IC、HL、SAD、KPA 等)和三点量表的含义,是理解数据集标签、二值化策略(合并1和2)以及评估指标的前提。
VideoMAE v2 视频基础模型
VideoMAE v2 是基于遮掩自编码(Masked Autoencoder)的视频基础模型,先在海量无标注视频(如 UnlabeledHybrid)上通过随机遮掩大部分时空 patch 来重建像素进行自监督预训练,再在 Kinetics-710 上监督微调获得人体动作识别能力。它采用 ViT 编码器,将视频切分为时空 patch 并做嵌入。本文以它作为 ChildGait-Video 的视觉主干。
本文的核心方法 ChildGait-Video 正是在 VideoMAE v2 基础上做两阶段适配(Kinetics-710 预训练→CGV 微调),并复用了 MAE 的 patch 丢弃机制来实现掩码引导剪枝。理解它的 patch 化结构和遮掩思想,才能理解两个创新模块为何能无缝嵌入。
Vision Transformer(ViT)的 patch 与 token
ViT 将图像或视频帧切分为固定大小(如 16×16)的非重叠 patch,每个 patch 经线性投影成一个 token,加上位置编码后输入 Transformer 编码器,通过自注意力在全局聚合信息。视频时空 patch 还包含时间维度。token 是自注意力计算和特征聚合的基本单位,patch 级别的设计(哪些被保留、哪些被遮掩)直接影响模型关注的内容。
本文两个核心创新都在 patch/token 级别操作:Token 级运动提示把骨骼关键点渲染到帧上使其成为特殊 token,掩码引导剪枝则根据前景 mask 决定保留哪些 patch、丢弃哪些 patch。不理解 ViT 的 patch 机制就无法理解这两个模块。
步态周期与步态相位
一个完整的步态周期指一只脚从首次着地(initial contact)到下一次同一只脚着地的过程,分为支撑相(stance,脚接触地面)和摆动相(swing,脚在空中)。精细的步态分析需要在特定相位上估计关节角度(如摆动相的峰值膝屈曲、支撑相的峰值膝伸展)。儿童步态因发育不成熟而具有高熵、高类内方差和运动模式不一致的特点。
EVGS 评分项大多是相位相关的(如支撑相、中支撑、终末摆动),需要在特定相位捕捉亚秒级偏差。理解步态周期和相位,才能理解为什么需要足够的采样帧数(T=16/32)来覆盖关键相位转换,以及为什么成人中心模型在儿童上失效。
掩码引导剪枝与软标签交叉熵
掩码引导剪枝指利用实例分割得到的前景二值 mask $M \in \{0,1\}^{H\times W}$,确定性保留那些前景像素占比足够高的 patch,丢弃背景 patch,从而抑制噪声并降低计算量。软标签交叉熵的损失为 $\mathcal{L}_{video}(\theta)=-\sum_{k\in\{0,1\}} q_k \log(\text{Softmax}(L(\theta))_k)$,其中 $q=(\lambda,1-\lambda)$ 反映正负样本比例,用于缓解类别不平衡。
掩码引导剪枝是本文相对随机遮掩和包围盒遮掩的关键改进点,软标签交叉熵则是训练分类头时缓解 EVGS 严重类别不平衡的核心机制。理解这两个设计才能看懂消融实验中各模块的增益。
研究动机
儿童步态的定量分析对脑瘫、偏瘫等发育与神经肌肉障碍的诊断和康复管理至关重要,但目前依赖儿科医生在门诊的主观目测,存在显著的主观性和评分者间差异。基于 3D 动捕和 IMU 的客观测量系统虽已识别出脑瘫步态偏差的定量预警信号,但落地困难:动捕需要大场地和多个无遮挡视线,易偏向资源充足的大型医院而加剧不公平;IMU 需贴附在儿童身上,部分儿童无法耐受,还会引发反应性效应——即测量装置本身改变了自然步态。更关键的是,现有计算机视觉步态方法几乎全部聚焦于健康成人,建立在“步态成熟、稳定、高度周期”的假设上,无法捕捉儿童发育运动系统的高熵、高类内方差和不一致运动模式,存在严重的域偏移。
本文的目标是本文要在标准 RGB 视频(仅一两个视角、无需穿戴设备)的前提下,把儿童(3–17 岁)步态的细粒度分析确立为一个新的计算机视觉问题,并构建一套端到端可用的解决方案。具体目标有三:一是构建并开源首个面向临床的多视角儿童步态视频数据集 CGV,包含丰富的逐帧标注(实例分割 mask、检测框、解剖关键点)和经专家评审的 EVGS 逐项临床评分;二是系统评估当前最强的基础模型(零样本多模态大模型、微调视频语言模型、步态识别与骨架模型)能否解决这一临床任务;三是提出专门的 ChildGait-Video 模型,在所有 34 个双侧评分项上实现自动化、可复现的 EVGS 推断基线。
与已有工作不同的是,本文的独特切入角度有三层。第一,填补“缺乏专门面向儿童临床步态筛查的多视角视频数据集”这一关键瓶颈——既有大规模数据集(如 OULP-Age、CASIA、OU-ISIR、SUSTech1K)要么面向生物识别身份识别、要么面向健康成人或野外步态,没有覆盖儿童特有的生物力学发育轨迹和病理表现。第二,首次全面揭示了“基础模型在儿童临床步态上集体失效”这一现象:零样本 MLLM、微调 VLM、SoTA 步态识别模型 BiggerGait 都只有 45%–60% 的接近随机水平,说明通用语义级表征无法替代定量生物力学解释。第三,方法上摒弃了“姿态估计→关节角几何计算→规则评分”的多阶段几何范式,转而用端到端视频建模,并通过把解剖先验显式注入到 token 级别来弥补基础模型对儿童先验的缺失。
核心方法
整体思路是用通用视频基础模型的强时空表征,叠加显式儿童解剖先验与前景聚焦,端到端预测 EVGS。直觉上,成人中心模型预训练从未见过儿童特有骨骼比例,缺乏解剖理解,而临床评分高度依赖细微关节角偏差,因此单纯微调不足,需把专家标注的骨骼关键点作为运动提示渲染到 RGB 帧、把分割前景作为注意力焦点。技术路线分两阶段:先在 Kinetics-710 预训练获取人体动作识别能力,再在 CGV 上带两个新模块(Token 级运动提示 TKP、掩码引导 patch 剪枝 MPP)监督微调。视频降采样到 30 FPS,训练时随机裁剪 $M=4$ 个时间窗、每窗采样 $T=16$ 帧,测试取中心窗 $T=16$ 帧。视觉输入经 ViT 后做时空全局平均池化,再用线性头投影成二分类 logit,以 AdamW($\eta=10^{-4}$、权重衰减 0.05、batch size 每 GPU 8)训练,硬件为 10 块 NVIDIA L40S。
核心创新点是用两个轻量但本质性的改造把通用视频基础模型“儿科化”。与已有方法的本质区别在于:(1)传统步态识别网络(GaitSet、BiggerGait 等)目标是提取全局时空表征做身份判别,忽略临床评分所需的局部细微运动学细节,且预训练数据是健康成人、与儿童病理步态存在域鸿沟;本文不追求身份不变性,而是直接端到端回归临床评分。(2)传统多阶段几何流水线把高维视频压缩成稀疏骨架再算关节角,丢失了丰富的外观纹理且误差逐级累积;本文保留全帧 RGB,并通过 token 级渲染把关键点“画”到帧上——在 ViT 切 patch 时,含关键点的 patch 自然成为混合了外观与解剖拓扑的“运动 prompt token”,让自注意力同时关注细粒度关节角和全局身体形态。(3)相比随机遮掩或包围盒遮掩,掩码引导剪枝用实例分割二值 mask $M$ 精确定位前景,只保留前景占比足够的 patch($N_{foreground}\ll N_{total}$),既消除背景噪声又显著降低计算量。
方法步骤详情
完整流程为六步。①采集标注:用主副相机同时记录冠状与矢状面,规格 1920×1080、60 FPS;以 SAM 3 分割、Sapiens-2B 姿态估计,人工校正得包围框、关键点与逐项 EVGS(资深医生复核,专家间 ICC=0.93)。②匿名化:RetinaFace 检测人脸、SAM 3 分割后做马赛克遮挡,双重人工核对保证 100% 去标识。③任务形式化:三分制 EVGS 合并 1 与 2 成二分类,按 Patient ID 做对象级 6:1 划分防身份泄漏。④模型构建:把关键点渲染到帧得 $\hat{I}_t=R(I_t,K_t)$,按前景 mask 确定性剪枝保留前景 patch,经 ViT 与时空全局平均池化得特征,线性头输出 2 维 logit 取 argmax。⑤训练:最小化软标签交叉熵 $\mathcal{L}_{video}=\sum_{k}q_k\log(\text{Softmax}(\mathbf{L})_k)$,$q=(\lambda,1-\lambda)$,前 5% 轮线性预热。⑥评估:逐项报告百分比准确率、双侧 34 项平均与 F1。
技术新颖性
技术新颖性体现在三方面。一是问题与数据的新颖——首次把“从 RGB 视频做儿童步态的细粒度临床评分”正式确立为视觉任务,并构建了目前最大、唯一开源的儿童多视角步态视频数据集 CGV(339,236 帧、1,185 段视频、110 名患者、17×2 项 EVGS、多诊断标签、逐帧 mask/关键点)。二是 token 级运动提示(TKP)的新颖——不是把关键点作为独立模态分支,而是直接渲染进 RGB 帧,借助 ViT 的 patch 化让解剖拓扑成为与视觉 token 自然混合的“prompt”,省去跨模态融合的复杂结构,消融显示 TKP 单独带来 L/R 平均准确率 +3%/+2%。三是掩码引导 patch 剪枝(MPP)的新颖——复用 MAE 的 token 丢弃机制但改为由前景 mask 确定性引导,相对随机遮掩(-1%/-2%)、包围盒遮掩(+6%/+5%)取得 +9%/+7% 的最大单项增益,证明自适应前景过滤显著优于朴素背景抑制。这三者叠加使 ChildGait-Video 把 VideoMAE v2 基线的 69%/72% 提升到 84%/84%。
实验结果
实验证明通用模型失效、专门模型有效。其一,零样本 MLLM(表 2):Gemini 3 Pro、GPT-5.2、Qwen3-VL-235B 等左右肢平均仅 50%–60%,略高于随机,对细微项薄弱,说明其偏向语义理解而非定量生物力学。其二,微调 VLM(表 3):Qwen3-VL-4B 微调后左右肢平均仅升 2%/1%,部分项反降,证明因果语言建模在细粒度动作识别上有根本局限。其三,步态/视频模型(表 4):SoTA 步态模型 BiggerGait 等仅 45%–56%;VideoMAE v2 微调跃升至 69%/72%。其四,本文 ChildGait-Video 达 70%–93% 逐项准确率,左右肢平均均 84%、F1 均 0.83,相对 VideoMAE v2 升 15%/12%;McNemar 检验 $(b,c)=(28,6)$,$p<0.001$,改进高度显著。其五,骨架基线 ScoNet 达 68%/70% 仍不及本文。其六,帧数消融显示 8→16→32 帧使准确率 74.1%→87.0%→90.7%,模块消融确认 TKP +3%、MPP +9%/+7%,随机遮掩反掉点。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| EVGS 逐项二分类评分(左肢 17 项平均,CGV 测试集) | 平均准确率 L-AVG | 84% | 69% (VideoMAE v2) / 54% (BiggerGait) | +15% 相对 VideoMAE v2,+30% 相对 BiggerGait |
| EVGS 逐项二分类评分(右肢 17 项平均,CGV 测试集) | 平均准确率 R-AVG | 84% | 72% (VideoMAE v2) / 53% (BiggerGait) | +12% 相对 VideoMAE v2,+31% 相对 BiggerGait |
| EVGS 双侧 34 项整体评分(CGV 测试集) | 平均 F1 分数 | 0.83 | 0.70/0.71 (VideoMAE v2) / 0.51-0.53 (BiggerGait) | F1 提升 0.12-0.13 相对 VideoMAE v2 |
| 零样本多模态大模型步态评分(CGV 测试集) | 左右肢平均准确率 | 84%/84% (ChildGait-Video) | 50%-60% (Gemini 3 Pro/GPT-5.2/Qwen3-VL-235B 等) | 相对最强零样本 MLLM 高约 24-34 个百分点 |
| 初始着地项 IC 的输入帧数消融 | 准确率 | 90.7% (T=32, F1 0.92) | 74.1% (T=8) | +16.6 个百分点(8→32 帧) |
局限与改进
作者承认的局限主要有三:其一,当前研究只完成了模型层面的稳健验证,数据采集局限于单一临床环境,尚未扩展到家庭、康复中心、社区等开放场景,对复杂病理步态和不可控采集条件的泛化能力有待验证;其二,尽管 CGV 是同类最大数据集,110 名受试者的规模对训练大模型仍偏小;其三,出于隐私保护,仅公开匿名化后的儿童姿态序列,原始视频需单独授权、不得用于训练基础模型,这限制了外部复现与二次利用。我观察到额外几点局限:EVGS 被二值化(合并 1 与 2),丢失了中度与重度偏差的区分,临床价值有所折损;诊断标签仅覆盖脑瘫、TBI、DDH、Toe-in、ITW 等少数病种,未涉及自闭症谱系等作者在引言中畅想的关联;数据来自单一亚洲儿童医院,存在地域与设备偏倚,跨人群泛化未经验证;缺乏与金标准 3D 动捕的临床指标级对照,方法仅以专家 EVGS 为准,难以判断其相对客观生物力学的真实精度。
独立分析的弱点
独立分析来看,本文存在若干可改进的弱点。第一,数据规模与多样性不足——110 名受试者、单一医院、单一亚洲人群,外推到其他种族、年龄段或病种存在风险;改进方向是联合多中心、多地区采集,并补充自闭症谱系、神经发育障碍等更多病种标签。第二,任务粒度被过度简化——三分制 EVGS 被二值化,损失了中度/重度区分,对临床分级的实用性打折;改进方向是直接做三分类或序数回归,引入等级感知损失(如 ordinal contrastive loss)缓解类别不平衡。第三,评估缺乏金标准对照——仅以专家 EVGS 为标签,未与 3D 动捕的关节角、GDI 等客观指标对标;改进方向是采集小规模带 3D 动捕标注的子集做联合校准。第四,对时序长度敏感——32 帧仅 1.06 秒、覆盖 2-3 个步态周期,对慢速或异常儿童可能不足以捕捉完整周期;改进方向是引入可变长序列建模或动作分割以自适应选取完整步态周期。第五,方法强依赖前景分割质量,当儿童与家长/医生严重遮挡、多人交互时 mask 易失效;改进方向是引入多目标跟踪与遮挡鲁棒的分割模型,或对遮挡帧做时序插值。
未来方向
作者明确提出的未来方向是:把框架从临床采集扩展到家庭、康复中心、社区等开放场景数据,提升算法在复杂病理步态和不可控采集条件下的泛化,实现可复现的纵向追踪和跨机构标准化,从而支撑大规模康复效果评估与数据驱动的康复研究。基于本文成果还可延伸出多个方向:一是探索细微步态偏差能否作为自闭症谱系障碍、脑机接口辅助技术疗效等早期/疗效指标;二是把 EVGS 推断与 3D 动捕、可穿戴 IMU 融合,构建多模态客观步态量化体系;三是把方法从“评分”扩展到“可解释诊断”——生成关节级、相位级的解释,辅助医生理解模型判断依据;四是研究轻量化部署,让模型在手机或边缘设备上实时运行,真正实现“一两个相机即可筛查”的临床普惠目标;五是探索序数回归与多任务学习,联合预测 17 项评分及整体诊断。
复现评估
复现评估整体中等偏上。代码与数据方面,作者提供项目主页(pediamedai.com/ChildrenGait)和 HuggingFace 数据集,姿态序列在 CC BY-NC 4.0 下公开,但原始视频及标注需单独授权且不得用于训练基础模型——这意味着外部研究者难以完全复现训练(特别是依赖原始 RGB 帧的 TKP/MPP),但可在公开姿态序列上做骨架级复现与评测。训练细节披露充分:优化器 AdamW、学习率 $\eta=10^{-4}$、权重衰减 0.05、前 5% 轮线性预热、batch size 每 GPU 8、10 块 NVIDIA L40S、训练时随机裁剪 $M=4$ 个时间窗每窗 $T=16$ 帧、测试取中心窗 $T=16$ 帧;评估协议(按 Patient ID 做对象级 6:1 划分、逐项准确率/F1、McNemar 显著性检验)也清晰可复算。模型架构基于公开的 VideoMAE v2 与 Kinetics-710 预训练权重,SAM 3、Sapiens-2B 均为公开模型。主要门槛在于算力(10×L40S)和受控的临床视频获取,对学术小团队而言中等偏高难度。
论文图表
图 2 概览了 CGV 数据集:包含 110 名儿科患者,每次评估覆盖两个身体平面共 2×17=34 项 EVGS 评分;左侧展示儿童身体平面(矢状面/冠状面),右侧展示各 EVGS 评分项在全体患者上的标签分布,直观呈现了类别严重不平衡(特别是 score 2 极端偏差样本稀少)。
这张图解释了为何作者把三分制 EVGS 二值化为典型/非典型二分类——极端偏差样本过少导致难以训练稳健的三分类器,这一设计决策直接影响了后续所有模型的目标设定与评估方式。
图 5 展示了 CGV 的人口统计学构成:(a) 年龄分布直方图叠加正态拟合曲线,受试者年龄跨度 2.6–16.6 岁、均值 $\mu=8.40$、标准差 $\sigma=3.14$ 岁;(b) 性别分布为男性 58.2%、女性 41.8%,总体接近平衡。文内还报告按年龄分层(≤8 岁 vs ≥8 岁)的平均准确率为 82.4% 与 85.2%,说明低龄儿童更难分析。
该图帮助读者把握数据集的代表性与潜在偏差——年龄集中在学龄前/学龄期、性别近平衡,且揭示了模型在低龄儿童上性能下降这一临床相关的难点,对理解方法局限与适用人群很重要。