GNM Head:一种生成式人体测量头部参数化模型 GNM Head: A Generative aNthropometric Model of the human head
Google 提出 GNM:首个统一刻画皮肤、眼、牙、舌的生成式头部模型。
前置知识
3D Morphable Model (3DMM, 三维形变模型)
一类把人脸/人头的复杂三维几何与外观蒸馏到低维、可控潜空间的统计框架,起源于 Blanz & Vetter 1999 用 PCA 把形状和纹理表示成若干样例子网格的线性组合。给定身份系数与表情系数,就能生成或重建一张几何合理的三维人脸,是图形/视觉里的经典先验。
GNM 本质上是一个 3DMM 的扩展,读懂它的前提是理解'低维线性基 + 系数控制几何'这套范式。
Linear Blend Skinning (LBS, 线性混合蒙皮)
骨骼驱动网格变形的标准方法:每个顶点被若干关节影响,权重为 $W_{k,i}$,最终位置是各关节刚体变换 $X_k$ 按权重混合后的结果 $\sum_k W_{k,i} X_k v_i$。GNM 用 4 个关节(头、颈、左眼、右眼)的 LBS 把绑定姿态顶点摆到目标姿态。
GNM 的姿态化、眼球转动、颈部articulation都依赖 LBS,理解它才能看懂模型公式 $M(\Theta;\Psi)=L(V_B,X;W)$。
Principal Component Analysis (PCA, 主成分分析)
一种把高维数据投影到若干正交主方向、保留主要方差的线性降维方法。3DMM 里对一组对齐的网格做 PCA,得到的特征向量就是身份/表情基,特征值代表各方向解释的方差。GNM 在每个解剖区域上分别做 PCA,再按特征值缩放基向量。
GNM 的身份基 $I$、表情基 $E$ 都是用区域 PCA 构造的,'保留解释约 99% 方差的前若干维'是反复出现的操作。
Conditional VAE (CVAE, 条件变分自编码器)
VAE 的条件版本:编码器和解码器都额外吃一个条件向量 $c$,从先验 $\mathcal{N}(0,I)$ 采样的潜变量 $z$ 在条件控制下生成输出。GNM 的语义采样器用双 CVAE 把性别/族裔/动作类别的高层语义映射到 GNM 身份/表情系数,让用户能直观采样与插值。
语义采样器是把 GNM 从'PCA 黑箱系数'变成'可交互生成工具'的关键组件,理解 CVAE 才能看懂它的训练损失与 mixup 正则。
FLAME (Faces Learned with an Articulated Model and Expressions)
Li et al. 2017 提出的当前 SOTA 参数化头部模型,用线性形状基 + 表情基 + 颈/颌/眼球骨骼的 LBS 表示人头。它是 GNM 的主要对比基线,但只建模外部脸皮,几乎没有内部口腔结构,是 GNM 想要取代的对象。
整篇论文的所有定量对比都针对 FLAME 的两个变体(带下颌关节 vs 线性下颌),不理解 FLAME 就无法评估 GNM 的进步幅度。
研究动机
现有公开的参数化头部模型如 FLAME、BFM、LSFM 普遍把人头当作一个'空心外壳':它们只建模外部的脸皮几何,几乎完全忽略口腔内部的牙齿、舌头,以及精细的眼部结构(巩膜、角膜、瞳孔等)。这种结构性缺失在多个下游场景中造成实质性瓶颈。其一,在 2D 生成式 AI 与神经渲染(如 3D Gaussian Splatting、NeRF)中,由于缺乏嘴部内部几何约束,生成或重建的开口/张嘴镜头里往往没有可信的牙列与舌头,导致视觉质量明显下降、跌入'恐怖谷'。其二,在 AR 远程呈现和语音驱动的视听合成中,唇齿舌协同发音(co-articulation)这种关键的非言语交流线索无法被精确控制,因为模型根本没有可独立操控的舌体自由度。其三,现有模型的输入数据集保真度有限,几何质量较差,加上传统全局 PCA 把脸、颅骨、耳朵的形变耦合在一起——改动一个面部参数会意外变形颅骨——进一步削弱了区域控制力。
本文的目标是本文的目标是构建一个真正'整体化'的人头参数化框架 GNM(取名自人类基因组 human genome 的谐音),把外部脸皮、眼球、牙齿、舌头统一进同一个统计空间,从而补上 3DMM 长期缺失的内部解剖结构。具体可量化的目标包括:(1) 在统一拓扑上同时支持身份与表情控制,且眼球、牙齿、瞳孔都随身份自然联动;(2) 表情基按解剖区域(左眼/右眼/下半脸/舌头/瞳孔)解耦,做到语义隔离——例如张嘴不会触发眨眼;(3) 基于约 5000 人、约 15 万个高保真样本的大规模数据集,重建精度(scan-to-mesh)在所有面部子区域和人口子群上全面优于 FLAME;(4) 提供一个直观可生成的语义采样器,让非专业用户也能通过性别/族裔/动作类别等高层语义直接采样与插值;(5) 整套框架对学术与商用都开源,便于社区接入下游管线。
与已有工作不同的是,以往工作要么走'全局线性 3DMM'路线(FLAME/BFM/LSFM),结构简单、可控、易集成,但牺牲了内部解剖与高频细节;要么走'神经隐式'路线(NPHM、imHead、AIM、StyleMorpheus),能处理拓扑变化与近距细节,但潜空间是黑箱、缺乏语义可解释控制,做动画时无法精准指定'调整牙列'或'放大瞳孔'而不扰动相邻区域;还有一批'独立部件模型'(专门的牙齿、舌头、眼球模型),保真度极高,却各自孤立、没有统一的多部件注册流形。GNM 的独特切入角度是:保留线性 3DMM 的简单与可控,同时把神经化身(neural avatar)才有的整体解剖范围搬进来——它把分散的区域先验缝合成一个数学一致、区域解耦、可线性操控的统一流形,并显式建模瞳孔缩放、角膜形状、舌位等此前被忽略或被'烘焙'进神经体积里的量。
核心方法
直觉上,GNM 像是把一个全局 PCA 拆成一组'解剖区域子空间'再缝合起来:它沿袭经典 3DMM 公式 $M(\Theta;\Psi)$,但把身份基 $I$ 拆成头部、眼球、牙齿三段,把表情基 $E$ 拆成左眼、右眼、下半脸、舌头、瞳孔五段,每段独立做 PCA。技术路线上,模型输出 $N_V=17821$ 个顶点的头部网格,由参数 $\Theta=(\beta,\phi,\theta,\tau)$(身份、表情、4 个关节的轴角旋转、全局平移)驱动;先用 $T(\beta,\phi;T,I,E)=T+\sum_i\beta_i I_i+\sum_i\phi_i E_i$ 算出绑定姿态顶点,再通过 $K=4$ 个关节(头、颈、左眼、右眼)的标准线性混合蒙皮(LBS)摆姿态。数据基础是一个自建的多视图采集系统(22 台 6144×4096 相机 + 14 盏可控灯),覆盖约 5000 人、约 15 万个表情样本,配合艺术家雕刻的颅骨、牙齿、舌头等专门资产,经过一个可分并行、日处理约 1 万样本的注册流水线对齐到统一拓扑。
核心创新点是'区域解耦的复合线性基 + 对内部解剖的混合数据建模'。区别于 FLAME 等用单一全局 PCA 把整张脸压成一个身份基、一个表情基,GNM 显式地把基切分成对应解剖区域的子空间:身份侧 $I=[I^{(head)}, I^{(eye)}, I^{(teeth)}]$(共 253 维:头 170 + 眼 3 + 牙 80),表情侧 $E=[E^{(left\ eye)}, E^{(right\ eye)}, E^{(lower\ face)}, E^{(tongue)}, E^{(pupil)}]$(共 382 维)。这种切分带来三个本质变化:第一,避免全局 PCA 的'远程耦合形变'——改脸不会意外变形颅骨,张嘴不会触发眨眼,左右眼表情还被强制镜像对称;第二,把此前缺失的内部解剖(牙齿身份基、舌头 PCA、两球眼球模型、瞳孔缩放)作为独立可控维度直接编进统一流形,而非事后烘焙或外部资产;第三,瞳孔用一个标量系数(范围 $[-3,3]$)独立驱动,角膜半径按生理高斯分布($\mu=8.5$ mm, $\sigma=0.73$ mm)采样再线性化,让身份改变时眼球会随眼窝自动平移。'区域独立建模 + 全局统一缝合'是和已有方法最本质的区别。
方法步骤详情
完整流程分五步。(1) 数据采集:22 台 ZCam E2 S6G 相机(6144×4096)+ 14 盏可控灯,水平 150°/垂直 60° 覆盖,对约 5000 人采集中性 + 多类表情,得到约 15 万样本,并行流水线日处理约 1 万。(2) 迭代共注册:用 Mitsuba 做带边缘采样的逆向渲染,联合优化 GNM 参数、逐顶点偏移和 RGB 纹理;图像侧用 RGB L1、SSIM、法线 AOV、语义分割、稠密人脸 landmark 监督,几何侧用梯度下降预条件子、偏移 L2、图拉普拉斯 L2、自相交惩罚正则;颅骨因头发遮挡用 200 个艺术家雕刻头做跨域潜空间回归补全。(3) 基构造:每个区域分别做 PCA,特征向量按方差缩放,保留解释约 99% 方差的前若干维;眼球顶点在身份基里先置零再用刚体平移回填贴合眼睑;表情基用未中心化 PCA,保证 $\beta=\phi=0$ 给出完全中性脸。(4) 内部部件回填:把艺术家雕刻的牙/舌/眼注入基础模板与子空间,再按各分量引起的下唇/下巴刚体位移近似回填牙舌。(5) 拟合:从图像跑约 600 个稠密 2D landmark,最小化 $E_{total}=w_{lan}E_{lan}+w_{prior}E_{prior}+w_{anat}E_{anat}+w_{temp}E_{temp}$,含 landmark 重投影、系数 L2、防自相交的解剖惩罚、视频时序平滑。
技术新颖性
和已有技术的本质区别有四点。与 FLAME/BFM/LSFM 等线性 3DMM 比:GNM 不再是'空心壳',首次把牙齿身份、舌头 PCA、两球眼球与瞳孔缩放编进统一统计空间;并把全局 PCA 改成区域解耦,避免远程耦合。与 DECA/EMOCA 等高频细节方法比:它们仍依赖 FLAME 拓扑,继承了简化口腔与缺眼模型的架构缺陷,GNM 在拓扑层面就解决了。与 NPHM/imHead/AIM 等神经隐式模型比:它们能处理拓扑变化但潜空间黑箱、缺乏语义可解释控制,GNM 保留了线性模型的可控性与图形流水线兼容性,同时把整体解剖范围搬了进来。与 Gaussian Head Avatar/StyleMorpheus 等神经化身比:它们常常把牙齿眼睛'烘焙'进神经体积,难以做唇齿舌协同运动;GNM 提供显式、可独立操控的部件。眼球的两球参数化(巩膜半径固定 $r_s\approx14.6$ mm,角膜/角巩膜缘半径按生理分布采样再线性化)也是新颖的工程化处理,让身份改变时眼球能正确随眼窝平移。
实验结果
作者在 1.5 万张留出测试扫描上做了系统评估。(1) 内在一般化(scan-to-mesh 距离):GNM 平均 0.748 mm、中位 0.623 mm、标准差 0.529 mm,全面优于 FLAME 的 0.971/0.780/0.734 mm 和无下颚 FLAME 的 0.968/0.779/0.729 mm——平均误差降低约 23%,标准差也更紧,误差分布更集中。Figure 10 的分区域分解显示 GNM 在脸、额、鼻、颊、上下唇所有区域都更低,尤其在张嘴/极端表情的下半脸改善最显著,FLAME 在那里出现明显红色热点(拓扑错误)。Figure 11 按表情类型、性别、年龄、族裔分层,GNM 在所有子群都领先,证明改善普适而非针对某类样本。(2) 紧凑性:Figure 13 的身份一般化曲线显示 GNM 用更少成分就达到更低误差;区域表情基(左/右眼、下半脸)也优于 FLAME 全局表情基;特异性采样 2000 个 $\beta\sim\mathcal{N}(0,\Sigma)$ 生成的中性脸到最近真实扫描的距离更低,采样更贴近真实流形。(3) 单视图合成重建(2000 张合成图、7000 个 GT landmark):GNM 平均 1.683 mm、中位 1.589 mm,对比 FLAME 的 2.172/2.086 mm,平均误差降低约 22%。(4) 多视图与 ITW:多视图用共享身份 + 逐帧表情重建高保真;ITW 极端表情(大张嘴、吐舌、不对称眼动)下,GNM 因显式建模口腔能恢复单颗牙齿与极端舌姿,这是 FLAME 结构上做不到的。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 三维头部内在一般化(intrinsic generalization, 15000 张留出扫描) | scan-to-mesh 平均距离 | 0.748 mm | 0.971 mm (FLAME) | 平均误差降低约 23%,标准差 0.529 vs 0.734 mm 也明显更紧 |
| 三维头部内在一般化(中位) | scan-to-mesh 中位距离 | 0.623 mm | 0.780 mm (FLAME) | 中位降低约 20% |
| 单视图合成三维人脸重建(2000 张合成图) | scan-to-mesh 平均距离 | 1.683 mm | 2.172 mm (FLAME) | 平均误差降低约 22%,证明增益来自模型本身而非 landmark 检测 |
| 特异性(specificity, 采样 2000 个身份) | 到最近真实扫描的最小表面距离 | 低于 FLAME(曲线更低) | FLAME | 采样脸更贴近真实人脸流形,生物学合理性更好 |
局限与改进
作者承认的局限主要在数据与人口分类上:训练语义采样器只用了二元性别(男/女)和四大族裔(中东、亚、黑、白),不能覆盖完整的人类性别光谱与全球祖先多样性,可能带来公平性与代表性偏差;这些分类受限于可用扫描数据。我自己观察到的额外局限:(1) 牙齿/舌头的训练数据里相当一部分是艺术家程序化生成或基于稀疏关键点拟合的合成数据(如舌头数据集 $N_G\sim2.5$ K,牙齿 $N_T=5000$ 全合成),与真实扫描的统计分布可能有偏差,极端个体的牙列未必被良好覆盖;(2) 眼球模型用两球 + 生理高斯分布生成伪真值再线性化,对角膜非球面性、散光等更精细的光学变异是简化处理;(3) 头发遮挡的颅骨完全依赖 200 个艺术家头模型的跨域回归,对发型奇异或颅型异常的个体是近似;(4) 线性 PCA 本身对高度非线性的极端形变(如极端吐舌、面部剧烈不对称)表达力有上限,论文也承认左右眼一般化曲线有小差异来自评估集分布不对称。
独立分析的弱点
独立分析,我看到三个具体弱点及改进方向。(1) 部件回填是近似刚体平移:论文用下唇/下巴的平均位移或 Procrustes 刚体变换近似牙齿舌头的随脸运动,在剧烈非线性形变(如不对称吐舌 + 咬牙)下会产生穿模或错位。改进方向是把牙舌耦合建模成条件神经网络或物理约束的弹簧-质点模型,从粗到精求解,并用可微分碰撞检测在训练时直接惩罚穿模。(2) 语义采样器的人口维度过粗:6 维 OHE(2 性别 + 4 族裔)对真实多样性是严重降维,且族裔本身是社会学而非纯几何概念,可能放大刻板印象。改进方向是引入连续人口学潜变量(年龄、BMI、地理主成分)替代离散 OHE,并用公平性约束采样分布。(3) 评估只在内部数据上做:1.5 万留出扫描与 FLAME 的对比都用 GNM 拓扑注册,FLAME 经过额外非刚性对齐(虽报告平均误差 < 0.02 mm),仍可能在拓扑差异处系统性不利;缺乏 NoW challenge、Stirling、D3DFACS 等公开基准,也没和 DECA/EMOCA/NPHM 同台。改进方向是接入公认基准并报告标准化指标。
未来方向
作者明确提到的下一步是开源生态扩展,特别是公开本文用于高保真人脸追踪的稠密 landmark 检测器,让社区能把 GNM 接入自定义管线。基于成果可延伸的方向我看到几条:(1) 把区域解耦的复合线性基思路推广到全身——做一个包含手、脚、可动内脏结构的统一人体 GNM;(2) 把 GNM 作为神经渲染(3DGS/NeRF)的结构先验,做实时、可动画、身份无关的高保真化身(论文已展示潜力但未深入);(3) 与物理仿真结合,让舌头、下颌、牙齿做生物力学正确的协同运动,服务语音驱动动画与正畸/颌面外科规划;(4) 把语义采样器升级为扩散模型或掩码建模,支持更细粒度的文本/语音条件生成;(5) 扩展人口学维度并加入公平性评估,减少生成偏差;(6) 把眼球两球模型升级为带虹膜纹理与折射光学的可渲染模型,直接服务注视估计与合成数据生成。
复现评估
复现评估整体偏正面但需分层。有利因素:Google 已开源完整 GNM 框架(github.com/google/GNM),许可覆盖学术与商用;模型拓扑($N_V=17821$、4 关节)和基维度(Table 1:身份 253 = 170+3+80,表情 382 = 100+100+150+31+1)都明确给出;拟合与语义采样器的损失函数、优化器、学习率、训练步数都写得很细(如 CVAE 用 cyclical KL annealing,$w_{KL}$ 在 4000 步内从 0 升到 0.05,mixup $\lambda\sim\text{Beta}(0.2,0.2)$,L1 重建损失)。困难因素:核心数据集(约 5000 人、15 万扫描)是 Google 私有采集,使用 22 相机 + 14 灯的定制 rig,外人无法复刻;艺术家雕刻的颅骨/牙齿/舌头资产、FLAME↔GNM 的稠密重心映射也需大量人工。普通研究者可直接用预训练 GNM 做下游任务,但难以从零重训——这更像'开放使用'而非'完全可复现'。算力上拟合单/多视图相对轻量,重训则需 GPU 集群与专业采集设备。
论文图表
GNM 是一个把脸、眼、牙、舌统一在同一统计空间的整体参数化模型。该图展示它作为 3D 先验在多种下游模态的应用:结构一致的 2D 生成建模、隐私安全的真实感合成数据集生成、3D Gaussian Splatting 等实时神经渲染。
这是全文的导览图,一张图说清楚 GNM 是什么、为什么有用、能用在哪里,是理解论文定位的起点。