Puppeteer:物体接地、姿态感知的伴随语音手势生成 Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation
首个物体接地且姿态感知的协同语音手势扩散模型,在因果潜空间实现时序可控、无穿模的手势合成
前置知识
协同语音手势生成(Co-speech Gesture Generation)
根据语音音频(通常辅以文本)自动生成与语音节奏和语义同步的 3D 人体手势动画的任务,是数字人、虚拟主播和具身对话智能体的核心组件。输入一般是音频特征(如 HuBERT)与文本 token,输出逐帧人体姿态序列(常用 SMPL-X 参数表示),典型评测指标有 FGD(生成动作与真实动作的分布距离)和 BC(节拍一致性)。
本文的问题设定就建立在该任务之上,只是额外增加了姿态约束与物体接地两个维度,理解任务定义才能理解各模块的设计动机。
因果变分自编码器(Causal VAE)
把序列压缩为低维潜表示的 VAE,但编码器只使用因果(单向)卷积,使第 $i$ 个潜 token 只依赖过去与当前帧,后验严格分解为 $q_\phi(z|g)=\prod_i q_\phi(z_i|g_{\le i})$。相比双向 VAE,潜 token 带有显式的时间顺序,可以与音频等外部信号按时间对齐,也天然支持自回归滚动生成与中间段替换(补间)。
本文全部时序控制能力——audio window 掩码、text span 掩码、自回归潜扩散、手势补间与补全——都建立在因果潜 token 的时间有序性上。
条件扩散模型与无分类器引导(CFG)
扩散模型通过逐步去噪 $z_t=\sqrt{\bar\alpha_t}z_0+\sqrt{1-\bar\alpha_t}\epsilon$ 学习从噪声到数据的映射;条件扩散把语音、姿态、物体等信号注入去噪网络。CFG 在采样时外推条件与无条件预测之差:$G_w=G_\theta(z_t,t,\varnothing)+w\,[G_\theta(z_t,t,c)-G_\theta(z_t,t,\varnothing)]$,$w$ 越大越服从条件但多样性和真实感会受损。
PUPPETEER 的生成器就是一个条件潜扩散模型,主实验采用 CFG 尺度 2.5 与 DDIM 20 步采样,附录对这两个超参做了系统消融,是理解其质量-多样性权衡的关键。
SMPL-X 参数化人体模型
统一表示身体、双手与面部的统计人体网格模型,由形状参数 $\beta$ 和各关节姿态旋转(通常用连续的 6D 旋转参数化以避免轴角不连续)驱动,经正向运动学得到关节位置与网格顶点。手势研究普遍以其为输出格式,便于计算关节误差(MPJPE)、加速度误差与穿模深度等几何量。
论文的动作表示 $y_t=(R_t,\Theta_t,J_t,\Delta R_t,\Delta J_t)$、SMPL-X 几何一致性损失、碰撞损失以及 SCENEGES 的动作恢复全部基于 SMPL-X。
基点集(Basis Point Sets, BPS)
用固定数量的参考点(本文为 1024 个,分布在人体周围的椭球支撑面上)到目标点云或网格表面采样点的最小距离,把任意形状压缩成定长向量。它计算高效、对网格拓扑不敏感,常用于人-物空间关系的紧凑编码,原文把椭球半径设为 $(r_{front},r_{lat},r_{vert})=(0.48,0.6,0.4)$ 米并前移 0.5 米,因为手部碰撞集中发生在身体前侧和侧面。
原始家具网格无法直接输入 transformer,本文用 BPS 把桌椅几何与人体表面编码为 1024 维描述子 $B_H=[B_O,B_P]$ 再注入去噪网络,是实现物体接地的桥梁。
符号距离场(SDF)与碰撞损失
SDF 在空间每个体素存储到物体表面的带符号距离(外部为正、内部为负),据此可判断任意点是否处于物体内部以及穿透深度。把生成人体的 SMPL-X 顶点查询 SDF、对负值平方求和,就得到可反向传播的碰撞损失,并可在 GPU 上以体积网格高效计算。
Stage 3 用 32³ 的 SDF 体素网格实现 $\mathcal{L}_{collision}$(损失权重 $\lambda_{collision}=50$,仅作用于上半身顶点),是把『不穿模』变成可优化目标的关键技术。
研究动机
现有语音驱动手势模型(EMAGE、LOM、GestureLSM、SynTalker 等)本质上都是场景无关的:它们只做多模态融合,把音频和文本对齐到手势,却完全不感知身体姿态约束和周围物体。而主流训练数据本身就缺乏这些维度——BEAT2 只包含 25 名说话人站立、朗读预设文本、相对受限场景下的手势,模型学到的先验天然偏向『站立+大幅挥动』,一旦换成坐姿或桌边场景就会生成与家具穿模、与椅子不协调的动作。真实具身交流中,手势与物理空间强耦合:说话人会把双手放在桌面上、手臂搭在扶手上、坐下时减小手势幅度。此外长时序生成还有时间连贯性难题:基于 transformer 的方法普遍采用 VQ-VAE 离散 token 化,引入量化误差、损失细微动态;扩散方法直接在高位运动空间去噪,保真但计算昂贵;而现有潜扩散方法(如 SynTalker)使用双向潜表示,时间信息被纠缠在一起,无法对语音-动作对齐做显式控制。
本文的目标是本文要构建 PUPPETEER:一个姿态感知、物体接地的协同语音手势扩散模型。形式化地说,给定 $H$ 帧手势历史 $h\in\mathbb{R}^{H\times D}$、语音信号 $S$(音频+文本)、初始姿态参考 $\gamma$ 和周围 3D 物体网格 $O$,自回归生成连续逼真的长手势序列 $G\in\mathbb{R}^{F\times D}$。生成的手势需同时满足四个条件:与语音节奏和词级语义对齐、从历史动作平滑衔接、保持参考姿态(站/坐及其具体构型)、满足周围物体的物理约束(不穿模、手可以放在桌面上)。配套目标还包括:构建首个合成的物体接地协同语音手势数据集 SCENEGES、提出更合理的新评测指标(样本间多样性 Div、下肢误差 LL1、穿透深度 MaxPen/MeanPen),并使模型天然支持手势补间(in-betweening)与补全等下游任务。
与已有工作不同的是,本文的独特切入有三点。第一,问题定义上的空白:此前场景感知动作生成(DIMOS、MOVER、TeSMo 等)都面向行走或任务导向的物体操作(抓、放、坐),没有工作建模『被动家具如何塑造交流性手势』这一现象——本文明确把物体感知定义为周围物理结构对对话手势的影响,而非动作中心的操作,并声称是首个物体接地的协同语音手势生成工作。第二,技术路线上,作者借鉴 MotionStreamer 的因果 VAE 思想,但把它改造成音频同步版本:把长手势分解为固定长度基元并编码为时间有序的因果潜 token,从而既避免 VQ 量化误差,又能在潜空间做高效扩散的同时保留精确时间结构,进而实现 audio window 与 text span 两种基于加性掩码的时间对齐控制。第三,物体感知以『冻结先验+门控融合分支』的方式注入,不破坏从大规模数据学到的语音-手势先验,并用 4:1 的重放比例防止遗忘。
核心方法
整体思路可以用一句话概括:先学『说话时人一般怎么动』的通用先验,再把它空间接地到具体姿态与家具上。直觉上,交流手势的核心规律(节奏、语义对应)与体型和场景无关,应该在一个规范的、形状无关的身体表示上学习;而空间细节(手放桌上、避开扶手)则可以后置注入。技术路线分三个阶段:Stage 1 训练一个因果 VAE(CausalVAE),把 48 帧的手势基元 $g\in\mathbb{R}^{F_p\times D}$($D=666$)经 1D 因果卷积(时间下采样因子 $s=4$)编码为 $l=12$ 个 $d=256$ 维、时间有序的潜 token,后验 $q_\phi(z|g)=\prod_{i=1}^{l}q_\phi(z_i|g_{\le i})$ 严格因果;Stage 2 在该因果潜空间做自回归条件扩散,denoiser 是 7 层 transformer(512 维、8 头),以运动历史、HuBERT+韵律音频特征、CLIP 文本 token 和 13 个姿态 token 为条件,配合 audio window / text span 两种掩码交叉注意力,用 CFG 与 DDIM 采样;Stage 3 冻结前两阶段全部参数,插入门控物体融合模块,用 BPS 编码人-物空间关系,并以 SDF 碰撞损失微调,使手势符合家具几何。
核心创新是『时间有序的因果潜空间 + 扩散』以及基于掩码的显式时间控制。与 VQ 方法不同,潜空间连续、无码本量化误差;与双向潜扩散(如 SynTalker)不同,每个潜 token 只依赖过去,时间结构不被纠缠,因此可以:(i) 沿时间轴自生成长序列;(ii) 建立潜索引与音频/文本位置的软单调对齐——Audio Window Attention 把第 $i$ 个潜 token 的音频注意力限制在其对齐位置附近半径 $r$ 的窗口 $W_a(i)=\{j:|j-\phi(i)|\le r\}$ 内(窗口尺度 $w_a=\xi\cdot l/F_a$,$\xi=1$ 最优),Text Span Attention 让时间上落在某个词跨度 $[s_j,e_j]$ 内的潜 token 主要注意该词;(iii) 天然支持手势补间与补全。第二个创新是门控物体融合:物体信息作为附加条件分支注入冻结模型,所有门控 $\tanh(\alpha)$ 的 $\alpha$ 零初始化,训练起点严格等价于原始模型;再配合与 BEAT2/Embody3D 按 4:1 交错的重放批(无物体样本用可学习的 no-object token),在获得物体接地能力的同时完整保留语音-手势先验。
方法步骤详情
Stage 1(因果潜基元空间):每帧表示为 $y_t=(R_t,\Theta_t,J_t,\Delta R_t,\Delta J_t)$——全局朝向与 54 个关节的 6D 旋转、SMPL-X 正向运动学得到的关节位置及其一阶差分,$D=666$;训练时把体型固定为平均形状($\beta=0$)以学习形状无关先验。编码器为两个 stride-2 因果卷积下采样块加膨胀残差栈(膨胀率 1,3,9),总感受野 $R=176$ 帧;损失包含重建 $\mathcal{L}_{rec}$、KL 正则($\lambda_{kl}=10^{-6}$)、速度一致性 $\mathcal{L}_{\Delta j},\mathcal{L}_{\Delta r}$(权重 100)和 SMPL-X 几何一致性 $\mathcal{L}_{smpl},\mathcal{L}_{cons}$(权重 10)。Stage 2(自回归潜扩散):对每个基元的潜 token $z_0$ 加噪 $z_t=\sqrt{\bar\alpha_t}z_0+\sqrt{1-\bar\alpha_t}\epsilon$,训练 $G_\theta$ 预测干净潜变量,损失 $\mathcal{L}=\lambda_{g^0}\mathcal{L}_{g^0}+\lambda_{latent}\mathcal{L}_{latent}$,其中运动空间损失使用强度加权 $\omega_f=1+\lambda_I I_f$($\lambda_I=3$)以强调高强度手势段;条件包括 HuBERT 音频(768 维)+ 7 维手工韵律特征(log f0、能量、其一阶差分、谐性、语速、停顿标志)、CLIP 文本 token 与 WhisperX 词级时间戳、$H$ 帧历史、由首帧 12 个关节构造的 13 个姿态 token(含可学习坐/站 token);交叉注意力只作用于未来潜 token 且带时间掩码 $M$;推理用 DDIM 20 步、CFG 2.5。Stage 3(物体感知):每个去噪步从物体网格采 3000 点、对人体上半身用 LBS 权重选顶点,分别对 1024 个椭球 BPS 点取最小距离得到 $B_H=[B_O,B_P]$;碰撞损失用 32³ SDF 体素网格作用于上半身顶点,$\lambda_{collision}=50$;仅训练 BPS 投影与门控融合层,物体批与重放批按 4:1 混合。
技术新颖性
技术新颖性体现在四个层面。其一,问题层面:这是首个把『交流手势×姿态×被动场景几何』三者耦合建模的工作,与 InteracTalker 那种动作中心的物体交互(抓取、搬运、提示词驱动操作)有本质区别——本文建模的是家具如何约束手势空间、影响手的静息位置。其二,表示层面:首次把因果潜自回归扩散引入协同语音手势任务;虽然因果 VAE 思想受 MotionStreamer 启发,但 MotionStreamer 是文本条件、场景无关的,没有音频同步、词级对齐、姿态变化和 3D 物体几何,不能直接作为基线。其三,控制层面:无需修改 transformer 结构,仅通过对注意力 logits 加二元掩码 $M$($M_{i,j}=0$ 或 $-\infty$)就实现了音频窗口与文本跨度的软单调对齐,这是一种轻量的显式对齐控制器。其四,评测层面:提出样本间多样性 Div(同一音频生成 K=5 次的成对 L1 距离、按时间中位数归一化,避免偏爱大幅度动作)、下肢精度 LL1、以及基于 SDF 的穿透深度 MaxPen/MeanPen,并发布首个物体接地手势数据集 SCENEGES。
实验结果
(1)主对比实验(Table 2,BEAT2 Speaker2 测试集,指标 ×10⁻¹):PUPPETEER 取得 FGD 3.436、BC 7.693、Div 14.131 三项最佳,ΔBC 0.201 具竞争力——对比 GestureLSM(3.692/7.547/0.166/9.490)、LOM(4.069/7.407/0.481/9.112)、MIBURI(4.369/7.685/0.369/9.645)、EMAGE*(5.205/6.048/1.377/12.830)、EMAGE(5.117/5.910/1.522/无)、CaMN(6.273/7.458/0.145)、DisCo(7.586/7.652/0.224);真实动作 BC 为 7.282,本文 BC 甚至超过真实值。关键点在于:以往方法提高多样性往往牺牲 FGD(如 EMAGE* 通过对 codebook softmax 采样引入多样性但 FGD 变差),而本文同时做到更低 FGD 与更高 Div。(2)训练数据与姿态条件(Table 3):仅用 BEAT2 训练时跨数据集严重退化(Embody3D 上 FGD 13.993、LL1 14.074);加入 Embody3D 后 Embody3D FGD 降至 2.458;把简单的坐/站二值调制嵌入升级为姿态参考交叉注意力后,Embody3D FGD 进一步降至 1.676、LL1 降至 2.446(调制基线为 2.300/4.297),证明细粒度姿态建模的必要性。(3)物体感知(Table 4):把场景无关的 LOM 放入同样结构场景作代理,其 MeanPen 12.282×10⁻⁴、MaxPen 1.465×10⁻¹、LL1 6.563,分别是本文物体感知模型的 2.8×、2.0×、8.4×;消融显示加物体模块(无碰撞损失)已把 LL1 从 1.019 降到 0.760 但 MeanPen 反升(7.302),补上 $\mathcal{L}_{collision}$ 后 MeanPen 降至 4.450、MaxPen 降至 0.713;在完全未见过的 held-out 家具上 MeanPen 3.280×10⁻⁴、LL1 0.86,与主结果相当,说明学到了可泛化的空间可供性而非记忆几何。(4)掩码消融(Table 5):完整音频基线 FGD 3.917/ΔBC 0.431;仅 text span 降到 0.273;audio window $\xi=1$ 时 FGD 3.385;二者结合达到 3.437/0.201/Div 14.131 的最佳组合,且窗口越宽性能越接近 Full,验证局部化条件的作用。(5)CausalVAE 优势(Tables 6-7):重建上 BEAT2 FGD 0.161 vs VAE 0.242、MPJPE 7.387 vs 16.757、ACCL 5.497 vs 15.013;跨数据集与联合训练设置下优势更大;生成上 FGD 3.437 vs 4.221、ΔBC 0.201 vs 0.596、Div 14.131 vs 10.849。(6)SCENEGES 数据集验证:23 名参与者对 65 段随机片段做 2AFC 真假判别,balanced accuracy 仅 51.41%(近随机),自然度 Likert 得分 4.28 略高于真实 Embody3D 的 4.09。(7)系统消融:CFG 2.5 最优(1.0 时 FGD 7.093,7.0 时恶化到 11.775);DDIM 20 步最优(单步已有 FGD 4.930 的竞争力);强度加权 $\lambda_I=3$ 最优;潜尺寸 12×256 在生成上优于重建更好的 12×512。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 协同语音手势生成(BEAT2 Speaker2 测试集) | FGD↓(手势真实性) | 3.436 | GestureLSM 3.692;LOM 4.069;MIBURI 4.369 | 相对最强基线 GestureLSM 降低约 6.9%(-0.256) |
| 协同语音手势生成(BEAT2 Speaker2 测试集) | BC↑(节拍/语音同步性) | 7.693 | MIBURI 7.685;真实动作 7.282 | 超过所有基线,甚至高于真实动作的 7.282 |
| 协同语音手势生成(BEAT2 Speaker2 测试集) | Div↑(样本间多样性,本文新指标) | 14.131 | EMAGE* 12.830;GestureLSM 9.490 | 比最强基线高约 10.1%,同时 FGD 不劣化 |
| 物体接地手势(SCENEGES 结构化场景,以 LOM 为代理基线) | MeanPen↓(平均穿透深度,×10⁻⁴) | 4.450(含物体模块与碰撞损失) | LOM 场景代理 12.282;无物体模块 6.476 | 比代理基线低 2.8×;碰撞损失使 MeanPen 从 7.302 进一步降到 4.450 |
| 姿态泛化(Embody3D 跨数据集测试) | FGD↓ | 1.676(BEAT2(All)+Embody3D 训练 + 姿态交叉注意力) | 仅 BEAT2 训练 13.993;姿态调制基线 2.300 | 比仅 BEAT2 训练降低约 8.3×,比粗粒度姿态调制再降约 27% |
| 下肢姿态精度(Embody3D) | LL1↓(下肢关节 L1 误差) | 2.446 | 坐/站调制基线 4.297;无姿态条件 5.553 | 比调制基线降低约 43%,比无姿态条件降低约 56% |
局限与改进
作者明确承认的局限(附录 L):第一,模型只处理静止会话手势,去除了根轨迹,不支持边走边说或大幅身体移动,这是简化的设计选择;第二,虽然碰撞损失显著降穿模,但小部分帧仍有轻微穿透——实现绝对零碰撞和完美物体接触在整个 HSI(人-场景交互)领域仍是开放难题;第三,物体接地包含语义-空间相关与物理合理性两个侧面,本文同时建模但无法保证后者完美。我自己的观察还有几点:初始姿态参考 $\gamma$ 在整条序列中固定不变,模型无法表达坐→站切换或中途姿态漂移;SCENEGES 仅 28 分钟、26 个场景、153 个家具资产,规模小且依赖 Veo 3 生成视频与专业艺术家逐帧修形,扩展成本高,还可能携带视频生成模型的动作先验偏差;物体感知的定量评测几乎全部在自建的合成数据上进行,缺乏真实扫描场景中的验证;碰撞损失刻意排除下半身(坐姿髋部与椅面接触会诱导模型交叉腿部钻空子),腿部穿模只能靠其它损失隐式约束;FGD 在下肢中和后主要反映上半身分布,『手势风格是否被家具恰当塑造』这一语义层面没有量化指标。
独立分析的弱点
(1)姿态参考静态化:$\gamma$ 取自首帧并全程复用,无法处理姿态转换(如谈话中从坐到站)或长序列中的姿态漂移累积误差——改进方向是周期性姿态重估计、多姿态关键帧插值,或引入基于下半身状态的在线姿态追踪。(2)SCENEGES 管线难以规模化:依赖商业闭源模型(Gemini 写脚本、Veo 3 生成视频)加人工修形,28 分钟的数据相对 Embody3D 预处理后的 43 小时小两个数量级,物体类型仅限桌椅——改进方向是用可微接触优化/IK 自动修正穿透替代艺术家修形,并扩展到沙发、吧台、床等更多家具类别。(3)物体条件必须在生成前已知且静态:BPS 编码的是初始人-物关系,无法应对移动物体或说话人移动后的重新接地——可引入滚动更新的场景占据预测或场景图条件。(4)BPS 椭球只覆盖人体周围约 1 米范围(半径 0.4-0.6 米),远处的家具与空间布局不影响手势,限制了『大范围场景理解』,也无法表达跨越空间的指涉手势(如指向房门)。(5)评测体系偏物理:Div/LL1/穿透深度都是几何量,缺少对『家具是否语义上合理改变了手势风格』的感知评测,模型级用户研究在论文中着墨很少。
未来方向
作者提出的方向:放宽静止假设,建模行走或大幅身体移动时的手势生成;向 HSI 领域的终极目标——绝对零碰撞与完美物体接触——推进。基于其成果可自然延伸的方向:(1)实时化:因果潜结构天然支持流式推理,单步采样已有 FGD 4.930 的竞争力,可通过一致性蒸馏或 shortcut 模型压到 1-4 步,接入实时数字人对话系统;(2)与对话状态结合:让手势语义随 LLM 对话轮次、情感状态动态变化,而不只是跟随当前音频;(3)多人场景:SCENEGES 的场景脚本框架可直接扩展到双人对话的互动手势(递物、同时指向);(4)holistic 输出:当前未建模面部表情,可与 EMAGE 式人脸分支联合训练;(5)真实场景验证与数据引擎反哺:在真实扫描房间(完整 HSSD 场景)中评测泛化,并用该模型生成的大规模伪标签数据反哺真实数据训练;(6)接触语义显式化:把『手放桌面/搭扶手』从碰撞约束升级为可学习的接触类型预测,支持提示词控制接触行为。
复现评估
整体复现条件中上。有利因素:项目页 https://puppeteer.pickford.ai/ 提供视频与补充材料;所有训练数据均为公开资源(BEAT2、Embody3D、HSSD 物体库),论文承诺预处理后的 Embody3D 手势数据集(18,380 段、约 43 小时、280 名说话人)将公开发布;附录给出了罕见的完整超参数:denoiser 7 层 transformer(512 维、8 头、FFN 2048)、CausalVAE 潜尺寸 12×256、损失权重 $\lambda_{rec}=1,\lambda_{kl}=10^{-6},\lambda_{smpl}=10,\lambda_{cons}=10,\lambda_{\Delta j}=\lambda_{\Delta r}=100,\lambda_{collision}=50$、AdamW 学习率 $10^{-3}$、batch 128、CFG dropout 0.2、DDPM 1000 步训练 + DDIM 20 步推理(CFG 2.5)、窗口 $\xi=1$;模型规模小(denoiser 仅 7 层),单张高端消费级/工作站 GPU 应可完成训练,数据预处理流程(WhisperX 对齐、坐/站检测、下肢中和)也描述详尽。不利因素:SCENEGES 数据集复现瓶颈明显——需要调用 Veo 3 与 Gemini(商业 API、有成本与版本漂移风险)、SAM 3D Body 提取动作,且依赖『专业艺术家逐帧修形』这一无法自动化的环节;若直接使用官方发布的数据集则门槛大幅下降。综合评估:模型与方法复现难度中等,包含数据集构建的完整复现难度较高。
论文图表
展示同一段音频与文本("I've been going back and forth on this...")在不同条件下生成手势的对比:有无桌子、站立与坐姿。同一语音驱动下,模型生成的手势既保持语义一致(如双向比划、手抚胸口),又自然适应姿态与家具——有桌时手保持在桌面高度,坐姿时动作幅度收敛。
这是论文的问题陈述图,一图点明『相同语音×不同姿态×不同物体』的组合空间,直观定义了 posture-aware 与 object-grounded 两个核心概念,是理解全文动机的入口。
姿态条件化效果对比:无姿态条件时,生成动作随时间逐渐漂移向训练集中更常见的站立中位姿态;提供初始姿态参考 $\gamma$ 后,坐姿构型在整个自回归生成过程中被稳定保持。
可视化姿态漂移这一自回归模型的典型失效模式及其解决方案,解释 Table 3 中 LL1 大幅下降的机理,对长时序生成系统设计有普遍参考价值。
潜尺寸对重建的影响:BEAT2 上 12×512 重建最优(FGD 0.048/MPJPE 6.813),12×256 为 0.168/7.594;Embody3D 趋势一致(12×512 FGD 0.037)。容量越大重建越好。
与 Table S2 对照构成关键结论:重建最优的潜尺寸并非生成最优,揭示潜空间『好压缩』与『好生成』的解耦,对表示学习设计有方法论意义。
潜尺寸对生成的影响:12×256 取得最佳综合(FGD 3.436/Div 14.131/BC 7.693/ΔBC 0.201),而重建更好的 12×512 反而退化(FGD 3.795/Div 11.034/ΔBC 0.397)——潜 token 数量提升时间表达力,维度适中则保持潜空间紧凑易学。
确立全文采用的 12×256 配置的依据,并与 Table S1 一起说明不能只看重建指标选潜空间。
CFG 尺度消融:1.0 时 FGD 7.093(真实感差),2.5 时最优(FGD 3.436/ΔBC 0.201/Div 14.131),继续增大到 7.0 时 FGD 恶化至 11.775、ΔBC 升至 0.596——过强引导过度约束生成并损害多样性。
给出采样引导强度的甜点及其失效方向,是复现主表结果和实际部署调参的必要信息。
DDIM 采样步数消融:单步已有 FGD 4.930 的竞争力,10 步降至 3.441,20 步最优(3.436/14.131/0.201),50/100 步无进一步提升。
揭示效率-质量权衡:单步可用意味着流式/实时应用可行(与因果架构配合),20 步封顶则为推理成本设定了上界。
强度加权系数 $\lambda_I$ 消融:无加权(0)时 FGD 最低但 Div 与 ΔBC 较差;$\lambda_I=3$ 在 Speaker2 上取得最高 BC 7.693、Div 14.131 与最低 ΔBC 0.201,全数据集上同步性同样最佳;更大值不再一致改善。
验证运动空间损失中高强度段加权的价值,并说明为什么均匀 MSE 不足以学好富有表现力的说话人手势。
单说话人与多说话人训练对比:仅在 Speaker2 上训练测试时 PUPPETEER FGD 3.436/BC 7.693 全面最佳;用全量 BEAT2(多说话人)训练后在 Speaker2 上测试仍有 4.663/7.347/0.228,缓解了以往工作『多说话人训练 FGD 崩溃』的问题。
回应领域内一个公认难点(多说话人泛化),证明因果潜表示学到的先验跨说话人可迁移,对实际部署(不可能只有一个说话人)意义重大。
用 Gemini 生成对话场景的完整系统提示词:要求输出 JSON 格式的场景(≤12 词)、两个角色、性别、氛围词,并强制从四种姿态(sit_no_table/sit_behind_table/stand/stand_behind_table)中指定一种,同时禁止涉及物体操作和未成年人。
SCENEGES 管线的第一步,提示词设计(尤其姿态标签分布控制)直接决定数据的姿态覆盖,对想复刻该合成数据管线的读者是关键工程细节。
对话剧本生成提示词:以获奖编剧角色,要求纯对话、轮流发言、按 8 秒块切分,每行必须带 (char)、(TONE:)、(EMOTION:) 标签,情感限定八类,并给出严格的输出格式模板。
展示了如何用结构化提示词让 LLM 产出可直接驱动视频生成的机器可读剧本,是管线中连接场景与视频的桥梁。
手势建议提示词:让模型以 Veo 提示工程师身份,根据场景、姿态、情感为每段对白在文本中插入方括号手势描述(如"rest hands on table"),并强制肯定式、禁止犹豫词与超出场景的物体指涉。
这是『物体接地』进入数据的机制——手势描述被显式约束为与场景中家具相关,决定了下游恢复动作会包含真实的人-物接触。
Veo 3 视频生成提示词:强制固定机位、人物不移动、双手不出画、无字幕叠加、口型与文本对齐、以渲染首帧图为场景条件、按方括号提示执行手势且手势只在对应语音短语期间出现。
视频模型输出质量决定 3D 恢复数据的上限,这些硬约束(静态机位、无裁切、口型对齐)是保证后续 SAM 3D Body 提取动作可用的前提。