Super Star:面向数字人的流式实时交互智能体 Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans
以因果自回归建模实现流式语音驱动的低延迟实时共语手势生成与自进化
前置知识
共语手势生成
指从语音自动合成与说话节奏、语义内容在时间上对齐的身体动作的任务,是数字人、具身会话代理与虚拟形象的核心能力。早期工作用 RNN、VAE、GAN 建模语音-动作对应,现代方法多用 Transformer、扩散模型或离散动作分词。离线方法假设整段语音可用后再合成动作,在线方法则只能利用当前与过去的语音做因果生成。
这是本文重新定义并形式化的任务本身,理解离线/在线设定的本质区别是读懂全文动机、实验协议与所有对比结果的前提。
VQ-VAE / RQ-VAE(向量量化)
VQ-VAE 用编码器提取连续动作特征 $z^t$,再量化到最近码本向量 $q^t=\arg\min_{q_k\in Q}\|z^t-q_k\|_2$,从而把连续动作变成离散 token 供自回归模型预测。RQ-VAE 进一步对量化残差逐层再量化(本文离线生成器用 $L=4$ 层、码本大小 512),以更高精度表达手指等精细动作的不同粒度。
本文在线手势生成器建立在四个身体部位各自的 VQ-VAE 之上,所有预测都在离散动作 token 空间进行,离线数据合成则依赖表达力更强的 RQ-VAE。
因果掩码与流式推理
因果掩码禁止注意力机制关注未来位置,是 Transformer 解码器的标准设定;本文把它扩展到语音-动作交叉注意力上,使时刻 $t$ 的动作 token 只能关注 $y_{\le t}$。流式推理要求计算量有界、逐块输出,本文用 120 帧滑动历史窗口(音频与动作对齐、不在语句边界重置)替代 KV cache 来保证延迟稳定。
『在训练阶段就施加因果掩码,而非仅在推理时限制』是本文最重要的建模主张,直接对应消融实验中去除掩码后的性能崩塌。
FGD / BC / Diversity 评测指标
FGD(Fréchet Gesture Distance)用预训练动作编码器提取特征后,计算生成与真实动作分布之间的 Fréchet 距离,越低越真实;BC(Beat Correlation)把语音起点与音频节拍对齐到上肢关节速度的局部极小值(动作节拍),衡量音画同步程度,越高越好;Diversity 用关节位置序列间的平均 $L_1$ 距离衡量生成动作的多样性。
论文所有定量结论都围绕这三个指标加上延迟展开,不理解其定义就无法判断实验数字的优劣与提升幅度。
SMPL-X 与 6D 旋转表示
SMPL-X 是带手部与面部表情参数的全身人体参数化网格模型,本文 JIYI 数据集的动作以 30FPS 的 SMPL-X 格式存储。6D 旋转用旋转矩阵前两列共 6 个数表示关节朝向,比四元数或欧拉角更连续、更适合神经网络回归,是动作生成领域的标准表示。
论文的动作分解 $x=\{g^f, g^h, g^u, g^l\}$ 及各部位维度(下身 54 维/上身 78 维/双手 180 维/头面 106 维)都基于这套表示,直接决定分词器结构与损失函数设计。
研究动机
现有共语手势生成方法几乎都为离线设定设计:模型必须先拿到完整语音片段再合成动作。Semantic Gesticulator、EMAGE、LOM 等最强方法都依赖全序列语音上下文或未来声学线索来保证动作的语义恰当与时序连贯,这在预录制动画中可行,但在真实交互中不可用——数字人必须边说话边做手势,任何等语音说完再生成的策略都不可接受。在作者定义的严格在线协议下,Semantic Gesticulator 的延迟记为 $+\infty$(必须看完整段语音),LOM 每步推理延迟高达 22.902ms 且依赖未来上下文,TalkSHOW、EMAGE、SynTalker 的延迟也在 3.336~8.844ms 之外缺乏一致性。更麻烦的是数据瓶颈:现有数据集(BEAT、ConvoFusion、Embody3D 等)多采集自独白或一般社交场景,语音与动作并非为严格在线共语生成设计,且缺乏虚拟陪伴场景所需的主题与情感多样性、更丰富的姿态变化和更强的情感表达,无法提供情感价值与陪伴感。
本文的目标是本文的目标是把共语手势生成正式化为『在线共语手势生成』问题:在只能观测当前与过去响应语音 $y_{\le t}$、严格禁止访问未来语音的约束下,以低延迟因果地生成与语音同步、自然连贯的全身动作。具体拆成三件事:其一,设计可流式部署的在线手势生成器,在缺失未来语音上下文时仍输出稳定协调的全身动作,并与流式语音应答模块(Qwen-Omni,首音频 token 延迟约 234ms)耦合为完整实时交互系统;其二,解决虚拟陪伴场景的训练数据稀缺,包括自建 JIYI 动捕数据集和一条离线交互数据合成流水线;其三,建立用户反馈驱动的自进化闭环,让模型在部署后持续适配真实用户的偏好与交互模式,而不是一次训练永久使用。
与已有工作不同的是,本文的独特切入角度有三层。任务层面:此前的实时/流式工作(MotionStreamer、UMO、LiveAvatar、DiscoForcing 等)面向更一般的动作生成或音频驱动形象,没有工作严格研究『以流式应答语音为条件、全身、严格因果、毫秒级延迟』的共语手势生成,本文首次形式化该设定并建立统一评测协议(把所有离线基线改造成因果版本公平对比)。建模层面:作者强调因果掩码不是推理时的权宜技巧,而是在训练阶段就强制模型只看 $y_{\le t}$,使训练与部署条件一致,实现『训练即在线』。数据层面:不同于单纯的数据增广,本文把线上用户偏好样本回灌到离线合成流水线,既作直接监督又作 LLM 对话生成的 in-context 示例,把少量高价值部署信号放大成大量偏好对齐的合成数据,形成部署-训练闭环,这是与传统『离线训练、固定模型』范式的本质区别。
核心方法
直觉上,Super Star 像『边听边做动作』的人:听到哪、动到哪,不预知后文。系统分两条管线。在线管线:Qwen-Omni 流式全模态模型接收用户音频/文本/视觉输入,逐 token 输出应答音频供即时播放(首音频 token 约 234ms);在线手势生成器以流式语音 token 与历史动作为条件,按跨模态自回归分解 $p(C_{1:\tau}\mid Y_{1:\tau})=\prod_{t=1}^{\tau}\prod_{m\in\{f,h,u,l\}} p(c_m^t\mid c_{<t},\, y_{\le t})$ 逐帧预测下身、上身、双手、头面四个部位的动作 token,再经预训练 VQ-VAE 解码为 30FPS 的 SMPL-X 连续动作。离线管线:从主题-情感语料库采样结构化线索引导 LLM 生成人机对话,经声音克隆/TTS 转成语音,再用允许访问全段语音的非因果离线手势生成器批量合成配对动作数据,配合 OptiTrack 动捕的 JIYI 冷启动数据集训练在线模型;部署后的用户偏好样本又回灌进合成流水线形成自进化循环。最终每步手势推理延迟仅 1.623ms。
核心创新一是『因果音频条件交叉注意力』:在语音 token 流与动作 token 流之间加入多头交叉注意力并施加因果掩码,使时刻 $t$ 的动作只能关注 $y_{\le t}$。关键在于该掩码在训练时同样生效,逼迫模型从流式语音学习手势动力学而非依赖未来线索——消融显示去掉它 JIYI 上 FGD 从 2.795 恶化到 3.037、BC 从 7.354 降到 7.027。创新二是跨模态组合式自回归分解:四个部位独立分词后可并行预测,通过历史 $c_{<t}$ 共享跨部位依赖,在语音上下文不完整时稳定全身协调,这是对『整体建模在在线设定下歧义过大』问题的直接回应。创新三是自进化闭环:偏好样本占比虽小(第二轮仅 5%),但既作直接监督又作 LLM 对话合成的 in-context 示例,把少量偏好信号放大为 62% 的偏好对齐合成数据,形成『部署越多、越懂用户』的数据飞轮。
方法步骤详情
(1) 动作表示与分词:把 SMPL-X 30FPS 动作按 6D 旋转分解为下身 $g^l$、上身 $g^u$、双手 $g^h$、头面 $g^f$(维度分别为 54/78/180/106),训练 4 个独立 VQ-VAE(4 层 TCN 编码器),量化 $q^t=\arg\min_{q_k\in Q}\|z^t-q_k\|_2$,用测地重建、速度/加速度平滑、网格与 commitment 损失训练。(2) 在线生成器:12 层 Transformer 解码器,语音流与动作流之间用带因果掩码的交叉注意力,训练目标为因果约束下的真实动作 token 预测。(3) 流式应答:Qwen-Omni-3 逐 token 输出音频。(4) 推理:增量生成,120 帧滑动历史窗口、不用 KV cache,计算量有界,每步延迟 1.623ms。(5) 离线数据合成:语料库采样主题与情感(如『如何面对失败』『平静理性』)→LLM 生成对话→TTS/声音克隆→非因果离线生成器(RQ-VAE,$L=4$、码本 512)合成动作→校验工具过滤(节拍一致性、关节极限、滑步、异常速度)。(6) JIYI 数据集:OptiTrack 16 相机 120FPS、50 标记,1570 段约 6 小时,划分 1256/157/157。(7) 自进化:偏好样本既作监督又作 LLM 的 in-context 示例,训练集从 1256 扩至 2434(50%/47%/3%)再到 3852(33%/62%/5%),每轮 200 epochs 重训。
技术新颖性
技术新颖性体现在四个层面。任务形式化上,本文是首个明确定义『流式应答语音条件下、全身、严格因果、实时延迟』的在线共语手势生成工作,并为此改造出因果版基线与统一协议:BEATv2 上用官方代码加掩码推理,JIYI 上对基线做因果重训,保证公平。架构上,与 LOM 等基于 Flan-T5 的离线编码器-解码器不同,本文的因果交叉注意力在训练期就施加未来掩码,消融证明这不是可有可无的推理约束:把它换成弱交互的 prefix-conditioning 后 FGD 恶化到 3.745、Diversity 跌至 8.749,说明显式跨模态交互对在线设定不可或缺。表示上,组合式四部位分词让异质动态(手指精细抖动 vs 躯干大幅摆动)各得其所,且各部位并行预测有助于控制延迟。数据上,自进化循环把偏好信号『一次采集、多重复用』(直接监督+ICL 放大),相比 RLHF 式奖励建模是轻量但数据高效的偏好适配方案,伪标签质量也有离线生成器 FGD 2.512/BC 7.587 的验证支撑。
实验结果
主结果有三组。BEATv2 严格在线评测(Table 1):Super Star 取得 FGD 10.519、BC 8.389、Diversity 10.505、延迟 1.623ms,四项全面第一;对比 LOM(15.681/7.446/9.368/22.902ms)与 EMAGE(15.908/7.035/8.932/5.441ms)等,FGD 相对 LOM 降低约 33%、延迟约为其 1/14,Semantic Gesticulator 因需完整语音延迟记 $+\infty$。JIYI 交互场景(Table 2):base 版 FGD 2.795/BC 7.354/延迟 1.623ms 全场最低;一轮自进化 FGD 降至 2.419,两轮后 2.231/7.738/12.509,闭环持续有效。消融:去因果音频掩码 FGD 恶化到 3.037、BC 降到 7.027;去交叉注意力 FGD 3.745、BC 6.844、Diversity 8.749,质量崩塌。数据源消融(Table 4):完整 Round-2 数据(3852 样本)达 2.231/7.738/12.509;仅用稀疏偏好样本(1448 样本、无合成放大)只有 2.704,证明合成放大必要;LOM 喂同样数据也只达 2.622,说明增益非纯数据规模。用户研究:20 人盲测成对比较,在自然度、同步性、整体偏好上对 Omni+SynTalker/EMAGE/LOM 及自进化版本全面占优。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| BEATv2 在线共语手势生成 | FGD↓ | 10.519 | 15.681(LOM) | 降低约 32.9% |
| BEATv2 在线共语手势生成 | Latency (ms)↓ | 1.623 | 22.902(LOM) | 约为基线的 1/14 |
| JIYI 在线共语手势生成 | FGD↓ | 2.231(两轮自进化) | 3.240(LOM) | 降低约 31.1% |
| JIYI 自进化消融 | BC↑ | 7.738(两轮自进化) | 7.354(base 版) | +0.384(Diversity 同时 +0.989) |
| 用户研究(20 人盲测成对偏好) | Overall Preference | 全部配对比较中偏好率最高 | Omni+SynTalker / Omni+EMAGE / Omni+LOM / 自进化两轮版 | 自然度、同步性、整体偏好全维度占优 |
局限与改进
作者在附录 D 中坦承五点局限:(1) 严格在线约束限制了长时程规划能力,在话题快速切换、韵律剧烈变化、长情感递进语句或需要预判性手势时,动作的全局结构性不如拥有完整未来语音的离线模型;(2) 依赖合成数据,合成对话与动作和真实交互仍有分布差距,虽用原始动捕数据作质量锚点但未完全消除;(3) 框架假设存在小规模高质量种子数据(JIYI 或相关公开集)来启动合成流水线,零种子数据的泛化未探索;(4) 偏好建模轻量,只用满意/不满意二选一信号加 in-context 示例,没有显式偏好/奖励模型,难以捕捉细粒度、个性化的长期偏好;(5) 具身范围有限,未覆盖面部微表情、视线、话轮转换等通道。我自己的观察:延迟指标只统计手势模块每步推理,未含应答模块与渲染的端到端延迟;FGD 在 BEATv2 上的大幅领先部分可能来自与 LOM 同构的架构与分词选择;评测数据规模较小(JIYI 仅 6 小时、1570 段、单一演员群体),跨说话人风格泛化未系统评估;基线是『为在线改造』的版本,可能低估了部分离线方法的原设计能力。
独立分析的弱点
独立分析几个弱点。其一,因果掩码是双刃剑:保证低延迟的同时让模型对未来韵律完全盲视,遇到强调性手势(需提前蓄势)或话题转折只能事后反应,可引入可容忍延迟内的短前瞻缓冲(如 200-300ms mini-lookahead)或扩散强迫式的分段规划来兼顾。其二,自进化信号太弱且带噪:点赞/点踩稀疏、有选择偏差(活跃用户反馈更多),改进方向是显式奖励模型、隐式反馈信号(对话轮次、停留时长)或基于同步性检测的自动质量信号。其三,合成数据由 LLM+TTS+生成器级联产生,误差逐级放大,而校验工具只查关节极限、滑步等物理性问题,查不出『社交不自然』,可加入以 JIYI 真实分布为参照的判别器或人审抽检环节。其四,VQ-VAE 逐帧预测缺乏显式接触/物理约束,快速大幅度动作可能滑步或穿模,可引入物理引导项或后处理。其五,四部位独立码本可能限制跨部位细粒度耦合(如语音重音与手指微动作的精确同步),可探索共享码本或分层量化结构。
未来方向
作者提出的方向:(1) 在保持严格实时的前提下引入更先进的在线规划机制,提升长时程动作连贯性;(2) 更丰富的偏好感知适配,包括显式偏好建模、个性化对话-动作合成、自进化中更细粒度的数据选择与加权;(3) 扩展到更全面的虚拟陪伴设定:更丰富的情感交互、多模态接地与长期用户适配;(4) 补齐面部微表情、视线、头部注意、话轮转换等具身通道,走向整体多模态具身;(5) 将数字人替换为人形机器人,为真实世界部署铺路。基于成果可延伸的:与扩散强迫/流匹配等实时动作生成范式结合,在因果框架内引入可控前瞻与不确定性估计;把自进化闭环推广为通用的『偏好引导数据飞轮』,用在线偏好持续蒸馏合成数据引擎;在多说话人、多语言、多文化手势规范上验证泛化;探索流式语音-手势联合生成而非语音条件手势,让韵律与手势协同规划;以及把本设定做成公开 benchmark,推动在线共语手势的标准评测。
复现评估
复现难度中等偏高。有利条件:应答模块基于公开的 Qwen2.5/Qwen3-Omni;五个基线均有官方代码;BEATv2 公开;附录给出较完整细节——四部位维度、在线模型 12 层解码器、离线 RQ-VAE $L=4$、码本 512、120 帧滑窗、200 epochs、单张 80GB A100 级 GPU 即可训练,并附对话合成 prompt 模板与指标公式。不利条件:JIYI 数据集为自建(OptiTrack 16 相机 120FPS、50 标记、专业演员),论文未明确承诺开源,个人研究者几乎无法低成本复现同等动捕数据;自进化闭环依赖真实在线部署与用户反馈收集,学术环境难以重现两轮进化的数据构成;『偏好样本』的选取标准与规模着墨不多。项目页为 https://super-star-2026.github.io/,代码与数据发布情况需持续关注。总体判断:在 BEATv2 上复现 Table 1 相对可行;完整复现含 JIYI 与两轮自进化的结果需要动捕资源与部署渠道,难度显著更高。
论文图表
首页宣传图:展示名为 JIYI 的数字人与用户进行情感化对话(用户说『就是觉得自己不够好』,数字人回应安慰),并示意系统通过输入/输出实时管线生成与语音同步的动作,背后由闭环自进化数据管线支撑。
一图概括论文的全部主张:实时交互、语音同步手势、多模态输入、自进化训练,是快速把握系统全貌与目标场景的入口。