← 返回 2026-08-12

Ex-Omni-2D:具备原生视觉存在的全模态对话模型 Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

Haoyu Zhang, Zhipeng Li, Xiaoying Tang, Tianshu Yu, Yiwen Guo 📅 2026-08-11 👍 16 2026-08-17 18:30
全模态对话 扩散模型 流式生成 知识蒸馏 语音合成 音频驱动视频生成

让全模态对话模型不仅开口说话,还能以参考形象生成口型同步的视频回应

前置知识

多码本语音单元(Multi-codebook Speech Units)

神经编解码器(如 Qwen3-TTS)把语音波形离散化为多组码本索引:第一个码本按声学帧自回归生成,其余 15 个残差码本逐步修正细节。本文使用 $C=16$ 个码本,单元序列 $U \in \mathbb{N}^{N \times C}$,帧率 12.5 Hz。它既是语音的中间表示,也能被适配器映射为视频条件特征。

本文的核心接口设计就是把多码本语音单元当作语音与视频共享的『声学-时间』信号,理解它才能看懂语音单元如何同时解码成音频和驱动口型。

Flow Matching(流匹配)

一种连续归一化流训练范式:把干净潜变量 $x_0$ 与高斯噪声 $\epsilon$ 按噪声水平 $\sigma$ 插值成 $x_\sigma = (1-\sigma)x_0 + \sigma\epsilon$,训练去噪网络预测从噪声到数据的速度场,推理时沿该场迭代去噪若干步得到样本。相比 DDPM 训练更稳定,且便于做少步蒸馏。

Ex-Omni-2D 的视频生成器(Teacher 与 Student)都建立在 flow matching 之上,论文中的质量-步数权衡、蒸馏目标均围绕它展开。

视觉思维计划(VTP, Visual Thought Plan)

对话模型在 标签内输出的一段结构化文本计划 $p = (p_{first}, p_{scene}, p_{emotion}, p_{style}, p_{motion})$,分别描述首帧场景、整体场景、情绪、动作风格和动作细节。它不展示给用户,而是被文本编码器编码为 $L_{vtp}$ 供视频生成器消费。

VTP 是本文让对话模型『决定形象怎么演』的关键创新,也是理解消融实验(Table 5、6)的前提。

块因果注意力与前缀流式(Block-causal & Prefix Streaming)

把视频潜变量序列切成三潜变量一块的 chunk:块内保留双向自注意力,块间通过持久的历史 KV cache 强制因果,保证看不到未来帧;每个新块还携带上一块最终的干净潜变量作为一潜变量前缀,提供局部运动边界条件,从而支持增量渲染。

这是 Streaming Student 能边生成边播放的机制,论文对『后期块主体漂移』的分析也基于此。

E2E RTF(端到端实时率)

Real-Time Factor 指生成一段回应所需时间与回应时长的比值,RTF<1 表示快于实时。本文的 RTF 除了视频渲染外,还包含自回归回应文本生成、语音单元生成与音视频同步的耗时,因此即使视频渲染器超过 25 FPS,端到端仍可能略慢于实时。

Table 4 的效率对比核心就是 FPS 与 E2E RTF 两个指标,混淆它们会误读论文的部署结论。

研究动机

现有全模态对话系统(如 Qwen2.5-Omni、Moshi、VITA-1.5)已经能理解文本、语音和视觉输入并合成自然的口语回复,但在很多交互场景中,用户期望的不只是『听到回答』,还希望看到一个外观、情绪、动作与当前对话匹配的可见智能体——而口语回答结束后智能体在视觉上是缺席的。已有的说话人头像模型(OmniAvatar-1.3B、StableAvatar-1.3B、echomimic、FantasyTalking)虽然能把肖像按语音驱动成视频,但它们的视觉行为通常由一段已完成的波形和对话之外准备的辅助提示词控制,本质上是条件渲染器,不能作为对话原生回应。联合音视频生成器(UniVerse-1、UniAVGen、JavisDiT、Ovi)耦合更紧,却是提示驱动的内容生成工具,输入里不包含对话状态。缺失的关键一环是一个『回应接口』,让对话模型同时决定说什么、以及说话时虚拟形象看起来是什么样。

本文的目标是本文要构建一个对话原生的全模态回应框架:给定多模态用户查询 $x=(x_t, x_s)$(文本、语音或二者兼有)、一张参考图像 $I_{ref}$ 和一段参考音频 $a_{ref}$,系统生成回应文本、以参考音色合成个性化语音,以及一个与参考形象一致、与语音帧级同步的回应视频。同时论文要求方案具备工程可行性:对话与语音通路能利用语音中心的海量数据训练,视频通路能利用带标注的视频片段训练,而不必依赖大规模的『对话-语音-视频』三元配对数据;并探索一个可增量生成、启动延迟低、能部署在四 GPU 环境下的流式版本,量化其质量-延迟权衡。

与已有工作不同的是,本文的独特切入角度是用两个轻量接口把对话、语音、视频三条通路『先拆开训练、再推理时接上』:一是对话模型输出的结构化 Visual Thought Plan (VTP),用纯文本承载场景、情绪与动作语义;二是预训练的多码本语音单元 $U$,承载音色内容与 12.5 Hz 的时间信号。与级联方案不同,视频生成器无需重新编码完整波形,直接消费帧对齐的语音单元;与联合音视频扩散不同,视觉行为源自当前对话的规划而非静态提示。VTP 是文本,因此可以用普通自回归损失训练、也能在评测中人工检查甚至手动编辑,这为可解释的视觉控制留出了空间。

核心方法

整体是『LLM 规划 + 语音生成 + 视频实现』三段式。输入端:文本经嵌入 $E_t=Emb_{text}(x_t)$,语音经语音编码器加投影 $E_s=P_{sp}(E_{sp}(x_s))$,按查询中的顺序拼成多模态表示 $E_x$;参考图像走两条独立通路——对话理解用 Qwen3-VL-2B 视觉塔投影 $z^{llm}_I = P_{vis}(E_{vis}(I_{ref}))$,视频外观用 Wan 3D VAE 编码为 $R_{ref}=E_{vae}(I_{ref})$。骨干为 Qwen3-8B,按协议 $o = [, p, , , y, ]$ 先输出五字段 VTP $p=(p_{first}, p_{scene}, p_{emotion}, p_{style}, p_{motion})$,再输出用户可见回应 $y$,VTP 被编码为语义条件 $L_{vtp}=E_{text}(p)$。语音生成器由 Qwen3-TTS-0.6B 初始化,以回应 span 的最终层隐状态 $H^\ell_y$、回应 token 和说话人嵌入 $s_{ref}$ 为条件生成 16 码本单元 $U = G_{sp}(H^\ell_y, y, s_{ref})$。码本嵌入聚合经适配器 $\hat{A}_n = f_{aud}(\sum_{c=1}^{C} E_c(u_{n,c}))$ 后,因语音 12.5 Hz、视频 25 FPS,每声学帧复制两帧 $A_{2n-1}=A_{2n}=\hat{A}_n$ 得到帧对齐声学条件。视频 Teacher 基于 Wan2.1-T2V-1.3B(初始化自 OmniAvatar-1.3B LoRA),在 flow matching 框架下以 $x_\sigma=(1-\sigma)x_0+\sigma\epsilon$ 训练,条件为 $(R_{ref}, A, L_{vtp})$,声学特征注入 DiT 块 2-15:$X^{(\ell)} \leftarrow X^{(\ell)} + G^{(\ell)}$。

核心创新是『对话原生的视觉回应接口』:对话模型用一个内部结构化计划(VTP)加一串多码本语音单元,同时决定说什么和说话的形象如何演绎。与已有工作的本质区别有三点。第一,相对说话头像模型(OmniAvatar 等),视觉行为不再由对话外的辅助提示词和已完成的波形控制,而是由当前多模态查询驱动的 VTP 语义和流式生成的语音单元共同决定;第二,相对联合音视频生成器(UniAVGen、UniVerse-1),它把生成问题接入了对话状态,回应前先『想』形象该怎么演;第三,这条接口让训练数据彻底解耦:语音与对话模块用 ASR/TTS 和对话数据(约 800K ASR、1M TTS、InstructS2S-200K、OmniCharacter)训练,视频模块只需用约 140K 条带 VTP 标注和 teacher-forced 语音单元的头像视频片段训练,绕开了大规模对话-语音-视频三元配对数据不存在的现实约束。Prefix Streaming 则把已生成的干净潜变量作为下一块的运动边界条件,是针对长序列漂移的部分缓解。

方法步骤详情

训练分四个阶段。Stage 1 语音接口对齐:用约 80 万条 ASR 和 100 万条 TTS 样本训练语音投影器与语音生成器(Qwen3-TTS-0.6B 初始化),LLM 冻结,学的是『文本+隐状态到 16 码本单元』的映射。Stage 2 全模态回应适应:用 InstructS2S-200K 和 OmniCharacter 更新 LLM、语音投影器与生成器,引入 / 协议让模型学会先输出 VTP 再作答;因这些对话数据没有目标回应视频,用 Qwen3-VL-235B-A22B-Instruct 依据参考图像、对话上下文与目标回应按五字段模板构造 VTP 监督。Stage 3 头像视频实现:把约 14 万条过滤后的 SpeakerVid 片段转成『参考帧 + 五字段 VTP 标注 + 对齐语音单元 + 目标视频』的记录,以 flow matching 损失训练全序列视频 Teacher(Wan2.1-T2V-1.3B + OmniAvatar LoRA,语音特征注入 DiT 块 2-15),训练完成后冻结。Stage 4 流式学生蒸馏:把序列切成三潜变量块,Phase I 做 flow-map 学习(学习从噪声到干净潜变量的少步映射),Phase II 做在线分布匹配,使块因果的 Streaming Student 在四步内逼近 Teacher 分布;推理时前缀流式携带上一块干净潜变量,支持 400×720/720×400 分辨率下的增量播放。

技术新颖性

技术新颖性体现在四点。其一,『原生视觉存在』被形式化为两个可学习接口(VTP 与多码本语音单元),而非后处理的音视频配音——VTP 是文本计划,可自回归监督、可检查、可人工编辑(Figure 2b 的情绪可控性实验正基于此),这在对话模型中是新的设计。其二,语音单元被复用为帧级时间信号:16 个码本全部经适配器进入视频通路,12.5 Hz 到 25 FPS 的复制对齐让视频生成器无需重编码波形即可获得精确的口型时序,论文也坦诚指出这比波形特征更难优化,是当前的性能瓶颈之一。其三,全序列 Teacher 与块因果 Streaming Student 的两极设计给出了清晰的质量-延迟谱系:Teacher 全局双向注意力保质量,Student 块内双向、块间因果(持久 KV cache)加一潜变量前缀换取启动速度。其四,四阶段异构数据训练方案本身即是贡献——用 VLP 大模型合成 VTP 标注、用 teacher-forced 单元桥接语音与视频数据,使三通路可各自独立扩展。

Overview of Ex-Omni-2D
Figure 1: Overview of Ex-Omni-2D

实验结果

论文在 CommonEval 200 条语音问答(配 SpeakerVid 测试集采样的参考条件)、VoiceBench 与 OmniCharacter 400 轮对话上评测。其一(Table 1):Teacher 取得 SIM 0.417、DD 72.00、Sync-C 4.95(SC 94.62、IQ 67.31),并不统治单项渲染指标——echomimic 的 SC 97.87、DD 74.00 最高,UniAVGen 的 IQ 68.02 最高,OmniAvatar-1.3B 的 Sync-C 5.64 最强——但它额外生成了对话回应、个性化语音和查询驱动的视觉计划;Streaming Student 从 2 步到 8 步,SC 93.33→93.91、IQ 52.70→61.15、DD 9.50→48.00、Sync-C 3.51→4.00,呈现可控的质量-效率权衡。其二(Table 2):OmniCharacter 十二维平均 3.283 略高于骨干 Qwen3-8B 的 3.264,但 Flu./Coh./Cons. 三项拿到全场最高 3.812/4.100/3.902(三均值 3.938 对骨干 3.537),说明视觉回应训练重塑而非全面增强能力。其三(Table 3):VoiceBench 上 AlpacaEval 4.28、CommonEval 3.71、BBH 58.70,仅次于 Qwen2.5-Omni(4.49/3.93/60.80)。其四(Table 4):Teacher 50 步仅 1.409 FPS、E2E RTF 26.917;Student 2 步 39.546 FPS/RTF 1.201,4 步 26.512 FPS/RTF 1.293,8 步 15.622 FPS/RTF 1.932,端到端仍略慢于实时。其五(Table 5):去掉响应特定 VTP 后 SC 94.62→93.58、Sync-C 4.95→4.65;换公共参考语音后 PQ 7.53→8.11、CU 7.06→7.45,但 SIM 从 0.417 崩到 0.015。其六(Table 6):VTP 监督使 CommonEval 3.82→3.71、BBH 61.10→58.70。其七(Table 7):换上游 LLM 效果依渲染器而异,说明优势来自原生耦合而非 LLM 本身。

Capability-oriented audio-video comparison across three generation paradigms
Table 1: Capability-oriented audio-video comparison across three generation paradigms
Full multi-turn dialogue evaluation on OmniCharacter
Table 2: Full multi-turn dialogue evaluation on OmniCharacter
Speech QA comparison
Table 3: Speech QA comparison
Quality–efficiency Comparison between Teacher and Streaming Student
Table 4: Quality–efficiency Comparison between Teacher and Streaming Student
Complete ablation of response-specific VTP and personalized reference speech
Table 5: Complete ablation of response-specific VTP and personalized reference speech
Effect of VTP supervision on speech QA
Table 6: Effect of VTP supervision on speech QA
Controlled upstream-source comparison
Table 7: Controlled upstream-source comparison
Qualitative visualization of Ex-Omni-2D
Figure 2: Qualitative visualization of Ex-Omni-2D
查看结构化数据
任务指标本文基线提升
对话式音视频回应生成(200 条 CommonEval 语音问答) SIM / DD / Sync-C Teacher:SIM 0.417,DD 72.00,Sync-C 4.95 echomimic:DD 74.00;UniAVGen:SIM 0.291;OmniAvatar-1.3B:Sync-C 5.64 SIM 0.417 显著高于 UniAVGen 的 0.291,DD 72.00 接近最高的 74.00,Sync-C 4.95 略低于 OmniAvatar 的 5.64,但同时生成对话回应与个性化语音
多轮角色对话质量(OmniCharacter 400 轮) Fluency / Coherency / Consistency / 十二维平均 3.812 / 4.100 / 3.902 / 平均 3.283 Qwen3-8B 骨干:三均值 3.537,十二维平均 3.264;Qwen2.5-Omni-7B 平均 3.258 三项对话流畅性指标全场最高,三均值 3.938 对骨干 3.537;十二维平均小幅领先
语音问答(VoiceBench) AlpacaEval / CommonEval / BBH 4.28 / 3.71 / 58.70 Qwen2.5-Omni:4.49 / 3.93 / 60.80 所列系统中第二名,落后 Qwen2.5-Omni 约 0.21 / 0.22 / 2.10
视频渲染效率(400×720/720×400,四 GPU) FPS / E2E RTF Student 4 步:26.512 FPS,RTF 1.293 Teacher 50 步:1.409 FPS,RTF 26.917 渲染速度提升约 18.8 倍,RTF 从 26.9 降至 1.29,但端到端仍略慢于实时
VTP 与个性化语音消融(同 200 条 CommonEval) SC / Sync-C / SIM 完整版 SC 94.62,Sync-C 4.95,SIM 0.417 去 VTP:SC 93.58,Sync-C 4.65;去个性化语音:SIM 0.015 响应特定 VTP 贡献 SC +1.04、Sync-C +0.30;个性化语音贡献 SIM +0.402(尽管公共语音使 PQ +0.58)
VTP 监督对问答能力的影响 CommonEval / BBH VTP+回应:3.71 / 58.70 仅回应(无 VTP):3.82 / 61.10 代价为 CommonEval -0.11、BBH -2.40,换取显式视觉规划接口

局限与改进

作者承认三点:多码本语音单元作为视频条件比波形衍生特征更难优化,且受算力限制未验证更大规模训练能否弥补这一差距;Streaming Student 在长序列上仍会漂移,一潜变量前缀只能部分缓解累积误差。我自己的观察还有:Teacher 的 SIM 仅 0.417,说话人相似度绝对值不高,与公共语音下 0.015 的对照虽说明个性化有效,但整体身份保真仍有很大空间;VTP 监督以 CommonEval -0.11、BBH -2.40 为代价换取视觉接口,说明共享自回归通道存在容量冲突;Figure 2b 显示 VTP 情绪字段编辑后表情变化可能微弱甚至不出现,说明它只是软性的高层语义引导而非严格控制信号,最终动作由 VTP、语音条件与文本/音频 CFG 尺度共同决定;4 步 Student 渲染 26.5 FPS 虽超过 25 FPS 播放率,但端到端 RTF 1.293 仍慢于实时,全流水线尚不能真正实时对话;此外 2 步 Student 的 DD 从 72.00 骤降到 9.50,运动几乎消失,少步区间的质量坍缩相当严重。

独立分析的弱点

第一,少步蒸馏质量坍缩:2 步 Student 的 DD 只有 9.50(Teacher 72.00),IQ 仅 52.70(67.31),运动几乎消失,说明 flow-map + 分布匹配在极低步数下无法保留运动多样性,可考虑引入运动感知的蒸馏损失或对运动区域加权的匹配项。第二,长序列漂移:一潜变量前缀只是局部运动边界条件,累积误差未被消除,改进方向是更长的历史窗口、跨块记忆模块或周期性的全局外观再锚定(例如周期性重注入参考潜变量 $R_{ref}$)。第三,语音单元接口弱于波形特征:作者明确指出多码本单元更难优化,可以探索在视频侧并联一个轻量波形特征分支,或对码本嵌入做对比学习对齐。第四,VTP 控制是软性的:情绪字段编辑后表情可能微弱或不出现,可提高 CFG 尺度、引入 VTP 字段级的注意力约束或在训练中加大情绪描述与表情的因果绑定。第五,端到端 RTF 1.293 仍慢于实时:瓶颈在自回归回应生成、语音单元生成与音视频同步,可对 LLM 与语音生成做投机解码或并行化。第六,VTP 监督挤占问答与推理容量(BBH 降 2.40),可尝试把 VTP 放到辅助头而非共享自回归通道。第七,SIM 0.417 的身份保真不算高,外观参考机制(ID 保留损失)仍有提升空间。

未来方向

作者方向上:更大规模训练以检验多码本接口的性能上限;改进 Prefix Streaming 以彻底解决长序列后期块的主体漂移。可以延伸的方向包括:(1) 把 VTP 从五字段文本升级为可编辑的显式控制面板,结合姿态/表情先验实现严格可控的头像演绎;(2) 在 Student 中引入长期外观与身份记忆(如参考帧的周期性交叉注意力),支撑分钟级连续对话视频;(3) 端到端流水线级联优化,让 LLM、语音单元与视频渲染共享调度,把 E2E RTF 压到 1 以下实现真实时对话;(4) 把 VTP 接口迁移到非头像场景——具身智能体的视觉回应规划(手势、物品操作),检验『先规划视觉再执行』范式的泛化性;(5) 训练一个 VTP 质量评价模型,自动评估计划与最终视频的语义一致性,替代目前依赖 VLP 模型的标注与人工编辑实验;(6) 探索去除 VTP 的替代方案(如在 DiT 侧直接注入对话隐状态)以规避 BBH 2.40 分的推理能力损失。

复现评估

复现难度偏高。论文提供了项目主页(https://logo-cuhksz.github.io/Ex-Omni-2D),但正文与摘要中均未明确承诺开源代码或模型权重,截稿时仅有定性示例。数据方面:ASR/TTS 数据(约 800K/1M)、InstructS2S-200K、OmniCharacter、SpeakerVid 均为公开或可申请的数据集,但 Stage 2 的五字段 VTP 标注依赖 Qwen3-VL-235B-A22B-Instruct 生成,Stage 3 的 140K 片段还需过滤与标注流水线,这部分工程成本不小。模型依赖 Qwen3-8B、Qwen3-TTS-0.6B、Qwen3-VL-2B、Wan2.1-T2V-1.3B 与 OmniAvatar-1.3B LoRA,均为开源权重,获取门槛低。算力上,完整四阶段训练涉及 LLM、语音与 1.3B 级 DiT 的多阶段微调,估算需要数十张高端 GPU 周级训练;部署评测也需四 GPU。评测协议友好:VoiceBench、OmniCharacter 官方脚本公开,基线(echomimic、StableAvatar、OmniAvatar、UniAVGen、UniVerse-1 等)多数开源。总体而言,对资源有限的团队,可行的复现路径是只做 Stage 3 + Stage 4 的小规模验证(视频侧),对话侧直接复用 Qwen2.5-Omni 级联近似。