OmniVAE:用于联合生成的跨模态对齐音视频VAE OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
联合训练音视频VAE,用对比学习与语义蒸馏实现跨模态对齐,提升联合生成质量。
前置知识
变分自编码器(VAE)与潜在分词器
VAE 通过编码器把高维信号(像素、波形)压缩成低维连续潜在表示 $z$,再用解码器重建。在潜在扩散范式中,VAE 充当'分词器':先压缩、再在潜在空间上做生成,从而大幅降低扩散模型计算量。视频 VAE 通常做时空下采样,音频 VAE/神经编解码器做时间下采样。
OmniVAE 的核心命题就是改造这种分词器:传统分词器只以重建为目标,潜在空间没有语义结构;本文要让它同时具备语义结构和跨模态对齐。理解 VAE 接口才能理解'训练时加目标、推理时无开销'这一设计为何重要。
InfoNCE 对比损失
InfoNCE 是对比学习的标准损失:对锚点和正样本拉近、与一批负样本推远,用可学习温度 $\tau$ 调节锐度。形式为 $\mathcal{L}=-\log\frac{\exp(\text{sim}(a,p)/\tau)}{\sum_{k}\exp(\text{sim}(a,n_k)/\tau)}$。双向 InfoNCE 同时优化 $a\to p$ 和 $p\to a$ 两个方向。
OmniVAE 的跨模态对齐目标就是逐段双向 InfoNCE:把视频段特征 $u_v^{i,s}$ 与音频段特征 $u_a^{j,t}$ 拉近(匹配段为正),与三层负样本推远。读懂它才能理解负样本池设计和同步增益的来源。
知识蒸馏 / 语义蒸馏
知识蒸馏用教师模型的特征监督学生模型,让学生学到教师的语义结构。本文对每个对齐位置施加 sigmoid-cosine 损失 $\mathcal{L}_{cos}=-\frac{1}{|J|}\sum_{j\in J}\log\sigma(\cos(\tilde{z}_j, f_j))$,把冻结的 Qwen3-Omni 编码器特征蒸馏进 VAE 潜在表示。
语义蒸馏是 OmniVAE 的第二个训练目标,作用是让每个模态的潜在空间更易于下游生成器学习。它与对比目标互补:蒸馏改进单模态可学习性,对比改进跨模态对应。
音视频同步与跨模态对齐
音视频同步指生成或检索时音频事件与视觉动作在时间上对齐(如鼓声与击鼓画面同帧出现)。相关工作包括 SyncNet(学习唇同步判别特征)和 Synchformer(用逐段对比学习细粒度时间对应),但这些方法只服务于判别任务,不重建原始信号,不能直接作为生成潜在空间。
OmniVAE 的动机正是把这些'只判别不重建'的同步表示与'只重建不对齐'的 VAE 潜在空间结合起来,成为首个同时可解码且跨模态对齐的音视频 VAE。
研究动机
现有音视频联合生成系统(Sora 2、Veo 3、JavisDiT、MOVA、MMAudio 等)几乎都依赖独立训练、模态特定的 VAE 作分词器,如视频侧 Wan-VAE、Movie Gen VAE,音频侧 DAC、Stable Audio VAE、Qwen-Audio-VAE。这些 VAE 仅以重建(或加对抗)为目标优化,潜在空间既缺语义结构也不具备跨模态对齐:音频潜在 $z_a$ 与视频潜在 $z_v$ 落在两个互不相关的空间。于是下游生成器不仅要学数据分布,还要从头学音视频细粒度时序对应,使联合生成中的同步极难。即便先进系统也只能靠外部注入同步特征缓解——MMAudio 把 Synchformer 帧级视觉特征经 AdaLN 调制喂入流匹配 transformer,报告约 50% 的相对同步提升;HunyuanVideo-Foley 同样依赖 Synchformer 特征做门控调制。而已有语义分词器(VA-VAE、RAE、SpeechTokenizer、MOSS-Audio-Tokenizer)虽能改进单一模态的潜在结构,但都只针对单模态,无法建立音视频对应关系。
本文的目标是本文目标是在不改变 VAE 标准接口、不增加推理开销的前提下,把模态特定语义和跨模态时序对应直接嵌入到音频与视频的潜在表示之中。具体而言,作者希望训练出一个联合训练的音视频 VAE(OmniVAE),它同时满足:(1) 保持两个模态各自的强重建能力;(2) 通过逐段级别的音视频对比学习,让两个潜在空间在细时间粒度上对齐;(3) 通过模态特定的语义蒸馏,使每个模态的潜在空间更易于下游生成器学习;(4) 这些语义与对应信息只在训练阶段生效,推理时两个 VAE 完全独立运行、零额外成本。最终目标是让下游文本到音视频(T2AV)生成器在更易学习的潜在空间上,同时获得更高的生成质量与更精准的音视频同步,从而为统一多模态生成奠定更强的表示基础。
与已有工作不同的是,OmniVAE 的独特切入角度是把跨模态对应从下游生成器转移到分词器层。以往工作要么从全局对比角度组织模态(如 CLIP 式共享语义空间),要么学习模态无关的离散码以支持跨模态迁移,这些方法能捕捉高层语义对应,但对细粒度时序关系建模有限,且通常不优化重建、不能直接作为生成潜在空间;而 SyncNet、Synchformer 等专门学习时序对应的方法只服务于判别任务,未优化重建能力。OmniVAE 填补了'可解码可重建'与'细粒度跨模态对齐'之间的空白,成为首个显式为跨模态潜在对齐设计的音视频 VAE。区别于只改进单模态的语义分词器,它同时蒸馏模态特定语义并对齐两个模态;区别于需要外部同步特征注入的系统,它把对应关系直接编码进潜在表示,让下游生成器无需从头学习同步。这种'对齐但解耦'、'训练加目标、推理零开销'的设计是本文相对已有路径的关键差异。
核心方法
整体思路是保留两个架构独立的 VAE,再在其潜在空间之上叠加两个仅训练时使用的目标。视频分支基于 Wan2.2 VAE 骨干,将 $x_v$ 编码为 $z_v\in\mathbb{R}^{C_v\times T_v\times (H/8)\times (W/8)}$,做 4 倍时间、8 倍空间下采样,$T_v=1+T/4$;音频分支采用 DAC 风格连续 VAE,将 48kHz 波形 $x_a$ 编码为 1D 潜在 $z_a\in\mathbb{R}^{C_a\times T_a}$,$T_a=L/d_a$。两分支推理时互不交互、可单独部署。重建目标之上叠加两目标:一是逐段音视频对比学习,用轻量 Transformer 做视频空间聚合、ConvNeXt-1D 做音频时间聚合,把异质潜在映射到共享空间并施加双向 InfoNCE;二是模态特定语义蒸馏,用冻结 Qwen3-Omni 编码器作教师施加 sigmoid-cosine 损失。两目标的对比头和投影器仅训练时用、推理时丢弃,故零额外开销。模型保留约 1.08B 参数(视频 704.7M、音频 371.6M),训练时额外增约 49.5M(对比头 20.5M、蒸馏投影器 29.0M)。
核心创新点是把'分词器'从单纯重建工具升级为'携带跨模态对应的语义分词器'。与已有方法的本质区别有三:第一,与仅改进单模态的语义分词器(VA-VAE、SpeechTokenizer 等)不同,OmniVAE 首次在分词器层面同时蒸馏两模态语义并对齐二者潜在空间,让对应关系成为潜在空间的内禀属性,而非下游额外学习的负担。第二,与依赖外部同步特征注入的系统(MMAudio 用 Synchformer 通过 AdaLN 调制、HunyuanVideo-Foley 用门控时间调制)不同,OmniVAE 把同步对应编码进潜在表示本身,下游无需额外同步模块。第三,提出'源视频-片段-段'三层负样本构造:对锚点段 $(i,s)$,负样本集 $\mathcal{N}_{i,s}$ 包含同片段内 47 个段内负、48 个同源视频兄弟片段负、24 个跨视频负,约 2:2:1 配比,兼顾硬时间区分与广语义多样性,远超 Synchformer 只从同片段加一个额外片段取负的方案。两个目标都是训练时专用、推理时丢弃,工程上非常实用。
方法步骤详情
训练分三阶段。阶段 1:独立预训练两 VAE,仅用重建目标(视频 L1+LPIPS+KL,音频波形+多分辨率 mel+KL),两分支启用对抗监督,音频额外用判别器特征匹配,单模态变体训 250k 步、121 帧。阶段 2:引入对比对齐与语义蒸馏,因对比学习需长片段和大负样本池(内存密集),移除判别器与特征匹配,用 193 帧、全局批量 256 联合训 82k 步,遵循先冻结视频 VAE、再解冻的两阶段调度。逐段对比:预处理把长视频切成 8 秒片段、再切 $S=48$ 段(约 1/6 秒);视频潜在经空间聚合(轻量 Transformer,排除首帧)再时间池化投影为 $u_v^i\in\mathbb{R}^{S\times d}$;音频潜在经 ConvNeXt-1D 时间聚合得 $u_a^i$;对 $\text{sim}=u_v^{i,s}\cdot u_a^{j,t}$ 用可学习温度 $\tau$ 的双向 InfoNCE:$$\mathcal{L}_{v\to a}=-\frac{1}{BS}\sum\log\frac{e^{\text{sim}_{i,s,i,s}/\tau}}{\sum_{(j,t)\in\mathcal{P}_{i,s}}e^{\text{sim}_{i,s,j,t}/\tau}}$$语义蒸馏用 Qwen3-Omni 视觉第 27 层、音频第 18 层特征作教师,施加 $\mathcal{L}_{cos}=\frac{1}{|J|}\sum\log\sigma(\cos(\tilde{z}_j,f_j))$。总损失 $\mathcal{L}_v=\lambda_{vr}\mathcal{L}_{vr}+\lambda_{vd}\mathcal{L}_{vd}+\lambda_{avclip}\mathcal{L}_{avclip}$,$\lambda$ 用损失量级加权。阶段 3:冻结音频编码器、用阶段 1 音频损失微调解码器并恢复对抗以消除电子伪影。下游 T2AV 冻结 OmniVAE 作分词器,用流匹配训练,先预训练 T2I/T2V 与 T2A 再交叉注意力桥接。
技术新颖性
技术新颖性体现在多层面。架构上,OmniVAE 不强行统一编码器,而保留两个架构独立、可单独部署的 VAE,通过训练时的共享嵌入空间与对比头实现'对齐但解耦'设计,比强行共享编码器更灵活且推理可并行。对比目标上,借鉴 Synchformer 的逐段对比但大幅扩展负样本池:Synchformer 只取同片段与一个额外片段的负样本,OmniVAE 则利用源视频-片段-段层级配合分布式批量构造三层负样本(段内 47、兄弟片段 48、跨视频 24,约 2:2:1),并在 24fps、8 秒片段、0.17 秒段粒度上获 A@1 达 30.0 的最佳同步探测精度。蒸馏目标上,巧妙选 Qwen3-Omni 作统一教师——其视觉编码器同时覆盖图像和视频、音频编码器覆盖一般音频和语音,避免多教师不一致;并遵循 iREPA 对视觉教师特征做空间归一化以强调局部变化。训练调度上,三阶段设计解决'重建需更长训练但语义学习需大内存'的矛盾,阶段 3 微调解码器既修复伪影又不改已对齐的潜在空间。损失平衡上,对比三种策略发现损失量级加权显著更优,为该类联合训练提供实用经验。
实验结果
实验在重建、同步探测、T2AV 生成三层验证。重建(Table 2):视频端各配置 PSNR 在 36.22–36.93、SSIM 约 0.96,额外目标几乎不损视频重建,OmniVAE 略低于 Recon 但优于外部 Wan2.1/2.2 VAE;音频端 OmniVAE STOI=0.9948、ViSQOL=4.08/4.31,对比学习引入轻微退化但仍优于 HunyuanVideo-Foley VAE、MMAudio VAE 与 Stable Audio 3 SAME 系列。同步探测(Table 3,VGS-Sp):OmniVAE 冻结 A@1=20.2%、A@5=50.1%,远超 Recon 的 6.4%/31.5%;微调后 A@1=22.3%,证明对比学习是时间对齐主要增益来源,蒸馏贡献很小。T2AV 生成(Table 4,Verse-Bench,三检查点均值,CFG=5):OmniVAE Desync=0.570(Recon 0.884)、LSE-C=2.093(1.479)、Video-Audio Sim=0.274;音频质量 IS=4.001(3.041)、KL=1.140(1.279)、FD=0.875(1.029)、Speech WER=0.168(0.243);AudioBox CE=4.826、CU=6.119、PQ=6.406 均最佳。AVCLIP 主要提升跨模态对齐与音频美学,蒸馏提升模态特定质量,二者结合最强。消融(Table 5)24fps+8 秒+0.17 秒段 A@1 达 30.0;(Table 6)损失量级加权 Intra A@48=0.51、Overall A@64=0.24,显著优于 GradNorm(0.44/0.17)与不确定性加权(0.29/0.13)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 音视频同步探测(VGS-Sp 时间偏移分类) | A@1(冻结) | OmniVAE 20.2% | Recon(仅重建)6.4% | +13.8 个百分点(约 3.2 倍);微调聚合器后 22.3% |
| 文本到音视频联合生成(Verse-Bench,跨模态对齐) | Desync(越低越好) | OmniVAE 0.570 | Recon 0.884 | 相对降低约 35.5% |
| 文本到音视频联合生成(Verse-Bench,唇同步) | LSE-C(越高越好) | OmniVAE 2.093 | Recon 1.479 | 相对提升约 41.5% |
| 文本到音视频联合生成(Verse-Bench,音频质量) | Inception Score(IS) | OmniVAE 4.001 | Recon 3.041 | 相对提升约 31.6% |
| 文本到音视频联合生成(Verse-Bench,语音可懂度) | Speech WER(越低越好) | OmniVAE 0.168 | Recon 0.243 | 相对降低约 30.9% |
| 段检索(损失平衡消融,细粒度对齐) | Intra A@48 | 损失量级加权 0.51 | 不确定性加权 0.13 | 约 3.9 倍 |
局限与改进
作者承认的局限:阶段 2 为省显存移除音频判别器会引入轻微电子伪影,需阶段 3 微调解码器补救(客观指标变化可忽略);关节同步评估受 256×256 低分辨率限制,人脸过小致 SyncNet 可检测样本少,Set3 需用 LLM 改写提示为近景镜头,故该子集结果与原 Verse-Bench 不可直接比较;作者也指出未来应在更大规模验证。我自己的观察:(1) 训练数据约 23M 片段虽刻意平衡语音/非语音各半,但非语音覆盖仍依赖 LLM 概念树与人工标注,长尾分布可能仍有偏;(2) 对比学习最佳配置(8 秒片段、48 段、约 1/6 秒粒度)段粒度固定,对更短瞬态事件(枪声、快门)的同步可能仍不够细;(3) AVCLIP 在视频 rFVD(OmniVAE 2.81/1.31 vs Recon 2.40/1.25)和音频 ViSQOL(4.08/4.31 vs 4.55/4.60)仍有轻微下降,说明对齐与重建存在张力;(4) 未报告推理时实际生成速度、显存占用和下游 T2AV 规模;(5) 缺少与 MOVA、JavisDiT 等开源联合生成系统的端到端直接横向对比。
独立分析的弱点
弱点 1:负样本构造与段粒度是手动设计的(48 段、约 1/6 秒、三层 2:2:1 配比),缺自适应或学习式负样本挖掘;瞬态声事件(毫秒级)可能被过粗段粒度模糊,改进方向是引入层次化或可变粒度对比、在线硬负挖掘与课程学习。弱点 2:阶段 3 需单独微调解码器以修复移除判别器引入的伪影,说明'内存换质量'仍是工程妥协;可用更高效对抗损失、梯度检查点或混合精度让阶段 2 保留判别器,从而省去阶段 3。弱点 3:下游 T2AV 评估在 256×256 低分辨率进行,与 Sora 2、Veo 3 等工业系统的高清输出不可比,且只与自家四种配置对比,缺与 MOVA、JavisDiT、LTX-2 等开源联合生成器的直接横向比较。弱点 4:所有评估都依赖自动指标(Desync、LSE-C、AudioBox、IS/KL/FD/WER),缺大规模人工偏好评测,难反映真实感知质量。弱点 5:跨模态对齐仅在自建 T2AV 模型上验证,未展示作为通用分词器在视频到音频、音频到视频、唇同步驱动等更多下游的迁移性。弱点 6:损失系数 $\lambda$ 的具体值与三阶段调度超参敏感度未做系统分析。
未来方向
作者明确提出的未来方向:探索更有效的模态特定与跨模态语义学习方法,并在更大规模上验证其收益。基于本文成果可延伸的方向:(1) 将逐段对比扩展为可变粒度或层次化对比,适配瞬态声事件与长程结构;(2) 探索第三模态(文本、深度、运动轨迹)的统一表示,向真正的全模态(omni-modal)建模推进——论文标题与结论都强调 'unified multimodal generation foundation';(3) 将 Qwen3-Omni 教师替换或扩展为更强的多模态基础模型,研究教师质量对潜在空间可学习性的影响;(4) 把 OmniVAE 的跨模态对齐思想迁移到 3D/4D 场景生成、长视频联合生成、数字人唇同步驱动等更复杂任务;(5) 研究对比头与蒸馏投影器在持续学习或新模态扩展下的重用性,降低多模态预训练的边际成本;(6) 结合扩散模型本身的损失感知,研究'为生成而设计'的分词器目标,而非仅从重建与判别角度优化,探索生成损失反向指导分词器训练的可能性。
复现评估
复现评估:开源情况较好——论文提供 Homepage、GitHub 代码(github.com/OpenMOSS/OmniVAE)和 HuggingFace 模型(OpenMOSS-Team/OmniVAE),视频 VAE 基于开源 Wan2.2 VAE、音频 VAE 基于开源 HunyuanVideo-Foley VAE 初始化,教师用开源 Qwen3-Omni,这些都降低复现门槛。数据上,作者自建约 23M 音视频片段语料库(语音/非语音各半),用 LLM 概念树 + 人工验证 + 多阶段过滤(语义对齐评分、DeSync 同步过滤、音频事件检测)+ AudioSet 组合,但完整管线细节(过滤阈值、标注协议)披露有限,且自建数据不一定完全公开,可能成为复现障碍。算力上,训练需分布式批量 256、193 帧片段的联合训练,共约 1.13B 参数且对比学习内存密集,对单卡或小集群用户挑战极大。论文给出关键超参(步数 250k/82k、帧数 121/193、负样本 47/48/24 配比、损失量级加权)与三阶段调度,但未完整披露各 $\lambda$ 系数值与精确学习率,需读代码补全。整体复现难度中等偏高,主要依赖较强算力与自建数据。
论文图表