← 返回 2026-07-20

VideoRAE:通过表示自编码器驯服视频基础模型用于生成建模 VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang 📅 2026-07-15 👍 14 2026-07-25 18:30
潜在空间量化 自编码器 表示学习 视频基础模型 视频生成

用冻结视频基础模型做编码器,统一支持连续与离散视频生成,收敛快5倍。

前置知识

视频基础模型(Video Foundation Model, VFM)

在大规模视频数据上以自监督方式预训练的通用模型,如 V-JEPA 2 和 VideoMAEv2。V-JEPA 2 采用联合嵌入预测架构(JEPA),让目标编码器预测被掩码区域的潜在特征;VideoMAEv2 则通过双重掩码的掩码视频自编码方式训练。它们能提取结构化、可预测的时空语义特征。

本文的核心就是把冻结的 VFM 当成视频自动编码器的编码器,所以必须理解 VFM 提供了什么样的语义表示,以及不同 VFM 的预训练范式差异如何影响后续生成质量。

3D-VAE / 视频 Tokenizer

三维变分自编码器,将原始视频片段 $X \in \mathbb{R}^{B\times 3\times T\times H\times W}$ 压缩到紧凑的潜在空间,再由解码器重建像素。传统 3D-VAE 主要由像素级 MSE 损失和对抗损失驱动,服务于像素重建,可分为连续型(供扩散模型)和离散型(供自回归模型)两类。

VideoRAE 的对照对象就是传统 3D-VAE。理解传统 VAE 为像素重建优化、潜在空间语义贫乏这一痛点,才能理解 VideoRAE 的语义驱动压缩动机。

表示自编码器(Representation Autoencoder, RAE)

图像领域近期提出的一类方法,直接利用冻结视觉基础模型提取的特征作为潜在空间进行编码与解码,证明预训练表示可被转化为可解码、生成友好的潜在空间。VideoRAE 把这一思想从图像扩展到视频。

VideoRAE 的命名和方法论直接源于 RAE。理解 RAE 在图像上的成功,有助于把握作者把该方法迁移到时序更复杂、冗余更强的视频领域时所面对的挑战。

向量量化与 SimVQ

向量量化(VQ)将连续向量映射到离散码本最近邻。SimVQ 在此基础上改进:初始化一个冻结的基础码本 $E_k$,通过可学习的 MLP 动态映射成有效码本 $C_k = \text{MLP}_k(E_k)$,只更新 MLP 参数,从而缓解码本崩溃问题。VideoRAE 进一步提出 Multi-Codebook SimVQ,将向量沿通道维度分成 $K$ 个子向量分别量化。

离散 VideoRAE 面向自回归生成,其 Multi-Codebook SimVQ 是关键创新之一,理解 VQ/SimVQ 才能看懂消融实验中从 VQ 到多码本 SimVQ 的性能跃升(gFVD 从 95 降到 40)。

KL 散度正则化

传统连续 VAE 用 KL 散度惩罚项把潜在分布约束为标准高斯分布,以保证潜在空间平滑、利于扩散建模。但这一刚性约束常限制潜在表达力,导致视觉细节过度平滑,并与像素重建目标产生优化冲突。

VideoRAE 的卖点之一是完全去除 KL 正则化,改用表示对齐(REPA)隐式正则化潜在流形。理解 KL 的副作用,才能理解为什么作者称其为 KL-free 范式。

表示对齐(Representation Alignment, REPA)

一种让解码器中间特征与冻结教师模型特征在语义上对齐的训练目标,近期在扩散模型中被证明能加速收敛。VideoRAE 将其扩展为局部(逐 token 余弦相似度)和全局(池化特征相似度)两个尺度。

REPA 损失是 VideoRAE 替代 KL 正则化的核心机制,也是消融实验中显著提升生成质量(连续 gFVD 从 105 降到 93、离散从 67 降到 40)的关键组件。

研究动机

视频生成已从像素空间转向潜在空间生成,主流的 3D-VAE 和离散 tokenizer 通常用 3D 视觉编码器把视频压成紧凑时空 token。但这些 tokenizer 几乎完全由像素级重建目标驱动,损失函数以 MSE 和对抗损失为主,导致潜在空间偏向优化局部外观,而非高层语义或长程时空结构。结果是下游扩散/自回归生成模型不得不独自承担学习复杂时空动态和全局语义的重任,训练难度和数据需求都被显著放大。与此同时,V-JEPA 2、VideoMAEv2 等视频基础模型已经展现出强大的语义理解与时空推理能力,但这些高度抽象的表示历来被认为不适合直接做高保真像素重建,是否能被转化为紧凑、可重建且生成友好的视频潜在空间,长期悬而未决。

本文的目标是作者希望系统性地回答一个开放问题:冻结的视频基础模型表示,能否被转化为既紧凑、又支持高保真重建、还能直接服务下游视频生成的潜在空间。具体目标有三:一是构建统一框架,让同一套 VFM 特征既支持扩散变压器(DiT)的连续潜在空间,也支持自回归模型的离散 token 序列;二是在强压缩下保持甚至超越传统像素驱动 VAE 的重建质量;三是证明这种语义结构化的潜在空间能显著加速下游生成模型的训练收敛并提升生成质量,从而把 VFM 从理解任务解放到生成任务。

与已有工作不同的是,已有工作的切入点存在明显局限。图像领域的 RAE、VFMTok 已证明冻结基础模型特征可作生成潜在空间,但视频时空动态更丰富、冗余更强、压缩要求更严,能否直接迁移并不清楚;而视频 tokenizer 方向的研究大多只把语义对齐当作传统像素驱动 VAE 内的辅助监督,仍保留原始编码器架构与潜在构造机制,没有真正以冻结 VFM 为核心编码器。VideoRAE 的独特切入角度正是彻底抛弃像素驱动从头训练范式,直接以冻结 VFM 为编码主干,配合 1D 投影器和表示对齐目标,首次系统证明冻结 VFM 可以作为高保真视频生成的自动编码器基座。

核心方法

VideoRAE 的整体思路是:既然视频基础模型已经学到丰富的语义和时空结构,就不必从头训练像素驱动编码器,而是直接把冻结 VFM 当编码主干,再轻量化压缩其冗余表示。技术路线为:输入视频 $X\in\mathbb{R}^{B\times 3\times T\times H\times W}$ 经冻结 VFM(如 V-JEPA 2)提取浅到深多尺度特征并逐元素相加融合,得 $F_{VFM}\in\mathbb{R}^{B\times N_{vfm}\times D_{token}}$;再用基于自注意力的轻量 1D 投影器 $E_{1D}$ 把长序列压成 $N_{latent}$(512 或 1024)个基础 token;随后按需格式化为连续或离散表示;最后由 Transformer 解码器重建像素,并通过 REPA 目标与冻结 VFM 教师做局部+全局对齐。总损失 $\mathcal{L}_{total}=\mathcal{L}_{rec}+\mathcal{L}_{adv}+\lambda_{repa}\mathcal{L}_{REPA}(+\mathcal{L}_{vq})$。

核心创新点在于用语义驱动压缩取代像素驱动从头训练,这与已有方法有本质区别:传统 VAE 靠 KL 散度把潜在分布硬性约束为高斯、靠 MSE/对抗损失优化,而 VideoRAE 通过继承 VFM 的高质量语义拓扑,配合 REPA 对解码器特征的局部全局对齐,隐式地把潜在流形约束在良态语义流形上,从而完全去除 KL 散度项(KL-free)。第二个关键创新是 Multi-Codebook SimVQ:把基础 token 沿通道维度切成 $K=4$ 个子向量,每个用冻结基础码本+MLP 映射的 SimVQ 子码本量化(词表 $V=4096$),既扩大了等效词表又避免大码本优化困难,保住了 VFM 高维语义完整性。统一框架同时兼容连续与离散两种生成范式,是区别于以往工作的本质特征。

方法步骤详情

流程分四步。第一步编码:冻结 VFM 输出多层级特征 $f_l(X)$,按 $F_{VFM}=\sum_{l\in S} f_l(X)$ 逐元素相加融合,消融表明 Layers 8–24 最优。第二步压缩:1D 自注意力投影器 $E_{1D}$ 对 $F_{VFM}$ 建模全局依赖,压成 $Z_{base}$(长度 $N_{latent}=512/1024$,$\ll N_{vfm}$)。第三步格式化:连续分支用线性层把通道投到 32/64 维供 DiT;离散分支把 $Z_{base}$ 沿通道均分 $K=4$ 个子向量,各自在动态码本 $C_k=\text{MLP}_k(E_k)$(词表 4096)中取最近邻量化后拼接,供自回归模型。第四步解码与对齐:Transformer 解码器把潜在 token 与 1024 个可学习 3D token 拼接送自注意力块,depatchify 回 3D 特征图重建像素;同时把浅层特征投影插值到 VFM 网格,与教师特征算逐 token 余弦局部损失和池化后余弦全局损失,二者加权合为 REPA 损失 $\mathcal{L}_{REPA}=\mathcal{L}_{local}+\lambda\mathcal{L}_{global}$,隐式正则化潜在流形以取代 KL。

技术新颖性

技术新颖性体现在三处。其一,首次系统论证冻结 VFM 可作高保真视频生成的自动编码器基座,打破“抽象表示不适合像素重建”的固有认知,把 VFM 从理解任务延伸到生成任务。其二,提出 REPA 作为 KL 散度的替代品,用局部+全局语义对齐隐式正则化潜在流形,消融证明加 KL 反而损害重建与生成(连续 gFVD 101 vs 不加 KL 的 93)。其三,提出 Multi-Codebook SimVQ 高维量化策略,通过分治思想在保持单码本易优化的同时扩展等效词表并维持高维语义完整性,消融显示量化方式从 VQ(95)→SimVQ(59)→MCQ(51)→多码本 SimVQ(40) 的逐级跃升。整体框架的统一性(同一编码主干兼容连续/离散)也是相对以往单范式工作的新颖之处。

Overall architecture of VideoRAE.
Figure 2: Overall architecture of VideoRAE.

实验结果

实验覆盖重建、C2V 与 T2V。重建(Table 1/2):离散 VideoRAE(V-JEPA 2) 在 UCF-101 取 rFVD 13、TokenBench 28,显著优于 LARP(35/45)、SweetTok(20),刷新 SOTA;VideoMAEv2 版两数据集 PSNR 均最高(29.94/30.69)。连续分支用极紧凑 512×32 瓶颈即给出 rFVD 14、LPIPS 0.09 的顶级感知质量,扩到 1024×64 后 rFVD 5,逼近工业级 WAN2.1-VAE(4)。C2V 生成(Table 3/4):离散 AR 版 gFVD 仅 40,优于 1.9B 参数、1280 token 的 SweetTok(65);连续 DiT 版 gFVD 93,远低于 LeanVAE(164)、LTX-VAE(161)。收敛(Figure 7):AR 模型仅约 400 epoch 达 gFVD 139,而 LARP 需 2000 epoch 才到 136,约 5× 加速。T2V(Table 5):2B 规模 MMDiT 上 VideoRAE 总分 71.26 优于 LTX-VAE 的 69.35,全程收敛更快。关键洞察:VideoMAEv2 重建 PSNR 更高但 V-JEPA 2 版 gFVD 更好,说明深层语义抽象比刚性像素保真更利于生成。

Reconstruction performance of discrete tokenizers on UCF-101 and TokenBench.
Table 1: Reconstruction performance of discrete tokenizers on UCF-101 and TokenBench.
Reconstruction performance of continuous autoencoders on UCF-101 and TokenBench.
Table 2: Reconstruction performance of continuous autoencoders on UCF-101 and TokenBench.
Class-conditional generation evaluation (Discrete AR) on UCF-101, evaluated on 10K generated samples.
Table 3: Class-conditional generation evaluation (Discrete AR) on UCF-101, evaluated on 10K generated samples.
Class-conditional generation evaluation (Continuous DiT) on UCF-101, evaluated on 2K generated samples.
Table 4: Class-conditional generation evaluation (Continuous DiT) on UCF-101, evaluated on 2K generated samples.
Text-to-video generation evaluation on VBench.
Table 5: Text-to-video generation evaluation on VBench.
Ablation study on quantization strategies.
Table 6: Ablation study on quantization strategies.
Ablation study on the effect of REPA for semantic alignment.
Table 7: Ablation study on the effect of REPA for semantic alignment.
Ablation study on multi-scale feature aggregation.
Table 8: Ablation study on multi-scale feature aggregation.
Training convergence speed comparison in AR (left) and DiT (right) generative modeling.
Figure 7: Training convergence speed comparison in AR (left) and DiT (right) generative modeling.
查看结构化数据
任务指标本文基线提升
离散重建 (UCF-101 rFVD) rFVD↓ 13 (V-JEPA 2) 35 (LARP-L-Long) 降低 22,刷新 SOTA
离散类别条件生成 (UCF-101) gFVD↓ 40 (V-JEPA 2, 1.3B) 65 (SweetTok, 1.9B) 用更少 token 和更小生成器取得更优 gFVD
连续类别条件生成 (UCF-101) gFVD↓ 93 (V-JEPA 2, 512×32) 161 (LTX-VAE, 128×128) 大幅领先 LeanVAE/LTX-VAE
文本到视频生成 (VBench 总分) Total Score↑ 71.26 69.35 (LTX-VAE) 提升 1.91 分,且收敛更快
训练收敛速度 (AR) 达到 gFVD≈136 所需 epoch 约 400 epoch 2000 epoch (LARP) 约 5× 加速

局限与改进

作者坦承若干局限。第一,重建保真与生成质量存在权衡:V-JEPA 2 因基于潜在空间预测、语义更抽象,像素级 PSNR(29.39) 略低于 VideoMAEv2(29.94),但 gFVD 更好,说明追求极致像素保真未必利于生成。第二,连续分支即便用 1024×64 也仍未追上用工业级数据训练的 CogVideoX-VAE(rFVD 7)、WAN2.1-VAE(rFVD 4),作者把这归因于训练数据规模(仅 K600 与 UCF-101)。第三,T2V 对照仅与 LTX-VAE 单一基线比较,未与其他顶尖开源 T2V 模型横向对比,说服力有限。我进一步观察到:评估分辨率固定在 256×256、16 帧,未验证长视频与高分辨率;冻结 VFM(如 V-JEPA 2)作为编码器会带来不小的推理开销,但文中未报告推理延迟与编码成本;Multi-Codebook SimVQ 的 $K$、词表 $V$ 等超参敏感性也缺乏系统扫描。

独立分析的弱点

独立分析有四点弱点。其一,泛化性验证不足:仅评估 V-JEPA 2 与 VideoMAEv2 两种 VFM,未涉猎 InternVideo、DINOv3 视频版等更多教师,改进方向是系统比较不同 VFM 教师并设计教师选择准则。其二,分辨率与时序受限:实验限定 256×256、16 帧,对长视频生成、高分辨率场景未做验证,建议引入渐进式或分层压缩以支持长时序与高分辨率。其三,推理成本未量化:冻结 VFM 编码器参数量大(V-JEPA 2 达数十亿级),1D 投影器虽轻但整体编码开销未报告,建议补充 FLOPs/延迟对比并探索 VFM 蒸馏或剪枝。其四,T2V 对照单薄:仅对 LTX-VAE,建议在 OpenSora2 框架内同时替换更多 VAE(如 WAN2.1-VAE、CogVideoX-VAE)做受控对比,并补充人类评估与更长提示词测试。

未来方向

作者明确表示将发布模型与代码,并把“以 VFM 为默认潜在基座”作为统一表示学习与生成建模的新路径。基于成果可延伸的方向包括:第一,扩展到更长视频与更高分辨率生成,研究分层 VFM 特征在长时序压缩中的有效性;第二,将框架迁移到音视频联合生成(对标 LTX-2 这类音视频基础模型),探索 VFM 表示对音频模态的适配;第三,结合 V-JEPA 2 的预测/规划能力,把语义潜在空间用于世界模型与物理交互建模;第四,研究 VFM 教师蒸馏,让编码器端可部署轻量化;第五,把 Multi-Codebook SimVQ 思想推广到图像与多模态 tokenizer,验证其通用性。整体上,VFM 表示作为生成潜在基座这一范式还有很大探索空间。

复现评估

复现前景中等偏上。作者在结论中承诺发布模型与代码,数据集均为公开:训练用 UCF-101、Kinetics-600、VideoUFO,评估用 UCF-101、TokenBench、VBench,遵循既有协议(离散采样 10000 例、连续采样 2048 例)。关键超参披露较全:VFM 用 16× 空间下采样、2× 时间下采样,潜在长度 512/1024,连续瓶颈 32/64 维,离散 $K=4$、词表 $V=4096$,解码器拼 1024 可学习 3D token。但算力门槛高:C2V 生成模型参数达 1.3B,T2V 为 2B 规模 MMDiT、全局 batch 256、训练 800K 步,全部在 H100 上完成,完整复现 T2V 实验对多数实验室不现实;部分消融的训练时长、随机种子、详细架构(投影器层数、解码器深度)未完全给出,需等代码开源后才能精确复刻。