V-RAE:为生成重新思考视频潜在空间 V-RAE: Rethinking Video Latent Spaces for Generation
以冻结视觉基础模型特征构建语义潜空间,视频重建与生成双优、收敛快至6倍
前置知识
视频自编码器与潜空间生成
现代视频生成模型(Sora 类扩散 Transformer)不直接在像素上工作,而是先由视频自编码器把像素压缩为低维潜码(典型如 4×8×8 的时空压缩),生成器在潜空间学习分布,最后由解码器还原像素。压缩率越高、潜空间越“好学”,生成器的训练成本越低、质量上限越高。代表工作包括 Wan VAE、CogVideoX VAE、MAGVIT-v2 等连续/离散 tokenizer。
本文全部论证都围绕“什么样的潜空间适合生成”展开,这是理解 V-RAE 动机与贡献的基础。
FVD / rFVD / gFVD
Fréchet Video Distance 用预训练视频特征比较生成视频与真实视频的分布距离,越低越好。rFVD(reconstruction FVD)衡量“编码→解码”通路的重建分布相似度;gFVD(generation FVD)衡量训练生成器后采样视频与真实分布的距离。两者名字相近,但一个测自编码器、一个测完整生成系统。
论文核心发现之一是 rFVD 与 gFVD 的 Pearson 相关性仅 0.200(UCF101)/0.473(K600),混淆两者是此前评测的隐含误区,也是提出 tFVD 的直接原因。
视觉基础模型(VFM)与冻结表征
DINOv3、SigLIP2、EUPE、V-JEPA 等自监督/弱监督预训练的视觉编码器,其特征空间具有优异的语义组织和线性可分性(物体、场景、动作在特征空间中天然聚类)。“冻结”指训练中不更新其参数,仅将其作为特征提取器使用。
V-RAE 的核心思想就是直接继承冻结 VFM 的特征空间作为生成潜空间,理解 VFM 表征的语义性质是把握论文创新的前提。
DiT 与整流流(Rectified Flow)
DiT 是在潜空间工作的 Transformer 生成骨干;整流流把生成建模为从高斯噪声到数据的近似直线路径,训练时学习速度场 $v = \epsilon - z$,推理时沿 ODE 数值积分采样(本文用 100 步 Euler)。噪声调度偏移 $s = \sqrt{T_Z h w C / n}$ 用于适配高维潜空间。
V-RAE 的全部生成实验都在“DiT + 整流流”框架下进行,干净潜码预测、双头(DiTDH)等设计细节都基于此。
RoPE 旋转位置编码
RoPE 通过对 attention 的 query/key 施加位置相关的旋转,使注意力分数天然感知 token 间的相对位置。原始 RoPE 用于 1D 序列,3D RoPE 将其扩展到时间维和两个空间维,为每个潜 token 提供显式时空坐标。
V-RAE 的视频解码器依赖 3D RoPE 注入时空位置信息,是实现时序连贯重建、消除闪烁的关键组件。
REPA 与表征对齐
REPA(Representation Alignment)让扩散模型的中间层特征与预训练视觉表征对齐,从而加速训练收敛、提升质量。此前的 VideoREPA 等工作把它用于视频生成的辅助损失,语义只是正则信号而非潜空间本身。
理解“表征对齐作为辅助监督”与“冻结表征直接当潜空间”两条路线的区别,才能定位 V-RAE 在相关工作中的独特位置。
研究动机
现代视频生成几乎都在视频自编码器学到的潜空间中进行,而现有视频自编码器——连续 VAE(Wan2.1/2.2、HunyuanVideo、CogVideoX)、离散 tokenizer(MAGVIT-v2 等)和 query-based 设计(AToken、LARP)——都以像素级重建为首要优化目标,潜空间充满局部纹理、颜色等低层细节,缺乏高层语义组织。这带来两个问题。其一是“重建最优不等于生成最优”:HunyuanVideo VAE 在 UCF101 上 rFVD 为 7.73,优于 V-RAE (EUPE-B) 的 8.05,但 gFVD 高达 211.53,远差于 V-RAE 的 125.98;全部 tokenizer 的 rFVD 与 gFVD 在 UCF101 上 Pearson 相关仅 0.200,K600 上 0.473。其二是 VAE 潜空间语义贫乏:UCF101 线性探测中最强 VAE 基线 AToken 仅 30.83%,CogVideoX VAE 低至 14.51%。视频进一步放大问题:生成器须在长潜序列上联合建模外观、运动与时序依赖,无语义结构使学习难度陡增。
本文的目标是本文的具体目标是:把冻结视觉基础模型(VFM)的表征空间直接改造成视频生成的潜空间,并证明它在重建保真度、语义保留和生成质量三方面都能与大规模预训练视频 VAE 竞争。沿 RAE/RAEv2 在图像上的成功路径扩展到视频,需要先解决三大技术挑战:(1) 时序压缩率太低——图像编码器(DINOv3-L、SigLIP2-L、EUPE-B)逐帧编码原生压缩率为 1,视频编码器 V-JEPA 2.1-L 也只有 2,远低于让 DiT 训练和推理可负担的水平,必须引入额外的时序压缩;(2) 压缩后的潜变量和解码出的运动必须保持时序连贯,否则视频出现闪烁抖动、潜分布也难以被扩散模型学习;(3) 时序压缩必须保留从编码器继承的语义结构——这正是采用表征特征做生成潜空间的核心价值。此外论文还给自己加了一个评测层面的目标:提供比 rFVD 更能预测下游生成质量的潜空间诊断指标,纠正以重建保真度单一维度评判视频 tokenizer 的行业惯性。
与已有工作不同的是,此前把语义引入视频生成的尝试都停留在“辅助监督”层面:Ma et al. (2025a) 与 Wu et al. (2025b) 在自编码器训练中加入语义对齐损失;VideoREPA 把 REPA 式对齐用于扩散 Transformer 中间特征;Divot 学习面向理解-生成的连续 tokenizer 特征但仍以重新训练 tokenizer 的方式进行。语义在这些工作中只是正则项,生成潜空间本身仍由重建目标塑造。最新的 RAE/RAEv2 在图像上直接把冻结编码器特征空间作为生成潜空间,但这一范式能否扩展到视频——让冻结表征同时支撑高保真重建与有效生成——此前基本无人系统探索。V-RAE 的独特切入是“直接继承而非重新学习”:不训练新 tokenizer,而是冻结 VFM,只学习轻量时序池化模块和视频解码器,使潜空间天然保持预训练语义组织。同时引入 tFVD 诊断指标,用潜空间时序插值一致性替代像素重建保真度来评估自编码器,为“重建好即生成好”的隐性假设提供了系统反例与替代工具。
核心方法
直觉上,V-RAE 把“学一个好 tokenizer”换成“借一个好表征”:冻结的视觉基础模型已把世界组织成语义特征,缺的只是时序压缩和像素解码。架构分三段。首先,冻结编码器处理输入视频:图像编码器(DINOv3、SigLIP2、EUPE)逐帧编码并沿时间堆叠特征,视频编码器 V-JEPA 2.1 联合编码多帧,原生时序压缩率 $r_E$ 为 1 或 2。其次,可学习的轻量时序注意力池化模块 $P$ 以比率 $r_P$ 把相邻 $r_P$ 帧特征聚合为一个潜码,总压缩率 $r_{all} = r_E \cdot r_P = T/T_Z$。最后,MAE 风格的轻量 Transformer 解码器通过 3D RoPE 与多帧 unpatchify 把每个潜时间步映射回 $r_{all}$ 个连续帧。训练只优化池化模块和解码器($L_1$ + LPIPS + GAN + Gram 四项损失的加权和)。编码器始终冻结,潜空间因此锚定在预训练语义组织上。
核心创新是“冻结语义表征 + 内容自适应时序压缩 + 多帧解码”的组合,与已有方法的本质区别有三点。第一,生成潜空间直接由冻结 VFM 特征定义,而非像 Wan2.1/2.2 VAE 那样用重建目标从零学出:潜变量天然携带物体、动作与场景结构,扩散模型只需学“视觉状态如何演化”,不必从面向重建的编码里重新发现语义——这是收敛快 5-6 倍的根源。第二,时序池化不是均匀下采样,而是带共享可学习查询 $q^{(m)}$ 与时序偏置 $\beta_i^{(m)}$ 的单层注意力:$u^{(m)} = \sum_i \alpha_i^{(m)} v_i^{(m)}$,查询与偏置零初始化使训练起点等价于均值池化,再逐步学出内容自适应加权;仅 3M 参数就取得 UCF101 上 6.12 rFVD 与 89.13% 探测准确率的最佳平衡,而 67M 参数的 Q-Former 反而两头不讨好。第三,解码器多帧 unpatchify 与 3D RoPE 使同一框架适配任意“编码器原生压缩 × 池化压缩”组合,图像编码器配块级因果注意力,V-JEPA 配全时空注意力。
方法步骤详情
流程分四步。编码:图像编码器逐帧输出空间特征沿时间堆叠,V-JEPA 2.1 直接输出时空稠密特征。时序池化:把特征划分为不重叠的长度 $r_P$ 时间窗,每个窗、每个空间位置用共享查询做注意力汇聚,输出 $T_Z = T_E / r_P$ 个潜码;注意力权重含可学习偏置,零初始化使起点等价于均值池化。解码重建:潜时间步经 3D RoPE 编码后送入 ViT 块解码器,图像编码器变体用块级因果注意力,V-JEPA 变体用全时空自注意力;unpatchify 层把每个潜步解码为 $r_{all}$ 个连续帧;用 $L_1 + LPIPS + GAN + Gram$ 损失训练,DINOv3/EUPE 变体解码器用 RAEv2 checkpoint 初始化。生成:冻结 V-RAE,在潜空间从头训练 DiT + 整流流,噪声调度按 $s = \sqrt{T_Z h w C / n}$($n = 4096$)偏移,采用干净潜码预测,在第 8 个 Transformer 块挂辅助预测头(DiTDH),推理用 100 步 Euler 采样。生成对比统一 1280 潜 token。
技术新颖性
技术新颖性体现在四个层面。(1) 范式层面:这是首个在时序压缩后的冻结 VFM 高维语义特征空间中直接做视频生成、并把生成潜码解码回像素的工作——此前的 DERA、VideoREPA、Divot 都只是把语义作为 tokenizer 训练或扩散特征的辅助对齐。(2) 架构层面:时序注意力池化用 3M 参数实现“语义保持式压缩”,零初始化让训练从均值池化平滑过渡到内容自适应聚合;消融(Figure 5)显示均值池化保语义(91.82%)但重建崩坏(94.25 rFVD),卷积池化重建好(5.91)但语义掉至 78.26%,只有时序注意力同时拿到 6.12 / 89.13%,支撑 Finding 1。(3) 评估层面:tFVD 是新指标——把内部潜码替换为邻居中点 $z'_t = (z_{t-1}+z_{t+1})/2$ 后解码计算 FVD,故意破坏编解码直连通路以探测潜空间时序几何,与 gFVD 相关性从 rFVD 的 0.200/0.473 提升到 0.621/0.919。(4) 实证层面:跨 4 种预训练范式的编码器系统研究,辅以 TRED 时序误差波动诊断。
实验结果
重建(Table 1):V-RAE (V-JEPA 2.1-L) 在 K600 上 rFVD 2.13,较最强 Wan2.1 VAE 的 3.58 改善 40.5%,四变体全面超越大规模 VAE。语义(Table 2):4× 压缩后潜码在 UCF101/SSv2/K400 最高 89.13%/72.91%/83.12%,最强 VAE 基线 AToken 仅 30.83%/45.05%/53.27%。生成(Table 3):V-RAE (V-JEPA 2.1) 达 UCF101 gFVD 117.86、K600 19.16,较最强非 V-RAE 基线好 25.14/22.50 分,收敛快 5-6 倍。诊断(Figure 10):rFVD 与 gFVD 相关仅 0.200/0.473,tFVD 升至 0.621/0.919。预测(Table 4):Cityscapes 上 gFID 11.52 对 15.02、gFVD 111.36 对 144.47——rFVD 更差(29.29/7.03)而 tFVD 更好(224.60/319.02),证明潜空间性质决定生成上限。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频重建(K600 val) | rFVD ↓ | 2.13(V-RAE, V-JEPA 2.1-L) | 3.58(Wan2.1 VAE) | 降低 40.5%,超越全部大规模预训练 VAE |
| 视频重建(UCF101 test) | rFVD ↓ | 6.12(V-RAE, DINOv3-L) | 6.05(Wan2.1 VAE) | 基本持平,位列第二 |
| 语义线性探测(UCF101) | Top-1 准确率 ↑ | 89.13%(DINOv3-L,4× 时序压缩) | 30.83%(AToken) | +58.30 个百分点 |
| 语义探测(SSv2) | Top-1 准确率 ↑ | 72.91%(V-JEPA 2.1) | 45.05%(AToken) | +27.86 个百分点 |
| 类条件视频生成(UCF101) | gFVD ↓ | 117.86(V-JEPA 2.1, DiTDH XL) | 143.00(AToken) | −25.14 分,收敛约 5× 更快 |
| 类条件视频生成(K600) | gFVD ↓ | 19.16(V-JEPA 2.1) | 41.66(Cosmos VAE) | −22.50 分,收敛至 6× 更快 |
| 未来视频预测(Cityscapes 432×768) | gFID ↓ / gFVD ↓ | 11.52 / 111.36(EUPE-B) | 15.02 / 144.47(Wan2.2 VAE) | gFVD 降 22.9%,同等骨干与训练预算 |
| 潜空间诊断(K600) | 与 gFVD 的 Pearson 相关性 ↑ | 0.919(tFVD) | 0.473(rFVD) | 相关性接近翻倍 |
局限与改进
论文附录 D 专设 Limitations 章节,结合正文可观察到的局限如下。(1) 像素级保真不足:PSNR/SSIM/LPIPS 全面落后于大型 VAE(UCF101 PSNR 27.76-27.82 vs 34+),对视频压缩、修复等需逐帧精确细节的应用不友好,作者也承认这源于冻结编码器未针对低层像素恢复优化。(2) 潜空间维度极高(1024 维 vs VAE 的 16-48 维),虽通过噪声调度偏移缓解,但存储与 DiT 输入投影开销更高,论文未报告端到端推理延迟和显存对比。(3) 实验规模有限:类条件生成只在 UCF101/K600 的小规模 DiT XL/1280 token 设置下验证,无 text-to-video 实验,结论在文本条件、更长时序、更高分辨率下是否成立未知。(4) tFVD 只测试了“邻居中点插值”这一种扰动,对加噪、外推等扰动是否同样预测生成质量缺乏验证。(5) V-JEPA 2.1 变体在 UCF101 语义上掉 6.37 点,时序压缩的语义损耗与编码器选择强相关,缺乏理论解释。(6) 未来预测仅在驾驶场景 Cityscapes 上评估。
独立分析的弱点
独立分析几个可质疑之处。其一,部分评估配置不完全对齐:重建评测中 V-RAE 用 16 帧而因果 VAE 用 17 帧输入;DINOv3/EUPE 变体的解码器从 RAEv2 checkpoint 初始化而 SigLIP2/V-JEPA 从头训练,起点不一致;生成实验中 V-RAE 用双头 DiTDH 而 VAE 基线用单头——收敛优势中可能混入训练技巧的贡献,建议对所有方法统一采用 DiTDH 跑一组消融。其二,时序池化的 $r_P$ 固定,未研究自适应或分层压缩率;当 $r_{all}$ 增大时多帧 unpatchify 会让单个潜步承载过多运动信息,长视频下可能崩坏。其三,语义探测只能证明语义“保留”,不等于潜空间“可编辑/可理解”——论文未做潜空间插值编辑、属性操控或理解-生成统一实验,而这恰是 RAE 范式宣称的核心卖点。其四,与 VAE 基线比语义探测略占便宜,因为 VAE 潜码本非为语义设计;更有说服力的是与语义对齐型 tokenizer(DERA 类)比较。其五,tFVD 每个视频需额外解码一次插值序列,且为何选中点而非其他扰动方式缺乏消融讨论。
未来方向
未来方向可从两个层面延伸。作者层面:把 V-RAE 潜空间接入大规模 text-to-video 训练验证结论外推性;将 tFVD 推广为潜空间“可生成性”的综合诊断(加入外推、噪声扰动等探针,并研究其与潜空间曲率等几何量的理论联系);打通理解与生成——冻结 VFM 特征本就是感知任务的表征,V-RAE 潜码理论上可直接服务视频理解、跟踪、编辑,实现“一个潜空间、多任务共用”的统一接口(Finding 4 已暗示潜码是可直接解码的预测状态空间)。基于成果的自然延伸:(1) 在 Wan、CogVideoX 等现有文生视频大模型主干上做潜空间替换实验,验证大规模收益;(2) 设计自适应时序压缩,对静态镜头少压缩、动态镜头多压缩,突破固定 $r_{all} = 4$ 的限制;(3) 结合 REPA 式生成器对齐与 V-RAE 潜空间,可能进一步加速收敛;(4) 把 tFVD 纳入视频 tokenizer 标准评测套件;(5) 世界模型方向:在 Cityscapes 之外的机器人操作、具身导航数据上做视频预测,利用“语义状态转移 + 冻结解码”的接口做规划与反事实推演。
复现评估
复现评估:论文提供项目页(v-rae.github.io),但所给材料中未见明确的开源代码声明,建议关注官方发布。复现的关键依赖均公开可得:四个冻结编码器(DINOv3、SigLIP2、EUPE、V-JEPA 2.1)都是公开模型;DINOv3/EUPE 变体的解码器可从 RAEv2 checkpoint 初始化;数据集 UCF101、K600、SSv2、K400、Cityscapes 全部公开;附录 A/B 给出了架构、重建与生成训练配方和 tFVD 评测协议的较完整描述。主要门槛在算力:重建训练需在 UCF101+K600 联合集上训练含 GAN 损失的 VAE 级模型;类条件生成要为每个 tokenizer 从头训练 DiT XL(1280 token 序列)至 150K-180K 步,Table 3 覆盖 10 个 tokenizer × 2 个数据集,单次 DiT XL 训练估计在数十卡天量级,完整复现全部对比表格成本很高。建议:若只想验证核心主张,优先复现 Table 1 重建加 tFVD 计算,这部分性价比最高;生成实验等官方代码发布后再复现。
论文图表
左侧雷达图将各视频 tokenizer 在重建(rFVD)、生成(gFVD)、压缩率、语义探测四个维度归一化对比(FVD 轴反转,向外更好),对比对象包括 Wan2.2 VAE、AToken、CogVideoX VAE 与 V-RAE(V-JEPA 2.1 / EUPE / DINOv3)三种变体;右侧为 K600 上 gFVD 随训练步数的收敛曲线,V-RAE 比 VAE 潜空间快至 6 倍。
一图总览论文核心主张——V-RAE 在重建、生成、压缩、语义四个维度同时领先且收敛更快,是理解论文动机和结果的最佳入口。