← 返回 2026-08-12

超越像素:从视频先验到4D世界 Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang 📅 2026-08-11 👍 178 2026-08-17 18:30
3D重建 4D生成 前馈重建 潜空间接口 视频扩散模型

将视频模型的最终去噪潜变量直接映射为4D动态场景,绕过RGB解码,单checkpoint跨生成器复用

前置知识

VAE 潜空间

变分自编码器把高维视频压缩成低维潜张量,视频扩散模型实际在潜空间迭代去噪。只要共享同一 VAE checkpoint、潜变量归一化、张量布局和压缩约定,不同 DiT 的最终去噪潜变量就落在同一表示空间,且位于 RGB 解码的上游。

本文全部主张建立在'共享 VAE 潜空间可作为可复用接口'之上,不理解潜空间就无法理解为何一个 4D 通路能服务多个不同生成器。

DiT(视频扩散 Transformer)

Diffusion Transformer 是当前主流视频生成骨干,如 Wan2.1-T2V-14B。它从噪声出发,在 VAE 潜空间按条件 $c$ 逐步去噪,输出最终去噪潜变量 $\mathbf{z}_{gen} = G_\theta(c,\epsilon)$,再由 VAE 解码为 RGB 帧。

本文保持所有 DiT 冻结、只消费其终端潜变量,并在 Wan2.1-T2V-14B、Wan2.1-T2V-1.3B 与 Wan2.2-I2V-A14B 三个 DiT 上验证迁移性。

4D 生成与点图

4D 指带时间轴的动态 3D 场景,输出为逐帧相机 $C_t$ 与世界坐标系稠密点图 $P_t \in \mathbb{R}^{H\times W\times 3}$,可从新视角重投影渲染。前馈重建器(如 4RC、$\pi^3$)从 RGB 视频直接回归这些几何量。

论文的监督信号、损失函数 $\mathcal{L}=\mathcal{L}_{unc}+\mathcal{L}_{cam}+\mathcal{L}_{geom}$ 和评测协议全部围绕相机与点图展开。

LoRA 低秩适配

在冻结的预训练权重旁注入低秩矩阵增量的参数高效微调方法,只训练极少量参数。本文以 rank-16 LoRA 适配 31 层精炼层级,视频模型、VAE 与原始 Transformer 权重全部保持冻结。

它决定了复现成本,也是论文所称'轻量精炼增量 $\Delta\psi$'的具体含义,是防破坏预训练几何先验的关键设计。

DINO 特征与 DINO-F1 指标

DINOv2 是自监督视觉特征提取器,广泛用于生成质量评测。本文把预测点序列从两个离轴相机渲染,计算全局 DINO 相似度、有效块 DINO 匹配率,再由匹配与未匹配集合的查准查全得 DINO-F1(×100)。

主表所有结论(如 57.01 对 53.56)都基于该指标;需明白它衡量的是投影外观一致性的代理,并非度量级几何精度。

研究动机

现有 4D 生成方法分为两大阵营,各有硬伤。第一类是生成后重建范式(如 Diffusion4D、4Diffusion、CAT4D):先用视频扩散模型合成多视角或时序 RGB 视频,再用独立训练的重建模型转为动态 3D 场景。问题是 RGB 成为两个模型之间的表示边界——重建器通常只在狭窄的重建数据上训练,面对开放域生成内容存在分布失配,视频中的时序伪影与瑕疵会传播成不稳定的几何。第二类是一体化前馈生成(如 4DNeX、Diff4Splat、WorldReel、WorldForge):把几何预测内嵌进特定生成器,直接输出点云或高斯,但与特定生成器和条件模式强绑定,换一个预训练视频模型就要重新做几何监督训练。更棘手的是 4D 监督数据天然稀缺——本文训练也仅用约 1,143 段真实重建片段,与海量视频数据完全不成比例,这使得'每换一个生成器就重训一次'的路线难以规模化。

本文的目标是本文目标是建立一个可复用的接口:绕过生成的 RGB,让一条只用几何监督训练的通路能同时服务多个兼容的视频生成器。作者提炼的核心科学问题是:视频模型的最终去噪潜变量能否成为跨兼容 DiT 的可复用 4D 预测接口?具体而言,希望学一个从 VAE 潜空间 $\mathcal{Z}_v$ 到 4D 结构化 token 空间 $\mathcal{Z}_{4D}$ 的直接映射,输出逐帧相机 $C_t$ 和世界坐标系稠密点图 $P_t$。该接口应在同一 VAE 家族的两个文本生成视频 DiT(Wan2.1-T2V-14B、Wan2.1-T2V-1.3B)和一个图生视频 DiT(Wan2.2-I2V-A14B)之间零改动迁移,只需约 1K 重建片段训练,并在自建的 Text4D-200 与 I4D-200 基准上超过同潜变量的解码级联基线。

与已有工作不同的是,独特切入在于识别出共享 VAE 潜空间这一天然接口。虽然不同 DiT 的骨干架构和条件模式各异,但共享同一 VAE checkpoint、潜变量归一化、张量布局和压缩约定的模型,其最终去噪潜变量落在同一表示空间;且该空间位于 RGB 解码上游,天然携带外观、运动和条件信息。此前没有人把它当作多生成器共享的 4D 输入接口:相关工作 VIST3A 只把视频 VAE 对接到静态 3D 重建器的单一模型对;4RC、$\pi^3$、Any4D 等前馈重建器则依赖在重建数据上训练的 RGB 编码器去解释可能分布外的生成帧。作者反其道行之:保留预训练 4D 重建层级作为解码器,用视频模型本身充当编码器,把 RGB 接口替换为对齐后的终端潜变量,从而把几何监督与具体生成器彻底解耦。

核心方法

直觉上,与其让视频潜变量先解码成 RGB、再由另一个重建器翻译成几何,不如让几何解码器直接阅读潜变量。Latent-to-4D 把直接映射分解为对齐、精炼、解码三级:$\hat{\mathbf{Y}} = \mathcal{D}_\omega(\mathcal{H}_{\psi,\Delta\psi}(\mathcal{A}_\phi(\mathbf{z});\mathbf{S}))$,其中 $\mathbf{z}\in\{\mathbf{z}_{obs},\mathbf{z}_{gen}\}$ 是 VAE 潜变量,$\mathbf{S}$ 为冻结的相机与时间 token。训练时冻结 VAE 编码约 1,143 段带 4D 标注的重建片段,只更新对齐模块 $\mathcal{A}_\phi$、LoRA 精炼增量 $\Delta\psi$ 与几何/相机预测头;视频 DiT、VAE 和原 Transformer 权重全部冻结,并渐进激活可训练组件以免破坏几何先验。推理时把 $\mathbf{z}_{obs}$ 换成兼容 DiT 的最终去噪潜变量 $\mathbf{z}_{gen}$,下游通路完全不变。

核心创新是把共享 VAE 的最终去噪潜变量正式定义为生成器与 4D 预测之间的可复用接口。与生成后重建范式的本质区别:后者在生成器与重建器之间隔着 RGB 表示边界,生成内容的分布偏移和时序伪影会污染几何预测;本文在 RGB 解码之前介入,用 L4AR 网络直接把潜变量对齐到 4D token 网格。与一体化前馈范式的本质区别:后者把几何预测焊死在某个生成器里,换模型就要重训;本文保持所有条件 DiT 及其共享 VAE 冻结,只学一个接口,单个 checkpoint 无改动迁移到 Wan2.1-T2V-14B、Wan2.1-T2V-1.3B 和 Wan2.2-I2V-A14B 三个模型。由于条件信息已经在生成的潜变量中实现,无需条件专属分支或任务标识符,文本、图像乃至位姿、轨迹、机械臂操作等上游控制都能直接继承。

方法步骤详情

流程分五步。第一步取潜变量:训练时冻结 VAE 编码观测视频得 $\mathbf{z}_{obs} = \mu(\mathcal{E}_v(V))$,推理时从冻结 DiT 采样最终去噪潜变量 $\mathbf{z}_{gen}$。第二步对齐:三线性重采样 $R$ 匹配时空分辨率,可学习 3D 卷积 $S_\phi$ 聚合邻域并投影通道,展平得 $\mathbf{Q}^{(0)} = \mathcal{A}_\phi(\mathbf{z})$,形状为 $T\times M\times d$。第三步精炼:帧内注意力在 $(BT,M,d)$ 上巩固每帧结构,全局注意力在 $(B,TM,d)$ 上传播跨帧对应与运动证据,交替执行并多深度拼接特征。第四步解码:逐像素预测深度 $\hat{d}_t(u)$、光线原点 $\hat{\mathbf{o}}_t$、方向 $\hat{\mathbf{r}}_t(u)$ 与置信度,世界点 $\hat{\mathbf{P}}_t(u) = \hat{\mathbf{o}}_t + \hat{d}_t(u)\hat{\mathbf{r}}_t(u)$,相机头输出 9D 位姿-视场角参数。第五步训练:损失 $\mathcal{L} = \mathcal{L}_{unc} + \mathcal{L}_{cam} + \mathcal{L}_{geom}$,含置信度加权深度、梯度与光线项,相机平移/旋转/FOV 项,以及度量深度与表面法线项;末段用 6 个重建数据集共 1,143 片段。

技术新颖性

技术新颖性体现在三点。其一,接口选择:首个把终端去噪潜变量而非生成 RGB 作为 4D 解码输入的工作,潜变量位于解码上游,从机制上绕开了分布失配与误差传播。其二,迁移机制:无需测试时适配,单一 checkpoint 跨同 VAE 家族三个 DiT 成绩几乎一致(Text4D 上 DINO-F1 57.01 对 57.09),实证潜空间确为稳定共享接口;Grid-Align-null 残差诊断进一步显示,对受控 DiT 残差扰动本方法点图漂移仅 0.0053/0.0047,而解码 RGB 级联基线高达 0.3827/0.3160(7-Scenes/NRGBD)。其三,参数效率:31 层精炼层级仅以 rank-16 LoRA 适配,其余权重、相机/时间 token 全部冻结,训练数据只要约 1K 片段。相比 VIST3A 这类只对齐单一模型对的方案,本文建立的是家族级、可被后续任何同 VAE 生成器即插即用的通路。

Latent-to-4D enables unified text- and image-conditioned 4D generation. It turns video-model latents directly into dynamic geometry and motion through a shared pathway, without task-specific adaptation.
Figure 1: Latent-to-4D enables unified text- and image-conditioned 4D generation. It turns video-model latents directly into dynamic geometry and motion through a shared pathway, without task-specific adaptation.
Latent-to-4D training pipeline. A frozen video VAE encodes an observed video into a VAE-space latent. L4AR aligns the latent grid through a learned 3D convolution, reuses frozen camera and time tokens, and refines the representation through alternating frame-wise and global attention. The 4D decoder predicts cameras and dynamic world-space geometry.
Figure 3: Latent-to-4D training pipeline. A frozen video VAE encodes an observed video into a VAE-space latent. L4AR aligns the latent grid through a learned 3D convolution, reuses frozen camera and time tokens, and refines the representation through alternating frame-wise and global attention. The 4D decoder predicts cameras and dynamic world-space geometry.

实验结果

定量结果分四块。(1)Text4D-200(表1):单一 checkpoint 在两个文本 DiT 上几乎同分——DINO-F1 为 57.01(Wan2.1-14B)与 57.09(Wan2.1-1.3B),比匹配的同潜变量 Wan+4RC 级联高 3.45 与 2.88 分,也领先 $\pi^3$ 与 Any4D(分别为 47.50/45.55 和 50.10/46.06);但 CogVideoX-5B+4RC 仍保持最高 RGB 参考 CLIP-I(75.33 对 72.24),作者不宣称逐项全胜。(2)I4D-200:本文 DINO-F1 61.60,比匹配 Wan2.2+4RC 的 55.79 高 5.81 分,全局 DINO 54.85 对 47.83,远超 4DNeX 的 28.33。(3)人类评估(表2):50 名参与者对每基准 50 案例各评 10 次,所有偏好率区间下限超 50%,几何完整性偏好文本任务 66.8%、图生任务 72.1%。(4)诊断与消融:受控 DiT 残差测试 30/30 全胜,$\rho=0.6$ 时点图漂移 0.0053/0.0047 对基线 0.3827/0.3160;表3 消融显示去掉 3D 卷积后 7-Scenes Acc 从 3.121 恶化到 6.944 cm,去掉任一注意力几乎翻倍。定性上(图4、5),RGB 基线常见孔洞与碎裂表面,本文保留更多主体与场景结构。

4D generation on Text4D-200 and I4D-200. Two-view projection scores (×100; higher is better); Ours and matched Wan cascades share the same generated latent.
Table 1: 4D generation on Text4D-200 and I4D-200. Two-view projection scores (×100; higher is better); Ours and matched Wan cascades share the same generated latent.
User preference for Ours over baselines (%).
Table 2: User preference for Ours over baselines (%).
Text-to-4D comparison. Texts are abbreviated for display. RGB baselines reconstruct the decoded video, whereas Ours consumes its terminal latent directly.
Figure 4: Text-to-4D comparison. Texts are abbreviated for display. RGB baselines reconstruct the decoded video, whereas Ours consumes its terminal latent directly.
Image-to-4D comparison. Each row shows the input condition and 4D results. RGB baselines reconstruct the decoded video, whereas Ours consumes its terminal latent directly.
Figure 5: Image-to-4D comparison. Each row shows the input condition and 4D results. RGB baselines reconstruct the decoded video, whereas Ours consumes its terminal latent directly.
Additional controls. Motion, appearance, pose, and trajectory inputs.
Figure 7: Additional controls. Motion, appearance, pose, and trajectory inputs.
Action-conditioned 4D. Manipulation and navigation latents from a compatible backbone.
Figure 8: Action-conditioned 4D. Manipulation and navigation latents from a compatible backbone.
查看结构化数据
任务指标本文基线提升
Text-to-4D(Text4D-200) DINO-F1(×100) 57.01(Wan2.1-14B 潜变量) Wan2.1-14B + 4RC 解码级联 53.56 +3.45
Text-to-4D(Text4D-200) DINO-F1(×100) 57.09(Wan2.1-1.3B 潜变量) Wan2.1-1.3B + 4RC 解码级联 54.21 +2.88
Image-to-4D(I4D-200) DINO-F1(×100) 61.60 Wan2.2-I2V-A14B + 4RC 级联 55.79 +5.81
Image-to-4D(I4D-200) 全局 DINO 相似度(×100) 54.85 Wan2.2-I2V-A14B + 4RC 级联 47.83 +7.02
Image-to-4D 人类评估 几何完整性偏好率(%) 72.1(区间 67.8–76.3) 50%(与基线持平线) +22.1
DiT 残差敏感性诊断(7-Scenes/NRGBD) 点图 RMSE/半径(ρ=0.6) 0.0053 / 0.0047 解码 RGB + 4RC:0.3827 / 0.3160 漂移降低约两个数量级,30/30 对比全胜

局限与改进

作者明示的局限有三:证据限于共享 VAE 约定内,跨 VAE 家族(如 CogVideoX)无法直接迁移,只能退回解码级联;基于投影的 DINO 指标只是可见几何连贯性与完整性的外观代理,不构成对生成场景度量精度的证明;图8 的操作与导航示例仅展示接口兼容性,不代表动作成功或物理正确性。我补充观察:Text4D-200/I4D-200 是作者自建的生成潜变量基准,与自身方法同源,缺少外部第三方基准交叉验证;人类评估仅 50 人、每例 10 评,样本规模有限;推理延迟、显存与多级注意力的计算开销完全未报告;训练数据仅 1,143 段,对复杂大尺度场景的泛化存疑;正文未见代码与权重的开源承诺,只有项目页。

独立分析的弱点

独立分析三个弱点。第一,VAE 锁定:接口只在共享 VAE checkpoint、归一化、布局和压缩约定的家族内成立,面对 CogVideoX 这类不同 VAE 的主流生成器即失效;改进方向是学习跨 VAE 的潜空间翻译层,或蒸馏出 VAE 无关的中间几何表示。第二,评测循环性:主基准由作者自建且直接用生成潜变量构造,DINO-F1 依赖 DINOv2 特征,可能与训练中 DINO 类监督信号相关,存在指标偏置风险;建议引入带模拟真值的合成生成场景做度量误差评测,或用多视角光度一致性做无参考检验。第三,落地断言缺证据:动作条件 4D(图8)没有任务成功率、物理一致性或仿真回放实验,距具身智能应用尚远;应在仿真器中闭环验证预测几何的可执行性。另外,论文未报告潜变量精炼带来的额外推理成本,若对齐与多级注意力开销显著,会削弱相对级联方案的效率优势。

未来方向

作者方向的延伸:把接口推广到更多 VAE 家族乃至跨模态统一生成器;为生成场景建立带真值的度量基准;把上游位姿、轨迹、操作控制与 4D 输出联合评测。基于成果可延伸的方向:其一,潜变量接口思路可迁移到深度、法线、材质等其他属性预测,形成'潜变量到 X'的通用范式;其二,约 1K 片段即可训练说明几何通路对数据需求低,可扩展到百万级伪标注视频进一步提升几何质量;其三,结合流式长视频生成做增量式 4D 场景构建与回环闭环;其四,预测的世界坐标点图可直接对接物理引擎,服务可交互仿真资产创建;其五,Grid-Align-null 残差诊断本身可发展为生成-几何系统的标准化鲁棒性测试协议。

复现评估

复现评估:论文提供项目页(hayd-zju.github.io/Beyond-Pixels/),但正文未明确承诺开源代码与权重。复现需要:Wan2.1-T2V-14B、Wan2.1-T2V-1.3B、Wan2.2-I2V-A14B 及其共享 Wan VAE 的公开预训练权重;以 4RC 对齐的潜变量适配器为训练起点;6 个重建数据集共 1,143 个带 4D 标注片段(真值评测另需 7-Scenes 的 18 个与 NRGBD 的 9 个序列);rank-16 LoRA 多阶段训练,显存压力主要来自 31 层精炼层级与 14B 级 DiT 的采样。评测依赖锁定的 Text4D-200/I4D-200 各 200 例基准与双离轴相机投影协议,人类评估与残差构造细节在附录。总体难度中高:若自建基准与训练片段不公开,严格对齐表1数字会很困难。