超越像素:从视频先验到4D世界 Beyond Pixels: From Video Priors to 4D Worlds
将视频模型的最终去噪潜变量直接映射为4D动态场景,绕过RGB解码,单checkpoint跨生成器复用
前置知识
VAE 潜空间
变分自编码器把高维视频压缩成低维潜张量,视频扩散模型实际在潜空间迭代去噪。只要共享同一 VAE checkpoint、潜变量归一化、张量布局和压缩约定,不同 DiT 的最终去噪潜变量就落在同一表示空间,且位于 RGB 解码的上游。
本文全部主张建立在'共享 VAE 潜空间可作为可复用接口'之上,不理解潜空间就无法理解为何一个 4D 通路能服务多个不同生成器。
DiT(视频扩散 Transformer)
Diffusion Transformer 是当前主流视频生成骨干,如 Wan2.1-T2V-14B。它从噪声出发,在 VAE 潜空间按条件 $c$ 逐步去噪,输出最终去噪潜变量 $\mathbf{z}_{gen} = G_\theta(c,\epsilon)$,再由 VAE 解码为 RGB 帧。
本文保持所有 DiT 冻结、只消费其终端潜变量,并在 Wan2.1-T2V-14B、Wan2.1-T2V-1.3B 与 Wan2.2-I2V-A14B 三个 DiT 上验证迁移性。
4D 生成与点图
4D 指带时间轴的动态 3D 场景,输出为逐帧相机 $C_t$ 与世界坐标系稠密点图 $P_t \in \mathbb{R}^{H\times W\times 3}$,可从新视角重投影渲染。前馈重建器(如 4RC、$\pi^3$)从 RGB 视频直接回归这些几何量。
论文的监督信号、损失函数 $\mathcal{L}=\mathcal{L}_{unc}+\mathcal{L}_{cam}+\mathcal{L}_{geom}$ 和评测协议全部围绕相机与点图展开。
LoRA 低秩适配
在冻结的预训练权重旁注入低秩矩阵增量的参数高效微调方法,只训练极少量参数。本文以 rank-16 LoRA 适配 31 层精炼层级,视频模型、VAE 与原始 Transformer 权重全部保持冻结。
它决定了复现成本,也是论文所称'轻量精炼增量 $\Delta\psi$'的具体含义,是防破坏预训练几何先验的关键设计。
DINO 特征与 DINO-F1 指标
DINOv2 是自监督视觉特征提取器,广泛用于生成质量评测。本文把预测点序列从两个离轴相机渲染,计算全局 DINO 相似度、有效块 DINO 匹配率,再由匹配与未匹配集合的查准查全得 DINO-F1(×100)。
主表所有结论(如 57.01 对 53.56)都基于该指标;需明白它衡量的是投影外观一致性的代理,并非度量级几何精度。
研究动机
现有 4D 生成方法分为两大阵营,各有硬伤。第一类是生成后重建范式(如 Diffusion4D、4Diffusion、CAT4D):先用视频扩散模型合成多视角或时序 RGB 视频,再用独立训练的重建模型转为动态 3D 场景。问题是 RGB 成为两个模型之间的表示边界——重建器通常只在狭窄的重建数据上训练,面对开放域生成内容存在分布失配,视频中的时序伪影与瑕疵会传播成不稳定的几何。第二类是一体化前馈生成(如 4DNeX、Diff4Splat、WorldReel、WorldForge):把几何预测内嵌进特定生成器,直接输出点云或高斯,但与特定生成器和条件模式强绑定,换一个预训练视频模型就要重新做几何监督训练。更棘手的是 4D 监督数据天然稀缺——本文训练也仅用约 1,143 段真实重建片段,与海量视频数据完全不成比例,这使得'每换一个生成器就重训一次'的路线难以规模化。
本文的目标是本文目标是建立一个可复用的接口:绕过生成的 RGB,让一条只用几何监督训练的通路能同时服务多个兼容的视频生成器。作者提炼的核心科学问题是:视频模型的最终去噪潜变量能否成为跨兼容 DiT 的可复用 4D 预测接口?具体而言,希望学一个从 VAE 潜空间 $\mathcal{Z}_v$ 到 4D 结构化 token 空间 $\mathcal{Z}_{4D}$ 的直接映射,输出逐帧相机 $C_t$ 和世界坐标系稠密点图 $P_t$。该接口应在同一 VAE 家族的两个文本生成视频 DiT(Wan2.1-T2V-14B、Wan2.1-T2V-1.3B)和一个图生视频 DiT(Wan2.2-I2V-A14B)之间零改动迁移,只需约 1K 重建片段训练,并在自建的 Text4D-200 与 I4D-200 基准上超过同潜变量的解码级联基线。
与已有工作不同的是,独特切入在于识别出共享 VAE 潜空间这一天然接口。虽然不同 DiT 的骨干架构和条件模式各异,但共享同一 VAE checkpoint、潜变量归一化、张量布局和压缩约定的模型,其最终去噪潜变量落在同一表示空间;且该空间位于 RGB 解码上游,天然携带外观、运动和条件信息。此前没有人把它当作多生成器共享的 4D 输入接口:相关工作 VIST3A 只把视频 VAE 对接到静态 3D 重建器的单一模型对;4RC、$\pi^3$、Any4D 等前馈重建器则依赖在重建数据上训练的 RGB 编码器去解释可能分布外的生成帧。作者反其道行之:保留预训练 4D 重建层级作为解码器,用视频模型本身充当编码器,把 RGB 接口替换为对齐后的终端潜变量,从而把几何监督与具体生成器彻底解耦。
核心方法
直觉上,与其让视频潜变量先解码成 RGB、再由另一个重建器翻译成几何,不如让几何解码器直接阅读潜变量。Latent-to-4D 把直接映射分解为对齐、精炼、解码三级:$\hat{\mathbf{Y}} = \mathcal{D}_\omega(\mathcal{H}_{\psi,\Delta\psi}(\mathcal{A}_\phi(\mathbf{z});\mathbf{S}))$,其中 $\mathbf{z}\in\{\mathbf{z}_{obs},\mathbf{z}_{gen}\}$ 是 VAE 潜变量,$\mathbf{S}$ 为冻结的相机与时间 token。训练时冻结 VAE 编码约 1,143 段带 4D 标注的重建片段,只更新对齐模块 $\mathcal{A}_\phi$、LoRA 精炼增量 $\Delta\psi$ 与几何/相机预测头;视频 DiT、VAE 和原 Transformer 权重全部冻结,并渐进激活可训练组件以免破坏几何先验。推理时把 $\mathbf{z}_{obs}$ 换成兼容 DiT 的最终去噪潜变量 $\mathbf{z}_{gen}$,下游通路完全不变。
核心创新是把共享 VAE 的最终去噪潜变量正式定义为生成器与 4D 预测之间的可复用接口。与生成后重建范式的本质区别:后者在生成器与重建器之间隔着 RGB 表示边界,生成内容的分布偏移和时序伪影会污染几何预测;本文在 RGB 解码之前介入,用 L4AR 网络直接把潜变量对齐到 4D token 网格。与一体化前馈范式的本质区别:后者把几何预测焊死在某个生成器里,换模型就要重训;本文保持所有条件 DiT 及其共享 VAE 冻结,只学一个接口,单个 checkpoint 无改动迁移到 Wan2.1-T2V-14B、Wan2.1-T2V-1.3B 和 Wan2.2-I2V-A14B 三个模型。由于条件信息已经在生成的潜变量中实现,无需条件专属分支或任务标识符,文本、图像乃至位姿、轨迹、机械臂操作等上游控制都能直接继承。
方法步骤详情
流程分五步。第一步取潜变量:训练时冻结 VAE 编码观测视频得 $\mathbf{z}_{obs} = \mu(\mathcal{E}_v(V))$,推理时从冻结 DiT 采样最终去噪潜变量 $\mathbf{z}_{gen}$。第二步对齐:三线性重采样 $R$ 匹配时空分辨率,可学习 3D 卷积 $S_\phi$ 聚合邻域并投影通道,展平得 $\mathbf{Q}^{(0)} = \mathcal{A}_\phi(\mathbf{z})$,形状为 $T\times M\times d$。第三步精炼:帧内注意力在 $(BT,M,d)$ 上巩固每帧结构,全局注意力在 $(B,TM,d)$ 上传播跨帧对应与运动证据,交替执行并多深度拼接特征。第四步解码:逐像素预测深度 $\hat{d}_t(u)$、光线原点 $\hat{\mathbf{o}}_t$、方向 $\hat{\mathbf{r}}_t(u)$ 与置信度,世界点 $\hat{\mathbf{P}}_t(u) = \hat{\mathbf{o}}_t + \hat{d}_t(u)\hat{\mathbf{r}}_t(u)$,相机头输出 9D 位姿-视场角参数。第五步训练:损失 $\mathcal{L} = \mathcal{L}_{unc} + \mathcal{L}_{cam} + \mathcal{L}_{geom}$,含置信度加权深度、梯度与光线项,相机平移/旋转/FOV 项,以及度量深度与表面法线项;末段用 6 个重建数据集共 1,143 片段。
技术新颖性
技术新颖性体现在三点。其一,接口选择:首个把终端去噪潜变量而非生成 RGB 作为 4D 解码输入的工作,潜变量位于解码上游,从机制上绕开了分布失配与误差传播。其二,迁移机制:无需测试时适配,单一 checkpoint 跨同 VAE 家族三个 DiT 成绩几乎一致(Text4D 上 DINO-F1 57.01 对 57.09),实证潜空间确为稳定共享接口;Grid-Align-null 残差诊断进一步显示,对受控 DiT 残差扰动本方法点图漂移仅 0.0053/0.0047,而解码 RGB 级联基线高达 0.3827/0.3160(7-Scenes/NRGBD)。其三,参数效率:31 层精炼层级仅以 rank-16 LoRA 适配,其余权重、相机/时间 token 全部冻结,训练数据只要约 1K 片段。相比 VIST3A 这类只对齐单一模型对的方案,本文建立的是家族级、可被后续任何同 VAE 生成器即插即用的通路。
实验结果
定量结果分四块。(1)Text4D-200(表1):单一 checkpoint 在两个文本 DiT 上几乎同分——DINO-F1 为 57.01(Wan2.1-14B)与 57.09(Wan2.1-1.3B),比匹配的同潜变量 Wan+4RC 级联高 3.45 与 2.88 分,也领先 $\pi^3$ 与 Any4D(分别为 47.50/45.55 和 50.10/46.06);但 CogVideoX-5B+4RC 仍保持最高 RGB 参考 CLIP-I(75.33 对 72.24),作者不宣称逐项全胜。(2)I4D-200:本文 DINO-F1 61.60,比匹配 Wan2.2+4RC 的 55.79 高 5.81 分,全局 DINO 54.85 对 47.83,远超 4DNeX 的 28.33。(3)人类评估(表2):50 名参与者对每基准 50 案例各评 10 次,所有偏好率区间下限超 50%,几何完整性偏好文本任务 66.8%、图生任务 72.1%。(4)诊断与消融:受控 DiT 残差测试 30/30 全胜,$\rho=0.6$ 时点图漂移 0.0053/0.0047 对基线 0.3827/0.3160;表3 消融显示去掉 3D 卷积后 7-Scenes Acc 从 3.121 恶化到 6.944 cm,去掉任一注意力几乎翻倍。定性上(图4、5),RGB 基线常见孔洞与碎裂表面,本文保留更多主体与场景结构。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Text-to-4D(Text4D-200) | DINO-F1(×100) | 57.01(Wan2.1-14B 潜变量) | Wan2.1-14B + 4RC 解码级联 53.56 | +3.45 |
| Text-to-4D(Text4D-200) | DINO-F1(×100) | 57.09(Wan2.1-1.3B 潜变量) | Wan2.1-1.3B + 4RC 解码级联 54.21 | +2.88 |
| Image-to-4D(I4D-200) | DINO-F1(×100) | 61.60 | Wan2.2-I2V-A14B + 4RC 级联 55.79 | +5.81 |
| Image-to-4D(I4D-200) | 全局 DINO 相似度(×100) | 54.85 | Wan2.2-I2V-A14B + 4RC 级联 47.83 | +7.02 |
| Image-to-4D 人类评估 | 几何完整性偏好率(%) | 72.1(区间 67.8–76.3) | 50%(与基线持平线) | +22.1 |
| DiT 残差敏感性诊断(7-Scenes/NRGBD) | 点图 RMSE/半径(ρ=0.6) | 0.0053 / 0.0047 | 解码 RGB + 4RC:0.3827 / 0.3160 | 漂移降低约两个数量级,30/30 对比全胜 |
局限与改进
作者明示的局限有三:证据限于共享 VAE 约定内,跨 VAE 家族(如 CogVideoX)无法直接迁移,只能退回解码级联;基于投影的 DINO 指标只是可见几何连贯性与完整性的外观代理,不构成对生成场景度量精度的证明;图8 的操作与导航示例仅展示接口兼容性,不代表动作成功或物理正确性。我补充观察:Text4D-200/I4D-200 是作者自建的生成潜变量基准,与自身方法同源,缺少外部第三方基准交叉验证;人类评估仅 50 人、每例 10 评,样本规模有限;推理延迟、显存与多级注意力的计算开销完全未报告;训练数据仅 1,143 段,对复杂大尺度场景的泛化存疑;正文未见代码与权重的开源承诺,只有项目页。
独立分析的弱点
独立分析三个弱点。第一,VAE 锁定:接口只在共享 VAE checkpoint、归一化、布局和压缩约定的家族内成立,面对 CogVideoX 这类不同 VAE 的主流生成器即失效;改进方向是学习跨 VAE 的潜空间翻译层,或蒸馏出 VAE 无关的中间几何表示。第二,评测循环性:主基准由作者自建且直接用生成潜变量构造,DINO-F1 依赖 DINOv2 特征,可能与训练中 DINO 类监督信号相关,存在指标偏置风险;建议引入带模拟真值的合成生成场景做度量误差评测,或用多视角光度一致性做无参考检验。第三,落地断言缺证据:动作条件 4D(图8)没有任务成功率、物理一致性或仿真回放实验,距具身智能应用尚远;应在仿真器中闭环验证预测几何的可执行性。另外,论文未报告潜变量精炼带来的额外推理成本,若对齐与多级注意力开销显著,会削弱相对级联方案的效率优势。
未来方向
作者方向的延伸:把接口推广到更多 VAE 家族乃至跨模态统一生成器;为生成场景建立带真值的度量基准;把上游位姿、轨迹、操作控制与 4D 输出联合评测。基于成果可延伸的方向:其一,潜变量接口思路可迁移到深度、法线、材质等其他属性预测,形成'潜变量到 X'的通用范式;其二,约 1K 片段即可训练说明几何通路对数据需求低,可扩展到百万级伪标注视频进一步提升几何质量;其三,结合流式长视频生成做增量式 4D 场景构建与回环闭环;其四,预测的世界坐标点图可直接对接物理引擎,服务可交互仿真资产创建;其五,Grid-Align-null 残差诊断本身可发展为生成-几何系统的标准化鲁棒性测试协议。
复现评估
复现评估:论文提供项目页(hayd-zju.github.io/Beyond-Pixels/),但正文未明确承诺开源代码与权重。复现需要:Wan2.1-T2V-14B、Wan2.1-T2V-1.3B、Wan2.2-I2V-A14B 及其共享 Wan VAE 的公开预训练权重;以 4RC 对齐的潜变量适配器为训练起点;6 个重建数据集共 1,143 个带 4D 标注片段(真值评测另需 7-Scenes 的 18 个与 NRGBD 的 9 个序列);rank-16 LoRA 多阶段训练,显存压力主要来自 31 层精炼层级与 14B 级 DiT 的采样。评测依赖锁定的 Text4D-200/I4D-200 各 200 例基准与双离轴相机投影协议,人类评估与残差构造细节在附录。总体难度中高:若自建基准与训练片段不公开,严格对齐表1数字会很困难。
论文图表
对比框图:上方为传统'生成后重建'路线,DiT 产出潜变量经 VAE 解码成 RGB 再由重建模型转 4D;下方为本方法,噪声经 DiT 得到潜变量后由 L4AR 直接映射到 4D 解码器。
这是理解论文动机的关键图:两条路线的差异一目了然,解释了为何绕过 RGB 能规避分布失配与误差传播。
把受控 DiT 残差以 ρ 强度注入潜变量,绘制本方法与解码 RGB+4RC 基线在 7-Scenes 和 NRGBD 上的点图 RMSE、相机平移 RMSE 与旋转误差随 ρ 变化曲线,本文曲线几乎平坦。
支撑'潜变量接口对生成器噪声鲁棒'的核心论断:ρ=0.6 时漂移 0.0053/0.0047 对 0.3827/0.3160,是隔离性最强的诊断实验。
在 7-Scenes 与 NRGBD 真值数据上做组件消融:完整模型 Acc/Comp 为 3.121/5.418 与 5.202/8.187 cm;去掉 3D 卷积恶化到 6.944/15.806 与 12.439/26.511;去掉帧内或全局注意力同样大幅退化。
验证 L4AR 每个设计组件的必要性,是理解架构各部分贡献与复现关键配置的依据。