← 返回 2026-08-31

视频生成模型作为几何学习器 Video Generative Models as Geometry Learner

Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng 📅 2026-08-28 👍 12 2026-09-01 18:30
Stable Video Diffusion 深度估计 统一几何估计 表面法线估计 视频扩散模型

把视频扩散模型的下一帧预测改造成深度与法线联合估计,数据效率提升近百倍

前置知识

潜空间扩散模型(LDM)

扩散模型通过前向加噪过程把数据逐步破坏为高斯噪声,再学习反向去噪过程从噪声重建数据。潜空间扩散模型(Latent Diffusion Model)先用 VAE 编码器把图像压缩到低维潜空间,在潜空间而非像素空间执行扩散,大幅节省计算并支持高分辨率合成,Stable Diffusion 即其代表。

GeoNeXt 的全部训练与推理都在冻结的 Stable Diffusion VAE 潜空间中进行,理解潜空间编码/解码是理解其方法的第一步。

Stable Video Diffusion(SVD)

SVD 是 Stability AI 开源的图像到视频扩散模型,基于 U-Net 架构并加入时间注意力层(temporal attention)建模跨帧依赖。给定一张输入图像,它通过通道拼接和 CLIP 嵌入交叉注意力两种方式注入条件,沿时间轴合成连贯视频帧,预训练赋予它丰富的时序先验。

GeoNeXt 直接以 SVD 为底座模型,把几何目标当作'后续帧'生成,其时间注意力正是实现图像-几何联合建模的关键机制。

单目深度与表面法线估计

从单张 RGB 图像推断每个像素的深度值(与相机的距离)和表面朝向(法线向量),是 3D 视觉的基础任务,二者互补:深度刻画整体结构,法线刻画局部几何朝向。深度可预测仿射不变版本(对平移缩放不变),避免对相机内参的依赖,主流 zero-shot 评测均采用此设定。

本文要同时估计这两种几何量,评测指标 AbsRel、δ1(深度)和 mean angular error、11.25°(法线)贯穿所有实验表格。

EDM 去噪公式化

EDM(Elucidating Diffusion Models)把扩散过程参数化为 $\mathbf{z}_t=\mathbf{z}_0+\sigma_t\boldsymbol{\epsilon}$,其中 $\sigma_t$ 是噪声水平,并采用预处理去噪器 $\mathcal{Z}_\theta=\mathbf{z}_t+c_{\mathrm{out}}(\sigma_t)F_\theta(c_{\mathrm{in}}(\sigma_t)\mathbf{z}_t,c_{\mathrm{noise}}(\sigma_t))$,用 $c_{\mathrm{in}},c_{\mathrm{out}},c_{\mathrm{skip}}$ 等标量函数稳定不同噪声级别下的训练。SVD 即采用该公式化。

GeoNeXt 的训练目标与推理采样器(5 步 EDM sampler)都建立在 EDM 之上,论文中的噪声调度 $p(\sigma)=\mathcal{N}(0.7,1.6)$ 也来自 SVD 的设定。

研究动机

现有生成式几何估计方法都基于预训练图像扩散模型(如 Stable Diffusion),把几何当作'特殊图像'做图像条件生成,存在两条各有缺陷的路线:第一类(如 Marigold、Lotus)为深度和法线分别训练独立的任务专用模型,架构改动极小、迁移效率高,但参数不共享,完全无法利用深度与法线之间的内在关联(同一表面的两种几何表示天然强相关),且部署时需要维护两份 1.9B 参数的检查点,带来额外的显存与 I/O 开销;第二类(如 GeoWizard、Orchid)通过修改扩散骨干(加入交叉注意力、几何切换模块)做联合预测,却因微调与预训练之间的差距被拉大而需要海量标注数据——GeoWizard 用了 208K 样本训练,性能反而受限。另一条路是判别式方法(Depth Anything 系列依赖 62.6M 张训练图像的数据引擎),算力开销巨大且对伪标签噪声敏感,预测缺乏细粒度高频细节。

本文的目标是本文的目标是构建一个统一且数据高效的几何估计框架:用单一模型同时从单张 RGB 图像预测深度图和表面法线图,同时保持预训练模型的生成先验不被架构改动破坏,从而只需极少量的 RGB-深度-法线三元组(约 59K 样本,来自 Hypersim 与 Virtual KITTI 2 两个合成数据集)微调,就能在零样本设置下匹配甚至超越用 100 倍以上数据训练的判别式 SOTA(如 62.6M 图像的 Depth Anything)以及其他统一生成式方法(如 208K 数据的 GeoWizard),同时保留判别式方法常缺失的细粒度高频几何细节,并让推理成本控制在单卡可承受的范围。

与已有工作不同的是,作者的独特切入是从图像生成模型转向视频生成模型:视频扩散模型在超大规模视频数据上预训练,除图像先验外还带有捕获跨帧依赖的时间注意力先验。作者敏锐地意识到这种'预测下一帧'的归纳偏置与几何估计天然同构——把深度和法线建模为输入图像的'后续帧',让模型在原生生成顺序上做微调,而不是像 GeoWizard 那样改动架构强行注入几何分支。同时让图像与几何沿同一条去噪轨迹'同步生成'(lockstep co-generation),显式建模图像↔几何的交互,避免此前两条路线都忽略的跨模态一致性问题。

核心方法

直觉上,视频扩散模型有三点天然优势:预训练语料同时覆盖图像与视频、时间注意力提供跨帧(可迁移为跨模态)依赖建模能力、即使没有几何监督其先验也能被适配用于几何预测。技术路线上,GeoNeXt 以 Stable Video Diffusion(SVD)为底座:给定 RGB 图像 $\mathbf{x}$,把目标几何(深度 $\mathbf{d}$ 与法线 $\mathbf{n}$)组织成图像-几何三元组 $\mathcal{G}=(\mathbf{x},\mathbf{d},\mathbf{n})$,将几何预测重新表述为图像到视频的下一帧生成问题,学习条件分布 $p(\mathbf{g}\mid\mathbf{x})$,$\mathbf{g}=\{\mathbf{d},\mathbf{n}\}$。所有数据经冻结的 Stable Diffusion VAE 编码到潜空间,仅微调去噪 U-Net(1.5B 参数),采用 EDM 噪声调度 $p(\sigma)=\mathcal{N}(0.7,1.6)$ 与标准扩散损失,同时重建图像、深度和法线三个潜码。

核心创新是把单目几何估计重新表述为视频扩散模型中的下一帧预测,并让图像与几何'同步联合生成'。与已有方法的本质区别有三:其一,Marigold/Lotus 把几何当图像条件生成但只训练单任务模型,本文则在一个模型内沿同一条去噪轨迹同时重建图像与几何,损失中图像重建项强迫模型维持跨模态一致性(消融显示去掉图像重建后 NYUv2 深度 AbsRel 从 5.3 恶化到 6.5);其二,GeoWizard 通过修改自注意力和加切换模块实现联合估计,拉大了微调与预训练的差距,本文完全保留 SVD 原生架构与生成顺序,只移除文本/CLIP 分支,迁移效率因此极高;其三,时间注意力层天然把图像条件传播到几何分支,替代了人为设计的跨任务交互模块。

方法步骤详情

训练分四步(对应 Fig. 2):(1) 潜空间编码:把图像 $\mathbf{x}$、深度 $\mathbf{d}$、法线 $\mathbf{n}$ 三元组用冻结的 SD VAE 编码器 $\mathcal{E}$ 映射到潜空间;单通道深度平铺为三通道,值域先归一化到 $[0,1]$ 再经 $(x-0.5)\times 2$ 对齐 VAE 输入范围 $[-1,1]$。(2) 加噪:按 EDM 前向过程 $\mathbf{z}_t=\mathbf{z}_0+\sigma_t\boldsymbol{\epsilon}$ 加高斯噪声,图像潜码同时复制到几何槽位作为强条件信号。(3) 条件拼接与去噪:几何潜码与图像潜码通道拼接后送入可训练的 SVD U-Net,禁用原 CLIP 交叉注意力(避免缩放畸变),时间注意力把图像信息传播到几何分支。(4) 优化:最小化图像、深度、法线三潜码的重建损失 $\|\mathbf{z}_0-\hat{\mathbf{z}}_0\|^2$ 之和。训练用 Adam(学习率 $5\times 10^{-6}$)、随机水平翻转,Hypersim 与 Virtual KITTI 2 按 9:1 采样。推理时从高斯噪声初始化三个潜码,EDM 采样器去噪 5 步,丢弃图像潜码,VAE 解码出深度与法线,另以 5 个随机种子集成。

技术新颖性

技术新颖性体现在四个层面。形式化层面:首次把单目联合几何估计表述为视频扩散的下一帧预测,这是一个概念上的重构而非模块堆叠,使预训练的任务形式(帧间连续性预测)与目标任务(图像→几何映射)在结构上同构。一致性层面:图像与几何沿共享去噪轨迹同步合成,图像重建项作为隐式正则,解决了图像扩散路线中条件与目标互相独立、跨模态不一致的通病。效率层面:不修改任何注意力结构,微调-预训练差距最小化,59K 样本即可超越 208K 样本训练的 GeoWizard,参数量仅 1.5B 且单模型替代两个专用模型。实证层面:系统性的消融协议(生成式形式化、CLIP 嵌入、联合 vs 分离训练、深度/法线重建顺序)验证了每个设计决策,尤其发现重建顺序几乎不影响性能(normal-depth 与 depth-normal 在 NYUv2 上 AbsRel 5.7 vs 5.3),说明模型真正学到了三种表示的内在关联而非记忆帧序。

GeoNeXt 微调协议总览
Fig. 2: GeoNeXt 微调协议总览

实验结果

零样本深度估计(Table 1):仅用 59K 样本达到 NYUv2 AbsRel 5.3/δ1 96.8、KITTI 8.2/92.6、ETH3D 5.6/97.2、ScanNet 5.9/95.8、DIODE 22.6/74.3,全面优于统一模型 GeoWizard(208K 数据,KITTI 14.4、DIODE 33.0)和任务专用的 Marigold、Lotus-G 等;对比 62.6M 图像训练的 Depth Anything(约 100 倍数据),ETH3D 上 5.6 vs 13.1 反超,但 DIODE 仍落后于 DPT(18.2)。零样本法线估计(Table 2):NYUv2 mean 16.7°、iBims-1 16.4/69.2、Sintel 33.0/21.5、OASIS 22.8/30.8,在 iBims-1 和 Sintel 上领先所有生成式基线。消融(Table 3):去掉图像重建使 iBims 法线 mean 从 16.4 恶化到 18.5,保留 CLIP 嵌入反而略降性能,联合训练优于分离训练(深度专用 NYUv2 5.9 vs 联合 5.3)。成本分析(Table 5):单次预测 1.0 秒、5×5 集成 10.0 秒(A5000、768×768),而 GeoWizard 需 50×10 集成耗时 272.1 秒,效率优势超过一个数量级。

零样本仿射不变深度估计定量对比
Table 1: 零样本仿射不变深度估计定量对比
零样本表面法线估计定量结果
Table 2: 零样本表面法线估计定量结果
生成式形式化、模型架构与联合估计的消融
Table 3: 生成式形式化、模型架构与联合估计的消融
重建顺序消融
Table 4: 重建顺序消融
成本效益分析
Table 5: 成本效益分析
多数据集上单目深度估计方法的定性对比
Fig. 3: 多数据集上单目深度估计方法的定性对比
多数据集上表面法线估计方法的定性对比
Fig. 4: 多数据集上表面法线估计方法的定性对比
查看结构化数据
任务指标本文基线提升
零样本仿射不变深度估计(NYUv2) AbsRel↓ / δ1↑ 5.3 / 96.8 GeoWizard 5.6 / 96.3;Marigold 5.5 / 96.4;Depth Anything 4.5 / 97.9(62.6M 数据) 较 GeoWizard AbsRel 降低 0.3,δ1 提升 0.5;训练数据仅为判别式 SOTA 的约 1/1000
零样本深度估计(KITTI) AbsRel↓ / δ1↑ 8.2 / 92.6 GeoWizard 14.4 / 82.0;Lotus-G 8.5 / 92.2 较 GeoWizard AbsRel 降低 6.2、δ1 提升 9.4,且训练数据少 3.5 倍
零样本深度估计(ETH3D / DIODE) AbsRel↓ / δ1↑ ETH3D 5.6 / 97.2;DIODE 22.6 / 74.3 ETH3D:Depth Anything 13.1 / 86.5,Lotus-G 5.9 / 97.0;DIODE:Lotus-G 23.0 / 73.0 ETH3D 上以约 1/1100 的数据反超 Depth Anything(AbsRel 5.6 vs 13.1);DIODE 上小幅领先 Lotus-G
零样本表面法线估计(iBims-1 / Sintel) mean 角误差↓ / 11.25°内比例↑ iBims-1 16.4 / 69.2;Sintel 33.0 / 21.5 iBims-1:GeoWizard 19.4 / 62.8,Lotus-G 17.2 / 66.3;Sintel:E2E-FT 33.5 / 22.3 iBims-1 较 GeoWizard mean 降低 3.0°、11.25° 比例提升 6.4;Sintel 与最优生成式方法持平
推理效率(ETH3D+iBims-1,A5000,768×768) 推理时间 / 参数量 / NFEs 1×1:1.0s(1.5B);5×5 集成:10.0s,ETH3D AbsRel 5.6 / iBims mean 16.4 GeoWizard 50×10:272.1s(0.9B,双检查点);Marigold 双模型 50×10:180.5s 单步预测即超越所有基线,达到可比质量的总耗时比 GeoWizard 低 27 倍,且无需维护两份模型

局限与改进

作者承认的局限较为隐含,更多可从实验设置中推断:(1) 训练完全依赖合成数据(Hypersim 室内 + Virtual KITTI 2 驾驶),域外真实场景的泛化虽经零样本验证,但 DIODE 上 AbsRel 22.6 仍落后于判别式 DPT 的 18.2,Sintel 法线 mean 33.0°、11.25° 内仅 21.5%,说明高度动态的户外场景依旧困难;(2) 预测的是仿射不变深度而非度量深度,无法直接用于自动驾驶等需要绝对距离的应用;(3) 单次预测质量有限,最佳结果依赖 5 种子集成,推理成本从 1.0s 增至 10.0s;(4) 分辨率受 VAE 与训练分辨率约束(576×768 / 352×1216),高分辨率输入的几何细节可能受限;(5) 主结果基于 SVD U-Net,论文声称架构无关并承诺在补充材料给出 WAN 等 DiT 结果,正文未验证;(6) 度量指标间互有取舍,如 DIODE δ1 74.3 相对其他基准明显偏低,暗示深度尺度在部分场景不稳定。

独立分析的弱点

独立来看有几点值得警惕。第一,合成到真实的域差距被部分掩盖:训练集 9:1 偏向 Hypersim 室内场景,DIODE(高分辨率、多变光照)和 Sintel(动态运动模糊)上的相对弱势(δ1 仅 74.3、法线 11.25° 内 21.5%)可能源于光照与运动模式的分布缺口,改进方向是引入真实数据伪标签或域随机化增强。第二,仿射不变深度对机器人、AR 等需要绝对尺度的场景不可用,可将相机内参作为额外条件通道以支持度量深度预测。第三,图像重建项虽然提升一致性,但意味着推理时浪费约三分之一的生成容量在会被丢弃的图像潜码上,可探索推理时冻结图像分支、只去噪几何分支的两阶段采样。第四,5 种子集成的成本不可忽视,可通过 EDM 蒸馏到 1-2 步或 ODE 求解器加速。第五,消融仅在 4 个数据集上进行且未报告方差,59K 与 208K 数据对比也未做数据缩放曲线,'数据高效'的结论缺少更细的支撑。第六,CLIP 条件被禁用的原因(缩放畸变)值得更深入分析,或许可用不缩放的特征提取器替代以兼得语义先验。

未来方向

作者明确提出的方向:将框架迁移到更先进的 DiT 视频模型(如 WAN),利用其更强的先验和可扩展性;利用预测的几何支撑下游应用——可控图像生成、图像重打光、网格重建(Fig. 1 已展示雏形)。基于成果可自然延伸的方向:(1) 从单帧扩展到视频几何估计,利用时间一致性输出逐帧连贯的深度/法线序列,这几乎不需改动框架;(2) 扩展几何目标族,把点图、相机位姿、内参也建模为'后续帧',走向单模型全 3D 感知;(3) 与前向渲染结合做几何条件的新视角合成或材质估计,形成逆渲染闭环;(4) 用大模型蒸馏或一致性模型把 5 步 EDM 采样压缩到 1-2 步,释放实时应用潜力;(5) 引入不确定性估计(如预测多个假设帧),提升边缘与遮挡区域的可靠性;(6) 系统研究视频预训练先验中究竟哪些成分(时间注意力、数据规模、帧序建模)贡献了几何能力,指导下一代几何基础模型的设计。

复现评估

复现基础较好但有缺口。有利条件:底座 SVD 与冻结 VAE 均为公开权重;训练数据 Hypersim 与 Virtual KITTI 2 公开可下载,预处理协议(尺寸、裁剪、远平面、9:1 采样)在论文中写得很具体;实现细节完整(Adam、学习率 $5\times 10^{-6}$、EDM 调度 $p(\sigma)=\mathcal{N}(0.7,1.6)$、5 步采样、5 种子集成);项目页 happy-hsy.github.io/projects/GeoNeXt/ 已建立,推理在单张 NVIDIA A5000 上即可运行(1.5B 参数、768×768)。缺口:正文未明确说明训练代码与权重是否开源,也未披露训练所需 GPU 时长与卡数;基线中带 * 的结果(GeoWizard、DepthFM、Lotus-G)为作者自行复现,严格复现对齐需自行处理其评测协议;DiT(WAN)版本只在补充材料,正文不可验证。总体而言,若代码开源,中等规模实验室(1-2 张 A100/A5000 级别)复现主结果是可行的;纯推理复用则门槛很低。