Marigold V2:基于扩散Transformer的单目深度估计再探索 Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
单张32GB GPU一周内把图像编辑DiT改造成细节锐利的SOTA单目深度估计器
前置知识
仿射不变深度(affine-invariant depth)
单目深度存在全局尺度与平移歧义:同一张图对应无穷多线性变换后的深度。仿射不变深度放弃绝对尺度、只刻画相对几何;评测时先用 RANSAC 把预测对齐到真值尺度与平移再算 AbsRel、δ1。本文将度量深度转成按 2%/98% 分位稳健裁剪、映射到 $[-1,1]$ 的归一化对数深度 $d$。
论文的训练目标、损失设计与全部评测指标都建立在这套归一化对数深度表示之上,理解它才能看懂深度归一化一节和各表格间如何公平比较。
潜在扩散与 VAE 编解码器
潜在扩散模型用 VAE 把图像压到低分辨率潜在空间:$z_I=E_{\text{vae}}(I)$ 编码、$D_{\text{vae}}$ 解码,扩散模型在潜在空间中运算。VAE 是有限带宽的压缩重建,容易抹掉毛发、细边缘等高频细节,这正是扩散深度估计器边界过平滑、点云飞行像素的重要根源。
Marigold V2 在潜在空间直接回归深度潜变量,Stage 2 还解冻 VAE 解码器配合 SinkLoss 修细节;理解 VAE 的信息瓶颈才能明白细节丢失的机制与本文的对策。
修正流(Rectified Flow)与单步推理
修正流把生成建模为噪声分布到数据分布的直线路径,网络学习速度场 $v=z_I-z_d$。当时间步固定为 $t=0.5$ 时无需迭代采样,训练退化为直接回归 $\mathcal{L}=\|f_\theta(z_I,t)-v\|_2^2$,推理一次前向即得深度潜变量。
这是本文摆脱多步扩散采样延迟、实现单步推理的关键设定;论文的效率对比(Table 6)与延迟分析全部基于这一参数化,Lotus 系列也采用同样的直推式思路。
QLoRA 与 4-bit 量化
QLoRA 把预训练权重量化到 4-bit 并冻结存储,只训练插入的低秩适配器 LoRA(本文用 rank-128)。量化大幅降低权重与优化器状态的显存开销,LoRA 只更新极小比例参数,两者结合使超大 DiT 在单张消费级 GPU 上微调成为可能,同时基本保留模型容量。
本文的核心卖点——单张 32GB GPU、不足一周完成训练——完全建立在 QLoRA 之上;理解它才能判断这套协议的算力门槛和容量损失。
REPA / iREPA 表示对齐
REPA/iREPA 在训练扩散模型时,用辅助损失约束网络内部中间表征与预训练视觉编码器(DINOv2/DINOv3)的特征对齐,把大规模预训练的语义先验注入生成模型,可加速收敛并提升语义保真。既有深度估计工作(DepthMaster、PPD)的对齐目标都取自输入 RGB 图像的特征。
本文的 iREPA-depth 是该技术的非常规用法:对齐目标不是 RGB 特征,而是真值深度图经冻结 DINOv3 提取的特征,它是 Stage 1 的核心正则项,也是主要创新之一。
Sinkhorn 迭代与熵正则最优传输
最优传输在两个分布间求代价最小的软匹配。加熵正则 $\tau H(M)$ 后可用 Sinkhorn–Knopp 迭代(在 $\exp(-\tilde{C}/\tau)$ 上交替行列归一化)求解,得到软一对一指派。本文在 $K\times K$ 图块内做像素软匹配,允许预测与真值集合一致、位置可换。
SinkLoss 完全建立在该机制之上;理解熵正则如何把硬匹配软化、如何在真值有噪声时提供容错监督,是看懂 Stage 2 训练和抗歧义设计的前提。
研究动机
单目深度估计是本质病态的问题,现有两条路线各有硬伤。判别式路线(MoGe、π3、Depth Anything 系列)受限于真值数据稀缺:训练集仅百万量级(MoGe 9M、Depth Anything V2 62.6M),远不及生成模型的十亿级语料,且传感器噪声与非朗伯表面(玻璃、反光、透明物)使标注质量天然受限,模型在分布外场景精度骤降。扩散式路线(Marigold V1、Lotus 等)虽用极少数据(54K–90K 张图)复用生成先验,但两个老毛病未解:一是预测深度图细节丢失、边界过平滑,投影成点云后出现成片飞行像素;二是逐像素强监督对透明或细小结构的噪声真值过度敏感——HyperSim 的 V-Ray 准蒙特卡洛渲染使透明像素的深度真值本质上随机取前景或背景值,完美的逐像素 AbsRel 既达不到也不该追求,L1 损失却会逼模型把噪声学进去。此外,社区从 U-Net 转向扩散 Transformer(DiT)后改造成本陡增:DICEPTION 需 96 GPU 天,Lotus-2 用 8 张 GPU,从零训练需数十张卡,个人研究者与小实验室难以负担。
本文的目标是本文目标是设计一条低成本微调协议,把开源图像编辑扩散 Transformer(Qwen-Image-Edit-2509)改造成最先进的单目深度估计器,并正面解决扩散深度估计的两大顽疾:细节丢失与噪声真值下的脆弱监督。量化目标非常明确:在单张 32GB 消费级 GPU 上、只用约 7.4 万张合成训练图(HyperSim + vKITTI)、不到一周完成训练;在 NYUv2、KITTI、ETH3D、ScanNet、DIODE 五个数据集的零样本仿射不变深度评测上全面超过同等数据量的最新扩散方法(Lotus-2、FE2E、PPD、DepthMaster);在边缘敏感的 SEE 指标上击败专攻细节、却需更复杂推理的 PPD 与 InfiniDepth;同时保持 VAE 框架的效率优势(单步推理、高分辨率可行)。同一套配方还要能直接迁移到表面法线、度量深度补全、透视深度、反照率估计等稠密回归任务并全部达到 SOTA,证明这是通用协议而非深度任务特调。
与已有工作不同的是,本文的独特切入有三点。其一,把图像编辑范式引入深度估计:Marigold V1 系列基于文生图模型加噪去噪,本文直接用编辑模型把 RGB 潜变量变换成深度潜变量,配合固定时间步的修正流参数化,天然适配单步推理,且编辑模型预训练时见过大量图像到图像的成对变换。其二,表示对齐的非常规用法:此前 REPA 在深度估计中的变体(DepthMaster 用 DINOv2 对齐输入 RGB,PPD 经 Semantics-Prompted DiT 注入语义表征)都以输入图像为特征来源,本文改为对真值深度图提取冻结 DINOv3 特征作为对齐目标,为几何重建提供更直接的教师信号,且不引入推理时依赖。其三,把最优传输引入稠密回归监督:针对透明、细小结构的真值歧义,放弃严格逐像素对齐,在 5×5 图块内用 Sinkhorn 软匹配,只要求预测值集合与真值集合一致。作者明确指出:现有方法要么只顾细节(PPD 在像素空间扩散但细粒度细节仍丢),要么只顾聚合精度,没有方法能在单步 VAE 框架内同时解决细节保持与噪声真值下的鲁棒监督。
核心方法
直觉上,Marigold V2 把深度估计当作一次图像编辑:让预训练编辑模型学会把 RGB 图像的潜变量直接翻译成归一化深度图的潜变量,一次前向完成,不再迭代采样。技术路线分两阶段(Fig. 2)。Stage 1 只训练轻量参数:将 Qwen-Image-Edit-2509 的 DiT 权重 4-bit 量化冻结,训练 rank-128 QLoRA 适配器;用固定 $t=0.5$ 的修正流把潜在监督退化为直接回归损失 $\mathcal{L}_{\text{latent}}$,并叠加像素 L1 损失 $\mathcal{L}_{\text{pix}}$、梯度损失 $\mathcal{L}_{\text{grad}}$ 与 iREPA-depth 正则(以真值深度图的 DINOv3 特征为对齐目标),得到全局结构准确的强基线。Stage 2 在此基础上解冻 VAE 解码器,加入新提出的 SinkLoss 续训 3 万步,专门锐化边缘细节、削弱噪声真值的不良影响并压低飞行像素。推理时模型只需 VAE 编码、DiT 单步预测、VAE 解码各一次前向,无多步采样或外部依赖。
核心创新有两个。第一是 iREPA-depth:表示对齐的目标从业界惯例的输入 RGB 语义特征,换成真值深度图经冻结 DINOv3 提取的特征。深度域特征与几何重建更相关,能更有效把语义结构注入预测:30K 步消融中 iREPA-depth 全面优于 iREPA-RGB(DIODE AbsRel 5.55 对 5.72)与 LPIPS 损失,且显著加速收敛——这对预算受限的小规模训练价值极大。第二是 SinkLoss:在 $K\times K$($K=5$)图块内,对 $K^2$ 个预测与 $K^2$ 个真值深度构建代价矩阵 $C_{ij}=|\hat{d}_i-d_j|$,经熵正则最优传输求软一对一指派,损失为归一化传输代价 $\mathcal{L}=\sum m_im_jM_{ij}C_{ij}/\sum m_im_jM_{ij}$,无效像素以 $B=10^6$ 罚值屏蔽。它与逐像素损失的本质区别:不再强迫每个像素复现真值的确切位置,只要求图块内预测集合与真值集合一致(至多差一个置换)——真值噪声不再被学进模型,边缘像素可自由归属更吻合的一侧,同时保住细结构与干净边界。
方法步骤详情
流程分四步。①目标构造:度量深度 $D$ 转为仿射不变对数深度 $d=2\frac{\log(D+\epsilon)-d_2}{d_{98}-d_2}-1$,按 2%/98% 分位裁剪到 $[-1,1]$、复制成灰度三通道图,与输入分别过 VAE 得 $z_I$、$z_d$。②Stage 1:固定 $t=0.5$ 回归速度场 $\mathcal{L}_{\text{latent}}=\|f_\theta(z_I,t)-(z_I-z_d)\|_2^2$,叠加像素 L1、梯度损失与 iREPA-depth 对齐,权重 1.0/1.0/5.0/0.2,batch size 1,训 16 万步约 5 天。③Stage 2:解冻 VAE 解码器,加 SinkLoss($K=5$、$\tau=0.1$、$B=10^6$),续训 3 万步约 1 天。④推理:单次前向 $\hat{z}_d=z_I-f_\theta(z_I,t)$,解码得 $\hat{d}=D_{\text{vae}}(\hat{z}_d)$。
技术新颖性
技术新颖性体现在三处。其一,监督信号的组合方式:此前扩散深度估计器(Marigold V1、Lotus、GenPercept)几乎只在潜在空间监督,本文首次在同一框架内叠加潜在回归、像素 L1、空间梯度与语义表征对齐四类损失,并用受控消融(Table 3)证明各自贡献:像素损失对 AbsRel 影响有限但一致提升 δ1,iREPA-depth 增益最大。其二,iREPA 的深度域对齐是概念上的小改动但效果显著——把对齐教师从 RGB 域换成真值深度域,等于把语义教师换成几何教师,且不增加推理成本,修正了 REPA 系文献默认对齐输入特征的惯性做法。其三,SinkLoss 把离散最优传输这一经典匹配工具引入稠密回归监督:与检测/分割中的 Hungarian 硬匹配不同,它用熵正则软化指派、保持可微、只在图块内运算,兼顾抗真值噪声与边缘锐度;跨骨干实验(Table 5)证明收益来自配方而非 Qwen 特性(SD V1.5 的 SEE3 0.553→0.485,FLUX.2 klein 0.491→0.377)。总体上论文贡献是协议级的:一套可复制、可迁移的低成本配方。
实验结果
零样本深度(Table 1):仅 7.4 万训练图即领先,AbsRel/δ1 为 NYUv2 3.6/98.0、KITTI 5.4/97.4、ETH3D 2.8/99.2、ScanNet 3.7/97.9、DIODE 5.2/97.1;对最强可比基线 FE2E,KITTI、ETH3D 改善 17%/26%,甚至超过 900 万图的 π3。边缘质量(Table 2):SEE3 0.352 优于 PPD 0.404、InfiniDepth 0.470。消融(Table 3/4):iREPA-depth 胜过 iREPA-RGB 与 LPIPS;对数深度 4.72 优于线性 5.04、视差 5.28。SinkLoss 跨骨干奏效(Table 5)。效率(Table 6):1024² 1.9 秒/16.9GB;2048² 9.6 秒/29.3GB 仍可行,对手均 OOM。下游:深度补全四基准 RMSE 全最低(0.122/0.189);透视深度 AbsRel 13.66→8.17;法线 Sintel 28.7 最佳;反照率 PSNR 20.78/LPIPS 0.195 双最佳。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 零样本仿射不变深度(ETH3D) | AbsRel (↓) | 2.8 | 3.8(FE2E, CVPR 2026,7.1万训练图) | 相对降低约 26% |
| 零样本仿射不变深度(KITTI) | AbsRel (↓) | 5.4 | 6.5(FE2E, CVPR 2026) | 相对降低约 17% |
| 边缘保持质量(HyperSim 测试集) | SEE3 (↓) | 0.352 | 0.404(PPD, NeurIPS 2025) | 相对降低约 13% |
| 零样本表面法线(Sintel 户外) | MeanErr (↓) | 28.7° | 30.3°(Lotus-2) | 降低 1.6°,全场最佳 |
| 零样本度量深度补全(iBims-1,测试时 LoRA + 分块局部适配) | RMSE (↓) | 0.122 | 0.189(Marigold-DC, ICCV 2025) | 相对降低约 35%,四个基准 RMSE 全部最低 |
| 反照率估计(HyperSim 测试集) | PSNR (↑) / LPIPS (↓) | 20.78 / 0.195 | 19.28 / 0.260(IID-in-the-wild, TOG 2024) | PSNR 提高 1.5 dB,LPIPS 降低 25% |
局限与改进
作者在结论中坦承两点:大型图像编辑骨干使模型无法实时运行(1024² 单帧 1.9 秒,比 InfiniDepth 的 0.2 秒慢近十倍);反射、运动、失焦模糊区域仍存在本质歧义,需要不确定性感知或多层深度扩展。我的补充观察:(1)输出仍是仿射不变相对深度,不含度量尺度,获取绝对深度需依赖补全或外部对齐;(2)训练数据全部为合成数据(HyperSim 室内 + vKITTI 驾驶),水下、医学影像等真实域偏移未被验证;(3)SinkLoss 引入 K、τ、B 等超参数与图块划分策略,论文未系统分析其对分辨率和图块尺寸的敏感性;(4)法线任务上 SinkLoss 使平均角误差略升(18.53→18.84),只改善边缘指标 SAEE,说明集合匹配对方向场这类需严格局部一致性的目标未必总是有利;(5)Stage 2 解冻 VAE 解码器后显存达 16.9GB(1024²),部署门槛明显高于 InfiniDepth 的 1.9GB,交互式应用仍然吃力。
独立分析的弱点
第一,推理效率与显存:DiT 骨干庞大且 VAE 解码不轻,1024² 单帧 1.9 秒、16.9GB 显存,难以嵌入实时 AR 或机器人闭环;改进方向是对单步 DiT 做一致性蒸馏或对 VAE 解码器实施更激进量化,把推理压到亚秒级。第二,透明与反光场景的系统性歧义只是被绕开而非解决:SinkLoss 让模型不必复现噪声真值,但模型并不知道自己在哪里不确定,透视深度仍需单独微调才能看穿玻璃;改进方向是输出像素级不确定性图或概率式多层深度分布。第三,训练分布局限:仅用 HyperSim(室内合成)与 vKITTI(驾驶合成),对真实相机噪声、鱼眼畸变、极端光照的泛化缺乏验证;可小比例混合真实数据或施加域随机化。第四,SinkLoss 图块粒度固定为 5×5,对发丝级极细结构或大面积均匀平面都未必最优;自适应图块尺寸或多尺度 Sinkhorn 匹配可能进一步受益。第五,评测依赖 RANSAC 仿射对齐协议,单图内深度阶跃剧烈时对齐质量会影响结论稳健性,建议补充跨尺度一致性评测;反照率实验只在合成 HyperSim 上评测,真实场景泛化仍是未知数。
未来方向
作者明确提出两个方向:一是引入不确定性感知或多层深度扩展,处理反射、运动、失焦模糊等歧义区域;二是把配方继续推广到更多稠密模态(已示范深度补全、透视深度、法线、反照率)。基于本文成果可延伸的研究包括:(1)把 SinkLoss 推广到视频深度、光流等时序任务,利用其抗噪声真值特性处理动态遮挡与运动模糊;(2)把 iREPA-depth 的教师域思想推广到其他几何任务(相机位姿、3D 高斯重建)——用任务专属的真值域特征替代惯用的 RGB 特征;(3)将单步 DiT 深度模型与指令编辑范式结合,实现指令驱动的几何编辑与可控生成;(4)探索量化感知训练与更低比特(2-bit)适配,把训练门槛压到 16GB 显存级,覆盖更广泛的个人研究者;(5)把 Marigold V2 作为几何先验嵌入 3D 重建与新型视图合成管线,定量评估其对 bokeh、重光照、物体重插入等下游图形学任务的实际收益。
复现评估
复现门槛极低,这是本文最大卖点之一。模型基于完全开源的 Qwen-Image-Edit-2509,DINOv3 公开,训练数据 HyperSim 与 vKITTI 均可下载;官方项目页面为 hf.co/spaces/huawei-bayerlab/marigold-v2-web,论文给出几乎全部关键超参数:4-bit QLoRA rank-128、batch size 1、损失权重 1.0/1.0/5.0/0.2、SinkLoss 参数(K=5、τ=0.1、B=10⁶、5 次迭代)、Stage 1 训 16 万步约 5 天、Stage 2 续训 3 万步约 1 天,全部在单张 32GB GPU 上完成;每个消融约 1 天(3 万步)。深度补全的测试时适配描述详尽:零初始化 rank-16 LoRA 挂在最后 12 层、学习率 10⁻³ 与 3×10⁻²、100 步 Adam、约 21.2M 可训练参数。不确定点:权重与训练代码的完整开源程度需到项目页确认;评测需复现 PPD 的 RANSAC 对齐协议。总体评级中低难度,一张 32GB 显卡约一周即可复现主结果。
论文图表
首图展示 Marigold V2 的核心卖点:在单张 32GB GPU 上不到一周,把开源图像编辑扩散 Transformer(Qwen-Image-Edit)改造成最先进的单目深度估计器。右侧定性对比显示本方法忠实复现锐利边缘、毛发和发丝级细节,超越细节导向的 Pixel-Perfect Depth(PPD)与 InfiniDepth,同时保留 VAE 模型的效率。
一张图概括论文的全部定位:便宜(单卡一周)、好用(细节 SOTA)、高效(单步 VAE 推理),是理解论文动机与卖点的入口。
展示 HyperSim 数据集的一个局部裁剪:细结构在 RGB 中呈半透明,其深度真值因渲染管线(V-Ray 准蒙特卡洛采样)内部的随机采样而定义不良——透明或边缘像素随机地被赋前景或背景深度。
这是 SinkLoss 动机的直接证据:说明逐像素严格监督在透明/细小结构上本质是让模型拟合噪声,从而引出集合匹配式的容错监督设计。