← 返回 2026-09-09

TransNormal-2:几何接地的整流流与边缘感知解码的精准法线估计 TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation

Mingwei Li, Yi Yang, Hehe Fan 📅 2026-09-06 👍 19 2026-09-12 18:30
LoRA微调 VAE重建退化 单目几何估计 整流流 法线估计 潜在扩散模型 透明物体感知

量化VAE重建退化,用像素空间几何损失与GRM后解码修正实现单步精准法线估计

前置知识

VAE与8×潜在压缩

变分自编码器(VAE)把图像压缩到低分辨率潜在空间(如 $H\times W \to \tfrac{H}{8}\times\tfrac{W}{8}$),潜在扩散模型在latent上去噪、解码器负责重建像素。8倍压缩下一个latent格点对应一个 $8\times8$ 像素块,块内的剧烈变化无法被latent编码,只能靠解码器的学习先验补全。

本文的核心论点:法线在物体边界的突变被这种压缩平均掉,即使把ground-truth法线直接编码再解码也会损失1.3°–8.5°的平均角误差,边缘区达全局的2.82倍,这是全文要解决的根本问题。

Rectified Flow与单步推理

Rectified flow(流匹配)用近似直线的概率路径训练生成模型,学习速度场把噪声拉向数据分布;由于路径直,推理可以少步甚至单步完成。本文进一步把整个DiT'重用途'为确定性单步预测器:固定时间步 $t=1$、空文本提示,一次前向直接输出法线latent,不做任何迭代采样。

理解TransNormal-2的推理形态(单步、确定性)与其效率优势,以及它继承自E2E-FT/Lotus这条'diffusion单步密集预测'研究线的定位。

DiT与MM-DiT(FLUX.2)

Diffusion Transformer(DiT)用transformer替换U-Net作为扩散骨干;MM-DiT让图像token与文本token在double-stream块中各自保留独立权重、通过联合注意力交互,再经single-stream块融合。FLUX.2[klein]是9B参数的rectified-flow MM-DiT,自带8×压缩VAE。

这是本文的骨干网络。图像token的patchify/unpatchify机制解释了LCM(修patch接缝)的由来,double/single-stream结构说明了LoRA适配的对象。

LoRA低秩适配

LoRA冻结预训练权重,只训练低秩增量 $\Delta W = BA$($B\in\mathbb{R}^{d\times r}, A\in\mathbb{R}^{r\times k}$),以远小于全量的参数微调大模型。本文取 $r=256, \alpha=256$,可训练参数约700M,其余90亿参数全部冻结。

训练策略的核心组件;Table 6的rank消融(64/128/256/512)显示256是最优甜点,rank 512参数翻倍却无收益,是理解模型容量分析的关键。

von Mises-Fisher(vMF)分布

vMF分布是单位球面 $S^2$ 上方向数据的典型概率模型,类似高斯的方向版,浓度参数 $\kappa$ 控制围绕均值方向的集中程度。若把每个预测法线视为vMF均值方向,其负对数似然(去掉常数)等价于最大化 $\hat{n}^\top n^* = \cos\theta$,即直接缩小预测与真值的测地角 $\theta$。

vMF角损失是本文像素空间监督之一,针对'latent MSE比较的是VAE编码、永远看不到法线方向'这一盲区,把监督搬到球面几何上。

Lambertian反射与逆渲染

Lambertian(漫反射)模型假设像素阴影亮度与 $\max(0, n(p)^\top \ell)$ 成正比,即法线与光照方向夹角的余弦。逆渲染是反问题:由观测图像推断几何与光照。本文用最小二乘从预测法线和灰度图估计光照向量 $\hat{\ell}$(梯度detach),再渲染阴影 $\hat{S}$ 并最小化 $\mathcal{L}_{render} = 1 - \text{NCC}(\hat{S}, I_{gray})$。

这是逆渲染自洽损失的理论基础:正确法线应当能解释漫反射区域的观测阴影,从而从输入图像本身导出弱几何约束,NCC的尺度/平移不变性使其对未知反照率鲁棒。

Haar小波分解与边缘感知

Haar小波把图像分解为低频子带 $LL$ 和高频子带 $HF=[LH;HL;HH]$,高频子带集中编码边缘与细节。配合由ground-truth法线梯度导出的边缘mask $M_{edge}$,可以把高频监督限制在物体边界处。

小波边缘感知损失直接针对VAE退化的空间分布——边界处高频法线变化被8×瓶颈抹掉,因此把高频重建监督聚焦到边界正是对症下药。

法线估计评价指标

平均角误差(MAE/Mean,越小越好)度量预测法线与真值的平均夹角;11.25°与30°阈值指标统计角误差小于该阈值的像素百分比(越大越好);边缘/全局比率把Canny边缘(3×3膨胀)附近的MAE与全图MAE对比,用于刻画误差是否集中在边界。

读懂数据必需:论文用'Edge/Global MAE达1.26–2.82×'证明VAE误差的边界局部化,用这些指标在NYUv2、ScanNet、iBims、Sintel、ClearGrasp、TN-Syn、ClearPose七个基准上对比。

研究动机

基于VAE的潜在扩散几何方法(Marigold、Lotus、E2E-FT、Lotus-2等)共享一个长期被忽视的系统性误差源:VAE重建退化。VAE编解码器将图像空间压缩8倍($H\times W \to \tfrac{H}{8}\times\tfrac{W}{8}$),这对平滑的颜色渐变无害,却会在法线突变的物体边界把高频几何细节平均掉。作者用一个受控诊断实验量化其规模:把ground-truth法线图直接经FLUX.2 VAE编码再解码,就会引入1.3°–8.5°的平均角误差(MAE)——ClearGrasp 1.29°、NYUv2 1.81°、ScanNet 2.45°、iBims高达8.50°;且误差在空间上高度集中,边缘区域MAE达到全局的1.26–2.82倍(ClearGrasp边缘3.64°,iBims边缘14.61°)。由于该误差由encode-decode路径本身引入,潜在空间的MSE训练目标完全'看不见'它,再好的latent预测也无法消除;而在透明物体等边界精度至关重要的场景,折射与反射外观进一步放大了这一瓶颈的危害。

本文的目标是本文的目标是:在保留大规模预训练生成先验(FLUX.2 9B MM-DiT)所含几何知识的同时,系统性消除VAE解码造成的边界局部化法线误差,并在极少监督数据下达到SOTA。具体分解为三点:其一,把VAE重建退化从'隐性噪声'变成可测量、可归因的量化结论,为后续修正提供依据;其二,重新设计训练目标,让潜在预测'为解码后的像素级法线质量负责',而不是只拟合VAE编码;其三,构建一个推理时仍保持单步确定性前向的后处理模块,用绕过潜在瓶颈的全分辨率RGB证据修复残余边界误差。量化目标是在仅122K合成标注(约为MoGe-2的8.9M样本的1.4%)条件下,于四个通用场景基准上匹配或超越MoGe-2的全部八项指标,并在ClearGrasp、ClearPose等透明物体基准上大幅刷新此前最佳成绩。

与已有工作不同的是,既有应对路线各有局限:Pixel-Perfect Depth干脆绕过VAE在像素空间做扩散以消除'飞行像素',但计算昂贵;NormalCrafter在latent预测之后做像素空间微调;VA-VAE/VIVAT/DC-AE从VAE架构侧改良,改动大且未针对几何任务量化收益;SharpDepth用昂贵的迭代score distillation锐化深度边界。本文的独特切入是'先量化、再两侧夹击':作者首次系统测量了法线任务上的VAE退化(GT法线往返即损失1.3°–8.5°),并给出一维边界模型 $E_{edge} = \|\Delta n\|_2 \int |F_\sigma(x) - \mathbb{1}[x\ge 0]|\,dx \propto \|\Delta n\|_2\,\sigma$,解释误差为何恰好局限在宽度为 $\sigma$ 的边界带。随后不改动VAE架构,而是从两端同时施策——训练时监督解码后的像素空间结果、推理时用绕过瓶颈的RGB证据做后解码修正——把问题切分为'latent能编码的'与'latent必然丢失的'分别处理。这种测量驱动的、保留标准VAE的轻量修正路线在法线估计领域是首次。

核心方法

直觉上,8×潜在网格丢掉的边界细节无法从latent侧恢复,必须引入绕过瓶颈的像素级证据。技术路线分三段:编码段,冻结的FLUX.2 VAE把RGB编码为 $z_{rgb}=E_{vae}(I)$ 并patchify为图像token,配空提示条件token $c$;预测段,LoRA($r=256$)适配的9B rectified-flow DiT在固定时间步 $t=1$ 单步直接输出法线latent $\hat{z}_n = f_\theta(z_{rgb}, t, c)$,无迭代采样;解码与修正段,latent先经轻量LCM修复patchification接缝($\bar{z}_n=\text{LCM}_\psi(\hat{z}_n)$),再由冻结VAE解码出粗法线 $\hat{N}=D_{vae}(\bar{z}_n)$,随后几何修正模块GRM(约0.4M参数)以RGB引导锚点 $N_{anc}$ 为基准做门控残差修正 $\tilde{N} = \text{normalize}(N_{anc} + g_\phi \odot s\, R_\phi)$,其中 $g_\phi\in(0,1)$ 为逐像素置信门、$s$ 为全局残差尺度。训练分两阶段:Phase 1联合训练DiT LoRA与LCM,像素空间损失穿过冻结VAE解码器反传;Phase 2冻结核心预测器,单独训练GRM。

核心创新有三层。问题层面:首次把'VAE重建退化'确立为潜在扩散几何方法的公共误差源并定量刻画——GT法线经VAE往返即损失1.3°–8.5° MAE、边缘达全局2.82倍,并用一维边界模型证明误差 $\propto \|\Delta n\|_2\,\sigma$ 只集中在法线跳变处,法线图因在每个折痕处跳变而比深度图更脆弱。监督层面:把监督从latent MSE搬到解码后的像素空间,本质区别是让优化'看见'法线的几何属性——vMF损失在球面上直接最小化测地角($\hat{n}^\top n^*=\cos\theta$),latent MSE永远看不到方向;小波损失把高频监督用边缘mask聚焦到退化最重的边界;逆渲染损失 $\mathcal{L}_{render}=1-\text{NCC}(\hat{S}, I_{gray})$ 从漫反射阴影导出弱几何约束。修正层面:GRM以gated残差约束修正幅度而非自由改写,并采用'冻结核心预测器后解耦训练'——消融显示联合训练反而劣化0.7–1.3°,证明细化模块的梯度泄漏会破坏已收敛的transformer。

方法步骤详情

①编码:冻结VAE编码RGB得 $z_{rgb}$,patchify为图像token,空提示产生条件token。②单步预测:token流经LoRA适配的double/single-stream块,unpatchify输出法线latent $\hat{z}_n$,时间步固定为1。③latent修正:$\bar{z}_n=\text{LCM}_\psi(\hat{z}_n)$ 修复patch接缝。④解码:$\hat{N}=D_{vae}(\bar{z}_n)$ 得粗法线。⑤GRM修正:不透明域用RGB引导滤波(rGF=4)构造无参数anchor $N_{anc}$,透明域(标志 $\mathbb{1}_T$,训练取自数据集、评测按基准设定)因折射使RGB边不可靠而直接用粗法线;从拼接 $[\hat{N}, N_{anc}, I, \mathbb{1}_T]$ 预测逐像素门 $g_\phi$ 与残差,L2归一化输出。⑥Phase 1(35K步,8×A100 80GB,batch 32):总损失为latent MSE $\mathcal{L}_{normal}=\|\bar{z}_n-z_n\|_2^2$ 加小波边缘、vMF角损失($-\frac{\kappa}{|\Omega|}\sum_p \hat{n}(p)^\top n^*(p)$)与逆渲染损失三项;数据按35:15:45:5采样ClearGrasp(45,454)/TN-Syn(3,555)/Hypersim(39,648)/VKITTI(33,580),分阶段调度:先通用预热、再加透明数据、最后启用渲染损失;光照 $\hat{\ell}$ 用梯度detach的最小二乘估计,形成EM式交替优化。⑦Phase 2:冻结transformer与LCM,GRM先经base子阶段学残差,再经calibration子阶段对anchor误差超过阈值 $\tau_g$ 的hard pixel校准门控。

技术新颖性

技术新颖性可从四组对照看。对Pixel-Perfect Depth(绕开VAE做像素空间扩散):本文保留标准VAE,用测量驱动的事后修正替代昂贵的像素空间生成,推理仍是单次前向,便宜且即插即用。对SharpDepth(迭代score distillation锐化边界):GRM是一次前向的gated残差,仅约0.4M参数,Table 7显示其平均误差10.6°优于最佳经典引导滤波器的11.0°,且在NYUv2/ScanNet/CG-Syn/TN-Syn每个数据集上都最好。对前作TransNormal(SD 2.0 U-Net 865M全微调):本作升级为FLUX.2 9B DiT + LoRA,新增vMF与逆渲染损失及GRM,所有基准全面领先(零样本ClearPose 25.5°→19.1°)。对常规端到端细化:'解耦训练'是关键设计——Table 4显示联合训练GRM(16.0°)反而明显差于解耦GRM(14.7°),证明细化模块经VAE解码器的梯度泄漏会扰动已收敛的DiT;这个'先冻结、再拟合残差、最后校准门控'的协议本身即可迁移到其他细化任务。此外,把vMF负对数似然、Haar小波频带选择与NCC逆渲染组合成系统的'解码后监督'配方,在法线任务上也属首次。

Overview of the TransNormal-2 framework
Fig. 3: Overview of the TransNormal-2 framework
Geometry-aware pixel-space losses
Fig. 4: Geometry-aware pixel-space losses

实验结果

通用场景(Table 1):TransNormal-2在全部八项指标上匹配或超越MoGe-2,而任务标注仅为122K对8.9M(1.4%)——NYUv2 14.7°/62.5%(MoGe-2:14.7°/62.3%),ScanNet 12.7°/69.2%(12.8°/68.4%),iBims 14.7°/70.6%(14.7°/70.4%),Sintel 29.2°/27.5%(29.3°/24.8%),平均排名1.4对2.3;翻转TTA可进一步提升。透明物体(Table 2):所有指标第一(平均排名1.0)——ClearGrasp MAE 11.3°,较此前最强的Lotus-2(15.5°)降4.2°,30°内94.1%;TN-Syn近饱和(3.6°,30°内99.1%);零样本ClearPose 19.1°,比FE2E(22.2°)低3.1°、比Lotus-2低4.3°。对比前作(Table 3):ClearGrasp −4.8°、ClearPose −6.4°、NYUv2 −1.9°、ScanNet −2.6°。消融(Table 4):NYUv2上MSE基线16.9°→+小波/vMF 16.6°→+渲染损失16.0°→解耦GRM 14.7°,而GRM联合训练只有16.0°;GRM设计对深度/宽度极稳定(Table 5,波动0.03°),去掉RGB引导劣化约1.0°/0.7°;LoRA rank 256为最优点(Table 6)。机制验证:GRM使边缘像素MAE降约2.6°、非边缘仅0.6°–0.8°(Table 8),高频带误差能量降53.2%/42.9%(Fig. 8),证明修正精准对准VAE退化模式。

Quantitative comparison on transparent object normal estimation
Table 2: Quantitative comparison on transparent object normal estimation
TransNormal vs. TransNormal-2: Key differences and head-to-head mean angular error
Table 3: TransNormal vs. TransNormal-2: Key differences and head-to-head mean angular error
Ablation on key design choices
Table 4: Ablation on key design choices
GRM design ablation
Table 5: GRM design ablation
LoRA rank ablation
Table 6: LoRA rank ablation
Learned GRM vs. classical image-guided filters
Table 7: Learned GRM vs. classical image-guided filters
Edge vs. non-edge MAE analysis
Table 8: Edge vs. non-edge MAE analysis
In-the-wild qualitative results on surface normal estimation
Fig. 1: In-the-wild qualitative results on surface normal estimation
Qualitative results on unlabeled in-the-wild general objects
Fig. 5: Qualitative results on unlabeled in-the-wild general objects
Qualitative comparison on transparent object normal estimation
Fig. 6: Qualitative comparison on transparent object normal estimation
Frequency-wise ratio of angular-error PSD after and before GRM refinement
Fig. 8: Frequency-wise ratio of angular-error PSD after and before GRM refinement
查看结构化数据
任务指标本文基线提升
通用场景法线估计(NYUv2) MAE(↓) / 11.25°内像素(↑) 14.7° / 62.5% MoGe-2:14.7° / 62.3%(8.9M训练样本) MAE持平,11.25°精度+0.2个百分点,训练数据仅为其1.4%
通用场景法线估计(ScanNet) MAE(↓) / 11.25°(↑) 12.7° / 69.2% MoGe-2:12.8° / 68.4% MAE −0.1°,11.25°精度+0.8个百分点
通用场景法线估计(iBims) MAE(↓) / 11.25°(↑) 14.7° / 70.6% MoGe-2:14.7° / 70.4% MAE持平,11.25°精度+0.2个百分点
通用场景法线估计(Sintel) MAE(↓) / 11.25°(↑) 29.2° / 27.5% MoGe-2:29.3° / 24.8% MAE −0.1°,11.25°精度+2.7个百分点
透明物体法线估计(ClearGrasp,合成) MAE(↓) / 30°(↑) 11.3° / 94.1% Lotus-2:15.5° / 87.4% MAE −4.2°,30°精度+6.7个百分点
透明物体法线估计(ClearPose,真实,零样本) MAE(↓) / 11.25°(↑) 19.1° / 52.3% FE2E:22.2°(MAE最强基线);Lotus-2:43.0%(11.25°) MAE −3.1°(相对Lotus-2为−4.3°)
透明物体法线估计(TN-Syn) MAE(↓) / 30°(↑) 3.6° / 99.1% TransNormal(前作):3.9° / 98.3% MAE −0.3°,基准已近饱和

局限与改进

作者承认的局限有二:逆渲染损失假设漫反射Lambertian成像,折射与强镜面反射只被弱建模——而透明物体正是折射成像,意味着 $\mathcal{L}_{render}$ 在其主打的透明场景中作用有限,其收益主要在漫反射的通用室内场景;GRM只能修复边界附近的细尺度结构,核心预测器大面积预测错误时无法补救。我的补充观察:其一,域标志 $\mathbb{1}_T$ 训练时取自数据集、评测时按基准人工设定,真实部署需要额外的透明域判别,否则anchor选择策略无从执行;其二,GRM依赖'RGB边缘≈几何不连续'的假设,作者自己在5.8节承认折射表面RGB边不可靠,故只在不透明场景用它做机制诊断;其三,8×压缩瓶颈本身没有消除——GT法线仍有1.3°–8.5°的固有误差地板(iBims高达8.5°),从MSE-only到14.7°的提升中GRM只贡献约1.3°,其余来自损失设计,问题仅部分解决;其四,训练全用合成数据,ClearPose虽为零样本但仍是桌面级受控场景,户外强光、多层玻璃等复杂折射未见验证;其五,9B骨干的推理成本远高于DSINE等判别式模型。

独立分析的弱点

独立分析的弱点及改进方向:①域标志 $\mathbb{1}_T$ 依赖人工指定——可训练一个轻量材质/透明度判别器自动输出,或将anchor策略做成软混合(按透明概率加权两种anchor),消除部署时的域假设。②Lambertian假设在高光与折射表面失效——可引入材质感知渲染(如分裂求和BRDF、环境光遮蔽),或仅在检测为漫反射的区域激活渲染损失,让约束与成像物理匹配。③GRM对大面积错误无补救能力——可引入不确定性引导的多尺度细化,或让GRM迭代2–3次并携带置信图,把'边界修补'扩展为'区域级修正'。④NCC度量对阴影与反照率的混淆仍敏感——可先用本征图像分解估计反照率再渲染阴影,或对镜面区域用高光先验建模。⑤合成到真实的域差距集中在真实材质(磨砂玻璃、水渍、灰尘)——可加入少量真实标注或更强的域随机化渲染。⑥8×VAE地板未变——可试验tile化解码、更高分辨率latent或DC-AE类高压缩VAE做对照,检验'压缩率-边界误差'关系的普适性,并可能进一步压低iBims那样8.5°的高误差域。⑦9B模型推理成本高——可探索蒸馏到1B级骨干,验证GRM范式对更小模型的增益是否保持。

未来方向

作者明确提出的方向:材质感知的渲染约束(超越Lambertian、覆盖镜面与折射成像);构建更大规模、精心标注的法线训练集以突破122K合成数据的上限;以及设计更高分辨率的潜在空间,从源头缓解8×压缩带来的几何监督损失。基于本文成果可自然延伸的研究:把'VAE退化测量+GRM后解码修正'范式移植到深度、边缘、材质等其他密集预测任务,检验边界局部化误差是否为VAE管线的普遍模式;与像素空间扩散(Pixel-Perfect Depth)和高压缩VAE(DC-AE)做系统性正交对比,绘制'压缩率-边界误差-算力'三者的权衡图谱;让GRM在端到端训练中用梯度投影或stop-gradient选择性抑制泄漏,弥合联合训练(16.0°)与解耦训练(14.7°)的差距;结合视频扩散先验引入时序一致的法线估计(如NormalCrafter路线);在机器人抓取等下游任务上量化边界法线精度提升(ClearGrasp −4.2°)对操作成功率的实际收益。

复现评估

复现条件较好但门槛不低。开源方面:论文承诺代码将在项目页(longxiang-ai.github.io/TransNormal-2)发布;骨干FLUX.2[klein]为公开模型;训练数据全部公开——ClearGrasp 45,454样本、TN-Syn 3,555训练样本、Hypersim 39,648样本(576×768)、Virtual KITTI 33,580样本(352×1216);七个评测基准(NYUv2、ScanNet、iBims-1、Sintel、ClearGrasp、TN-Syn、ClearPose)均为标准数据集。算力方面:需8张A100 80GB、总batch 32、Phase 1约35K步,另加Phase 2的GRM两子阶段训练;可训练参数约700M(LoRA r=256)+0.4M GRM,推理为单次前向(另有2×翻转TTA选项)。细节方面:损失系数、LCM/GRM结构、子阶段schedule与推理设置都在补充材料。难点在于两阶段+两子阶段协议、分阶段数据调度与NCC光照估计的实现环节较多,任何一环偏差都会影响精度;但指标基于公开benchmark、可逐项核对,属于中高难度、有单机多卡条件的实验室可尝试的复现工作。