TransNormal-2:几何接地的整流流与边缘感知解码的精准法线估计 TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation
量化VAE重建退化,用像素空间几何损失与GRM后解码修正实现单步精准法线估计
前置知识
VAE与8×潜在压缩
变分自编码器(VAE)把图像压缩到低分辨率潜在空间(如 $H\times W \to \tfrac{H}{8}\times\tfrac{W}{8}$),潜在扩散模型在latent上去噪、解码器负责重建像素。8倍压缩下一个latent格点对应一个 $8\times8$ 像素块,块内的剧烈变化无法被latent编码,只能靠解码器的学习先验补全。
本文的核心论点:法线在物体边界的突变被这种压缩平均掉,即使把ground-truth法线直接编码再解码也会损失1.3°–8.5°的平均角误差,边缘区达全局的2.82倍,这是全文要解决的根本问题。
Rectified Flow与单步推理
Rectified flow(流匹配)用近似直线的概率路径训练生成模型,学习速度场把噪声拉向数据分布;由于路径直,推理可以少步甚至单步完成。本文进一步把整个DiT'重用途'为确定性单步预测器:固定时间步 $t=1$、空文本提示,一次前向直接输出法线latent,不做任何迭代采样。
理解TransNormal-2的推理形态(单步、确定性)与其效率优势,以及它继承自E2E-FT/Lotus这条'diffusion单步密集预测'研究线的定位。
DiT与MM-DiT(FLUX.2)
Diffusion Transformer(DiT)用transformer替换U-Net作为扩散骨干;MM-DiT让图像token与文本token在double-stream块中各自保留独立权重、通过联合注意力交互,再经single-stream块融合。FLUX.2[klein]是9B参数的rectified-flow MM-DiT,自带8×压缩VAE。
这是本文的骨干网络。图像token的patchify/unpatchify机制解释了LCM(修patch接缝)的由来,double/single-stream结构说明了LoRA适配的对象。
LoRA低秩适配
LoRA冻结预训练权重,只训练低秩增量 $\Delta W = BA$($B\in\mathbb{R}^{d\times r}, A\in\mathbb{R}^{r\times k}$),以远小于全量的参数微调大模型。本文取 $r=256, \alpha=256$,可训练参数约700M,其余90亿参数全部冻结。
训练策略的核心组件;Table 6的rank消融(64/128/256/512)显示256是最优甜点,rank 512参数翻倍却无收益,是理解模型容量分析的关键。
von Mises-Fisher(vMF)分布
vMF分布是单位球面 $S^2$ 上方向数据的典型概率模型,类似高斯的方向版,浓度参数 $\kappa$ 控制围绕均值方向的集中程度。若把每个预测法线视为vMF均值方向,其负对数似然(去掉常数)等价于最大化 $\hat{n}^\top n^* = \cos\theta$,即直接缩小预测与真值的测地角 $\theta$。
vMF角损失是本文像素空间监督之一,针对'latent MSE比较的是VAE编码、永远看不到法线方向'这一盲区,把监督搬到球面几何上。
Lambertian反射与逆渲染
Lambertian(漫反射)模型假设像素阴影亮度与 $\max(0, n(p)^\top \ell)$ 成正比,即法线与光照方向夹角的余弦。逆渲染是反问题:由观测图像推断几何与光照。本文用最小二乘从预测法线和灰度图估计光照向量 $\hat{\ell}$(梯度detach),再渲染阴影 $\hat{S}$ 并最小化 $\mathcal{L}_{render} = 1 - \text{NCC}(\hat{S}, I_{gray})$。
这是逆渲染自洽损失的理论基础:正确法线应当能解释漫反射区域的观测阴影,从而从输入图像本身导出弱几何约束,NCC的尺度/平移不变性使其对未知反照率鲁棒。
Haar小波分解与边缘感知
Haar小波把图像分解为低频子带 $LL$ 和高频子带 $HF=[LH;HL;HH]$,高频子带集中编码边缘与细节。配合由ground-truth法线梯度导出的边缘mask $M_{edge}$,可以把高频监督限制在物体边界处。
小波边缘感知损失直接针对VAE退化的空间分布——边界处高频法线变化被8×瓶颈抹掉,因此把高频重建监督聚焦到边界正是对症下药。
法线估计评价指标
平均角误差(MAE/Mean,越小越好)度量预测法线与真值的平均夹角;11.25°与30°阈值指标统计角误差小于该阈值的像素百分比(越大越好);边缘/全局比率把Canny边缘(3×3膨胀)附近的MAE与全图MAE对比,用于刻画误差是否集中在边界。
读懂数据必需:论文用'Edge/Global MAE达1.26–2.82×'证明VAE误差的边界局部化,用这些指标在NYUv2、ScanNet、iBims、Sintel、ClearGrasp、TN-Syn、ClearPose七个基准上对比。
研究动机
基于VAE的潜在扩散几何方法(Marigold、Lotus、E2E-FT、Lotus-2等)共享一个长期被忽视的系统性误差源:VAE重建退化。VAE编解码器将图像空间压缩8倍($H\times W \to \tfrac{H}{8}\times\tfrac{W}{8}$),这对平滑的颜色渐变无害,却会在法线突变的物体边界把高频几何细节平均掉。作者用一个受控诊断实验量化其规模:把ground-truth法线图直接经FLUX.2 VAE编码再解码,就会引入1.3°–8.5°的平均角误差(MAE)——ClearGrasp 1.29°、NYUv2 1.81°、ScanNet 2.45°、iBims高达8.50°;且误差在空间上高度集中,边缘区域MAE达到全局的1.26–2.82倍(ClearGrasp边缘3.64°,iBims边缘14.61°)。由于该误差由encode-decode路径本身引入,潜在空间的MSE训练目标完全'看不见'它,再好的latent预测也无法消除;而在透明物体等边界精度至关重要的场景,折射与反射外观进一步放大了这一瓶颈的危害。
本文的目标是本文的目标是:在保留大规模预训练生成先验(FLUX.2 9B MM-DiT)所含几何知识的同时,系统性消除VAE解码造成的边界局部化法线误差,并在极少监督数据下达到SOTA。具体分解为三点:其一,把VAE重建退化从'隐性噪声'变成可测量、可归因的量化结论,为后续修正提供依据;其二,重新设计训练目标,让潜在预测'为解码后的像素级法线质量负责',而不是只拟合VAE编码;其三,构建一个推理时仍保持单步确定性前向的后处理模块,用绕过潜在瓶颈的全分辨率RGB证据修复残余边界误差。量化目标是在仅122K合成标注(约为MoGe-2的8.9M样本的1.4%)条件下,于四个通用场景基准上匹配或超越MoGe-2的全部八项指标,并在ClearGrasp、ClearPose等透明物体基准上大幅刷新此前最佳成绩。
与已有工作不同的是,既有应对路线各有局限:Pixel-Perfect Depth干脆绕过VAE在像素空间做扩散以消除'飞行像素',但计算昂贵;NormalCrafter在latent预测之后做像素空间微调;VA-VAE/VIVAT/DC-AE从VAE架构侧改良,改动大且未针对几何任务量化收益;SharpDepth用昂贵的迭代score distillation锐化深度边界。本文的独特切入是'先量化、再两侧夹击':作者首次系统测量了法线任务上的VAE退化(GT法线往返即损失1.3°–8.5°),并给出一维边界模型 $E_{edge} = \|\Delta n\|_2 \int |F_\sigma(x) - \mathbb{1}[x\ge 0]|\,dx \propto \|\Delta n\|_2\,\sigma$,解释误差为何恰好局限在宽度为 $\sigma$ 的边界带。随后不改动VAE架构,而是从两端同时施策——训练时监督解码后的像素空间结果、推理时用绕过瓶颈的RGB证据做后解码修正——把问题切分为'latent能编码的'与'latent必然丢失的'分别处理。这种测量驱动的、保留标准VAE的轻量修正路线在法线估计领域是首次。
核心方法
直觉上,8×潜在网格丢掉的边界细节无法从latent侧恢复,必须引入绕过瓶颈的像素级证据。技术路线分三段:编码段,冻结的FLUX.2 VAE把RGB编码为 $z_{rgb}=E_{vae}(I)$ 并patchify为图像token,配空提示条件token $c$;预测段,LoRA($r=256$)适配的9B rectified-flow DiT在固定时间步 $t=1$ 单步直接输出法线latent $\hat{z}_n = f_\theta(z_{rgb}, t, c)$,无迭代采样;解码与修正段,latent先经轻量LCM修复patchification接缝($\bar{z}_n=\text{LCM}_\psi(\hat{z}_n)$),再由冻结VAE解码出粗法线 $\hat{N}=D_{vae}(\bar{z}_n)$,随后几何修正模块GRM(约0.4M参数)以RGB引导锚点 $N_{anc}$ 为基准做门控残差修正 $\tilde{N} = \text{normalize}(N_{anc} + g_\phi \odot s\, R_\phi)$,其中 $g_\phi\in(0,1)$ 为逐像素置信门、$s$ 为全局残差尺度。训练分两阶段:Phase 1联合训练DiT LoRA与LCM,像素空间损失穿过冻结VAE解码器反传;Phase 2冻结核心预测器,单独训练GRM。
核心创新有三层。问题层面:首次把'VAE重建退化'确立为潜在扩散几何方法的公共误差源并定量刻画——GT法线经VAE往返即损失1.3°–8.5° MAE、边缘达全局2.82倍,并用一维边界模型证明误差 $\propto \|\Delta n\|_2\,\sigma$ 只集中在法线跳变处,法线图因在每个折痕处跳变而比深度图更脆弱。监督层面:把监督从latent MSE搬到解码后的像素空间,本质区别是让优化'看见'法线的几何属性——vMF损失在球面上直接最小化测地角($\hat{n}^\top n^*=\cos\theta$),latent MSE永远看不到方向;小波损失把高频监督用边缘mask聚焦到退化最重的边界;逆渲染损失 $\mathcal{L}_{render}=1-\text{NCC}(\hat{S}, I_{gray})$ 从漫反射阴影导出弱几何约束。修正层面:GRM以gated残差约束修正幅度而非自由改写,并采用'冻结核心预测器后解耦训练'——消融显示联合训练反而劣化0.7–1.3°,证明细化模块的梯度泄漏会破坏已收敛的transformer。
方法步骤详情
①编码:冻结VAE编码RGB得 $z_{rgb}$,patchify为图像token,空提示产生条件token。②单步预测:token流经LoRA适配的double/single-stream块,unpatchify输出法线latent $\hat{z}_n$,时间步固定为1。③latent修正:$\bar{z}_n=\text{LCM}_\psi(\hat{z}_n)$ 修复patch接缝。④解码:$\hat{N}=D_{vae}(\bar{z}_n)$ 得粗法线。⑤GRM修正:不透明域用RGB引导滤波(rGF=4)构造无参数anchor $N_{anc}$,透明域(标志 $\mathbb{1}_T$,训练取自数据集、评测按基准设定)因折射使RGB边不可靠而直接用粗法线;从拼接 $[\hat{N}, N_{anc}, I, \mathbb{1}_T]$ 预测逐像素门 $g_\phi$ 与残差,L2归一化输出。⑥Phase 1(35K步,8×A100 80GB,batch 32):总损失为latent MSE $\mathcal{L}_{normal}=\|\bar{z}_n-z_n\|_2^2$ 加小波边缘、vMF角损失($-\frac{\kappa}{|\Omega|}\sum_p \hat{n}(p)^\top n^*(p)$)与逆渲染损失三项;数据按35:15:45:5采样ClearGrasp(45,454)/TN-Syn(3,555)/Hypersim(39,648)/VKITTI(33,580),分阶段调度:先通用预热、再加透明数据、最后启用渲染损失;光照 $\hat{\ell}$ 用梯度detach的最小二乘估计,形成EM式交替优化。⑦Phase 2:冻结transformer与LCM,GRM先经base子阶段学残差,再经calibration子阶段对anchor误差超过阈值 $\tau_g$ 的hard pixel校准门控。
技术新颖性
技术新颖性可从四组对照看。对Pixel-Perfect Depth(绕开VAE做像素空间扩散):本文保留标准VAE,用测量驱动的事后修正替代昂贵的像素空间生成,推理仍是单次前向,便宜且即插即用。对SharpDepth(迭代score distillation锐化边界):GRM是一次前向的gated残差,仅约0.4M参数,Table 7显示其平均误差10.6°优于最佳经典引导滤波器的11.0°,且在NYUv2/ScanNet/CG-Syn/TN-Syn每个数据集上都最好。对前作TransNormal(SD 2.0 U-Net 865M全微调):本作升级为FLUX.2 9B DiT + LoRA,新增vMF与逆渲染损失及GRM,所有基准全面领先(零样本ClearPose 25.5°→19.1°)。对常规端到端细化:'解耦训练'是关键设计——Table 4显示联合训练GRM(16.0°)反而明显差于解耦GRM(14.7°),证明细化模块经VAE解码器的梯度泄漏会扰动已收敛的DiT;这个'先冻结、再拟合残差、最后校准门控'的协议本身即可迁移到其他细化任务。此外,把vMF负对数似然、Haar小波频带选择与NCC逆渲染组合成系统的'解码后监督'配方,在法线任务上也属首次。
实验结果
通用场景(Table 1):TransNormal-2在全部八项指标上匹配或超越MoGe-2,而任务标注仅为122K对8.9M(1.4%)——NYUv2 14.7°/62.5%(MoGe-2:14.7°/62.3%),ScanNet 12.7°/69.2%(12.8°/68.4%),iBims 14.7°/70.6%(14.7°/70.4%),Sintel 29.2°/27.5%(29.3°/24.8%),平均排名1.4对2.3;翻转TTA可进一步提升。透明物体(Table 2):所有指标第一(平均排名1.0)——ClearGrasp MAE 11.3°,较此前最强的Lotus-2(15.5°)降4.2°,30°内94.1%;TN-Syn近饱和(3.6°,30°内99.1%);零样本ClearPose 19.1°,比FE2E(22.2°)低3.1°、比Lotus-2低4.3°。对比前作(Table 3):ClearGrasp −4.8°、ClearPose −6.4°、NYUv2 −1.9°、ScanNet −2.6°。消融(Table 4):NYUv2上MSE基线16.9°→+小波/vMF 16.6°→+渲染损失16.0°→解耦GRM 14.7°,而GRM联合训练只有16.0°;GRM设计对深度/宽度极稳定(Table 5,波动0.03°),去掉RGB引导劣化约1.0°/0.7°;LoRA rank 256为最优点(Table 6)。机制验证:GRM使边缘像素MAE降约2.6°、非边缘仅0.6°–0.8°(Table 8),高频带误差能量降53.2%/42.9%(Fig. 8),证明修正精准对准VAE退化模式。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 通用场景法线估计(NYUv2) | MAE(↓) / 11.25°内像素(↑) | 14.7° / 62.5% | MoGe-2:14.7° / 62.3%(8.9M训练样本) | MAE持平,11.25°精度+0.2个百分点,训练数据仅为其1.4% |
| 通用场景法线估计(ScanNet) | MAE(↓) / 11.25°(↑) | 12.7° / 69.2% | MoGe-2:12.8° / 68.4% | MAE −0.1°,11.25°精度+0.8个百分点 |
| 通用场景法线估计(iBims) | MAE(↓) / 11.25°(↑) | 14.7° / 70.6% | MoGe-2:14.7° / 70.4% | MAE持平,11.25°精度+0.2个百分点 |
| 通用场景法线估计(Sintel) | MAE(↓) / 11.25°(↑) | 29.2° / 27.5% | MoGe-2:29.3° / 24.8% | MAE −0.1°,11.25°精度+2.7个百分点 |
| 透明物体法线估计(ClearGrasp,合成) | MAE(↓) / 30°(↑) | 11.3° / 94.1% | Lotus-2:15.5° / 87.4% | MAE −4.2°,30°精度+6.7个百分点 |
| 透明物体法线估计(ClearPose,真实,零样本) | MAE(↓) / 11.25°(↑) | 19.1° / 52.3% | FE2E:22.2°(MAE最强基线);Lotus-2:43.0%(11.25°) | MAE −3.1°(相对Lotus-2为−4.3°) |
| 透明物体法线估计(TN-Syn) | MAE(↓) / 30°(↑) | 3.6° / 99.1% | TransNormal(前作):3.9° / 98.3% | MAE −0.3°,基准已近饱和 |
局限与改进
作者承认的局限有二:逆渲染损失假设漫反射Lambertian成像,折射与强镜面反射只被弱建模——而透明物体正是折射成像,意味着 $\mathcal{L}_{render}$ 在其主打的透明场景中作用有限,其收益主要在漫反射的通用室内场景;GRM只能修复边界附近的细尺度结构,核心预测器大面积预测错误时无法补救。我的补充观察:其一,域标志 $\mathbb{1}_T$ 训练时取自数据集、评测时按基准人工设定,真实部署需要额外的透明域判别,否则anchor选择策略无从执行;其二,GRM依赖'RGB边缘≈几何不连续'的假设,作者自己在5.8节承认折射表面RGB边不可靠,故只在不透明场景用它做机制诊断;其三,8×压缩瓶颈本身没有消除——GT法线仍有1.3°–8.5°的固有误差地板(iBims高达8.5°),从MSE-only到14.7°的提升中GRM只贡献约1.3°,其余来自损失设计,问题仅部分解决;其四,训练全用合成数据,ClearPose虽为零样本但仍是桌面级受控场景,户外强光、多层玻璃等复杂折射未见验证;其五,9B骨干的推理成本远高于DSINE等判别式模型。
独立分析的弱点
独立分析的弱点及改进方向:①域标志 $\mathbb{1}_T$ 依赖人工指定——可训练一个轻量材质/透明度判别器自动输出,或将anchor策略做成软混合(按透明概率加权两种anchor),消除部署时的域假设。②Lambertian假设在高光与折射表面失效——可引入材质感知渲染(如分裂求和BRDF、环境光遮蔽),或仅在检测为漫反射的区域激活渲染损失,让约束与成像物理匹配。③GRM对大面积错误无补救能力——可引入不确定性引导的多尺度细化,或让GRM迭代2–3次并携带置信图,把'边界修补'扩展为'区域级修正'。④NCC度量对阴影与反照率的混淆仍敏感——可先用本征图像分解估计反照率再渲染阴影,或对镜面区域用高光先验建模。⑤合成到真实的域差距集中在真实材质(磨砂玻璃、水渍、灰尘)——可加入少量真实标注或更强的域随机化渲染。⑥8×VAE地板未变——可试验tile化解码、更高分辨率latent或DC-AE类高压缩VAE做对照,检验'压缩率-边界误差'关系的普适性,并可能进一步压低iBims那样8.5°的高误差域。⑦9B模型推理成本高——可探索蒸馏到1B级骨干,验证GRM范式对更小模型的增益是否保持。
未来方向
作者明确提出的方向:材质感知的渲染约束(超越Lambertian、覆盖镜面与折射成像);构建更大规模、精心标注的法线训练集以突破122K合成数据的上限;以及设计更高分辨率的潜在空间,从源头缓解8×压缩带来的几何监督损失。基于本文成果可自然延伸的研究:把'VAE退化测量+GRM后解码修正'范式移植到深度、边缘、材质等其他密集预测任务,检验边界局部化误差是否为VAE管线的普遍模式;与像素空间扩散(Pixel-Perfect Depth)和高压缩VAE(DC-AE)做系统性正交对比,绘制'压缩率-边界误差-算力'三者的权衡图谱;让GRM在端到端训练中用梯度投影或stop-gradient选择性抑制泄漏,弥合联合训练(16.0°)与解耦训练(14.7°)的差距;结合视频扩散先验引入时序一致的法线估计(如NormalCrafter路线);在机器人抓取等下游任务上量化边界法线精度提升(ClearGrasp −4.2°)对操作成功率的实际收益。
复现评估
复现条件较好但门槛不低。开源方面:论文承诺代码将在项目页(longxiang-ai.github.io/TransNormal-2)发布;骨干FLUX.2[klein]为公开模型;训练数据全部公开——ClearGrasp 45,454样本、TN-Syn 3,555训练样本、Hypersim 39,648样本(576×768)、Virtual KITTI 33,580样本(352×1216);七个评测基准(NYUv2、ScanNet、iBims-1、Sintel、ClearGrasp、TN-Syn、ClearPose)均为标准数据集。算力方面:需8张A100 80GB、总batch 32、Phase 1约35K步,另加Phase 2的GRM两子阶段训练;可训练参数约700M(LoRA r=256)+0.4M GRM,推理为单次前向(另有2×翻转TTA选项)。细节方面:损失系数、LCM/GRM结构、子阶段schedule与推理设置都在补充材料。难点在于两阶段+两子阶段协议、分阶段数据调度与NCC光照估计的实现环节较多,任何一环偏差都会影响精度;但指标基于公开benchmark、可逐项核对,属于中高难度、有单机多卡条件的实验室可尝试的复现工作。
论文图表
(a) 四个基准上GT法线经VAE编码-解码往返的平均角误差表:ClearGrasp全局1.29°/边缘3.64°/比率2.82×,NYUv2 1.81°/2.27°/1.26×,ScanNet 2.45°/3.29°/1.34×,iBims 8.50°/14.61°/1.72×;(b) ClearGrasp样本的VAE重建图与全帧角误差图(亮=高误差),可见误差集中在几何边界。
这是全文动机的量化基石:证明误差不是模型预测问题而是VAE压缩固有的、边界局部化的系统性偏差,直接催生了'训练时像素空间监督+推理时GRM修正'的双侧设计。
野外物体上的定性消融五联图:(a)输入,(b)仅MSE基线,(c)加小波+vMF后局部几何更连贯,(d)再加逆渲染自洽后结构进一步提升,(e)完整模型+GRM后残余边界伪影减少。面板(b)–(e)对应Table 4的行(a)、(b)、(c)、(f)。
把Table 4的数字消融可视化,逐组件展示每种损失和GRM各贡献了什么,帮助读者建立'哪一步修哪类误差'的直觉。
NYUv2、ScanNet、iBims、Sintel四个通用基准上的定量对比,指标为MAE(Mean↓)与11.25°内像素比例(↑),共14个方法、含训练数据量与平均排名。TransNormal-2用122K样本取得四基准最佳或并列最佳:14.7/62.5、12.7/69.2、14.7/70.6、29.2/27.5,平均排名1.4,超过用8.9M样本(73倍数据)的MoGe-2(排名2.3)。
核心主表之一:支撑'用1.4%标注匹配或超越MoGe-2全部八项指标'这一 headline 结论。