SUFLECA:面向CAD与图像对齐的规模化特征学习 SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
弱监督大规模NOC特征学习+几何一致匹配,零样本CAD对齐首次超越全监督。
前置知识
CAD-to-image Alignment
给定单张RGB图像、相机内参和一个候选CAD模型,估计从CAD坐标系 $X_{cad}$ 到相机坐标系 $X_{cam}$ 的9D变换 $X_{cam}=RSX_{cad}+t$,其中 $R\in SO(3)$ 为旋转,$S=\mathrm{diag}(s_x,s_y,s_z)$ 为各向异性缩放,$t\in\mathbb{R}^3$ 为平移。它是机器人抓取、AR注册等任务中检索到CAD模型后的关键配准步骤。
本文核心任务就是该9D对齐,理解变换参数构成与各向异性缩放的意义,才能看懂后续的对应关系求解与RANSAC Procrustes过程。
Normalized Object Coordinates (NOCs)
NOC将每个物体点表示在类别级规范坐标系中,取值归一化到 $[-1,1]^3$,从而把位姿估计转化为稠密坐标预测+3D配准。本文使用分箱分类头将每个坐标轴分成 $m=64$ 个bin,预测NO值作为期望,监督信号来自渲染CAD与深度反投影。
NOC是SUFLECA特征学习的关键弱监督信号,理解它才能看懂为什么模型能学到几何感知而非仅外观的特征,以及NO头训练后被丢弃的设计动机。
Zero-shot CAD Alignment
指对齐阶段不使用位姿标注数据训练,仅依赖弱监督(如NOC、合成渲染)。文中明确‘zero-shot’专指对齐阶段,物体检测、深度估计、CAD检索仍作为上游组件继承自前人工作。
本文要在零样本设定下首次超越全监督方法,必须分清‘零样本’边界,否则容易误以为整个pipeline都无监督。
Dense Prediction Transformer (DPT)
DPT通过融合视觉编码器多层多尺度输出,并通过Transformer上采样产生更稠密的特征图。SUFLECA在冻结的DUNE-B感知编码器上叠加DPT,输出维度 $\mathrm{dim}=384$ 的稠密patch特征。
DPT是SUFLECA特征模型的核心结构,理解它才知道为什么能同时兼顾稠密对应与紧凑特征表示,进而实现低显存、亚秒级运行。
Mutual k-Nearest-Neighbors Matching + Geometric Consistency
匹配时只在双方互为top-k近邻时保留对应($k=13$),再用各向异性缩放估计和共识矩阵过滤几何不一致的对应。共识矩阵 $G_{ij}=\mathbf{1}[|\|q_i-q_j\|^2-\tilde{d}_{ij}^2|/\tilde{d}_{ij}^2<\beta]$ 通过主特征向量给每个对应打分。
这是SUFLECA相对ZeroCAD简单最近邻匹配的关键改进,理解它才能解释为什么消融中仅用最近邻会掉到26.3/34.2。
研究动机
CAD-to-image对齐要从单张RGB图像估计物体的9D位姿(旋转、平移、各向异性缩放),是机器人感知与增强现实的关键环节。已有的监督方法如ROCA、SPARC、MultiObj-SPARC、CosCAD依赖昂贵的位姿标注,泛化到分布外图像能力差。零样本路线虽用视觉基础模型(如DINOv3-L、DUNE-B)做对应,但其特征以外观为主、缺乏3D几何grounding,存在显著域间隙,在遮挡或sim-to-real迁移下精度大幅退化。代表方法ZeroCAD仅在9个类别的30万张合成单物体图像上训练,且采用高维(2048维)语义特征空间的最近邻匹配,产生噪声大、多对一的对应,必须依赖昂贵的迭代位姿精修(如ZeroCAD带refine的3.77s/实例、FoundationPose的0.61s/实例但精度受限),既慢又显存大,难以满足机器人实时性。
本文的目标是作者要构建一个弱监督零样本CAD-to-image对齐框架SUFLECA,达成三个目标:(1)通过大规模、跨域(真实+合成)的NOC监督,把冻结视觉编码器的高维特征‘塑形’为几何感知且紧凑的低维描述子;(2)设计一个能利用刚体几何结构、过滤几何不一致对应的匹配算法,替代脆弱的语义最近邻匹配,从而无需迭代位姿精修;(3)在保持亚秒级单实例运行时与低显存的同时,在ScanNet25k上首次让零样本方法超越全监督方法,并输出一个有原则的对齐质量分数 $S_{fit}=\log\det(\Lambda)$ 用于NMS排序或多视角聚合。
与已有工作不同的是,SUFLECA的独特切入角度是把‘数据规模/多样性’和‘几何一致匹配’这两个被前人割裂的维度同时拉满。在数据侧,它把训练集从ZeroCAD的30万张单物体合成图扩展到674K张、12个数据集、平均3.38物体/帧的混合真实+合成数据,并显式生成real-synthetic成对样本来桥接域间隙;在匹配侧,它不再把对应问题留在高维语义空间,而是结合互k近邻(mutual k-NN)、各向异性缩放的IRLS鲁棒估计与基于共识矩阵的几何一致性过滤,把对应留在2D域,避免对CAD mesh做多视角有损聚合。这一组合让零样本精度首次跨过监督方法的天花板。
核心方法
SUFLECA沿用经典的间接式CAD对齐流水线:先用SAM2提取物体掩膜,计算逐像素描述子;对候选CAD同样提取描述子;在特征空间建立图像-CAD对应;用单目度量深度把对应lift到3D;最后用RANSAC Procrustes求解9D变换 $X_{cam}=RSX_{cad}+t$。直觉上,作者认为前人瓶颈在两处:特征缺几何grounding、匹配缺几何一致性。因此SUFLECA对这两个模块做关键改造——特征模型通过大规模NOC监督让描述子几何可分;匹配模块通过互k近邻+各向异性缩放共识过滤剔除不一致对应。整套流程把对齐留在2D域,避免对CAD mesh做多视角有损聚合,从而又快又省显存。
核心创新有两点。其一,统一的大规模NOC对齐特征学习:在冻结的DUNE-B感知编码器上叠加DPT,再用轻量分箱NOC头($m=64$ bin)做监督,把高维特征‘对齐’到NOC空间。损失 $\mathcal{L}_{NOC}=\mathcal{L}_{CE}+\lambda\|\hat{N}-N\|_1$($\lambda=0.33$),训练后丢弃NOC头,仅用 $\ell_2$ 归一化后的DPT特征(dim=384)作为描述子,比ZeroCAD的2048维小5.3倍。其二,几何一致的对应估计:互k近邻匹配($k=13$)后,先用对数缩放直方图众数得到各向同性初值,再用IRLS精化各向异性对数缩放 $\tilde{\ell}=\alpha\hat{\ell}+(1-\alpha)\hat{\ell}_{iso}\mathbf{1}$($\alpha=0.5$),构造共识矩阵 $G_{ij}$ 取主特征向量保留对应,最后送入空间划分RANSAC的Procrustes求解器。与ZeroCAD相比,本质区别在于既规模化又几何一致。
方法步骤详情
完整流程:(1)数据准备——12个数据集共674,851帧(Pascal3D、Objectron、ARKitScenes、REAL275、RealEstate10K、ScanNet、ScanNet++、Pix3D、ObjectNet3D、3D-Front、Hypersim、ShapeNet),每张真实图配同姿态合成对应;ScanNet在评测ScanNet25k时被剔除以严格零样本,剩557,567帧。(2)NOC推导——渲染GT物体、SAM2抠mask、度量深度反投影算NOC,与CAD NOC比对剔除超阈值实例。(3)模型——冻结DUNE-B+DPT上采样+分箱NOC头(m=64),AdamW训练50 epoch,lr=$1.1\times10^{-4}$,$\lambda=0.33$。(4)推理——对n=6个预渲染CAD视角提特征按公式(3)选最佳;FPS取N=512点做mutual k-NN(k=13);IRLS估各向异性缩放构建共识矩阵G($\beta=0.01$),按$m=\mathbf{1}[e\ge\delta\max(e)]$($\delta=0.05$)保留对应;送RANSAC Procrustes得9D变换。(5)评分——$\Lambda=\frac{1}{\sigma^2}\sum_i J_i^\top J_i$,$S_{fit}=\log\det(\Lambda)$用于NMS排序。
技术新颖性
技术新颖性体现在四方面。第一,NOC监督规模与多样性前所未有:12个数据集、674K帧、平均3.38物体/帧,且显式构造真实-合成成对样本以弥合域间隙,远超ZeroCAD的9类30万合成图。第二,匹配全程留在2D域,不依赖对CAD mesh做任意且有损的多视角聚合,而是维护n=6个预渲染固定视角并用编码器隐含的全局姿态信息选最佳视角。第三,几何一致匹配把各向异性缩放估计(IRLS+各向同性收缩)与共识矩阵主特征向量过滤结合,从有噪声的mutual k-NN对应中恢复最大一致子集,无需迭代位姿精修。第四,对齐质量分数 $S_{fit}=\log\det(\Lambda)$ 由配准残差雅可比解析导出,比直接借用CAD检索分数更原则化,消融显示用检索分数会让精度从33.4/42.3掉到30.4/39.3。
实验结果
在ScanNet25k的NMS协议下SUFLECA达类别33.4%/实例42.3%精度,相比最强零样本基线ZeroCAD(23.1/30.1)提升+10.3/+12.2个百分点,并首次在该benchmark超过全监督MultiObj-SPARC(30.3/40.3)和CosCAD(27.4/33.2),9类中7类取最佳或次佳。更难的DiffCAD split(无NMS、非微调深度)上达36.1/44.8,比ZeroCAD(15.9/20.9)提升+20.2/+23.9,甚至超过用GT姿态从8假设中挑最优的DiffCAD oracle(35.8/41.9)。CO3D的inexact CAD设定下seen类别3D-IoU 62.63、ADD-S@0.1达84.00%,大幅领先Diorama(39.41/82.00);unseen类别(烤面包机/吹风机/微波炉/行李箱)3D-IoU仍48.89。效率上单实例仅0.53s、显存2178MB,优于ZeroCAD*(3.77s/5158MB),主要时间花在RANSAC(332ms)。消融显示:仅最近邻匹配掉到26.3/34.2,加互一致性30.7/39.4,加mutual k-NN 32.0/41.0,再加几何过滤才到33.4/42.3。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ScanNet25k NMS协议下的9D CAD对齐 | 类别平均准确率(%) | 33.4 | ZeroCAD 23.1 / MultiObj-SPARC(监督) 30.3 | 较ZeroCAD +10.3pp,并首次超越监督方法 |
| ScanNet25k NMS协议下的9D CAD对齐 | 实例平均准确率(%) | 42.3 | ZeroCAD 30.1 / MultiObj-SPARC 40.3 | 较ZeroCAD +12.2pp |
| DiffCAD split(无NMS、非微调深度) | 类别/实例平均准确率(%) | 36.1 / 44.8 | ZeroCAD 15.9 / 20.9 | +20.2 / +23.9pp,超越DiffCAD oracle 35.8/41.9 |
| CO3D inexact CAD(seen类别:chair/couch) | 3D-IoU(%) | 62.63 | Diorama 39.41 / DINOv3-L 36.21 | 较Diorama +23.22pp |
| 单实例CAD对齐效率 | 运行时(s)/峰值显存(MB) | 0.53s / 2178MB | ZeroCAD* 3.77s / 5158MB | 速度7.1倍、显存降至42% |
局限与改进
作者明确指出三点局限:一是对齐质量仍受CAD检索精度制约——表V显示从GT Scan2CAD标注(43.0/54.2)到监督ROCA(33.4/42.3)再到零样本GroundedSAM+OSCAR(22.5/33.1,实例检索仅3.8%),类别/实例精度急剧下降,表明零样本开集检索仍是瓶颈;二是当前仅限室内场景和常见物体类别,未覆盖户外与稀有类别;三是SUFLECA的‘零样本’专指对齐阶段,仍依赖上游SAM2分割、单目度量深度估计和CAD检索组件,并非端到端零样本。此外,从我的观察看,n=6个预渲染固定视角、$\alpha=0.5$、$\beta=0.01$、$\delta=0.05$等大量超参均经验设定,对未见类别/极端遮挡的鲁棒性仍待验证;SUFLECA-blend在ScanNet25k上反而略低于base,说明特征拼接并不普适。
独立分析的弱点
第一个弱点是对CAD检索质量的强依赖:当检索从GT退到零样本(GroundedSAM+OSCAR)时实例精度从42.3掉到33.1,因为大多数检索到的CAD是‘inexact’的,改进方向是引入外观-几何联合检索或与对齐端到端微调的检索器。第二个弱点是预渲染视角选择较粗糙:仅n=6个固定视角并用平均最近邻余弦相似度选择,对前-后/左-右歧义敏感(CO3D定性图4所示),改进方向是可学习视角bank或姿态敏感的视角检索。第三个弱点是几何一致过滤依赖各向异性缩放估计的鲁棒初值,当对应未充分覆盖三轴时退化,改进方向是引入不确定性建模或贝叶斯缩放估计。第四个弱点是训练数据仍偏室内SLAM轨迹,户外与稀有类别覆盖不足,改进方向是把数据扩展到自动驾驶/户外场景数据集。第五个弱点是NMS排序仍依赖单一$S_{fit}$,未利用多视角时序信息,改进方向是把$S_{fit}$用于多视角聚合。
未来方向
作者提出的未来工作主要有两条:一是研究鲁棒的开集CAD检索,从被遮挡的真实观测中检索准确CAD,这是当前最大的瓶颈;二是把SUFLECA扩展到户外场景和稀有类别,提升可扩展性与泛化。基于本文成果可延伸的方向还包括:(1)利用解析的$S_{fit}=\log\det(\Lambda)$做多视角聚合或主动视角选择,把单图方法升级为视频级CAD对齐;(2)把几何一致匹配思想迁移到类别级位姿与形状联合估计,结合SAM3D生成的CAD pool;(3)探索用更紧凑的特征(如SUFLECA-S的dim=256)部署到边缘机器人,目前SUFLECA-S已达30.6/39.5且显存仅1556MB;(4)与可微渲染结合做轻量级位姿精修,作为RANSAC后的可选阶段,进一步压榨精度。
复现评估
复现性整体较好:作者在 https://github.com/snt-arg/SUFLECA 开源代码,所有关键超参(dim=384/256、m=64/50 bin、AdamW 50 epoch、lr=$1.1\times10^{-4}$、$\lambda=0.33$、n=6视角、N=512、k=13、M=256、$\alpha=0.5$、$\beta=0.01$、$\delta=0.05$、RANSAC 300k迭代)均已给出且各实验保持一致。训练数据为12个公开数据集,合计674,851帧,需自行下载与做NOC推导(依赖SAM2与度量深度估计器MetricAnything)。评测benchmark(ScanNet25k、DiffCAD split、CO3D)均公开。算力要求较高:作者在NVIDIA RTX 5090上实验,单实例推理0.53s、峰值显存2178MB;推理时还需上游SAM2、度量深度与CAD检索模型,复现整条pipeline工作量较大但可行。
论文图表
三联图展示零样本方法在ScanNet25k上的精度(左)、运行时(中)和峰值显存(右)。SUFLECA在精度轴上最高(甚至超过Supervised SOTA),同时在运行时与显存轴上最靠近原点,形成‘又准又快又省’的帕累托前沿;ZeroCAD/FoundationPose/Diorama则在右侧偏移,说明它们或慢或耗显存。
这张图是全文最强的卖点可视化,一张图同时呈现精度、速度、显存三个维度的帕累托优势,是理解论文贡献与定位的最佳入口。
列出12个训练数据集(上半部分真实、下半部分合成)的标注来源、帧数与平均物体数/帧。总计674,851帧、平均3.38物体/帧;ScanNet在评测ScanNet25k时被排除,剩余557,567帧。
这张表是SUFLECA‘规模化’卖点的数据支撑,直接对比ZeroCAD的30万合成图,凸显数据规模与多样性优势。
主结果表:在ScanNet25k NMS协议下,SUFLECA达类别33.4%/实例42.3%,超过ZeroCAD的23.1/30.1和监督方法MultiObj-SPARC的30.3/40.3;DiffCAD split上SUFLECA达36.1/44.8,远超ZeroCAD 15.9/20.9和DiffCAD oracle 35.8/41.9。表中9类逐类精度也列出。
这是论文最核心的结果表,所有‘首次超越全监督’的论断都来自此表,是results章节的基石。
CO3D上inexact CAD、带遮挡mask下的泛化结果。seen类别(chair/couch)SUFLECA 3D-IoU 62.63、ADD-S@0.1 84.00;unseen类别(烤面包机、吹风机、微波炉、行李箱)3D-IoU 48.89、ADD-S@0.1 78.75,全面优于Diorama、DINOv3-L、DUNE-B。
证明SUFLECA在训练时未见的类别上仍具强泛化能力,是‘zero-shot’泛化主张的关键证据。
四组消融:(1)训练数据含ScanNet→34.4/42.8;(2)对应策略——最近邻26.3/34.2、互最近邻30.7/39.4、mutual k-NN无过滤32.0/41.0;(3)NMS评分——用ROCA检索分数30.4/39.3、用渲染选择分数29.2/38.8。逐一证明各模块必要性。
这张表把SUFLECA每个设计选择的贡献量化,是理解方法新颖性与各组件作用的核心。
对比GT Scan2CAD标注、监督ROCA、零样本GroundedSAM+OSCAR三种检索模式下的对齐精度。实例检索精度从43.0%→33.4%→3.8%,对应实例对齐精度从54.2→42.3→33.1,揭示CAD检索是零样本pipeline的瓶颈。
这张表诚实展示了方法的局限与对上游检索的依赖,是论文局限性与未来方向的关键依据。
效率对比:SUFLECA仅0.53s/实例、峰值显存2178MB、特征dim=384,远优于ZeroCAD*(3.77s/5158MB/dim=2048)、Diorama(2.39s/3426MB)、FoundationPose(0.61s/8544MB)。SUFLECA-S更优(0.49s/1556MB)。子表给出SUFLECA内部计时:RANSAC占332ms(最大头)、Featurizer 86.6ms、对应估计68.7ms、视角选择43.1ms。
这张表是效率卖点的硬数据,解释了为什么SUFLECA适合机器人实时应用,也是理解亚秒级运行时构成的关键。