Self-Geometry:免真值、即插即用的测试时自适应,实现几何一致的3D视觉基础模型 Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models
用测试时2D像素对应作伪真值,两分钟内以显式多视几何约束适配冻结的3D基础模型
前置知识
视觉基础模型(VFM:VGGT / π3 / DA3)
前馈式 3D 重建大模型,输入任意数量多视图像,单次前向同时输出相机位姿、逐像素深度和 pointmap。VGGT 用交替注意力融合多视图,π3 用置换等变结构,DA3 用统一深度-光线表示并提供 Giant/Large/Base/Small 四档规模,以'训练后冻结'范式部署,零样本泛化强。
本文的操作对象就是这些冻结的 VFM:TTA 只更新插入其中的 LoRA,理解 VFM 的输出形式是理解监督信号如何施加的前提。
对极几何与基本矩阵
两视图间的像素对应满足线性约束 $\tilde{x}_i^\top F_{i\leftarrow j}\tilde{x}_j=0$,$F$ 由相对位姿与内参决定;对应点必须落在对极线 $\ell_i=F\tilde{x}_j$ 上,Sampson 距离量化约束的违反程度。
本文的 EC Loss 就是对极约束的 Sampson 距离,是点对线、深度无关的位姿监督;不懂对极几何就看不懂核心损失设计。
重投影误差与光束法平差(BA)
把源视图像素经预测深度反投影为 3D 点,再用相对位姿投影到目标视图,量测其与匹配像素的偏差即重投影误差;BA 是同时优化位姿与 3D 点使重投影误差最小的非线性最小二乘,是 SfM 核心,但需逐场景迭代、计算昂贵。
MVC Loss 是重投影误差的可微版本;它同时解释了为何 VFM 预训练省略 BA,以及 MVC Loss 为何继承姿态-深度歧义。
姿态-深度歧义(pose-depth ambiguity)
重投影误差同时由位姿和深度决定:把相机平移拉远、把深度等比放大,重投影结果可以完全不变。因此仅靠点对点重投影约束,存在无穷多组 (位姿, 深度) 组合给出同样小的损失,无法唯一定解。
这是本文引入深度无关 EC Loss 和梯度解耦(GD)的直接动因,是理解方法设计逻辑的关键。
测试时自适应(TTA)
在推理阶段不改训练数据、不依赖标签,仅用测试样本自身的自监督信号(如熵最小化、自蒸馏)临时更新模型参数,使其适配当前输入分布。经典工作有 TTT、TENT 等;在 3D 重建中则用测试场景的图像关系或自身预测构造损失。
Self-Geometry 本质是逐场景 TTA:50 轮迭代、只更新 LoRA、用测试场景自身信号优化,理解 TTA 范式才能明白'即插即用'的含义。
LoRA 低秩适配
把权重更新近似为低秩分解 $\Delta W=BA$(秩远小于维度),冻结原权重只训练 $A,B$ 两个小矩阵。本文在 VFM 注意力 QKV 权重中插入 rank 64 的 LoRA,新增参数仅占原模型的 0.7%–3.4%。
Lightweight TTA 组件完全建立在 LoRA 之上,是'预训练权重冻结、两分钟完成逐场景适配'的工程基础。
SO(3) 测地距离
两个旋转之间的最短角距离 $\theta_{ij}=\cos^{-1}\frac{\mathrm{tr}(R_iR_j^\top)-1}{2}\in[0,\pi]$,只依赖相对旋转,与场景尺度和平移无关。相对旋转基本决定观察方向差异,可作为'视角差多远'的尺度不变度量。
FAN 视图采样器完全建立在该度量上:SO(3) 分 bin、熵最大化选目标视图都靠它,并回避了 SE(3) 距离需逐场景尺度归一化的麻烦。
梯度手术(PCGrad 式投影)
多任务学习中,若两个损失的梯度夹角为钝角(内积为负),联合更新会互相拖累;PCGrad 把一个任务的梯度投影到另一任务梯度的正交补空间(减去冲突分量),使两个目标至少互不妨碍。
本文的 Gradient Disentanglement 即该技术用于 MVC/EC 双损失:实测 42.4% 的 TTA 迭代存在梯度冲突,去掉 GD 几何 F1 从 0.50 跌至 0.45。
LightGlue 特征匹配
2023 年提出的轻量级图像特征匹配器,能极快输出两图间的 2D 像素对应及置信度,是 SfM/SLAM 前端常用组件;匹配质量受重复纹理、弱纹理、宽基线低重叠等因素影响。
它是本文监督信号的唯一来源:初始化时一次性提取全部视图对的伪对应并全程复用,其质量上限决定方法上限(Raw 精度 0.39 时训练崩溃)。
研究动机
VGGT、π3、DA3 等视觉基础模型(VFM)以单次前向传播同时回归相机位姿、深度和 pointmap,零样本泛化强,但预训练时为省算力完全省略了光束法平差一类的显式多视几何一致性约束(如 VGGT 只用 GT 逐项监督位姿与深度回归),预测因此可能违反多视几何:Fig. 2 中 DA3-Base 在 HiRoom 828786 场景的深度误差图出现大片超过基准阈值的红色区域,pointmap 明显错位。已有的测试时修正路线依赖模型自身输出的隐式自洽(如 Free-Geometry 用全视图教师蒸馏掩码视图学生、TTT3R 利用 pointmap 置信度),监督信号不携带显式几何语义,在预训练模型本就严重失准的场景几乎无效——Fig. 2 中 +Free-Geometry 后位姿与深度误差几乎不变。依赖外部先验的 TCO 在 GT 不可得、只能拿模型自身预测当先验时直接发散:在 π3 上 Mean 位姿 AUC@3 暴跌 91.5%、几何 unposed F1 下跌 60.0%。
本文的目标是本文要构建一个免真值(GT-free)、免教师(Teacher-free)、即插即用(Plug-and-play)、且施加显式多视几何约束(Explicit-Geometry)的测试时自适应(TTA)管线:不使用任何 GT 标注、教师蒸馏或外部先验,仅凭目标场景自身的多视图像,在冻结的预训练 VFM 上做轻量适配,使位姿与深度显式满足 2D 像素对应所定义的几何关系。工程指标同样具体:在单张 NVIDIA RTX PRO 6000 上,最多 40 输入视图的场景于两分钟内完成适配;在 VGGT、π3、DA3-Giant/Large/Base/Small 六个模型与 7Scenes、ETH3D、ScanNet++、HiRoom 四个基准上,位姿估计(AUC@1/3/30)与几何估计(F1,posed/unposed 两种模式)都要取得一致提升。
与已有工作不同的是,本文的独特切入是把显式几何监督的来源从 GT、教师或先验换成测试时免费获得的 2D 像素对应:LightGlue 等外部匹配器提取的对应关系本身就定义了位姿和深度必须满足的像素级约束,可直接当伪真值。在此之上,作者没有把几何约束揉成一个总损失,而是按几何语义拆成两类互补约束:点对点的重投影约束(MVC Loss,同时监督位姿+深度)与点对线的对极约束(EC Loss,与深度无关、只监督位姿),并进一步诊断出两者会在位姿参数上产生梯度冲突,用梯度解耦(GD)让点对线损失独立校正位姿、点对点损失负责精细修正。相比 Table I 中已有路线(冻结 VFM、微调类、TCO/Free-Geometry 等 TTA 类),该方法不依赖 GT 与教师、不绑定 CUT3R/MASt3R 等特定骨干,四个定位轴同时满足。
核心方法
直觉:若两视图中同一物理点的像素被可靠匹配,那么预测的位姿与深度必须能把源视图像素重投影到目标视图对应位置(点对点),且至少落在对极线上(点对线);违反即说明预测有几何错误,可作无需真值的监督。技术路线是逐场景 TTA:初始化时用 LightGlue 对全部视图对提取 2D 伪对应集 $\mathcal{M}$ 并过滤误匹配;用 FAN 基于 SO(3) 测地距离选 bin 熵最大的目标视图;随后 50 轮迭代:按 bin 采样角度多样的源视图,前向得位姿与深度,计算 MVC+EC 主损失与三个辅助正则(光度、边缘平滑、基线深度锚定),经 MAD-Huber 鲁棒化与动态权重平均(DWA)配权,再把 $\nabla\mathcal{L}_{mvc}$ 投影到 $\nabla\mathcal{L}_{ec}$ 的正交补后 AdamW 更新。唯一可学习参数是注意力 QKV 中的 LoRA(rank 64),预训练权重全程冻结,checkpoint 按 $\sqrt{\tilde{\mathcal{L}}_{ec}\cdot\tilde{\mathcal{L}}_{mvc}}$ 最小者选取。
核心创新是按几何语义把监督拆成互补的两条约束,并显式处理其梯度冲突。点对点的 MVC Loss $\mathcal{L}_{mvc}=\frac{1}{|\mathcal{M}|}\sum\|\hat{x}_i^m-x_i^m\|_2$ 经预测位姿与深度把源视图像素重投影到目标视图,联合监督位姿与深度,但继承经典姿态-深度歧义:不同 $(P,D_j)$ 组合可给出相同损失,无法唯一定解。点对线的 EC Loss $\mathcal{L}_{ec}$ 改用 Sampson 距离度量对应点偏离基本矩阵 $F_{i\leftarrow j}$ 所定对极线的程度,与深度无关,可独立校正位姿。但两损失共同监督同一批位姿,实测 42.4% 的 TTA 迭代中两梯度夹角为钝角(冲突)。GD 据此把 $\nabla\mathcal{L}_{mvc}$ 投影到 $\nabla\mathcal{L}_{ec}$ 的正交补,令 EC 独立校正位姿、MVC 做精细修正;消融显示去掉 GD 几何 F1 从 0.50 跌至 0.45。与隐式自洽方法的本质区别:监督是显式几何关系而非模型自身输出。
方法步骤详情
见 Algorithm 1。(1) 初始化:冻结 VFM 前向得基线位姿/深度;LightGlue 提取伪对应集 $\mathcal{M}$,依次经 EC 滤波与 MVC 滤波两级清洗,并按 MAD 估计 Huber 阈值 $\delta=1.345\sigma$。(2) GRV 选目标视图:按 SO(3) 测地距离把 $[0,\pi]$ 分成 15° 的 9 个 bin,统计各候选下源视图的 bin 分布,选活跃 bin 数多且 bin 熵 $H(v)=-\sum_b p_b\log p_b$ 最大者为 $v^*$。(3) 50 轮 TTA:ANS 从 $v^*$ 周边各 bin 采样源视图,前向得 $P_t,D_t$;计算双主损失与三个辅助正则(光度/平滑/基线锚定),Huber 化后 DWA 配权,GD 处理主损失梯度,AdamW 更新 LoRA(rank=α=64,lr $5\times10^{-5}$)。(4) 每轮按 $\sqrt{\tilde{\mathcal{L}}_{ec}\cdot\tilde{\mathcal{L}}_{mvc}}$ 存最优参数。
技术新颖性
新颖性有四点。(1) 监督源替换:把外部匹配器的 2D 对应当作显式几何伪 GT 用于前馈 3D 基础模型的逐场景测试时适配——对应约束做自监督在单目深度估计(Monodepth2)训练中常见,但用于 VFM 的 TTA 并与对极残差结合是新的,由此同时摆脱 GT、教师、先验三重依赖。(2) 几何语义拆分+梯度解耦:点对点/点对线是经典对偶,但作者定量测出两损失在 TTA 中 42.4% 的迭代存在梯度冲突,并把 PCGrad 式投影用于'位姿 vs 位姿+深度'的不对称监督结构,论证了为何保留 EC 方向、修剪 MVC 冲突分量(对比 $\nabla\mathcal{L}_{mvc}$ Disent. 与双向解耦等变体)。(3) SO(3) 驱动的视图采样:用尺度不变、免归一化的旋转测地距离做 bin 采样与熵最大化选目标视图。(4) 全套数值稳定工程(MAD-Huber、DWA、尺度不变 checkpoint 指标)配合逐场景 LoRA,全部超参在 6 模型×4 数据集间完全共享,兑现即插即用。
实验结果
主结果覆盖 6 模型×4 基准,模型越弱收益越大。位姿估计:VGGT 在 ETH3D 上 AUC@3 0.20→0.27(+37.3%)、AUC@30 +9.2%;π3 在 ETH3D AUC@3 +25.1%、Mean +8.3%;DA3-Base 在 HiRoom AUC@3 +54.8%,DA3-Small +64.8%。几何估计(unposed F1):DA3-Base HiRoom 0.23→0.43(+85.2%)、DA3-Small 0.18→0.31(+70.4%),Mean 上三者 +12.2%/+13.9%/+5.1%,DA3-Giant 仅 +1.5%/+0.9%。基线方面,TCO 在 π3 崩溃(Mean AUC@3 -91.5%),Free-Geometry 多数列仅 1% 量级变化,本文全面领先。消融显示双损失+GD 缺一不可;Raw 伪对应精度 0.39 会致训练崩溃,两级滤波提至 0.63 后恢复;GRV 比固定目标视图高 0.05。成本:LoRA 仅 +0.7%–3.4% 参数,DA3-Giant 每场景 1.65 分钟。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 相机位姿估计(VGGT,ETH3D 宽基线户外) | AUC@3 | 0.27 | 0.20(冻结 VGGT) | +37.3% |
| 相机位姿估计(VGGT,ETH3D) | AUC@30 | 0.83 | 0.76 | +9.2% |
| 相机位姿估计(π3,ETH3D) | AUC@3 | 0.41 | 0.33 | +25.1% |
| 相机位姿估计均值(π3,4 数据集) | AUC@3 | 0.48 | 0.45 | +8.3% |
| 相机位姿估计(DA3-Base,HiRoom) | AUC@3 | 0.29 | 0.19 | +54.8% |
| 几何估计(DA3-Base,HiRoom,unposed) | F1 | 0.43 | 0.23 | +85.2% |
| 几何估计(DA3-Small,HiRoom,unposed) | F1 | 0.31 | 0.18 | +70.4% |
| 几何估计均值(DA3-Small,4 数据集,unposed) | F1 | 0.36 | 0.32 | +13.9% |
| 几何估计均值(DA3-Base,4 数据集,unposed) | F1 | 0.48 | 0.42 | +12.2% |
| 与 TCO 对比(π3,4 数据集均值位姿) | AUC@3 | 0.48 | 0.04(π3-TCO) | TCO 相对基线 -91.5%,本文 +8.3% |
局限与改进
作者承认(Sec. S.VI)两点:一是依赖外部特征匹配器 LightGlue——重复纹理、弱纹理、宽基线低重叠场景中匹配质量下降会直接削弱监督信号,且无备用监督源;二是适配延迟虽在分钟级(0.49–5.83 分钟/场景),但离实时要求尚远。我的补充观察:(1) 收益与模型能力负相关——DA3-Giant 上 Mean 仅 +1.5%(位姿)/+0.9%(几何),对最强模型价值有限,而它恰是实际部署首选;(2) VGGT 在 ScanNet++(AUC@3 -2.9%、几何 unposed -10.6%)和 HiRoom(AUC@3 -8.2%)出现回退,说明显式几何约束并非对所有(模型, 场景)组合都安全,checkpoint 准则未能完全规避负迁移,论文也未分析为何 VGGT 受损而 π3/DA3 受益;(3) 伪对应在初始化一次性提取并冻结,模型变准后无法回挖新对应,监督上限被初始匹配质量锁死;(4) 评测限定 DA3 协议下的静态室内外场景(排除 DTU),动态场景未验证;(5) VGGT 在 ETH3D 上总耗时 3.29 分钟,超出'2 分钟'宣传边界,该口径依赖模型选择。
独立分析的弱点
独立分析四点弱点。(1) LightGlue 单点故障:弱纹理/重复纹理/宽基线下 Raw 匹配精度只有 0.39(Table V),两级滤波只是事后剔除、无补救机制,极端场景可能无对应可用;改进方向是用适配中的 VFM 自身特征迭代重匹配,或多匹配器集成加不确定性加权。(2) 一次性伪对应:50 轮 TTA 中 $\mathcal{M}$ 固定,模型变准后原本被滤掉的边界对应可能其实可用;改进方向是每 K 轮用当前模型重估对应(类似自训练的再标注循环)。(3) 逐场景适配不可复用:每个新场景都要重跑 50 轮,多场景积累的修正无法沉淀为通用先验;改进方向是跨场景汇总 LoRA 增量或蒸馏回主干,摊销逐场景收益。(4) GRV 目标视图只在初始化用尚不准的基线模型选一次,动态 GRV(每轮重选)反而更差(w/o p. 0.58 vs 0.60),说明选择对初始预测敏感,环绕拍摄、走廊等极端视角分布场景可能选偏;改进方向是基于预测不确定度或覆盖增益的在线重选。另外 50 轮固定迭代、除 checkpoint 指标外无早停判据,工程上仍有打磨空间。
未来方向
论文结论未列明确的未来工作,可从成果自然延伸的方向包括:(1) 匹配鲁棒性——把 LightGlue 替换或融合为学习式匹配器,或利用适配后的 VFM 特征做第二轮匹配,覆盖弱纹理与宽基线;(2) 与预训练闭环——既然显式几何约束能在测试时低成本修复不一致,可将其作为正则融入 VFM 预训练或持续预训练,从源头消除 Fig. 2 所示的不一致,而非事后修补;(3) 视频流式设定——与 CUT3R/Online3R 类流式模型结合,把逐场景 TTA 推广为在线时序自适应,服务实时 SLAM/AR;(4) 蒸馏加速——把 TTA 学到的逐场景修正蒸馏进前向推理或将 LoRA 合并,消除分钟级延迟;(5) 任务面扩展——从位姿+深度延伸到新视角合成、3D 高斯重建与动态 4D 场景;(6) 与 TCO 的外部先验路线互补——先验可用时自适应加权两种监督。更一般地,'2D 对应即伪 GT'的原则可迁移到其他被预训练遗漏的显式约束(如跨视角光度一致性)。
复现评估
复现条件总体较好。代码承诺开源(GitHub: CMLab-Korea/Self-Geometry,论文标注 'will be released soon',截至论文版尚未放出);全部依赖均为公开组件:LightGlue、六个 VFM(VGGT、π3、DA3 各规模均有开源权重)、四个基准(7Scenes、ETH3D、ScanNet++、HiRoom 均公开且含 GT 位姿/深度)。算力需求适中:单张 RTX PRO 6000 即可,每场景 50 轮 TTA,DA3-Small 仅 0.49 分钟、VGGT 3.29 分钟,全量实验估计单卡数天内可完成。复现细节充分:Table S.1 列出全部超参并声明跨所有模型×数据集组合完全一致(无逐场景调参),Algorithm 1 给出完整伪代码,辅助损失(Monodepth2 式光度/平滑、DWA、MAD-Huber)均有公式与出处。风险点:π3 的 LoRA 只插入 encoder 等细节需读源码确认;TCO 与 Free-Geometry 基线为作者复现重训,对比数字可能有小幅偏差。总体难度:中低,代码发布后应可较顺利复现主表结果。
论文图表
论文首页总览图:标注方法四大卖点(免真值、即插即用、测试时显式多视几何监督、DA3-Giant 在单张 PRO 6000 上每场景 <2 分钟),示意冻结 VFM 的位姿/深度误差如何违反多视几何、Self-Geometry 如何修复,并列出在 VGGT、π3、DA3 与 7Scenes、ETH3D、ScanNet++、HiRoom 上的位姿与几何估计一致提升。
一张图看懂论文的定位、成本与适用范围,是快速判断该方法是否与自己工作相关的入口。
把 HiRoom 一个场景的预测拆解为相机位姿误差、深度误差和最终 pointmap 三列,对比 DA3-Base 原模型、+Free-Geometry(隐式自洽代表)与 +Self-Geometry(本文)。Free-Geometry 对位姿和深度几乎无改善,pointmap 仅边缘提升;本文方法三项同步改善,红色(超阈值误差)区域大幅减少。
全文动机的核心证据:直观证明隐式自洽方法失灵、必须引入显式几何约束,并展示'位姿-深度-pointmap'三者的因果链。
庭院场景上对比两种目标视图选择:任意固定选 v=0 与本文 GRV 选出的 v*=14。上排为相机轨迹俯视图(按 SO(3) bin 着色,黄色星为目标),下排为各 bin 的源视图计数;GRV 的 bin 熵从 1.22 提高到 1.98,源视图分布明显更均匀。
把抽象的'熵最大化选目标视图'落到具体场景,直观展示视角覆盖差异,配合 Table VI 验证 GRV 的增益。
按 GT-free、Teacher-free、Plug-and-play、Explicit-Geometry 四个轴对比冻结 VFM(VGGT/π3/DA3)、微调类(Pow3R/Fin3R/Selfi)、TTA 类(TCO/Free-Geometry/SelfEvo/TTT3R/Online3R/Test3R/LoRA3D)与本文:已有方法各缺一轴,仅本文四轴全满足。
一张表说清本文在文献版图中的位置和差异化卖点,是定位论证的骨架。
6 个预训练模型各自 baseline/-TCO/-Fr/-Ours 四行的完整位姿结果(括号内为相对基线的百分比变化)。亮点:VGGT ETH3D AUC@3 +37.3%、π3 ETH3D +25.1%、DA3-B HiRoom +54.8%、DA3-S HiRoom +64.8%;败笔:π3-TCO 全线崩溃(Mean -91.5%),VGGT-Ours 在 ScanNet++/HiRoom 小幅回退。
核心主表之一,全部位姿结论与'模型越弱收益越大'的规律都出自这张表。
几何估计 F1 完整结果,unposed(用预测位姿)与 posed(GT 位姿,纯深度)两种模式。亮点:DA3-B HiRoom unposed +85.2%、DA3-S +70.4%;unposed 增益普遍大于 posed,说明位姿改善带动了几何改善;VGGT-Ours 在 ScanNet++ unposed -10.6%。
核心主表之二,与 Table II 互为印证:位姿与深度指标的联动关系在此表中清晰可见。
GDO 消融:块 (i) 去 MVC(几乎无提升)或去 EC(次优);块 (ii) 双损失组合但变换 GD 策略——无 GD 使 F1 (w/ p.) 从 0.50 跌到 0.45,本文的 EC 梯度方向解耦最优(AUC@1/3/30=0.07/0.27/0.83,F1=0.47/0.60),优于 MVC 方向与双向解耦。
证明双损失缺一不可、且 GD 的投影方向选择有讲究,是方法核心设计的消融证据。
滤波消融:Raw 对应精度仅 0.39 且下游崩溃(AUC@3 0.04、F1 0.17);EC 滤波提精度至 0.56;MVC 滤波 0.62;本文 EC+MVC 顺序滤波精度 0.63、AUC@1/3/30=0.07/0.27/0.83、F1=0.47/0.60 全场最优(Recall 从 1.00 降到 0.88 的代价可接受)。
量化了'伪对应质量决定适配成败':没有滤波不仅无增益反而严重负迁移,是复现时最容易踩的坑。
FAN 消融:块 (i) SO(3) bin 宽 15°/30°/45° 性能相当(对超参鲁棒);块 (ii) GRV 选目标视图(AUC@3 0.27)显著优于固定 v=0(0.22),动态 GRV(每轮重选)略差;块 (iii) 源视图排序策略影响很小。
说明 FAN 中真正起作用的是目标视图选择而非采样细节,帮助读者抓住组件的主次。
六个模型的 LoRA 新增参数(0.7%–3.4%,1.18M–18.87M)与 ETH3D 每场景耗时分解(Init 匹配约 0.3 分钟、FAN 仅 0.01–0.02 分钟、GDO 0.21–2.98 分钟):DA3-Small 总计 0.49 分钟,VGGT 3.29 分钟;另列 7Scenes/ScanNet++/HiRoom 总耗时(HiRoom 最快 0.33–2.22 分钟)。
给出方法的真实成本账单,是判断'2 分钟/场景'宣传口径适用范围和实际可部署性的依据。
全部 TTA 超参:50 轮迭代、AdamW、lr 5e-5、权重衰减 0.05、cosine+5% warmup、最终 lr 1e-8、梯度裁剪 5.0、LoRA rank/alpha 64、dropout 0.1;并强调这些值跨 6 模型×4 数据集完全一致,无任何逐模型或逐数据集调参。
复现的关键依据:超参全共享是'即插即用'声明的量化支撑,也大幅降低复现的调参成本。
完整伪代码:基线前向 → LightGlue 提取并两级滤波伪对应 → 估计逐场景 Huber 阈值 → GRV 选目标视图 → 50 轮循环(ANS 采样、前向、五个损失、Huber 化、DWA、GD、梯度裁剪与 AdamW 更新、按尺度不变指标保存最优 LoRA)→ 返回最优参数。
把方法章节所有公式串成可执行流程,是复现实现时对照源码的路线图。
7Scenes 上六个预训练模型各自 F1 提升最大场景的补充定性结果,含深度误差图与点云误差图,对比 Original/+TCO/+Free-Geometry/+Ours。
补充验证主结果在不同场景上的稳定性,确认 Fig. 4 不是挑选出来的孤例。
ScanNet++ 上六模型各自最大 F1 提升场景的补充定性对比,格式同 Fig. S.1。
同上,扩大定性证据的场景覆盖面。
HiRoom 上六模型各自最大 F1 提升场景的补充定性对比,格式同 Fig. S.1;HiRoom 是本文增益最大的数据集。
展示增益最大数据集上的视觉证据,与 Table II/III 中 HiRoom 的大幅提升相互印证。