GaussianSelector:基于图优化的轻量级3D高斯泼溅人机协同物体选择 GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization
训练免、无需预训练模型的3D高斯稀疏涂鸦交互式物体选择框架
前置知识
3D Gaussian Splatting (3DGS)
一种新兴的3D场景表示方法,用一组各向异性3D高斯基元 $G_i$ 来表示场景,每个高斯由均值 $\mu_i$、对数尺度 $s_i$、旋转 $R_i$、不透明度 $\alpha_i$ 和球谐(SH)辐射系数 $c_i$ 参数化。空间范围由协方差 $\Sigma_i = R_i \text{diag}(\exp 2s_i) R_i^\top$ 决定。渲染时通过可微分的光栅化把高斯投影并 alpha 合成到像素,比 NeRF 训练和渲染都快,且保留了显式的3D几何结构。
本文所有方法都直接操作这些原生高斯基元,理解其参数化和渲染机制是读懂 CAC 特征、可见性覆盖以及图结构构建的基础。
图割(Graph Cut)与 s-t 最小割
把像素或节点建模为图的顶点,节点带一元代价(unary cost),相邻节点带成对代价(pairwise cost)。当能量是子模的二值 Potts 形式 $E(L) = \sum_k D_k(L_k) + \lambda \sum_{(i,j)} w_{ij} \mathbb{1}[L_i \neq L_j]$ 时,可用 s-t 最小割在多项式时间内求出全局最优二值标注。
本文的核心就是把物体选择写成这样的能量最小化,并在超点图上用 s-t min-cut 求得精确全局最优解,这是其结果质量和效率的根本来源。
球谐函数(Spherical Harmonics, SH)辐射场
球谐是一组定义在球面上的正交基函数,常用来表示视角相关的颜色。3DGS 通常用低阶(如3阶)SH 系数 $c_i$ 来编码每个高斯从不同方向看时的颜色。直接在原始 SH 系数空间算距离不可靠,因为同一渲染外观可由多组不同系数向量表达(非唯一表示歧义)。
正是出于对 SH 非唯一性的警惕,作者设计了 Canonical Axis Color(CAC)特征,把 SH 投影到高斯支撑的主轴上,得到稳定可比的18维描述子。
Leiden 社区发现 / 超点(Superpoint)
Leiden 是一种改进的图社区检测算法,能找到连通紧密、模块度高的节点簇。把相似的高斯基元聚成一个超点 $S_k$,相当于过分割(over-segmentation),让后续标注和图割在更紧凑的抽象层上进行,从而降低优化复杂度。
超点是本文把稠密高斯压缩成可管理结构的核心抽象,理解它才能理解为什么选择边界会自然落在社区接缝处。
研究动机
在重建好的3DGS场景里选中一个完整3D物体,是场景编辑、资产提取、机器人操作和具身感知的基础能力。但现有3DGS方法两条主流路线都代价高昂:第一条是特征场学习类(如 LangSplat、VLGaussian、SAGA、OmniSeg3D),需要重新训练3DGS骨干把语义/CLIP/DINO蒸馏进高斯特征,训练时间动辄上千秒(如 SAGA 训练需 1407.3 秒,OmniSeg3D 需 2960.2 秒),还依赖昂贵的2D监督标注;第二条是 SAM 提升类(如 SA3D、GaussianGrouping、FlashSplat、GaussianCut),需要稠密多视角的SAM掩码再回投到3D,VRAM 占用大、且掩码跨视角不一致,遮挡和外观变化会让3D选择出现断裂和歧义。更现实的问题是:真实场景下用户很难在大量视角上逐张画涂鸦,稀疏视角+稀疏涂鸦才是实际可得的交互方式。
本文的目标是作者想做一个训练免(training-free)、神经网络免(不依赖SAM或CLIP等预训练分割网络)、即插即用(plug-and-play)的交互式3D物体选择框架,只用单视角或极少数视角的稀疏涂鸦,就能直接在原生3D高斯基元上恢复出完整的高质量3D物体选择。同时要在不重训、不微调、不精修底层3DGS表示的前提下,支持多轮人在回路的迭代精修,让用户加一笔涂鸦就能即时更新3D选择,做到响应快、VRAM 占用低、适合真实部署。
与已有工作不同的是,独特切入角度是:放弃「向3DGS里再学语义」或「用2D大模型生成掩码再提升」这两条老路,转而直接挖掘3D高斯本身固有的外观(SH辐射)与几何(位置、不透明度)线索,用图结构把它压缩成超点图,再把稀疏涂鸦通过可见性感知机制广播为前景/背景种子,最后用图割在超点图上做全局最优二值标注。这样既绕开了稠密多视角SAM的依赖,又把交互部分和场景编码解耦——场景级的大图只算一次,后续每轮交互只重算证据广播和图割,从而把推理时间压到 0.2 分钟级。
核心方法
整体思路是把交互式物体选择建模成一个 MAP 后验最大化问题 $P(L | G, M) \propto P(M | L, G) \cdot P(L | G)$,取负对数得到要最小化的能量 $E(L) = \sum_{k \in V_s} D_k(L_k) + \lambda \sum_{(i,j) \in E_s} w_{ij} \mathbb{1}[L_i \neq L_j]$,其中一元项 $D_k$ 来自涂鸦证据,成对项 $w_{ij}$ 编码场景连续性先验。技术路线分三阶段:先做与涂鸦无关的场景编码(算 CAC 特征、Leiden 聚超点、建超点 k-NN 图,缓存一次);再把用户涂鸦通过可见性感知广播成超点级前景/背景种子;最后用 GMM 对比建模求一元代价,在超点图上做 s-t 最小割求全局最优标注,再把标签广播回每个高斯得到稠密3D选择。这种解耦让人机迭代特别高效。
本质创新有两点。第一是「场景编码与涂鸦建模解耦」:大尺度稠密高斯图、CAC特征、超点图只在场景载入时算一次,之后每轮交互只重跑证据广播+GMM对比+超点图割,推理压到约0.2分钟,而 GaussianCut 推理要90.8秒、OmniSeg3D 总耗时3066.5秒。第二是「原生高斯线索替代神经网络」:用 Canonical Axis Color(CAC)18维描述子替代CLIP/DINO语义,把SH辐射沿高斯六个本征轴 $\pm e_x,\pm e_y,\pm e_z$ 求值归一化,避开SH非唯一表示歧义;用 alpha 透射覆盖 $\rho_i=\frac{\sum_p \alpha_i^p T_i^p \mathbb{1}_M(p)}{\sum_p \alpha_i^p T_i^p+\epsilon}$ 量化「这个高斯到底多少落在涂鸦里」,比单纯看投影中心更贴合软体积可见性。再用 Neyman–Pearson 意义下最优的对数似然比 $\delta_k=\log\frac{p_F(\phi_k)}{p_B(\phi_k)}$ 作判别统计量,理论上有最强区分力。
方法步骤详情
算法1给出完整流程。场景编码阶段(一次性缓存):(1) 对每个高斯按式(3)算 CAC 描述子 $f_i$,沿 $D=\{\pm e_x,\pm e_y,\pm e_z\}$ 把 $R_i\text{diag}(\exp s_i)d$ 归一化后代入SH得到18维向量;(2) 建带权 k-NN 高斯图,权重 $w_{ij}=\exp(-d_{ij}^2/\sigma_{ij}^2)$,其中 $d_{ij}=w_x d_x+w_c d_c+w_o d_o$,$\sigma_{ij}=\sqrt{\gamma_i\gamma_j}$ 用邻域中位距离自调,并用0.95分位门控剔除异常边;(3) 用 Leiden 聚成超点 $S_k$,每个超点存均值 $\bar\mu_k$、CAC $\bar f_k$、不透明度 $\bar\alpha_k$;(4) 在超点中心上建超点图 $G_s=(V_s,E_s)$。证据广播阶段:按式(6)算可见性覆盖 $\rho_i=\frac{\sum_p \alpha_i^p T_i^p \mathbb{1}_M(p)}{\sum_p \alpha_i^p T_i^p + \epsilon}$,超阈值的赋种子 $y_i\in\{F,B\}$、模糊记 $U$,多视角多数投票,再按 $\tilde y_k=\text{majority}\{y_i:i\in S_k\}$ 广播到超点。对比建模:用标准化特征 $\phi_k=[z(\bar f_k),z(\bar\alpha_k)]$,分别给前景、背景种子各拟合3分量GMM,算对数似然比 $\delta_k=\log(p_F/p_B)$ 并做对比仿射归一化 $\hat\delta_k=s(\delta_k-m)$。优化:一元代价 $D_k(c)=-\log\frac{\exp(sg(\delta_k,c))}{\exp\delta_k+\exp(-\delta_k)}+\beta\mathbb{1}[\tilde y_k\neq c]$,在超点图上用 s-t 最小割精确求 $L^*$,限制到前景子图迭代重估直至收敛,最后广播回高斯得 $\hat G=\{G_i:L^*_{k(i)}=F\}$。还提供 ROI 变体,只在涂鸦初始化的局部包围盒内建图优化,适合大场景里选小物体。
技术新颖性
技术新颖性体现在四方面:一是首次用「图抽象+证据建模」把3DGS交互选择写成纯原生高斯空间的能量最小化,不引入任何预训练分割网络,真正做到 plug-and-play;二是提出 CAC 特征,用SH沿高斯本征轴的矩投影作为「渲染器对齐」的稳定外观描述子,规避SH非唯一歧义;三是提出 alpha 透射可见性覆盖来量化软体积可见性,比硬投影中心判断更准确;四是把场景编码与交互解耦,配合迭代子图重估,让单轮推理压到0.2分钟、VRAM大幅降低。与 NVOS、GaussianCut 等在神经渲染表示上直接做细粒度图割(优化复杂度高)的方法相比,本文在超点层抽象上做图割,复杂度更低;与依赖语义嵌入定义超点的 AG2aussian、InstanceGaussian 相比,本文完全靠固有3DGS属性定义超点,避免语义学习开销。
实验结果
逐表分析核心发现。Table 1(NVOS)单轮设置下,仅用单视角+NVOS涂鸦,本文就达85.3 mIoU,远超同单视角的 NVOS 基线(70.1 mIoU),提升约15个点;多轮设置下2轮89.6、3轮92.2 mIoU,已与依赖稠密全视角SAM的强基线(GaussianCut 92.5、iSegMan 92.0、OmniSeg3D 91.7)相当,而本文只需2-3视角、不依赖SAM、推理仅0.2分钟,对比 GaussianCut 2.1分钟、OmniSeg3D 51.1分钟。Table 2(3D-OVS)本文93.2、ROI变体93.6 mIoU,仅次于GaussianCut的94.4,超过SAGA(86.5)、GaussianGrouping(82.9)。Table 3(运行时)最有说服力:本文总耗时仅11.6秒、ROI 3.2秒,对比 GaussianGrouping 1667.1秒、SAGA 1644.4秒、OmniSeg3D 3066.5秒,快两个数量级;推理阶段本文0.3秒,GaussianCut却要90.8秒。Table 4(消融)证明各组件贡献:仅涂鸦33.2、去图传播61.0、去一元79.6、去CAC或均匀边均80.3、完整版85.3,说明一元证据和图传播缺一不可、CAC更稳。Table 5(12人用户研究)本文意图匹配6.3±0.6、等待可接受度6.5±0.5、SUS 84.2±6.8全面领先,等待可接受度领先尤其悬殊(6.5 vs 3.4/3.9)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| NVOS单视角物体选择 | mIoU | 85.3 | NVOS 70.1 | +15.2 mIoU |
| NVOS多轮交互选择 | mIoU | 92.2(3轮) | OmniSeg3D 91.7(全视角) | +0.5 mIoU,且视角数3 vs ALL、推理0.2min vs 51.1min |
| 3D-OVS交互式物体选择 | mIoU | Ours-ROI 93.6 | GaussianCut 94.4 | 几乎持平(-0.8)但推理快3个数量级 |
| NVOS平均总运行时 | 秒 | 11.6(ROI 3.2) | OmniSeg3D 3066.5 | 快约264倍 |
| 可用性 SUS | 0-100分 | 84.2±6.8 | GaussianCut 63.5、FlashSplat 60.8 | +20.7 / +23.4 |
局限与改进
作者在结论里承认仍与最强基线(GaussianCut 92.5)有小差距,且主要靠多轮交互追平而非单轮超越。我从论文中观察到几点:一是评测规模偏小,定量基准只有 NVOS 的8个任务和3D-OVS的5个场景,缺乏大规模、开放词汇或动态场景的验证;二是CAC只有18维,本质是SH的低阶投影,对复杂视角相关外观(高光、镜面、透明、纹理细密物体)的判别力可能不足,消融里「w/o CAC」仍有80.3说明上限受限;三是仍有三个用户可调超参(过分割粒度、连通分量阈值、尺度异常判据),需要用户凭直觉和即时反馈反复试,自动化程度不够;四是虽然号称神经网络免,但3DGS本身的重建/渲染仍需GPU(实验用 V100),对没有GPU的用户并不算真正「轻量」;五是多视角种子靠多数投票,当视角覆盖严重不足或涂鸦噪声大时,种子标签可能不可靠,文中用软 $\beta$ 权重而非硬约束来缓解,但极端情况下仍可能传播错误。
独立分析的弱点
弱点一:稀疏视角下种子证据稀薄,若用户第一笔画错或物体外观与背景接近(低对比),GMM对比统计量 $\delta_k$ 区分度差,单轮结果易退化(消融显示仅涂鸦33.2、去图61.0)。改进方向是引入轻量的语义先验(如可选的CLIP特征作为高代价的备用通道)或主动学习提示用户补涂鸦。弱点二:超点粒度固定后难以兼顾大物体和小细节,过粗漏边界、过细优化慢。改进方向是分层超点金字塔或多尺度图割。弱点三:评测基准太小,NVOS仅8任务、3D-OVS仅5场景,难以反映开放场景泛化。改进方向是在更大规模基准(如 ScanNet++、LERF)上验证,并扩展到开放词汇和实例级选择。弱点四:CAC的18维是SH的矩投影,丢失高阶视角信息。改进方向是用更高阶的本征轴采样或可学习(但仍轻量)的外观头。弱点五:用户研究只12人,统计功效有限,且视觉满意度三项接近(5.9 vs 6.0 vs 5.9),说明选择质量上未碾压。改进方向是更大规模、多任务类型的用户研究。
未来方向
作者方向:把「场景编码与交互解耦」的设计推广到更高效的实时人在回路工作流,并探索 ROI 变体在大场景里选小物体的应用。我基于成果可延伸的方向包括:(1) 把框架扩展到4D/动态3DGS(如形变物体、运动场景),用时间维度上的超点对应实现跨帧一致性选择;(2) 结合开放词汇,用 CAC+可选语义嵌入实现「选那个红色的椅子」这类自然语言驱动选择;(3) 把选择结果直接送入场景编辑/资产导出流水线,验证端到端可用性;(4) 用图传播结果反过来弱监督学习一个轻量语义头,逐步把训练免升级为少训练;(5) 探索该图割框架在其他显式3D表示(点云、体素)上的迁移,验证「原生线索+图抽象+证据广播」范式的通用性。
复现评估
复现性中等偏好。论文给出了关键实现细节:硬件 AMD Ryzen 9 9950X3D CPU + NVIDIA V100 GPU;默认超参 3 个 GMM 分量、k=8 的 k-NN、0.95 分位门控、种子置信度0.95、种子证据权重 $\beta=4.0$;用户可调超参也明确列出(过分割粒度、连通分量阈值、尺度异常判据)。评测基准 NVOS、3D-OVS 是公开数据集,指标定义清晰(渲染评估视角掩码与真值的 IoU)。能量最小化用标准 s-t min-cut、聚类用 Leiden、对比用标准 GMM,均有成熟开源实现。不足之处:论文未在摘要或正文明确给出代码/权重开源链接,CAC、可见性覆盖的具体代码实现细节(如 $T_i^p$ 累计透射的实现、GMM 拟合的初始化)需读者自行推导;ROI 变体的包围盒初始化和过滤阈值未完全给数。总体上熟悉3DGS渲染和图论工具链的研究者能在合理时间内复现主结果,但完全复刻数字仍需与作者沟通细节。
论文图表
展示框架总览:左边是输入的2D视角图像和用户画的前景/背景涂鸦,中间把涂鸦提升为前景/背景节点,右边在3D高斯空间里用图优化得到优化割和最终选择结果。
一图让人秒懂本文做什么——稀疏涂鸦进、3D物体选择出,且强调 plug-and-play 和交互式,是理解动机与定位的最佳入口。
算法伪代码:先做一次性场景编码(算CAC、建k-NN图、Leiden聚超点、建超点图),再把涂鸦广播成超点种子,然后迭代地拟合GMM、算一元代价、用s-t最小割求L*,限制到前景子图重估直至收敛,最后广播到高斯输出。
把整个流程的输入输出和迭代结构精确化,是复现和实现的关键参照,尤其凸显场景编码与交互解耦的设计。