← 返回 2026-08-04

InfiniSplat:面向大基线单目视图合成的隐式高斯解码 InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng 📅 2026-08-03 👍 63 2026-08-09 18:30
3D高斯泼溅 几何引导采样 前馈3D重建 单图新视图合成 隐式神经表示

几何引导采样加隐式解码,把单图3D高斯从像素对齐推向表面对齐

前置知识

3D高斯泼溅(3D Gaussian Splatting, 3DGS)

用一组带位置、尺度、旋转、颜色、不透明度的3D高斯椭球体显式表示场景辐射场的方法。通过可微分光栅化将3D高斯投影叠加到2D图像平面实现渲染,兼具高视觉质量和实时性能,已成为新视图合成的主流显式表示。

InfiniSplat的最终输出就是一组3D高斯基元,理解高斯属性(位置、尺度、旋转、颜色、不透明度)及其渲染流程是理解方法的基础,所有改进都围绕'如何更好地放置和参数化这些高斯'展开。

新视图合成(Novel View Synthesis, NVS)

给定场景若干已有视图(本文仅单张),合成从新视角观察该场景的图像。核心难点是3D结构高度欠约束——单张图像无法确定被遮挡区域和深度歧义,大基线视角变化尤其困难。

本文目标任务就是单图前馈NVS,方法以PSNR/SSIM/LPIPS等NVS指标评估,大基线下渲染结构稳定性是核心关注点,理解NVS才能理解为什么'像素对齐'在大基线下会失效。

单目深度估计

从单张RGB图像预测每个像素的深度值。本文用预训练DepthPro模型提供稠密深度图和相机内参估计,作为几何引导采样的几何先验;LiDAR变体则用InfiniDepth-Metric融合1500个稀疏深度提示。

几何引导采样完全依赖单目深度先验质量,深度估计的误差(反射面、透明物、无纹理区)会直接传递到高斯支撑分布,是方法性能上界和主要失效来源。

像素对齐 vs 表面对齐表示

像素对齐指每个高斯从固定图像网格位置生成,与像素一一对应、更像局部'泼溅展开';表面对齐指高斯位置跟随真实场景表面结构排布、邻近高斯拼装成连贯曲面。前者近视角尚可但大基线下出现撕裂断裂。

这是本文核心论点和切入点——从像素对齐转向表面对齐是解决大基线单图3DGS的关键,理解两者本质差异才能理解几何引导采样和隐式解码为何缺一不可。

隐式神经表示与查询条件解码

将信号建模为定义在坐标上的连续函数,可查询任意坐标得到对应值(如LIIF将图像表示为连续函数实现超分辨率)。本文将高斯属性预测建模为查询条件的隐式解码:在支撑点坐标处双线性查询图像特征,再用共享MLP预测属性残差。

隐式解码使模型能处理几何引导采样产生的不规则(非网格)支撑点分布,这是脱离固定像素网格、实现灵活支撑布局的技术关键,与几何引导采样互为支撑。

研究动机

现有单图前馈3DGS方法(SHARP、Flash3D、Splatter Image等)能在输入视角附近合成不错的渲染,但其核心局限是像素对齐表示:每个高斯基元从固定图像网格位置预测,更像在像素处局部'泼溅展开'而非构建贴合场景表面的连贯3D结构。当目标相机大幅偏离源视角(尤其侧向大基线),原本近距离看起来高质量的渲染会暴露撕裂、表面断裂、松散结构和严重几何畸变。SHARP在近视角锐度高,但大侧视时大平面和物体边界处出现明显撕裂与不连续。评估采用四个真实数据集(ETH3D、ScanNet++、Tanks-and-Temples、DL3DV),每个512对源-目标视角,按0–0.5m、0.5–1m、1–2m、2m以上四档基线分组,恰恰在这些大基线区间像素对齐方法的弱点最为突出,且要求源-目标视锥重叠超过60%以保证公共可见性。

本文的目标是本文目标是构建一个前馈单图3DGS框架,使其生成的3D高斯表示在大基线视角变化下仍保持结构连贯,而非仅在源视角附近的'局部泼溅展开'。具体而言,要让高斯支撑点跟随深度诱导的局部表面结构排布,同时让高斯属性预测脱离固定像素中心的约束,使邻近基元能拼装成连贯曲面。通过在ETH3D、ScanNet++、Tanks-and-Temples、DL3DV四个跨数据集零样本评估中取得优于SHARP、Flash3D、LagerNVS、LVSM等前馈基线的PSNR/SSIM/LPIPS表现,并展示从Hypersim室内合成训练到复杂开放世界场景的零样本泛化能力,证明单图前馈3DGS能够突破像素对齐泼溅展开、走向更结构稳定的场景表示。

与已有工作不同的是,本文独特切入角度是识别出'像素对齐'才是前馈单图高斯重建的根本瓶颈,而非简单改进深度先验或网络容量。已有查询式方法(C3G、TokenGS)用可学习查询token聚合多视图特征解码紧凑高斯,但单图场景缺乏跨视图约束,可学习查询缺乏几何锚点、难以沿表面组织。InfiniSplat与之不同——用来自单目几何先验的几何引导支撑查询代替自由学习token,再叠加查询条件隐式解码,既保留查询式解码的灵活性、又将生成过程锚定在显式几何结构上,在单视图欠约束场景下形成更受约束、更稳定、更表面贴合的高斯分布。这一视角将问题从'更好的像素回归'重构为'如何改变高斯的支撑域'。

核心方法

直觉上,如果高斯位置不再被锁死在像素网格上、而是按真实表面的几何排布来放置,那么邻近高斯就能拼装成连贯曲面而非各自为政的小泼溅。技术路线分两条并行预处理分支加一个紧耦合双阶段核心:冻结的单目深度模型 $\Phi_{geo}$(DepthPro)预测稠密深度图 $D$ 和内参 $\hat{K}$ 提供几何支架;可训练双分支编码器 $\Phi_{img}$ 提取DINO语义特征图 $F_{dino}$ 和CNN纹理特征图 $F_{cnn}$。核心第一阶段是几何引导采样 $Q$,将深度反投影得到局部3D面片、按面积加权采样2D支撑点并初始化基础高斯;第二阶段是隐式高斯解码 $D_\theta$,在每个支撑点处查询DINO和CNN特征、门控融合后预测有界残差更新。整体公式为 $G = D_\theta(\bar{G}, S, F_{dino}, F_{cnn})$,其中 $S=\{q_i\}$ 是采样支撑集、$\bar{G}=\{\bar{g}_i\}$ 是基础高斯集。

核心创新在于同时满足两个条件使高斯从像素对齐转向表面对齐:(1)几何引导采样决定高斯'放在哪'——按深度诱导的局部表面结构而非固定网格放置支撑点;(2)查询条件隐式解码决定'如何预测'——用共享MLP在不规则支撑分布上查询图像特征预测属性更新。两者缺一不可:没有解码器,不规则支撑无法变成完整高斯;没有几何引导支撑,解码器退化为在无结构点集上操作、缺乏表面先验。与已有像素对齐方法(每像素回归一组高斯)和自由查询token方法(C3G/TokenGS用可学习token)的本质区别在于:InfiniSplat用几何锚定的支撑查询桥接两者,在单视图欠约束场景下仍能沿连贯表面组织高斯,且共享解码器学到统一更新规则使邻近支撑产生一致属性。

方法步骤详情

步骤1:冻结的DepthPro预测深度图与内参,作为几何支架。步骤2:可训练双分支编码器提取DINOv3语义特征与CNN纹理特征,互补提供局部条件信号。步骤3几何引导采样:将每像素反投影到3D,以邻域三角面反投影后的3D面积作归一化采样权重 $w_t=A_t/\sum_{t'}A_{t'}$,丢弃深度突变三角面,按权重在2D三角区采样支撑点,每个初始化为基础高斯(均值取反投影位置、颜色取输入图双线性值,尺度旋转不透明度统一初始化)。步骤4-5查询与门控融合:在各支撑点双线性查询两路特征,再用门控权重自适应平衡语义与纹理得融合描述子。步骤6参数更新:共享MLP由描述子预测位置、尺度、旋转、颜色、不透明度的有界残差,最终高斯均值取 $\mu_i=\Pi^{-1}(\bar u_i+\lambda_{xy}\Delta u_i,\;\bar d_i+\lambda_z\Delta z_i;\hat K)$,其中基础支撑 $\bar u_i$ 与深度 $\bar d_i$ 由采样给定,$\lambda_{xy},\lambda_z$ 控制更新范围;受约束属性在激活空间加性更新以保证取值有效。

技术新颖性

技术新颖性体现在三方面。第一,几何引导采样改变了高斯生成的'支撑域'——不是为了增加点数,而是让大平面、斜面、物体边界、深度变化区获得与其3D面积成比例的支撑密度,从而减少固定网格带来的离散化限制,使高斯更易组织成空间连贯结构而非无关点状泼溅。第二,查询条件隐式解码使单一共享预测函数能处理不同密度和空间排布的支撑集——因为所有基础高斯共享同一特征查询、融合模块和Gaussian MLP,解码器学到统一更新规则,有利于邻近支撑产生一致的放置、形状和外观。第三,将LIIF式隐式表示思想从单通道图像/深度信号扩展到必须联合形成连贯曲面布局的多属性3D高斯基元集合(位置、形状、不透明度、外观),区别于InfiniDepth仅建模深度信号,这是从单信号隐式场到场景级显式几何组织的关键跃迁。

InfiniSplat pipeline.
Fig. 2: InfiniSplat pipeline.
Qualitative effect of learned Gaussian updates.
Fig. 7: Qualitative effect of learned Gaussian updates.
Qualitative effect of image feature branches.
Fig. 8: Qualitative effect of image feature branches.
Qualitative effect of Gaussian regularization.
Fig. 9: Qualitative effect of Gaussian regularization.
Qualitative effect of geometry-guided sampling and implicit decoding.
Fig. 10: Qualitative effect of geometry-guided sampling and implicit decoding.

实验结果

跨数据集零样本评估(Table 1)显示InfiniSplat-RGB在四数据集上全面领先RGB-only基线:平均20.394/0.806/0.277(PSNR/SSIM/LPIPS),较SHARP(18.475/0.758/0.299)提升+1.919 PSNR、+0.048 SSIM、-0.022 LPIPS,较Flash3D、Flash3D-DepthPro、LagerNVS分别提升+3.050、+4.082、+2.934平均PSNR,DL3DV对SHARP增益最大达+3.380。LiDAR版平均22.548/0.851/0.225,较ADGaussian(12.249/0.639/0.418)提升+10.299 PSNR。消融(Table 2)证实:去DINO使ScanNet++ PSNR从22.240暴跌至12.501(泛化核心),去隐式解码降至20.811,去几何引导采样降至21.576且大基线现裂缝。定性(Fig.3-4)显示SHARP大侧视时撕裂断裂、Flash3D全局模糊,InfiniSplat裂缝孔洞更少、法线更连贯。

Quantitative evaluation on zero-shot novel-view synthesis.
Table 1: Quantitative evaluation on zero-shot novel-view synthesis.
Ablation study on representative zero-shot datasets.
Table 2: Ablation study on representative zero-shot datasets.
Support budget ablation.
Table 3: Support budget ablation.
Robustness of InfiniSplat-LiDAR to multiplicative noise in sparse depth prompts.
Table 4: Robustness of InfiniSplat-LiDAR to multiplicative noise in sparse depth prompts.
RGB qualitative comparison under large viewpoint changes.
Fig. 3: RGB qualitative comparison under large viewpoint changes.
Surface and normal comparison.
Fig. 4: Surface and normal comparison.
Qualitative comparison between InfiniSplat-LiDAR and ADGaussian.
Fig. 5: Qualitative comparison between InfiniSplat-LiDAR and ADGaussian.
Qualitative results of InfiniSplat on in-the-wild images.
Fig. 6: Qualitative results of InfiniSplat on in-the-wild images.
查看结构化数据
任务指标本文基线提升
零样本单图NVS(ETH3D,RGB-only,PSNR) PSNR↑ 20.531 SHARP 19.046 +1.485 dB
零样本单图NVS(ScanNet++,RGB-only,PSNR) PSNR↑ 22.240 SHARP 20.801 +1.439 dB
零样本单图NVS(DL3DV,RGB-only,PSNR) PSNR↑ 21.685 SHARP 18.305 +3.380 dB
零样本单图NVS(四数据集平均,RGB-only) PSNR/SSIM/LPIPS 20.394/0.806/0.277 SHARP 18.475/0.758/0.299 +1.919 PSNR, +0.048 SSIM, -0.022 LPIPS
零样本单图NVS(RGB-only平均 vs Flash3D) PSNR↑ 20.394 Flash3D 17.344 +3.050 dB
LiDAR条件单图NVS(三数据集平均) PSNR/SSIM/LPIPS InfiniSplat-LiDAR 22.548/0.851/0.225 ADGaussian 12.249/0.639/0.418 +10.299 PSNR, +0.212 SSIM, -0.193 LPIPS

局限与改进

作者承认的局限:(1)单视图歧义和深度先验不完美带来的几何误差——无法观察遮挡区域或消歧多种3D解释,暴露大未见过区域的视角会产生不完整几何、拉伸结构或幻觉外观;(2)几何引导采样依赖预测深度,在反射面、透明物体、薄结构、无纹理区域或异常场景上采样支撑会落在错误的几何支架上;(3)极端视角外推和非朗伯表面、重复精细结构、极薄几何、强深度不连续仍具挑战(Fig.11展示三类失败案例:大遮挡、错误深度先验、极端外推)。我的观察:评估仅用静态真实数据集,未在视频序列或强非朗伯材质场景量化;DL3DV在LiDAR设置因无可用的源深度未评估;方法对DepthPro深度质量的隐式依赖使深度先验成为单点故障,且训练仅用Hypersim室内合成数据,泛化到极端户外或特殊光照仍待验证。

独立分析的弱点

弱点一:对单目深度先验的单点依赖。反射、透明、薄结构场景的深度估计失效会直接污染整个支撑分布,改进方向是引入不确定性感知的深度估计或轻量多视图线索提供更鲁棒的几何支架。弱点二:遮挡区域的幻觉质量受限于前馈回归范式。源视角看不到的区域只能靠先验猜测,大遮挡场景渲染质量下降明显,改进方向是结合更强的生成式先验(如3D感知扩散模型)补全未见区域。弱点三:仅用Hypersim室内合成数据训练,虽展示了零样本泛化但域偏移仍存在,尤其在极端户外或特殊光照,改进方向是扩充训练数据域或引入域自适应。弱点四:1.5M支撑点在2.0M后收益递减但推理时间从0.598s增至0.772s(Table 3),大场景的推理-渲染权衡仍可优化,可探索自适应支撑预算或高斯稀疏化。

未来方向

作者明确提出未来可结合更强生成式先验、不确定性感知几何估计、或稀疏多视图输入,同时保留前馈高斯预测的效率。基于成果可延伸的方向:(1)将几何引导采样与生成式扩散先验融合,专门处理大遮挡和未见区域的幻觉补全;(2)引入深度不确定性估计,对低置信度区域的支撑分布做自适应调整或拒绝采样,缓解深度先验失效;(3)将框架扩展到时序视频单图NVS,利用时序一致性约束进一步稳定大基线渲染;(4)探索自适应支撑预算机制,根据场景复杂度动态分配高斯数量以优化推理效率;(5)将表面对齐表示的思想迁移到稀疏多视图或文本驱动3D生成任务,验证其通用性。

复现评估

复现评估较好。训练细节充分公开:Hypersim数据集,每样本1上下文+3目标视角,每图1.5M高斯支撑,DINOv3 ViT-L/16加128通道CNN,8块NVIDIA H20 GPU训练约100K步,AdamW优化器学习率 $5\times10^{-5}$,每GPU batch size 1,损失权重 $\lambda_{rgb}=1$、$\lambda_{perc}=1$、$\lambda_{reg}=0.1$,Gram矩阵项 $\gamma=10$,高斯正则 $\lambda_{scale}=0.1$、$\lambda_{smooth}=0.1$,log尺度界限 $[\ell_{min},\ell_{max}]=[-8,-3]$。评估协议清晰:四数据集各512对、四基线区间、60%视锥重叠过滤、统一评估掩码,并按数据集对齐目标尺寸。论文提供项目主页链接(zju3dv.github.io/InfiniSplat)。主要障碍是算力门槛高(8块H20)、依赖DepthPro/InfiniDepth等外部预训练模型,且文中未明确说明代码与权重是否完全开源,复现需要较大工程投入。