← 返回 2026-07-23

ATSplat:基于自适应令牌扩展的紧凑前馈3D高斯泼溅 ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim 📅 2026-07-22 👍 9 2026-07-28 18:30
3D高斯泼溅 前馈重建模型 多视角重建 新视角合成 自适应表征分配

用自适应3D锚令牌把前馈3DGS的高斯预算按场景难度分配

前置知识

3D高斯泼溅 (3D Gaussian Splatting, 3DGS)

用一组各向异性3D高斯基元(每个基元带中心位置、旋转、缩放、不透明度、球谐系数)表示场景,通过可微光栅化做alpha-compositing渲染成图像。它的核心优势不是高斯本身,而是优化过程会做densification(自适应增密):在重建不足的区域分裂、克隆高斯,从而按场景复杂度分配表征容量。

本文全部动机都建立在'优化式3DGS能自适应分配容量,而前馈方法丢掉了它'这一对比上,不理解3DGS的densification就读不懂ATSplat在补什么洞。

前馈3DGS与像素对齐 (Feed-forward 3DGS / pixel-aligned)

用一个大网络从多视角带位姿图像一次性(单次前向传播)预测所有高斯属性,免去逐场景优化。主流做法是pixel-aligned:每个输入像素回归一个高斯,中心用预测深度沿相机光线反投影 $\mu_v(x)=o_v+d_v(x)r_v(x)$。基元数量=像素数×视角数,强绑定图像分辨率。

像素对齐正是ATSplat要攻击的靶子——它把容量绑定到图像网格而非场景难度,产生大量冗余高斯。理解这一点才能看懂'锚点+偏移'解耦的价值。

新视角合成 (Novel-View Synthesis, NVS)

给定若干已知位姿的输入视角,合成从任意新位姿看到的图像。评测指标用PSNR(像素重建精度)、SSIM(结构相似度)、LPIPS(感知相似度),并统计高斯数量和推理/渲染时间作为效率指标。

这是本文全部实验的任务和评测口径,RealEstate10K、DL3DV两大基准都按此协议对比。

锚点高斯与Scaffold-GS (Anchor-based Gaussians)

Scaffold-GS等优化式方法不直接存全部高斯,而是存一组稀疏3D锚点,每个锚点用可学习的相对偏移解码出一簇局部高斯,从而用结构化、紧凑的方式组织场景。ATSplat把这一'锚点+相对偏移'思想搬进了前馈框架。

ATSplat的基元放置用 $\mu_{i,k}=p_i+\Delta\mu_{i,k}$(锚点加相对偏移),正是借鉴此思想来摆脱像素光线约束,这是它区别于像素对齐方法的关键。

Transformer交叉注意力与令牌 (Cross-attention / tokens)

把3D锚点当作一组可变数量的'token',解码器用交叉注意力把细粒度图像特征注入这些token;不确定性预测和令牌扩展都在这套transformer解码块里完成。ATE本质上是'选top比例token→线性投影裂解成M个子token'。

整个解码器和ATE模块都是transformer语言,理解token、cross-attention才能跟上方法步骤和为什么扩展能'分配计算容量'。

研究动机

现有多数前馈3D高斯泼溅(feed-forward 3DGS)方法采用像素对齐(pixel-aligned)建模:在每个输入像素上回归一个高斯基元,再沿相机光线反投影到3D空间。这把基元的数量与位置和图像分辨率、输入视角数强绑定,而不是和场景本身的重建难度对齐。后果是纹理简单、平坦的区域被塞进大量冗余高斯,而细杆结构、复杂几何、视点外内容这些真正需要更多容量的区域却拿不到补充。例如在DL3DV的512×960高分辨率设置下,DepthSplat要生成约5898K个高斯才能覆盖场景,iLRM也需要1474K,存储与渲染开销都很大。更深层的问题是,这种像素绑定丢失了优化式3DGS最核心的优势——按场景复杂度自适应分配表征容量(densification机制),使前馈方法本质上退化为'把容量按图像网格均匀撒下去'。

本文的目标是本文要在单次前向传播中恢复优化式3DGS的场景自适应容量分配能力,同时保住前馈方法的速度优势。具体目标是让高斯基元的数量与空间分布由场景重建难度决定,而非由输入像素网格决定,从而用远少于像素对齐方法的基元数实现同等甚至更好的渲染质量。量化指标上,希望在RealEstate10K、DL3DV两大基准取得SOTA渲染质量的同时,把高斯数量相比稠密像素对齐方法减少5.7倍以上;并在512×960高分辨率下用单张商用GPU在不到1秒内完成重建、以1136 FPS实时渲染(仅311K高斯)。

与已有工作不同的是,已有的'紧凑型前馈3DGS'工作要么对已重建的像素对齐高斯做事后剪枝/融合(如FreeSplat、Gaussian Graph Network、Fuse-and-Refine),要么用均匀空间下采样(如iLRM把高斯在2倍下采样网格上预测,TokenGS用全局可学token)。这些手段要么是后处理、要么无法区分难易区域——均匀下采样会连同复杂区域一起把容量削掉。ATSplat的独特切入角度是把优化式3DGS的三条核心设计原则——稀疏初始化、3D自由放置、自适应容量分配——重新诠释为围绕'3D锚点令牌(anchor tokens)'的前馈操作,并用'学习到的不确定性分数'在前向过程中直接定位需要扩容的区域,无需访问渲染误差或梯度。这是从'表征如何参数化'层面解决容量分配,而非事后修补。

核心方法

整体直觉是'像优化式3DGS那样先搭稀疏骨架、再按难度补强'。技术路线:先冻结DINO骨干从多视角图像提取粗粒度patch特征并预测patch级深度,把深度沿光线反投影到3D,得到一组稀疏的'3D锚点令牌'作为场景精简骨架;再用image-to-3D解码器以交叉注意力把细粒度图像信息注入这些锚点,解码器内的ATE模块逐块挑出高不确定性的锚点并扩展开来;最后每个精炼锚点被解码成 $K=16$ 个局部3D高斯,中心表示为相对锚点的可学习3D偏移 $\mu_{i,k}=p_i+\Delta\mu_{i,k}$,从而把基元位置从输入像素网格上解放出来。整条路线可概括为'稀疏→自适应':稀疏初始化保证紧凑,自适应扩展保证重点区域够用,最终高斯数 $G=K\cdot N_{final}$。

核心创新是把'重建难度'显式建模为一个可在单次前向传播中预测、并被监督对齐到真实渲染误差的不确定性分数 $u_i=g_\phi(f_i)\in\mathbb{R}$。这与优化式3DGS靠反传梯度观察渲染误差来做densification有本质区别:前馈模型推理时拿不到误差或梯度,ATSplat通过在解码器每块之后用当前锚点解码出中间高斯集 $G^{(l)}$、按D-SSIM计算2D误差图 $U^{(l)}$,并把不确定性分数当作标量属性经alpha-compositing渲染成不确定性图 $\hat{U}^{(l)}$,再用损失 $\mathcal{L}^{(l)}_{unc}=\|\hat{U}^{(l)}-\mathrm{sg}(U^{(l)})\|_1$ 监督($\mathrm{sg}(\cdot)$ 阻止梯度流入高斯参数,只更新不确定性头)。配合锚点+相对偏移的自由3D放置,扩容就能精准投到难点区域,这是全文最关键的一点。

方法步骤详情

步骤一(编码):冻结DINOv2-B把每视角token化为粗patch(size 14),注入Plücker光线图嵌入,经12层全局自注意力融合跨视角特征。步骤二(稀疏锚点):MLP对每patch预测深度并反投影到3D得到锚点 $(p_i,f_i)$,再用kNN PointNet式算子聚合局部3D上下文。步骤三(解码+ATE):用2倍分辨率细patch特征,经 $L_d{=}4$ 个块(每块=ATE+交叉注意力)精炼锚点;ATE对每token打不确定性分 $u_i$,选top比例 $\rho_l$ 的锚点,经线性投影裂解为 $M{=}2$ 个子token,与未选中token拼接送入下一块。步骤四(出高斯):2层MLP的Gaussian head把每锚点解码成 $K{=}16$ 个高斯,中心 $\mu_{i,k}=p_i+\Delta\mu_{i,k}$。训练目标含最终渲染损失与各解码块的中间渲染损失、不确定性损失,权重 $\lambda_p{=}0.5,\lambda_{int}{=}0.5,\lambda_{unc}{=}0.1$。

技术新颖性

技术新颖性体现在三点。其一,把优化式3DGS的'自适应densification'移植到前馈框架——此前没人能在不访问渲染误差的前提下做这件事,ATSplat用监督学习的不确定性代理实现,并用stop-gradient($\mathrm{sg}$)保证误差图只训练不确定性头而不污染高斯参数。其二,锚点+相对3D偏移的基元放置打破了像素/光线绑定范式,使基元能自由落在相机光线之外(这对小重叠、外推视角尤其关键,Tab.10外推PSNR达22.11 vs DepthSplat 19.22)。其三,难度度量用D-SSIM而非L1/L2,更贴合人眼对结构差异的敏感度。与同期SparseSplat(按信息丰富度在图像网格上自适应采样)、VolSplat(体素对齐)相比,ATSplat是从patch深度出发构建场景条件的稀疏锚点,而非固定体素/网格,扩展后子token还会继续交叉注意力到图像,实现了'计算容量'也向难点区域倾斜。

框架总览(a)、自适应令牌扩展ATE(b)、锚点到局部高斯(c)
Fig. 2: 框架总览(a)、自适应令牌扩展ATE(b)、锚点到局部高斯(c)
扩展token的可视化
Fig. 3: 扩展token的可视化
不确定性与被选token的可视化
Fig. 4: 不确定性与被选token的可视化

实验结果

在RealEstate10K(256×256,2视角)上ATSplat以28.46/0.894/0.118的PSNR/SSIM/LPIPS追平iLRM(28.65),却只用23K高斯、相比131K的稠密像素对齐方法减少5.7倍,推理0.022s全场最快。在DL3DV(256×448)2/4/6视角下全面领先:6视角达27.28/0.868/0.138(DepthSplat仅24.19/0.823/0.147,iLRM 25.60),用120K高斯而DepthSplat需688K。在512×960高分辨率12视角下取得24.85/0.794/0.241,仅311K高斯、0.677s,远超DepthSplat(5898K)与iLRM(1474K),甚至优于优化10分钟以上的3DGS(22.87)。消融:锚点+偏移(28.46)远优于直接预测xyz(20.87)或可学习初始化(24.62);不确定性选择(28.46)优于随机(27.97)、FPS(27.98)、STE(27.93)和无扩展(27.02)。外推、零样本迁移、小重叠场景均占优,单一统一模型联合训练后质量与分别训练相当。

RealEstate10K 256×256 2视角定量结果
Table 1: RealEstate10K 256×256 2视角定量结果
DL3DV 256×448 2/4/6视角定量结果
Table 2: DL3DV 256×448 2/4/6视角定量结果
DL3DV 512×960高分辨率12视角定量结果
Table 3: DL3DV 512×960高分辨率12视角定量结果
3D锚点设计的消融(RE10K 2视角)
Table 4: 3D锚点设计的消融(RE10K 2视角)
ATE模块的消融(RE10K 2视角)
Table 5: ATE模块的消融(RE10K 2视角)
各实验配置下的token与高斯计数
Table 6: 各实验配置下的token与高斯计数
基于不确定性阈值的逐场景动态预算(RE10K 2视角)
Table 12: 基于不确定性阈值的逐场景动态预算(RE10K 2视角)
RealEstate10K 256×256 2视角定性对比
Fig. 5: RealEstate10K 256×256 2视角定性对比
DL3DV 256×448 6视角定性对比
Fig. 6: DL3DV 256×448 6视角定性对比
DL3DV 512×960 12视角高分辨率定性对比
Fig. 7: DL3DV 512×960 12视角高分辨率定性对比
逐块开启token扩展的效果
Fig. 8: 逐块开启token扩展的效果
查看结构化数据
任务指标本文基线提升
RealEstate10K 256×256 新视角合成(2视角) PSNR / 高斯数 / 推理时间 28.46 dB / 23K / 0.022s iLRM: 28.65 dB / 131K / 0.025s; MVSplat 26.39 / 131K 高斯数减少5.7倍,推理最快;PSNR与最强基线持平
DL3DV 256×448 新视角合成(6视角) PSNR / SSIM / LPIPS / 高斯数 27.28 / 0.868 / 0.138 / 120K DepthSplat: 24.19 / 0.823 / 0.147 / 688K; iLRM 25.60 / 172K PSNR +3.09dB,高斯数减少约5.7倍
DL3DV 512×960 高分辨率(12视角) PSNR / 高斯数 / 推理时间 24.85 dB / 311K / 0.677s DepthSplat: 21.33 / 5898K / 0.758s; iLRM 24.35 / 1474K; 3DGS 22.87(>10min) PSNR +3.52dB vs DepthSplat,高斯少约19倍,且超优化式3DGS
DL3DV 外推视角合成(6视角) PSNR / LPIPS 22.11 / 0.246 DepthSplat: 19.22 / 0.265 PSNR +2.89dB,验证锚点自由放置在视线外的优势

局限与改进

作者承认三点局限:(1)ATE只扩展不剪枝,解码中变冗余的token无法回收,限制了容量分配效率;(2)架构可扩展性有待改进,以支撑更大场景、更多视角和更高分辨率;(3)目前需要已知位姿,未拓展到无位姿(unposed)野外图像。我额外观察到:在RE10K上SSIM(0.894)和LPIPS(0.118)略逊于iLRM(0.900/0.110),说明纹理/感知层面并非全面占优;在大重叠(large-overlap)场景因像素对齐方法本就擅长、ATSplat反而落后(Tab.7大重叠PSNR 29.13 vs iLRM 29.43);不确定性用D-SSIM做代理是启发式,未必完美刻画所有重建难点;高分辨率需把首个ATE选择比从0.5调到0.8,固定比例对设置敏感;粗分支深度质量直接决定锚点几何,深度不准会传导误差。

独立分析的弱点

弱点一:只增不减的容量分配。可借鉴3DGS剪枝思路,引入基于不确定性或不透明度的token剪枝,进一步压预算并加速解码器(作者也点名这是关键方向)。弱点二:大重叠场景退化——可在小重叠用锚点、大重叠回退像素对齐,做混合或门控策略。弱点三:固定选择比例需按分辨率调参(512×960时 $\rho_1$ 从0.5提到0.8),可改为完全场景自适应的阈值机制(Tab.12已显示阈值法能让预算在场景间变化6.9倍且质量不降)。弱点四:依赖已知位姿,可结合PF3plat/NoPoSplat的位姿估计扩展到无位姿。弱点五:误差代理用单尺度D-SSIM是启发式,可换成多尺度或学习式难度估计。弱点六:粗分支深度直接决定锚点几何,深度不准会误差传导,可加显式深度监督或多尺度深度一致性约束。

未来方向

作者明确指出三方向:token剪枝机制(类比3DGS pruning)、更可扩展的架构以支撑大场景/多视角/高分辨率、以及无位姿设定。基于成果可延伸的方向包括:(1)把自适应token思想用于动态场景(4D高斯),按时序扩展关键区域token;(2)用学习式难度估计替代D-SSIM启发式,做端到端的难度感知分配;(3)把动态预算阈值机制(Sec.C.1)做成默认推理策略,实现真正逐场景自适应(已有Tab.12证据支持);(4)扩展到大重建模型LRM骨干,验证大规模预训练下的收益;(5)探索token扩展与表面重建(2DGS/SuGa)结合,用紧凑token生成高质量mesh。统一的跨数据集/跨视角模型(Tab.11)已验证可行,可进一步训练单一通用模型降低部署成本。

复现评估

复现性中等偏上。作者提供项目页(join16.github.io/page-atsplat),训练细节披露充分:PyTorch、BF16、AdamW(weight decay 0.05、初始lr $2\times10^{-4}$、cosine退火+warmup、batch 8/GPU)、12层全局自注意力编码器、4块解码器、$K=16$、$\rho_l=(0.5,0.5,0.25)$、扩展比 $M=2$,并给出各设置下token/高斯计数表(Tab.6,如RE10K 2视角 $N_{init}{=}512,N_{final}{=}1440,G{=}23040$)。数据集(RE10K、DL3DV)与基线均公开。算力门槛较高:基模型4×RTX 4090训练约2天,DL3DV用4×H200训练2天,高分辨率微调用8×H200近2天,对小团队不友好。难点在于冻结DINOv2-B骨干、双分支(粗patch14/细patch8)特征对齐、Plücker嵌入与位姿归一化等工程细节,以及iLRM、LongLRM等部分基线无公开代码。