AsySPLAT:面向长序列场景建模的高效非对称3D高斯泼溅 AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
用非对称双分支解耦几何与外观,参数减30%、训练提速30%且零样本性能领先
前置知识
3D Gaussian Splatting(3DGS)
3DGS是一种用一组各向异性3D高斯基元(每个高斯由中心 $\mu$、不透明度 $\alpha$、缩放 $s$、四元数 $q$、球谐函数 SH 表示)来表示场景的方法。渲染时通过可微的alpha合成(splatting)将3D高斯投影到2D图像平面。相比NeRF它兼具高保真度与实时渲染速度,且优化效率高,是当前新视角合成的主流方案。
本文的全部工作都建立在3DGS表示之上,理解高斯的属性($\mu_n, \alpha_n, s_n, q_n, SH_n$)及其alpha合成特性是理解作者两个核心观察的基础,尤其是'高保真渲染更多依赖alpha合成而非精确几何'这一关键洞察。
可泛化3DGS / 前馈高斯重建模型
传统3DGS需要对每个场景做耗时的逐场景优化(如3DGS需要13分钟训练30k迭代)。可泛化方法通过数据驱动的先验,以feed-forward方式直接从多视角图像一次性预测3D高斯,跳过逐场景优化。常见做法是用像素对齐的unprojection:在2D图像平面预测高斯属性,再用估计的深度反投影到3D空间。
本文属于可泛化3DGS范畴,对手是LongLRM(142M参数,32视角540×960输入下的SOTA)。要理解AsySPLAT为何要重新分配计算,必须明白前馈模型需要把高分辨率长序列图像patchify成token并堆叠大量层做跨帧交互,这正是冗余的来源。
Patchify与Token交互
在vision transformer中,patchify指将图像切成固定大小的patch并展平为token序列(token长度为 $VHW/p^2$,$p$ 为patch size)。token交互指通过注意力或Mamba等模块让不同位置的token交换信息。注意力复杂度对token长度是二次的 $O((VHW/p_c^2)^2)$,Mamba则是线性的。patch越小、视图越多,token越长,计算开销越大。
本文的核心动机正是patchify带来的token爆炸与冗余。作者用两种粒度切分——粗粒度 $p_c=16$ 喂给几何分支、细粒度 $p_f=8$ 喂给外观分支——并仅在粗粒度token上做昂贵的跨帧交互,这是AsySPLAT非对称设计的关键技术机制。
Mamba与稀疏注意力
Mamba是一种状态空间模型(SSM),用线性复杂度建模长序列,双向Mamba(bidirectional)通过前向和后向扫描让每个token获得完整上下文。注意力机制计算量大但匹配能力强,对于多视图深度估计这种密集匹配任务至关重要。稀疏注意力借鉴MaxViT的grid attention思想,将token重排成2D token map,按 $p_g \times p_g$ 网格分块后再做self-attention,把序列长度从 $VHW/p_c^2$ 降到 $p_g^2 \times (VHW/(p_gp_c)^2)$。
AsySPLAT几何分支采用'Mamba + 稀疏注意力'混合架构,每个stage 4层Mamba + 4层稀疏注意力($4m+4s$)。作者明确指出过度依赖Mamba会损害多视图深度估计,因此必须保留注意力,但又用稀疏注意力把540×960阶段的训练时间从10.5s降到6.0s(减少约40%)。
像素对齐反投影(Pixel-aligned Unprojection)
可泛化3DGS的常用做法:模型在2D图像平面(或下采样后的特征图)上预测每个像素位置对应的3D高斯属性,再用估计的深度将2D位置映射到3D空间。这种方式天然地使'外观属性预测'成为像素对齐的局部任务——只要深度已知,从RGB像素映射到高斯的颜色/球谐是相对直接的。
这是作者第二个核心观察的理论支撑:外观建模比几何重建容易,因为外观本质上是像素对齐的RGB证据分配给高斯,不需要跨帧交互。这解释了为什么外观分支可以只用intra-frame交互(序列长度限制在单帧token数),从而绕过token长度爆炸问题。
研究动机
近期可泛化3DGS方法(如LongLRM)虽然推进了长序列、高分辨率新视角合成,但付出了巨大的冗余计算代价。LongLRM采用堆叠架构,把32视角540×960的输入patchify成大量token,再堆叠24层(142M参数)做跨帧token交互来预测深度和高斯外观属性。这种设计把全部计算都集中在跨帧token交互上,导致训练耗时约76小时、推理20.2 TFLOPs、显存占用高(540×960时52G)。问题的根源在于:为达到高保真渲染,patch必须很小(如 $p=8$)以保留细节,但token长度 $VHW/p^2$ 随之暴涨,注意力的二次复杂度使训练和推理开销急剧上升。作者由此提出一个根本性问题:这种简单堆叠是否引入了大量计算冗余,推高了对参数的需求?
本文的目标是本文的具体目标是在不牺牲(甚至提升)渲染质量的前提下,重新分配可泛化3DGS中的计算与参数预算,使紧凑模型(更少参数、更低训练/推理开销)也能达到强性能。具体而言,作者希望:(1)在32视角960P输入下达到与优化方法(如3DGS需13分钟)相当的质量,但推理时间小于1秒,实现近800×加速;(2)在零样本泛化上超越SOTA前馈模型LongLRM;(3)同时降低参数量(目标减少30%)、训练时间(减少30%)、推理FLOPs(减少20%)、高斯数量(减少50%)和后优化时间(加快60%)。这要求作者从架构层面重新思考计算该花在哪里,而不是简单地堆更多层。
与已有工作不同的是,已有方法(LongLRM、GS-LRM、pixelSplat、MVSplat等)要么专注稀疏视角(≤16视角),要么对长序列采用'一刀切'的堆叠架构,把相同粒度的token、相同计算量无差别地分配给几何和外观建模。本文的独特切入角度是'任务感知的非对称':作者通过两条经验观察(i)高精度几何对新视角合成不是必需的——3DGS渲染的高保真主要来自高斯alpha合成而非精确几何,这一事实已被表面重建研究证实;(ii)外观属性虽然需要高精度,但比几何重建容易——一旦多视图深度建立,只需把像素对齐RGB证据映射到高斯属性即可,无需跨帧交互。基于这两条观察,作者主张把几何和外观解耦成两个分支,按各自精度需求和学习难度分配粒度、计算和参数,这是此前所有可泛化3DGS方法都忽略的视角。
核心方法
AsySPLAT整体思路是'任务感知的非对称计算重分配'。直觉:既然几何只要粗略(观察i)、外观虽精细但易学(观察ii),就没必要让细粒度token卷入昂贵跨帧交互。技术上把输入图(拼接Plücker射线)tokenize成两种粒度——粗粒度 $p_c=16$ 喂几何分支,细粒度 $p_f=8$ 喂外观分支。几何分支承担全部跨帧token交互(序列长度 $VHW/p_c^2$),用三个层次化stage(特征维度 $\{d_s\}=\{192,512,896\}$,每stage 4层双向Mamba + 4层稀疏注意力)做多视图深度重建,占约90%参数。外观分支只做intra-frame交互,用6层MambaVision($d_f=256$ 固定)捕捉细节,仅占约10%参数。两分支每stage末通过bilateral connection交换信息:细→粗注入高频细节,粗→细回传深度线索(如高斯scale与深度相关)。最终两token map经步长 $p_c/p_f$ 卷积融合,每像素映射 $p_f^2$ 个高斯。这设计让细粒度token完全不参与跨帧计算,从根本上消除冗余。
核心创新点是'跨三维度(token粒度、计算分配、参数分布)的非对称解耦'。和已有方法(如LongLRM把细粒度token拖入昂贵跨帧交互)的本质区别在于:AsySPLAT只在粗粒度token上做跨帧匹配(深度估计确实需要),把细粒度token严格限制在intra-frame范围内(外观预测不需要跨帧)。这种解耦带来两个看似矛盾的设计——'粗粒度做几何但占90%参数'与'细粒度做外观但只占10%参数'。作者解释:虽然几何只要粗略,但即使是粗深度预测也隐含着极具挑战的跨视图匹配和多视图立体,仍需大量参数;而外观虽然需要精细,但本质是像素对齐映射,用slim通道即可。这与SlowFast网络的'快慢通路'设计哲学一致。此外,把Mamba省下的算力再投资到更多注意力层以提升紧凑模型的容量,并用自研稀疏注意力(grid partition $p_g=2$)把训练时间压下来,构成第二条关键创新。
方法步骤详情
完整流程分四步。步骤1(Tokenization):$V$ 张 $I_i \in \mathbb{R}^{H\times W \times 3}$ 拼接Plücker射线后,以 $p_c=16$、$p_f=8$ 切分,得粗粒度 $C_0 \in \mathbb{R}^{(VHW/p_c^2)\times d_c}$($d_c=192$)与细粒度 $F_0 \in \mathbb{R}^{V\times(HW/p_f^2)\times d_f}$($d_f=256$)。步骤2(Geometry Branch,三stage):每stage先 $N_b=4$ 层双向Mamba $B_l^s=\text{Mamba}(B_{l-1}^s)$,再 $N_a=4$ 层稀疏注意力 $T_l^s=\text{SparseAttn}(T_{l-1}^s)$,维度按 $\{192,512,896\}$ 增大、扩张比 $\{1,2,3\}$;稀疏注意力把序列reshape成2D map,每帧独立卷积聚合上下文(去掉掉1.0+ PSNR),再按 $2\times 2$ 网格分块做self-attention。步骤3(Appearance Branch,三stage):每stage $N_v=2$ 层MambaVision,$d_f=256$ 不变,全程intra-frame。每stage末bilateral connection:$C^s=\text{Reshape}(\text{CrossAttn}(\tilde{C}^s,\tilde{F}^s))$、$F^s=\text{SelfAttn}(\text{CrossAttn}(\tilde{F}^s,\tilde{C}^s))$。步骤4(Merging):两token map经 $3\times 3$ 步长 $p_c/p_f=2$ 卷积融合,每像素解码 $p_f^2$ 个高斯,共 $VHW(p_f/p_c)^2$ 个。训练渐进分辨率 $256^2$/bs256/60k → $512^2$/bs64/10k → $540\times 960$/bs64/10k,配FlashAttention-2、梯度检查点、BFloat16、deferred backpropagation。
技术新颖性
技术新颖性分四层。第一,'非对称架构'首次把可泛化3DGS中无差别token交互拆成任务感知双分支:粗粒度+90%参数的几何分支 vs 细粒度+10%参数的外观分支,三维度(粒度、计算、参数)同时非对称。第二,bilateral connection用双向cross-attention(细→粗注入高频、粗→细回传几何),去掉任一方向都掉点(fine→coarse掉0.14、coarse→fine掉1.91 PSNR)。第三,把Mamba省下的算力再投资到更多注意力层,并提出稀疏注意力(2D map + 卷积 + $p_g\times p_g$ grid),在540×960阶段把iter从10.5s降到6.0s(减~43%)而性能不降。第四,同参数量下AsySPLAT-98M/24layer全面碾压LongLRM变体(18layer-103M、减宽-99M、hierarchical-102M,PSNR 19.24 vs 18.39/17.71),证明设计紧凑模型非平凡。
实验结果
实验从五维度验证。(1)与优化方法(Table 2):DL3DV-140前馈PSNR=24.00、SSIM=0.785、耗时<1s,对比3DGS 23.60(需13min),近800×加速且PSNR更高;10次后优化(18s)达25.20,超Scaffold-GS(30k iter/16min得24.77)。(2)零样本(Table 2-3):Tanks&Temples 18.51 vs 18.38,MipNeRF-360 22.20 vs 21.54,Deep Blending 21.58 vs 20.91;合成Replica零迭代27.46 vs 25.89,10次后优化30.83 vs 28.37(领先2.46 PSNR)。(3)训练开销(Table 1):540×960阶段iter 6.0s vs 8.5s,显存48G vs 52G;总训练54h vs 76h(减30%)。(4)推理开销(Table 4):参数98M vs 142M(减30%),FLOPs 16.2 vs 20.2 TFLOPs(减20%),高斯3M vs 12M(减50%),后优化18s vs 50s(快60%)。(5)稀疏视角(Table 5):RealEstate10K 2-view PSNR=28.27,超GS-LRM(300M,28.10)和DepthSplat(354M,27.47),参数仅98M。消融(Table 6):仅coarse预测18.54、仅fine 19.02、合并最优19.24;'4m+4s no conv'掉到17.78证明卷积关键;同参数AsySPLAT-98M全面碾压LongLRM变体(17.71-18.39)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DL3DV-140 新视角合成(前馈,无后优化) | PSNR↑ / 推理时间↓ | 24.00 / <1s | 3DGS 23.60 / 13min | PSNR +0.40,速度近800× |
| DL3DV-140 新视角合成(10次后优化) | PSNR↑ | 25.20(18s) | Scaffold-GS 24.77(16min, 30k iter) | PSNR +0.43,时间减少98% |
| MipNeRF-360 零样本(单次前馈) | PSNR↑ | 22.20 | LongLRM 21.54 | +0.66 PSNR |
| Deep Blending 零样本(20 iter后优化) | PSNR↑ | 22.77(36s) | LongLRM 10 iter 21.84(50s) | +0.93 PSNR,时间还少14s |
| 合成Replica 零样本(10 iter后优化) | PSNR↑ | 30.83 | LongLRM 28.37 | +2.46 PSNR |
| RealEstate10K 2-view 稀疏视角 | PSNR↑ / 参数量 | 28.27 / 98M | GS-LRM 28.10 / 300M | PSNR +0.17,参数仅为1/3 |
| 整体效率 | 参数 / 训练时间 / 推理FLOPs / 高斯数 | 98M / 54h / 16.2 TFLOPs / 3M | LongLRM 142M / 76h / 20.2 TFLOPs / 12M | 分别减少30% / 30% / 20% / 50% |
局限与改进
作者承认的主要局限:(1)在LPIPS感知指标上AsySPLAT落后于优化方法(如DL3DV-140上0.255 vs 3DGS的0.213),这是可泛化3DGS方法的通病——缺少基于误差的致密化(densification)机制;(2)当固定后优化迭代次数时,LongLRM有时反而占优(如DL3DV-140在相同迭代次数下LongLRM略好),AsySPLAT的优势主要靠'预测更少高斯→能在相同时间预算内跑更多迭代'来体现,对后优化的依赖较强。我观察到的额外局限:(3)所有消融实验都只在256×256低分辨率下做(作者坦言是'资源限制'),高分辨率下各组件的贡献是否仍成立未验证;(4)实验只对比了LongLRM一个SOTA前馈基线,没有与同时期的其他长序列方法对比;(5)bilateral connection的双向cross-attention仍然在每个stage末做,当view数 $V$ 很大时intra-frame cross-attention也会累积开销;(6)稀疏注意力的grid size $p_g=2$ 是固定的,更大视角/分辨率下是否需要自适应未讨论。
独立分析的弱点
独立分析的弱点有四方面。第一,'粗几何即可'假设依赖alpha合成:对极端稀疏视角或强视角差异场景,几何精度下降可能导致高斯错位,alpha合成救不回来。改进:在几何分支引入深度监督或预训练深度先验(如DepthSplat用DepthAnything)。第二,外观分支用intra-frame交互意味着完全依赖几何分支的深度线索做跨视图一致性,若几何分支某帧出错该帧外观无法被其他视图纠正。改进:bilateral connection中加轻量跨视图一致性loss或少量跨帧信息。第三,$p_g=2$ 的稀疏注意力把token分到4块做self-attention,块间信息只能靠卷积传递,对跨视图长距离匹配可能不够。改进:借鉴Shifted Window或dilated grid让块边界交错。第四,AsySPLAT-98M在DL3DV-140零迭代PSNR=24.00,略低于LongLRM零迭代的24.10,说明主训练分布上并非全面领先,零样本优势可能来自参数减少的隐式正则化,机制不清。改进:补充scaling law分析。
未来方向
作者明确提出的延伸:(1)把非对称设计原则推广到其他视觉任务(暗示可能用于视频、动态场景建模);(2)稀疏注意力模块可独立用于其他长序列token交互场景。基于成果可延伸的方向:(1)将两条'观察'推广到动态场景3DGS(4D高斯)——动态场景中外观时变性更强,几何估计更难,非对称重分配可能收益更大;(2)探索pose-free设置下的非对称架构,作者在related work提到pose-free可泛化3DGS是开放方向,几何分支的非对称容量是否有助于姿态鲁棒性值得研究;(3)用学习到的patch size替代固定 $p_c/p_f$,让模型自适应地为不同区域分配粒度;(4)把后优化与bilateral connection统一——既然外观比几何容易,能否让后优化只针对几何部分做,进一步加速;(5)将非对称思想与diffusion-based 3D生成结合,外观分支可作为高效的detail decoder。
复现评估
开源:论文标'Preprint',提供主页 https://zhongyingji.github.io/asysplat/,但未明确代码开源时间表,大量训练细节说'refer to supplementary materials'但preprint未见。数据:训练用DL3DV(10k+训练场景、140基准场景),评测用DL3DV-140、Tanks&Temples、MipNeRF-360、Deep Blending、Replica——均公开可获取。算力:540×960阶段batch size 2,靠FlashAttention-2+梯度检查点+deferred backpropagation把显存压到48G(单卡A100/H100 80G可跑),累计约54小时(推测需多卡分布式,未明示GPU型号)。难度:高——架构新颖(自研稀疏注意力、bilateral connection)、训练技巧密集、消融仅在256×256下完成。一般实验室复现540×960需多卡A100/H100训练数天;但256×256消融(batch 24, 10k iter)可复现,可用于验证核心思想。
论文图表
图分两部分:左侧列出两条核心观察(i 高精度几何对高保真渲染不是必需的,ii 一旦几何估计完毕高精度外观属性易于建模);右侧用条形图对比AsySPLAT与LongLRM在多个效率维度上的差距——参数量、FLOPs、训练时间、高斯数量、后优化速度均有30%-60%的缩减,同时PSNR在多个数据集(Mip360/Replica/DL3DV/TnT/DB)上反而更高。
这张图是理解整篇论文的'地图':它一图说清了动机(两条观察)、方法(非对称双分支)、结果(参数/FLOPs/训练时间/高斯数全面下降,PSNR全面上升)。读者应先看这张图建立全局认知再深入细节。