GS-Voxel:面向大规模3D高斯场景生成的免拟合结构化潜变量 GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation
免拟合将预优化3DGS转为稀疏体素潜变量,单张卫星图生成千米级航拍3D场景
前置知识
3D高斯泼溅(3DGS)
一种显式3D表示:场景由数百万个带中心 $x$、不透明度logit $\alpha$、SH颜色系数、对数尺度 $s$、旋转四元数 $q$ 的各向异性高斯基元组成,通过可微光栅化实时渲染。优化后的产物只是无序基元集合,基元数量随场景复杂度自由变化,没有统一的空间结构。
本文的输入与输出都是预优化3DGS(SH0格式),理解其属性构成是看懂确定性转换、量化打包与解码还原的前提。
稀疏体素张量
只在被占用的体素上存储固定通道宽度特征的表示,特征挂在离散空间坐标上,配合稀疏卷积或稀疏Transformer(如TRELLIS系列的DiT)高效处理。潜变量3D生成模型普遍假设输入是这种结构化稀疏张量。
原生3DGS无法直接喂给生成模型,正是因为它不满足固定通道维度加离散坐标的结构化要求——这是本文要解决的核心矛盾。
变分自编码器(VAE)
编码器把输入压缩为低维潜变量,解码器负责重建,训练时以重建损失加KL正则(本文各损失中的 $\lambda_{KL}$ 项)约束潜空间接近先验分布,使潜变量适合后续的扩散或流式生成建模。
本文用几何VAE与局部属性VAE两个VAE把GS-Voxel压缩为可生成的潜变量,理解重建损失与KL项的分工是读懂公式(12)与(15)的基础。
流匹配(Flow Matching)
一类生成建模方法:学习一个速度场,把简单噪声分布沿ODE确定性地输运到数据分布,训练目标是回归条件速度场,采样即对ODE做数值积分,与扩散模型同属连续时间生成框架。
本文的稀疏结构、几何、属性三个阶段都是条件流模型,推理用每阶段50步Euler采样、CFG强度3.0,不理解流匹配就看不懂生成管线。
球谐SH0与DC系数
3DGS用球谐系数表达视角相关颜色,0阶(SH0)只含一个DC系数 $f^{dc}\in\mathbb{R}^3$,乘以 $C_0=0.28209479$ 即得视角无关的RGB。阶数越高外观越丰富,但每基元属性通道数也越多。
GS-Voxel当前只支持SH0输入,这是把每基元属性向量压小、适配百万级基元场景的关键设定,也是作者明示的适用范围限制。
FID/KID
FID用Inception特征在真实集与生成集上分别拟合高斯并计算Fréchet距离;KID用核二乘距离估计分布差异。两者数值越低越好,但高度依赖评估所用的真实图像集与相机协议。
Table 6给出跨论文FID/KID参考(本文28.0/0.020),由于各方法GT集与相机协议不同,必须理解其不可直接比较的性质。
研究动机
潜变量3D生成模型(如TRELLIS系列)依赖结构化局部张量,但真实预优化的3DGS重建是无序、空间不规则的基元集合,基元数量跨场景差异巨大。以本文目标的大规模航拍3DGS为例,一块200m×200m的航拍瓦片可包含超过300万个高斯基元,远超对象级生成模型常见的全局基元预算——Can3Tok把输入截断到40K再映射到64×64×4潜变量,TripoSplat的解码预算也只有33K–262K。现有高斯生成方案各有取舍:GaussianCube需要致密化约束拟合成固定数量高斯再用最优传输全局重排进体素网格;Can3Tok学习固定基数的场景级潜变量;L3DG只覆盖物体与房间尺度。它们都无法在不重新逐场景拟合的前提下,把已优化的百万级真实3DGS直接转成生成模型可用的稀疏潜变量,表示层面的瓶颈由此产生。
本文的目标是本文的目标是设计一个免拟合(fitting-free)的结构化潜变量框架GS-Voxel,并在大规模航拍3D高斯场景生成任务上系统评估它。具体而言:给定兼容的预优化3DGS重建(标准SH0属性格式),通过确定性转换将其组织为稀疏活跃体素,全程无需对该场景做任何额外优化、不拟合固定基数的全场景高斯模板、也不做全局最优传输重排,同时保留被选中基元的亚体素位置与渲染属性;随后在GS-Voxel潜空间中训练图像条件流模型生成航拍3DGS场景;并借助重叠感知的分块推理,把合成范围从200m×200m的单个训练裁剪扩展到1,400m×800m的大区域,条件可以是真实或生成的卫星视角图像。
与已有工作不同的是,本文的独特切入是「消费已有优化结果」而非「从头学习高斯分布」。GaussianCube需要先拟合成固定数量高斯再做最优传输重排;Can3Tok把每个重建截断为固定40K高斯后压缩到全局固定大小的潜变量;TripoSplat的DeG-VAE从资产表面采样点并投影DINOv3与FLUX.2多视角特征,学习的是全新的物体级高斯分布,且默认解码器仅提供约150万输出槽位;L3DG的稀疏VQ-VAE扩散只做到物体与房间尺度。GS-Voxel只在每个活跃体素内施加固定槽位预算($K_{in}$),总容量随占用体素数增长而非被场景级全局基数归一化,因此能直接承载原始航拍瓦片中超过300万的基元,是少数直接面向预优化真实世界3DGS训练生成模型的表示框架。
核心方法
要把无序的高斯集合变成生成模型可处理的张量,最自然的办法是把它们「装进」稀疏体素网格:每个活跃体素存一个固定宽度的特征向量,稀疏卷积与稀疏DiT即可直接建模。实现分两步:第一步是显式确定性转换,把归一化到 $[-0.5,0.5]^3$ 的场景离散为 $R^3$ 体素网格(默认 $R=256$,$h=1/256$),丢弃低不透明度基元后按 $v_i=\mathrm{clip}((x_i-b_{\min})/h,0,R-1)$ 分配体素,每体素内按不透明度logit降序保留Top-$K_{in}=16$个基元并零填充;亚体素偏移与各属性归一化到 $[0,1]$ 后做8bit量化,拼成特征 $\phi_v$。第二步是因子化VAE:几何VAE把细支撑 $S_R$ 编码到 $(R/8)^3=32^3$ 粗稀疏格,解码器预测层次细分信号恢复细支撑;局部属性VAE把每体素属性压缩为紧凑潜变量 $z_a$。生成时基于TRELLIS.2做三阶段流匹配,依次生成粗支撑、几何与属性潜变量。
核心创新是「体素局部固定预算」:不像Can3Tok把整个场景归一化到固定基数,GS-Voxel只在每个活跃体素内固定最多 $K_{in}$ 个槽位,总输出容量随占用体素数增长,天然适配百万级基元的真实航拍重建。转换是确定性且可逆的:按不透明度Top-$K$保留主导基元、以亚体素偏移 $\Delta x$ 保留精确位置、零填充槽位量化不透明度为零因而不参与渲染;体素内基元数 $n_v$ 只是构造期计数,既不进入VAE也不被解码器预测。生成阶段用渲染一致性($L_1$、$L_2$、SSIM与感知损失组合)而非显式计数匹配做监督,因此解码槽位 $K_{out}$ 可以不等于 $K_{in}$。另一个关键设计是只存SH0的DC颜色($C_0=0.28209479$),在受限航拍视角下足够表达外观且把每基元属性压小;对数尺度减去 $\log L$ 使尺寸保持相对场景的比例,量化范围取 $[s_{\min},s_{\max}]=[-24,-4]$。
方法步骤详情
流程分四步。(1)训练瓦片生成:对大型3DGS场景做200m滑窗裁剪(50m重叠),仅保留中心落入窗口的高斯;DBSCAN($\varepsilon=0.02$、$m_{min}=50$)剔除漂浮离群点,以主簇下沿对齐 $z=-0.5$ 并归一化到单位立方体,按算法S1转成GS-Voxel。(2)虚拟相机与视图过滤:10×10网格、5个高度层共39种俯仰组合,每窗口约3,900视图;先用渲染alpha过滤(平均累积不透明度低于 $\tau_\alpha=0.9$ 丢弃),再用Qwen-VL-Plus打分,每窗口保留500–1,000张,仅监督局部属性VAE。(3)训练:约18K个样本(800个验证,按源场景隔离划分),三个条件流与两个VAE用AdamW(学习率 $10^{-4}$、CFG丢弃率0.1)训练,几何与属性流为0.3B DiT;条件为9张512×512鸟瞰渲染,随机采样。(4)推理:三阶段各50步Euler采样、CFG强度3.0;大区域以BFS螺旋遍历 $32^3$ 粗格瓦片,相邻重叠8格(步长24),重叠区用repaint式inpainting约束,配合羽化累积消除接缝。
技术新颖性
技术新颖性体现在四点。其一,免拟合的确定性转换本身就是贡献:给定SH0 3DGS即可离线完成体素化、Top-$K$截断与8bit量化打包,配合完整的逆映射算法S1/S2与复用TRELLIS.2开源o_voxel.io接口的.vxz序列化格式,表示构建零训练成本、逐场景无优化。其二,因子化双VAE把支撑建模与属性重建解耦:几何VAE只建模层次细分与占用(Shape IoU 0.99),属性VAE只在解码出的支撑上工作,避免为空白空间分配容量;对比联合压缩的单阶段基线(IoU仅0.76)优势明显。其三,通过渲染一致性监督使输出槽位 $K_{out}$ 独立于输入 $K_{in}$,消融显示 $K_{out}=4$ 优于1与8,说明监督方式而非槽位数量决定重建质量。其四,重叠感知的三阶段分块推理把潜空间inpainting与结构-几何-属性的分阶段传播结合起来,实现了跨瓦片基本无缝的1,400m×800m级生成,这在预优化真实3DGS的生成建模中尚属首次。
实验结果
实验在源场景隔离的10个验证瓦片上评估。直接转换消融(Table 3):固定 $R=256$,$K_{in}$ 从1到16时PSNR 18.52升至40.04(SSIM 0.98、LPIPS 0.023),保留1,602K基元、377K活跃体素;$K_{in}=32$ 仅40.94;$R=512$ 时PSNR 39.20但支撑增至2.6倍,故取 $R=256$、$K_{in}=16$。槽位消融(Table 4):$K_{out}=4$ 最优(23.09/0.62/0.331),$K_{out}=1/8$ 为22.81/22.12。VAE对比(Table 5):几何VAE支撑重建Shape IoU 0.99,单阶段联合基线仅0.76/21.01/0.54/0.418。生成质量(Table 6):生成与真实各15K图像,本文FID 28.0、KID 0.020;跨论文参考EarthCrafter 69.5/0.061、GaussianCity 86.9/0.090、CityDreamer 97.3/0.096(协议不同)。大区域演示达1,400m×800m,远超200m×200m训练裁剪。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| GS-Voxel直接转换保真(VAE编码前,10个验证瓦片) | PSNR / SSIM / LPIPS | R=256, Kin=16(默认配置):40.04 / 0.98 / 0.023 | 同分辨率 Kin=1:18.52 / 0.55 / 0.425 | PSNR提升21.52 dB,LPIPS降低0.402 |
| 局部属性VAE重建(目标支撑上) | PSNR / SSIM / LPIPS | Kout=4:23.09 / 0.62 / 0.331 | 单阶段联合压缩VAE:21.01 / 0.54 / 0.418 | PSNR +2.08 dB,LPIPS降低0.087 |
| 几何支撑重建 | Shape IoU | 0.99(几何VAE) | 单阶段VAE:0.76 | +0.23,接近无损恢复占用支撑 |
| 卫星图条件航拍3DGS场景生成 | FID / KID(各15K图像) | 28.0 / 0.020 | EarthCrafter:69.5 / 0.061(跨论文参考) | FID低41.5(GT集与相机协议不同,不直接可比) |
局限与改进
作者承认的局限:实现与实验仅覆盖SH0属性的航拍场景,支持高阶SH需增加通道并重训属性VAE与属性流;条件流用渲染鸟瞰图训练,对渲染、真实与生成卫星图之间的传感器差异与域偏移鲁棒性尚未评估;Top-$K_{in}$ 会丢弃极密体素中的部分基元,有限空间分辨率使细薄结构难以保留;研究定位是重建保真与条件生成,未报告熵编码码率或率失真曲线。我的补充观察:Table 6是对他人结果的跨论文参考而非同协议评测,数字优势需谨慎解读;属性VAE重建PSNR仅23.09、SSIM 0.62,说明属性压缩损失仍相当可观,生成场景的局部纹理质量可能受限;视图过滤完全依赖Qwen-VL-Plus的单一评分,可能引入系统性偏差;训练数据为作者团队自建航拍场景,地域与风格多样性未知;200m固定窗口假设也限制了向其他尺度的直接迁移。
独立分析的弱点
独立分析的弱点与改进方向:第一,SH0使颜色视角无关,斜视或街景下高光与镜面反射会失真,可按通道增量加入高阶SH并渐进重训属性VAE,保持向后兼容的序列化格式;第二,属性潜变量压缩质量一般(PSNR 23.09、SSIM 0.62),而属性流仅0.3B参数(TRELLIS.2为1.3B),扩大属性流容量或引入感知加权更强的损失应能改善纹理保真;第三,Top-$K_{in}=16$ 是静态预算,高密度城区必然丢基元,可借鉴TripoSplat的密度控制思路做学习式局部容量分配或自适应分辨率;第四,结构-几何-属性三阶段串行生成,上游支撑错误会逐级放大且无法在下游补救,可探索跨阶段联合采样或一致性正则;第五,视图过滤依赖单一VLM的0–1打分与阈值策略(保留500–1,000张),可用多评审一致性或人工校准子集提升监督质量;第六,渲染条件与真实/生成卫星图之间的域差距未量化,建议在训练中混合三种条件并报告分域指标。
未来方向
作者提出的方向:把体素局部表示推广到室内、街景与对象级资产,但需适配不同的相机分布、空间尺度与外观特性,可能要修改SH0属性、航拍归一化策略与训练数据;研究自适应分辨率与学习式局部容量分配,缓解极密体素丢基元与细结构丢失两类问题;系统评估量化或熵编码GS-Voxel潜变量的存储与码率,给出率失真曲线,把表示推向压缩格式;评估生成航拍场景对规划、仿真、应急响应等下游任务的保真度与可控性。基于本文成果可延伸的工作包括:与真实高分辨率卫星影像联合训练并系统量化域差距;把重叠感知分块推理扩展为无限场景的流式生成或LOD多细节层次输出;将GS-Voxel潜变量作为3DGS的中间压缩表示研究编码效率;以及与ABot-Earth等行星尺度系统工程结合,探索多模态条件(文本、OSM、深度)下的大范围地球表面生成。
复现评估
复现评估:论文未提及开源代码或数据。有利条件是细节披露充分:附录A的算法S1/S2给出完整可逆转换伪代码,默认参数明确($R=256$、$K_{in}=16$、不透明度阈值 $t_8=5$、尺度范围 $[-24,-4]$、越界容差 $\delta_b=2/128$),序列化直接复用TRELLIS.2开源的o_voxel.io接口(.vxz格式),附录C公开了Qwen-VL过滤的完整评分prompt,Table 2给出虚拟相机rig全部参数(5层高度、39个俯仰、每窗口约3,900视图)。主要障碍在数据:约18K个200m×200m航拍瓦片来自Amap自建大规模3DGS场景,外部研究者难以获得同规模同质数据,且源场景级划分协议难以复制。算力方面,模型基于公开的TRELLIS.2架构(三个0.3B DiT加两个VAE),训练规模不算夸张,但估计仍需多卡GPU数天至数周。总体判断:表示与转换部分可低成本复现验证,生成模型部分受数据与算力双重限制,完整复现难度较高。
论文图表
展示方法的最终能力:以一张1,400m×800m的大幅面卫星视角图为条件,流水线生成整片大区域3DGS场景,五个局部裁剪特写呈现建筑外观与几何细节。
开门见山展示核心卖点——远超训练裁剪的大面积生成与局部质量,是理解论文动机与价值的最佳入口。