← 返回 2026-08-28

Luce:面向3D资产生成的可重光照高斯表示 Luce: Relightable Gaussians for 3D Asset Generation

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs 📅 2026-08-25 👍 14 2026-09-01 18:30
3D高斯泼溅 PBR材质 图像转3D 整流流 生成式3D 重光照

体素化多模态PBR高斯+整流流Transformer,单图生成可重光照3D资产

前置知识

3D高斯泼溅(3DGS)

一种显式3D表示:用大量带位置偏移、各向异性尺度、旋转四元数、不透明度与颜色值的3D高斯图元,经可微光栅化按深度做alpha合成来渲染图像。训练快、渲染实时,已成为重建与生成领域的主流显式表示之一。

Luce的资产表示正是多模态高斯云:每个活跃体素挂三组模态高斯,不先理解高斯的参数化与splat渲染方式就无法读懂其表示与损失设计。

PBR与金属度-粗糙度工作流

基于物理的渲染把外观分解为反照率albedo、金属度metallic、粗糙度roughness与表面法线等独立通道,再用Cook–Torrance微表面BRDF结合环境贴图的split-sum近似着色,使同一资产能在任意新光照下重新渲染。

本文的核心卖点就是原生生成完整PBR通道,让资产可直接导入标准渲染管线并重打光,公式(1)的延迟着色贯穿全文。

结构化latent与structure-then-latent范式

TRELLIS提出的生成范式:先用稀疏结构流预测哪些体素被物体占据,得到稀疏体素骨架,再在每个活跃体素上生成压缩latent特征,最后解码为3D表示;VAE负责把高维表示压成可低成本扩散的低维latent。

Luce完全沿用该范式:结构阶段不加修改地复用TRELLIS 2,并自行训练SLatVAE压缩多模态高斯、SLatFlow在其latent上做生成。

整流流与DiT

整流流(rectified flow)学习从噪声到数据的近似直线速度场,路径直、采样步数少;DiT把Transformer作为扩散/流模型骨干,通过自适应层归一化把扩散时间步以shift/scale/gate方式注入每个块。

SLatFlow是DiT风格的整流流transformer,在稀疏3D latent上仅用10步采样即联合生成几何与全部材质。

DINOv2多层特征

自监督训练的ViT编码器,浅层特征保留边缘、纹理等细空间结构,深层特征承载语义。近年研究表明拼接融合多层特征优于只取最后一层,对密集预测和细节保持尤其有效。

本文用DINOv2第6/12/18/24层特征拼接投影后经交叉注意力注入SLatFlow,这是保住文字、logo、铭文等细节的关键设计。

切线空间法线贴图

把高频表面细节存进2D纹理:渲染时在像素处由切线坐标系把贴图法线变换回物体空间,仅扰动光照计算用的法线而不增加任何多边形。是实时渲染管线的标准做法,通常从高模或法线数据烘焙得到。

论文把解码出的法线高斯烘焙成网格切线空间法线贴图,以零多边形成本恢复雕刻、织物纹理等亚体素细节,使网格法线PSNR从29.5提升到33.0 dB。

研究动机

单图生成3D资产近年进展很快,但主流方法在表示选择上各有硬伤。TRELLIS、LiTo等结构化latent或表面光场方法把环境光照直接烘焙进外观,只能输出固定光照下的渲染,资产无法在新环境贴图下重新打光,也无法接入标准PBR管线;TripoSG、Direct3D-S2等隐式场方法只建模水密几何,完全不含材质。已有的PBR相关方法又各有约束:TexGaussian需要输入网格,RelitLRM用球谐而非显式PBR分解,MGM是文本条件且多阶段,MatSpray需逐场景多视角优化。即便是最强的TRELLIS 2(mesh-centric体素PBR属性)和LiTo,在Toys4K上的FID也只到29.22与29.76,且文字、logo、铭文等高频细节常被模糊或扭曲——而这恰是图像到3D最难保真的部分。

本文的目标是本文要构建一个单图到3D的生成系统,使其输出同时满足三点。一是几何精确、外观保真:在Toys4K(412个资产)等基准上以FID等分布级指标超越TRELLIS 2、LiTo等最强基线。二是原生携带完整PBR材质——反照率、金属度-粗糙度、表面法线三种模态——可在任意环境光下经标准Cook–Torrance微表面着色重打光,且无需网格提取或UV展开即可直接渲染。三是保住输入图像中的高频细节,让生成表面上的文字与logo保持可读,并在130张AI生成图像基准上提升CLIP对齐分数。最终输出既可以是可延迟着色的PBR高斯云,也可以双解码为带albedo/metallic/roughness/切线法线四张贴图的纹理网格,直接导入生产渲染器。

与已有工作不同的是,作者的独特切入点是把『像PBR管线那样分解外观』直接搬到3D表示层。TRELLIS 2给每个体素存一份共享的PBR属性包,LiTo对表面光场做tokenization,而Luce让每个活跃体素为albedo、metallic-roughness、normals三种模态各配一组几何独立的高斯——各模态拥有自己的位置、尺度、旋转与不透明度,把图元集中到自己细节最丰富的区域(抛光木需要密集albedo高斯刻画木纹,拉丝金属需要密集metallic-roughness与法线高斯刻画划痕)。同时法线作为显式独立模态存储而非从几何派生,允许偏离底层表面、携带超过网格分辨率的细节,为后续切线空间法线贴图迁移埋下伏笔。整个多模态高斯云再压缩进统一材质感知latent,由单个整流流联合生成几何与材质。

核心方法

直觉上,Luce把3D资产当作『贴在稀疏体素骨架上的三套高斯』:分别管颜色、金属-粗糙度、法线,各自splat成PBR缓冲后用split-sum图像光照与Cook–Torrance BRDF延迟着色:$$L_{IBL}(\omega_o)\approx\frac{a}{\pi}(1-\kappa)E(n)+L_{pref}(r,\alpha)[F_0 A(\mu_o,\alpha)+B(\mu_o,\alpha)]$$。技术路线沿用structure-then-latent范式:离线在128³稀疏网格按模态拟合每体素K=8个高斯;SLatVAE(16块Swin稀疏transformer)把336通道表示编码为64³×32紧凑latent,解码器以『分辨率换密度』每模态输出32个高斯,可微渲染端到端训练。SLatFlow是30块DiT整流流transformer:TRELLIS 2结构流先预测活跃体素,再条件于多层DINOv2特征在10步内生成PBR latent,双解码为PBR高斯或纹理网格。GS路径4.48B参数,单H100约42秒。

核心创新有四点,本质区别于TRELLIS 2的mesh-centric体素属性与LiTo的表面光场tokenization。其一,模态独立高斯:三个模态各有自己的位置、尺度、旋转与不透明度,不共享图元,避免单一布局迫使模态间竞争容量,直接以3D原生格式构成完整PBR材质描述。其二,分辨率换密度:编码端下采样到64³把latent压小到可廉价扩散,解码端每体素吐32个高斯补偿损失的分辨率。其三,法线解耦:法线高斯监督于『应用了原始法线贴图后的有效法线』,学到比网格几何更细的表面朝向,烘焙成切线空间法线贴图后网格法线PSNR从29.5提升到33.0 dB,零多边形成本恢复雕刻与织物细节。其四,多层DINOv2条件:第6/12/18/24层特征拼接后$4\times1024\to1024$投影,早期层携带文字logo等细空间结构,深层携带语义,共同保证细节传递到3D表面。

方法步骤详情

预处理:150个相机渲染1024²的albedo/metallic-roughness/法线图,每模态独立拟合3DGS到128³网格,每体素每模态K=8个高斯。SLatVAE:编码器在128³处理336通道输入(3模态×14参数×8高斯)后下采样到64³×32,解码器每模态输出32个高斯,以可微渲染监督,损失$\mathcal{L}=\sum_m(\mathcal{L}^m_{\ell_1}+\mathcal{L}^m_{LPIPS}+\mathcal{L}^m_{SSIM})+\lambda_{KL}D_{KL}$(系数1.0/0.2/0.2),Muon优化器lr=1e-3训50万步。结构生成:复用TRELLIS 2结构流,12步采样活跃体素。SLatFlow:30块DiT、RoPE、变长flash attention、adaLN时间步调制,DINOv2第6/12/18/24层特征交叉注意力注入,10步生成latent。双解码:PBR高斯直接延迟着色;或FlexiCubes提取网格、xatlas UV展开,烘焙albedo/metallic/roughness/切线法线四张贴图。

技术新颖性

新颖性首先在表示层:把3DGS从『烘焙外观的辐射场』改造成『携带显式PBR材质的图元集』且每模态独立参数化——这与逐场景逆渲染(GS-IR等,不泛化到新物体)和TRELLIS 2(mesh中心、逐体素PBR属性)形成实质差异。其次是联合性:几何与全部材质模态在同一个latent里由单个整流流一次生成,而非TRELLIS 2的形状+纹理两段式(12+12步),Luce的SLat阶段只需10步。第三是法线通道的『超几何频率』设计:监督目标采用应用authored normal map后的有效法线,使解码法线天然携带雕刻、织物纹理等亚体素细节,再借网格切线帧烘焙回UV空间,相当于把高频细节从几何迁移到纹理。第四是训练机制:Swin稀疏注意力的延迟压缩(最后一个块才下采样)、变长flash attention避免padding、Muon优化器,使4.5B参数模型能在42秒内生成可重打光资产,比TRELLIS 2的176.7秒快4倍。

Overview of Luce.
Figure 3: Overview of Luce.
Effect of multi-layer DINOv2 conditioning.
Figure 4: Effect of multi-layer DINOv2 conditioning.
SLatVAE architecture.
Figure 9: SLatVAE architecture.
PBR shaded rendering.
Figure 10: PBR shaded rendering.

实验结果

生成上,Luce GS在Toys4K(N=412)取得FID 20.99、KID 0.033、FID_dino 0.100,比最强基线TRELLIS 2(29.22)降低超过8个点,也优于LiTo的29.76;CLIP 0.9062、SigLIP2 0.9230均为最佳。在130张AI生成图像基准上,CLIP 0.8519对最佳基线TRELLIS GS的0.8299,SigLIP2 0.8508对0.8339;mesh变体在ULIP(0.1254)与Uni3D-L(0.3298)上领先。重建(338资产PBR子集)上Luce GS颜色PSNR 36.1 dB、法线34.6 dB最佳,超过TRELLIS 2的34.5/32.1,后者仅在albedo(40.7)与metallic-roughness(42.7)领先。消融一:多层DINOv2条件把FID从25.21降到20.99、AI图CLIP从0.8081升到0.8519。消融二:切线法线烘焙把网格法线PSNR从29.5提到33.0 dB。效率上GS路径4.48B参数、单H100约42.2秒,远快于TRELLIS 2的176.72秒。

Image-to-3D generation.
Table 1: Image-to-3D generation.
SLatVAE and SLatFlow hyperparameters.
Table 3: SLatVAE and SLatFlow hyperparameters.
Multi-layer DINOv2 conditioning ablation.
Table 4: Multi-layer DINOv2 conditioning ablation.
Inference sampling steps per method.
Table 5: Inference sampling steps per method.
Image-to-3D generation comparison.
Figure 5: Image-to-3D generation comparison.
Additional generation examples.
Figure 6: Additional generation examples.
Reconstruction quality on Toys4K.
Figure 7: Reconstruction quality on Toys4K.
Tangent-space normal map transfer.
Figure 8: Tangent-space normal map transfer.
Additional generation results.
Figure 11: Additional generation results.
Per-sample baseline comparison (1/8)-(8/8).
Figures 12–19: Per-sample baseline comparison (1/8)-(8/8).
查看结构化数据
任务指标本文基线提升
单图生成3D(Toys4K,N=412) FID(Inception) 20.99(Luce GS) 29.22(TRELLIS 2) 降低8.23个FID,约28%
单图生成3D(Toys4K) CLIP对齐分数 0.9062 0.8909(LiTo) +0.0153
单图生成3D(AI生成图像,N=130) CLIP对齐分数 0.8519 0.8299(TRELLIS GS) +0.0220
3D重建(Toys4K PBR子集,N=338) 颜色渲染PSNR 36.1 dB(Luce GS) 34.5 dB(TRELLIS 2) +1.6 dB
3D重建(Toys4K PBR子集) 法线PSNR 34.6 dB(Luce GS) 32.1 dB(TRELLIS 2) +2.5 dB
切线法线贴图迁移(消融) 网格法线PSNR 33.0 dB(带烘焙) 29.5 dB(不带烘焙) +3.5 dB,零多边形成本
多层DINOv2条件(消融) FID 20.99(6/12/18/24层) 25.21(仅第24层) -4.22 FID
推理效率(单H100) GS路径平均耗时 42.20秒(4.48B参数) 176.72秒(TRELLIS 2,7.48B) 快约4.2倍

局限与改进

作者承认的局限:有限分辨率的体素化表示对『细节相对整体尺寸过细』的资产欠采样,特征可能只跨几个体素;材质模型限于Cook–Torrance下的标准PBR属性,不显式建模次表面散射、各向异性、半透明、薄膜干涉和强视角相关反射;网格导出沿用TRELLIS的FlexiCubes解码器,分辨率与UV质量受限;管线只面向物体级资产,场景级生成(一致光照、材质一致、物体交互)仍是开放问题。我的补充观察:结构先验完全继承自TRELLIS 2,结构流失败会直接拖垮材质阶段且论文未分析这种级联误差;FID/KID是分布级指标,『文字可读性』这一核心卖点主要靠定性图与CLIP分数间接支撑,缺少字符级OCR准确率这类直接度量;与LiTo的对比存在姿态不对齐(LiTo在输入视角坐标系生成),同样的四个评估视角对其未必公平;约50万资产的高质量PBR过滤本身引入了域偏置,可能影响对复杂真实材质的泛化。

独立分析的弱点

第一,表示容量与体素分辨率强耦合:128³网格对细长薄壁物体(栏杆、天线、珠宝链)难以覆盖,建议引入级联或自适应分辨率解码,粗latent定全局、细stage精修局部几何与法线。第二,模态独立高斯带来3倍参数冗余(每体素3模态×8高斯×14参数=336通道输入),存储与解码开销大,可探索模态间共享骨架高斯、只对模态残差独立建模。第三,双解码路径质量与速度不一致:GS路径42秒且指标最佳,mesh路径要148-159秒且FID升至21.10、颜色PSNR掉到32.5,说明latent到网格的转换仍是瓶颈,值得研究端到端的UV感知网格解码。第四,材质物理合理性缺乏专门评测:论文未对生成的metallic/roughness通道与真实扫描PBR资产做量化对比,建议引入材质估计基准验证分解的正确性而非仅看渲染相似度。第五,缺乏条件可控性:不支持文本指令式的材质编辑(如『改成拉丝金属』),也没有局部重生成能力,限制了在资产生产流程中的实用性。

未来方向

作者提出的方向:级联或自适应分辨率解码,让粗latent承载全局形状与材质结构、高分辨率stage细化局部几何、纹理与法线;扩展材质通道或学习视角相关残差,覆盖次表面散射、各向异性、半透明与薄膜干涉;用更高分辨率或学习式UV感知的提取方案替换FlexiCubes;把管线推广到场景级生成,处理一致光照、材质一致性与物体交互。基于本文成果还可延伸:把SLat latent与文本或多视图条件结合,实现材质级的可控编辑与属性插值(利用统一latent的连续性);将法线解耦思路迁移到4D动态资产生成;利用PBR分解对生成资产做重光照数据增广,反哺2D生成模型的阴影去除训练;把split-sum延迟着色器作为可微渲染损失推广到更多生成框架,让『原生可重打光』成为3D生成的事实标准输出;以及在端侧探索GS路径的蒸馏加速,绕过昂贵的mesh烘焙直接服务实时渲染。

复现评估

复现难度较高。论文未提及开源代码、模型权重或训练脚本(Apple团队工作,正文与附录均无release链接),SLatVAE、SLatFlow、PBR高斯拟合与烘焙管线均需自行实现。数据侧可获取:训练用Objaverse/Objaverse-XL约50万PBR过滤资产加TexVerse 15.8万子集,评测用公开的Toys4K(412生成/338重建);但130张Gemini图像基准未随论文发布。算力门槛高:SLatVAE与SLatFlow各用64张H100训练50万步、约14天,预处理还需对数十万资产做150视角1024²渲染与逐模态3DGS拟合,这是最大工程成本。推理相对友好:GS路径4.48B参数、单H100约42秒、10步采样,且结构流直接复用TRELLIS 2的开源权重可省去一部分工作。综合评估:拥有数百卡资源的团队约需数周到数月可复现训练;个人研究者建议只复现推理与评测部分,并从TRELLIS生态出发改写表示层。