← 返回 2026-07-21

用于高保真薄壳三维生成的可微几何图像 DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

Eungjune Shim, Hansol Lee, Eunjung Ju 📅 2026-07-15 👍 17 2026-07-25 18:30
3D生成 TSDF 几何图像 可微Marching Squares 潜在扩散模型 薄壳建模

可微几何图像:用连续TSDF把薄壳3D生成压入32×32潜空间,消费级硬件实时运行。

前置知识

几何图像(Geometry Image)

几何图像把不规则的三角网格表面参数化映射到规整的、与 UV 对齐的二维网格上,使三维坐标和属性可以作为类似图像的张量来处理,从而能直接套用二维卷积或二维生成模型。多图表几何图像(multi-chart geometry image)会先把表面切成多块 UV 版片再拼到一张图里,是服装等带 UV 展开物体的天然表示。本文在此基础上工作,所以理解二维网格参数化与三维表面的对应关系是前提。

本文的核心表示 DiffGI 属于几何图像家族,理解几何图像如何把三维表面摊平成二维张量,才能理解后续为什么要用 TSDF 替代二值占据、为什么能直接用二维 VAE 和扩散模型。

有符号距离函数与 TSDF(SDF / TSDF)

有符号距离函数(SDF)给空间中每一点返回到最近表面的有符号距离:表面内部为正、外部为负、表面本身为零。截断有符号距离函数(TSDF, Truncated Signed Distance Function)则把距离截断在一个阈值内以节省存储和聚焦局部。本文把这一概念从三维体素搬到了二维 UV 平面:对每个像素计算到最近图表轮廓的有符号欧氏距离并截断于 15 像素,从而用连续场编码边界位置。

用连续 TSDF 替代二值占据图是本文第一项、也是最根本的贡献,理解 TSDF 如何在固定分辨率下保留亚像素边界信息,是理解全文性能优势的钥匙。

可微等值面提取(Differentiable Iso-Surface Extraction)

Marching Cubes / Marching Squares 是把隐式场(SDF/占据)转成网格/等高线的经典算法,但其拓扑判定靠离散查表,会阻断梯度。可微版本(如 DMTet、FlexiCubes、可微 Marching Cubes)把顶点位置表述为隐式场值的连续函数,使三维表面损失能通过链式法则反传到场。本文提出的 Differentiable Marching Squares(DMS)是这一思想在二维 TSDF 网格上的实现,复杂度仅 $O(N^2)$。

DMS 是把三维重建拉进学习回路的关键枢纽,理解可微等值面提取才能理解为什么三维法线损失能反传到二维潜在空间,这是本文端到端优化的核心。

薄壳与非流形几何(Thin-Shell / Non-Manifold Geometry)

薄壳几何指像服装、纸张那样厚度可忽略、只有表面没有体积的结构;非流形指边/顶点连接关系不满足流形条件(如多条边共享一条边)。这类几何没有封闭(watertight)的内外之分,传统基于 SDF/占据场/NeRF 的三维生成因假设水密表面而无法忠实表示,常导致人为厚度或正反面融合。

本文的动机正是解决隐式表示无法处理薄壳/非流形几何的痛点,服装和家具框架这类应用场景是论文一切设计的出发点。

潜在扩散模型与 VAE(Latent Diffusion & VAE)

变分自编码器(VAE)把高维数据压缩到紧凑的潜在空间再重建;潜在扩散模型(如 Stable Diffusion)先训练 VAE 再在潜在空间上训练扩散模型,以降低计算成本。本文的 DiffGI-VAE 用 Stable Diffusion 1.5 预训练权重初始化、把 256×256×4 几何图像压到 32×32×4,再用 Diffusion Transformer(DiT)+ flow matching 在其上做条件生成。

潜在压缩到 32×32×4 与消费级硬件实时生成是本文的卖点之一,理解 VAE 编解码与潜在扩散才能理解整个生成管线和效率优势。

研究动机

现有三维生成模型主要依赖隐式体积表示,如有符号距离场(SDF)、占据场和神经辐射场(NeRF)。这些方法从根本上假设表面是水密的(watertight),即封闭且没有开放边界。这一假设对表示薄壳与非流形几何(如服装、家具框架)构成根本限制:当用隐式场生成数字服装时,网络往往无法保持薄表面,导致人为厚度或正反面融合。此外,经 Marching Cubes 提取的网格缺乏 UV 坐标,难以用于需要物理模拟与材质编辑的工业流程。另一方面,几何图像类方法(Omages、GIMDiffusion、GarmageNet)虽把三维表面参数化到二维网格、可直接用二维生成模型,却依赖二值占据图编码边界。二值占据的硬性 0/1 过渡使边界定位天然依赖分辨率:降采样到实际训练分辨率时,精细边界被破坏并产生阶梯伪影,因此常需高达 768×768 的网格来部分补偿。更关键的是,边界捕捉等后处理步骤不可微,在学习与网格重建间造成结构性断裂,三维表面损失无法反传到二维模型权重。

本文的目标是本文要为薄壳与非流形几何(尤其是服装)构建端到端可微的三维生成框架,同时保留几何图像的结构化二维表示优势。具体目标包括:(1) 用连续的二维截断有符号距离函数(TSDF)替代二值占据图,在固定网格分辨率下以亚像素精度编码边界位置,从根本上消除分辨率依赖与阶梯伪影;(2) 让网格重建过程完全可微,使三维表面损失(如法线损失)能通过链式法则无缝反传到二维潜在空间;(3) 把复杂三维非流形表面压缩到极致紧凑的 32×32×4 潜在空间,支持在消费级硬件(甚至纯 CPU)上实时生成;(4) 在此潜在空间上训练基于 transformer 的潜在扩散模型,验证该表示天然支持高效的条件化三维生成,并覆盖标签条件化、图像条件化、占据条件化三类下游任务。

与已有工作不同的是,本文的独特切入角度在于,把可微等值面提取这一在三维体素领域(DMTet、FlexiCubes、可微 Marching Cubes)已被证明有效的思想,首次迁移到二维 UV 网格上的几何图像家族中。此前工作要么用三维隐式表示(内存立方级增长 $O(N^3)$、无天然 UV 参数化、仍假设水密),要么用二维几何图像但依赖二值占据且后处理不可微。DiffGI 同时获得三个看似矛盾的优势:可微的端到端表面优化、二维 UV 网格带来的线性内存增长与 UV 友好网格,以及极致紧凑的潜在压缩。作者明确指出,SDF 相对占据场在三维表示中的优势虽已广泛建立,却从未在二维多图表几何图像设定中实现,DiffGI 正是补上这一空白。

核心方法

DiffGI 的整体思路是先把复杂三维网格摊平成一张带连续距离场的二维几何图像,再在这张图上做可微的编解码与生成。直觉上:服装等薄壳物体本就有 UV 展开(如缝纫版片),用一张图来参数化既保留表面结构又便于二维生成模型处理;问题只在于如何用可微方式把边界在哪编码清楚,并让三维重建能反向求导。技术路线分四步:离线 Mesh-to-DiffGI 转换得到 256×256×4 张量;DiffGI-VAE 将其压到 32×32×4 潜在;Differentiable Marching Squares(DMS)负责可微网格重建;最后用 Diffusion Transformer(DiT)配 flow matching 在潜在空间做条件生成。整个管线中 DMS 是连接二维优化与三维网格的关键枢纽,使从重建网格渲染法线图算出的法线损失能反传到二维 TSDF 与位置图张量。

核心创新有三个,彼此正交、可消融验证。第一,用连续二维 TSDF 替代二值占据图:TSDF 编码每个像素到最近图表轮廓的有符号欧氏距离(内部为正、外部为负、截断于 15 像素),即便激进降采样仍保留亚像素边界信息,而二值图降采样必然丢失信息。第二,Differentiable Marching Squares:当相邻两像素 $\phi_A$、$\phi_B$ 异号时,由介值定理知存在零交叉,其相对位置用线性插值 $x = \frac{\phi_A}{\phi_A - \phi_B}$ 计算(引入 $\epsilon \approx 10^{-5}$ 防止梯度爆炸,$\text{sgn}(\cdot)$ 视为局部常量不参与求导),梯度仅通过连续比值流动,从而把拓扑判定的离散查表软化为顶点坐标的连续函数。第三,几何感知法线渲染损失:用 nvdiffrast 把 DMS 重建网格渲染成法线图,与真值网格法线图做 L1 损失,把高频几何细节(细小褶皱、锐边)压进潜在空间。三者共同的本质区别在于,它们把表示与重建都纳入了可微的学习回路。

方法步骤详情

(1) Mesh-to-DiffGI 离线预处理:AABB 打包排列 UV 版片(统一缩放、加 padding、迭代优化填充率);1024×1024 网格经重心插值采样得 3 通道位置图;边缘像素膨胀防降采样边界腐蚀;每像素算到最近图表轮廓的有符号欧氏距离(截断 15 像素)得 TSDF;双线性降采样到 256×256×4。(2) DiffGI-VAE:用 SD1.5 权重初始化,首层卷积扩到 4 通道(位置 3 + TSDF 1)并零初始化新权重;总损失 $\mathcal{L}_{total} = \mathcal{L}_{Pos} + \lambda_{TSDF}\mathcal{L}_{TSDF} + \lambda_{Normal}\mathcal{L}_{Normal} + \lambda_{KL}\mathcal{L}_{KL}$,位置与 TSDF 用 L1,法线损失 $\mathcal{L}_{Normal} = \|R(\hat{M}) - R(M^*)\|_1$ 经 nvdiffrast 渲染。(3) DMS 重建:PyTorch 向量化实现,复杂度 $O(N^2)$;Case 6/9 鞍点歧义确定性分离为两区域,拓扑选择虽离散但顶点坐标仍是 TSDF 值的连续函数,反传路径完整。(4) 条件扩散生成:DiT + flow matching;标签条件化用 DiT-B/2,图像条件化用 DiT-L/2 + DINOv2-Large 交叉注意力,占据条件化因输入已强约束结构而用 UNet-Tiny;训练做 90° 倍数旋转与 UV 版片级重打包增强。

技术新颖性

新颖性体现在表示、可微重建与潜在压缩三层面的协同。表示上,虽然 SDF 优于占据场在三维体积表示中已确立,但此前从未在二维多图表几何图像设定中实现连续 TSDF,DiffGI 把这一优势带入 2D UV 空间。可微重建上,既有可微等值面方法(DMTet、FlexiCubes、可微 Marching Cubes)都在三维体素或四面体网格上运行、内存立方级增长且无 UV 参数化;DiffGI 的 DMS 在 2D 上运行,复杂度仅 $O(N^2)$ 且天然 UV 对齐。潜在压缩上,作者实验证明从随机初始化训练 DiffGI-VAE 与用 SD1.5 初始化得到的最终重建保真度几乎相同(GarmageSet 上 CD 0.47 vs 0.46,NC 均为 0.96),说明性能增益源于 DiffGI 表示与可微重建管线本身而非预训练初始化,这是一个重要且诚实的消融。此外,把二维版片级数据增强、flow matching、针对不同任务灵活选择 DiT 或 UNet-Tiny 的设计组合,也体现了工程上的成熟权衡。

Overview of the proposed DiffGI framework
Fig. 2: Overview of the proposed DiffGI framework

实验结果

(1) 重建(Table 1):ABO 上用 32×32×4 潜在(8× 压缩)取得 CD $0.83\times10^{-3}$,优于 Omages 直接用 64×64×4 的 $0.89\times10^{-3}$,NC 略低(0.83 vs 0.89);GarmageSet 全面领先,CD $0.46\times10^{-3}$(Omages 1.31)、NC 0.96 最高。(2) 消融(Table 2):仅 Occ→TSDF(无法线损失)使 CD 从 $1.503\times10^{-3}$ 降到 $0.595\times10^{-3}$;加法线损失后 TSDF 达 CD $0.461\times10^{-3}$、NC 0.961;Occ+法线损失 NC(0.947) 超过 TSDF 无法线损失(0.921),但 CD/EMD/JSD 后者仍优,证明表示本身更根本。(3) 效率(Table 3):TRELLIS 16.28GB/4.52s、Omages 52s/样本;本文 RTX 4070 仅 3.22GB/1.21s,M4 CPU 8.52s。(4) 标签生成(Table 4):平均 P-FID 从 31.14 降到 19.91(椅子降 50%、灯具降 49%),P-KID 从 0.12 降到 0.06。(5) 图像生成(Table 5):仅 23K 顶点取得 CD $1.35\times10^{-2}$、F1 0.48、BCD $2.91\times10^{-2}$,优于 TRELLIS(109K 顶点、CD 3.44)与 GarmageNet(526K 顶点、BCD 5.64)。

Quantitative comparison of 3D reconstruction and encoding fidelity on the ABO and GarmageSet datasets
Table 1: Quantitative comparison of 3D reconstruction and encoding fidelity on the ABO and GarmageSet datasets
Ablation study of representation (Occ. vs. TSDF) and normal rendering loss for our DiffGI-VAE on GarmageSet
Table 2: Ablation study of representation (Occ. vs. TSDF) and normal rendering loss for our DiffGI-VAE on GarmageSet
Computational Efficiency & Inference Performance
Table 3: Computational Efficiency & Inference Performance
Label-conditioned 3D generation performance on the ABO dataset, reported as P-FID and P-KID per category and averaged
Table 4: Label-conditioned 3D generation performance on the ABO dataset, reported as P-FID and P-KID per category and averaged
Quantitative comparison of image-to-3D generation on GarmageSet
Table 5: Quantitative comparison of image-to-3D generation on GarmageSet
Qualitative comparison of VAE reconstructions on the ABO and GarmageSet datasets
Fig. 3: Qualitative comparison of VAE reconstructions on the ABO and GarmageSet datasets
Qualitative ablation study of our VAE on the GarmageSet dataset
Fig. 4: Qualitative ablation study of our VAE on the GarmageSet dataset
Qualitative label-conditioned generation results on the ABO dataset
Fig. 5: Qualitative label-conditioned generation results on the ABO dataset
Qualitative single-view image-to-3D comparison on GarmageSet
Fig. 6: Qualitative single-view image-to-3D comparison on GarmageSet
Occupancy-conditioned garment generation and local edit propagation
Fig. 7: Occupancy-conditioned garment generation and local edit propagation
查看结构化数据
任务指标本文基线提升
ABO 数据集三维重建 CD (×10⁻³,越低越好) 0.83(32×32×4 潜在) 0.89(Omages,64×64×4 无压缩) 在 8× 更强压缩下 CD 降低约 7%
GarmageSet 薄壳服装重建 CD (×10⁻³,越低越好) 0.46 1.31(Omages) 降低约 65%,且 NC 0.96 为最高
表示消融(GarmageSet) CD (×10⁻³) 0.461(TSDF + 法线损失) 1.503(Occ,无法线损失) 降低约 69%
图像条件化三维生成 平均顶点数 / BCD (×10⁻²) 23K 顶点,BCD 2.91 TRELLIS 109K 顶点;GarmageNet 526K 顶点 BCD 5.64 顶点数少 4–20 倍且 BCD 最低
标签条件化生成(ABO 平均) P-FID(越低越好) 19.91 31.14(Omages) 降低约 36%,椅子/灯具各降约 50%
推理效率 峰值 VRAM / 单样本时间 RTX 4070 3.22 GB / 1.21s;M4 CPU 8.52s TRELLIS 16.28 GB / 4.52s;Omages 2.49 GB / 52s 比 Omages 快约 43 倍,可在 CPU 实时

局限与改进

作者承认三点局限。第一,基于线性插值的 TSDF 在极端锐边(如机械零件)上会引入局部圆角,因为线性插值天然平滑了尖锐特征。第二,当前框架只生成几何,不输出 RGB 纹理或 PBR 材质属性。第三,每个 UV 图表被独立重建、DMS 把相邻版片当作分离区域,导致相邻图表相接处出现可见接缝(如图 6 中连衣裙上下部分之间);这些边界不连续虽不影响重建与生成指标,却对下游物理模拟构成额外挑战。我补充的观察:消融只覆盖了表示与法线损失,未单独评估 DMS 可微性本身相对真实不可微后处理的贡献(Occ 变体用的是 Omages 风格的可微 tessellation 而非真二值后处理,可能低估二者实际差距);评估数据集高度偏向薄壳场景(家具、服装),对一般性三维物体的泛化未充分验证;WARDROBE 仅作定性零样本评估、缺少定量指标;TSDF 截断阈值与各损失权重等关键超参数未在正文给出。

独立分析的弱点

第一,锐边处理弱:TSDF 线性插值对机械零件等硬边产生圆角,改进方向是引入特征保持的等值面提取(如 dual contouring 双轮廓)来保留锐边,作者也把此列为未来工作。第二,无纹理/PBR 生成:框架只输出几何,难以直接用于服装工业的材质编辑,改进方向是扩展潜在空间联合生成高分辨率纹理与材质图。第三,跨图表接缝:独立重建各图表导致接缝处不连续,改进方向是显式强制跨图表边界一致性(如在 DMS 后加图表缝合约束或全局优化),使输出网格可直接用于布料物理模拟。第四,可微性贡献的消融不充分:Occ 变体用了可微 tessellation 而非真实不可微后处理,可能掩盖 DMS 相对不可微重建的真实增益,改进方向是补充真实不可微基线对照。第五,数据增强定量依据不足:UV 版片级重打包与 90° 旋转增强的定量消融仅放在补充材料,主干正文对该设计选择说服力较弱。第六,评估偏科:数据集集中于服装与家具这类天然薄壳物体,对一般刚性物体、大规模场景的适用性未验证,改进方向是补充更广类别基准。

未来方向

作者明确提出的未来方向有三:(1) 把特征保持等值面提取(如 dual contouring)集成进 DMS 以处理锐边领域;(2) 扩展潜在空间以联合生成高分辨率纹理与材质图;(3) 引入两阶段管线,把二维版片布局生成与三维形状重建分离,增强对复杂服装设计的可控性。基于本文成果可延伸的方向包括:将跨图表边界一致性约束显式建模,使输出网格可直接喂给布料物理仿真器;把 DiffGI 表示与近期高效流匹配/少步蒸馏技术结合进一步压低延迟;探索 TSDF 几何图像在三维编辑、风格化、可微物理仿真等下游任务的应用;将方法推广到角色动画、毛发布料等其他薄壳/非流形几何主导的领域;研究在 32×32×4 这么紧凑的潜在空间上做大规模多类别联合训练的可行性与上限。

复现评估

复现性中等偏上但非完全开放。论文提供项目主页(https://ejshim.github.io/diffgi/),但正文未明确代码与权重是否开源,仅承诺项目页;ABO(公开)与 WARDROBE 可获取,GarmageSet(14,801 件仿真服装)可用性需确认。方法细节较完整:Mesh-to-DiffGI 五步流程、DMS 插值公式与 $\epsilon$、VAE 的 SD1.5 初始化与零初始化、损失项、三类条件模型(DiT-B/2、DiT-L/2+DINOv2-Large、UNet-Tiny)、数据增强均有交代,足以复现核心算法。模型极轻量(潜在仅 32×32×4),推理可在 RTX 4070 甚至 M4 CPU 上运行,训练成本应远低于典型体积生成模型。依赖 nvdiffrast(需 NVIDIA GPU)与 PyTorch,有一定硬件门槛。主要缺口是训练超参数(学习率、各 $\lambda$ 权重、训练步数)多未给出,UV 打包与 dilation 细节需从代码确认;Occ 变体的可微 tessellation 实现未充分说明,可能影响精确复现。