MegaParts:将部件感知3D生成扩展至300部件的令牌高效自回归框架 MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling
自适应长度离散部件令牌+长上下文自回归,部件级3D生成扩展至300部件、256k令牌
前置知识
VQ-VAE(向量量化变分自编码器)
一种将连续特征离散化的自编码器:编码器把输入映射为连续潜在向量序列,每个向量被替换为码本中最近的离散码字,解码器再从离散码序列重建输入。训练用重建损失加 VQ 损失 $\mathcal{L}_{vq}=\|\mathrm{sg}[Z^q]-Z^e\|_2^2+\|Z^q-\mathrm{sg}[Z^e]\|_2^2$(含 stop-gradient)拉近编码器输出与码本。离散 token 天然适配 GPT 式自回归的 next-token 预测,是 3D 生成与 LLM 结合的标准桥梁。
本文的核心部件 tokenizer 就是一个因果注意力版 VQ-VAE,理解码本、量化瓶颈以及词表中 65,536 个 形状 token 的来源都依赖这一概念。
符号距离场(SDF)
定义在三维空间上的连续函数 $f(\mathbf{x})$,返回查询点到物体表面的带符号距离:内部为负、外部为正,零等值面即物体表面。本文使用截断归一化 SDF $\tilde{s}_i=\mathrm{clip}(s_i,-\delta,\delta)/\delta$ 作为监督信号,重建时在 $1024^3$ 分辨率运行 Marching Cubes 从预测 SDF 提取三角网格。
VQ-VAE 的输入输出都是 SDF 场,全部重建损失(tsdf 重建、eikonal 正则、法向对齐)都定义在该场上,不理解 SDF 就无法理解 tokenizer 的训练目标与网格提取流程。
自回归序列建模
把数据表示为 token 序列 $s=(s_1,\dots,s_T)$,用链式法则分解 $p_\theta(s|q)=\prod_{t=1}^{T}p_\theta(s_t|q,s_{<t})$,以 next-token prediction 训练,生成时逐 token 采样,天然支持任意长度输出与条件前缀。GPT 类 LLM 是典型实现;现代长上下文技术(张量并行、序列并行、vLLM 推理服务)使其能处理数十万 token 的序列。
本文把整个 3D 物体(物体包围盒→部件包围盒→部件几何 token)序列化后交给微调的 Qwen3-8B 做自回归生成,这是全文的生成范式,也是其能借用 LLM 基础设施的原因。
率失真理论(Rate–Distortion)
香农信息论中刻画有损压缩的框架:在失真 $D$(重建误差)与码率 $R$(比特/token 数)之间做权衡,典型代价函数形如 $J(L)=D(L)+\gamma R(L)$。增加 token 预算 $L$ 会降低失真但抬高码率,最优预算位于二者权衡的拐点,对应率失真曲线的肘部。
本文用 $J^{(c)}(L)=D^{(c)}(L)+\gamma R^{(c)}(L)$ 为每个部件在 9 个候选前缀长度中自动挑选最优 token 数,这是实现自适应长度表示、把 token 效率变成可优化目标的关键准则。
部件感知3D生成
将 3D 物体表示为语义部件(如桌腿、琴键)的结构化组装而非单一整体网格,通常同时预测部件布局(包围盒)与局部几何。相比整体生成,它天然支持局部编辑、跨资产部件重组与铰接动画。现有方法多为扩散模型(PartCrafter、OmniPart、FullPart、XPart),部件数通常少于 50,token 长度与显存随部件数快速增长。
这是本文要扩展的任务本身:MegaParts 的目标就是把该范式从 50 以内部件推到 300 部件,同时保持结构一致性与几何保真,并释放编辑与铰接等下游能力。
长上下文并行训练(张量并行与序列并行)
Megatron 式训练技术:张量并行(TP)把注意力与 MLP 的权重矩阵切分到多张 GPU,序列并行(SP)把序列维度的激活切分以摊销显存,二者结合使超长 token 序列的训练在显存上可行。推理侧 vLLM 等服务系统通过 PagedAttention 等优化显著提升自回归解码吞吐。
256k token 的训练序列正是靠 TP=4、SP=4 实现的;推理吞吐从 17.0 到 42.5 token/s 的提升也来自换用 vLLM。理解这一点才能体会论文『LLM 原生基础设施直接服务 3D 生成』的主张。
研究动机
现有部件感知 3D 生成方法几乎清一色基于扩散模型(PartCrafter、OmniPart、FullPart、XPart 等),要么依赖预定义分割先验(掩码/部件 ID)做条件生成,要么联合预测布局与几何。这类方法在部件数增多时遭遇共同瓶颈:表示细节几何所需的 token 长度、显存和计算量随部件数快速膨胀,因此绝大多数方法只能处理 50 个部件以内的物体;图像生成领域的实验(Hoogeboom et al. 2023、Tian et al. 2024 等)也证明朴素扩散模型在 token 数增大时生成质量明显退化。表示层面同样受限:VecSet 用共享潜向量池编码整体形状,全局结构与局部细节争夺潜容量,复杂物体的小部件容易被丢掉;体素表示的容量绑定固定网格或预设层级,几何上简单和复杂的区域拿到相近的预算,即便自适应变体也依赖手工空间规则,无法与部件语义分解对齐。而自回归路线(Cube、SAR3D、ShapeLLM-Omni)虽已崭露头角,却没有人探索过长上下文自回归建模用于高复杂度部件级生成——直接给每个部件分配长 token 序列会让总长度随部件数爆炸,压缩 token 又牺牲几何保真,保真与效率的权衡成为根本障碍。
本文的目标是本文的目标是构建一个可扩展的自回归部件感知 3D 生成框架,把实际可生成的物体规模从以往的小于 50 个部件推进到 300 个部件、序列长度最高 256k token,同时不牺牲几何质量。具体拆解为三个子目标:其一,设计令牌高效的向量量化部件 tokenizer,让 token 预算按几何复杂度自适应分配——简单部件只花几个 token,复杂部件保留足够容量;其二,把物体表示为统一的结构化序列(物体级包围盒→各部件包围盒→部件形状 token),用微调的 LLM 一次性自回归生成,使布局规划与几何生成在同一序列中完成,并支持物体级与部件级两类控制信号;其三,充分利用 LLM 生态成熟的长上下文训练与推理技术(上下文/张量并行、vLLM),让整个流水线在训练效率和推理吞吐上都切实可行。作者还怀有一个更深层的验证目标:证明压缩的离散部件表示不仅带来可扩展性,还能反过来提升可达的几何保真度,从而确立『LLM 原生令牌高效自回归建模』作为扩散之外另一条规模化路线的地位。
与已有工作不同的是,本文最独特的切入是把『token 效率』从工程附带指标提升为表示学习的第一性目标,并用率失真理论形式化。已有形状 tokenizer(Cube 的 VQ-VAE、八叉树方法、VAR 式多尺度 triplane)几乎只优化重建保真,token 预算固定或依赖手工设计的空间层级;本文让因果 VQ-VAE 学会把几何信息压缩到前缀 token,再用 $J^{(c)}(L)=D^{(c)}(L)+\gamma R^{(c)}(L)$ 自动决定每个部件的最优长度,实现真正按复杂度分配容量。第二个差异是生成范式:先前 AR 3D 工作要么生成整体形状(Cube、DeepMesh),要么两阶段拼接——先自回归出粗结构、再用扩散模型(TRELLIS 第二阶段)恢复细节(ShapeLLM-Omni);本文受 LLM 思维链启发,把『先规划布局、再逐部件生成几何』编码进单一结构化序列,完全不需要第二阶段扩散模型,布局 token 与几何 token 联合优化。第三个差异在基础设施层面:论文首次把 Megatron 式上下文/张量并行训练和 vLLM 推理引入部件级 3D 生成,把部件数推高一个数量级到 300,并用实验证明『压缩与保真可以兼得』这一反直觉结论。
核心方法
MegaParts 是一条两阶段流水线,直觉上像工厂装配线:先用一个『会节约用字』的 tokenizer 把每个部件的几何压缩成离散 token 串,再让一个 LLM 像写文章一样先列大纲(物体包围盒与所有部件包围盒,即布局规划段),然后逐段填写正文(每个部件的形状 token),最后把生成的部件网格变换回全局坐标拼装成完整物体。技术路线分三步。第一步训练因果 VQ-VAE:把 Cube 的双向注意力编码器/解码器全部换成对潜在维度全因果的注意力,并用随机前缀截断策略(从长度 $L\in\{2^n\}_{n=4}^{12}$ 的随机前缀重建形状)迫使几何信息向前缀集中,从而支持可变长度解码而不明显损失保真;同时引入编码器/解码器分阶段交替优化、最优传输量化与随机梯度捷径(SGS)稳定码本训练。第二步做率失真长度选择:对每个部件离线扫描 9 个候选前缀长度,按 $J^{(c)}(L)=D^{(c)}(L)+\gamma R^{(c)}(L)$ 选出 $L^*_c$,其中失真项是 Chamfer 距离、法向不一致与包围盒 IoU(防小浮块)的加权和,码率项为 $R^{(c)}(L)=L/L_{\max}$。第三步微调 Qwen3-8B 生成器:扩展词表加入 65,536 个形状 token 与结构特殊 token,以 next-token prediction 联合优化布局与几何 token;训练分为 token 对齐、8k 短上下文预训练、32K/128K/256K 长上下文微调三个阶段,用张量并行 TP=4 加序列并行 SP=4 支撑长序列,最终可生成 300 部件、256k token 的物体。
核心创新是『全因果注意力+随机前缀截断训练』带来的信息有序化,以及在此之上用率失真准则实现的自适应长度部件表示。标准 VQ-VAE(如 Cube)用双向注意力,几何信息在潜在序列上分布较均匀,截掉尾部 token 会显著破坏几何,因此无法按需缩短表示;本文把编码器和解码器都改成对潜在维度全因果的注意力(编码器各层在交叉注意力与因果自注意力间切换 $H^{\ell+1}=\mathrm{CrossAttn}(H^\ell,T)$ 或 $\mathrm{CausalSelfAttn}(H^\ell)$),配合训练时随机前缀截断重建($L=\{2^n\}_{n=4}^{12}$),几何内容被天然推向序列前部——前几个 token 承载粗结构、越往后越是细节。这恰好匹配自回归『由粗到细』的语义,使可变长度 tokenization 无需重建降级即可成立。在此之上,率失真目标 $L^*_c=\arg\min_{L\in\{2^n\}}J^{(c)}(L)$ 把『用多少 token』从超参数变成逐部件自动求解的优化问题,与固定预算或手工层级的 tokenizer 有本质区别。更深一层,本文证明压缩与保真并不矛盾:同样 1024 token 预算下,因果 tokenizer 部件级 Chamfer 距离 0.12×10⁻³,远优于 Cube 的 3.95×10⁻³,说明为自回归设计的离散表示同时改善了可扩展性与可达保真度,这挑战了『token 越多越好』的直觉。
方法步骤详情
第一步,数据构建:把多来源物体网格分解为连通分量,按包围盒大小与体素重叠图迭代合并最小分量直到不超过 300 个部件;对非流形网格依次尝试 Blender 3D Print Toolbox、VolumeMaker、solidify 修改器三种修复策略(按与原网格 Chamfer 距离阈值择优),再用 cubvh 水密化并提取真值 SDF。共整理约 1000 万部件网格训 tokenizer、44 万部件标注资产(公开 34 万+私有 10 万)训生成器;文本标注由 Kimi-K2.5 基于 8 个球面视角渲染图生成,含层级类别、材质和 10 条由细到粗的描述;并按部件数 [1,50]、(50,100]、(100,200]、(200,300] 四组以 1:1:1:1 均衡采样。第二步,训练因果 VQ-VAE:结构沿用 Cube v0.5 并从其权重初始化,但查询 token 从 1024 扩到 4096、码本从 16,384 扩到 65,536(三倍复制加扰动);可学习潜在查询 $H_0\in\mathbb{R}^{M\times d}$ 经交叉注意力/因果自注意力更新,球形量化后由因果解码器解码,查询头预测 SDF 并经 Marching Cubes 出网格;损失 $\mathcal{L}=\lambda_{tsdf}\mathcal{L}_{tsdf}+\lambda_{eik}\mathcal{L}_{eik}+\lambda_{normal}\mathcal{L}_{normal}+\lambda_{vq}\mathcal{L}_{vq}$,eikonal 只在近表面带 $|\tilde{s}_i|\le\alpha\delta$ 内施加;训练用 1:1 的物体级/部件级混合及分阶段交替优化。第三步,率失真长度选择:每部件 GPU 并行评估 9 个候选长度(平均 1.8 秒),取 $L^*_c=\arg\min_L J^{(c)}(L)$,纯离线、推理零开销。第四步,微调 Qwen3-8B:词表加入 – 及 <|plan_start|>、<|plan_end|>、<|part_start|>、<|part_end|>、<|shape_start|>、<|shape_end|>、<|box_start|>、<|box_end|>,包围盒用三位有效数字浮点编码;序列=规划段(物体框+部件框)+部件段(按 z–x–y 空间序、量化到 $32^3$ 体素网格的字典序排列),码本嵌入冻结并由 MLP projector 对齐进 Qwen 隐空间;三阶段训练为 token 对齐 1000 步(lr 1e-4、batch 128)→ 8192 token 短上下文 10 万步 → 32K/128K/256K 各 2 万/2 万/5 万步(lr 1e-5、batch 128/64/32、TP=4、SP=4)。第五步,推理与重建:模型自回归预测规划段与各部件 token,部件网格经 VQ 解码器加 1024³ Marching Cubes 提取,再按 $\hat{M}^{(c)}_0=0.5\max(\hat{e}^{(c)})\cdot\tilde{M}^{(c)}+\hat{m}^{(c)}$ 各向同性缩放平移回全局坐标,拼装成完整部件化资产。
技术新颖性
技术新颖性可从四个层面评估。表示层面:因果 3D VQ-VAE 的组件本身来自 Cube,但『全因果注意力+随机前缀截断』的信息前缀化训练是以往 3D tokenizer 没有的,它把表示从『定长、信息均匀』改造成『可变长、由粗到细』;与八叉树/VAR 依赖显式空间层级不同,这里的粗细顺序是学出来的,自然对齐部件语义。分阶段交替优化(冻结互补模块)配合最优传输量化和 SGS,是对 VQ 训练中码字分配不稳定这一老问题的针对性改造,作者明确表示超越了 Cube 的 EMA 稳定化。长度选择层面:把率失真理论引入部件级 token 预算分配是明确创新,且实现代价极低——离线每部件 1.8 秒扫描 9 个长度,推理时零开销,因为 LLM 直接学会预测每个部件该用多少 token。生成范式层面:单序列内『先规划后生成』借用了思维链思想,避免 ShapeLLM-Omni 式『AR 粗结构+扩散补细节』的两阶段拼接;规划段与几何段联合训练还免费带来物体/部件包围盒双粒度条件生成能力。规模化层面:首次把 256k 长上下文训练(TP=4、SP=4)与 vLLM 推理引入部件感知 3D 生成,把可生成部件数推到 300,比先前方法(<50)高约一个数量级。最有说服力的是反直觉的实验结论:为效率设计的压缩表示在同等预算下保真度反超基线约 33 倍(0.12 vs 3.95),说明 token 效率与几何质量可以兼得。
实验结果
重建实验(Table 1)确立了 token 化质量的决定性优势:同为 1024 token 预算,本文部件级 Chamfer 距离 0.12×10⁻³,约为 Cube(3.95×10⁻³)的 1/33,法向一致性 0.93 对 0.89;物体级 CD 1.52 对 1.89、NC 0.89 对 0.85。预算从 512 加到 4096 时部件 CD 单调降至 0.06×10⁻³、NC 升至 0.98,证实学到的离散表示有清晰的由粗到细结构。文本生成 3D(Table 2,PartObjaverse-Tiny,法向贴图评测):FID 43.40 全面领先 SAR3D 94.69、TRELLIS-text 54.81、Cube 55.58、ShapeLLM-Omni 70.99,CLIP 分 0.27 亦最高。部件包围盒条件生成(Table 3,与 FullPart/XPart 共享 GT 包围盒):Part CD 3.01×10⁻² 优于 FullPart 8.59 与 XPart 8.01,Part IoU 0.63 对 0.41/0.52,BBox IoU 0.94 对 0.76/0.59。消融(Table 4):去掉分阶段 VQ 训练,1024 token 下部件 CD 从 0.12 恶化到 0.22、NC 从 0.93 掉到 0.82;去掉因果注意力则大预算的增益缩水(4096 token 部件 CD 0.06→0.10),分别支撑两个核心设计。物体框预测监督把 BBox IoU 从 0.89 提至 0.93(Table 5);部件排序用 z–x–y 或连通图 BFS 性能相当(CLIP 0.27/0.25、FID 43.40/41.68,Table 6)。按部件数分层的四个 held-out 集(Table 7,各 400 个未见物体):本文 FID 46.3/55.0/64.9/73.2,全部区间大幅优于基线的 93.5–124.0,CLIP 稳定在 0.26–0.27。包围盒条件生成(Table 8):本文成功率 0.99/0.95/0.85/0.77,而扩散基线在超过 50 部件后因 CUDA OOM 骤降(XPart 直接 0.00,FullPart 在 [200,300] 为 0.00);有趣的发现是部件越多单部件几何越简单,自适应表示给出更紧凑的预算,Part CD 反而从 1.9 降到 0.2×10⁻²、Part IoU 升至 0.81。效率(Table 9):自回归解码是瓶颈,[200,300] 部件区间 AR 生成约 6735 秒、解码+Marching Cubes 1076 秒;换 vLLM 后吞吐从 17.0 提至 42.5 token/s;300 部件、188k 上下文的峰值显存 71.24 GB,单张 A800 80GB 可容纳。人类偏好研究(Table 10):本文在文本对齐和几何质量上分别拿走 64% 和 69% 的选票,远超 Cube(18%/16%)等基线。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VQ-VAE 部件级重建(1024 token 预算,PartObjaverse-Tiny) | Chamfer Distance (×10⁻³) ↓ / Normal Consistency ↑ | 0.12 / 0.93 | Cube (1024):3.95 / 0.89 | CD 降低约 33 倍,NC 提升 0.04 |
| VQ-VAE 物体级重建(1024 token 预算) | CD (×10⁻³) ↓ / NC ↑ | 1.52 / 0.89 | Cube (1024):1.89 / 0.85 | CD 降低约 20%,NC 提升 0.04 |
| 文本条件 3D 生成(PartObjaverse-Tiny) | FID ↓ / CLIP ↑(法向贴图) | 43.40 / 0.27 | TRELLIS-text 54.81、Cube 55.58、ShapeLLM-Omni 70.99、SAR3D 94.69 | FID 较最优基线低约 21% |
| 部件包围盒条件形状生成 | Part CD (×10⁻²) ↓ / Part IoU ↑ / BBox IoU ↑ | 3.01 / 0.63 / 0.94 | FullPart 8.59 / 0.41 / 0.76;XPart 8.01 / 0.52 / 0.59 | Part CD 降低约 62%,三项指标全面领先 |
| 文本生成 3D([200,300] 部件 held-out 集,各区间 400 物体) | FID ↓ / CLIP ↑ | 73.2 / 0.27 | Cube 100.9 / 0.26;SAR3D 116.4 / 0.23 | FID 较最优基线低约 27% |
| 包围盒条件生成([200,300] 部件区间) | 成功率 ↑(完成推理并产出有效网格的比例) | 0.77 | FullPart 0.00;XPart 0.00(均因 OOM 失败) | 该区间唯一可规模化运行的方法 |
| 人类偏好研究(20 条提示,6 视角渲染盲评) | 文本对齐 / 几何质量 选票占比 ↑ | 64% / 69% | Cube 18% / 16%;TRELLIS-text 16% / 13%;ShapeLLM-Omni 2% / 2%;SAR3D 0% / 0% | 两项均以绝对优势领先 |
局限与改进
作者明确承认的局限有三点。第一,长上下文自回归的训练与推理代价依然高昂:300 部件物体一次生成约需 6735 秒自回归解码加 1076 秒网格提取(Table 9),训练须在多卡上用 TP=4、SP=4 才能容纳 256k 上下文。第二,当前框架只建模几何,不含纹理、材质、语义标注以及部件间物理与功能关系,距离可直接使用的完整资产仍有差距。第三,尽管能到 300 部件,极端长序列仍会在单卡 80GB 显存内失败——Table 8 显示 [200,300] 区间成功率降到 0.77,且失败主要由序列长度而非部件数决定。我自己的观察补充几点:率失真长度选择是逐部件离线的(每部件 1.8 秒、9 次解码扫描),数据或部件数继续增大时会成为数据工程瓶颈;评测协议上,Table 3/8 中各方法接收相同 GT 包围盒但辅助模态不同(本文用文本、FullPart 用图像、XPart 用点云),作者也承认这不是严格公平的跨模态外观对比;基线普遍存在的『部件融合成整块』失败模式会被逐部件归一化的指标过度惩罚,因此 Part CD/IoU 更接近『遵循给定分解』的度量而非纯粹外观质量;此外部件监督来自连通分量分解而非语义分割,学到的『部件』与人类语义部件未必一一对应;全因果解码也意味着多个部件无法并行生成,天然慢于扩散的一次性并行去噪。
独立分析的弱点
弱点一:自回归解码速度。300 部件物体 AR 阶段近 2 小时,vLLM 加速后也只有 42.5 token/s。改进方向:投机解码/多 token 预测、形状 token 的 KV 缓存压缩、部件级并行解码(各部件条件于规划段近似独立)、或用少步扩散头蒸馏局部细化。弱点二:只有几何没有外观与语义。可把纹理、PBR 材质、层级类别 token 纳入同一结构化序列,或与 Part-X-MLLM 类多模态模型联合训练,使一份序列同时支撑生成与理解。弱点三:每个部件的 token 数是离线率失真选出的,模型隐式学会长度预测但缺乏显式长度可控性——用户无法要求『用更少 token 生成简化版』。可在序列中显式输出 $L^*_c$ 或引入长度条件训练,实现 LOD(细节层级)可调。弱点四:部件来源是连通分量加合并,而非语义分割,钢琴键、按钮等细小功能件的质量强依赖数据;可接入更多人工部件数据集或引入自监督部件发现模块。弱点五:网格提取对每个部件都在 1024³ 分辨率跑 Marching Cubes,简单部件也付全价(解码+提取在 [200,300] 区间耗时 1076 秒);可按率失真失真度自适应选择提取分辨率、批量化解码并与 AR 生成流水线重叠。弱点六:成功率与保真随规模下降(0.99→0.77),长序列下的注意力稀释与曝光偏差值得用层级化/分块生成缓解;同时所有评测在单卡 A800 80GB 上进行,多卡分布式推理的规模化上限尚未被探索。
未来方向
作者提出的方向包括:更高效的序列建模、层级化表示,以及几何-外观-语义的统一建模。在此基础上可延伸多条路线。其一,统一多模态资产表示:把纹理、PBR 材质、铰接关节参数(应用演示已暗示钢琴键、控制面板按钮可绑定运动参数与交互逻辑)编码进同一结构化序列,走向『仿真就绪』资产生成。其二,生成范式混合:保留 AR 的结构规划能力,把每个部件的几何 token 交给并行解码器(MaskGIT 式或少步扩散头),在保持部件结构的同时把生成时间降低一个数量级。其三,场景级扩展:物体包围盒→部件包围盒的层级天然可再向上推广为场景→物体→部件三级序列。其四,强化学习后训练:DeepMesh 已证明 RL 能提升 artist-mesh 质量,可用人类偏好或可微渲染信号精调形状 token 策略。其五,交互式编辑闭环:结构化序列支持只重采样某部件 token 的局部重生成,结合用户框选可做对话式 3D 编辑。其六,推理系统工程:作者指出模型量化、投机解码、分布式推理都是兼容方向,并强调吞吐结论必须绑定实测配置,这为后续『3D 专用推理引擎』研究留出空间。其七,基准建设:[200,300] 部件量级缺乏带语义部件标注的标准测试集,作者约 1000 万部件、44 万资产的数据管线若开源将极有价值。
复现评估
复现难度评估:偏高。开源情况——论文提供项目主页(expmaster.github.io/megaparts_webpage),但正文未给出代码或权重发布承诺;利好是关键依赖均开源:基座 Cube v0.5(tokenizer 权重可初始化)、Qwen3-8B、vLLM、cubvh,评测基准 PartObjaverse-Tiny 公开。数据方面一半可自建:公开部分(ShapeNet、Objaverse、HSSD、Infinigen、Infinite-Mobility、PartNet、PartVerse-XL、PartNext、HY3D-Bench)约 34 万资产可获取,但另有 10 万私有资产不可得;文本标注依赖 Kimi-K2.5 对 8 视角渲染打标,可替换为其他 VLM 但质量可能有差异;连通分量分解、三阶段网格修复(Blender 3D Print Toolbox/VolumeMaker/solidify)与 cubvh 水密化管线的工程量不小。算力方面:生成模型基于 Qwen3-8B,长上下文阶段 TP=4×SP=4,训练 256k 上下文至少需要 8 卡级 A800/H100 节点;单张 A800 80GB 只够推理(300 部件、188k 上下文峰值 71.24 GB)。评测协议复现性好:四个 held-out 集构建规则明确(各 400 个、按部件数四档分层),CD、NC、FID、CLIP、Part IoU、BBox IoU、成功率定义清楚,率失真选择开销仅 1.8 秒/部件。总体判断:若作者不开源代码与 VQ-VAE 权重,独立复现需要资深 3D+LLM 工程团队投入数月;若开源,多数实验可在学术算力范围内验证。
论文图表
论文主视觉:展示多个高达 300 部件的复杂生成物体(如机械、载具、家具),并用工厂装配线作类比——模型先自回归地『制造』各部件网格,再拼装成完整 3D 物体。
一图点明任务定位(部件感知生成)、规模上限(300 部件)与核心隐喻(自回归制造+装配),是理解论文主张的最佳入口。
训练数据集中物体部件数的分布直方图(横轴 0–300,纵轴计数最高约 50000),显示低部件数物体占多数、高部件数区域样本稀少但覆盖完整。
说明『300 部件』能力背后的数据基础,也解释了后续按部件数分组 1:1:1:1 均衡采样的必要性。
部件数大于 50 的资产分布放大图(横轴 50–300,计数约 500–2500),显示高部件数样本是数据集中的稀缺长尾。
量化高复杂度样本的稀缺程度,是理解训练数据配方与评测集构造(四个部件数区间 held-out 集各 400 个)的背景信息。
三个由模型生成的洗碗机,展示了高质量的内部结构:内腔、碗架、分层结构等细节合理;论文指出模型并未被显式训练建模内部结构,这是偶尔涌现的生成行为。
展示结构化序列建模带来的涌现能力,暗示方法在显式监督之外的泛化潜力,也佐证自适应 token 预算能承载复杂内部几何。
补充的文本条件生成视觉对比:玩具坦克、CRT 台式电脑、带植物的花盆、低多边形皮卡、科幻坦克、金色铠甲武士等提示词下,本文与 ShapeLLM-Omni、Cube、SAR3D、TRELLIS 的网格渲染对比,本文在部件完整性与细节上持续占优。
扩大定性证据的物体类别覆盖面,避免主图选择偏差,进一步支撑 Table 2/7 的定量领先。
对比显式监督物体包围盒预测与直接把框提示给模型:BBox IoU 从 0.89 提升到 0.93,说明联合优化布局 token 带来更强的用户全局约束遵循。
支撑『规划段与几何段联合训练』这一设计选择的消融证据,补充结构可控性的量化口径。
对比 z–x–y 空间排序与连通图 BFS 排序:CLIP 0.27/0.25、FID 43.40/41.68,两者性能相当;作者保留 z–x–y 因其无需建图、大规模预处理更快。
回应『自回归对部件序列顺序是否敏感』的自然疑问,说明方法对合理的序列化策略稳健。
四个互斥 held-out 集(各 400 物体,部件数 [1,50)/[50,100)/[100,200)/[200,300])上的文本生成:本文 CLIP 稳定 0.26–0.27,FID 46.3/55.0/64.9/73.2;基线 CLIP 0.22–0.27、FID 93.5–124.0,本文在每个区间都大幅领先。
最重要的规模化证据:随部件数增长质量平缓退化且全程碾压基线,直接支撑『扩展到 300 部件』的核心主张。
按部件数分层的包围盒条件生成:本文成功率 0.99/0.95/0.85/0.77、Part CD 1.9→0.2、Part IoU 升至 0.81、BBox IoU 0.87–0.93;FullPart 成功率 0.89/0.17/0.05/0.00,XPart 0.82/0.00/0.00/0.00,扩散基线在超过 50 部件后因 OOM 大面积失败。
规模维度上最悬殊的对比,直观展示自回归+token 高效表示在 50+ 部件区间的可用性优势,以及部件越多单部件越简单的有趣规律。
单张 A800 80GB 上的推理耗时分解:自回归生成 335/2066/3746/6735 秒,解码+Marching Cubes 51/413/502/1076 秒(对应四个部件数区间);另报告朴素 HF 吞吐 17.0 token/s、vLLM 42.5 token/s,以及 300 部件、188k 上下文峰值显存 71.24 GB。
量化推理成本与瓶颈(AR 解码主导),是评估方法实用边界和改进方向(vLLM、批量解码)的必要数据。
20 条提示、6 个固定视角渲染的盲评用户研究:本文文本对齐 64%、几何质量 69% 的选票;Cube 18%/16%、TRELLIS-text 16%/13%、ShapeLLM-Omni 2%/2%、SAR3D 0%/0%。
补充人类感知维度的证据,验证自动指标(尤其 FID)的领先能转化为真实观感优势。