← 返回 2026-08-03

Meshy T2:基于流匹配的快速原生网格生成 Meshy T2: Fast Native Mesh Generation with Flow Matching

Jiale Xu, Rendong Liang, Yuhao Long, Siyuan Shen, Zangyueyang Xian, Zeyi Xu, Yuanming Hu 📅 2026-07-28 👍 53 2026-08-08 18:30
3D网格生成 三维内容生成 图像到网格 流匹配 网格VAE

基于流匹配的两阶段图像到网格框架,中位6秒生成紧凑可用的艺术家网格

前置知识

多边形网格(Polygonal Mesh)

多边形网格用顶点、边、面三种基本元素描述三维物体的表面,是游戏引擎、AR/VR、机器人仿真、数字内容流水线中渲染、碰撞、编辑、存储和传输的标准表面表示。网格质量取决于能否用尽可能少的图元表达目标形状,同时保留锐利边缘、薄结构和有意义的部件边界。生产级资产通常由艺术家手工建模或重拓扑,对拓扑(顶点如何连接成边和面)要求很高:边流要顺应几何结构与动画需求,这类拓扑被称为 artist-style topology。

理解网格为何是标准表示、以及为什么拓扑质量对工业流水线至关重要,才能明白论文要解决的真正痛点不是把形状画出来,而是产出可直接用于生产的紧凑网格。

自回归网格生成(Autoregressive Mesh Generation)

以 MeshGPT 为代表的范式把网格当作一条可序列化的 token 序列:把面拆解成离散坐标,用自回归 Transformer 逐 token 生成。后续工作(EdgeRunner、TreeMeshGPT、MeshSilksong、BPT、DeepMesh)主要通过设计拓扑感知遍历以最大化边的复用、或用分块索引压缩坐标来降低序列长度。这类方法能产出紧凑且接近艺术家风格的拓扑,但本质上是把一个无序整体压扁成一维序列,推理天然是顺序过程且随面数预算增长而变慢,而网格有效性成为长采样序列的涌现属性,局部采样错误会传播为破面、绕序不一致或裂缝。

这是本文要超越的主流基线范式,理解它的根本缺陷(顺序性、误差累积、序列化不自然)才能理解为什么并行、流匹配方案是有意义的。

流匹配与 Rectified Flow

流匹配(Flow Matching)是一类生成模型,把生成过程建模为从噪声分布到数据分布的连续流,训练目标是在线性插值轨迹 $x_t = t x_1 + (1-t) x_0$ 上学习速度场 $v_\theta(x_t, t)$(其中 $x_1$ 是数据、$x_0$ 是噪声)。Rectified Flow 是其线性插值调度的实例,目标函数简洁、训练稳定。与扩散模型相比,流匹配天然支持所有图元的并行合成,推理成本可与网格规模解耦,因此特别适合处理无序、大规模的图元集合。

本文用流匹配替代自回归来生成网格,理解速度场预测和线性插值调度是理解两阶段流水线与并行生成的核心。

稀疏结构生成与 Voxel VAE

借鉴 TRELLIS 等稀疏结构生成思路,本文不为二值占据网格直接建模,而是在一个预训练的 Voxel VAE 的连续潜在空间里做流匹配。Voxel VAE 是一个稠密 3D 卷积 VAE,通过两次 stride-2 卷积把 $64^3$ 占据网格压缩成分辨率 $16^3$、8 通道的空间高斯后验,解码器用 3D pixel-shuffle 上采样重建占据 logits。这样既去除了原始网格的大量空间冗余,又为流匹配提供了平滑的潜在分布,生成后再冻结 VAE 解码并阈值化得到二值占据 scaffold。

这是第一阶段粗 scaffold 的关键机制,理解它才能看懂为什么要把生成拆成体素流和网格流两段。

顶点集网格表示与 SpaceMesh

SpaceMesh 提出用每个顶点对应一个潜在 token 的集合表示,并把拓扑分为两层:用邻接的时空嵌入(spacetime embedding)预测的无向边集 $E$,以及用 per-vertex 半边后继置换 $\pi_i$ 表示的有向面。半边后继 $\pi_i(p)=n$ 表示在顶点 $i$ 的扇形(triangle fan)里,走到 $p$ 的边紧接着是走到 $n$ 的边,构成一个三角形 $(p, i, n)$。读出所有 $E$ 和 $\{\pi_i\}$ 可无损还原有向面集。SpaceMesh 原假设网格是 watertight(封闭),每个扇形是闭合循环。

本文的 Mesh VAE 几乎无损地扩展了 SpaceMesh,并把它推广到含开放边界的非封闭网格,这是理解其表示设计的基础。

研究动机

高质量、可直接用于生产的紧凑网格至今仍主要靠艺术家手工建模或重拓扑,慢且昂贵,无法跟上三维内容需求的增长。现有生成路线各有硬伤:第一类主流方法(3DShape2VecSet、TRELLIS、LATTICE 等)先学习隐式或体积几何表示,再用 Marching Cubes 及其变体抽面,结果往往带数十万近均匀三角形,远超渲染、编辑、动画流水线的承受能力,而后续简化作为纯几何后处理,三角化不规则、难以尊重锐利特征与部件结构。第二类方法(MeshGPT 及其后续 EdgeRunner、TreeMeshGPT、MeshSilksong、BPT、DeepMesh)把网格序列化后自回归生成,虽能产出艺术家风格拓扑,但把一个无序整体压成一维 token 流本质不自然,推理随面数预算线性变慢,且网格有效性是长序列的涌现属性——一次局部采样失误会传播成破面、绕序不一致或相邻区域裂缝。已有的扩散/流方法又普遍对顶点做量化、对重合顶点做焊接、或用启发式从边图恢复三角面,损失精度与拓扑;而且多数以现有表面采样的点云为条件,本质只做重拓扑,没系统处理推理时无密集几何可用的图像到网格任务。

本文的目标是本文要打造一个快速的原生网格生成框架 Meshy T2,直接以单张参考图像为输入,产出紧凑、可直接使用、带艺术家风格拓扑的网格。具体目标有四:一是交互级速度,端到端图像到网格生成在十秒以内完成;二是几乎无损的表示,顶点坐标保持连续、重合顶点不被焊接、艺术家手工连接关系被精确保留;三是强面数控制,用户在解码前设定顶点预算即可控制网格复杂度,无需事后简化;四是原生支持多部件资产,让连接部件直接从生成的连通性中自然分解出来,而无需额外的按部件生成或缝合阶段。

与已有工作不同的是,本文的独特切入角度在于同时闭合两个长期存在的缺口。其一是表示的精确性:过去方法靠顶点量化和启发式面重建必然引入伪影,使原网格的细节和拓扑无法忠实穿过潜在空间,解码产物常需后处理修复非法连接、重叠面或非流形边才能用;Meshy T2 设计了几乎无损的顶点集 VAE,坐标不量化、重合顶点不焊接、顶点与边连接和面绕序一次性联合恢复。其二是任务范围:以往扩散/流方法多条件于现有表面采样的点云,实际只做重拓扑,而图像到网格生成在推理时根本没有密集几何可用,挑战未被系统对待;Meshy T2 把生成拆成粗到细的两阶段流匹配级联——图像条件的体素流先勾画粗略占据 scaffold,网格流再在其上填充逐顶点潜在 token,并用 Sobol 最优传输为无序潜在集合分配位置编码,从而把全局布局与局部镶嵌的难题分而治之。

核心方法

Meshy T2 先建一个几乎无损的顶点集 Mesh VAE,每个顶点对应一个潜在 token $z_i \in \mathbb{R}^C$($C=32$),解码器单次前向即同时恢复顶点坐标、无向边和有向面绕序;再在 Rectified Flow 线性插值调度 $x_t = t x_1 + (1-t) x_0$ 上构建粗到细两阶段流匹配级联。第一阶段为图像条件的体素流:冻结 Voxel VAE 把 $64^3$ 占据网格编成 $16^3$、8 通道潜在,展平成 4096 个 token 作干净端点,28 层 hidden 1536 的 DiT 速度场在 DINOv3 图像交叉注意力下做速度预测,结果冻结解码并阈值化得二值占据 scaffold。第二阶段为网格流:把潜在、图像(2304 个 token)、体素(4096 个 token)拼接送入 single-stream DiT,用 Sobol 最优传输给无序潜在 token 分配 3D 位置,以顶点预算与存在通道实现面数控制,只取存在通道为正的 token 送 VAE 解码,端到端中位 6 秒。

核心创新点与已有方法的本质区别有三。第一,几乎无损的表示:绝大多数既往生成器把顶点量化到离散网格并焊接重合顶点,会模糊细节、静默改写连接、融合仅相触的部件;Meshy T2 连续回归顶点位置、保留重合顶点的独立 token,几何精度、艺术家拓扑与部件结构被精确保留,并因此让多部件资产自然分解为连通分量。第二,粗到细分治:单图对全局三维形状约束很弱,而潜在集合是大而无序的细粒度 token,单流直接生成效果差;两阶段把全局布局交给体素流、把镶嵌与拓扑交给网格流。第三,为无序潜在集合分配位置编码的最优传输方案:每个潜在槽初始都是 i.i.d. 高斯噪声、彼此不可区分,任何置换都是同等合法的生成目标,速度场被迫对组合数级的等价指派取平均而严重阻碍收敛;作者用与槽数同基数的确定性 Sobol 点集,按平方欧氏代价做最优传输指派来给潜在 token 赋 3D RoPE 位置,推理时无需真值,Sobol 点集本身就提供位置。面数控制则借助闭三角网格的欧拉关系 $F \approx 2V$,通过顶点预算间接控制面数。

方法步骤详情

Mesh VAE 解码器预测坐标 $\hat{x}_i$、边嵌入 $e_i$、面嵌入 $f_i$:边用 $A_{ij}=\|e_i^t-e_j^t\|^2-\|e_i^s-e_j^s\|^2$ 超阈值判有边、类平衡 BCE 监督;面用半边后继置换 $\pi_i$ 加 NULL 支持开放边界,元素积经 10 步 Sinkhorn 成 $P_i$、NLL 监督;损失 $\mathcal{L}_{\text{VAE}}=w_v\mathcal{L}_{vertex}+w_e\mathcal{L}_{edge}+w_f\mathcal{L}_{face}$,$w_v=100$、$w_e=w_f=10$。两阶段流:冻结体素 VAE 后,体素流 DiT 出 scaffold;网格流为单流 DiT,拼接潜在、图像与体素 token,预算 $N$ 经 Fourier 嵌入加时间嵌入,训练加存在通道(真值 +1、pad -1)做 CFG。推理:坐标作顶点、$A_{ij}>0$ 作无向边,$P_i$ 经单扇形约束线性指派成硬后继映射,读出有向面输出完整网格。

技术新颖性

技术新颖性体现在四个相互配合的设计上。其一,表示层面:在 SpaceMesh 基础上引入 NULL 元素把半边后继置换推广到开放、非 watertight 表面,使艺术家资产中常见的开放边界被精确表示而非近似或丢弃;同时坚持不量化、不焊接以保无损。其二,位置编码层面:针对无序潜在集合“所有置换等价导致速度场取平均”的收敛瓶颈,提出 Sobol 点集加最优传输指派,相比 index PE 把验证 Chamfer 从 0.0127 降到 0.0070(降 45%)、Hausdorff 从 0.0783 降到 0.0225(降逾 3 倍),且推理无需真值。其三,任务层面:把图像到网格拆成体素 scaffold 与网格流两阶段,让全局形状与局部镶嵌解耦,避免单流直接生成在弱 2D 约束下的失败。其四,可控性层面:用存在通道与顶点预算把“精确面数控制”松弛为“范围控制” $[N/(1+p), N]$,借助欧拉关系 $F\approx 2V$ 让面数预算可预测,而无需事后简化。这些设计共同把并行流式生成、无损拓扑、可控面数和多部件原生支持整合进一个端到端框架。

Vertex-set mesh autoencoder training framework.
Figure 2: Vertex-set mesh autoencoder training framework.
Voxel-grid encoding.
Figure 3: Voxel-grid encoding.
Voxel-grid generation.
Figure 4: Voxel-grid generation.
Mesh generation.
Figure 5: Mesh generation.

实验结果

位置编码消融(Table 1,同架构)显示 Sobol OT 全面领先:Chamfer 从 no-OT 的 0.0127 降到 0.0070(降 45%)、Hausdorff 从 0.0783 降到 0.0225(降逾 3 倍)、非流形边比从 0.0102 降到 0.0043,增益主来自完整传输指派。高多边形重拓扑(Table 2,115 资产、约 4000 面)中 Meshy T2 几何最佳:CD 0.020、HD 0.044、NC 0.860、中位 3 秒、成功率 100%,大优势领先 MeshFlow(CD 0.319、94 秒)与最强自回归基线 MeshAnything V2(CD 0.037、49 秒),DeepMesh、MeshSilksong 成功率仅 28.7%、49.6%。图像到网格(Table 3)中 Meshy T2 在 DINOv2 FD 以 2312.01 领先 Tripo P1(2442.27)与 MeshFlow(2577.00),中位 6 秒、成功率 100%。综上几何保真度达 SOTA 且比自回归快一个数量级。

Position-encoding / optimal-transport ablation on the vertex-set mesh VAE.
Table 1: Position-encoding / optimal-transport ablation on the vertex-set mesh VAE.
High-poly mesh retopology results.
Table 2: High-poly mesh retopology results.
Image-to-mesh generation results.
Table 3: Image-to-mesh generation results.
Position-encoding / OT ablation on the vertex-set mesh VAE.
Figure 6: Position-encoding / OT ablation on the vertex-set mesh VAE.
查看结构化数据
任务指标本文基线提升
高多边形重拓扑(retopology) Chamfer Distance(CD,越低越好) 0.020 MeshAnything V2 为 0.037,MeshFlow 为 0.319 相比次优的 MeshAnything V2 降低约 46%,相比同属扩散的 MeshFlow 降低约 94%
高多边形重拓扑(retopology) 中位端到端耗时(秒) 3 秒 MeshAnything V2 49 秒,BPT 210 秒,MeshFlow 94 秒 比最快的强基线 MeshAnything V2 快逾 16 倍,比自回归方法整体快一个数量级以上
图像到网格生成(image-to-mesh) Fréchet Distance(DINOv2 骨干,越低越好) 2312.01 Tripo P1 为 2442.27,MeshFlow 为 2577.00 相比 Tripo P1 降低约 5.3%,相比 MeshFlow 降低约 10%,体现更强语义结构一致性
位置编码消融(VAE 验证集) Chamfer Distance 0.0070(Sobol OT) no-OT(index PE)0.0127,Sobol+Morton 0.0091 相比 no-OT 降低 45%,相比 Sobol+Morton 降低 23%

局限与改进

作者承认与可观察到的局限有几方面。表示层面,半边后继置换 $\pi_i$ 仅在流形网格上有定义,数据集中的非流形网格需预先通过切分违规边/顶点来修复;作者也直言在高度不规则源网格上的拓扑鲁棒性仍待加强。可控性层面,精确面数控制难以学习——数据集覆盖的顶点计数有限,模型对任意形状无法可靠地恰好花满 $N$ 个顶点,故退化为范围控制 $[N/(1+p), N]$,对需要严格预算的应用仍是松弛。评测层面,基准仅 115 个资产,且 ground truth 由自家 Meshy 6 生成并均匀抽稀到 10 万三角面,存在自指评测风险;图像到网格的 FD 分数整体偏高(与 Meshy 6 参考上限 240.65/2021.68 相差不大),说明在该度量下方法间差异有限。任务范围层面,仅支持三角网格、单张前向参考图条件,未涉及材质、纹理或四边面;图像到网格对照中的自回归基线经“图像→密集网格→艺术家网格”两阶段流水线评测,FD 度量的是流水线后外观而非原生图像条件,比较口径不完全一致。

独立分析的弱点

独立来看有几个可改进的弱点。第一,流形假设与不规则源:真实扫描或逆向工程网格常含非流形结构,当前需预处理修复,改进方向是把表示或损失扩展到原生支持非流形,或引入鲁棒的拓扑修复解码后处理。第二,单图条件与视角歧义:单张前向图对背面与遮挡几何约束很弱,可引入多视角图、视频或文本-图像联合条件,并用视图一致性损失降低歧义。第三,面数控制为范围而非精确:对移动端与 LOD 流水线的硬预算不够,可结合存在通道的强约束、计数蒸馏或自回归式预算头实现更接近精确的控制。第四,仅三角网格、无材质:生产资产常需四边面与 PBR 材质,可扩展面预测头支持四边/多边面,并接上纹理与材质生成分支。第五,评测规模与自指:基准仅 115 资产且 ground truth 来自自家系统,建议在公开数据集(如 Objaverse-XL)与外部 ground truth 上做更大规模评测以增强说服力。第六,端到端 FD 度量区分度有限:可补充更敏感的几何与拓扑指标(如 FID-style 网格分布距离、部件分割一致性)。

未来方向

作者明确点出三个方向:一是进一步提升在高度不规则源网格上的拓扑鲁棒性;二是把框架扩展到更丰富的材质与部件级控制;三是研究场景级生成,在共享全局预算下同时产出多个紧凑网格。基于成果的可延伸方向包括:把 Sobol OT 位置编码思想推广到其他无序集合生成任务(点云、场景图、分子);将两阶段粗到细范式与多视角或视频条件结合,做交互式、可控的资产创作工具;引入用户友好的四边面输出与 PBR 材质,衔接现有 DCC 流水线;以及探索把存在通道式的预算控制迁移到其他需要“软预算”的生成任务,例如可控序列长度生成或可变 token 数的潜在扩散。

复现评估

作者承诺代码与权重开源于 https://github.com/meshy-dev/meshy-t2,并给出了较完整的实现细节:注意力宽度 1024、16 头,编码器 6 对图注意力/自注意力层、解码器 12 块共享 trunk 加 4+4 分支,潜在 $C=32$、$d_e=d_f=16$、10 步 Sinkhorn、损失权重 $w_v=100$、$w_e=w_f=10$;体素 VAE 的 KL 权重 $\lambda_{\text{KL}}=10^{-4}$;体素流 DiT 为 hidden 1536、28 块、12 头;图像编码用冻结 DINOv3,计数条件与 classifier-free guidance 丢弃概率(0.2/0.3/0.2 与 0.05)也都列出,并提到用 FSDP2 分片与按 token 上限打包 batch。但训练数据集未公开(疑似专有艺术家资产),网格流 DiT 规模未完整给出,且整体是大规模流匹配训练,复现所需算力与数据门槛很高。因此架构与超参可复现,但完整训练复现难度较大,需依赖作者如期释放的权重与(可能的)数据子集。