← 返回 2026-08-05

Hunyuan3D-Buffalo 1.0:统一3D生成、理解与编辑的多模态模型 Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Zhuo Chen, Chunchao Guo 📅 2026-08-03 👍 86 2026-08-10 18:30
3D生成 3D编辑 合成数据 扩散Transformer 统一多模态模型

一个架构统一3D理解、生成、编辑与部件生成,87M数据驱动协同

前置知识

统一多模态模型(Unified Multimodal Model)

统一多模态模型指把视觉理解、内容生成和指令式编辑等多个任务集成进单一神经网络架构,由一套参数联合训练。在2D图像领域,GPT-4o、FLUX、Seedream、Qwen-Image等已证明这种统一性能让不同任务相互迁移能力——更强的理解能指导更可控的生成。其核心难点在于不同任务的最优建模范式不同:理解常用自回归序列预测,生成常用扩散过程,需要在架构层面把它们桥接起来。

本文的核心命题就是验证3D领域也能实现这种统一,以及理解/生成/编辑能否相互增益,这是判断全文价值的关键。

扩散Transformer与流匹配(DiT & Flow Matching)

扩散Transformer(DiT)用Transformer作为去噪骨干,通过流匹配目标训练:在目标潜在 $z_1$ 与高斯噪声 $z_0$ 之间做线性插值 $z_\tau=\tau z_1+(1-\tau)z_0$,模型学习预测速度场 $v_\theta$ 去逼近 $z_1-z_0$,使对应的概率流ODE能把噪声映射到数据分布。相比传统DDPM,流匹配目标更简单、训练更稳定,被Hunyuan3D-2.1、TRELLIS等3D生成模型广泛采用。

本文的生成模块3D-DiT即以流匹配为训练目标,理解它能帮助看懂生成与编辑的训练原理。

3D视觉语言模型(3D-VLM)

3D-VLM是面向3D资产的视觉语言模型,输入通常是点云(XYZ坐标+RGB+法线)或多视图渲染,输出文本回答、定位框或指令。它先用3D编码器把几何压缩成潜在token,再注入解码器式Transformer与文本token一起做自回归预测。本文用VecSet编码器把3D表示压成latent token,再用Q-Former压缩成512个固定长度token,并扩展133个特殊token支持3D包围盒定位(用 / 包裹6个量化坐标 …)。

3D-VLM是本文的语义引擎,它产出的隐藏状态直接条件化生成与编辑,理解它才能看懂统一如何落地。

VecSet表示与3D-native VAE

VecSet是3DShape2VecSet提出的3D-native潜在表示:先用集合编码器把点云/网格映射成一组有序潜在向量集合,再由解码器重建几何。它把不规则的3D几何转化成类似图像patch的规整token序列,非常适合做扩散生成的潜在空间。Hunyuan3D-2.1和TRELLIS都基于这种表示构建3D VAE和生成模型,Hunyuan3D-Buffalo 1.0也沿用这一潜在空间作为基础设施。

3D-DiT和编辑的源物体条件化都发生在该潜在空间,是架构运转的地基。

Chamfer距离与F1分数

Chamfer距离(CD)衡量两个点集/网格表面的几何差异:对A中每个点找B中最近点、对B中每个点找A中最近点,把所有最近距离平方求和再平均,写作 $\text{CD}=\frac{1}{|A|}\sum_{a\in A}\min_{b\in B}\|a-b\|^2+\frac{1}{|B|}\sum_{b\in B}\min_{a\in A}\|a-b\|^2$,值越小越相似。F1分数则基于距离阈值判定匹配点的精确率和召回率的调和平均。二者是3D编辑与生成评估的标配指标。

论文用CD和F1作为Edit3D-Bench的核心指标,理解它们才能正确解读86.7% CD降低等结论。

研究动机

当前3D领域的研究高度碎片化——理解、生成、编辑三类任务分别由独立系统承担:PointLLM、ShapeLLM专注理解,TRELLIS、Hunyuan3D专注生成,Nano3D、VoxHammer专注编辑。这种割裂阻碍了模型学到统一的“语义-视觉-几何”表征。更关键的是数据瓶颈:3D资产采集、标注、编辑远比2D图像困难,尤其缺乏大规模且几何一致的编辑数据。具体而言,主流的2D-to-3D lifting范式(如ShapeLLM-Omni先用2D扩散编辑再重建)缺少源资产与目标之间的显式3D对应,常导致身份漂移、几何幻觉、多视图不一致以及对未编辑区域的意外修改;而显式3D约束范式(如Nano3D、VoxHammer)的编辑质量受限于底层3D骨干(多为TRELLIS,结构偏模糊),VoxHammer还需人工指定3D包围盒难以规模化,原始Nano3D的启发式区域估计对小幅、遮挡、视角相关的编辑定位不准。

本文的目标是本文的目标是在单一架构内统一3D理解、文本到3D生成、指令引导的3D编辑和文本定位的部件生成四类任务,并验证它们在统一训练下能相互增益而非彼此拖累。为此作者设定了可量化的目标:构建87M规模的三模态3D语料(25M理解样本、50M文生3D对、12M编辑对,分别是Nano3D的100倍、Omni123的12倍),在Edit3D-Bench编辑基准上取得最优的Chamfer距离与F1,在UniPart-Bench理解基准上全面领先,并通过用户研究在文生3D上获得超过25%随机基线两倍以上的偏好率。同时要证明两条协同关系:更强的文生3D改善编辑,更强的3D理解改善编辑。

与已有工作不同的是,本文的独特切入角度有二。第一,它不把编辑当成需要专用流水线的孤立任务,而是把“源物体表示作为条件拼接到扩散过程”——编辑和部件生成共享同一套数据准备与训练管线,只在指令类型上不同(部件生成被视为目标区域即查询部件本身的编辑特例)。第二,它借鉴Vision-Banana“把密集感知改写成条件生成”的思路,首次证明文本定位的部件生成可以在原生3D多模态大模型内完成,无需专门的部件生成流水线。更宏观地,它回答了一个被忽视的问题:3D的理解、生成、编辑在统一训练范式下究竟能否互相强化——论文用“只加文生3D数据就涌现编辑能力”等实验给出肯定证据。

核心方法

直觉上,可以把Hunyuan3D-Buffalo 1.0想象成一个“会看图说话又会动手雕塑”的工匠:它的“眼睛和大脑”是Hunyuan3D-VLM,负责读懂点云的结构、外观、空间关系并产出语义特征;它的“手”是3D-DiT,负责把这些语义意图雕刻成高保真几何。两者通过一个轻量MLP-Connector连接,VLM的隐藏状态经投影后注入DiT的条件空间。生成时VLM只提供语义条件;编辑和部件生成时则额外把源物体的3D表示拼接到DiT自注意力层的噪声潜在上,让模型在去噪时直接“看到”原始几何,从而保住未编辑区域。架构灵感来自Qwen-Image这类混合框架——理解用自回归、生成用扩散,各取所长,理解训练不破坏生成先验。

全文最核心的创新是“用统一的条件接口让自回归理解驱动扩散生成与编辑”。与以往把理解和生成塞进同一Transformer(如Bagel的Transfusion式深度融合)不同,本文采用解耦设计:Hunyuan3D-VLM训练好后完全冻结,只通过MLP-Connector把它的高层语义特征投到3D-DiT的条件嵌入空间,生成阶段用交叉注意力注入,编辑阶段用源物体拼接做自注意力条件。这种设计的本质区别在于——它把“指令理解”和“几何合成”解耦,让强大的3D生成先验(来自Hunyuan3D-2.1初始化)不被理解训练破坏,同时又让理解能力能精确指导局部编辑区域定位。源物体条件化是编辑保真度的关键:它给予模型对原始几何的直接访问,从而在修改目标部件的同时忠实保留未编辑区域。

方法步骤详情

整体训练分四个阶段。Stage 1训练3D-VLM:先冻结Qwen-VL骨干只训3D-token连接器(VecSet编码器、Q-Former、投影层)做对齐,再解冻全模型在文本/图像/3D混合指令数据上联合微调,得到统一语义引擎并在此后全程冻结。Stage 2文生3D预训练:把VLM隐藏状态经MLP-Connector注入从Hunyuan3D-2.1初始化的3D-DiT,在约50M文-资对上以流匹配目标训练,per-token特征通过交叉注意力条件化去噪器。Stage 3统一预训练:以文生3D:(编辑+部件)=1:1的采样比例混合训练,因编辑语料远小于文生3D,编辑与部件数据重复4倍以匹配批内比例。Stage 4分路继续预训练:编辑与部件仍混入一半文生3D数据保生成质量,文生3D则纯用文生3D数据;所有生成阶段优化流匹配目标,预测从高斯先验到目标3D潜在分布的速度场。数据侧,文生3D用五阶段流水线(层级提示分类→组合式提示合成→图生3D+多视图渲染→六级字幕+几何打分→阈值 $\tau=10$ 过滤)产出约 $5\times10^7$ 对;编辑用Nano3D-v2五阶段流水线(锚点视图选择→学习3D包围盒→体素FlowEdit+合并→LATTICE几何精修+NaTex纹理精修→VLM标注过滤)产出12M对。

技术新颖性

技术新颖性体现在四点。第一,Nano3D-v2首次引入“学习的3D编辑区域定位模块”——训练一个自回归Transformer根据2D编辑掩码和源体素预测精确3D包围盒作为硬空间约束,取代了VoxHammer的人工框和原Nano3D的启发式估计,解决了小幅/遮挡编辑定位不准的问题并实现大规模自动化。第二,统一架构上首次把部件生成作为原生指令跟随任务,用统一3D MLLM的指令微调数据实现开放词表的部件定位与分解,无需专用管线。第三,设计了语义mesh合并工具,把过分割的mesh碎片合并为可被自然语言指称的宏观部件,解决了HY3D-Bench等数据集只有几何碎片无语义标签的问题。第四,对比ShapeLLM-Omni这类用VQVAE tokenization做统一3D的尝试,本文的解耦AR+DiT设计在细粒度几何和复杂空间结构上更强。

Hunyuan3D-Buffalo 1.0统一3D多模态框架总览
Fig. 1: Hunyuan3D-Buffalo 1.0统一3D多模态框架总览
Nano3D-v2编辑数据构建流水线
Fig. 3: Nano3D-v2编辑数据构建流水线
Hunyuan3D-Buffalo 1.0架构
Fig. 6: Hunyuan3D-Buffalo 1.0架构
四阶段训练流水线
Fig. 7: 四阶段训练流水线

实验结果

核心发现分四块。3D理解(UniPart-Bench):部件问答Hunyuan3D-VLM达SBERT 85.47、SimCSE 89.06、BLEU-1 49.95、METEOR 45.79,全面超越次优UniVerse3D(83.11/87.16/46.79/42.05);物体级字幕SBERT 72.94、ROUGE-L 52.84;纯框列举IoU 0.864、多部件定位0.880。文生3D(Table 5,100提示四盲评):文本对齐/几何/总体偏好55.2%/57.1%/56.6%,超最强基线Omni123(17.5%/21.0%/18.4%)两倍以上;数据消融显示从300w→1500w→5000w,总体偏好8.4%→28.6%→57.5%,规模未饱和。3D编辑(Table 7,Edit3D-Bench):3D-VLM版平均CD 0.0091、F1 0.6515,相对Omni123平均CD(0.0684)降86.7%,相对Steer3D平均F1(0.2729)升2.39倍;3D-VLM条件化优于CLIP条件化(CD 0.0158→0.0091)。最有洞察力的是协同效应(Fig. 10):Omni预训练阶段仅加1000条“鸡”的文生3D样本、不加任何编辑数据,模型就能完成“把头换成鸡头”,证明文生3D生成能力是编辑基础、可经更廉价的文生3D数据规模化来提升编辑。

训练语料总览
Table 1: 训练语料总览
文生3D用户研究结果
Table 5: 文生3D用户研究结果
Edit3D-Bench定量编辑对比
Table 7: Edit3D-Bench定量编辑对比
3D形状编辑定性结果
Fig. 9: 3D形状编辑定性结果
文生3D数据规模化促进3D编辑
Fig. 10: 文生3D数据规模化促进3D编辑
部件生成定性结果
Fig. 11: 部件生成定性结果
查看结构化数据
任务指标本文基线提升
3D理解-部件问答(UniPart-Bench) SBERT(越高越好) 85.47 83.11(UniVerse3D) +2.4个点,全面领先
3D编辑-Edit3D-Bench平均 Chamfer Distance ↓ 0.0091(3D-VLM版) 0.0684(Omni123) 相对降低86.7%
3D编辑-Edit3D-Bench平均 F1 ↑ 0.6515(3D-VLM版) 0.2729(Steer3D) 提升2.39×
文生3D-用户研究 总体偏好率(%) 56.6% 18.4%(Omni123) 约3倍,远超25%随机基线
文生3D-用户研究 几何质量偏好率(%) 57.1% 21.0%(Omni123) 约2.7倍,几何优势最大

局限与改进

作者坦承六大局限。其一,3D生成的高质量几何表示尚未收敛,现需多阶段DiT(如TRELLIS),多阶段编辑难以规模化,能否实现图像域那样的单阶段高质量几何仍是开放问题。其二,文生3D字幕依赖Gemini等MLLM,描述仍有歧义导致训练对噪声。其三,端到端纹理编辑因缺数据基本未探索,几何与纹理能否联合单阶段建模存疑。其四,Nano3D-v2靠替换box外token保一致性,但box内部常含未编辑区域,其一致性难以保证,不一致会传播进端到端模型。其五,当前AR+DiT级联架构,Transfusion式深度融合在图像/视频已显威力,3D值得探索。其六,3D数据量与质都未达理想规模。我额外观察到:评估偏重几何(CD/F1),纹理/外观一致性缺少量化;文生3D仅用户研究无自动指标;编辑仅在Edit3D-Bench的Add/Remove两类,Replace与复杂语义编辑未量化;用户研究样本仅100提示,统计稳健性有限。

独立分析的弱点

第一个弱点是编辑数据生成对“box掩码”的强依赖。Nano3D-v2只冻结box外的体素,但box内常含不应改动的区域(如换头部时box可能框住部分躯干),这种内部不一致会被模型学习,导致编辑边界或邻近区域出现伪影。改进方向是引入更细粒度的“实际变化掩码”(基于体素级diff而非轴对齐box),或用可学习的软掩码替代硬box。第二个弱点是评估覆盖面窄。Edit3D-Bench只有Add/Remove,缺少Replace、材质/纹理替换、风格迁移等真实高频编辑类型,且全部依赖几何指标,无纹理一致性与指令遵循度的自动度量。改进方向是构建多类型、含纹理指标、含指令对齐(如CLIP指令相似度)的综合基准。第三个弱点是部件生成仅有定性结果无定量评测,难以判断其在复杂拓扑物体(如多肢生物)上的鲁棒性,建议建立部件级IoU/Chamfer的定量基准。第四个弱点是2D字幕MLLM的歧义噪声会污染50M文生3D对,建议引入几何-字幕交叉校验或多模型投票去噪。

未来方向

作者提出的方向包括:单阶段高质量几何表示、提升字幕质量(依赖MLLM进步)、端到端纹理编辑与几何纹理联合建模、更鲁棒的编辑数据流水线、Transfusion式新架构、持续数据规模化。基于成果可延伸的方向:把“文生3D改善编辑”的协同规律推广为可预测的缩放定律,量化“多少文生3D数据能解锁哪类编辑能力”;将统一范式扩展到3D场景级(多物体、空间关系)而非单物体;把3D-VLM的grounding能力用于机器人操作的3D感知;探索编辑数据中box内部一致性问题的自动化修复,形成闭环数据迭代;尝试让VLM不仅条件化生成还能接收生成反馈做多轮交互式3D创作。

复现评估

复现性中等偏上但完整复现门槛高。论文提供了项目主页(tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0)和定性demo,但正文未明确承诺权重或代码开源,Nano3D-v2管线涉及TRELLIS/LATTICE/NaTex/Qwen-Image/Gemini多个外部模型,完整复现数据流水线工程量巨大。数据规模庞大(87M样本、50M文生3D对、12M编辑对),合成依赖大量GPU渲染和VLM调用,仅几何质量打分和过滤就需跨机分片,算力门槛极高。训练分四阶段且3D-DiT从Hunyuan3D-2.1初始化,需先有该预训练骨干。论文给出了架构(512 token Q-Former、133特殊token、流匹配目标、1:1采样比例、4×重复、分路继续预训练)和评估设置,但核心超参数(学习率、训练步数、batch)未详述。复现核心结论(如协同效应的定性演示)相对可行,但复现SOTA数字需要工业级资源。