← 返回 2026-09-09

基于生成先验蒸馏的无配对监督三维编辑学习 Learning 3D Editing without Paired Supervision via Generative Prior Distillation

Hao Wen, Weibin Yun, Hongxing Fan, Haotian Lu, Rui Chen, Zehuan Huang, Lu Sheng 📅 2026-09-04 👍 3 2026-09-12 18:30
3D编辑 3D高斯泼溅 分布匹配蒸馏 前馈编辑 无配对监督 生成先验蒸馏 视觉语言模型

蒸馏2D编辑模型、VLM与3D生成先验,无配对数据训练前馈3D编辑器

前置知识

UniLat3D 与结构化 3D 潜表示

UniLat3D 是在统一 VAE 潜空间中同时容纳 3D 高斯与网格的潜扩散生成模型:先把 3D 资产压缩成稀疏结构化的潜 token 序列(本文用的去噪器为 SparseStructureFlowModel,稀疏分辨率 16、模型维度 1280、36 个 DiT 块),再用流匹配建模潜空间分布,可少量步数生成带外观的 3D 资产。所谓潜表示,就是用一组向量 $x_{src} \in \mathbb{R}^{N\times C}$ 代替网格或点云,作为 3D 内容的可学习编码。

本文的编辑对象不是 mesh 而是 UniLat3D 潜向量:学生编辑器、DMD 教师、可微渲染全部定义在这个潜空间上,不理解该表示就无法看懂训练与推理流程。

流匹配与速度场

流匹配是扩散模型的一种参数化方式:网络预测连接噪声 $\epsilon$ 与数据 $x_0$ 的概率流 ODE 的速度场 $v=\epsilon-x_0$,采样时从噪声出发按 $\hat{x}_{t_{i-1}}=\hat{x}_{t_i}-(t_i-t_{i-1})v_\theta$ 做欧拉积分;本文使用线性插值 $\hat{x}_t=(1-t)\hat{x}_0+t\epsilon$。相比 DDPM,它路径更直、步数更少。

编辑器的输出 $​​$\hat{x}_0$ 靠短程反向展开从学生速度场积分得到,DMD 中教师速度 $v_{real}$ 与假模型速度 $v_{fake}$ 也都以流匹配速度场定义,是读懂公式的基础。

分布匹配蒸馏(DMD)

DMD 用逆向 KL 散度 $D_{KL}(q_\theta\|p_\phi)$ 衡量学生分布与教师分布的距离。两边密度都不可显式计算,但梯度可用两个去噪器在同一噪声状态处的速度差近似:冻结的预训练教师提供指向真实数据流形的吸引项,在线更新的假模型(fake model)提供学生自身分布项,防止分布过度收缩和模式坍缩。

本文把 DMD 从单步图像生成蒸馏迁移到 3D 潜空间,作为几何先验正则,是解决 2D 投影监督导致几何坍缩的核心手段。

可微渲染与 3D Gaussian Splatting

可微渲染指整个渲染过程对 3D 表示可求导,使图像空间的损失能反传回 3D 参数。3DGS 用各向异性高斯基元表示场景,通过可微光栅化高效渲染出 RGB 与透明度图。本文用冻结的可微渲染器 $R$ 把编辑后的潜表示 $\hat{x}_0$ 渲染成图像,让所有 2D 损失都能穿过渲染器更新 3D 编辑器。

三条监督信号(像素、VLM、DMD)全部经由可微渲染回传,这是无配对 3D 监督能够成立的技术前提。

VLM 即评判器(VLM-as-judge)

用 Qwen3-VL 这类视觉语言模型对图像对回答二值问题(如『编辑是否被执行』『身份是否保持』),直接从语言头读取 Yes/No 答案 token 的 logits,差值经 sigmoid 转成概率并最小化负对数似然 $L_{vlm}=-\log\sigma(o^{Yes}-o^{No})$。VLM 本身冻结,梯度穿过图像输入与渲染器,因此相当于一个可微的语义奖励函数。

VLM 语义反馈是本文三大损失之一,负责约束新视角的指令遵循与身份保持;评测指标 LLM-Id/LLM-Inst 也基于同样机制。

指令引导 2D 图像编辑模型

以源图像加自然语言指令为输入、输出编辑后图像的扩散模型,本文采用 Qwen-Image-Edit-2511-Lightning。它能高质量地执行加部件、删部件、换材质、改颜色等编辑,从而廉价地制造源视图-目标视图的图像对,但它本身完全没有 3D 多视角一致性的概念。

它的输出是本文主视图的像素级教师信号,相当于把 2D 编辑能力蒸馏进 3D 编辑器;同时它的错误也会传播到 3D 结果,是论文局限之一。

研究动机

指令引导的 3D 编辑要求模型既遵循编辑指令,又保持几何合理性、跨视角外观/语义一致性和原始资产的全局结构,而训练前馈编辑模型需要海量『源资产-编辑后资产』配对 3D 数据,这种数据在现实中几乎不存在。现有方法各自绕开这一瓶颈但代价明显:基于 SDS 测试时优化的方法(Instruct-NeRF2NeRF、Vox-E)对每个实例单独优化,速度极慢,且易出现过饱和、模式坍缩和视角不一致;2D 提升类方法(EditP23、Instant3DiT)先编辑多视图图像再重建 3D,各视图独立修改缺乏严格空间约束,误差累积导致跨视图不一致与几何伪影;免训练原生方法(VoxHammer、Nano3D)依赖缓慢的潜空间反演,且 VoxHammer 等还需要繁琐的手工 3D 掩码;监督式原生方法(3DEditFormer、ShapeUP)依赖合成 3D 伪配对,数据管线严格限制了编辑类型(多为简单部件增删替换),伪配对普遍存在结构漂移、几何畸变与伪影,严重制约泛化与保真度。

本文的目标是本文的目标是训练一个完全不需要配对 3D 监督的前馈式 3D 编辑器 PriorEdit3D:给定源 3D 资产的 UniLat3D 潜表示 $x_{src}$ 和以编辑视图图像为条件的编辑指令,网络一次前向即预测编辑后的潜表示 $\hat{x}_0 = G_\theta(x_{src}, c)$,实现免反演(inversion-free)、免掩码(mask-free)的原生 3D 编辑,单次编辑约 7 秒。质量上要求:编辑在主视图上忠实执行指令、在任意新视角保持身份与结构一致、未编辑区域保持不变,并且同时支持部件添加/删除/替换、颜色与纹理修改等部件级编辑,以及姿态、比例、风格化等全局级编辑,从而兼顾可扩展性、速度与鲁棒性。

与已有工作不同的是,本文的独特切入在于:不是构造更好的 3D 伪配对,而是彻底放弃 3D 配对,把无配对 3D 编辑重新表述为『生成先验蒸馏』问题——直接从三类基础模型中蒸馏知识:(1) 2D 图像编辑模型在主编辑视图提供像素级视觉先验;(2) 视觉语言模型在新颖视角提供语义先验(指令遵循 + 身份保持);(3) 冻结的预训练 3D 生成模型 UniLat3D 通过 DMD 提供几何先验,把编辑结果约束在真实 3D 资产流形上。论文 Table 1 对各范式的梳理凸显了这一空位:优化式、2D 提升、免训练、监督式四类方法各有至少两项能力缺失,而 PriorEdit3D 是首个同时做到免反演、原生 3D、无配对 3D 数据、蒸馏先验、免掩码的统一框架。

核心方法

直觉上,这是让一个『学生』编辑网络同时模仿三位异质『老师』。技术路线:源潜表示 $x_{src}$ 与噪声潜 $x_t$ 做 token 拼接 $\tilde{x}_t=\mathrm{Concat}_{token}(x_t,x_{src})$ 后送入从 UniLat3D 初始化的 DiT,只对 $x_t$ 去噪、$x_{src}$ 全程固定为源上下文,预测编辑后潜 $\hat{x}_0$。先用短程反向展开从学生速度场积分得到 $\hat{x}_0$:20 级递减时间步欧拉积分,前缀步停止梯度、只反传最后一步跳变 $\hat{x}_0=\hat{x}_{t_s}-t_sv_\theta(\tilde{x}_{t_s},t_s,c)$ 以控制开销。随后冻结的可微渲染器渲染三个视图:编辑视图 $\pi_0$ 上用 2D 教师编辑图计算掩码 $\ell_1$+LPIPS+前景外透明度正则的像素损失;侧视图 $\pi_1$ 与背视图 $\pi_2$ 上由冻结 VLM 分别回答『是否遵循指令』『是否保持身份』并计算 NLL;DMD 项用冻结 UniLat3D 教师与在线假模型的速度差 $-(v_{real}-v_{fake})\cdot\partial\hat{x}_0/\partial\theta$ 把学生分布拉向 3D 流形。总损失 $L=L_{pixel}+\lambda_{vlm}L_{vlm}+\lambda_{DMD}L_{DMD}$,交替更新编辑器与假模型。

核心创新是与已有方法的本质区别在于监督信号的来源与形态。其一,不构造伪配对而直接蒸馏:任何强 2D 编辑器的输出都可作为主视图的像素教师,省去把 2D 编辑提升成 3D 对的昂贵且易漂移的管线。其二,VLM 首次被用作跨视角语义监督的可微奖励:在侧视图问『编辑是否被执行』(IF)、在背视图问『身份是否保持』(IP),读 Yes/No logits 的 sigmoid 概率做 NLL,梯度穿过图像输入和渲染器回传,弥补单视图像素监督对未见过视角的过拟合。其三,把 DMD 从图像蒸馏迁移到 3D 潜空间编辑:教师是去掉源 token 分支、只以编辑图像 $c$ 为条件的冻结 UniLat3D,在 $\hat{x}_t=(1-t)\hat{x}_0+t\epsilon$ 处比较教师速度 $v_{real}$ 与在线假模型速度 $v_{fake}$,速度差对应学生分布与 3D 先验间 KL 散度的梯度,既把输出吸引回真实 3D 流形又防过度收缩导致的模式坍缩。其四,源 token 拼接让预训练生成器零结构改动即可变成编辑器,教师与学生架构天然同源。

方法步骤详情

第一步,数据构建:渲染 73,451 个 Objaverse 物体正视图,Gemini3-Flash 生成指令,Qwen-Image-Edit-2511-Lightning 执行 2D 编辑,Qwen3-VL 裁判过滤编辑失败/背景破坏/主体裁剪样本并丢弃 SSIM>0.995 的琐碎编辑,得 73,121 个实例、150,482 条操作标注(添加 46,472、删除 22,194、替换 31,241、颜色 27,868 等)。第二步,编辑潜预测:20 级递减时间步(1.00→0.05)从噪声欧拉积分 $\hat{x}_{t_{i-1}}=\hat{x}_{t_i}-(t_i-t_{i-1})v_\theta(\tilde{x}_{t_i},t_i,c)$,随机退出点 $s$ 后做跳变 $\hat{x}_0=\hat{x}_{t_s}-t_sv_\theta$,仅跳变步反传。第三步,像素监督($\ell_1$ 权重 1.0、LPIPS 0.2):rembg 前景掩码内匹配教师图、掩码外惩罚透明度抑制浮空伪影,掩码仅训练期使用。第四步,VLM 监督(Qwen3-VL-4B,权重 0.0005):$L_{vlm}=\sum-\log\sigma(o^{Yes}-o^{No})$。第五步,DMD(权重 0.01):500 步恒等热身($G_\theta(x_{src},I^{src}_{\pi_0})=x_{src}$)后,每个编辑器步先按流匹配回归 $L_{fake}=\|F_\phi(\hat{x}_t,t,c)-(\epsilon-\hat{x}_0)\|^2$ 更新假模型 10 次,再按速度差更新编辑器。第六步,优化:AdamW 学习率 $10^{-5}$、18K 步、8×A100;推理 20 步约 7 秒、13 GB 显存。

技术新颖性

技术新颖性体现在四个层面。范式层面:Table 1 显示此前没有任何方法同时满足免反演、原生 3D、无配对 3D 数据、蒸馏先验、免掩码五项能力,本文首次用『蒸馏』统一了 2D 视觉、语言语义与 3D 几何三种异质先验,证明『好 2D 编辑器 + 好 VLM + 好 3D 生成器』的组合足以替代昂贵的 3D 伪配对管线。算法层面:DMD 原本用于单步图像生成蒸馏,本文将其迁移到编辑场景,并巧妙地把教师设为去掉源条件分支的冻结 UniLat3D——教师只看目标图像不看源资产,从而成为纯粹的『真实 3D 流形』先验,再配合恒等热身稳定早期训练,这是对 3D 潜扩散做分布级约束的少见实践,与 SDS 的单点梯度修正有本质区别。反馈机制层面:与把 VLM 当黑盒奖励或评测器的做法不同,本文直接读二值答案 logits 使其可微且视角可控,成本极低却带来跨视角语义约束。工程层面:源 token 拼接的条件化方式让编辑任务复用生成预训练权重,学生与 DMD 教师共享架构,训练稳定且推理保持纯前馈。

Automated dataset pipeline. Objaverse objects are rendered, edited via Gemini3-Flash instructions and Qwen-Image-Edit, and filtered using Qwen3-VL 32B and SSIM.
Fig. 2: Automated dataset pipeline. Objaverse objects are rendered, edited via Gemini3-Flash instructions and Qwen-Image-Edit, and filtered using Qwen3-VL 32B and SSIM.
Training framework of PriorEdit3D. Given a source 3D latent and an instruction-conditioned edited image, the editor predicts an edited UniLat3D latent, which is rendered and optimized with pixel-level 2D supervision, VLM-based semantic/view feedback, and DMD-based 3D prior regularization.
Fig. 3: Training framework of PriorEdit3D. Given a source 3D latent and an instruction-conditioned edited image, the editor predicts an edited UniLat3D latent, which is rendered and optimized with pixel-level 2D supervision, VLM-based semantic/view feedback, and DMD-based 3D prior regularization.
Representative samples from our 3D editing dataset. We showcase various editing types including texture alterations, local geometric edits, and broad stylistic modifications.
Fig. 13: Representative samples from our 3D editing dataset. We showcase various editing types including texture alterations, local geometric edits, and broad stylistic modifications.

实验结果

主测试集(130 样本,Table 2):本文 PSNR 24.37、FID 71.96、LLM-Id 93.13%、LLM-Inst 86.92%、7 秒,对比 EditP23(PSNR 16.74、FID 184.51、18 秒)、Instant3DiT(LLM-Id 仅 40.09%)、3DEditFormer(PSNR 18.89、LLM-Inst 53.39%、74 秒)、VoxHammer(PSNR 16.87、133 秒)、Nano3D(PSNR 19.90、FID 103.50、LLM-Inst 60.37%、14 秒):PSNR 比最强基线高 4.47 dB,FID 降约 30%,指令遵循近乎翻倍,比 VoxHammer 快 19 倍,唯 LPIPS 0.12 逊于 Nano3D 的 0.07。OOD(ABO 236+GSO 239 样本):FVD 168.78、PSNR 20.59、LLM-Id 91.14%、LLM-Inst 68.41% 均第一,LPIPS 0.13 略逊基线的 0.10。消融(Table 3):仅像素损失时 FVD 高达 307.58,加 DMD 后降至 193.44;去掉像素损失 PSNR 跌至 20.99、FID 恶化到 94.11;全配置 FID 71.96、LLM-Id 93.13% 最优,三项损失互补。Table 5 显示双提示最均衡:仅身份提示 FID 71.77 更优但 LLM-Inst 降至 82.31%。Fig. 8 换 Gemini-3 Flash、GPT-5.4 做裁判本文仍居首;Fig. 9 的 50 人用户研究三维度均最高分;Fig. 12 在 Edit3D-Bench 上与 VoxHammer 相当且免掩码。总体来看,这些数字传递了两个关键信息:其一,蒸馏式训练在指令遵循与身份保持上大幅超越依赖伪配对的监督式方法,说明『像素教师+VLM 语义教师+DMD 几何教师』的组合确实能替代昂贵的 3D 配对数据;其二,DMD 消融中 FVD 从 307.58 降到 195.77 的变化远大于其他指标,证明几何流形约束主要改善的是跨视角 3D 一致性而非单视图保真,这正是三重先验各司其职的设计意图。

Comparison of SOTA 3D editing paradigms. Our framework is the first unpaired approach to achieve inversion-free and mask-free editing in native 3D space.
Table 1: Comparison of SOTA 3D editing paradigms. Our framework is the first unpaired approach to achieve inversion-free and mask-free editing in native 3D space.
Main quantitative comparison across different evaluation datasets. We report edited-image alignment, overall 3D quality, condition alignment, and runtime per edit on a single A100 GPU.
Table 2: Main quantitative comparison across different evaluation datasets. We report edited-image alignment, overall 3D quality, condition alignment, and runtime per edit on a single A100 GPU.
Ablation study of loss terms. We compare pixel reconstruction loss, VLM loss, DMD loss, and additional leave-one-out ablations.
Table 3: Ablation study of loss terms. We compare pixel reconstruction loss, VLM loss, DMD loss, and additional leave-one-out ablations.
Impact of VLM backbone on 3D editing performance.
Table 4: Impact of VLM backbone on 3D editing performance.
Impact of VLM prompt strategy on 3D editing performance.
Table 5: Impact of VLM prompt strategy on 3D editing performance.
Detailed model and training configuration used in our experiments.
Table 6: Detailed model and training configuration used in our experiments.
Training-time computational cost and peak GPU memory under different supervision settings.
Table 7: Training-time computational cost and peak GPU memory under different supervision settings.
Qualitative comparison between our method and SOTA methods, including EditP23, Instant3DiT, 3DEditFormer, VoxHammer, and Nano3D.
Fig. 4: Qualitative comparison between our method and SOTA methods, including EditP23, Instant3DiT, 3DEditFormer, VoxHammer, and Nano3D.
Qualitative results on ABO dataset.
Fig. 5: Qualitative results on ABO dataset.
Qualitative results on GSO dataset.
Fig. 6: Qualitative results on GSO dataset.
Qualitative ablation results. We compare our full method with variants w/o VLM, w/o DMD, w/o Pixel, w/o both VLM and DMD, and direct conditional generation (UniLat3D).
Fig. 7: Qualitative ablation results. We compare our full method with variants w/o VLM, w/o DMD, w/o Pixel, w/o both VLM and DMD, and direct conditional generation (UniLat3D).
VLM Evaluation with different judge backbones: Qwen2.5-VL-72B, Gemini-3 Flash, and ChatGPT 5.4.
Fig. 8: VLM Evaluation with different judge backbones: Qwen2.5-VL-72B, Gemini-3 Flash, and ChatGPT 5.4.
User Study Results. Average human ratings on a 1-5 scale.
Fig. 9: User Study Results. Average human ratings on a 1-5 scale.
More results.
Fig. 11: More results.
Qualitative results with samples in Edit3D-Bench.
Fig. 12: Qualitative results with samples in Edit3D-Bench.
查看结构化数据
任务指标本文基线提升
指令引导 3D 编辑(130 样本主测试集) PSNR ↑ 24.37 Nano3D 19.90(最强基线) +4.47 dB
指令引导 3D 编辑(主测试集) FID ↓ 71.96 Nano3D 103.50 降低约 30.5%
指令引导 3D 编辑(主测试集) LLM-Inst 指令遵循 ↑ 86.92% Nano3D 60.37% / 3DEditFormer 53.39% +26.55 个百分点
指令引导 3D 编辑(主测试集) LLM-Id 身份保持 ↑ 93.13% 3DEditFormer 86.31% +6.82 个百分点
单次编辑速度(单张 A100) Runtime 7 s VoxHammer 133 s / Nano3D 14 s 较 VoxHammer 约 19 倍加速
OOD 泛化(ABO 236 + GSO 239 样本) FVD ↓ 168.78 Nano3D 270.86 / 3DEditFormer 197.22 较 Nano3D 降低约 37.7%
OOD 泛化(ABO+GSO) PSNR ↑ 20.59 Nano3D 18.39 +2.2 dB

局限与改进

作者承认的局限(Fig. 10):精细文本与密集/小型实例编辑困难,全局一致性优先牺牲高频细节;未编辑区域可能出现意外纹理或几何漂移;2D 编辑器的错误会传播到 3D 结果;受 UniLat3D 先验与可微渲染约束,大姿态或拓扑变化困难,不兼容不可微 3D 架构。我的观察:训练管线深度绑定四个外部模型(Gemini3-Flash、Qwen-Image-Edit、Qwen3-VL、rembg),任何一环的系统性偏差都会进入监督信号,商用模型版本更迭威胁可复现性;Table 7 显示 DMD 使每步前向从约 8 秒暴涨到 73 秒,抬高训练成本门槛;VLM 反馈是二值的,无法提供『编辑到什么程度』的细粒度梯度;条件 $c$ 只来自单一规范视图,侧面/背面的大幅编辑仅靠稀疏二值语义信号约束;主测试集 LPIPS 0.12(Nano3D 0.07)与 OOD 集 LPIPS 0.13(基线 0.10)均落后,像素级感知保真并非强项;训练反馈模型(Qwen3-VL-4B)与默认评测器(Qwen2.5-VL-72B)同属 Qwen 家族,存在自我偏好风险,Fig. 8 的跨裁判验证部分缓解了这一担忧。

独立分析的弱点

第一,数据管线同源偏差:指令由 Gemini3-Flash 生成、编辑由 Qwen-Image-Edit 执行、过滤由 Qwen3-VL 完成,三个模型可能共享措辞与审美偏见,窄化训练分布;改进方向是指令多生成器集成并加入人工抽检校准。第二,单视图条件瓶颈:$c$ 只来自规范前视图的 2D 编辑,大角度新视角的编辑正确性只能依赖 VLM 二值信号;改进方向是引入多视图扩散编辑器(如 MV-Adapter 类)提供多视图像素教师,把语义级约束升级为像素级。第三,DMD 开销:73 秒/步的训练成本主要来自每步 10 次假模型更新,限制数据与迭代规模;改进方向是降低假模型更新频率、缓存教师速度或用轻量判别器近似分布匹配。第四,3D 先验强绑定 UniLat3D:稀疏分辨率 16 的结构化潜限制了几何精细度;改进方向是在 TRELLIS.2、CLAY 等更高保真先验上重复该配方验证可迁移性。第五,评测与反馈同源风险:训练用 Qwen3-VL-4B、评测默认 Qwen2.5-VL-72B;改进方向是建设以人工标注为主的固定第三方基准。

未来方向

作者提出的方向:补充网页展示 360° 多视图结果,暗示向更复杂资产的组合编辑扩展;明确承认大姿态与拓扑变化是开放问题,需要摆脱对可微渲染的依赖。基于其成果可延伸的研究:(1) 把『2D 编辑器 + VLM + 3D 先验』的蒸馏配方推广到场景级 3D 编辑与 PBR 材质编辑(结合 TRELLIS.2 的 O-Voxel 表示);(2) 用 RL 后训练(如 GRPO)替代二值 VLM 的 NLL,引入连续、多维的奖励并缓解奖励同源问题;(3) 与免训练方法互补,蒸馏 VoxHammer/Nano3D 的反演轨迹得到更高质量的学生模型;(4) 扩展到 4D 动态资产与多轮链式编辑,研究编辑组合性与误差累积规律;(5) 在不可微渲染器(如路径追踪的 PBR 管线)上,用基于分数的代理模型实现流形约束,摆脱可微性限制;(6) 探索把数据管线的自动裁判换成多个异构模型投票,进一步压低伪标签噪声。

复现评估

复现条件总体友好。代码已开源(github.com/thiamine128/PriorEdit3D),附录提供完整配置(Table 6)、三个训练算法伪代码(Algorithm 1-3)与成本表(Table 7)。数据可自建:Objaverse 开源,指令用 Gemini3-Flash API,2D 编辑用开源 Qwen-Image-Edit-2511-Lightning,过滤与反馈用开源 Qwen3-VL,评测集(130+236+239 样本)协议交代清楚。算力门槛中等偏高:训练需 8 张 A100 跑 18K 步,单卡峰值显存 59 GB,DMD 使每步前向约 73 秒,完整训练耗时可观;推理仅 20 步采样、约 7 秒、13 GB 显存,单张消费级以上 GPU 即可部署。复现难点在数据管线中多个外部模型的版本对齐,以及 DMD 交替训练的稳定性(假模型与编辑器 10:1 更新节奏、500 步恒等热身、损失权重 1.0/0.2/0.0005/0.01 等超参可能敏感)。综合评估:中高难度,但配置文档质量很高,认真照做成功率较大。