← 返回 2026-07-30

面向视频物体插入与图层分解的显式分层建模 Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

Kyujin Han, Seungjoo Shin, Sunghyun Cho 📅 2026-07-28 👍 8 2026-08-04 18:30
图层分解 扩散模型 数据集构建 视频生成 视频编辑

提出TriLayer三元组数据集与双分支扩散框架,实现视频物体的显式分层插入与分解。

前置知识

扩散模型与整流流(Rectified Flow)

扩散模型通过逐步加噪再反向去噪来生成数据。整流流是扩散模型的一种变体,它把噪声到数据的路径"拉直",用速度场预测代替噪声预测,训练目标是预测从噪声 $x_1$ 到数据 $x_0$ 的速度 $v = x_1 - x_0$。本文用整流流框架训练双分支模型。

本文的训练目标和推理都基于整流流,理解它才能看懂双分支如何各自独立采样时间步、如何在去噪过程中交换信息。

LoRA 与 DoRA 低秩适配

LoRA 把权重更新约束为两个低秩矩阵之积 $\Delta W = BA$,高效微调大模型。DoRA(Weight-Decomposed Low-Rank Adaptation)把权重分解为幅度(magnitude)和方向(direction),只对方向做低秩更新,从而保留预训练方向先验,更适合学习分布外的新概念。

本文的关键设计是"混合适配":RGB 分支用 LoRA(rank 128),RGBA 分支用 DoRA(rank 32),因为两分支面对的分布偏移不同。不理解这个区别就看不懂训练策略。

Alpha 合成与 RGBA 图层

RGBA 表示在 RGB 颜色外加一个 alpha 通道表示不透明度。前景层 alpha 合成到背景上的公式为 $V_C = \alpha V_F + (1-\alpha) V_B$,其中 $\alpha$ 还可以刻画半透明视觉效果如阴影、反射。Omnimatte 系列工作就是把视频中物体及其"连带效果"提取成一个 RGBA 层。

整篇论文的核心就是把视频显式表示为"前景 RGBA 层 + 背景层",合成视频由两者 alpha 合成得到。这是 TriLayer 数据和双分支输出的基本单元。

VACE 与 Wan2.1 视频扩散骨干

VACE(Wan2.1-VACE)是阿里达摩院提出的 all-in-one 视频创建编辑扩散变换器,支持图像/视频到视频、首帧控制、掩码等多种条件输入,工作在 VAE 潜空间。WAN-alpha 则提供同时编码 RGB 与 alpha 的 RGBA VAE。

本文两个分支都基于 VACE-1.3B 骨干构建,RGB 分支用标准 VACE 潜空间和 RGB VAE,RGBA 分支用 WAN-alpha 的 RGBA 潜空间。理解骨干才能看懂分支如何共享主干只改输入输出投影。

联合交叉注意力(Joint Cross-Attention)

在双分支架构中,每个 transformer block 让 RGB 分支的特征去 attend 到 RGBA 分支的 K/V,反之亦然,从而双向交换信息。权重 $W_x^Q, W_x^K, W_x^V$ 来自 RGB 分支(用 LoRA),$W_y^Q, W_y^K, W_y^V$ 来自 RGBA 分支(用 DoRA),初始化自骨干的自注意力。

这是两分支保持几何与外观一致性的关键耦合机制,没有它就退化为单分支。论文强调交叉注意力与三元组监督不能单独消融。

研究动机

现有视频编辑系统普遍缺少显式的分层视频表示(前景、背景及其物理交互),这在两个根本依赖图层结构的任务上尤其致命。其一是视频物体插入:早期 inpainting 方法(如 VACE-Inp、ReVideo)在掩码区域内隐式生成前景,常扭曲邻近背景、限制后编辑;较新的 OmniInsert、InsertAnywhere 虽用配对"背景-合成"视频提升质量,但仍缺含物体诱发视觉效果(阴影、反射、水花)的显式前景层,导致合成质量下降、对象难复用。其二是视频图层分解:Omnimatte 系列及 Gen-Omnimatte、OmnimatteZero 因缺前景层监督,只能依赖逐场景优化或隐式推理,在透明物体、精细边界上不稳定、泛化差。表1显示 DVM、VideoMatte240K、Senorita-2M、VPData 等数据集要么没干净背景、要么 alpha matte 不含视觉效果,ROSE++ 则只有虚拟场景静态物体,没有任何数据集能同时提供"合成+去效果背景+含效果前景+动态物体+真实视频"完整监督。

本文的目标是本文的目标是证明"对分层视频表示进行显式监督"能开启新的视频操控任务并显著改善已有任务。具体地,作者要(1)构建首个大规模三元组视频数据集 TriLayer,每个样本提供物理对齐的合成视频、不含物体及连带效果的干净背景视频、以及既含对象外观又含阴影反射等效果的 RGBA 前景层;(2)基于该数据提出统一的双分支扩散框架 DBL-Diffusion,同时建模场景级 RGB 合成和显式 RGBA 前景层;(3)将其实例化为 DBL-Insert 完成视频分层物体插入(据称是视频域首次分层插入演示),以及 DBL-Decompose 从合成视频恢复前景与背景层;(4)支持分层编辑、场景感知编辑、VFX(火、烟)分解等下游应用。

与已有工作不同的是,本文的独特切入角度是把"视频物体插入"和"视频图层分解"这两个目标看似相反的任务,统一到同一个缺失要素上——一个提供显式、物理一致的前景-背景-合成三元组的数据集。不同于以往要么只做插入要么只做分解的孤立工作,作者意识到二者本质上需要同一种监督信号,于是用一条可扩展的合成流水线(VLM 筛选 + 自动处理 + 人工验证)从 in-the-wild 视频反推出三元组,再设计与之配套的双分支架构,让 RGB 与 RGBA 表示解耦学习。这种"数据-架构协同"的视角是本文与所有前作的本质区别。

核心方法

整体思路先有直觉再走技术路线。直觉上,作者希望把一段视频显式表示成两层:一层是"前景对象 + 它诱发的视觉效果"组成的 RGBA 层 $V_F$,另一层是不含物体及连带效果的干净背景 $V_B$;而原合成视频 $V_C$ 物理上由前景层 alpha 合成到背景上得到。技术路线是构建 DBL-Diffusion(Dual-Branch Layered Diffusion):一个 RGB 分支负责场景级外观(生成/重建合成或背景视频),一个 RGBA 分支负责预测含对象与效果的显式前景层。两分支共享 VACE 扩散变换器主干,但分别走标准 RGB VAE 潜空间和 WAN-alpha 的 RGBA 潜空间,仅适配输入输出投影以匹配 RGBA 维度。每个 transformer block 通过联合交叉注意力双向交换特征,保证合成层反映前景的几何外观、前景层捕获场景依赖的光照运动遮挡线索。

核心创新点有三处与已有方法的本质区别。第一是 TriLayer 数据集首次为分层视频表示提供显式三元组监督,让模型直接学习而非隐式推断分层结构。第二是双分支解耦设计:RGB 分支用 LoRA(rank 128)做 in-domain 适配(预测的 RGB 分布接近预训练数据),RGBA 分支用 DoRA(rank 32)做 out-of-domain 适配(需学习透明度、alpha matte、图层特有效果等预训练模型从未见过的概念),DoRA 的方向保持参数化让分布外学习更稳定。第三是解耦时间步采样:对 RGB 与 RGBA 分支独立采样 $t_x, t_y \sim U(0,1)$,各自演化到不同噪声水平,平衡两分支学习动力学,还能在推理时固定某分支低噪声实现条件生(如固定 RGBA 分支以保留背景做前景编辑)。这三点与单分支方法形成本质差异。

方法步骤详情

DBL-Insert 流程:输入背景视频 $V_B$、对象文本 $T$、边界框序列 $B$、已插入对象的编辑首帧 $E$。先用 SAM2 从 $E$ 提取前景得到 RGB 图与 alpha 掩码,构造 RGBA 分支条件 $C_F$(首帧为提取前景叠在常数背景色、其余帧仅常数色且 alpha 为零),再把 $V_B$ 首帧替换为 $E$ 得 RGB 分支条件 $C_C$,把 $B$ 转二值掩码序列 $C_M$(首帧置零)。两分支接收不同文本(RGBA 加"背景为透明")后用 VACE 双分支去噪,各自由对应 VAE 解码出 $V_C$ 与 $V_F$;推理时把 $V_F$ 与 $V_B$ 做 alpha 混合得最终结果。DBL-Decompose 流程:输入合成视频 $V_C$、文本 $T$、对象名 $T_N$、掩码 $M$;构造前景条件 $C_F'$(把 $V_C$ 背景区域置零),RGB 分支以 $V_C$ 配合"自然移除{object}"提示重建 $V_B$,RGBA 分支预测 $V_F$。两任务共享同一双分支架构与 WAN-alpha RGBA VAE。

技术新颖性

技术新颖性体现在几个层面。架构上,双分支思想虽在别处出现过(Li 等 2024 的统一条件生成),但本文是首个将其用于分层视频结构、联合建模 RGB 合成与 RGBA 前景的工作,并通过联合交叉注意力让两层互相约束。训练上,混合 LoRA-DoRA 策略精准匹配两分支的分布偏移特性,比单一方法(图4消融显示 LoRA-LoRA 和 DoRA-DoRA 都出现严重伪影)更稳定。优化上,解耦时间步采样的整流流目标 $\mathcal{L} = \mathcal{L}_{RGB}(t_x) + \mathcal{L}_{RGBA}(t_y)$ 等权相加,既稳定联合优化又支持条件推理。数据上,TriLayer 的合成流水线把 Gen-Omnimatte(效果提取)、MatAnyone(视频抠图)、Grounded-SAM2(分割)三源互补,alpha 取逐像素最大、RGB 取获胜源,并用 VLM 双阶段筛选 + 多轮人工验证从约 18000 候选筛到 3964 高质量三元组,是首个支持监督式分层视频学习的数据集。

Detailed pipeline of the TriLayer dataset construction pipeline.
Fig. 2: Detailed pipeline of the TriLayer dataset construction pipeline.
Overviews of DBL-Insert and DBL-Decompose.
Fig. 3: Overviews of DBL-Insert and DBL-Decompose.
Qualitative ablation on the effect of lora-dora training strategy.
Fig. 4: Qualitative ablation on the effect of lora-dora training strategy.
Qualitative ablation on the effect of foreground object conditioning.
Fig. 5: Qualitative ablation on the effect of foreground object conditioning.

实验结果

实验在自建 LayeredVid-Benchmark(85 段)上。视频物体插入(表2):DBL-Insert 在 ViCLIP-T 达 24.767、DINO-I 0.747、Aesthetic 0.537 均为最高,相比 AnyV2V(DINO-I 0.567)、VACE-Inp(0.716)领先。前景层质量(表4):RGBA 分支 DINO-I 0.482、CLIP-I 0.693,显著优于 VACE-F(0.466)与 AnyV2V+Gen-Omnimatte(0.274),证明双分支解耦更优。图层分解(表3、5):DBL-Decompose 在 Movie PSNR 33.09、Kubric 38.22,虽略低于 OmnimatteZero(35.11),但 FID 更优(Kubric-BG 16.340、Movie-BG 14.527 均最低)。用户研究(表6、7):DBL-Insert 总体质量 61.5% 偏好(VACE-Inp 仅 15.5%),DBL-Decompose 背景/前景获 71.5%/75.0%。消融证明 LoRA-DoRA 混合最稳、前景条件提升质量。

Comparison with existing open-source video matting and video object insertion datasets.
Table 1: Comparison with existing open-source video matting and video object insertion datasets.
Video object insertion comparison on TriLayer.
Table 2: Video object insertion comparison on TriLayer.
Background layer reconstruction comparison.
Table 3: Background layer reconstruction comparison.
Quantitative Comparison: Quality of Inserted Foreground Layers.
Table 4: Quantitative Comparison: Quality of Inserted Foreground Layers.
Additional FID (↓) comparison of background reconstruction.
Table 5: Additional FID (↓) comparison of background reconstruction.
User study on video object insertion conducted with 20 participants over 10 videos.
Table 6: User study on video object insertion conducted with 20 participants over 10 videos.
User study on layer decomposition conducted with 20 participants over 10 videos.
Table 7: User study on layer decomposition conducted with 20 participants over 10 videos.
Qualitative video object insertion comparison with existing SOTA models.
Fig. 6: Qualitative video object insertion comparison with existing SOTA models.
Qualitative video layered object insertion and layer decomposition results on the internal dataset.
Fig. 7: Qualitative video layered object insertion and layer decomposition results on the internal dataset.
Qualitative video layer decomposition comparison with existing SOTA models.
Fig. 8: Qualitative video layer decomposition comparison with existing SOTA models.
Qualitative examples of applications.
Fig. 9: Qualitative examples of applications.
查看结构化数据
任务指标本文基线提升
视频物体插入(文本-视频对齐) ViCLIP-T ↑ 24.767 AnyV2V 23.520 / ReVideo 24.303 / VACE-Inp 24.717 相比最强基线 VACE-Inp 提升 0.05,全场最高
视频物体插入(主体一致性) DINO-I ↑ 0.747 AnyV2V 0.567 / ReVideo 0.699 / VACE-Inp 0.716 相比 VACE-Inp 提升 0.031,相对 AnyV2V 提升约 31.6%
插入前景层质量(对象结构) DINO-I ↑ (RGBA层) 0.482 VACE-F 0.466 / VACE-Inp+Gen-Omnimatte 0.408 相比 VACE-F 提升 0.016,证明双分支解耦更优
背景层视觉保真度 FID ↓ (Movie-BG) 14.527 Gen-Omnimatte 16.344 / OmnimatteZero 36.428 相比 Gen-Omnimatte 降低 1.817,视觉质量最优
背景层像素重建(Kubric) PSNR ↑ 38.22 OmnimatteZero 44.97 / OmnimatteRF 40.91 略低,因方法走生成路线而非严格重建(权衡)
用户研究-插入总体质量 偏好率 ↑ 61.5% VACE-Inp 15.5% / VACE-C 13.0% 约 4 倍于第二名
用户研究-分解前景质量 偏好率 ↑ 75.0% Gen-Omnimatte 19.0% / OmnimatteZero 6.0% 约 4 倍于 Gen-Omnimatte

局限与改进

作者承认三方面局限:其一,模型仍难以捕捉物体与场景之间复杂的物理交互和高度动态的运动(例如剧烈碰撞、流体飞溅的真实物理);其二,双分支架构引入额外计算与内存开销,论文补充材料报告每个推理案例约需 1 小时(单张 A100 80GB),难以实时应用;其三,像素级重建指标(PSNR/SSIM)不如专门优化的重建方法(如 OmnimatteZero 的 44.97 dB vs 本文 38.22 dB),因为本文走生成路线追求视觉合理性而非严格复现。从我的观察补充:数据构建严重依赖外部模型链(SAM2、Grounded-DINO、ROSE、Gen-Omnimatte、MatAnyone、Qwen2.5-VL-32B),任一环节失败都会污染标签(附录图14展示 SAM 掩码不全、ROSE 残留效果的失败案例);TriLayer 仅 3964 样本、229 类,规模远小于主流视频数据集,长尾类别覆盖有限;评测基准 LayeredVid-Benchmark 仅 85 段视频且由作者自建,可能存在划分偏向;论文未明确说明代码与数据是否开源,影响可复现性。

独立分析的弱点

第一,推理效率是最大短板——双分支 + VAE 解码 + 50 步采样导致每例约 1 小时,无法支持交互式编辑。改进方向:采用蒸馏(如一致性模型、LCM)、减少采样步数、用更小的骨干(如 1.3B→更轻量)或合并两分支到共享主干以降低冗余。第二,物理交互建模弱,复杂碰撞、流体、透明材质仍不稳。改进方向:引入物理先验(深度、法向、光流)作为额外条件,或结合 3D/4D 表征(借鉴 InsertAnywhere 的 4D 重建思路)增强时空一致性。第三,数据规模与多样性受限(3964 样本、229 类)。改进方向:把流水线扩展到更多源视频、加入多对象场景、覆盖更多透明/半透明 VFX 类别,并用主动学习迭代清洗。第四,评测依赖自建基准与部分外部提取器(如用 Gen-Omnimatte 为基线提 RGBA),存在评测偏差。改进方向:建立社区共享、含人工标注真值前景层的标准化基准。第五,强依赖外部模型链,任一上游模型升级都可能改变数据分布。改进方向:把数据清洗与前端提取内化为可端到端微调的模块,减少级联误差。

未来方向

作者明确提出的未来方向:一是提升效率(降低双分支计算与内存开销)、二是扩展框架以更好地建模物理交互。基于本文成果可延伸的方向包括:(1)多对象、多图层场景——当前每样本仅一个前景层,可扩展为任意层数的堆叠表示,支持复杂场景编辑;(2)3D 一致性——结合 Omnimatte3D、神经辐射场思想,把分层表示延伸到新视角合成与 6DoF 编辑;(3)实时/交互式应用——通过模型蒸馏与流式推理把每例 1 小时压缩到秒级,赋能直播、AR 场景;(4)更大规模与多模态条件——把 TriLayer 扩展到百万级并加入音频、文本叙事条件;(5)统一插入-分解-编辑的多任务框架——既然 DBL-Insert 与 DBL-Decompose 共享骨干,可训练一个多任务模型按指令切换;(6)把显式分层思想迁移到图像域、3D 生成域,作为通用"图层原生"生成范式。

复现评估

复现评估中等偏难。有利因素:骨干用公开的 Wan2.1-VACE-1.3B,训练超参清晰(3 epochs、AdamW、学习率 $1\times10^{-4}$、LoRA rank 128、DoRA rank 32、50 步推理),附录给出负向提示词、VLM 筛选指令(图10-13)、前景层融合公式和人类标注协议,单张 A100 80GB 即可。不利因素:(1)论文未明确声明代码与 TriLayer 是否开源,数据构建依赖 ROSE、Gen-Omnimatte、MatAnyone、Qwen2.5-VL-32B、Grounded-SAM2 等多个外部模型,复现完整 3964 样本流水线工程量大且易因上游版本差异产生不同分布;(2)推理每例约 1 小时使大规模评测成本高;(3)部分对比方法(OmniInsert、InsertAnywhere、LoVoRA、VideoAnyDoor)无官方代码;(4)评测基准与内部 VFX 数据集为作者私有。整体架构与训练可复现,数据集与基准复现需相当投入。