← 返回 2026-08-07

EffectLearner:面向真实世界视频物体擦除的世界感知对象-效果推理 EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu 📅 2026-08-06 👍 21 2026-08-11 18:30
对象-效果推理 扩散变换器 视觉语言模型 视频修复 视频物体擦除 视频生成

用VLM显式推理物体诱导效果,实现高保真视频对象擦除。

前置知识

视频物体擦除(Video Object Removal, VOR)

视频物体擦除任务的目标是:给定源视频 $V_{src}\in\mathbb{R}^{T\times H\times W\times 3}$ 和目标物体掩码 $M\in\{0,1\}^{T\times H\times W}$,生成一段编辑后的视频 $\hat{V}_{tgt}$,其中目标物体及其诱导产生的全部视觉效果(阴影、反射、镜面复制、光照变化、折射、波纹、尾迹、飞溅、烟雾、尘埃、运动轨迹等)都被彻底消除,同时受影响区域以高视觉保真度和时空连贯性被重建。它是影视后期、数字内容创作等领域的关键技术,难点在于多帧间的一致性与因果效果的彻底清除。

本文研究的核心任务就是 VOR。理解它的输入输出定义和评价指标(PSNR、SSIM、LPIPS、MAE、FVD)是把握全文贡献的基础。

潜在扩散与流匹配(Latent Diffusion / Flow Matching)

潜在扩散先用变分自编码器(VAE)把视频压缩到低维潜空间,再在潜空间建模去噪。本文采用流匹配目标,用线性插值构造噪声潜变量 $z_t=(1-t)z_0+t\epsilon$($t\sim U(0,1)$,$\epsilon\sim\mathcal{N}(0,I)$),模型回归速度场 $v_\theta(z_t,t)\approx\epsilon-z_0$,损失为 $\mathcal{L}_{flow}=\mathbb{E}\|v_\theta(z_t,t)-(\epsilon-z_0)\|_2^2$。相比离散噪声调度的 DDPM,流匹配以更直接的连续路径回归速度场,训练更稳定。

本文的 DiT 视频擦除器在流匹配框架下训练,理解 $z_t$ 的构造和 $\mathcal{L}_{flow}$ 才能看懂后续区域加权损失 $\mathcal{L}_{w\text{-}flow}$ 与运动一致性损失 $\mathcal{L}_{motion}$ 如何在其上叠加。

扩散变换器(Diffusion Transformer, DiT)

DiT 用 Transformer 替代 U-Net 作为扩散骨干。本文采用的 Wan2.2-TI2V-5B 是基于 DiT 的文生视频模型,每个 DiT 块含时空自注意力(建模视频 token 间交互)、交叉注意力(注入文本/语义条件)和前馈网络,在潜空间对视频 token 序列去噪,能同时捕捉细粒度空间细节与全局上下文。

Video Eraser 以 Wan2.2 的 DiT 为骨干,把语义上下文 token 注入其交叉注意力层。理解 DiT 结构有助于明白为何能用 effect-aware context tokens $C_{effect}$ 直接替换原始文本条件。

视觉语言模型(Vision-Language Model, VLM)

VLM 能同时理解图像/视频和自然语言。本文采用的 Qwen2.5-VL-3B-Instruct 用原生动态分辨率 ViT 把图像和视频表示为时空 token,结合窗口注意力与稀疏全局注意力高效捕捉细节与全局上下文,再经 visual merger 压缩投影到语言嵌入空间,由解码器与文本 token 联合自回归处理,具备丰富的世界知识与跨模态语义推理能力。

本文核心创新是把 VLM 当作对象-效果推理器而非字幕生成器。理解 VLM 结构才能明白 learnable effect queries 如何通过交叉注意力从其隐状态提取语义上下文。

交叉注意力(Cross-Attention)

交叉注意力让一组查询 token 从另一组键值 token 中检索信息,公式为 $\text{Attention}(Q,K,V)=\text{softmax}(QK^\top/\sqrt{d})V$,使模型可有选择地聚合外部条件。本文中 effect queries 与 VLM 隐藏状态之间、以及 DiT 中视频 token 与语义 context token 之间,都通过交叉注意力交互信息。

理解交叉注意力是看懂 effect queries 如何从 VLM 海量隐状态中抽取精简语义条件、以及这些条件如何引导 DiT 擦除器的关键。

研究动机

视频物体擦除在真实场景中远非抹掉目标像素那么简单——目标物体往往会在场景中诱导出阴影、反射、镜面复制、光照变化、折射、波纹、尾迹、飞溅、烟雾、尘埃、运动轨迹等一连串因果效果,这些效果会延伸到目标区域之外,并随物体运动和场景动态而演化。早期基于修复的方法靠零掩码或复制粘贴物体的人工配对数据监督,往往只擦掉目标本身而留下诱导效果,结果不自然。基于物理渲染或受控真实采集的近期 effect-aware 方法(ROSE、EffectErase、SVOR、GenEraser)虽能联合擦除物体和效果,但都从有限的预定义效果类别(ROSE 仅覆盖 shadow、light、reflection、mirror、translucent 五类)和固定训练分布中隐式学习物体-效果对应关系,缺乏专门机制去推理目标如何与周围环境交互。这导致它们在组合性效果、空间上分离或弱相关的效果、长尾物理现象、动态演化的交互等复杂真实场景上泛化很差,常出现漏擦、残留痕迹和时间闪烁。

本文的目标是本文的目标是构建一个能显式推理目标物体如何与场景交互、会诱导哪些效果的语义增强擦除框架,从而在复杂真实视频中同时彻底擦除目标物体及其全部因果诱导效果,并保持高视觉保真度和时空连贯性。具体而言,作者希望:第一,引入具备广泛世界知识的 VLM 作为对象-效果推理器,识别弱相关或空间分离的微妙效果;第二,把推理得到的高层语义信息以紧凑的 effect-aware context tokens 形式引导 DiT 视频擦除器;第三,通过运动感知的掩码引导和运动一致性监督,解决动态场景中物体快速移动、效果随时间演化带来的漏擦、残留与闪烁;第四,构建覆盖组合性、动态、空间分离、长尾物理效果的 EffectWorld 数据集,并通过渐进式训练课程让模型从基础擦除平稳过渡到复杂场景泛化。

与已有工作不同的是,本文的独特切入角度是显式语义推理而非堆数据或堆算力。已有 effect-aware 方法要么依赖预定义类别标签做有监督学习(如 ROSE 的五类标签),要么靠隐式对应关系,无法处理开放世界中的长尾因果效果。而本文把 VLM 当作因果推理引擎:它构造一个目标高亮视频(半透明红色填充加黄色边界标注目标,同时保留原始外观和场景上下文),再喂入一个结构化的效果分析提示,让 VLM 按阴影、反射、光照、折射、镜面、物理轨迹等维度系统排查,并以因果证据(时间、几何、物理)而非仅凭邻近或重叠来判断效果归属。这种先推理后引导的范式,把高层世界知识与低层视频生成桥接起来,从根本上区别于纯数据驱动或纯类别监督的范式。

核心方法

EffectLearner 的整体思路是先推理、后擦除、再稳定。整个框架由两个核心模块加一个稳定性增强模块组成:左侧是 VLM-Based Object-Effect Reasoner,负责对目标高亮视频和结构化提示做跨模态推理,提取紧凑的 effect-aware 语义上下文;中间是 DiT-Based Video Eraser,把语义上下文与源视频、掩码一起作为条件,联合擦除目标及其诱导效果并高保真重建;右侧是运动感知时空稳定化,通过运动感知掩码引导和运动一致性损失增强动态场景连贯性。直觉上,VLM 像现场勘察员,先分析目标和环境如何互动、会产生什么效果、擦掉后场景应长什么样、什么必须保留;DiT 擦除器则像施工队,按勘察报告和原始素材执行擦除与重建。技术路线以 Wan2.2-TI2V-5B 的 DiT 为生成骨干、Qwen2.5-VL-3B-Instruct 为推理骨干,在流匹配框架下训练,并配合作者自建的 EffectWorld 数据集和渐进式训练课程,从简单擦除逐步过渡到复杂效果。

核心创新点是可学习的 effect queries 配合结构化因果推理提示这一组合。作者没有让 VLM 直接生成文字描述喂给 DiT(那样信息有损且不可控),而是在 VLM 解码器中插入若干可学习的 effect query tokens $Q_{effect}\in\mathbb{R}^{N_q\times d_q}$,让它们通过交叉注意力主动从 VLM 隐藏状态中抽取擦除相关语义——包括目标身份与运动、诱导效果类别及其时间演化、擦除后场景应有的状态、以及必须保留的内容。这些查询特征再经 query connector 投影到 DiT 条件空间,得到紧凑的 effect-aware context tokens $C_{effect}\in\mathbb{R}^{N_c\times d_c}$,直接替换 DiT 交叉注意力中的原始文本条件。这与类别标签监督或文本提示生成有本质区别:前者只学到预定义类别的统计对应,后者受限于自然语言表达;而 effect queries 是端到端可学习、面向擦除任务定制、能编码多效果因果链和保留约束的紧凑表示,既保留 VLM 世界知识又精准服务擦除任务。

方法步骤详情

具体步骤如下。第一步构建目标高亮视频:对源视频做透明度混合 $V_{hl}=(1-\alpha M)\odot V_{src}+\alpha M\odot c_{hl}$,$c_{hl}=(255,0,0)$、$\alpha=0.15$,并绘制黄色边界既标注目标又保留外观。第二步 VLM 推理:把高亮视频与结构化提示 $P=[P_{sys};P_{inst};P_{task}]$ 输入 Qwen2.5-VL,effect queries 经交叉注意力与 VLM 隐藏状态交互,再经 query connector 投影得到 $C_{effect}$。第三步构造 DiT 条件:源视频经 VAE 编码为源潜 $z_{src}$,掩码下采样并与运动感知时间并集掩码 $M^{union}_k=\max_{i\in\Omega_k}M^{(i)}$ 对齐再膨胀,三者沿通道拼接。第四步流匹配训练:构造 $z_t=(1-t)z_0+t\epsilon$,回归速度场 $\mathcal{L}_{flow}=\mathbb{E}\|v_\theta(z_t,t)-(\epsilon-z_0)\|_2^2$。第五步区域加权:由配对差分阈值化得 $M_{effect}$,构造 $\mathcal{L}_{w\text{-}flow}=(1+w_{obj}M_{obj}+w_{effect}M_{effect})\odot\mathcal{L}_{flow}$ 强调目标与效果区。第六步运动一致性监督:用相邻帧质心位移构造平移伪流 $f_k$,对预测与真值潜做后向变形并匹配运动补偿残差 $\mathcal{L}_{motion}=\text{Mean}_{R_k}\|\hat{\Delta}_k-\Delta_k\|_2^2$。第七步总损失 $\mathcal{L}=\mathcal{L}_{w\text{-}flow}+\lambda_{motion}\mathcal{L}_{motion}$,推理时 50 步去噪生成 $\hat{V}_{tgt}$。

技术新颖性

技术新颖性体现在四个层面。其一,VLM-as-reasoner 范式:不同于 RACCOON、Kiwi-Edit、Void、Viva 等 VLM 辅助视频编辑方法只处理显式编辑指令或物体级操作,本文首次把 VLM 用作隐式物体-场景交互与诱导视觉效果的推理器,并设计目标高亮输入和结构化因果分析提示。其二,可学习的 effect queries 机制:把语义信息压缩成面向擦除任务定制的紧凑 token,而非损失性地转化为自然语言,使条件既保留世界知识又精准可控。其三,运动感知稳定化双设计:运动感知掩码引导(时间窗内掩码取并集再膨胀)解决 VAE 时间压缩下快速运动目标的覆盖丢失,运动一致性损失(质心位移伪流加运动补偿残差匹配)显式约束跨帧一致,二者分别从引导和监督两端互补抑制闪烁与残留。其四,EffectWorld 数据集与渐进式训练课程:基于 UE 物理渲染构造的组合性、长尾物理、弱相关、空间分离效果配对数据,配合从基础擦除到复杂效果再到长尾与快速运动的难度递增课程,为复杂场景泛化提供靶向监督,让方法在抽象层和实现层都形成闭环创新。

Overview of EffectLearner. The framework consists of two core components: (1) the VLM-Based Object-Effect Reasoner ...; and (2) the DiT-Based Video Eraser ...
Figure 1: Overview of EffectLearner. The framework consists of two core components: (1) the VLM-Based Object-Effect Reasoner ...; and (2) the DiT-Based Video Eraser ...
Data construction pipeline of EffectWorld.
Figure 2: Data construction pipeline of EffectWorld.

实验结果

本文在三类基准上全面验证。其一,在 ROSE-Bench(60 个配对三元组、49 帧)上,EffectLearner 取得 PSNR 28.973、SSIM 0.921、LPIPS 0.054(最佳)、MAE 6.781、FVD 81.866(最佳);像素级指标略逊于类别监督强化的 ROSE(30.468/0.933/6.002),但 ROSE 的 FVD 高达 803.722 说明视频级连贯性差,本文以最低 FVD 取得最佳感知-时间平衡。其二,在更具挑战的 EffectWorld-Eval(33 个复杂效果配对)上本文全面领先:PSNR 29.521、SSIM 0.934、LPIPS 0.044、MAE 6.839、FVD 69.184,相较 ROSE 的 LPIPS 0.111 与 FVD 887.541 大幅改善,证明对组合性、动态、空间分离、长尾效果的强泛化。其三,在 EffectWorld-Wild(70 个开放世界视频,VBench 指标)上本文总分 0.772 与 VACE 并列最佳,且同时取得最佳背景一致性 0.958 与最佳动态度 0.400,EffectErase 虽主体一致性最高(0.965)但动态度最低(0.343)显示过度平滑。其四,消融显示去掉 VLM 后 FVD 从 69.184 升至 118.236,去掉运动一致性损失退化最剧烈:PSNR 暴跌至 24.703、MAE 飙至 21.523、FVD 暴增至 294.778,证明时空一致性监督是抑制闪烁与残留的关键。其五,细粒度评测中 LLM 裁判(GPT-5.4)总分 3.389 居首,20 名人类评测者总分 3.675 居首,且两者皮尔逊相关 $r=0.9837$,验证 LLM 裁判可作为可靠代理。

Quantitative results on ROSE-Bench and EffectWorld-Eval.
Table 1: Quantitative results on ROSE-Bench and EffectWorld-Eval.
Quantitative results of various methods in EffectWorld-Wild.
Table 2: Quantitative results of various methods in EffectWorld-Wild.
Ablation results of our proposed components.
Table 3: Ablation results of our proposed components.
Visualization results of various methods on EffectWorld-Wild.
Figure 3: Visualization results of various methods on EffectWorld-Wild.
查看结构化数据
任务指标本文基线提升
ROSE-Bench 视频物体擦除(感知质量) LPIPS↓ 0.054 ROSE 0.058 取得全场最佳 LPIPS,超越次优的 ROSE,体现更优的感知质量
ROSE-Bench 视频物体擦除(视频级连贯性) FVD↓ 81.866 ROSE 803.722 FVD 较 ROSE 降低约一个数量级,视频级时空连贯性大幅领先
EffectWorld-Eval 复杂效果擦除(像素保真) PSNR↑ 29.521 ROSE 25.955 PSNR 提升约 3.57 dB,在复杂效果场景上像素保真显著领先
EffectWorld-Eval 复杂效果擦除(感知质量) LPIPS↓ 0.044 ROSE 0.111 LPIPS 降低 0.067,感知质量与因果效果擦除完整性大幅改善
EffectWorld-Wild 开放世界擦除(动态自然度,VBench) Dynamic Degree↑ 0.400 EffectErase 0.343 动态度最佳,避免过度平滑,保持场景自然动态
EffectWorld-Wild 细粒度擦除(人类评测总分) Overall↑ (1-4) 3.675 EffectErase 3.213 人类主观评测总分最高,效果擦除与背景保留均第一
EffectWorld-Eval 消融(去除运动一致性损失) FVD↓ 69.184(完整) w/o $\mathcal{L}_{motion}$ 为 294.778 运动一致性损失使 FVD 降低约 225,是抑制时空闪烁的关键组件

局限与改进

作者在补充材料中坦承两类失败模式。第一类是大前景遮挡加复杂背景纹理:在猫的案例中目标占据大片前景并遮挡了纹理复杂的沙发和另一只猫,虽然目标被擦除,但重建区域出现过度平滑的纹理,且在剩余那只猫附近出现局部畸变,说明被大目标遮挡的高频内容恢复仍困难。第二类是复杂运动与重复遮挡:在狗的案例中严重运动模糊和被细杆反复遮挡使模型错误地擦掉了本应保留的部分细杆结构,显示复杂运动或遮挡下的精确对齐仍是挑战。除作者承认的之外,我观察到几点:其一,方法强依赖 VAE 时间压缩,对极快运动目标即便有时间并集掩码仍可能信息不足;其二,effect queries 数量 $N_q$ 是超参,对稀有效果或极长因果链可能表达力受限;其三,UE 渲染的物理效果与真实世界仍有域差距,real-world 泛化证据仅来自 70 个无配对真值的评测视频;其四,PSNR 等像素指标在 ROSE-Bench 上未超过 ROSE,说明类别内像素级精度上有取舍;其五,同时运行 3B VLM 推理器和 5B DiT,推理成本显著高于纯修复方法,论文未报告推理时间与显存。

独立分析的弱点

独立分析的弱点及改进方向如下。其一,长距离因果效果建模不足:当前运动一致性损失用相邻帧质心位移构造平移伪流 $f_k$,只能建模近似刚体平移,对旋转、缩放、非刚性效果(扩散的烟雾、波纹)建模偏弱,可引入光流或可变形配准替代,或用 3D 时空注意力建模长程依赖。其二,高频细节恢复能力弱:大遮挡区域纹理过平滑,可引入显式高频损失(感知损失、小波损失)或级联超分辨率分支,并增加高纹理场景训练比例。其三,VLM 推理与生成解耦:effect queries 是一次性前向提取,无法在去噪过程中迭代修正,可让 DiT 反馈给 VLM 形成迭代推理。其四,类别级像素精度不及 ROSE,可将类别标签作为辅助监督蒸馏进 effect queries。其五,计算成本高:3B 加 5B 双模型难以实时,可蒸馏到轻量编码器或用更小的 VLM。其六,效果掩码靠差分阈值 $\tau$ 生成,对弱效果或配对噪声敏感,可改用学习型效果分割器。

未来方向

作者明确提出的未来方向集中在解决两类失败模式——大遮挡下高频纹理的过度平滑与复杂运动遮挡下的结构误擦——指出这两点仍是开放问题。基于本文成果可延伸的方向包括:第一,把 VLM 推理器推广到更广义的场景理解引导生成,例如不仅擦除还能插入、替换、改光,effect queries 可扩展为多任务 query 集合;第二,引入更强运动模型(光流、可变形注意力、3D 时空 Transformer)替代平移伪流,以建模非刚性与扩散性效果;第三,迭代式推理-生成耦合,让 VLM 与 DiT 在去噪过程中多轮交互以纠正早期推理误差;第四,扩大 real-world 配对数据采集(如多视角同步拍摄、神经辐射场重建生成配对真值),缩小 sim-to-real 域差距;第五,将 effect-aware context 思想迁移到图像编辑、3D 场景编辑、自动驾驶场景补全等相关任务;第六,结合负责任 AI,开发擦除溯源水印与编辑检测,应对论文伦理声明中提到的深度伪造与信息伪造滥用风险。

复现评估

复现评估整体良好。开源情况:论文提供项目主页(morleyolsen.github.io/EffectLearner)和 EffectWorld 数据集(HuggingFace: jenniferwuuu/EffectWorld),含 11,092 个 UE 渲染配对三元组(3,428 个 90 帧加 7,664 个 150 帧)及标准化目录结构,补充材料给出 UE 三元组生成、目标高亮视频、时间并集掩码、运动一致性损失的完整算法(Algorithm 1-4),结构化提示(Figure V)与 LLM 裁判提示(Figure VI)全文公开。数据:训练用 16,663 个 ROSE 三元组加 11,048 个 EffectWorld 三元组共 27,711 样本,评测基准(ROSE-Bench 60、EffectWorld-Eval 33、EffectWorld-Wild 70)规模明确。算力:训练在 NVIDIA L20 GPU 上 1 个 epoch,全局 batch size 12,AdamW 学习率 $5\times10^{-6}$,89 帧、1280×704 分辨率,推理 50 步去噪;L20 是中端数据中心 GPU,单卡可训练,门槛相对友好。复现难点:UE 场景组合与渲染需一定工程量;双骨干模型(Qwen2.5-VL-3B 加 Wan2.2-TI2V-5B 从 Kiwi-Edit 初始化)需正确加载;LLM 裁判依赖 GPT-5.4 付费 API;未公开推理时间与显存数值。整体属中高可复现。