← 返回 2026-08-13

从合成到去除:物理约束的反射模拟与基于扩散的视频去反射 From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou 📅 2026-08-12 👍 9 2026-08-18 18:30
基准测试 扩散模型 数据合成 视频修复 视频去反射

首个视频去反射闭环框架:物理增强合成配对数据、一步扩散去除模型与专用基准S2R-Bench

前置知识

反射成像线性混合模型

反射去除的标准成像假设:观测图像 $I$ 是透射层 $T$ 与反射层 $R$ 的线性叠加 $I=\alpha_t T+\alpha_r R$,$\alpha_t,\alpha_r$ 控制两层相对强度。真实玻璃还会引入粗糙度模糊、厚度鬼影、菲涅耳强度变化等效应,因此纯 RGB 线性混合合成的反射过于简化、缺少玻璃依赖细节。

本文的物理增强模块 PGA 正是对该模型的结构空间升级,理解它才能看懂合成管线的设计动机与消融逻辑。

视频扩散模型与 DiT(Wan2.1)

扩散模型通过逐步去噪学习数据分布;视频版本在潜空间用 3D VAE 压缩时空体积,主干 DiT 是 Transformer 去噪网络,可接收文本/图像/线稿等条件。本文的渲染器与去除模型均构建于 Wan2.1-Fun-v1.1-1.3B-Inp 之上,推理设定为 81 帧、832×480。

S2R-Synthesis 的渲染器和 S2R-Removal 都是对该骨干的 LoRA 改造,训练目标与损失设计都围绕其潜空间展开。

LoRA 微调

低秩适配:冻结预训练权重,仅在注意力/线性层旁注入低秩矩阵 $\Delta W=BA$ 训练,参数与显存开销小、不易灾难性遗忘,是扩散模型定制的主流方式。配合零初始化新增分支,可在不打扰预训练行为的前提下注入新能力。

论文两个训练阶段均用 LoRA 适配骨干,强度头零初始化设计直接依赖这一机制的稳定性。

线稿条件与结构空间合成

从视频帧提取线稿表示,保留结构布局、剥离不稳定的外观细节。本文在结构空间融合透射与反射条件 $E_F=\mathrm{clip}(E_T+\mathcal{A}(E_R;\theta_g),0,1)$,再由学习到的视频渲染器补全逼真外观,而非直接在 RGB 空间做像素混合。

结构空间条件化加神经渲染是本文合成管线区别于传统 alpha 混合的核心机制。

一步去噪与涌现的单步能力

标准扩散推理需多步迭代;本文发现在反射-干净视频对上做潜空间扩散训练时,模型会自发获得单步生成粗糙但连贯干净估计的能力(与 GenSIRR 在图像上的观察一致),从而可在最大噪声级 $\tau$ 处一步预测 $\hat z_0$ 并解码输出。

这一涌现能力是 Stage II 高效像素-几何精化的引擎,也是本文推理速度反超非扩散基线的关键。

玻璃光学三要素:GGX、Snell 鬼影、菲涅耳反射

粗糙表面按 GGX 微表面法线分布散射,远场等效为对镜像反射的高斯模糊(宽度 $\sigma$);厚玻璃多界面反射按傍轴 Snell 定律产生横向位移 $\delta\approx d\theta_i(1-1/n)$ 的重影;菲涅耳反射率 $F$ 决定强度,可实例化为仿射调制 $\gamma E_R+\beta$。

PGA 的六个算子逐一对应这些光学效应,理解物理来源才能理解参数设计(如 $\sigma\in[5,15]$)与合成趋势验证。

研究动机

隔着玻璃拍摄的视频(车窗、橱窗、眼镜)普遍被反射污染,遮挡透射场景、降低感知质量并干扰下游视觉系统。单图像反射去除已研究多年,但视频反射去除几乎空白,瓶颈有三:其一,成对视频数据极难获取——反射视频与完美对齐的无反射视频要求拍摄前后相机运动、光照与动态场景内容完全一致;其二,缺乏时序连贯的去除模型,把图像方法逐帧套用会产生闪烁、去除强度不一致和背景细节不稳定,因为反射会随时间变化、独立于透射层运动并与相机运动耦合;其三,没有任务专用评测基准。现有合成策略也各有缺陷:RGB 空间混合能对齐但反射过于简化、缺少玻璃效应;逐帧图像扩散(如 FLUX 编辑)单帧逼真但时序闪烁且无法控制玻璃参数;直接用视频扩散模型提示加反射成功率极低,常常生成不出可见反射或破坏原场景内容。

本文的目标是本文把视频反射去除当作合成-去除-评测的闭环问题而非孤立的模型设计问题,目标是同时解决三件事:(1) 构建可规模化、逼真且可控的成对视频反射合成管线 S2R-Synthesis,能对玻璃粗糙度、反射率、厚度等物理参数编程控制,生成带精确配对监督的无闪烁反射视频;(2) 训练首个基于扩散的视频反射去除模型 S2R-Removal,要求单步推理、时序连贯、保结构保几何,且推理速度比非扩散基线更快;(3) 发布首个视频反射去除基准 S2R-Bench,同时支持全参考客观评测(S2R-Ref,60 对带干净真值的配对视频)与真实场景人类感知评测(S2R-Real,50 条野外视频)。最终在自建基准与 Real、SIR2、Nature、OpenRR 等公开图像基准上达到 SOTA 并验证合成数据价值。

与已有工作不同的是,独特切入是把反射合成从 RGB 空间像素混合抬升到结构空间条件化:把反射的结构(线稿)与外观解耦——用 FLUX 逐帧生成的伪反射视频作监督训练一个 Wan2.1 视频扩散渲染器负责逼真外观与时序连贯,而把玻璃物理效应(粗糙模糊、厚度鬼影、反射率变化、局部覆盖、静态反射)实例化为对线稿条件的六个可控算子 PGA,参数在片段级共享保证时序一致。去除侧则利用潜扩散训练中涌现的一步去噪能力绕开昂贵多步采样,用像素与深度几何损失一步锚定输出;并把去反射定义为修复而非自由生成——因为反射是衰减叠加而非遮挡透射层,模型必须保真而非创造。这是首个把物理模拟、扩散去除、基准评测闭环起来的视频去反射框架。

核心方法

整体分合成、去除、基准三块。合成侧两阶段:Stage A 用 VLM(Qwen3-VL-8B)从 Ditto-1M 筛出无反射视频,FLUX.2-Klein-9B 逐帧注入反射得到 11,132 条伪配对视频,以其线稿为条件、伪反射为目标训练结构引导的视频渲染器 $\mathcal{G}$(Wan2.1 骨干,扩散损失监督);Stage B 对透射视频 $T$ 与独立反射源 $R$ 提取线稿 $E_T,E_R$,经物理增强 $\mathcal{A}(\cdot;\theta_g)$ 后融合为 $E_F$,与 $T$ 一起送入 $\mathcal{G}$ 渲染出逼真反射视频 $I$,$(I,T)$ 即训练对。去除侧两阶段:Stage I 用 LoRA 做反射感知潜空间适配,附加零初始化强度头以残差 $|I-T|$ 为真值学习反射强度图;Stage II 利用涌现的一步去噪能力从最大噪声级单步预测并解码,用 L1 重建、SSIM 与 LeReS 深度一致性损失(仅反射掩码区域加权)精化。基准侧构建 S2R-Ref(60 对)与 S2R-Real(50 条野外视频),全部模型在 8×A100 上训练。

核心创新三点咬合。第一,结构与外观解耦:传统方法在 RGB 空间做 $I=\alpha_t T+\alpha_r R$ 线性混合,反射缺乏玻璃效应;本文把玻璃光学效应实例化为对反射线稿的六个可控算子——Roughness 高斯模糊(核宽 $k=2\lfloor3\sigma\rfloor+1$)、Thickness 平移重影 $E_R+w W_\Delta(E_R)$、Reflectance 仿射调制 $\gamma E_R+\beta$、Partial 掩码、Static 冻结帧、Planar 直融,参数片段级采样保证时序连贯,再由学习到的视频渲染器补全逼真外观,兼得可控性与真实性。第二,反射强度显式监督:残差 $M_{gt}=|I-T|$ 编码反射位置与强度,经零初始化轻量头以 $\mathcal{L}_{int}=\|\hat M-\mathcal{E}(M_{gt})\|_1$ 注入 DiT,让模型知道去哪里去除而不扰动预训练去噪行为。第三,把 Stage I 涌现的单步去噪当 Stage II 引擎:从 $z_\tau\sim\mathcal{N}(0,\mathbf{I})$ 一步得 $\hat z_0$,用像素与深度几何损失(反射掩码聚焦)锚定输出,实现 87.09ms/帧。

方法步骤详情

流程:(1) 数据清洗——Qwen3-VL-8B-Instruct 以固定提示词判定视频是否含玻璃反射,从 Ditto-1M、HumanVid、UltraVideo 筛选无反射视频;(2) 伪反射生成——FLUX.2-Klein-9B 逐帧 image-to-image,三选一提示(微弱/强烈/彩色),得 11,132 条带闪烁伪配对;(3) 训练渲染器——对伪反射提取三通道线稿条件,训练 $\mathcal{G}$ 从 $(T,E_{\tilde M})$ 重构伪反射,8k 步、约 21k 样本;(4) PGA 合成——按 Table 5 采样 $\theta_g$,融合 $E_F=\mathrm{clip}(E_T+\mathcal{A}(E_R),0,1)$,渲染 HumanVid 20,031 + UltraVideo 5,768 条无闪烁配对,另加 2,997 条传统混合配对,合计约 3.76 万对(含 8,800 图像对,80% 经 crop-to-video 转伪视频);(5) Stage I——采样 $z_t=\alpha_t z_T+\sigma_t\epsilon$,LoRA 训练 $\mathcal{L}=\mathcal{L}_{diff}+0.1\mathcal{L}_{int}$;(6) Stage II——从最大噪声级一步去噪得 $\hat T$,损失 $\mathcal{L}_{rec}+0.2\mathcal{L}_{ssim}+0.5\mathcal{L}_{depth}$,深度用冻结 LeReS;(7) 两阶段各 30k 步,8×A100。

技术新颖性

新颖性体现为三个首次与一个反直觉设计:首次将扩散去反射从图像扩展到视频、首个视频反射去除基准、首个闭环合成-去除框架。反直觉之处在于:视频扩散模型直接被提示生成反射成功率极低,作者不硬攻生成端,而是训练结构条件渲染器、用 FLUX 伪标签蒸馏时序连贯性,把控制权交给解析可编程的 PGA 算子,巧妙绕开视频编辑模型的失败模式。去除侧的强度头是残差监督的潜空间版本,零初始化保证不破坏先验;更关键的是把潜扩散训练自然获得一步能力这一观察(此前 GenSIRR 在图像上发现)系统化为两阶段训练策略,使扩散模型推理速度(87.09ms/帧)反超纯 CNN 基线 RDNet(145.13ms/帧),挑战了扩散等于慢的固有印象。PGA 对线稿而非 RGB 操作,使物理参数(如鬼影位移 $\delta\approx d\theta_i(1-1/n)$)能以可控、可复现方式注入,并与 UE5 渲染趋势对齐(Figure 6)但无需重型引擎。

反射合成与去除管线概览。左:跨玻璃粗糙度、反射率、厚度的可控合成;右:野外视频的定性去除结果。
Figure 1: 反射合成与去除管线概览。左:跨玻璃粗糙度、反射率、厚度的可控合成;右:野外视频的定性去除结果。
S2R-Synthesis 概览。左:现有策略的局限;Stage A 从 FLUX 生成的伪反射视频训练结构引导反射渲染器;Stage B 通过 PGA 融合两条干净视频的条件并渲染配对反射视频。右:代表性 PGA 操作。
Figure 2: S2R-Synthesis 概览。左:现有策略的局限;Stage A 从 FLUX 生成的伪反射视频训练结构引导反射渲染器;Stage B 通过 PGA 融合两条干净视频的条件并渲染配对反射视频。右:代表性 PGA 操作。
S2R-Removal 概览。Stage I 通过残差导出的强度监督进行反射感知潜空间适配;Stage II 用重建、结构与深度一致性损失做一步像素-几何精化。
Figure 3: S2R-Removal 概览。Stage I 通过残差导出的强度监督进行反射感知潜空间适配;Stage II 用重建、结构与深度一致性损失做一步像素-几何精化。
在受控改变三个玻璃属性(粗糙度、反射率、厚度)下,比较 S2R-Synthesis(含 PGA)与 UE5 管线的反射合成趋势。
Figure 6: 在受控改变三个玻璃属性(粗糙度、反射率、厚度)下,比较 S2R-Synthesis(含 PGA)与 UE5 管线的反射合成趋势。
Stage I 中反射强度头的可视化。
Figure 10: Stage I 中反射强度头的可视化。

实验结果

主实验(Table 1):S2R-Ref 上 PSNR 28.84dB / SSIM 0.859 / TC 0.9740,PSNR 领先次优 GenSIRR(27.04dB)1.80dB;S2R-Real 人评(15 人、0-3 分归一化)去除 0.787、保持 0.980、TC 0.9827,大幅超过 GenSIRR(0.654/0.831)与 DAI(0.332/0.871)。效率 87.09ms/帧(81 帧、832×480),比次优 RDNet(145.13ms)快约 1.67 倍,比 GenSIRR(7214.94ms)快约 83 倍。图像基准平均 28.77dB/0.921,超过 DAI 的 27.35/0.913,验证跨域泛化。数据消融(Table 2,固定 RDNet):基线 28.05→传统合成 31.98→本文平面 32.35→结合 33.26dB;全 PGA 达 34.13dB/0.9704,较平面-only +1.78dB。损失消融(Table 3):纯扩散 27.00→强度监督 27.71→重建 28.21→SSIM 28.55→深度 28.84dB,各组件一致正贡献。单图应用(Table 9):zoom-out 推理 28.77dB 优于直接单图 28.21dB。下游(Table 10/11):去反射后 YOLOP mIoU 0.891→0.898,YOLOv5n mAP@0.5 0.351→0.372。

在视频与图像基准上与 SOTA 去反射方法的比较。
Table 1: 在视频与图像基准上与 SOTA 去反射方法的比较。
合成管线有效性:RDNet 在 OpenRR-1k 上用不同数据配置训练并在测试集评测。
Table 2: 合成管线有效性:RDNet 在 OpenRR-1k 上用不同数据配置训练并在测试集评测。
S2R-Removal 在 S2R-Ref 上的损失消融:逐步启用 Stage I 潜空间适配损失与 Stage II 像素-几何精化损失。
Table 3: S2R-Removal 在 S2R-Ref 上的损失消融:逐步启用 Stage I 潜空间适配损失与 Stage II 像素-几何精化损失。
反射合成训练数据集构成。
Table 4: 反射合成训练数据集构成。
用于视频反射合成的 PGA 增强参数。
Table 5: 用于视频反射合成的 PGA 增强参数。
反射去除训练数据集构成。
Table 6: 反射去除训练数据集构成。
物理增强(PGA)控制变量及其物理解释。
Table 7: 物理增强(PGA)控制变量及其物理解释。
人类感知评测评分标准。
Table 8: 人类感知评测评分标准。
单图推理与 zoom 伪视频推理在图像反射去除基准上的比较。
Table 9: 单图推理与 zoom 伪视频推理在图像反射去除基准上的比较。
在含反射的 BDD100K 视频上的下游驾驶区域分割(YOLOP)。
Table 10: 在含反射的 BDD100K 视频上的下游驾驶区域分割(YOLOP)。
在含反射的 BDD100K 视频上的下游车辆检测(YOLOv5n)。
Table 11: 在含反射的 BDD100K 视频上的下游车辆检测(YOLOv5n)。
在有干净真值的受控反射视频上的定性比较。
Figure 4: 在有干净真值的受控反射视频上的定性比较。
与 SOTA 反射去除方法在视频上的定性比较(第 1/20/40 帧)。
Figure 5: 与 SOTA 反射去除方法在视频上的定性比较(第 1/20/40 帧)。
在无真值的真实世界反射视频上的定性比较。
Figure 7: 在无真值的真实世界反射视频上的定性比较。
与已有视频反射去除方法的定性比较,其结果帧直接取自原论文(因无公开代码)。
Figure 8: 与已有视频反射去除方法的定性比较,其结果帧直接取自原论文(因无公开代码)。
与通用视频编辑模型 Kling O1 在三个代表性用例上的比较。
Figure 9: 与通用视频编辑模型 Kling O1 在三个代表性用例上的比较。
S2R-Removal Stage I 与 Stage II 的定性比较。
Figure 11: S2R-Removal Stage I 与 Stage II 的定性比较。
在 Real、SIR2、Nature 图像基准上的定性比较。
Figure 12: 在 Real、SIR2、Nature 图像基准上的定性比较。
下游感知任务的定性结果:所提去反射模型提升视觉清晰度并有利于分割与检测。
Figure 13: 下游感知任务的定性结果:所提去反射模型提升视觉清晰度并有利于分割与检测。
查看结构化数据
任务指标本文基线提升
视频反射去除(全参考,S2R-Ref 60 对) PSNR / SSIM / TC 28.84 dB / 0.859 / 0.9740 GenSIRR 27.04 dB / 0.846 / 0.9648;RDNet 24.71 dB / 0.870 / 0.9564 PSNR +1.80 dB,SSIM 略低于 RDNet 但 TC 最高
真实视频人评(S2R-Real 50 条) 归一化人评分(15 人,0-3 分制) 去除 0.787,保持 0.980,TC 0.9827 GenSIRR 0.654 / 0.831 / 0.9747;DAI 0.332 / 0.871 / 0.9777 去除 +0.133,保持 +0.149
推理效率(81 帧 832×480 视频) ms/帧 87.09(单步扩散) RDNet 145.13;GenSIRR 7214.94 较次优快约 1.67 倍,较 GenSIRR 快约 83 倍
图像基准跨域(Real/SIR2/Nature 平均) PSNR / SSIM 28.77 / 0.921 DAI 27.35 / 0.913;RDNet 26.63 / 0.903 PSNR +1.42 dB(对比 DAI)
合成数据消融(OpenRR-1k,RDNet 骨干) PSNR / SSIM 全 PGA 34.13 / 0.9704 平面-only 32.35 / 0.9643;传统合成 31.98 / 0.9619 +1.78 dB / +0.0061(对比平面-only)
下游:BDD100K 驾驶区域分割(YOLOP) mIoU / IoU 0.898 / 0.835(去反射后) 原始输入 0.891 / 0.823 mIoU +0.007,IoU +0.012
下游:BDD100K 车辆检测(YOLOv5n) mAP@0.5 / mAP@0.95 0.372 / 0.238(去反射后) 原始输入 0.351 / 0.221 +0.021 / +0.017

局限与改进

作者承认两点:多层玻璃嵌套反射存在歧义——内层反射既可视为待去除伪影也可视为场景一部分,模型会残留(S2R-Real 顶例)或过度去除(S2R-Ref 底例);合成管线以片段级参数近似时序连贯,未显式建模相机运动与反射几何的耦合(视点相关视差)。我的补充观察:(1) S2R-Ref 由 DRR 图像对加 Ken Burns 虚拟运动(10fps)构成,本质是准视频,无真实相机运动与真实反射动态,其 TC 高分说服力有限;(2) S2R-Real 仅 50 条、15 名评分者,人评统计功效较弱;(3) 训练监督大量依赖 FLUX 伪标签与线稿渲染器,反射外观可能偏向渲染器先验,对真实玻璃色散、镜面高光溢出等覆盖不足;(4) 受 Wan2.1 1.3B 与 81 帧、832×480 设定限制,长视频与高分辨率场景未验证;(5) PGA 参数范围(Table 5)为手工设定,文中未见敏感性分析;(6) 文中未声明代码与权重开源,且依赖 FLUX.2-Klein-9B 非商用许可组件。

独立分析的弱点

具体弱点与改进方向:(1) 嵌套反射歧义——可在合成端引入多层玻璃递归组合算子,并让强度头输出多实例强度图显式区分反射层次,训练时对内层反射给予可配置标签;(2) 视差缺失——把 Thickness 的静态平移 $\Delta$ 升级为随相机位姿变化的深度相关位移场 $\delta(x,t)\approx d(x)\theta_i(t)(1-1/n)$,或引入可微光传输渲染生成视差正确的反射;(3) 基准偏合成——S2R-Ref 应补充真实捕获的成对视频(偏振/分光镜采集),并增加 LPIPS、光流时序误差等感知指标,避免仅靠 PSNR/SSIM/TC;(4) 人评规模小——扩展评审员数量并报告置信区间,或引入无参考视频质量模型辅助打分;(5) 单步质量依赖 Stage I 涌现能力,训练方差与稳定性未报告——可加入一致性蒸馏或多步到一步的显式蒸馏稳定该能力;(6) 分辨率与时长受限——可做滑窗推理加潜空间时序缓存,或迁移到 14B 骨干验证可扩展性与更高分辨率下的去除上限。

未来方向

作者提出的方向:把多层反射案例纳入训练数据缓解嵌套歧义;探索更丰富的物理反射模拟(显式视差耦合)与更大的真实世界视频基准。基于本文成果可延伸的:(1) 把结构空间条件化加物理算子的思路迁移到其他介质退化——雾、水面波纹、雨痕、透明遮挡的可控合成与去除,形成通用透过介质修复框架;(2) 反射去除作为预训练任务:合成配对数据可自监督训练视频表征,下游实验(mIoU 0.891→0.898、mAP@0.5 0.351→0.372)已暗示其在自动驾驶感知的实用价值,可系统化为退化即增强的数据引擎;(3) 一步去噪加像素域几何监督的两阶段范式可推广到去模糊、去雨、低光增强等修复型任务,统一效率与保真;(4) PGA 与 UE5 趋势一致(Figure 6)提示可构建神经-物理混合渲染管线:游戏引擎出物理真值、神经渲染器出外观;(5) 交互式应用:利用强度预测图做可控编辑,选择性地保留或移除指定区域反射。

复现评估

复现要素基本齐全但门槛不低。有利条件:骨干开源(Wan2.1-Fun-v1.1-1.3B-Inp),训练与评测数据均为公开数据集(Ditto-1M、HumanVid、UltraVideo、OpenRR-1k/5k、RRW、SIR2、DRR、BDD100K),PGA 算子推导与参数范围(Table 5、7)、损失权重($\lambda_{int}=0.1$、$\lambda_{ssim}=0.2$、$\lambda_{dep}=0.5$)、提示词全文、训练步数(8k+2×30k)与算力(8×A100)均已披露,项目页为 https://codingwzp.github.io/VideoDereflection_S2R。风险点:FLUX.2-Klein-9B 为非商用许可需自备;VLM 过滤依赖 Qwen3-VL-8B 判定质量,边界样本处理未说明;S2R-Ref 构建含人工筛选(434 条筛至 60 条);重跑 11,132 条 FLUX 逐帧推理与 3.8 万对渲染的算力和存储开销大;论文未明确声明代码与权重发布。总体:具备 8×A100 资源与扩散训练经验的团队约 2-4 周可复现核心管线,完整数据再生需更久,难度中上。