MirrorWorld:驯服视频扩散模型生成一致的镜面反射 MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation
用语义关系蒸馏与几何变换对齐,让视频扩散模型生成与可见场景一致的镜面反射
前置知识
视频扩散模型(VDM)
扩散模型通过逐步去噪生成数据:训练时向干净潜变量 $z_0$ 加噪得到 $z_s$,网络 $u_\theta$ 学习预测调度器定义的目标;视频扩散模型把该过程扩展到时空潜变量,联合建模外观与运动。代表性工作包括 Video Diffusion Models、VideoLDM、CogVideoX、Wan2.1 等,主流架构为扩散 Transformer(DiT)。
本文的全部工作建立在微调一个条件 VDM(Wan2.1-VACE-14B)之上,不熟悉去噪训练与条件输入机制,就无法理解扩散损失 $\mathcal{L}_{\mathrm{diff}}$ 以及掩码条件 $(V_m, M, T)$ 如何驱动镜面区域的重建。
视频修复
给定带有缺失或遮蔽区域的视频,模型需在保持可见区域不变的前提下补全缺失内容。早期方法依赖光流、特征传播与 Transformer 跨帧传递信息,新方法则利用视频扩散先验直接生成。镜面修复与普通修复的关键区别是:补全内容不是任意的,必须与可见场景形成语义和几何对应。
本文把镜面反射生成形式化为反射感知的视频修复任务:输入遮蔽镜区的视频、二值镜面掩码与文本提示,输出须保持非镜面区域不变。理解这一任务设定是读懂方法与指标的前提。
REPA 式表示对齐(关系蒸馏)
REPA(Representation Alignment for Generation)在训练扩散模型时,用轻量投影头把网络中间特征对齐到冻结基础模型(如 DINOv2)的特征,以注入语义先验、加速收敛。本文将其推广为关系对齐:不对齐特征本身,而是对齐由 token 对之间余弦相似度构成的关系矩阵,梯度只流经扩散表示,基础模型全程冻结。
SRD 直接继承该思想,把冻结 VideoMAEv2 的跨区域关系蒸馏进扩散特征;理解参考关系矩阵 $R^R_\tau$ 与扩散关系矩阵 $R^D_\tau$ 的构造,是理解什么内容该被反射这一监督信号的关键。
LoRA 低秩适配
LoRA 冻结预训练权重,只在每层旁学习低秩增量 $\Delta W = BA$(秩 $r \ll d$),以极少参数完成领域适配。本文对 14B 的 Wan2.1-VACE 主干应用 rank-32 LoRA,作用于注意力 q/k/v/o 投影与 FFN,所有预训练参数保持冻结,因此 4 张 A100 80GB 即可训练。
这解释了论文的训练可行性,也说明 SRD/GTA 的梯度只能通过 LoRA 和两个小投影头更新主干,属于参数高效微调范式;推理时辅助分支直接移除、零额外开销。
评估指标 PSNR/SSIM/LPIPS/FVD/Ewarp
PSNR 衡量像素级重建误差,SSIM 衡量结构相似性,LPIPS 用深度特征衡量感知差异,三者只在镜面掩码内计算;FVD 用 I3D 特征衡量生成视频与真实视频的分布距离(全帧、固定 10 帧 224×224 前缀);$E_{\mathrm{warp}}$ 用 RAFT-Large 光流对相邻帧做运动补偿后的光度误差,衡量镜区内时序一致性。
论文所有结论由这五个指标支撑,且镜区指标与全帧 FVD 可能给出相反结论(如 GTA 单独 FVD 最低 174.444 但镜区重建一般),理解各指标的计算范围才能正确解读实验表格。
仿射变换
仿射变换是线性矩阵与平移的组合,可表达缩放、旋转、剪切与平移,是平面镜反射几何的一阶近似。本文由局部时间窗上下文 $C_t$ 经回归器 $g_\eta$ 预测仿射矩阵 $A_t$(从恒等映射初始化),再在特征空间对源特征图做可微双线性 warp 得到 $\tilde{F}^G_t = \mathcal{W}(S_t, A_t)$。
GTA 的核心就是学习从可见场景到镜内反射的特征级仿射映射;Table 4 证明它全面优于水平翻转加残差修正的固定几何假设(PSNR 14.005 对 13.802),说明反射几何是场景相关的。
研究动机
现有视频扩散模型(VDM)虽能合成高保真视频,却没有专门建模场景与镜像之间的对应关系。作者用 Veo 3.1 做实验发现:画面本身视觉逼真,但镜中内容经常与可见场景不一致——出现错误的反射物体、与周围环境矛盾的空间排布,以及跨帧的时序不稳定(Figure 1 红框)。与普通视频修复不同,镜面内容并非任意:它必须由反射相关的场景内容唯一约束。现有图像级反射生成方法(MirrorFusion、MirrorVerse)逐帧独立处理,只适用于少量前景物体居中的简单场景,无法覆盖包含多物体、背景结构与相机运动的真实视频;通用视频修复方法(如 VACE)虽能保持整体结构,却仍会复制墙上的画框、在可见衣物位置不对应的地方凭空生成衣物反射,说明局部上下文加生成先验不足以推断场景到镜像的关系。
本文的目标是本文的目标是构建一个反射感知的视频修复框架:给定遮蔽镜面区域的视频 $V_m$、二值镜面掩码 $M$ 与文本提示 $T$,生成 $\hat{V} = G(V_m, M, T)$,在保持非镜面内容不变的同时,重建出与可见场景语义兼容、几何一致、帧间连贯的镜面反射。为此作者把问题分解为两个互补子问题:决定什么内容应该被反射(what-to-reflect,语义关联),以及反射内容应如何在镜内排布(how-to-arrange,几何变换);并分别为二者设计训练目标(SRD 与 GTA),同时把四个已有镜面数据集统一改造成可系统评测的反射重建基准。
与已有工作不同的是,本文的独特切入角度有四点。其一,首次把镜面反射生成显式分解为 what 与 how 两个正交子问题,而不是笼统交给生成先验;其二,借鉴 REPA 的表示对齐思想但目标不同——不是对齐特征以加速训练,而是从冻结视频基础模型(VideoMAEv2)蒸馏镜内-镜外 token 之间的相似度关系矩阵,把场景到镜像的语义关系注入扩散特征;其三,提出在特征空间学习由局部时间窗($K=5$)条件化的仿射变换,把可见区域特征搬运到镜内并与镜内特征对齐,比水平翻转等启发式更贴合真实反射几何;其四,将 VMD-D、ZOOM、MMD、DVMD-D 四个只服务检测/分割的数据集统一为反射重建基准(1,242 个片段),填补了该任务缺乏系统评测的空白。
核心方法
直觉上,镜中画面应是可见场景的语义相关加几何变换版本。MirrorWorld 以条件 VDM(Wan2.1-VACE-14B,LoRA 微调,主干冻结)为骨架:VAE 把目标视频编码为 $z_0$,加噪得 $z_s$,DiT 输出隐表示 $H_\theta$。训练时在扩散损失外并联两个辅助分支:SRD 用冻结的 VideoMAEv2-Base 提取参考特征 $F^R = E(V)$,令扩散特征 $F^D$ 在镜内-镜外 token 对上的余弦相似度关系矩阵逼近参考关系,解决该反射什么;GTA 用另一投影头得到几何特征 $F^G$,由 $K=5$ 帧时间窗上下文 $C_t$ 回归仿射变换 $A_t = g_\eta(C_t)$,把只含可见信息的源特征图 $S_t$ warp 后与镜内特征对齐,解决如何排布。总损失 $\mathcal{L} = \mathcal{L}_{\mathrm{diff}} + \lambda_{\mathrm{SRD}}\mathcal{L}_{\mathrm{SRD}} + \lambda_{\mathrm{GTA}}\mathcal{L}_{\mathrm{GTA}}$,权重 0.05 与 0.01;推理时辅助分支移除,零额外开销。
核心创新在于:不修改生成主干,而是以关系对齐的形式把镜面物理先验注入扩散特征。与 REPA/VideoREPA 对齐整体表示以提升训练效率或物理合理性不同,SRD 显式约束的是镜内 token 与镜外 token 之间的相似度结构——令扩散特征上的关系矩阵 $R^D_\tau(i,j)$ 逼近参考特征上的 $R^R_\tau(i,j)$——只惩罚关系结构而不强求特征数值一致,从而让模型学会哪些可见内容与镜区相关。GTA 则把反射等于翻转这一朴素假设推广为可学习的特征空间仿射变换:为防止变换器偷看答案,源图 $S_t$ 在镜内位置被替换为可见区域均值特征;变换由 $K=5$ 帧窗口预测并从恒等映射初始化,提供跨帧稳定的几何引导。消融证明二者缺一不可:仅 GTA 的 FVD 最低(174.444)但镜区重建一般,两者结合才把 PSNR 推到 14.005,正好对应 what 与 how 的互补分工。
方法步骤详情
第一步,构造基准与条件:把四个公开镜面数据集切成 10 至 49 帧的片段,共 1,242 段(45,373 帧),按源视频级划分 1,142 训练/100 测试;条件为遮蔽镜区的视频、掩码与统一文本提示,原始视频作监督。第二步,前向:VAE 编码得 $z_0$,加噪构造 $z_s$,冻结的 Wan2.1-VACE-14B 主干输出 $H_\theta$。第三步,SRD:参考特征 $F^R = E(V)$ 与扩散特征 $F^D$ 重采样到 token 网格,每个有效时间片随机采样至多 64 个镜内/镜外 token,按余弦相似度 $\mathrm{sim}(a,b)$ 计算关系矩阵 $R^R_\tau$、$R^D_\tau$,用 $L_1$ 损失对齐。第四步,GTA:$F^G$ 由独立投影头(256 维)得到,源图 $S_t$ 在镜内位置填可见均值以防偷看目标,经 $K=5$ 窗口平均得 $C_t$,回归恒等初始化的仿射 $A_t$,warp 后对镜内 token 取 $1 - \mathrm{sim}(\tilde{F}^G_t(q), F^G_t(q))$ 的平均。第五步,联合优化:AdamW、学习率 $10^{-4}$、batch 4、4 张 A100;推理 50 步、CFG 5.0。
技术新颖性
新颖性体现在四个层面。任务层面:首次把镜面反射生成从图像、单物体推进到视频、场景级,并给出统一的反射重建基准,此前镜面数据集只服务检测与分割。监督信号层面:以关系矩阵对齐而非特征回归来注入语义对应,梯度只流经扩散表示而基础模型冻结,是 REPA 思想在跨区域一致性问题上的新用法。几何建模层面:用时间条件化仿射变换在特征空间显式建模可见到反射的空间映射,Table 4 显示其全面优于可学习 Flip 变体(PSNR 14.005 对 13.802、FVD 184.868 对 189.707),说明反射几何是场景相关而非简单镜像翻转。系统层面:SRD 与 GTA 作用于同一扩散特征的不同 256 维投影头,语义与几何互补且互不干扰;辅助分支推理时零开销,可即插即用地增强任意 VDM。这种分解加对齐的思路有望推广到水面倒影、光滑地板反光、屏幕反射等其他跨区域一致性问题。
实验结果
主实验(Table 1,镜区内指标):MirrorWorld 取得 PSNR 14.005、SSIM 0.504、LPIPS 0.488、FVD 184.868,居首。相对最强基线 VACE(13.537/0.489/0.493/191.617),PSNR +0.468 dB、SSIM +0.015、FVD −6.75;图像方法差距悬殊:MirrorFusion 仅 PSNR 9.508、FVD 513.062,VideoPainter 11.282、229.558。光流误差 $E_{\mathrm{warp}}$(Table A):Ours 0.025 优于 VACE 0.026,远优于 VideoPainter 0.076 与图像方法(≥0.188)。消融(Table 2):仅 SRD 13.551/0.500/0.489/185.708,仅 GTA 13.542/0.495/0.490/174.444(FVD 最低),组合后重建最优,证明二者互补。其余消融:VideoMAEv2 全面优于 DINOv3;几何变换 14.005 全面优于 Flip 变体 13.802;$K=5$ 最优。定性上:去 SRD 出现错误内容(镜内两画框),去 GTA 只重建半截金属环。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频镜面反射重建(镜区内) | PSNR (dB) ↑ | 14.005 | VACE 13.537 / MirrorVerse 9.666 | 较 VACE +0.468 dB,较最佳图像方法 +4.339 dB |
| 视频镜面反射重建(镜区内) | SSIM ↑ | 0.504 | VACE 0.489 / MirrorVerse 0.312 | 较 VACE +0.015,较 MirrorVerse +0.192 |
| 视频镜面反射重建(镜区内) | LPIPS ↓ | 0.488 | VACE 0.493 / MirrorVerse 0.680 | 较 VACE −0.005,较 MirrorVerse −0.192 |
| 整体视频生成质量(全帧) | FVD ↓ | 184.868 | VACE 191.617 / MirrorFusion 513.062 | 较 VACE −6.749,较 MirrorFusion −328.194 |
| 镜区内时序一致性 | 光流 warp 误差 $E_{\mathrm{warp}}$ ↓ | 0.025 | VACE 0.026 / MirrorFusion 0.192 | 较 VACE −0.001,较 MirrorFusion −0.167 |
局限与改进
作者承认的局限:整个公式化假设反射相关内容至少部分可见。当镜子反射的是相机视野之外的内容时(Figure 5:镜中人站在相机背后),SRD 与 GTA 无法约束其身份与位形,模型只能依靠先验合成时间上连贯但内容不必然正确的反射;此外当前框架只在特征空间学习(仿射)变换,更复杂的反射几何尚未覆盖。我的补充观察:其一,测试集只有 100 个片段,且所有方法共用同一条任务级文本提示,提示敏感性未系统评估;其二,PSNR 绝对值仅 14 dB 左右,说明像素级重建仍然很困难,指标更多体现方法间的相对排序而非绝对质量;其三,仿射变换是平面反射的一阶近似,对曲面镜、倾斜镜、镜中镜可能不足;其四,方法绑定 Wan2.1-VACE-14B 底座,跨底座(如 CogVideoX、HunyuanVideo)的泛化未验证;其五,FVD 与镜区指标在不同设置下结论不一致(Top-N 采样 FVD 更低但重建更差),如何统一分布质量与反射正确性的评测仍值得研究。
独立分析的弱点
弱点一:本质是重建式学习,模型在给定场景下逼近数据集真值反射,遇到完全不可见内容时原理性失效(Figure 5);改进方向是引入深度、法线或多视角条件,甚至显式 3D 场景表示,把可推断范围从可见区域扩展到合理的不可见内容。弱点二:GTA 的仿射变换只能表达全局线性几何,真实反射包含透视缩放、遮挡与非线性畸变;可升级为逐 token 光流场、薄板样条或由深度引导的单应分解。弱点三:SRD 每片随机采样至多 64 对 token,关系监督较稀疏,且 Table C 显示换用 Top-N($N=16$)采样反而全面变差(PSNR 13.591 对 14.005),说明对齐目标对采样策略敏感;可探索稠密关系图或最优传输式对齐。弱点四:只评测不超过 49 帧的短片段、单条统一提示、固定 50 步推理,长视频一致性与推理效率未涉及;可引入分段变换传递或层级化时间上下文。弱点五:数据全部来自镜面检测/分割数据集的自然完整视频,缺乏强反光、暗镜面、镜中镜等困难样本,且 FVD 只用 10 帧 224×224 前缀计算,可能与主观感知脱节,建议补充人类偏好评测。
未来方向
作者明确提出:建模更复杂的反射几何(超越当前特征空间仿射变换)是首要方向。在此基础上可延伸:其一,把 SRD/GTA 迁移到水面倒影、光滑地板、黑屏反光等更多反射面一致性问题,形成通用的跨区域关系对齐框架;其二,结合深度、法线与相机位姿显式推导平面镜反射的单应约束,用于初始化或正则化学习到的变换,提升可解释性与数据效率;其三,将反射一致性作为偏好信号引入 RLHF 或偏好优化,直接优化物理正确性而非代理损失;其四,扩展基准:更长视频、更高分辨率、非平面镜与多人交互场景,并建立人类评测协议弥补 FVD 的不足;其五,研究窗口大小自适应或逐片段变换链,以支持 49 帧以上的长程一致反射;其六,与 VACE 类可控编辑框架结合,实现反射内容的可控编辑与合成数据生成(如为镜面检测/反射去除任务造数据)。
复现评估
复现条件较好但有门槛。数据:基准由四个公开数据集(VMD-D、ZOOM、MMD、DVMD-D)改造,切分规则清晰(源视频级划分防泄漏、每片段 10 至 49 帧、共 1,242 段/45,373 帧、1,142 训练/100 测试),重建成本低。代码与权重:论文给出项目主页 youjunzhao.github.io/MirrorWorld,正文未明确承诺开源,需关注主页更新。算力:训练用 4 张 A100 80GB、batch 4、rank-32 LoRA、14B 主干全冻结,属中等规模可负担微调;关键超参齐全($\lambda_{\mathrm{SRD}} = 0.05$、$\lambda_{\mathrm{GTA}} = 0.01$、$K=5$、64 token 采样、学习率 $10^{-4}$、推理 50 步、CFG 5.0、每帧限 399,360 像素、投影 256 维)。难点在于对齐各基线的统一微调协议、复现 FVD(I3D 加 StyleGAN-V 实现)与 $E_{\mathrm{warp}}$(RAFT-Large)的评测细节,以及基础模型特征重采样到 token 网格的插值细节。总体对有 VDM 微调经验的团队属中等难度。
论文图表
以 Veo 3.1 生成的三段视频(木椅、白色行李箱、水壶放在平面镜前)为例,红框标出镜中错误反射的物体与不合理的空间排布,说明最先进的商用 VDM 仍无法保证镜面内容与可见场景一致。
这是全文的问题动机来源:用具体失败案例直观展示 VDM 缺乏场景到镜像关系建模,并引出 what/how 两个子问题的划分。
失败案例:镜中反射的人位于相机视野之外(第 1、25、49 帧),模型生成的反射时间上连贯,但人物确切内容无法由可见场景推断,只能依赖先验合成。
明确指出方法的原理性边界——反射相关内容必须至少部分可见,是评价与改进该框架时必须记住的前提假设。
展示统一使用的任务级文本提示:镜区被自然补全,反射与周围一致、结构正确、细节真实、运动时序连贯;不含任何场景特定物体描述。
保证所有方法在完全相同的提示下比较,排除提示工程带来的不公平,是理解实验协议公平性的关键细节。
损失权重扫描曲线:固定 $\lambda_{\mathrm{GTA}}=0.01$ 扫 $\lambda_{\mathrm{SRD}}$、固定 $\lambda_{\mathrm{SRD}}=0.05$ 扫 $\lambda_{\mathrm{GTA}}$,两个辅助目标都在中间强度处取得最佳镜区重建;FVD 的最优点与镜区指标不同。
说明两个辅助损失均不可或缺且权重适中最佳,同时揭示 FVD 与镜区指标的评价错位现象。
基准统计图:视频分辨率分布跨度很大(从 320×568 到 3840×2160,最多 17,814 个视频来自某一子集),四个数据集 VMD-D、DVMD-D、MMD、ZOOM 各自贡献的视频数与帧数(合计 1,242 个片段、45,373 帧)。
展示基准的多样性与规模,评估结论的覆盖面,以及复现数据划分所需的统计依据。
补充定性对比(四个采样帧):可见墙面同时含给皂器与电源插座,VACE 只重建了给皂器而漏掉插座反射(红框),MirrorWorld 同时保留两者并跨帧维持空间关系。
进一步佐证 SRD 能把多个可见元素正确关联到镜区,弥补主文 Figure 3 案例数量的不足。
补充定性对比:图像方法生成不相关室内结构,VideoPainter 时间连贯但语义无关,VACE 镜区边缘附近的结构跨帧变化不一致(红框),MirrorWorld 保持更连贯的反射布局。
展示 VACE 在镜区边界处的时序不一致这一具体失效模式,与 $E_{\mathrm{warp}}$ 指标结论相互印证。
MirrorWorld 自身结果展示(四个采样帧):视角移动时浴室门洞与墙界在镜中保持稳定,镜中沙发与地毯的相对布局随视角正确变化。
说明方法在相机运动下依然维持场景到镜像的几何关系,体现 GTA 时间条件化变换的价值。
多边形、椭圆形等不规则镜面以及前景运动下的结果:生成内容能贴合任意镜面边界,房间结构跨帧保持,镜中人物的姿态与位置变化被正确跟随。
验证方法对镜面形状与动态主体的泛化能力,说明掩码驱动的框架不依赖特定镜面几何假设。
镜区内光流 warp 误差 $E_{\mathrm{warp}}$:Ours 0.025 < VACE 0.026 < VideoPainter 0.076 < MirrorVerse 0.188 < MirrorFusion 0.192;逐帧处理的图像方法时序最不稳定。
补充时序维度证据,说明 GTA 的局部时间窗确实带来跨帧稳定的几何引导;同时作者提醒低 warp 误差不等于反射正确。
token 共享消融:让 GTA 复用 SRD 采样的稀疏 token 子集得 13.773/0.504/0.484/196.814;GTA 使用全部 token(本文做法)14.005/0.504/0.488/184.868,PSNR 与 FVD 明显更好。
证明语义关系所需的稀疏 token 不足以支撑几何变换学习,两个分支应使用不同的 token 覆盖范围。
SRD 采样策略对比:Top-N(每镜内 token 选关系最强的 $N=16$ 个可见 token)13.591/0.494/0.491/173.294;随机采样(每区域至多 64 token,本文做法)14.005/0.504/0.488/184.868,重建指标全面更优。
说明覆盖更广的场景到镜像关系比只对齐最强关系更有利于重建复杂反射,指导关系对齐的采样设计。