← 返回 2026-07-27

ID-V2V:保持身份的视频重新风格化 ID-V2V: Identity-Preserving Video Restylization

Yuancheng Xu, Mingming He, Pablo Salamanca, Li Ma, Yash Kant, Emmett Steven, Paul Debevec, Ning Yu 📅 2026-07-24 👍 10 2026-08-01 18:30
ControlNet 人脸动画 扩散Transformer 视频到视频 视频生成 视频编辑 身份保持 重打光

把身份保持建模为视频重打光,用重打光人脸+法线+关键帧+深度联合控制,实现关键帧编辑的逐帧扩散传播。

前置知识

视频到视频生成 (Video-to-Video Generation)

给定一段源视频,由生成模型输出一段目标视频,通常通过 ControlNet 类的条件信号(深度、姿态、Canny 边缘、参考帧等)约束生成结果保持源视频的结构、运动与几何。本文以 VACE(基于 Wan2.1)作为多 ControlNet 骨干,把编辑关键帧、深度序列、重打光人脸与人脸法线四类信号融合注入 DiT 主干。

ID-V2V 的整个技术路线就是设计一类特殊的视频到视频生成:要严格保持身份与表演,又要把关键帧上的场景/光照/风格编辑灵活传播。理解视频到视频范式才能看懂多 ControlNet 设计。

视频重打光 (Video Relighting)

在保持人脸几何结构与肤色材质的前提下改变光照条件的任务。经典做法来自 Light Stage / One-Light-at-a-Time (OLAT) 捕获系统 [Debevec et al. 2000],对每个光源分别拍照后用 HDR 环境图合成任意光照。本文把「身份保持」重新表述为一个视频重打光子问题:人脸结构与表情保持不变,光照是唯一允许变化的属性。

这是全文最核心的洞察——把身份保持问题形式化为重打光问题,由此引出『训练时用重打光人脸作条件、推理时直接用源人脸像素』这一对称设计,绕开了成对训练数据稀缺的瓶颈。

关键帧编辑 (Edited Keyframe)

用户对源视频第一帧做修改得到的「目标外观」参考帧,可由艺术家手动绘制或用图像编辑模型(本文用 Gemini-2.5 提议 + Qwen-Image-Edit 执行)生成,可改变背景、光照、风格、添加视觉元素。模型负责把该关键帧上指定的视觉编辑沿时间维度传播到整段视频。

关键帧是整个任务的输入接口,决定了 ID-V2V 要『传播什么』;它是『编辑驱动合成』分支的核心条件信号,理解这一点才能区分两类控制信号的职责。

AdaFace / FACS Action Units / EMOCA 表征

AdaFace [Kim et al. 2022] 是基于质量自适应 margin 的人脸识别模型,输出身份嵌入用于衡量面部相似度;FACS Action Units [Ekman & Friesen 1978] 编码细粒度肌肉激活单元;EMOCA [Daněček et al. 2022] 是情绪感知的 3D 人脸重建模型,输出表情向量。三者分别度量『脸像不像』『肌肉动得对不对』『3D 表情参数是否一致』。

这是论文用来定量评估身份保持与表演保持的三类核心指标(AdaFace、Exp-AU、Exp-EMOCA)。看懂表 1 必须先理解这些指标的含义。

ControlNet / 多 ControlNet 融合

ControlNet [Zhang et al. 2023] 通过把条件信号送入一个与主网络共享结构、参数从主网络初始化的『控制分支』,再把分支输出加到主网络对应 block 上,实现可控生成。本文采用 VACE 的 context block 作为共享控制分支处理多类条件,输出在注入主 DiT 前做求和融合,只占用约 N/4 个共享 block,大幅降低计算开销。

ID-V2V 的架构创新就建立在『用同一套 VACE 控制参数同时处理重打光人脸、人脸法线、深度三类条件并求和融合』之上,理解 ControlNet 才能理解图 3 的架构。

研究动机

在影视与内容创作中『先捕获表演、后设计视觉』是核心工作流:演员在简单环境下表演,后期再决定背景、打光、风格。生成式视频模型理应支撑这条工作流——既能灵活生成视觉场景,又能严格保留身份与表演细节(表情、眼神、口型)。但现有方法各有硬伤:(1) 基于参考图的图到视频方法(ConsisID、EchoVideo、ID-Animator、Phantom)只用几张参考图注入身份,无法利用源视频时间信息,身份仅恢复到粗略外观。(2) 视频到视频方法(WanAnimate、AnimateAnyone、VACE、FantasyPortrait、SteadyDancer)用关键点或低维 embedding 驱动,捕获不到口型、微表情、眼神等高频线索,多人场景退化严重。(3) 通用风格化会改人脸本身。(4) 视频重打光方法(Light-X、Lumen、RelightVid)不支持关键帧编辑也不针对身份保持。更根本的是现实中几乎拿不到『同一角色同动作不同风格』的成对训练视频,导致该任务缺乏大规模配对监督数据。

本文的目标是作者把挑战形式化为一个新任务——身份保持的视频重新风格化 (identity-preserving video restylization):给定 (1) 一段含人物表演的源视频,(2) 一张对源视频首帧编辑后得到的关键帧(指定新背景/光照/视觉元素),目标是把关键帧上的视觉编辑沿时间传播到整段视频,同时严格保持角色的面部相似度与细粒度面部表演(表情、眼神、口型同步)。人物可能被重新打光以匹配编辑后的场景,但其身份与表演必须不变。在此之上,作者要 (i) 在缺乏配对数据的情况下仍能训练,(ii) 在单人场景大幅超越现有方法的身份/表演保持,(iii) 鲁棒支持多人场景且保持个体身份与面部互动——这正是当前方法最弱的能力。

与已有工作不同的是,本文的独特切入点是『原则性解耦』:把任务拆成『编辑驱动合成』与『基于源视频的身份保持』两半。关键观察是——在身份保持重新风格化下,面部结构与表情应保持不变,光照是唯一允许变化的属性。于是作者把身份保持形式化为视频重打光问题,把编辑传播实现为以关键帧为引导的条件式图到视频生成。这一解耦让训练对可以从『单个视频』中构造:用训练视频的人脸做目标(要被重打光成『电影光』的脸),用重打光成『普通光』的人脸与法线作为输入条件(模拟推理时源视频常见的普通光照),用首帧+深度序列承载场景编辑。于是无需任何稀有的成对重新风格化数据。这与依赖抽象 embedding、依赖稀缺成对数据、或仅支持文本/参数化光照控制的现有方法在本质上不同。

核心方法

ID-V2V 的直觉是『分工』:『什么该变』由编辑驱动合成负责(关键帧说什么就生成什么),『什么不该变』由身份保持负责(人脸贴死在源视频上)。技术上用两类互补控制信号实现:① 重打光人脸视频 + 人脸法线图 → 强约束面部相似度与表演;② 编辑首帧 + 深度序列(DepthAnything-V2 提取)→ 引导灵活、时空连贯的合成。骨干采用 VACE(基于 Wan2.1)的多 ControlNet 架构,重打光人脸、法线、深度三类控制共用同一套 VACE context block 参数(初始化自 VACE),输出做求和融合后注入主 DiT block;为省算力只让 $N/4$ 个 block 接共享控制分支(图 3)。训练规模 40k 段人物中心视频,分辨率 $1280\times720$、每段 81 帧,文本描述由 QwenVL2.5-32B 生成;用 SCRFD 检测人脸,每帧最多保留 5 张按像素面积排序的人脸以支持多人,丢弃超 40% 帧无人脸的视频。整个方法的最大亮点是训练数据构造——从单段训练视频同时派生出『条件』与『目标』,使成对监督免费可得。

核心创新是把『身份保持』重新定义为『视频重打光』。这一形式化带来三重好处:(1) 明确了不变量——面部结构与表情不变、光照可变,避免把身份与场景风格纠缠在一起;(2) 让身份信息直接来自源视频像素(推理时直接用源视频人脸像素,跳过任何抽象 embedding),从而保留口型、微表情、眼神等高频细节;(3) 把『重新风格化』的数据需求降维——只需构造『同一张脸在普通光 vs 电影光』的配对人脸图像,而这种配对可以用重打光模型从训练视频里自动生成。与现有方法的本质区别:以往方法要么只用参考图(无时间信息)、要么用关键点/embedding(损失高频表演)、要么做通用风格化(改人脸),ID-V2V 是首个把重打光当作身份保持控制信号、并把关键帧编辑与重打光人脸+法线+深度统一进单一视频到视频扩散框架的方法。

方法步骤详情

完整流程分四块。**重打光模型训练**:参考 LuxPostFacto 但目标改为『顶部半白半黑 HDRI 产生的规则顶部光』,匹配推理时源视频的普通光照;用 OLAT 数据(67 名参与者)合成配对,输入任意 HDR 环境图合成人脸、目标为顶部光重打光人脸,共产 ~330,000 图像对;以预训练 SVD 为基座、帧数降到 1 变图像模型、条件为 HDR 图,微调 200K 步。**训练数据构造**(图 2):逐帧 SCRFD 检测人脸,用重打光模型把人脸/头区域转成规则光得到重打光人脸视频;DAViD 预测人脸法线;DepthAnything-V2 提取全视频深度序列;首帧作编辑参考。**主模型训练**:在 VACE/Wan2.1 上扩成多 ControlNet,重打光人脸、法线、深度经同一 VACE context block 求和融合注入 DiT,关键帧按 VACE 格式替换控制视频首帧并附加文本 prompt,所有控制联合训练,规模 40k 视频、$1280\times720$、81 帧/段。**推理**:关键改动是直接用源视频原始人脸像素(跳过重打光)以避免身份损失;引导区域可从人脸扩展到全身甚至全场景实现零样本重打光(图 9),全局深度与训练一致以保持几何时序连贯。

技术新颖性

技术新颖性体现在四点:(i) 任务定义本身——首次明确把『身份保持的视频重新风格化』形式化为以编辑关键帧为输入的人中心创作任务,并强调真实创作流程中常见的多人互动场景。(ii) 解耦原则——把任务拆为编辑驱动合成(首帧+深度)与源视频锚定的身份保持(重打光人脸+法线),并用『身份=重打光』这一观察串起两端。(iii) 单视频自监督构造——通过把训练视频的人脸重打光成规则光、把原视频人脸当作目标,巧妙回避成对重新风格化数据的稀缺,这是方法能落地到 40k 段视频大规模训练的关键。(iv) 共享多 ControlNet 架构——三类控制共用一套 VACE 参数并求和融合、只让 $N/4$ 个 block 接控制分支,在保留多条件能力的同时把计算开销降到很低。此外还展示了未经全场景重打光训练就能推广到全身/全场景重打光的零样本能力(图 9)。

Training data construction: decomposing into synthesis and identity preservation.
Fig. 2: Training data construction: decomposing into synthesis and identity preservation.
ID-V2V architecture with shared multi-ControlNet.
Fig. 3: ID-V2V architecture with shared multi-ControlNet.
Relit face video produced by the image-based relighting model.
Fig. 6: Relit face video produced by the image-based relighting model.

实验结果

在 100 段单人 + 60 段双人评测集上对比 5 个基线。**身份保持**(表 1):单人 ID-V2V 的 AdaFace 达 0.701,远高于最强基线 WanAnimate 的 0.529(+0.172);Exp-AU 0.668 vs 0.600、Exp-EMOCA 0.899 vs 0.841。双人场景 ID-V2V 的 AdaFace 0.637、Exp-AU 0.709、Exp-EMOCA 0.901 全面领先,而依赖抽象 embedding 的 WanAnimate/FantasyPortrait 在双人下身份大幅下降(FantasyPortrait AdaFace 0.507→0.433)。**通用质量**:CLIP-T ≈0.344 与基线持平,VBench 主观/背景一致性、时序闪烁、VBench-2.0 人体解剖正确性均为最佳或并列(单人 Human Anatomy 0.993、时序 0.954),证明专项训练未损害整体生成。**用户研究**(26 人):单人在面部相似度/表演/质量胜率达 75.00%/74.32%/70.09%,双人为 85.62%/86.09%/81.05%,优势比 WanAnimate(~10-12%)高约 6 倍。**消融**:去掉重打光人脸使 AdaFace 0.701→0.574(最关键),去掉法线→0.676。**失败模式**(图 5):源视频处于极端打光(如强绿光)时残余光照线索在后续帧重现,造成色偏与时序不一致。

Quantitative and user-study results for identity-preserving video restylization.
Table 1: Quantitative and user-study results for identity-preserving video restylization.
Single-subject comparison across methods.
Fig. 4: Single-subject comparison across methods.
Two-subject comparison across methods.
Fig. 7: Two-subject comparison across methods.
More than two subjects handled by ID-V2V.
Fig. 8: More than two subjects handled by ID-V2V.
查看结构化数据
任务指标本文基线提升
单人身份保持视频重新风格化 AdaFace 身份相似度(越高越好) 0.701 WanAnimate 0.529;FantasyPortrait 0.507;VACE 0.465;SteadyDancer 0.479;AnimateAnyone 0.402 相对最强基线 WanAnimate 绝对 +0.172,相对提升约 32.5%
单人面部表演保持 Exp-EMOCA 表情向量相似度 0.899 WanAnimate 0.841;FantasyPortrait 0.767;VACE 0.776 绝对 +0.058 相对 WanAnimate;细粒度表情保持显著领先
双人身份保持视频重新风格化 AdaFace 身份相似度 0.637 VACE 0.401;WanAnimate 0.432;FantasyPortrait 0.433 绝对领先第二名约 +0.204,多人场景优势比单人更明显
用户研究-面部表演保持(单人) 胜率(%) 74.32% WanAnimate 11.36%;VACE 8.18%;FantasyPortrait 2.27% 用户偏好以 6.5 倍量级超过最强基线

局限与改进

作者承认两点:(1) 由于源深度序列提供场景结构与运动引导,源视频与编辑关键帧之间的几何差异过大会让该约束过于受限——中等背景改动可容忍,但场景布局或深度的极端差异会与源几何冲突、降低编辑保真度。作者建议用『深度 dropout』训练让模型在目标场景与源差异大时可选择性放弃深度引导。(2) 方法专为『规则光照下拍摄的源视频』设计,与训练条件及『先捕获后风格化』工作流一致;在极端/不规则打光(强彩色光、硬阴影)下,残余源光照线索会传播进生成视频,产生非预期色偏与时序不一致(图 5 绿光案例)。我额外观察到的局限:(a) 评测集规模偏小(100 单人 + 60 双人),且未报告置信区间/统计显著性,用户研究只覆盖各 20 个样本;(b) 推理时直接用源视频原始人脸像素的策略假设人脸区域可被干净分割,遮挡、大幅头部转动或非正面视角下可能退化;(c) 文中只展示了最多 5 张人脸/帧的设置,更多主体或人群镜头的极限行为未知;(d) 重打光模型基于 67 名 OLAT 参与者,跨人种/年龄的泛化虽用 40k 视频间接覆盖但缺乏直接评估。

独立分析的弱点

弱点一:对源视频光照条件敏感。失败模式(图 5)说明规则光照假设是硬约束;改进方向是训练时对源视频做光照数据增强(模拟彩色光、硬阴影),并把重打光模型升级成能处理任意极端光照的版本,让推理时的『源人脸像素』本身就已被归一化。弱点二:深度引导过于刚性。源与编辑关键帧几何差异大时会冲突;改进方向是引入训练时的深度 dropout(作者自己也提到),或用软深度 mask、几何对齐网络动态权衡深度引导强度。弱点三:人脸像素直接复用依赖精确分割。遮挡与极端姿态下退化;改进方向是把人脸区域检测换成时序一致的人脸分割/跟踪,并对遮挡区域用重打光人脸作为兜底信号。弱点四:评测规模与统计严谨性不足;改进方向是扩大评测集、报告多次随机种子下的均值与方差、增加统计显著性检验,并加入更多主体(>2)的定量评测。弱点五:每帧 81 帧、$1280\times720$ 的训练成本高、推理时延未报告;改进方向是用蒸馏或更低分辨率先验加速推理。

未来方向

作者明确指出的方向:(1) 训练时引入深度 dropout,让模型在源场景与目标差异巨大时可选择性放弃深度引导,扩大可编辑范围;(2) 拓展对极端/不规则源光照的鲁棒性,使其超越『先捕获后风格化』的规则光照假设。基于成果可延伸的方向:(3) 把『重打光=身份保持』的范式从人脸推广到全身——图 9 已展示全场景重打光的零样本能力,可专门训练一个全身/全场景重打光条件分支;(4) 把关键帧编辑接口升级为多关键帧或时间线编辑,处理长视频里场景渐变;(5) 与音频驱动的口型/表情模型结合,把 ID-V2V 作为表演保持层叠加唇形同步;(6) 探索把该框架迁移到 3D 一致的多人对话/交互场景生成;(7) 把重打光人脸控制信号与身份 embedding(ConsisID、EchoVideo 类)融合,做更轻量的实时推理版本。

复现评估

复现整体偏好但有门槛。**开源**:作者明确给出代码 https://github.com/Eyeline-Labs/ID-V2V,是重大利好。**数据**:训练用 40k 人物中心视频来源未公开;重打光模型依赖 LuxPostFacto 的 OLAT 数据(67 名参与者、~330k 对)属受限数据集,复现重打光模型较难;评测集(100 单人+60 双人)构造流程详尽——Gemini-2.5 提议背景/光照、Qwen-Image-Edit(带深度与 Canny)执行、人工筛选——但是否发布未说明。**依赖组件清晰**:骨干 VACE/Wan2.1、SCRFD、DAViD、DepthAnything-V2、QwenVL2.5-32B、Qwen-Image-Edit 均公开可获。**算力要求高**:$1280\times720$×81 帧×40k 视频 + 重打光微调 200K 步,个人/小团队复现完整训练成本巨大,但可基于开源代码做推理或小规模微调。**评测指标**(AdaFace、Exp-AU、Exp-EMOCA、CLIP-T/I、VBench/VBench-2.0)均来自公开模型,定量结果可被第三方复核。综合看方法与消融描述充分,但训练数据与 OLAT 数据可获得性是最大障碍,建议复现者先用发布的预训练权重做推理与定性复现。