InfinityEdit:用轻量点燃适配器实现无限视频编辑 InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter
冻结流式生成器,适配器在编辑到达时点火,无限轮指令编辑质量不衰减
前置知识
扩散 Transformer(DiT)
用 Transformer 替代 U-Net 作为扩散模型骨干的架构,通过时空注意力建模帧间运动,是 CogVideoX、Wan、HunyuanVideo 等开源视频生成基座的共同选择。它把视频的时空 token 序列输入多层自注意力块,在噪声水平 $\sigma$ 下逐步去噪生成视频潜码。
本文的适配器就是插在 DiT 每个 transformer 层之后的模块,理解层级隐藏状态 $H=[H_{hist};H_{cur}]$ 的组织方式是读懂架构图的前提。
流匹配(Flow Matching)
一种扩散生成训练范式:在干净数据 $z_0$ 与噪声 $\epsilon$ 之间做线性插值 $z_\sigma=(1-\sigma)z_0+\sigma\epsilon$,训练网络回归速度场 $v=\epsilon-z_0$,损失为 $\mathcal{L}=\mathbb{E}\, w(\sigma)\lVert v_\theta(z_\sigma,\sigma,c)-v\rVert_2^2$。相比 DDPM 路径更直、推理步数更少。
本文训练适配器用的就是流匹配目标(式 9),且噪声水平 $\sigma$ 的采样策略(高斯混合)是训练设计的关键一环。
自回归分块流式视频生成
长视频生成的主流范式:模型不一次生成整段视频,而是逐块(chunk)生成,把干净的历史帧窗口与噪声目标块拼接作为输入,只对目标块去噪,生成后追加进历史继续下一块。Helios 进一步把历史压缩成多尺度层级记忆并维护单个锚帧 $x_0$ 以稳定长程外观。
本文整个任务定义建立在分块自生成之上:编辑指令在块边界到达,点火块生成后靠历史条件继承编辑。
零初始化残差适配器
参数高效微调技巧:在冻结骨干的层间插入小模块,其输出投影权重初始化为零,使模块初始时是恒等映射、完全不改变基座行为;训练中编辑能力以残差形式 $H\leftarrow H+\mathrm{Attn}(H,\cdot)$ 逐步学出,避免破坏预训练先验。
本文适配器的三个注意力阶段全部零初始化并配 AdaLN 调制 $m_\sigma(\cdot)=(1+s_\sigma)\odot(\cdot)+b_\sigma$,这是'冻结骨干加轻量控制'思路能成立的技术保证。
曝光偏差与历史腐蚀
自回归扩散模型训练时条件于干净真实历史,推理时却条件于自己生成的不完美历史,这种训练-推理不一致即曝光偏差,会导致误差逐步累积。缓解办法是在训练时以概率把历史帧替换为加噪版本 $\tilde{x}=\sigma_c\epsilon+(1-\sigma_c)x$,让模型见过并容忍带噪历史。
无限编辑任务中每段输出都是下一段的条件,误差传播风险更高,本文训练全程使用历史腐蚀(独立作用于长/中/短三个历史尺度)来保证多轮稳定性。
因果注意力与时间 RoPE
因果注意力在注意力矩阵上加掩码 $M_{t,t'}=0\,(t'\le t)$、$-\infty\,(t'>t)$,只允许信息从较早时间步流向较晚时间步;RoPE 是旋转位置编码,通过旋转查询/键向量注入相对位置信息。两者结合即可让一维时间序列上的自注意力符合自回归方向。
本文适配器的第二阶段 Temporal Causal Self-Attention 用因果掩码加独立的时间 RoPE,保证时间线索只向前传播,与流式生成的自回归顺序对齐。
研究动机
现有指令式视频编辑方法(InsViE、Ditto、OpenVE、Kiwi-Edit、RefVFX、Video-As-Prompt 等)都建立在“就地编辑”(in-place editing)假设上:输入源片段 $V_{src}\in\mathbb{R}^{T\times C\times H\times W}$,输出与源片段时长相同、逐帧对齐同一时间区间的结果,本质是对一段有限素材的重写。这对开放式视频流完全失效——例如给直播游戏画面持续换画风、对进行中的镜头追加运镜时,新帧不断到来,编辑必须延伸到尚未出现的未来帧,而不是对固定片段做一次变换。一种朴素做法是直接复用流式生成器(Helios、LongLive、Anchor Forcing 等)在边界处切换提示词,但这类模型依赖锚帧和多尺度历史缓存来维持长视频稳定,这些机制在换指令后反而会把后续生成拉回未编辑内容,导致编辑被削弱甚至完全忽略;而流式生成器本身也未训练过执行指定关系型编辑。因此既缺任务定义、缺合适数据,也没有现成模型能胜任。
本文的目标是论文正式定义并求解“无限视频编辑”任务:给定前段 $V_{pcd}\in\mathbb{R}^{T_1\times C\times H\times W}$ 与编辑指令 $c_{edit}$,模型需生成时间上紧随其后、同时执行编辑的下一段 $V_{tgt}=G(V_{pcd},\,c_{edit})$,$T_1$ 不必等于 $T_2$,目标帧与输入帧没有任何逐帧对应;整个过程随指令序列 $\{c_{edit}^{(i)}\}_{i\ge1}$ 无限重复,即 $V^{(i)}=G(V^{(i-1)}[-T_1:],\,c_{edit}^{(i)})$,每一段都成为下一段的条件历史。目标包含三层要求:一是编辑对齐,结果忠实实现指令意图;二是忠实延续,未被编辑触碰的实体、运动和镜头语义要与输入保持一致(风格迁移保运动、运镜编辑保主体);三是重复编辑下的稳定性,生成误差不能随轮次累积导致质量崩塌。后两点是该任务区别于就地编辑的本质难点,也是论文要同时解决的核心问题。
与已有工作不同的是,本文的独特切入是“冻结先验 + 点火式适配器”:不微调 14B 流式生成器 Helios 本体(全量微调成本高且会扰动其长视频稳定性先验),也不满足于纯提示词切换(编辑指令缺少进入中间特征的显式通路,且锚帧与缓存会把生成拽回未编辑内容),而是冻结全部基座权重,只训练插入各 transformer 层后的轻量“编辑点燃适配器”。推理时采用“点燃-延续”策略:适配器只在编辑指令到达的那个块上激活一次完成点火,之后冻结骨干凭历史条件自然把编辑后的内容向前携带。此外,由于目标段位于输入之后、与源无逐帧对应,OpenVE 等现有基准及帧级对应指标全部失效,作者据此自建了 (source, edit, target) 三元组数据合成管线和分布外序列编辑基准,从任务定义、数据构建到模型设计形成完整闭环,这是与既有工作最根本的差异。
核心方法
直觉上,本文把一次编辑视为流上的“点火”事件而非逐帧重写。技术上以 Helios-Distilled(14B 自回归视频扩散 Transformer)为骨干并全部冻结,在每层后插入轻量适配器块,对当前块 token $H_{cur}$(层级隐藏状态 $H=[H_{hist};H_{cur}]$)做三阶段精炼:历史交叉注意力让块内前 $L_a$ 帧查询历史 token 完成锚定;时间因果自注意力(带时间 RoPE 与因果掩码)沿时间轴向前传播线索;编辑交叉注意力把指令 $c_{edit}$ 注入所有去噪 token。各阶段输出经 AdaLN 调制 $m_\sigma(\cdot)=(1+s_\sigma)\odot(\cdot)+b_\sigma$ 以残差形式加回,输出投影零初始化,适配器初始为恒等映射,编辑作为对冻结先验的残差更新被逐步学出。训练用流匹配目标,配合历史腐蚀、混合高斯 $\sigma$ 采样与两阶段课程;推理采用“点燃-延续”策略:适配器只在编辑到达的首块激活一次,之后冻结骨干凭历史条件继承编辑,配合滑动历史窗口与锚帧重置实现有界内存下的无限轮编辑。
核心创新是“点燃-延续”机制与残差式适配器的结合,与已有方法的本质区别有三层。第一,任务层面:以往编辑输出与源片段同窗口逐帧对齐,本文要求输出是时间后继段,模型必须“生成延续”而非“重写已有帧”。第二,架构层面:全量微调会扰动骨干先验、纯提示词条件缺乏进入中间特征的通路,本文冻结全部基座权重,仅以零初始化残差注意力模块叠加编辑控制,既保住 Helios 的长视频稳定性(层级多尺度历史记忆、少步蒸馏),又给指令一条直达去噪过程的路径,且查询被限制在前 $L_a$ 帧上以控制开销。第三,推理层面:适配器只在编辑到达的首块激活一次完成点火,后续块由冻结骨干以金字塔调度继续生成,编辑凭借已进入历史窗口的点火块被自然继承;同时把锚帧 $x_0$ 重置为点火块首帧、场景提示替换为 $c_{edit}$,防止生成回退到未编辑内容。滑动窗口保证内存恒定,移动锚帧提供当前编辑的稳定参考,二者加上腐蚀训练共同支撑无限编辑序列。
方法步骤详情
流程分数据、训练、推理三步。数据:从 UltraVideo 采样源视频并按主体实体分组,用 Gemini 3 Flash 把 VAP 基础编辑类型扩写成具体指令 $c_{edit}$;取源末帧为连接帧 $X_{con}=V_{pcd}[-1]$,外观/风格类编辑先用 Qwen-Image-Edit-2511 改写连接帧再作首帧,运镜类直接保留原帧,然后用 Wan2.2-I2V-A14B 图生视频合成目标段 $V_{tgt}$;统一缩放到 Helios 训练分辨率并裁帧使 $T_1/T_2$ 匹配骨干窗长;由 20 名标注者按对齐、一致性、合理性、视觉质量四项 1–4 分过滤。训练:以流匹配损失 $\mathcal{L}=\mathbb{E}\,w(\sigma)\lVert v_\theta(z_\sigma,\sigma,c)-v\rVert_2^2$($z_\sigma=(1-\sigma)z_0+\sigma\epsilon$,$v=\epsilon-z_0$)只训适配器;以概率 $p_{corrupt}$ 对长/中/短三个历史尺度独立加噪模拟不完美历史;$\sigma$ 用 $N$ 分量高斯混合 $\sum_k\pi_k\mathcal{N}(\mu_k,\delta_k^2)$ 采样,中心对齐推理时的离散去噪步(含 $\mu_N\approx0$);两阶段课程先均匀覆盖($\pi_k=1/N$、$\omega_t=1$)再偏向中低 $\sigma$ 并让帧权重 $\omega_t$ 随帧序增大。推理:点火块用单阶段 Euler 调度并附加近零 $\sigma$ 步细化细节,后续块切回骨干金字塔调度;每块生成后滑窗保留最近历史,锚帧 $x_0$ 每次点火后重置为该块首帧。
技术新颖性
技术新颖性体现在四点。其一,零初始化残差 + 选择性激活:适配器初始为恒等映射且仅在点火块前向生效,使编辑能力以最小代价嫁接到冻结生成器上,是参数高效微调在流式编辑场景的新用法。其二,噪声水平采样设计:骨干原生的金字塔去噪把 $\sigma$ 范围与分辨率阶段耦合,而编辑所需的变化可能落在视点、布局、外观或细节任一尺度,作者改用单阶段固定步 Euler 调度并以高斯混合 $\sigma\sim\sum_k\pi_k\mathcal{N}(\mu_k,\delta_k^2)$ 把训练分布对齐到推理离散步,属于细致的训练-推理分布对齐设计。其三,历史腐蚀与锚帧机制本身并非首创(分别借鉴相关去偏与长视频稳定工作),但把“点燃-延续 + 移动锚帧 + 滑动有界记忆”组合成可无限重复的编辑闭环是新贡献。其四,数据管线的编辑类型感知连接帧处理(外观类改写、运镜类保留)直击“跨边界一致性”这一任务特有难题,配合四维人工过滤保证三元组质量。
实验结果
在自建的 OOD 序列编辑基准(200 个 UltraVideo 源视频、每样本 3 条场景接地指令、4 大类 15 种编辑、每段 4 块共 12 块)上全面领先。VBench 指标(表1):Camera Motion 0.7654 最高,超第二名 SANA-Streaming(0.5432)约 +0.22;Temporal Flickering 在累积风险最大的第三轮测得 0.9660 全场最高(Helios-Base 0.9641、SANA 0.9631);Motion Smoothness 0.9833 接近最佳(Helios-Base 0.9869)。VLM-as-Judge(Gemini-3.5-Flash,1–5 分,表2):编辑忠实度 3.828、视觉质量 3.765、身份保持 3.815、跨编辑连贯性 3.840 四项全部第一;对照组暴露基线失败模式:纯骨干忠实度仅 2.637,in-place 类连贯性差(Lucy-Edit 2.560,逐轮重写破坏连续性),prompt-switching 类保持分低于 2.0(Anchor-Forcing 1.830、Infinity-RoPE 1.865),因缺少源视频接地。表3 分轮忠实度:本文 3.860/3.805/3.820,std=0.023 最低;Anchor-Forcing 与 Infinity-RoPE std 达 0.715/0.694,首轮仅 1.530/1.655。图4 显示基线美学质量在二三轮下降 0.02–0.04,本文 $\Delta\approx0$。图7 中序列超 1000 帧仍稳定跟随指令,Ladudu 风格在后续运镜编辑下持续保留。图5/6 定性显示 zoom-out 后山峰占比正确缩小、风格切换处背景连续。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 无限序列视频编辑(200样本×3轮,运镜类编辑) | Camera Motion(VBench + CoTracker2 点跟踪) | 0.7654 | Helios-Base 0.5494;最佳基线 SANA-Streaming 0.5432 | +0.222(相对最佳基线) |
| 无限序列视频编辑(第三轮编辑后测稳定性) | Temporal Flickering | 0.9660 | Helios-Base 0.9641;SANA-Streaming 0.9631 | +0.0019,全场最高,证明累积编辑后时间一致性不崩 |
| 无限序列视频编辑 | Motion Smoothness(AMT 插值误差) | 0.9833 | Helios-Base 0.9869(最佳);SANA-Streaming 0.9858 | −0.0036,接近最佳且远超其余基线 |
| 无限序列视频编辑(VLM-as-Judge,Gemini-3.5-Flash) | Edit Faithfulness(1–5 分) | 3.828 | 最佳基线 SANA-Streaming 3.303;纯骨干 2.637 | +0.525(相对最佳基线) |
| 无限序列视频编辑(VLM-as-Judge) | Scene Identity Preservation(1–5 分) | 3.815 | SANA-Streaming 3.060;prompt-switching 类 1.830/1.865 | +0.755(相对最佳基线) |
| 无限序列视频编辑(VLM-as-Judge) | Cross-Edit Coherence(1–5 分) | 3.840 | Anchor-Forcing 3.480;Lucy-Edit 2.560 | +0.360(相对最佳基线) |
| 跨 3 轮编辑的忠实度稳定性 | 分轮 Edit Faithfulness 标准差(越低越好) | 0.023(3.860/3.805/3.820) | SANA-Streaming 0.039;Anchor-Forcing 0.715;Infinity-RoPE 0.694 | 唯一兼顾高位与稳定的方法 |
局限与改进
作者承认两点局限:目前只支持自然语言指令,难以言传的目标外观(如特定角色形象)无法精确表达,需要引入图像/视频参考;编辑边界处指令切换的过渡仍可能生硬。我的补充观察:其一,评测指令由 Gemini-3-Flash 生成、评审由 Gemini-3.5-Flash 完成、训练指令也由 Gemini 扩写,同一 VLM 家族既造数据又当裁判可能引入系统性偏好;其二,生成分辨率仅 384×640、16 fps,高分辨率下的细节与稳定性未验证;其三,prompt-switching 基线不接收源视频(表中以 † 标注),与源条件方法同台比较的公平性存疑,虽有说明但读者需谨慎解读;其四,方法深度绑定 Helios 的层级历史记忆、锚帧与金字塔调度等内部接口,能否迁移到 CogVideoX、Wan 等其他骨干完全未验证;其五,训练需要 32 张 NVIDIA H20 且数据过滤依赖 20 人人工四维打分,规模化和复现门槛都高;其六,点火块每次编辑都需完整多步去噪,编辑指令非常密集时延迟开销未见量化。
独立分析的弱点
独立分析几点弱点。第一,点火块计算开销:每次编辑都需在适配器启用下以单阶段 Euler 调度走完整去噪并附加近零 $\sigma$ 步,编辑频繁时首块延迟显著高于纯骨干续写,改进方向是把少步蒸馏延伸到点火路径或复用缓存减少点火步数。第二,锚帧重置是全局操作:重置为点火块首帧后,若编辑只涉及局部实体,全局锚可能把未编辑区域的缓慢漂移也一并固化,长序列中未编辑内容的外观一致性缺少显式保障,可考虑区域化锚帧或多锚机制。第三,编辑边界过渡生硬:指令切换是阶跃式的,跨边界连贯只靠历史条件软约束,可引入过渡块专用调度或新旧指令插值。第四,文本指令表达力有限,泛化依赖训练数据见过的编辑类型分布,对分布外编辑类型(基准只测了 15 种中的 OOD 视频、编辑类型仍在集合内)可能失效,应加入参考图/视频条件。第五,单骨干绑定:适配器假设骨干暴露逐层隐藏状态、多尺度历史与锚帧接口,通用性受限,可设计更骨干无关的注入方式。第六,评测偏差:可用人工盲评与多个第三方开源 VLM 交叉评审来校验 Gemini 评审的结论。
未来方向
作者明确提出两个方向:一是把图像或视频示例作为参考条件引入编辑指令,让难以用文字描述的目标外观(尤其特定形象类编辑)变得可控;二是改进编辑边界过渡,使连续指令间的切换更平滑、减少阶跃感。在此基础上可自然延伸:把点燃-延续范式移植到 Wan、CogVideoX 等其他流式骨干验证通用性;发展交互式编辑,允许用户在流式生成过程中随时修改、撤销或回滚已应用的编辑;研究编辑序列的长期记忆机制,使超过 1000 帧后早期引入的属性仍可召回或按需更新;构建社区公认的无限编辑基准,用人工评测与多种 VLM 交叉评审降低单一裁判偏差;把点火机制与步数蒸馏结合进一步压缩编辑到达时的首块延迟,逼近直播级实时编辑;以及探索指令间的组合与冲突消解(多条指令同时生效时的优先级)。
复现评估
论文提供了项目页与 GitHub 仓库(yunzetong.github.io/InfinityEdit,github.com/YunzeTong/InfinityEdit),但正文未确认 14B 的 Helios-Distilled 骨干是否开放权重,这是复现的最大变数。数据方面依赖开放的 UltraVideo 数据集加多个生成模型:Wan2.2-I2V-A14B、Qwen-Image-Edit-2511、Gemini 3 Flash(闭源 API),三元组合成与两阶段训练在 32 张 NVIDIA H20 上完成,默认输出 384×640、16 fps;评测基准的 200 个源视频与指令生成流程理论上可重建,但包含 20 名标注者的人工四维(1–4 分)打分过滤,难以完全自动化复刻。综合评估:即便代码与骨干开源,完整复现仍需 14B 级模型、32 卡级算力和一条含闭源 API 的数据管线,属于高难度复现;对多数研究者更现实的路径是在开源骨干上按论文描述复刻三注意力适配器做小规模验证。
论文图表