JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
16B自回归扩散模型实现单卡B200上30FPS实时720p流式视频编辑
前置知识
自回归扩散生成 (Autoregressive Diffusion)
将扩散模型与自回归序列生成结合的范式:把长视频沿时间轴切成若干固定大小的 chunk,每个 chunk 内部做完整的(双向)扩散去噪,而不同 chunk 之间按因果顺序逐块生成,即当前 chunk 只能看见自己和过去的 chunk,看不到未来。本文用每个 chunk 一个 latent frame 的设定,注意力为「块内双向、块间因果」,并以滑动窗口+首个 chunk 作为全局 sink 来约束历史状态。
本文的核心架构就是因果化的自回归扩散,理解「块内双向、块间因果」以及 train–inference mismatch(训练用干净历史、推理用模型自己生成的有损历史)是读懂 SA-DMD 与 LHAD 两项蒸馏创新的前提。
Distribution Matching Distillation (DMD / 分布匹配蒸馏)
DMD 把多步迭代的扩散采样蒸馏成少步生成器,由三部分组成:可训练的因果生成器 $G_\theta$、可训练的 fake-score 模型 $F_\psi$、冻结的 real-score 教师 $R_\phi$。它通过 reverse-KL 散度的 mode-seeking 形式,用 real-score 与 fake-score 之间的差异把学生拉向教师分布。本文采用共享骨干的 LoRA 配置,三者从上一阶段权重初始化,最终把去噪压到两步。
SA-DMD 是在标准 DMD 基础上做的关键改造,若不理解 DMD 的「real/fake score 差异驱动学生更新」机制,就无法理解作者为何要在教师侧沿文本和源保真两个独立轴施加 CFG。
Classifier-Free Guidance (CFG / 无分类器引导)
CFG 是扩散模型推理时常用的条件增强技巧:同时计算条件预测 $v^{cond}$ 与无条件预测 $v^{uncond}$(把条件置空),用差分放大条件信号。本文把它推广到多轴形式 $v_{g_\phi}=v_\phi^{cond}+w_{txt}(v_\phi^{cond}-v_\phi^{-txt})+w_{src}(v_\phi^{cond}-v_\phi^{-src})$,其中 $v^{-src}$ 丢弃对齐的源 latent、$v^{-txt}$ 丢弃文本指令。
SA-DMD 的源锚定正是通过对 real-score 教师施加沿源保真轴的 CFG 来实现的;理解多轴 CFG 才能明白作者为何能把源保真控制蒸馏进单分支部署模型。
因果视频 VAE 与 KV-Cache 流式部署
因果视频 VAE 把源视频编码为 latent 序列,时空压缩比为 $8\times24\times24$(时间压缩因子 8、空间压缩因子 $24\times24$),即每个 latent frame 代表 8 个视频帧,并采用 (1+8) 帧的伪编码形式提供单张上下文帧。部署时把每个 chunk 的干净 key-value 状态缓存,保留首个 chunk 作 global sink 加一段滑动窗口历史,从而把 KV-cache 与每块算力与流长度解耦。
实时 30FPS 的实现依赖有界历史的 KV 复用,结合 FP8 量化、算子融合、计算图编译;不理解这部分就难以解释为何 16B 大模型能在单卡 B200 上做 720p 实时编辑。
Resampling Forcing / 自强迫训练
为缓解「训练喂干净历史、推理吃自己有损预测」的分布失配,Resampling Forcing 在因果扩散训练中用「单步去噪 rollout 重新生成、并从梯度中 detach」的历史替代干净历史,使训练分布更接近部署时的历史分布。Self Forcing 则显式展开模型自回归轨迹,但串行展开成本高、依赖少步生成器与截断梯度,难以扩展到大骨干。
本文先用 clean-history teacher forcing 再切到 Resampling Forcing 做因果适配;LHAD 则进一步针对「短 rollout 看不到长程累积误差」这一被 Resampling Forcing 忽略的问题做分段长程优化,是读懂方法演进链条的关键。
研究动机
现有的高质量视频编辑器几乎都面向离线、固定长度的片段:它们利用双向或全局时序交互处理整段视频,需迭代去噪完成才输出结果。这种「依赖未来帧」的设计无法做因果输出,难以满足直播、视频通信、实时内容创作等场景——编辑帧必须随源视频到达而即时产生。更深层的问题是,把离线编辑器逐段独立套用并不令人满意:它会反复处理重叠上下文,并在片段边界引入可见的不连续。即使简单地把模型「因果化」也解决不了根本困难:训练时自回归模型通常条件于干净的目标历史,而推理时却消费自己不完美的预测,这种 train–inference mismatch 会让重建误差、颜色偏差、外观漂移在生成历史中传播并累积成长程漂移。视频编辑尤其棘手,因为每个输出块既要与时序对齐的当前源块保持保真,又要在目标身份、几何、运动、背景上保持一致,还要稳定地施加所要求的变换;而实时吞吐所需的少步生成又额外拉开了迭代、带 CFG 的训练目标与部署时的单分支模型之间的差距。
本文的目标是本文要打造一个面向实时、开放式(无预定义时长、看不到未来帧)流式视频编辑的统一系统 JoyAI-Video-Edit,它是一个 16B 参数的自回归扩散框架。具体目标是:在因果生成的前提下同时实现低响应延迟、有界的计算与显存、以及对未知时长流的稳定编辑质量;要让编辑后的每一块既忠实于源块(保留未编辑的身份/几何/运动/背景),又长期时序一致;并在单张 Nvidia B200 GPU 上完成端到端 720p 视频编辑、达到约 30 FPS。为支持对「持续流」下的系统化评测,作者还专门构建了 LongV2VBench 这一分钟级长视频编辑基准,覆盖背景替换、全局风格、局部增删改五类任务共 229 项。
与已有工作不同的是,已有工作各自只解决一部分且互不相容。离线编辑器质量高但依赖未来帧;SANA-Streaming、LiveEdit、XMax-X2.0、StreamDiffusionV2 等流式方法为实时性往往牺牲容量,长流上的一致性与指令遵循仍未解决。长视频生成侧,Diffusion/Self/Resampling Forcing 处理因果与 train–inference mismatch,但 Self Forcing 串行展开难扩展到大骨干和长 horizon,Resampling Forcing 在短轨迹上优化、低估反复复用历史后才涌现的累积误差;DMD/Causal Forcing 做少步蒸馏却未触及流式编辑中「源块、生成历史、当前块」三者平衡。本文的独特切入点是把因果适配、源保真的少步蒸馏、显式的长程抗漂移优化三者整合进统一框架:用块内双向+块间因果注意力+滑动窗口/全局 sink 约束历史,用 SA-DMD 把源保真 CFG 只施加于蒸馏目标并吸收进生成器,用 LHAD 做分段长 rollout 优化直接监督受累积误差影响的深层状态。
核心方法
JoyAI-Video-Edit 是统一的 16B 自回归扩散视频编辑模型,由三部分组成:基于 MLLM 的条件编码器(处理源视频首帧+编辑指令,输出条件 token)、因果视频 VAE(时空压缩比 $8\times24\times24$,每 latent frame 代表 8 帧,把源视频与可选参考图编码进同一 latent 空间)、多模态扩散 Transformer(MM-DiT)联合建模条件与视觉 latent token 后解码;同时支持 V2V 与 IV2V 编辑。训练走「基础→因果适配→少步蒸馏→长程优化」四阶段(规模见 Table 1):先 256/512 渐进式 T2I 预训练(约 5.1B 样本)→渐进 T2V→I2I 图像编辑→双向 V2V/IV2V SFT+CT。给定源 $x_s$、条件 $c$、参考 $z_r$、目标 $x_t$,对噪声级 $\sigma\in[0,1]$ 与高斯噪声 $\epsilon$ 构造 $z_\sigma=(1-\sigma)z_0+\sigma\epsilon$、$v^\star=\epsilon-z_0$,双向编辑器以 $L_{V2V}=E\|v_\theta^{bi}(z_\sigma,\sigma;c,z_s,z_r)-v^\star\|_2^2$ 训练,为后续因果适配提供高质量初始化。
核心创新是用统一框架同时解决三个互不相干的难题,且彼此高度互补。其一,块级因果适配:块内双向、块间因果,活动块只看当前+过去;滑动窗口(固定近期块)+ 首块 global sink 把注意力上下文与流长度解耦,并用 Resampling Forcing 把干净历史换成 detach 的模型生成估计缓解 train–test 失配。其二,Source-Anchored DMD(SA-DMD):标准 DMD 在长 rollout 中让生成器越来越依赖有损历史,误差复合成源漂移;SA-DMD 对 real-score 教师沿文本轴与源保真轴独立做 CFG $v_{g_\phi}=v_\phi^{cond}+w_{txt}(v_\phi^{cond}-v_\phi^{-txt})+w_{src}(v_\phi^{cond}-v_\phi^{-src})$,使教师成「源锐化后验」,关键是源锚定只施加于蒸馏目标并吸收进生成器,部署时单条件前向即保源保真。其三,LHAD:把 m-块 rollout 切成更短 clip,逐 clip 反向、清图、跨 clip 累加梯度,在有限显存内反映整段 horizon 梯度。
方法步骤详情
四阶段流程(规模见 Table 1)。A 基础训练:T2I 预训练(256/512,LR $1\times10^{-4}$)→T2V 渐进(256p→360p→480p)→I2I 图像编辑 SFT→双向 V2V/IV2V SFT+CT。B 块级因果适配:把视频对切成对齐固定大小源/目标块(每块一 latent frame),训练时把噪声活动块与源 $S_t$、条件 $C_t$、可选参考 $R$、干净历史 $H_{<t}$ 打包,用掩码控制可见性(块内双向看源/条件、因果看窗口历史与 global sink、未来块掩码、R 全局可见),按 Diffusion Forcing 给每块独立噪声级、用掩码 flow-matching;先干净历史 teacher forcing,再 Resampling Forcing 换 detach 的单步去噪估计。C SA-DMD:共享骨干 LoRA 初始化 $G_\theta/F_\psi/R_\phi$,对 real-score 做双轴 CFG 得 $v_{g_\phi}$,扰动到 $\sigma$ 转干净预测,生成器最小化两预测归一化差异,fake-score 在 detach 样本上做 flow-matching 回归。D LHAD:m-块 rollout 分段,逐 clip 反向清图累加梯度;源视频不够长用动态镜像循环扩展。部署:流切成 8 帧块,FP8+算子融合+图编译,每块 VAE 编码→两步 DiT 去噪→立即解码,缓存首块 global sink+滑动窗口历史。
技术新颖性
新颖性体现在三处本质区别与一个系统级整合。区别于 Self Forcing(串行展开、依赖少步生成器与截断梯度,难扩展到大骨干和长 horizon),本文用 Resampling Forcing 做基础因果适配,再独立引入 LHAD 用分段反向在有限显存内做长 rollout 优化,可扩展到 16B 与分钟级流。区别于标准 DMD/Causal Forcing 只做少步蒸馏而忽视源保真,SA-DMD 首次把「源锚定」这一流式编辑独有的需求,通过多轴 CFG 限定在蒸馏目标上并蒸馏进单分支生成器——这是部署时无需多分支即可同时保持编辑一致性与源保真的关键。区别于 LiveEdit(用 mask cache 复用算力)、SANA-Streaming 等为实时性牺牲容量,本文保留 16B 容量,靠两步蒸馏+有界 KV-cache+FP8/算子融合/图编译达到 30FPS。系统级整合上,块级因果适配、SA-DMD、LHAD 三者统一解决因果生成、源漂移、少步加速、长程稳定,并通过 LongV2VBench 填补了「分钟级持续流编辑评测」的空白(229 项任务、五类编辑、含全流水线吞吐)。
实验结果
核心结论:流式编辑大幅领先并逼近强离线系统。短视频 OpenVE-Bench(Gemini 1-5 分):本文总体 3.60,比 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)、StreamDiffusionV2(1.23) 分别高 0.98/1.60/1.73/2.37,五类中四类流式第一,local change 4.47 与 local removal 4.06 均为全场最高;总体与 Bernini-R(3.72)、Kling-3.0 Omni(3.64) 相当。长视频 LongV2VBench(1 分钟/229 项):本文总体 3.30、五类全第一,超最强基线 XMax-X2.0(1.71) 达 1.59;吞吐 720×1280 达 30.19FPS,比低分辨率 XMax-X2.0(20.90) 快 44.4%。人工偏好(<10s 成对):对 LiveEdit/SANA/XMax/StreamDiff 获 90%/87%/81%/87%,对 Bernini-R 48%(对方44%),与 Kling-3.0 Omni、Seedance 2.0 各 56%。部署(81帧 batch1):全流水线 2.68s/30.19FPS(VAE 仅 0.405s/200FPS),是三流式基线的 1.67/1.95/2.08 倍。消融:无策略 2.81→+SA-DMD 3.23→+LHAD 3.06→两者并用 3.30,证明源锚定与长程优化高度互补。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OpenVE-Bench 短视频编辑(总体分) | Gemini 评委 1-5 分(总体) | 3.60(16B, 720×1280) | SANA-Streaming 2.62、LiveEdit 2.00、XMax-X2.0 1.87、StreamDiffusionV2 1.23;离线 Bernini-R 3.72、Kling-3.0 Omni 3.64 | 分别比四个流式基线高 +0.98/+1.60/+1.73/+2.37;五类中四类流式第一,local removal 4.06 全场最高 |
| LongV2VBench 长视频编辑(总体) | 编辑质量分(1 分钟视频) | 3.30(720×1280) | XMax-X2.0 1.71、SANA-Streaming 1.64、LiveEdit 1.23、StreamDiffusionV2 1.21 | 五类全第一,总体比最强基线 XMax-X2.0 高 +1.59 分 |
| 全流水线吞吐(LongV2VBench) | 端到端 FPS | 30.19 FPS @ 720×1280 | XMax-X2.0 20.90 FPS @ 832×1440、SANA-Streaming 14.51 FPS @ 704×1280 | 比 XMax-X2.0 快 44.4%,是 SANA-Streaming 的 2 倍多 |
| 81 帧 batch1 延迟/吞吐 | 全流水线延迟(s)/FPS | 2.68s / 30.19 FPS(VAE 0.405s=200FPS) | StreamDiffusionV2 4.48s/18.07、LiveEdit 5.24s/15.45、SANA-Streaming 5.58s/14.51 | 全流水线吞吐是三者 1.67/1.95/2.08 倍 |
| 人工成对偏好(<10s 单镜头) | 偏好本文比例 | LiveEdit 90%、SANA 87%、XMax 81%、StreamDiff 87%;Bernini-R 48%(对方44%) | 对应离线系统:Kling-3.0 Omni/Seedance 2.0 各 56% 对本文 | 对四个流式方法呈压倒性偏好,与最强离线系统持平 |
局限与改进
作者层面:论文自承的是评测主要依赖 Gemini 自动评委与人工成对偏好,长流基准 LongV2VBench 虽新增但仍只有 229 项、1 分钟量级,对真正「无界」开放流(数十分钟以上)的退化行为尚未充分刻画;两步蒸馏与 FP8 部署带来的精度-质量权衡只在 B200 上验证,未讨论更弱硬件(如消费级 4090、A10)的可移植性,30FPS 的成绩强依赖单卡 B200 与编译优化。我观察到的额外局限:(1) 强对比基线大多为闭源商用系统(Kling、Runway、PixVerse、XMax),参数/方法不透明,公平性存疑;(2) 训练数据规模极大(T2I 约 5.1B、V2V SFT 5.3M),且依赖大量合成配对编辑数据与 MLLM 自动 recaption,数据偏置与合成痕迹可能影响真实分布泛化;(3) SA-DMD/LHAD 引入多个超参($w_{txt}$、$w_{src}$、分段长度 m),论文未给敏感性分析;(4) 系统对参考图编辑(IV2V)与纯指令(V2V)质量的细分对比、以及失败案例展示较少。
独立分析的弱点
弱点一:长 horizon 评测天花板偏低。LongV2VBench 仅到 1 分钟,而论文强调「无界流」,建议构造 5-10 分钟乃至小时级持续流基准并量化「随时间增长的源漂移曲线」。弱点二:硬件可移植性未论证,30FPS 强依赖单卡 B200(FP8+图编译+KV 复用),普通创作者难复现;建议给出 INT8/FP16 在 4090/5090 上的吞吐-质量曲线。弱点三:自动评测信度依赖 Gemini 评委与成对偏好,建议引入前景/背景分层保真、光流一致性、身份保持率等解耦指标。弱点四:超参敏感性缺失,$w_{src}$、$w_{txt}$ 与 LHAD 分段长度 m 决定源保真-历史连续权衡却无消融曲线,建议补全并给自适应调度。弱点五:大量合成配对数据可能放大风格/身份偏置,且开放式实时编辑的深伪/换脸内容安全防护未讨论,可加指令与输出双重过滤。弱点六:与闭源强基线公平性,Kling-3.0 Omni、Seedance 2.0 在人工评测中与本文持平(各 56%)但参数/数据不透明,建议在可控开源强基线上做规模对齐对比。
未来方向
作者明确提出的方向:把流式编辑从「固定片段后处理」扩展为连续交互范式,应用于直播、实时数字人、交互娱乐、游戏内容生成、远程呈现与具身仿真,让指令可在播放中即时应用或修改。基于成果可延伸的方向:(1) 把 SA-DMD 的多轴 CFG 思想推广到「多源锚定」(多参考图/多模态条件),统一处理 IV2V 的身份、风格、运动分别约束;(2) 把 LHAD 的分段反向与动态镜像循环扩展为自适应 horizon,按累积误差自适应决定回传深度,进一步降显存;(3) 探索把 MLLM 条件编码器与 DiT 更深度耦合,支持多轮、对话式实时编辑与时间线级编辑历史回放;(4) 结合扩散模型的实时安全护栏(实时检测违规编辑指令与输出),面向开放流的合规部署;(5) 把两步蒸馏进一步压到一步并研究步数-质量的 Pareto,结合推测式去噪降低单块延迟;(6) 在更平民硬件上做端侧流式编辑,扩大可及性。
复现评估
复现评估总体「半开放、高门槛」。代码已声明开源于 https://github.com/jd-opensource/JoyAI-Video-Edit,对复现架构与推理流水线(块级因果注意力、SA-DMD、LHAD、FP8 部署)是关键利好;模型 16B,规模公开。但训练侧门槛极高:基础训练数据量巨大(T2I 约 5.1B、T2V 视频数亿级、V2V SFT 5.3M+CT 1.1M,见 Table 1),配对编辑数据还依赖自研 keyframe-guided 编辑传播与 latent-shared I2V 两条合成管线 + MLLM recaption + 多维过滤,这些数据与脚本是否完整开源未明说。训练超参部分给出(T2I LR $1\times10^{-4}$、T2V $5\times10^{-5}$、压缩比 $8\times24\times24$),但蒸馏/长程优化的完整超参($w_{txt}$/$w_{src}$/分段 m/窗口大小)缺失。推理侧相对现实:单卡 B200+FP8+编译可跑,但 30FPS 强依赖 B200 级硬件,消费级卡难达同性能。综合:架构与推理可复现性较好,从头完整训练复现成本极高。
论文图表
展示 JoyAI-Video-Edit 的核心能力定位:在源视频持续到达时,模型实时输出被编辑的帧,并保持主体身份、运动、空间结构与未编辑区域稳定,体现了「实时、高质量、流式」三大卖点。
作为 teaser 图,它一句话讲清本文要解决什么——随源帧持续到达保持编辑一致性与源保真,是理解动机的最佳入口。
用一组样例展示模型支持的多样化编辑任务,涵盖物体操作、外观修改、背景替换、风格化等全局与局部变换,对应评测中五类编辑类别。
帮助快速建立「这个系统能做什么」的全貌,与后续 OpenVE-Bench/LongV2VBench 的五类任务对应。
进一步补充定性结果,延续展示多样编辑任务下的稳定表现。
作为可视化附录,强调模型在更多场景下的稳健性,但相对前述图表属辅助证据。