← 返回 2026-08-05

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan 📅 2026-08-04 👍 90 2026-08-10 18:30
实时推理 扩散Transformer 流式生成 自回归扩散 蒸馏加速 视频编辑

16B自回归扩散模型实现单卡B200上30FPS实时720p流式视频编辑

前置知识

自回归扩散生成 (Autoregressive Diffusion)

将扩散模型与自回归序列生成结合的范式:把长视频沿时间轴切成若干固定大小的 chunk,每个 chunk 内部做完整的(双向)扩散去噪,而不同 chunk 之间按因果顺序逐块生成,即当前 chunk 只能看见自己和过去的 chunk,看不到未来。本文用每个 chunk 一个 latent frame 的设定,注意力为「块内双向、块间因果」,并以滑动窗口+首个 chunk 作为全局 sink 来约束历史状态。

本文的核心架构就是因果化的自回归扩散,理解「块内双向、块间因果」以及 train–inference mismatch(训练用干净历史、推理用模型自己生成的有损历史)是读懂 SA-DMD 与 LHAD 两项蒸馏创新的前提。

Distribution Matching Distillation (DMD / 分布匹配蒸馏)

DMD 把多步迭代的扩散采样蒸馏成少步生成器,由三部分组成:可训练的因果生成器 $G_\theta$、可训练的 fake-score 模型 $F_\psi$、冻结的 real-score 教师 $R_\phi$。它通过 reverse-KL 散度的 mode-seeking 形式,用 real-score 与 fake-score 之间的差异把学生拉向教师分布。本文采用共享骨干的 LoRA 配置,三者从上一阶段权重初始化,最终把去噪压到两步。

SA-DMD 是在标准 DMD 基础上做的关键改造,若不理解 DMD 的「real/fake score 差异驱动学生更新」机制,就无法理解作者为何要在教师侧沿文本和源保真两个独立轴施加 CFG。

Classifier-Free Guidance (CFG / 无分类器引导)

CFG 是扩散模型推理时常用的条件增强技巧:同时计算条件预测 $v^{cond}$ 与无条件预测 $v^{uncond}$(把条件置空),用差分放大条件信号。本文把它推广到多轴形式 $v_{g_\phi}=v_\phi^{cond}+w_{txt}(v_\phi^{cond}-v_\phi^{-txt})+w_{src}(v_\phi^{cond}-v_\phi^{-src})$,其中 $v^{-src}$ 丢弃对齐的源 latent、$v^{-txt}$ 丢弃文本指令。

SA-DMD 的源锚定正是通过对 real-score 教师施加沿源保真轴的 CFG 来实现的;理解多轴 CFG 才能明白作者为何能把源保真控制蒸馏进单分支部署模型。

因果视频 VAE 与 KV-Cache 流式部署

因果视频 VAE 把源视频编码为 latent 序列,时空压缩比为 $8\times24\times24$(时间压缩因子 8、空间压缩因子 $24\times24$),即每个 latent frame 代表 8 个视频帧,并采用 (1+8) 帧的伪编码形式提供单张上下文帧。部署时把每个 chunk 的干净 key-value 状态缓存,保留首个 chunk 作 global sink 加一段滑动窗口历史,从而把 KV-cache 与每块算力与流长度解耦。

实时 30FPS 的实现依赖有界历史的 KV 复用,结合 FP8 量化、算子融合、计算图编译;不理解这部分就难以解释为何 16B 大模型能在单卡 B200 上做 720p 实时编辑。

Resampling Forcing / 自强迫训练

为缓解「训练喂干净历史、推理吃自己有损预测」的分布失配,Resampling Forcing 在因果扩散训练中用「单步去噪 rollout 重新生成、并从梯度中 detach」的历史替代干净历史,使训练分布更接近部署时的历史分布。Self Forcing 则显式展开模型自回归轨迹,但串行展开成本高、依赖少步生成器与截断梯度,难以扩展到大骨干。

本文先用 clean-history teacher forcing 再切到 Resampling Forcing 做因果适配;LHAD 则进一步针对「短 rollout 看不到长程累积误差」这一被 Resampling Forcing 忽略的问题做分段长程优化,是读懂方法演进链条的关键。

研究动机

现有的高质量视频编辑器几乎都面向离线、固定长度的片段:它们利用双向或全局时序交互处理整段视频,需迭代去噪完成才输出结果。这种「依赖未来帧」的设计无法做因果输出,难以满足直播、视频通信、实时内容创作等场景——编辑帧必须随源视频到达而即时产生。更深层的问题是,把离线编辑器逐段独立套用并不令人满意:它会反复处理重叠上下文,并在片段边界引入可见的不连续。即使简单地把模型「因果化」也解决不了根本困难:训练时自回归模型通常条件于干净的目标历史,而推理时却消费自己不完美的预测,这种 train–inference mismatch 会让重建误差、颜色偏差、外观漂移在生成历史中传播并累积成长程漂移。视频编辑尤其棘手,因为每个输出块既要与时序对齐的当前源块保持保真,又要在目标身份、几何、运动、背景上保持一致,还要稳定地施加所要求的变换;而实时吞吐所需的少步生成又额外拉开了迭代、带 CFG 的训练目标与部署时的单分支模型之间的差距。

本文的目标是本文要打造一个面向实时、开放式(无预定义时长、看不到未来帧)流式视频编辑的统一系统 JoyAI-Video-Edit,它是一个 16B 参数的自回归扩散框架。具体目标是:在因果生成的前提下同时实现低响应延迟、有界的计算与显存、以及对未知时长流的稳定编辑质量;要让编辑后的每一块既忠实于源块(保留未编辑的身份/几何/运动/背景),又长期时序一致;并在单张 Nvidia B200 GPU 上完成端到端 720p 视频编辑、达到约 30 FPS。为支持对「持续流」下的系统化评测,作者还专门构建了 LongV2VBench 这一分钟级长视频编辑基准,覆盖背景替换、全局风格、局部增删改五类任务共 229 项。

与已有工作不同的是,已有工作各自只解决一部分且互不相容。离线编辑器质量高但依赖未来帧;SANA-Streaming、LiveEdit、XMax-X2.0、StreamDiffusionV2 等流式方法为实时性往往牺牲容量,长流上的一致性与指令遵循仍未解决。长视频生成侧,Diffusion/Self/Resampling Forcing 处理因果与 train–inference mismatch,但 Self Forcing 串行展开难扩展到大骨干和长 horizon,Resampling Forcing 在短轨迹上优化、低估反复复用历史后才涌现的累积误差;DMD/Causal Forcing 做少步蒸馏却未触及流式编辑中「源块、生成历史、当前块」三者平衡。本文的独特切入点是把因果适配、源保真的少步蒸馏、显式的长程抗漂移优化三者整合进统一框架:用块内双向+块间因果注意力+滑动窗口/全局 sink 约束历史,用 SA-DMD 把源保真 CFG 只施加于蒸馏目标并吸收进生成器,用 LHAD 做分段长 rollout 优化直接监督受累积误差影响的深层状态。

核心方法

JoyAI-Video-Edit 是统一的 16B 自回归扩散视频编辑模型,由三部分组成:基于 MLLM 的条件编码器(处理源视频首帧+编辑指令,输出条件 token)、因果视频 VAE(时空压缩比 $8\times24\times24$,每 latent frame 代表 8 帧,把源视频与可选参考图编码进同一 latent 空间)、多模态扩散 Transformer(MM-DiT)联合建模条件与视觉 latent token 后解码;同时支持 V2V 与 IV2V 编辑。训练走「基础→因果适配→少步蒸馏→长程优化」四阶段(规模见 Table 1):先 256/512 渐进式 T2I 预训练(约 5.1B 样本)→渐进 T2V→I2I 图像编辑→双向 V2V/IV2V SFT+CT。给定源 $x_s$、条件 $c$、参考 $z_r$、目标 $x_t$,对噪声级 $\sigma\in[0,1]$ 与高斯噪声 $\epsilon$ 构造 $z_\sigma=(1-\sigma)z_0+\sigma\epsilon$、$v^\star=\epsilon-z_0$,双向编辑器以 $L_{V2V}=E\|v_\theta^{bi}(z_\sigma,\sigma;c,z_s,z_r)-v^\star\|_2^2$ 训练,为后续因果适配提供高质量初始化。

核心创新是用统一框架同时解决三个互不相干的难题,且彼此高度互补。其一,块级因果适配:块内双向、块间因果,活动块只看当前+过去;滑动窗口(固定近期块)+ 首块 global sink 把注意力上下文与流长度解耦,并用 Resampling Forcing 把干净历史换成 detach 的模型生成估计缓解 train–test 失配。其二,Source-Anchored DMD(SA-DMD):标准 DMD 在长 rollout 中让生成器越来越依赖有损历史,误差复合成源漂移;SA-DMD 对 real-score 教师沿文本轴与源保真轴独立做 CFG $v_{g_\phi}=v_\phi^{cond}+w_{txt}(v_\phi^{cond}-v_\phi^{-txt})+w_{src}(v_\phi^{cond}-v_\phi^{-src})$,使教师成「源锐化后验」,关键是源锚定只施加于蒸馏目标并吸收进生成器,部署时单条件前向即保源保真。其三,LHAD:把 m-块 rollout 切成更短 clip,逐 clip 反向、清图、跨 clip 累加梯度,在有限显存内反映整段 horizon 梯度。

方法步骤详情

四阶段流程(规模见 Table 1)。A 基础训练:T2I 预训练(256/512,LR $1\times10^{-4}$)→T2V 渐进(256p→360p→480p)→I2I 图像编辑 SFT→双向 V2V/IV2V SFT+CT。B 块级因果适配:把视频对切成对齐固定大小源/目标块(每块一 latent frame),训练时把噪声活动块与源 $S_t$、条件 $C_t$、可选参考 $R$、干净历史 $H_{<t}$ 打包,用掩码控制可见性(块内双向看源/条件、因果看窗口历史与 global sink、未来块掩码、R 全局可见),按 Diffusion Forcing 给每块独立噪声级、用掩码 flow-matching;先干净历史 teacher forcing,再 Resampling Forcing 换 detach 的单步去噪估计。C SA-DMD:共享骨干 LoRA 初始化 $G_\theta/F_\psi/R_\phi$,对 real-score 做双轴 CFG 得 $v_{g_\phi}$,扰动到 $\sigma$ 转干净预测,生成器最小化两预测归一化差异,fake-score 在 detach 样本上做 flow-matching 回归。D LHAD:m-块 rollout 分段,逐 clip 反向清图累加梯度;源视频不够长用动态镜像循环扩展。部署:流切成 8 帧块,FP8+算子融合+图编译,每块 VAE 编码→两步 DiT 去噪→立即解码,缓存首块 global sink+滑动窗口历史。

技术新颖性

新颖性体现在三处本质区别与一个系统级整合。区别于 Self Forcing(串行展开、依赖少步生成器与截断梯度,难扩展到大骨干和长 horizon),本文用 Resampling Forcing 做基础因果适配,再独立引入 LHAD 用分段反向在有限显存内做长 rollout 优化,可扩展到 16B 与分钟级流。区别于标准 DMD/Causal Forcing 只做少步蒸馏而忽视源保真,SA-DMD 首次把「源锚定」这一流式编辑独有的需求,通过多轴 CFG 限定在蒸馏目标上并蒸馏进单分支生成器——这是部署时无需多分支即可同时保持编辑一致性与源保真的关键。区别于 LiveEdit(用 mask cache 复用算力)、SANA-Streaming 等为实时性牺牲容量,本文保留 16B 容量,靠两步蒸馏+有界 KV-cache+FP8/算子融合/图编译达到 30FPS。系统级整合上,块级因果适配、SA-DMD、LHAD 三者统一解决因果生成、源漂移、少步加速、长程稳定,并通过 LongV2VBench 填补了「分钟级持续流编辑评测」的空白(229 项任务、五类编辑、含全流水线吞吐)。

Architecture of JoyAI-Video-Edit.
Figure 3: Architecture of JoyAI-Video-Edit.
The Training Pipeline of JoyAI-Video-Edit. LHAD indicates the long-horizon autoregressive distillation.
Figure 4: The Training Pipeline of JoyAI-Video-Edit. LHAD indicates the long-horizon autoregressive distillation.
Paired video editing data pipeline.
Figure 6: Paired video editing data pipeline.
Data distributions of T2V continual training (CT) and supervised fine-tuning (SFT), and V2V supervised fine-tuning (SFT).
Figure 7: Data distributions of T2V continual training (CT) and supervised fine-tuning (SFT), and V2V supervised fine-tuning (SFT).

实验结果

核心结论:流式编辑大幅领先并逼近强离线系统。短视频 OpenVE-Bench(Gemini 1-5 分):本文总体 3.60,比 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)、StreamDiffusionV2(1.23) 分别高 0.98/1.60/1.73/2.37,五类中四类流式第一,local change 4.47 与 local removal 4.06 均为全场最高;总体与 Bernini-R(3.72)、Kling-3.0 Omni(3.64) 相当。长视频 LongV2VBench(1 分钟/229 项):本文总体 3.30、五类全第一,超最强基线 XMax-X2.0(1.71) 达 1.59;吞吐 720×1280 达 30.19FPS,比低分辨率 XMax-X2.0(20.90) 快 44.4%。人工偏好(<10s 成对):对 LiveEdit/SANA/XMax/StreamDiff 获 90%/87%/81%/87%,对 Bernini-R 48%(对方44%),与 Kling-3.0 Omni、Seedance 2.0 各 56%。部署(81帧 batch1):全流水线 2.68s/30.19FPS(VAE 仅 0.405s/200FPS),是三流式基线的 1.67/1.95/2.08 倍。消融:无策略 2.81→+SA-DMD 3.23→+LHAD 3.06→两者并用 3.30,证明源锚定与长程优化高度互补。

Summary of the multi-stage foundation training curriculum.
Table 1: Summary of the multi-stage foundation training curriculum.
Quantitative comparison of closed-source, open-source, and streaming video editing methods on OpenVE-Bench.
Table 2: Quantitative comparison of closed-source, open-source, and streaming video editing methods on OpenVE-Bench.
Quantitative comparison with streaming video editing methods on LongV2VBench.
Table 3: Quantitative comparison with streaming video editing methods on LongV2VBench.
Latency and throughput comparison of streaming video editing methods on 81-frame inputs with batch size 1.
Table 4: Latency and throughput comparison of streaming video editing methods on 81-frame inputs with batch size 1.
Effectiveness of the proposed distillation components on LongV2VBench.
Table 5: Effectiveness of the proposed distillation components on LongV2VBench.
Runtime analysis of JoyAI-Video-Edit on an Nvidia B200 GPU.
Figure 5: Runtime analysis of JoyAI-Video-Edit on an Nvidia B200 GPU.
Overview of LongV2VBench.
Figure 8: Overview of LongV2VBench.
Pairwise human preference between JoyAI-Video-Edit and competing methods.
Figure 9: Pairwise human preference between JoyAI-Video-Edit and competing methods.
Qualitative comparison with streaming video editing methods.
Figure 10: Qualitative comparison with streaming video editing methods.
Additional qualitative results of JoyAI-Video-Edit across diverse editing tasks.
Figure 11: Additional qualitative results of JoyAI-Video-Edit across diverse editing tasks.
查看结构化数据
任务指标本文基线提升
OpenVE-Bench 短视频编辑(总体分) Gemini 评委 1-5 分(总体) 3.60(16B, 720×1280) SANA-Streaming 2.62、LiveEdit 2.00、XMax-X2.0 1.87、StreamDiffusionV2 1.23;离线 Bernini-R 3.72、Kling-3.0 Omni 3.64 分别比四个流式基线高 +0.98/+1.60/+1.73/+2.37;五类中四类流式第一,local removal 4.06 全场最高
LongV2VBench 长视频编辑(总体) 编辑质量分(1 分钟视频) 3.30(720×1280) XMax-X2.0 1.71、SANA-Streaming 1.64、LiveEdit 1.23、StreamDiffusionV2 1.21 五类全第一,总体比最强基线 XMax-X2.0 高 +1.59 分
全流水线吞吐(LongV2VBench) 端到端 FPS 30.19 FPS @ 720×1280 XMax-X2.0 20.90 FPS @ 832×1440、SANA-Streaming 14.51 FPS @ 704×1280 比 XMax-X2.0 快 44.4%,是 SANA-Streaming 的 2 倍多
81 帧 batch1 延迟/吞吐 全流水线延迟(s)/FPS 2.68s / 30.19 FPS(VAE 0.405s=200FPS) StreamDiffusionV2 4.48s/18.07、LiveEdit 5.24s/15.45、SANA-Streaming 5.58s/14.51 全流水线吞吐是三者 1.67/1.95/2.08 倍
人工成对偏好(<10s 单镜头) 偏好本文比例 LiveEdit 90%、SANA 87%、XMax 81%、StreamDiff 87%;Bernini-R 48%(对方44%) 对应离线系统:Kling-3.0 Omni/Seedance 2.0 各 56% 对本文 对四个流式方法呈压倒性偏好,与最强离线系统持平

局限与改进

作者层面:论文自承的是评测主要依赖 Gemini 自动评委与人工成对偏好,长流基准 LongV2VBench 虽新增但仍只有 229 项、1 分钟量级,对真正「无界」开放流(数十分钟以上)的退化行为尚未充分刻画;两步蒸馏与 FP8 部署带来的精度-质量权衡只在 B200 上验证,未讨论更弱硬件(如消费级 4090、A10)的可移植性,30FPS 的成绩强依赖单卡 B200 与编译优化。我观察到的额外局限:(1) 强对比基线大多为闭源商用系统(Kling、Runway、PixVerse、XMax),参数/方法不透明,公平性存疑;(2) 训练数据规模极大(T2I 约 5.1B、V2V SFT 5.3M),且依赖大量合成配对编辑数据与 MLLM 自动 recaption,数据偏置与合成痕迹可能影响真实分布泛化;(3) SA-DMD/LHAD 引入多个超参($w_{txt}$、$w_{src}$、分段长度 m),论文未给敏感性分析;(4) 系统对参考图编辑(IV2V)与纯指令(V2V)质量的细分对比、以及失败案例展示较少。

独立分析的弱点

弱点一:长 horizon 评测天花板偏低。LongV2VBench 仅到 1 分钟,而论文强调「无界流」,建议构造 5-10 分钟乃至小时级持续流基准并量化「随时间增长的源漂移曲线」。弱点二:硬件可移植性未论证,30FPS 强依赖单卡 B200(FP8+图编译+KV 复用),普通创作者难复现;建议给出 INT8/FP16 在 4090/5090 上的吞吐-质量曲线。弱点三:自动评测信度依赖 Gemini 评委与成对偏好,建议引入前景/背景分层保真、光流一致性、身份保持率等解耦指标。弱点四:超参敏感性缺失,$w_{src}$、$w_{txt}$ 与 LHAD 分段长度 m 决定源保真-历史连续权衡却无消融曲线,建议补全并给自适应调度。弱点五:大量合成配对数据可能放大风格/身份偏置,且开放式实时编辑的深伪/换脸内容安全防护未讨论,可加指令与输出双重过滤。弱点六:与闭源强基线公平性,Kling-3.0 Omni、Seedance 2.0 在人工评测中与本文持平(各 56%)但参数/数据不透明,建议在可控开源强基线上做规模对齐对比。

未来方向

作者明确提出的方向:把流式编辑从「固定片段后处理」扩展为连续交互范式,应用于直播、实时数字人、交互娱乐、游戏内容生成、远程呈现与具身仿真,让指令可在播放中即时应用或修改。基于成果可延伸的方向:(1) 把 SA-DMD 的多轴 CFG 思想推广到「多源锚定」(多参考图/多模态条件),统一处理 IV2V 的身份、风格、运动分别约束;(2) 把 LHAD 的分段反向与动态镜像循环扩展为自适应 horizon,按累积误差自适应决定回传深度,进一步降显存;(3) 探索把 MLLM 条件编码器与 DiT 更深度耦合,支持多轮、对话式实时编辑与时间线级编辑历史回放;(4) 结合扩散模型的实时安全护栏(实时检测违规编辑指令与输出),面向开放流的合规部署;(5) 把两步蒸馏进一步压到一步并研究步数-质量的 Pareto,结合推测式去噪降低单块延迟;(6) 在更平民硬件上做端侧流式编辑,扩大可及性。

复现评估

复现评估总体「半开放、高门槛」。代码已声明开源于 https://github.com/jd-opensource/JoyAI-Video-Edit,对复现架构与推理流水线(块级因果注意力、SA-DMD、LHAD、FP8 部署)是关键利好;模型 16B,规模公开。但训练侧门槛极高:基础训练数据量巨大(T2I 约 5.1B、T2V 视频数亿级、V2V SFT 5.3M+CT 1.1M,见 Table 1),配对编辑数据还依赖自研 keyframe-guided 编辑传播与 latent-shared I2V 两条合成管线 + MLLM recaption + 多维过滤,这些数据与脚本是否完整开源未明说。训练超参部分给出(T2I LR $1\times10^{-4}$、T2V $5\times10^{-5}$、压缩比 $8\times24\times24$),但蒸馏/长程优化的完整超参($w_{txt}$/$w_{src}$/分段 m/窗口大小)缺失。推理侧相对现实:单卡 B200+FP8+编译可跑,但 30FPS 强依赖 B200 级硬件,消费级卡难达同性能。综合:架构与推理可复现性较好,从头完整训练复现成本极高。