ContextMaster:基于固定预算稀疏上下文路由的交互式多镜头视频创作 ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
统一模型实现多镜头视频生成、参考生成与编辑,单GPU达16.74FPS。
前置知识
旋转位置编码 (RoPE) 与角色感知坐标
RoPE 对查询/键向量按频率 $\omega_\nu$ 施加依赖位置 $t_i$ 的旋转 $\phi_{i,\nu}=\omega_\nu t_i$,使内积自然编码相对距离。本文扩展为角色感知版本,给每个 token 额外加一个角色-镜头相位码 $c_i$,令 $\phi_{i,\nu}=\omega_\nu t_i+\alpha c_i$,从而在共享序列里区分参考帧、历史镜头、源视频与去噪目标等异质 token。
整篇方法的核心是“把异质视觉上下文放进一个模型而不混淆它们的时间语义”。若不理解 RoPE 如何通过相位偏移编码角色,就无法看懂第 3.1 节为何能保留源-目标的帧对齐。
KV 缓存与可缓存干净上下文
推理时把注意力中不依赖输入噪声的 Key/Value 缓存下来,避免每步去噪重复编码。本文设计非对称拓扑:上下文分支自注意力 $Y_C=\text{Attn}(\tilde Q_C,\tilde K_C,V_C)$ 既不读带噪目标也不做文本交叉注意力,并对上下文施零时间步调制、对目标施扩散时间步调制,使 $(\tilde K_C,V_C)$ 与去噪步和 CFG 分支无关,可每轮预填充一次。
“上下文只编码一次、去噪全程复用”是达成 16.74 FPS 与可预测延迟的关键。理解缓存前提(上下文与噪声解耦)才能看懂为何能做预填充。
块稀疏注意力 (Block-Sparse Attention) 与固定预算
把上下文与目标都切成 $m$ 个 token 的块,用头共享的块摘要 $\tilde q_{q,h},\tilde k_{k,h}$ 算相关性 $s_{qk}=\frac{1}{N_{head}}\sum_h\langle\tilde q_{q,h},\tilde k_{k,h}\rangle$,再对每个目标块只保留相似度最高的 $B$ 个上下文块。这样密集的 $O(N_X N_C D)$ 读写降为 $O(N_X B m D)$,与历史长度无关。
交互式创作要求每轮去噪成本不随会话变长而增长。固定预算块稀疏正是把“历史越长越慢”问题转化为“常数预算”的核心机制。
一致性蒸馏 (Consistency Distillation) 与流匹配
在 shifted-flow 调度 $x_\sigma=(1-\sigma)x_0+\sigma\epsilon$ 上,一致性模型要求相邻噪声电平 $\sigma,\sigma'$ 的两个样本映射到同一个干净估计。本文用稠密教师走一步 CFG 引导 $x_{\sigma'}^T=x_\sigma+(\sigma'-\sigma)v_T^{cfg}$,让学生与 EMA 目标分别在两端预测 $\hat x_0$,最小化 $L_{CD}=\|\hat x_0^\theta-sg(\hat x_0^{\bar\theta})\|^2$。
学生既要少步采样又要走稀疏上下文,直接蒸馏学不到稠密教师行为。PCD 把“全上下文行为+跨时间步一致性”一并迁移,是两阶段训练的第一阶段。
分布匹配蒸馏 (Distribution Matching Distillation, DMD)
用一个冻结的真实分数模型 $s_{real}^{cfg}$(全上下文+CFG)和一个可训练的伪分数模型 $s_{fake}$(预算上下文)比较,差值 $\Delta s_\gamma=s_{fake}(y_\gamma,\gamma,C_B,u)-s_{real}^{cfg}(y_\gamma,\gamma,C_{full},u)$ 指示生成分布偏离真实分布的方向,梯度 $\nabla_\theta L_{DMD}=\mathbb E[w(\gamma)\Delta s_\gamma\partial\hat x_0/\partial\theta]$ 回传给学生。
PCD 会磨平细粒度外观/编辑细节。DMD 在部署采样轨迹上做分布级精修,恢复感知细节并补偿学生自生历史累积的误差,是训练的第二阶段。
研究动机
当下统一的视频创作系统(如 Seedance、各类多镜头与编辑模型)虽然能在单一模型里做文生视频、参考条件生成和编辑,但它们几乎都把这些能力当成“对固定输入的独立操作”来暴露,而不是“在一个不断演化的创作状态上组合”。实际创作者通常是多镜头、多回合地工作:先生成一个镜头、再按参考图延续、回头编辑某个镜头,整个过程需要模型保持共享的视觉历史并维持跨镜头一致性。然而一旦会话变长,稠密上下文读取(dense context read)在每个去噪步都随历史长度线性增长,导致延迟不可预测。例如基准上 MultiShotMaster 跑到 0.19 FPS、Phantom 0.452 FPS、VideoCoF 1.41 FPS、LucyEdit 1.05 FPS,远不能满足交互式创作的实时性。同时把参考、历史、源、目标简单地堆在一个时间坐标系下会混淆各自的位置语义,造成视角切换后角色被替换或丢失、编辑时残留源画面等失败模式。
本文的目标是本文要形式化并提出首个针对“交互式多镜头视频创作(IMVC)”的统一模型 ContextMaster。具体目标有三:(1) 让同一个模型在第 $r$ 轮接收指令 $u_r$、可选参考图 $R_r$、可选源视频 $S_r$ 和历史 $H_{(r-1)}$,输出 $\hat V_r=G_\theta(u_r,R_r,S_r,H_{(r-1)})$,并把被接受的结果追加为下一轮的干净上下文;(2) 在历史不断增长的前提下,把每个目标查询在去噪阶段的有效上下文读取成本限制为一个与历史长度无关的常数预算;(3) 在大幅稀疏化+少步采样(仅 4 步)的苛刻部署条件下,仍要在文本到多镜头(T2MV)、参考到多镜头(R2MV)、多镜头编辑(V2MV)三类任务上超过专用基线,并在单 H200 GPU 上达到实时(论文宣称 16.74 FPS)。
与已有工作不同的是,现有路线各有盲区:整体式双向方法(MultiShotMaster 等)一次合成整段、缺乏逐轮交互;流式自回归方法(LongLive、ShotStream)用稀疏采样/滚动窗口/固定 sink 压低成本,却牺牲了历史覆盖;检索式记忆方法(Yu et al.、Meng et al.)恢复远处证据但不面向异质参考条件或帧对齐编辑约束。ContextMaster 的独特切入是把“可缓存的固定预算上下文”与“角色感知表示”结合:它不丢弃历史,而是把全部历史留作路由候选池,但对每个目标查询只激活固定 $B$ 个块;同时在同一预算内用 ConstraintSink 强制保留参考和帧对齐源约束。再配以特权上下文蒸馏把稠密全上下文教师的行为迁移到稀疏少步学生,这是既有方法都没同时解决的问题。
核心方法
直觉上,ContextMaster 把交互式多镜头创作看成一条“不断增长但访问受限”的记忆:历史全量保留以备检索,但每次去噪只读一个固定预算。整体由三模块构成。其一,角色感知表示:把参考/历史/源/目标的 VAE latent 经 patch embedding 拼成 $[C_0;X_0]=P([Z_{ref};Z_{hist};Z_{src};Z_{tar}^\sigma])$,再用角色感知 RoPE $\phi_{i,\nu}=\omega_\nu t_i+\alpha c_i$ 赋相位,使模型在共享序列里区分四类 token,并在编辑时保留源-目标 $t_i=f$ 帧对齐。其二,可缓存固定预算算子:上下文分支自注意力既不读带噪目标也不做文本交叉注意力,并用零时间步/扩散时间步调制让 KV 与去噪步、CFG 分支无关、每轮预填充一次;再对目标到上下文带做块稀疏化,固定预算 $B$。其三,特权上下文蒸馏:用冻结稠密教师做 PCD 建立稳定少步流图,再用 DMD 在部署 rollout 上做分布级精修,同一稀疏算子与 6 FE 预算贯穿训练与推理。模型从 Wan2.1-T2V-1.3B 初始化,生成 832×480、每镜头 81 帧、按 1 FPS 采样构建记忆,部署用 4 步去噪。
核心创新是把“异质上下文的角色区分”和“固定预算的缓存式稀疏访问”统一进同一套注意力,并用 ConstraintSink 在共享预算里抢救那些不该靠相似度排名的约束。本质区别有三点。其一,角色感知 RoPE 用相位偏移 $\alpha c_i$ 把参考、历史、源、目标放进一个模型而不混淆时间语义——以往不连续/分组 RoPE 只处理同质镜头,没有覆盖“参考+历史+源+目标”四角色。其二,非对称可缓存上下文使 $(\tilde K_C,V_C)$ 独立于去噪步与 CFG 分支,每轮预填充一次全程复用,从而把“历史越长越慢”的稠密读取 $O(N_X N_C D)$ 变成与历史长度无关的 $O(N_X B m D)$。其三,ConstraintSink 收集参考块和与目标帧严格对齐的源块为强制集 $A_{sink}(q)=C_{ref}\cup\{k\in C_{src}:t_k=t_q\}$,与动态 Top-k 路由共享同一预算,避免纯相似度路由在编辑时留下源残影、在参考生成时丢失外观。
方法步骤详情
步骤分四层。第一层输入编码与角色标注:参考/历史/源经 VAE 编码、与带噪目标 $Z_{tar}^\sigma$ 拼接,patch embedding 得 $[C_0;X_0]$;为每个 token 赋帧坐标 $t_i$ 与角色码 $c_i$(参考 $c_i=-1,t_i=0$;第 $j$ 个历史镜头 $c_i=j$;源与目标用超出历史范围的码区分,目标 $c_i=n+1$,编辑中源/目标同帧 $t_i=f$ 但角色码不同),相位 $\phi_{i,\nu}=\omega_\nu t_i+\alpha c_i$。第二层非对称注意力与缓存:上下文分支 $Y_C=\text{Attn}(\tilde Q_C,\tilde K_C,V_C)$ 自包含且零时间步调制,目标分支 $Y_X=\text{Attn}(\tilde Q_X,[\tilde K_C;\tilde K_X],[V_C;V_X])$ 读缓存好的上下文。第三层固定预算路由:把两侧切成 $m$-token 块,按 $s_{qk}=\frac{1}{N_{head}}\sum_h\langle\tilde q_{q,h},\tilde k_{k,h}\rangle$ 算相关性;先构造强制集 $A_{sink}(q)=C_{ref}\cup\{k\in C_{src}:t_k=t_q\}$,残差预算 $B_{rem}^q=B-|A_{sink}(q)|$ 在源、历史两角色间工作守恒地分配,得 $M_B(q)=A_{sink}(q)\cup\text{TopK}_{K_{src}}(C_{src}\setminus A_{sink};s)\cup\text{TopK}_{K_{hist}}(C_{hist};s)$,满足 $|M_B(q)|\le B$。第四层两阶段蒸馏:PCD 用稠密教师 CFG 一步 $x_{\sigma'}^T=x_\sigma+(\sigma'-\sigma)v_T^{cfg}$,学生与 EMA 目标预测 $\hat x_0^\theta=x_\sigma-\sigma v_{S_\theta}$、$\hat x_0^{\bar\theta}=x_{\sigma'}^T-\sigma' v_{S_{\bar\theta}}$,最小化 $L_{CD}=\|\hat x_0^\theta-sg(\hat x_0^{\bar\theta})\|^2$ 把 CFG 烤进学生;DMD 用 $\Delta s_\gamma=s_{fake}(y_\gamma,\gamma,C_B,u)-s_{real}^{cfg}(y_\gamma,\gamma,C_{full},u)$ 在随机退出步上做分布级精修,且历史由学生自回归 rollout 生成以暴露累积误差。推理可由人直接操作或由工具增强 Director 自动调用。
技术新颖性
技术新颖性体现在四个被既有方法忽略的耦合点。其一,首次把生成、参考条件、编辑统一成“在演化视觉历史上可组合的有状态操作”(IMVC 形式化),并配以覆盖参考+历史+源+目标四角色的角色感知 RoPE——此前不连续/分组 RoPE 只处理同质镜头身份。其二,把“可缓存”与“固定预算”绑定:非对称干净上下文拓扑使上下文 KV 与去噪步、CFG 分支无关,于是稀疏化只作用在延迟敏感的目标到上下文读取带上,上下文/目标自注意力保持稠密,这是达到 16.74 FPS 的关键工程取舍。其三,ConstraintSink 在同一预算里区分“必须可见的显式约束”与“可按内容检索的动态证据”,强制集与 Top-k 共享预算保证 $|M_B(q)|\le B$,消融显示去掉它后编辑/参考 TF 从 4.20/4.04 跌到 3.64/3.69。其四,特权上下文蒸馏把稀疏+少步这两个互补误差一起解决:教师读全上下文、学生读预算,PCD 迁移全上下文行为与跨时间步一致性,DMD 在部署 rollout 上恢复细节,消融证明 PCD→DMD 顺序组合在 AQ 0.565、Inter-Shot 0.836、TF 4.17 上全面优于任一单阶段。
实验结果
实验在四个任务上展开:T2MV 100 条 prompt、R2MV 50 条、V2MV 50 条、X2MV 20 条交互轨迹。Table 1 是核心定量结果。T2MV 上本文几乎全面领先:Inter-Shot 0.836(ShotStream 0.808、MultiShotMaster 0.739、Infinity-RoPE 0.711),TF 4.17(ShotStream 4.03),DD 0.669,且 16.74 FPS 远超 MultiShotMaster 的 0.19 FPS。R2MV 上 Inter-Shot 0.749 大幅领先 Phantom 的 0.638,TF 4.04 vs 3.68,AQ 0.585 vs 0.558,仅 DD 略低(0.689 vs 0.787)。V2MV 编辑上 Inter-Shot 0.751 高于 VideoCoF 0.714、LucyEdit 0.623、StreamEdit 0.632、LiveEdit 0.638,TF 4.20 领先所有编辑器(VideoCoF 3.80),九项中八项领先或并列,仅 VideoCoF 在 AQ 微弱占优。Table 2 用户研究(10 位专业人士,1-5 分)显示本文在三类原语任务的 IF 和 CC 均最高:T2MV CC 4.04 vs 3.74、IF 3.91 vs 3.68;R2MV CC 3.99 vs 3.42、IF 3.86 vs 3.35;V2MV IF 4.00 vs 3.45、CC 3.98 vs 3.52;X2MV 组合任务 IF 3.84、CC 3.65、TC 4.04 仍可用。Table 3 消融:架构上去角色感知 RoPE 使 Inter-Shot 从 0.779 降到 0.748、去 ConstraintSink 降到 0.742;训练上 vanilla 稀疏 Inter-Shot 仅 0.754、TF 3.92,PCD-only 0.821/4.05,DMD-only 0.785/3.91,PCD→DMD 最佳 0.836/4.17,印证 PCD 主攻跨镜头一致性、DMD 主攻外观细节。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Text to Multi-shot Video (T2MV) | Inter-Shot 跨镜头一致性 / Task Fulfillment (TF) / FPS | Inter-Shot 0.836, TF 4.17, 16.74 FPS (单 H200, 5-shot 平均) | ShotStream Inter-Shot 0.808 / TF 4.03 / 15.95 FPS;LongLive 0.795;MultiShotMaster 0.739 / 0.19 FPS;Infinity-RoPE 0.711 | Inter-Shot 比 ShotStream +0.028、TF +0.14,而 FPS 16.74 比 MultiShotMaster 快约 88 倍 |
| Reference to Multi-shot Video (R2MV) | Inter-Shot / TF / AQ | Inter-Shot 0.749, TF 4.04, AQ 0.585, 16.74 FPS | Phantom Inter-Shot 0.638 / TF 3.68 / AQ 0.558 / 0.452 FPS | Inter-Shot +0.111,TF +0.36,FPS 提升约 37 倍;仅 DD 略低 (0.689 vs 0.787) |
| Multi-shot Video Editing (V2MV) | Inter-Shot / TF / AQ | Inter-Shot 0.751, TF 4.20, 16.74 FPS, 九项中八项领先或并列 | VideoCoF Inter-Shot 0.714 / TF 3.80 / AQ 0.533;LucyEdit 0.623/2.96;StreamEdit 0.632/3.10;LiveEdit 0.638/3.26 | Inter-Shot +0.037(vs VideoCoF),TF +0.40;仅 VideoCoF 在 AQ 上保持微小优势 (0.533 vs 0.520) |
| 训练策略消融 (T2MV) | Inter-Shot / TF / AQ | PCD→DMD: Inter-Shot 0.836, TF 4.17, AQ 0.565 | vanilla 稀疏 0.754/3.92/0.536;PCD-only 0.821/4.05/0.548;DMD-only 0.785/3.91/0.561 | 相比 vanilla 稀疏 Inter-Shot +0.082、TF +0.25;两阶段顺序优于任一单阶段 |
局限与改进
作者承认的局限主要有三。其一,在 R2MV 上 Phantom 的动态程度 DD(0.789)仍高于本文(0.689),且略微领先于主体内一致性,说明在追求一致性时对运动幅度的取舍尚未最优。其二,V2MV 中 VideoCoF 在美感质量 AQ 上保持微小领先(0.533 vs 0.520),暗示本文在编辑后画面精细度上仍有提升空间。其三,TF 由 Gemini 2.5 Pro 自动评分,属于模型评测,存在判分偏置风险;用户研究仅 10 人,统计置信度有限。从我的观察看还有更深层隐忧:评测集规模偏小(T2MV 100、R2MV/V2MV 各 50、X2MV 仅 20),且未公布这些基准与 baseline 的复现细节;模型初始化自 Wan2.1-1.3B 并依赖 1M 私有多镜头数据集,能力上限可能受骨干规模与数据质量制约;6 FE 固定预算在更长的多角色叙事(远超 5 镜头)下是否仍够用并未验证;X2MV 缺乏与专用基线的横向比较,组合任务的优势主要靠用户主观评分支撑。
独立分析的弱点
独立来看有几个可改进点。第一,固定预算 $B=6$ FE 是对历史覆盖与延迟的硬折中:当叙事角色多、镜头数远超 5 时,6 帧等价预算可能不足以同时承载多个角色的身份与状态。改进方向是把预算做成与角色数/镜头数自适应的调度,或引入层次化记忆(角色级 sink + 镜头级摘要)。第二,DD 在 R2MV 落后于 Phantom,说明对参考条件的强一致性约束可能压制了运动多样性;可在 ConstraintSink 之外为运动/相机维度预留独立预算,或对参考与运动用解耦的 CFG。第三,PCD 把 CFG 烤进学生虽省掉无条件前向,但也损失了推理时调节引导强度的灵活性;可设计保留可调 guidance scale 的轻量化方案。第四,评测靠 Gemini 打 TF 且用户研究仅 10 人,证据强度不足;建议扩充基准规模、引入更多人工标注与盲评,并公布 baseline 复现以增强可比性。第五,源-目标角色码在 OCR 中疑似渲染异常(写作 $c_i=n+12$,疑为 $n+\tfrac12$),表明实现细节披露不够清晰,开源实现会显著降低复现门槛。
未来方向
作者明确提及的延伸是把 IMVC 接口交由可选的工具增强 Director 自动驱动:它规划脚本与镜头序列、检索参考图、调用镜头边界检测与时间定位工具找出待编辑源段,再以 $(u_r,R_r,S_r)$ 形式喂给同一视频模型,把交互式创作升级为自动化工作流(附录 A 给出更多细节)。基于本成果可进一步延伸的方向包括:(1) 把固定预算稀疏上下文迁移到更长的长视频叙事与更高分辨率,验证 6 FE 预算的扩展极限;(2) 引入音频/语音作为新角色并入角色感知 RoPE,实现声画一致的多镜头生成;(3) 用更强的骨干(如更大参数 DiT)重做 PCD→DMD,看一致性-画质-速度三角是否进一步外推;(4) 把 ConstraintSink 思想推广到文本/多模态长上下文 LLM,研究“强制可见约束+动态检索共享预算”在长上下文推理中的价值;(5) 把 Director 工具链与强化学习结合,让模型从用户接受/拒绝的反馈中持续优化历史管理策略。
复现评估
复现难度较高但部分可推断。已公开信息:骨干为 Wan2.1-T2V-1.3B(公开权重),生成规格 832×480、每镜头 81 帧、1 FPS 采样、4 步去噪、6 FE 固定预算;稀疏算子用块级零阶 Taylor kernel 在 TileLang 中实现(参照 LIVEditor),且训练与推理用同一算子与预算;评测指标明确(ViCLIP 算 TA、VBench 算 AQ/MS/DD、DINO/CLIP 算主体/背景一致性、ViCLIP 分组算 Inter-Shot、Gemini 2.5 Pro 算 TF、单 H200 测 FPS)。缺口也很明显:训练数据为 1M 私有多镜头视频加公开参考/编辑集,未公开;稠密教师/真实分数模型/伪分数模型的具体结构、PCD/DMD 的超参($\mu$、$w(\gamma)$、$N_{step}$、块大小 $m$)、角色码 $c_i$ 的确切取值(OCR 疑误)均未详述;项目页给出但未见代码与权重公开承诺。整体看,架构思路清晰、工程可行性高,但缺乏代码/权重/数据意味着第三方几乎无法精确复现 Table 1/2 的数字,更多是“方向可借鉴、数字难复刻”。
论文图表
图分四行展示四种任务:T2MV 用 5 段连续镜头描述一个昏暗仓库里的对话场景;R2MV 给参考图后连续生成驾驶/陶艺等镜头;V2MV 对多镜头源视频执行“加老人”“删人物”“替换男人”等编辑指令;X2MV 在演化历史上交替执行参考生成、生成、编辑,例如先生成提案准备、再生成客户到达、再编辑把头发变棕并删 logo。每行配关键帧缩略图与镜头级文字说明。
这张图直观定义了 IMVC 这一新设定本身,是理解全文动机与四类任务的最快入口,也说明了为什么需要一个能在演化历史上组合多种操作的有状态模型。