← 返回 2026-07-21

基于可学习规划Token的电影级多镜头视频生成 ShotPlan: Cinematic Video Generation with Learnable Planning Token

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin Huang, Hongxun Yao, Chi Zhang, Xuelong Li 📅 2026-07-20 👍 5 2026-07-25 18:30
多镜头视频 扩散Transformer 旋转位置编码 电影级生成 视频生成

用可学习规划Token与分数旋转位置编码实现帧级可控多镜头视频生成

前置知识

扩散Transformer(Diffusion Transformer, DiT)

DiT 是一类用 Transformer 替代 U-Net 作为去噪主干的扩散模型。它把图像/视频经 VAE 压缩到潜在空间,再 patchify 成 token 序列,通过多头自注意力建模长程依赖。ShotPlan 构建于 Wan2.1-T2V-14B 这一 DiT 视频底座之上,因此去噪过程是对潜在 token 序列做迭代修正。

本文所有改动(插入规划 token、自注意力交互)都发生在 DiT 的 token 序列层面,理解 DiT 的 token 化与自注意力机制是读懂方法的前提。

旋转位置编码(Rotary Position Embedding, RoPE)

RoPE 通过对 query/key 做随坐标旋转的变换来注入位置信息,其核心优势是外推性好、且参数化为连续正弦函数。视频模型用 3D RoPE,给每个 token 一个 $(t,h,w)$ 坐标,分别表示时间、高度、宽度位置,时间轴 $t$ 沿离散潜在步索引。本文的创新正是对 RoPE 的改造。

FRoPE(分数时间 RoPE)是论文标题之外最关键的技术贡献,必须先理解标准 RoPE 与时间维度的离散索引方式,才能明白为何 VAE 时间压缩会让帧级对齐失效。

整流流匹配(Rectified Flow / Flow Matching)

整流流匹配把生成过程建模为从噪声 $z_1$ 到数据 $z_0$ 的线性插值路径 $z_\tau=(1-\tau)z_0+\tau z_1$,模型学习预测速度场 $v_\theta$。训练目标为 $\mathcal{L}_{flow}=\mathbb{E}[\|v_\theta(z_\tau,\tau,c)-(z_1-z_0)\|_2^2]$。它是现代视频扩散底座(如 Wan2.1)的主流目标。

ShotPlan 沿用流匹配目标,训练损失只施加在视频 token 上,规划 token 作为干净的确定性条件锚点,这一设定直接关系到训练稳定性,需要理解流匹配目标才能看懂补充材料里的消融。

3D 变分自编码器(3D VAE)与时间压缩

3D VAE 同时在空间和时间维度上压缩视频:视频 $V\in\mathbb{R}^{T\times H\times W\times 3}$ 被编码为潜在 $z_0\in\mathbb{R}^{f\times h\times w\times C}$。关键在于时间压缩比 $s_t$(本文为 4),即多个物理帧对应一个潜在时间步,潜在长度 $f=1+(T-1)/s_t$。这正是多镜头精确切点难以对齐的根源。

FRoPE 的全部意义就是弥合'帧级用户时间戳'与'离散潜在时间索引'之间的粒度鸿沟,理解 VAE 时间压缩是理解该方法动机的关键。

研究动机

当前视频生成模型在单镜头生成上已相当出色,但在电影级多镜头视频生成上仍力不从心——这类任务要求连贯叙事和有效的镜头组合规划。已有的两条路线各有硬伤:第一条是关键帧驱动的图生视频流水线,各镜头独立生成,缺少镜头间的去噪交互,且整体一致性严重依赖稀疏关键帧的覆盖度,当关键帧稀疏时容易丢失瞬态元素、破坏跨镜一致性;第二条是在统一去噪过程内做多镜头生成,典型做法是改架构,比如 ShotAdapter、CineTrans、HoloCine 用结构化注意力掩码来切分镜头,EchoShot 和 MultiShotMaster 则修改 RoPE 引入镜头级相位偏移。注意力掩码会人为阻断跨镜头信息流动、削弱主体/场景一致性,而修改视频 token 的 RoPE 会扰乱预训练的时间位置先验、加大预训练与微调的差距。更隐蔽的难题是:现代视频扩散模型在时间压缩的潜在空间中运行(压缩比 $s_t=4$),多个物理帧对应一个潜在时间步,因此只对齐到离散潜在索引的转场信号无法精确匹配用户指定的帧级时间戳。

本文的目标是本文的目标是提出一个轻量、即插即用的多镜头电影视频生成框架 ShotPlan:在不修改预训练视频扩散骨干的注意力结构、也不改动视频 token 原始位置编码的前提下,用一组可学习的'规划 token'作为镜头间的时间锚点,捕获镜头级转场线索,并与原始视频生成 token 无缝协作,实现用户可控的精确转场时刻,同时保持更强的跨镜头主体与场景一致性。作者还希望该机制具备足够的通用性,可推广到诸如镜头内局部相机运动这类时间结构化控制任务,从而成为统一的结构化时间控制手段。

与已有工作不同的是,本文的独特切入角度是'用 token 化的显式规划'取代'用掩码或位置篡改的隐式规划'。它把镜头转场显式表示为插入 token 序列的可学习规划 token,这些 token 像普通 token 一样参与标准自注意力,既不阻断跨镜头交互(区别于注意力掩码系),又不改动视频 token 的 RoPE(区别于位置篡改系);同时只为规划 token 引入 FRoPE(分数时间 RoPE),把帧级用户时间戳映射为分数潜在坐标,从而绕开 VAE 时间压缩带来的粒度鸿沟。这种'保留预训练结构 + 仅新增轻量条件 token'的设计,最大程度保护了底座的生成先验。

核心方法

ShotPlan 的整体思路是把镜头规划表达成一组可学习 token,作为镜头间的时间锚点和上下文条件信号注入 DiT 去噪过程。技术路线:视频 $V$ 经 3D VAE 编码为潜在 $z_0=E(V)$,按整流流 $z_\tau=(1-\tau)z_0+\tau z_1$ 加噪后 patchify 成视觉 token $X_\tau\in\mathbb{R}^{N\times D}$;规划 token $F_p\in\mathbb{R}^{M\times D}$ 与之拼接为 $X_{in}=[X_\tau\|F_p]$,经 DiT 块联合处理;去噪后丢弃规划 token,对更新的视觉 token 做 unpatchify 得到预测速度。实现基于 Wan2.1-T2V-14B,分辨率 $832\times480$、81 帧、3D VAE 时间压缩因子 4,用 7K 硬切 + 6K 软切样本训练 3500 步,8 张 H100,批大小 1,学习率 $\eta=1\times10^{-5}$,AdamW,推理时 CFG 尺度 5、去噪 50 步。

核心创新点是'可学习规划 token + 分数时间 RoPE(FRoPE)'的组合,它与已有方法有本质区别。和 ShotAdapter 相比,后者的转场 token 依赖局部注意力掩码、会阻断跨镜头交互,而本文规划 token 参与标准自注意力、不阻断信息流;和 EchoShot/MultiShotMaster 相比,后者直接修改视频 token 的 RoPE 会扰乱预训练时间先验,而本文保留视频 token 原始 RoPE 不变,只为规划 token 引入 FRoPE。FRoPE 利用 RoPE 由正弦函数参数化、天然支持连续坐标这一性质,把用户指定的帧级时间戳 $t_u$ 映射为分数潜在坐标 $\tilde{t}_u=1+(t_u-1)/s_t$($t_u>0$),从而在 VAE 时间压缩($s_t=4$)的情况下仍能做帧级精确转场控制。规划 token 不对应空间 patch,故赋予固定空间坐标 $(h,w)=(0,0)$。

方法步骤详情

方法步骤为:(1) 视频编码:$V\to z_0$,按 $z_\tau=(1-\tau)z_0+\tau z_1$ 加噪并 patchify 成 $X_\tau$。(2) 构造规划 token:硬切用一个可学习 token $f_{cut}$ 复制 $M$ 份;软转场用起始/结束两个 token 分别置于区间两端。(3) 分配 FRoPE 坐标:用户切点 $t_u$ 映射为分数潜在坐标 $\tilde{t}_u=1+(t_u-1)/s_t$($s_t=4$),规划 token 取该分数时间坐标、空间坐标固定为 $(0,0)$;视频 token 维持原始 RoPE。(4) 拼接 $X_{in}=[X_\tau\|F_p]$ 送入 DiT,损失仅施加于视频 token。(5) 去噪后移除规划 token,unpatchify 得 $\hat{v}$ 用于流匹配。数据构造基于开源 VideoEvent,用 TransNet V2 检镜头边界、滑窗(5 秒、≥2 镜、每镜≥20 帧)抽样本,再由 Gemini 2.5 过滤并生成全局描述+逐镜头描述的分层标注。

技术新颖性

新颖性体现在四个被消融验证的设计选择上。第一,规划 token 是数据驱动可学习的,而非静态语义 token——把'场景切换'文本经 T5 编码并池化得到的静态 token,在跨镜头一致性和文本对齐上明显劣化。第二,注入机制选 in-context token 拼接而非潜在加法或 AdaLN 调制:潜在加法(转场偏差 1.76)、全局 AdaLN(5.64)、局部 AdaLN(4.39)都远差于完整模型(0.64),说明与 RoPE 协作的上下文 token 注入最有利于保留 DiT 结构并实现精确控制。第三,FRoPE 是关键,去掉分数部分、退回离散潜在索引,转场偏差从 0.64 恶化到 2.13,证实分数坐标弥合了 VAE 时间压缩的粒度差。第四,规划 token 保持干净(不参与加噪与损失)而非带噪,干净版 3500 步即收敛,带噪版需约 11000 步才能达到同等性能。此外,同一机制可顺延用于镜头内局部相机运动,展现了作为统一时间控制机制的潜力。

Overview of the ShotPlan framework.
Figure 2: Overview of the ShotPlan framework.
Latent temporal attention weight visualization of the injected cut tokens.
Figure 4: Latent temporal attention weight visualization of the injected cut tokens.

实验结果

Table 1 上 ShotPlan 多数指标领先:转场偏差 0.64,远优于 MultiShotMaster 1.12、HoloCine 2.71、EchoShot 6.95、CineTrans 4.73;跨镜头角色一致性从最强基线 0.39 提升到 0.46,场景一致性从 0.32 提升到 0.37;叙事连贯性 0.88 优于 MultiShotMaster 0.83;文本对齐 0.26 略低于 HoloCine 0.28 但整体更均衡。Table 2 消融逐项验证:完整 0.64,静态语义 token 退到 0.82,潜在加法 1.76,全局/局部 AdaLN 分别 5.64/4.39,去掉 FRoPE 退到 2.13。Table 3 相机运动用户研究中,类型准确率 89%(对比 Kling 81%、SeedDance 86%),时机准确率 97%(对比 92%、96%),时机定位最强。Figure 4 显示规划 token 注意力峰值精确落在 FRoPE 分数时间戳上并向相邻帧平滑扩散,证明转场是软时间调制而非硬切割;补充实验表明干净 token 收敛速度约为带噪版的 3 倍。

Quantitative comparison across multiple metrics.
Table 1: Quantitative comparison across multiple metrics.
Ablation study on token types, condition injection mechanisms, and positional encoding strategies.
Table 2: Ablation study on token types, condition injection mechanisms, and positional encoding strategies.
User Study on Camera Movement Control Accuracy.
Table 3: User Study on Camera Movement Control Accuracy.
Qualitative comparison of multi-shot video generation.
Figure 3: Qualitative comparison of multi-shot video generation.
Qualitative comparison of temporally localized camera movement.
Figure 5: Qualitative comparison of temporally localized camera movement.
ShotPlan generation gallery.
Figure 6: ShotPlan generation gallery.
ShotPlan generation gallery (continued).
Figure 7: ShotPlan generation gallery (continued).
查看结构化数据
任务指标本文基线提升
多镜头生成-转场精度 Transition Deviation(越低越好) 0.64 MultiShotMaster 1.12 / HoloCine 2.71 / EchoShot 6.95 / CineTrans 4.73 相对最强基线降低约 43%,相对 HoloCine 降低约 76%
多镜头生成-跨镜头角色一致性 DINOv2 特征相似度(越高越好) 0.46 HoloCine 0.39 / MultiShotMaster 0.36 相对最强基线提升约 18%
多镜头生成-叙事连贯性 Narrative Coherence(越高越好) 0.88 MultiShotMaster 0.83 / HoloCine 0.51 相对最强基线提升约 6%
消融-位置编码 Transition Deviation 0.64(含 FRoPE) 2.13(去掉分数 RoPE) 转场偏差降低约 70%
局部相机运动-时机准确率 用户研究 Timing(越高越好) 97% Kling 2.6 92% / SeedDance 1.5 Pro 96% 相对最强商业基线提升 1 个百分点

局限与改进

局限性主要来自以下几方面。其一,生成长度受限:每个样本仅 81 帧、$832\times480$ 分辨率,对应几秒钟的短片,离真实电影长片仍有差距,作者未讨论更长序列下规划 token 的位置外推与一致性。其二,性能上界被底座 Wan2.1-T2V-14B 锁定,生成保真度、运动真实度依赖该基础模型;本文也未验证在其他 DiT 视频底座(如 HunyuanVideo、CogVideoX)上的迁移性。其三,文本对齐 0.26 略低于 HoloCine 的 0.28,说明为换取时间控制与一致性在逐镜头文本契合度上略有让步。其四,评测体系对 Gemini 2.5 依赖很重:100 个评测 prompt 由 Gemini 构造、跨镜一致性由 Gemini 指定镜头对、叙事连贯性由 Gemini 评判,存在模型既是数据构造者又是裁判的潜在偏见。其五,相机运动评测仅基于主观用户研究,覆盖 6 种运动类型且训练数据是合成的,结论的客观性与泛化性有限。

独立分析的弱点

独立分析的主要弱点如下。第一,生成时长过短(81 帧),难以支撑真正多镜头叙事;改进方向是结合长上下文微调或滚动窗口,研究规划 token 在更长序列上的位置外推行为。第二,转场类型覆盖有限,只验证了硬切和交叉淡入两类,电影常用到的擦除、翻转、黑场等转场未涉及;改进方向是扩充可学习 token 种类,或让 token 类型本身条件化。第三,对底座的强绑定——所有实验只在 Wan2.1 上做,FRoPE 与干净 token 设计是否在其他时间压缩比、其他 RoPE 变体的底座上同样有效,缺乏跨底座验证;改进方向是开展跨模型迁移实验。第四,相机运动训练数据靠图生视频合成+人工筛选,约每种 6000 条,规模与多样性有限,且存在拼接缝隙、场景漂移等筛选主观性;改进方向是引入真实多机位数据或更强的合成一致性约束。第五,评测对 Gemini 既是出题人又是阅卷人,存在循环风险,建议引入人类标注或多个独立判官模型交叉验证。

未来方向

作者明确提出的方向是把同一套规划 token 机制推广为统一的结构化时间控制手段,从离散镜头转场延伸到连续时间结构化任务(本文已示范相机运动)。基于该成果可延伸的方向包括:将规划 token 扩展到更多镜头转场类型与更长视频,配合显式记忆或长上下文机制突破 81 帧上限;把该方法迁移到其他 DiT 视频底座,验证 FRoPE 与干净 token 设计的通用性;将局部控制从相机运动扩展到主体运动、光照变化、视点切换等更丰富的时序事件;研究规划 token 与音频生成、多模态条件的联合,迈向带声音的电影级生成;探索用规划 token 做交互式镜头编辑(如运行时增删切点、调整转场时刻),把它从生成控制升级为创作工具。

复现评估

复现性中等偏上。论文给出了完整的关键超参与实现细节:底座 Wan2.1-T2V-14B(开源)、分辨率 $832\times480$、81 帧、3D VAE 时间压缩因子 4、7K 硬切 + 6K 软切样本、3500 步、8 张 H100、批大小 1、学习率 $1\times10^{-5}$、AdamW、CFG 尺度 5、50 步去噪;规划 token 初始化为零均值、标准差 0.02 的高斯。训练数据构造链路(VideoEvent + TransNet V2 + 滑窗 + Gemini 2.5)描述清晰,但 Gemini 的具体过滤提示词、逐镜头标注的提示词模板未公开,而 Gemini 输出本身难以精确复现,是主要不确定性来源。论文提供了项目主页(含视频样例),但正文中未明确承诺代码与权重开源。算力门槛较高(8×H100 训练),对一般研究者有一定压力。整体上,方法与配置足以复现主结果,但数据管线的可复现性受闭源大模型依赖影响。