← 返回 2026-08-19

CoinVE-200K:面向组合式指令引导视频编辑的大规模高质量数据集 CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu 📅 2026-08-18 👍 15 2026-08-24 18:30
多模态大模型 扩散Transformer 指令引导生成 数据集 视频编辑

构建20万条组合指令视频编辑数据集,并用区域感知注意力训练22B编辑模型

前置知识

指令引导视频编辑

用自然语言指令描述修改需求的视频编辑范式:模型输入源视频与文字指令,输出仅改变指令相关内容、其余保持原样的视频。与传统依赖掩码、涂鸦或关键帧控制信号的方法相比,接口更自然,但要求模型同时理解语义、精确定位编辑区域并保持帧间时序一致,难度显著高于图像编辑。

这是本文的任务背景,组合式编辑是其在多指令场景下的扩展,读懂动机与相关工作部分需要它。

扩散 Transformer(DiT)与流匹配

DiT 用 Transformer 替代 U-Net 来建模扩散过程中的时空 token,是当前大规模视频生成的主流架构;流匹配是训练扩散模型的方式,让模型学习从噪声分布到数据分布近似直线路径上的速度场,训练更稳定高效。Wan2.1-T2V-14B 等开源视频基础模型即基于此范式。

CoinVE-Edit 的生成骨干是 Wan2.1 DiT,训练目标就是流匹配损失,核心创新 Q-Blending 也作用在 DiT 的交叉注意力上。

SAM/SAM2/SAM3 分割模型

Segment Anything 系列模型:SAM 根据点/框提示分割任意物体;SAM2 引入记忆机制,可把掩码沿视频帧传播;SAM3 进一步支持按文本短语在图像中定位并分割目标。三者组合可实现从文本关键词到关键帧掩码、再到全视频时空掩码的自动转换。

本文数据管线的核心工具,负责把每条原子指令落到具体时空区域,也是模型里 Mask Predictor 学习模仿的对象。

交叉注意力条件注入

Transformer 中让一组 query 从另一组 key/value 提取信息的机制,在扩散模型中广泛用于把文本等条件注入生成过程:图像/视频潜码 token 充当 query,条件编码充当 key/value。控制哪些条件影响哪些空间位置,是可控生成与局部编辑的关键。

Q-Blending 正是对交叉注意力输出做逐查询软加权的改造,是本文核心创新发生的位置,不看懂交叉注意力就无法理解方法。

MLLM(多模态大语言模型)

在 LLM 基础上接入视觉编码器、能同时理解图像/视频与文本的模型,如 Qwen3-VL。可通过指令微调执行视频理解、目标定位、细粒度描述等任务,还支持挂载可学习查询 token 来按需提取特定语义表征。

本文用 Qwen3-VL-8B 作为语义前端解析视频与多条指令,其输出的条件 token 直接决定掩码预测与门控的质量,是整个框架的理解中枢。

研究动机

现有的指令引导视频编辑数据集(如 InsViE、Senorita、Ditto、OpenVE)虽然规模与类别覆盖不断扩展,但几乎都聚焦单一编辑操作——换背景、删物体或改局部区域。而真实用户往往在一条请求里同时提出多个意图,例如把人换掉、把物体删掉、同时把背景风格化。这种组合式编辑要求模型联合理解多条指令、定位各自的时空区域、逐条忠实执行并保留无关内容,难度远高于单操作编辑:不同意图会相互干扰,导致指令冲突、误改无关区域和时序不一致。作者指出已有数据集存在三大缺陷:一是指令短且只对应单一主导意图,模型学不到多意图推理;二是编辑目标局限于单一主体或区域,无法同时覆盖人、物、背景;三是缺乏系统性组合不同编辑类型(添加、删除、修改、风格化)的标注与构建策略,导致训练出的模型在复杂多操作场景下频繁漏执行指令或越界修改无关区域。

本文的目标是论文的核心目标是把组合式指令引导视频编辑变成一个可研究、可训练、可评测的完整任务,并提出三位一体的解决方案。其一是 CoinVE-200K:包含 20 万条视频编辑对的大规模数据集,每条样本为 1080p、最多 201 帧,涉及 2 到 5 个原子编辑操作,覆盖人物、物体、背景三类目标主体,以及添加、删除、修改、风格化等多种编辑类型,平均每条视频 2.55 条指令。其二是 CoinVE-Bench:由 361 条高质量源视频构成的专用评测基准,平衡覆盖不同编辑主体、操作类型和指令复杂度,从指令遵循、组合编辑准确率、区域级精度、无关内容保持、视觉质量和时序一致性等维度统一评测。其三是 CoinVE-Edit:基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B 构建、总参数约 22B 的组合视频编辑模型,通过对不同编辑指令做区域感知的注意力解耦,实现精准多区域编辑,为该方向提供强基线。

与已有工作不同的是,作者的独特切入点是把多指令的空间归属作为一等公民显式建模。此前工作要么把多条指令拼成一个长提示词让模型隐式消化,要么在注意力里加硬性掩码偏置,前者导致指令间串扰,后者破坏预训练 DiT 的特征分布。本文反其道而行:在数据侧,用分割掩码加逐指令校验的合成管线,保证每条原子指令都有明确的区域归属和执行验证(Gemini 2.5 Pro 逐条检查,全部通过才保留,平均质量分 4.85);在模型侧,提出 Q-Blending 交叉注意力——保持预训练注意力分布不动,只在输出端按查询位置软性重加权,配合 Mask Predictor(预测每条指令的作用区域)与 GateNet(判断局部/全局编辑)两个轻量头,实现哪里编辑、编辑多强的解耦控制。评测侧借鉴 CoVEBench 的清单式范式,把组合编辑拆成逐指令的细粒度检查项,避免笼统打分掩盖部分指令未被执行的问题。

核心方法

整体思路是先造数据、再造模型、后立基准。数据构造分三步:先从 OpenVid-HD 筛出 42 万条源视频(至少 81 帧、短边不低于 1080 像素,用美学分数和光流保证画质与适度运动);然后用 Qwen3.6-27B 对每条视频做内容解析,从主体、物体、背景三个维度生成结构化描述,按预定义编辑模板实例化并组合出 2 到 5 条原子指令,经数据校验环节保证指令与源内容兼容、组合后仍连贯可执行;接着做掩码引导的视频合成——SAM3 根据指令关键词在关键帧上分割各编辑区域,SAM2 把掩码传播到全部帧,用 HunyuanImage-3.0 和 Nano Banana 编辑关键帧,再由微调过的 Wan2.2-Animate-14B 或 VACE 结合合并掩码与源视频合成完整编辑视频;最后 Gemini 2.5 Pro 做二次质量过滤,逐条原子指令校验执行情况,并检查语义、时序一致性与物理合理性,全部通过才入选。模型方面,CoinVE-Edit 以 Qwen3-VL 为语义前端、Wan2.1-T2V-14B DiT 为生成骨干,经掩码条件与 Q-Blending 交叉注意力把多条指令分别注入各自对应的时空区域,同时保留无关内容。

核心创新是 Q-Blending 交叉注意力。对每条指令 $I_i$,标准交叉注意力产出指令特定的输出 $o_i = \mathrm{Attn}(q, k_i, v_i)$,随后不再直接叠加,而是用逐查询权重 $w_i^q = 1 - \beta g_i(1 - M^i)$ 对输出做软性缩放,再加权求和并归一化:$$o_{ctx} = \frac{\sum_{i=1}^{N} w_i^q \odot o_i}{\sum_{i=1}^{N} w_i^q}$$ 其中 $M^i$ 是 Mask Predictor 预测的时空编辑掩码,$g_i$ 是 GateNet 输出的门控($g_i \approx 1$ 为局部编辑,$g_i \approx 0$ 为全局/风格编辑),$\beta=0.3$ 为混合强度。该设计有三段式行为:编辑区域内($M^i \to 1$)权重为 1,指令完全生效;局部编辑的非目标区域权重软衰减到 $1-\beta=0.7$,既抑制误改又避免硬零导致的不稳定;全局编辑权重退化为恒等于 1,全帧生效。整个机制复用预训练投影,不给 DiT 引入新参数。相比把指令拼接进单条提示(隐式推断区域、指令互相干扰)或在注意力 logits 上加硬掩码偏置(破坏预训练分布、损害物理自然度),这是在保持生成先验前提下的软性区域控制。

方法步骤详情

模型流程:给定源视频 $V$ 与 $N \ge 2$ 条指令,对每条 $I_i$ 拼接 $[V, I_i, \langle query\rangle_{1:L_q}]$ 送入 Qwen3-VL-8B,读取视觉 token $H^{vis}_i$ 与查询隐状态,经 MLP Connector 投影得到条件 $C_i$,供 DiT 交叉注意力、Mask Predictor 与 GateNet 三方共享。Mask Predictor 以 K 个可学习掩码查询经两个 transformer 块解码出掩码 $M^i \in \mathbb{R}^{T_v \times H_v \times W_v}$;GateNet 在平均池化的 $C_i$ 上用两层 MLP 输出门控 $g_i = \sigma(\mathrm{MLP}(\mathrm{Mean}(C_i)))$。DiT 侧把源视频 VAE 潜码 $x_0$ 与加噪潜码 $x_t$ 沿通道拼接以保留结构与运动,掩码经三线性重采样到潜网格后按 $w_i^q$ 调制交叉注意力输出。总损失 $\mathcal{L}_{total} = \lambda_{dit}\mathcal{L}_{dit} + \lambda_{seg}\mathcal{L}_{seg} + \lambda_{gate}\mathcal{L}_{gate}$,其中 $\mathcal{L}_{seg} = \mathcal{L}_{bce} + \mathcal{L}_{dice}$,辅助梯度在 MLLM 与 DiT 处截断。三阶段训练:特征对齐阶段冻结 DiT,只训查询 token、Connector 与 MLLM LoRA(rank 256),用约 200 万条 EditScore 大于 8.0 的图像编辑数据,学习率 $10^{-5}$、45K 步;单指令阶段解冻 DiT(LoRA rank 128),图文 1:1 混合约 90 万条视频对(OpenVE-3M/Ditto-1M/ReCo,EditScore 大于 6.0),最长 49 帧、batch 128、32.5K 步;组合微调阶段先离线训练 Mask Predictor(IoU 0.71)与 GateNet(准确率 0.95),再端到端微调,学习率 $5 \times 10^{-6}$、10K 步,共 32 块 H200。

技术新颖性

技术新颖性体现在四个层面。第一,任务定义新颖:把组合式指令视频编辑从单操作编辑中独立出来,强调多意图的联合分解、时空定位与互不干扰执行,直指现有数据集的空白。第二,数据合成范式新颖:用 MLLM 解析内容、模板组合原子指令、SAM3/SAM2 生成时空掩码、图像编辑器改关键帧、视频动画化模型扩展到全片、逐指令全过才保留的管线,把区域归属显式写进监督信号,平均质量分达 4.85,显著高于现有单指令数据集。第三,模型机制新颖:Q-Blending 在不增加 DiT 参数的前提下实现逐查询软加权,与 Q-Bias 消融对比证明硬偏置会损害尺度一致性(SC 89.64 对 91.17)和运动自然度(MN 91.95 对 95.30);GateNet 区分局部与全局编辑,避免风格化指令被掩码约束束缚或删除指令泄漏到全局。第四,训练策略新颖:图文混合训练缓解视频监督不足,辅助模块先离线训练再联合微调,稳定了控制头的收敛。整个方案把理解、定位、执行、验证闭合成环,而非单纯堆数据或堆参数。

Data construction pipeline of CoinVE-200K.
Figure 2: Data construction pipeline of CoinVE-200K.
Data statistics of CoinVE-200K.
Figure 3: Data statistics of CoinVE-200K.
An overview of the proposed CoinVE-Edit framework.
Figure 4: An overview of the proposed CoinVE-Edit framework.

实验结果

核心发现有三点。其一,单指令编辑上 CoinVE-Edit 在 OpenVE-Bench 取得 3.41 的开源最高总分(Gemini 2.5 Pro 评分),略低于闭源 Runway 3.51,但在 Background Change(3.11)和 Local Remove(3.81)等依赖精确定位的任务上优势明显,验证了掩码条件的价值。其二,组合编辑上 CoinVE-Bench 全面领先:编辑准确率 SA 87.97、SPA 89.45、EP 89.60,物理自然度 AN 91.85、SC 91.17、MN 95.30,语义保持 CP 90.83,全部超过开源最佳;SPA 超过最佳对手 Seedance 2.0 的 87.71 达 1.74,MN 95.30 高于 Kling O3 的 93.91,而视频质量指标(AQ 4.13、TQ 19.57、CQ 4.31、TS 0.72)与对手持平甚至并列最高,说明高编辑精度没有以画质为代价。其三,消融证明两个组件缺一不可:Instr.-Concat(去掉掩码与 Q-Blending)使 SA 降至 82.61、SPA 降至 84.43;Q-Bias(保留掩码但改用硬偏置)虽把 SPA 提到 85.49,却拉低 SC 至 89.64、MN 至 91.95。数据集本身六类原子操作分布均衡(局部添加 24.1%、背景替换 23.8%、物体替换 22.8%、局部删除 18.5%、背景风格化 6.4%、物体风格化 4.5%),2/3/4/5 条指令的视频分别占 57.7%/31.7%/8.5%/2.1%,平均每视频 2.55 条指令。

Evaluation matrix of CoinVE-Bench.
Table 1: Evaluation matrix of CoinVE-Bench.
Single-instruction video editing comparison on OpenVE-Bench evaluated by Gemini 2.5 Pro.
Table 2: Single-instruction video editing comparison on OpenVE-Bench evaluated by Gemini 2.5 Pro.
Compositional-Instruction Video Editing Comparisons on CoinVE-Bench.
Table 3: Compositional-Instruction Video Editing Comparisons on CoinVE-Bench.
Performance comparison among different variants of CoinVE-Edit on CoinVE-Bench.
Table 4: Performance comparison among different variants of CoinVE-Edit on CoinVE-Bench.
Quality comparison of single-instruction video editing on OpenVE-Bench.
Figure 5: Quality comparison of single-instruction video editing on OpenVE-Bench.
Quality comparison of compositional-instruction video editing on CoinVE-Bench.
Figure 6: Quality comparison of compositional-instruction video editing on CoinVE-Bench.
Visualization of predicted editing mask of each instruction for two editing examples.
Figure 7: Visualization of predicted editing mask of each instruction for two editing examples.
查看结构化数据
任务指标本文基线提升
组合式指令视频编辑 编辑范围准确率 SPA 89.45 Seedance 2.0(闭源最佳)87.71 +1.74
组合式指令视频编辑 语义准确率 SA 87.97 Kling O3 86.91 / Seedance 2.0 85.34 +1.06(对最强闭源)
组合式指令视频编辑 运动自然度 MN 95.30 Kling O3 93.91 +1.39
单指令视频编辑 OpenVE-Bench 总分 3.41 Runway 3.51(闭源);开源最佳 SAMA 3.33 开源第一,较开源最佳 +0.08
消融:去掉掩码与 Q-Blending SA / SPA 87.97 / 89.45 Instr.-Concat 82.61 / 84.43 +5.36 / +5.02
消融:硬掩码偏置替换软加权 SC / MN 91.17 / 95.30 Q-Bias 89.64 / 91.95 +1.53 / +3.35

局限与改进

作者承认的局限:CoinVE-200K 尚未覆盖参考图编辑、细粒度运动编辑和复杂相机控制等场景,长视频的高效组合编辑和高度交互场景仍然困难。我的补充观察:第一,数据管线深度依赖闭源模型——Qwen3.6-27B、SAM3、HunyuanImage-3.0、Nano Banana、Gemini 2.5 Pro,社区难以复现同等质量的数据;第二,逐指令全过才保留的保守过滤虽然把平均质量提到 4.85,但可能系统性淘汰难例(如大位移、严重遮挡的编辑),使数据分布偏向容易编辑的场景,模型在边界情形的泛化存疑;第三,基准只有 361 条视频,评测依赖 MLLM 清单打分,且评委(Gemini 3.6 Flash)与数据过滤同为 Gemini 系模型,可能存在评分偏差;第四,掩码由 SAM2 沿帧传播,在遮挡、出画、拓扑变化时掩码漂移会同时污染训练数据与推理条件;第五,每条指令需要对 MLLM 做一次前向,N 条指令意味着 N 次大模型前向,推理成本随指令数线性增长,22B 模型的部署门槛也不低。

独立分析的弱点

独立分析出的弱点及改进方向:其一,Q-Blending 权重 $w_i^q = 1-\beta g_i(1-M^i)$ 中的 $\beta=0.3$ 是全局固定超参,不同编辑类型(风格化对删除)可能需要不同强度,可改为按指令或按 DiT 层预测的自适应 $\beta_i$;其二,Mask Predictor 的 IoU 仅 0.71,对眼镜、项链等细小物体和边界模糊区域误差较大,可引入迭代掩码精化或用 SAM 类模型做蒸馏提升;其三,指令间相互依赖(先删 A 再在原位加 B)未被显式建模,掩码独立预测可能产生冲突,可加入指令间掩码一致性约束或顺序推理机制;其四,关键帧由 Nano Banana 等图像编辑器生成,其错误会被动画化模型放大到全片,可增加关键帧-视频一致性校验或对失败片段做局部重生成;其五,指令组合空间随指令数指数增长,数据集中 5 条指令仅占 2.1%,复杂组合的覆盖不足,可开发程序化指令组合生成与主动采样策略;其六,评测评委与数据过滤同用 Gemini 系模型,建议引入人工评测与多评委交叉验证来校准偏差。

未来方向

作者提出的方向包括:扩展编辑分类学以覆盖参考图编辑、细粒度运动编辑与复杂相机控制;提升长程时序一致性;降低模型成本;发展统一的视频编辑智能体。在此基础上可延伸的研究:第一,把逐指令掩码条件推广到开放词表与指代消解场景,支持把左边那个人这类需要推理的定位表述;第二,探索指令间因果与顺序建模,让模型理解删除后腾出的位置可以添加新物体这类组合逻辑;第三,用强化学习或基于 CoinVE-Bench 清单的奖励做偏好优化,直接优化逐指令执行率而非代理损失;第四,把 22B 模型蒸馏到可部署规模,或通过缓存与并行化降低 MLLM 的 N 次前向开销;第五,用开源模型替换数据管线中的闭源组件并开源完整管线,形成可复现的数据引擎;第六,向长视频与流式编辑延伸,研究分段编辑间的时序记忆机制;第七,结合多轮交互,支持用户在对话中逐步追加、修改和撤销编辑指令。

复现评估

复现难度评估:数据集已在 HuggingFace 开放(FireCRT/CoinVE-200K),项目页为 coinve200k.github.io,这对下游研究是重大利好——不需要自己跑数据管线即可拿到 20 万条训练数据。但端到端复现门槛很高:训练共用了 32 块 NVIDIA H200,三阶段累计约 8.75 万优化步,估算需要数百 GPU 天,普通实验室难以承担;数据管线中的 Nano Banana、Gemini 2.5 Pro、SAM3、Qwen3.6-27B、HunyuanImage-3.0 等组件部分闭源或收费,完整复刻数据生成不可行;论文未明确说明模型代码与权重的开源计划,CoinVE-Edit 的推理与训练代码可得性存疑;评测依赖 Gemini 系评委与多个专用评估器(DOVER++、VisualQuality-R1、Aesthetic Predictor v2.5),闭源评委也会带来结果波动。务实的复现路径是:用公开的 CoinVE-200K 数据在较小的 DiT 骨干上复现 Q-Blending 与三阶段训练策略,先验证方法核心思想,再考虑扩展规模。