← 返回 2026-07-17

KeyFrame-Compass:关键帧条件视频生成的综合评测基准 KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang 📅 2026-07-15 👍 42 2026-07-22 18:54
关键帧条件生成 基准测试 多模态大模型评判 视频生成评测 音频-视频联合评估

首个多关键帧条件视频生成评测基准,含386样本、6项关键帧指标与4维质量评估。

前置知识

多关键帧条件视频生成(Multi-keyframe-conditioned video generation)

指模型以「一串有序参考图像 + 文本提示」为输入,生成一段视频,要求在指定时刻逐一复现这些关键帧,并在相邻关键帧之间合成自然过渡。它区别于传统单图条件生成,需要同时完成视觉保持、时序定位、序列排序和运动合成。

这是 KeyFrame-Compass 要评测的下游任务本身,不理解「保留整个有序序列」这一目标,就无法理解它为什么要把指标拆成 6 个维度。

关键帧匹配流水线(Keyframe matching pipeline)

评测核心机制:先用 MLLM(Gemini 3.1 Pro)推断生成视频真实分镜,把每个输入关键帧映射到对应片段并推导期望时间窗;再用 DINOv3 语义相似度(阈值 $\gamma=0.80$)与 PSNR/SSIM 像素阈值联合筛候选;最后在窗内取 DINOv3 最高者为规范匹配。

它解决了「生成视频不一定遵守一帧一镜假设」这一根本难题,是 6 项关键帧指标能稳定计算的前提。

MLLM-as-judge(多模态大模型作为评判器)

用 GPT-5.5 从指标 checklist 生成可观测条目,再用 Gemini 3.1 Pro 按评分准则(rubric)逐条核对打分。本文进一步把它与专用感知模型(DINOv3、SAM 3.1、MonST3R、CLAP 等)的辅助信号融合,形成「证据落地」的评判。

通用质量 4 维指标(视频质量、时空一致性、指令遵循、音视协调)都依赖这套评判机制,理解其稳定性与局限才能正确解读榜单。

DINOv3 与 PSNR/SSIM 相似度

DINOv3 通过对空间 patch token 做平均池化并 L2 归一化,得到对语义/内容变化鲁棒的余弦相似度;PSNR/SSIM 则刻画像素级保真。本文按 $q_i = 0.4\,s^{pix}_i + 0.6\,c^{dino}_i$ 把两者融合,既看「像不像」又看「是不是同一帧」。

这是判断「关键帧是否被忠实复现」的底层度量,阈值校准(等错误率 $0.7837$)直接决定 Hit Rate 等指标的可信度。

Kendall 秩相关系数 $\tau$

一种衡量两个排列一致性的非参数指标,取值 $[-1,1]$。本文用它比较「输入关键帧顺序」与「匹配帧出现时间顺序」的一致性,并归一化为 $\mathrm{KOC}=(\tau+1)/2\in[0,1]$。

Keyframe Order Consistency(KOC)依赖它来诊断「关键帧顺序是否被打乱」,是时序组织维度的数学基础。

Storyboard grid(故事板网格)输入格式

把同一序列的关键帧拼成一张图喂给只接受单图输入的模型,与「多图列表」相对。两种格式内容、顺序完全一致,用于在不同条件接口间做受控对比。

论文发现多数开源模型无法把网格「拆解」成有序镜头,常整张复现为近静态视频——这是开源模型的核心失败模式之一。

研究动机

当前视频生成越来越依赖关键帧工作流:创作者先用图像生成工具排定关键画面,再让模型把它变成连贯视频。但现有评测体系无法回答「这一整串关键帧是否被按正确顺序、在正确时刻、忠实复现」。通用视频基准(VBench、EvalCrafter、TC-Bench、VBench-2.0)只关心感知质量、时序一致性、提示遵循;图像条件基准(AIGCBench、UI2V-Bench)聚焦单图保持,VideoCanvasBench、ViStoryBench 虽扩展到故事可视化,却仍以视觉条件保持或图像序列连贯为目标,没有把「有序关键帧在指定时间窗被复现」作为显式维度(见表 1 的逐项对比)。多关键帧生成还暴露出多种互不相同的失败模式——关键帧被遗漏、复现失真、时间错位、顺序颠倒、过渡不自然——它们源自视觉保持、时序定位、序列排序、运动合成等不同能力,用一个对齐分数根本无法区分。

本文的目标是作者要打造第一个专门面向「多关键帧条件视频生成」的诊断式基准 KeyFrame-Compass:包含 386 个精挑样本,沿 5 个可控因子(视频结构 one-take/multi-shot、关键帧数 3/6/9/12、提示粒度 minimal/segment-specific、条件接口 multi-image list/storyboard grid、应用域 daily/product/cinematic)做分层评测;并把关键帧执行拆成 6 个可测维度(presence、fidelity、ordering、localization、persistence、uniqueness),同时用 MLLM 评判 + 专用感知模型评估整体质量,最终在 9 个代表性系统上揭示系统性能力短板与失败模式。

与已有工作不同的是,本文的独特切入在于「把对齐拆开 + 把评判落地」。区别于前人用一个端到端对齐分,它把关键帧执行分解成 6 个互补指标,分别对应不同的底层能力;并提出一套分阶段匹配流水线,先让 MLLM 还原生成视频真实分镜结构(而非假设一帧一镜),再在期望时间窗内联合 DINOv3/PSNR/SSIM 定位规范匹配帧,从而容忍「模型不一定照搬结构」这一现实。同时它把 MLLM 评判与专用模型(DINOv3、SAM 3.1、MonST3R、CLAP、ImageBind 等)证据融合,并率先支持 storyboard-grid 输入与音频-视频联合评估(见表 1)。

核心方法

整体思路是「先直觉、后技术」:直觉上,一个好的关键帧条件视频必须同时满足两条彼此独立的轴线——是否照着关键帧计划走、是否本身质量过硬。作者据此把评测切成两大指标组:关键帧响应(6 项)与通用质量(4 维)。技术路线上,先把叙事数据转成结构化场景规范,用 GPT-Image-2 与 Nano Banana Pro 生成关键帧候选,经多模态一致性校验、人工复核与安全过滤后,由 Gemini 3.1 Pro 改写成视频提示;评测时跑分阶段匹配流水线定位每帧,再算 6 项关键帧指标,并用 checklist 协议让 GPT-5.5 出题、Gemini 3.1 Pro 评分,融合专用感知模型证据得到 4 维质量分,全部归一化到 $[0,1]$。

核心创新在于「关键帧执行六维分解 + 证据落地式 MLLM 评判」。与传统基准把保真压成一个分不同,它显式拆出 Hit Rate(是否出现)、Keyframe Similarity(复现得多像)、Order Consistency(顺序对不对)、Position Accuracy(时间准不准)、Persistence(持续够不够)、Response Uniqueness(是否唯一出现)六个维度,分别诊断不同失败模式。另一个本质区别是匹配流水线不假设生成视频遵守一帧一镜,而是先用 Gemini 3.1 Pro 还原真实分镜,再分 one-to-one / multi-to-one / unassigned 三类推导期望时间窗,在窗内按 $c^{dino}\geq 0.80$ 且($\mathrm{PSNR}\geq 12$ 或 $\mathrm{SSIM}\geq 0.65$)筛候选、取 DINOv3 最高者为规范匹配,从而既容忍结构漂移又保证定位可信。

方法步骤详情

完整流程分四步。①数据构造:从 ViStoryBench、VIST、ROCStories 及真实视频转录取得叙事源,转成含分镜、时间布局、关键帧位置与电影注释的结构化场景规范;用 GPT-Image-2 与 Nano Banana Pro 生成候选关键帧,经多模态一致性校验、人工复核与安全筛查后确定,再由 Gemini 3.1 Pro 改写成 minimal 与 segment-specific 两版视频提示。②匹配流水线:先用 Gemini 3.1 Pro 还原生成视频实际分镜并给每帧指派期望时间窗,再在窗内按 DINOv3≥0.80 且(PSNR≥12 dB 或 SSIM≥0.65)筛候选,取最高者为规范匹配,无合格者记为未匹配。③指标计算:在匹配基础上算 6 项关键帧指标;质量侧由 GPT-5.5 出题、Gemini 3.1 Pro 评分,并融合 DINOv3、SAM 3.1、MonST3R、CLAP 等感知证据。④聚合:每个提示模式内关键帧保真与时序组织先相乘再并入组平均,总体分取两模式均值;统一 8 FPS 采样,阈值在 50 样本留出集按等错误率校准,部署用 0.80。

技术新颖性

技术新颖性体现在三处。其一,首次提出可分解的六维关键帧响应指标,每维对应一种独立失败模式(遗漏、失真、错序、错时、flash/freeze、重复出现),告别单一对齐分。其二,分阶段匹配流水线用 MLLM 还原真实分镜再定位,解决了「生成结构与预期不符」这一长期被忽略的工程难题,并通过 DINOv3+PSNR/SSIM 双阈值与等错误率校准保证判定稳健;KFS 对像素参数的敏感性测试显示均值变化不超过 $0.0244$、与默认设置的 Spearman 相关最低 $0.997$。其三,证据落地的评判范式:GPT-5.5 出题、Gemini 3.1 Pro 评分,并按指标特定权重融合专用模型证据(如 MonST3R 把相机运动转成语义描述以排除「相机位移造成的假性主体漂移」),还引入 CLAP/ImageBind/JavisScore 三种音视对齐度量。相对表 1 所列 AIGCBench、ViStoryBench、MSVBench 等,它是唯一同时具备显式关键帧响应指标、多粒度提示控制、storyboard-grid 支持与音视频度量的基准。

Overview of KeyFrame-Compass.
Figure 2: Overview of KeyFrame-Compass.
Data construction of KeyFrame-Compass.
Figure 3: Data construction of KeyFrame-Compass.
Keyframe matching pipeline of KeyFrame-Compass.
Figure 4: Keyframe matching pipeline of KeyFrame-Compass.
Dataset statistics of KeyFrame-Compass.
Figure 5: Dataset statistics of KeyFrame-Compass.

实验结果

核心发现是一条贯穿始终的权衡:忠实复现关键帧与生成自然视频难以兼得,没有系统在两条轴线同时最优。在 115 个样本的短视频联合榜上 Seedance 2.0 以总体分 0.807 居首,领先 Gemini-Omni-Flash 0.063,时空一致性与指令遵循均第一;而 LTX-2.3 虽在关键帧保真(0.855)与时序组织(0.899)双第一,总体分却仅 0.659;Gemini-Omni-Flash 正相反,视频质量(0.861)与音视协调(0.640)第一,但关键帧相似度仅 0.371——单看保真会选 LTX-2.3、单看质量会选 Gemini,联合评估才选出 Seedance,证明三种能力不可互换。指令遵循随关键帧密度单调下降:3/6/9&12 帧的指令分依次为 0.849、0.818、0.756。开源模型存在故事板网格理解鸿沟:其余开源命中率均低于 0.28,最强开源与领先闭源总体分差 0.153。人机对齐 5 模型 Spearman ρs 落在 [0.70,1.00],指令遵循达 1.00(p=0.017),多模态评判 5 次重复标准差仅约 0.001。

Comparisons between KeyFrame-Compass and relative image-conditioned video generation benchmarks.
Table 1: Comparisons between KeyFrame-Compass and relative image-conditioned video generation benchmarks.
Distribution of samples across video structure, duration, and application domain.
Table 2: Distribution of samples across video structure, duration, and application domain.
Short-video leaderboard of joint audio-video generation models.
Table 3: Short-video leaderboard of joint audio-video generation models.
Per-metric results grouped by video duration.
Table 4: Per-metric results grouped by video duration.
Instruction-adherence scores by keyframe count under segment-specific prompts.
Table 5: Instruction-adherence scores by keyframe count under segment-specific prompts.
Descriptive model-level rank alignment between human win rates and automatic scores.
Table 6: Descriptive model-level rank alignment between human win rates and automatic scores.
Repeated-run stability of the MLLM-judged metric groups.
Table 7: Repeated-run stability of the MLLM-judged metric groups.
Representative failure modes of open-source models.
Figure 6: Representative failure modes of open-source models.
查看结构化数据
任务指标本文基线提升
短视频联合音视频生成总体能力 Overall(两 prompt mode 均值,归一化到[0,1]) Seedance 2.0 = 0.807 Gemini-Omni-Flash = 0.744(第二名) 领先第二名 0.063,且在时空一致性与指令遵循均第一
关键帧保真(短视频) Keyframe Fidelity LTX-2.3 = 0.855 Seedance 2.0 = 0.807、Gemini-Omni-Flash = 0.483 LTX-2.3 关键帧保真全场第一,但因视频质量低 Overall 仅 0.659,揭示权衡
视频静态/动态质量 Video Quality Gemini-Omni-Flash = 0.861 LTX-2.3 = 0.557(segment)/ 0.453 DVQ(minimal) Gemini 视频质量第一但关键帧保真仅 0.483,证明两种能力正交
指令遵循随关键帧密度变化 Instruction(VMA 与 AMA 均值) 3 帧时 0.849,9&12 帧时降至 0.756 同模型在 3 帧设置 密度增大导致 VMA 从 0.861 跌到 0.682,AMA 稳定在约 0.83
人机对齐(5 模型排序) Spearman ρs(人 vs 自动) Instruction Adherence ρs=1.00(p=0.017) AV Coordination ρs=0.70(p=0.233,最弱) 四维 ρs 在 0.70–1.00,Overall 0.90,验证自动榜单可信
关键帧复现命中率(开源模型) Hit Rate(segment-specific) LTX-2.3 = 0.967 daVinci 0.270 / HunyuanVideo 0.232 / SkyReels 0.272 其余开源均 <0.28,暴露 storyboard-grid 拆解能力缺失

局限与改进

论文本身未单设 Limitations 小节,短板散见于分析与我的独立观察。其一,整套评测高度依赖闭源 MLLM 评判(GPT-5.5 出题、Gemini 3.1 Pro 评分),存在潜在模型偏好与版本漂移——虽 5 次重复标准差仅约 $0.001$,但跨 judge 模型的系统性偏差未被检验。其二,样本规模 386 相对 AIGCBench 的 3928 偏小,长视频 split 仅 2 个 agent 模型参与,统计功效有限。其三,关键帧相似度阈值仅在 4 个闭源模型 50 个留出样本上校准($\gamma^\star=0.7837$),是否覆盖开源失败分布未验证。其四,关键帧由 GPT-Image-2 与 Nano Banana Pro 生成,可能引入与某些被评模型相近的美学/风格偏置。其五,人机对齐仅 60 案例、5 模型,除 Instruction Adherence($p=0.017$)外其余维度 $p>0.05$,显著性偏弱。其六,9 个被评系统中 7 个为闭源 API,社区难独立复跑全部榜单。

独立分析的弱点

独立来看有几处可改进。①对闭源 MLLM judge 的强依赖:评分质量随 GPT/Gemini 版本变化,且可能与某被评模型同源造成偏好,改进方向是用多 judge 交叉验证、并增加可对齐的感知模型证据占比,或训练专用判别器。②样本与覆盖偏小:386 案例、长视频仅 2 模型,对边缘场景统计力不足,应扩充样本并纳入更多开源与长视频模型。③阈值校准偏闭源:在开源失败模式(如网格整张复现)上阈值未必最优,可在更广模型分布上重校或做按模型自适应阈值。④关键帧由 AI 生成带来的分布偏置:建议补充真实拍摄/人工绘制关键帧子集做对照。⑤开源 storyboard-grid 理解短板虽被诊断但未被量化到训练数据层面:可加「网格拆解成功率」作为独立可控指标,并设计不同网格排版(行数/间距/顺序方向)的扰动实验。⑥音视频指标要求模型支持音频,多数开源静音导致 AV Coordination 缺失,可用文本到音频后处理统一补齐再评。

未来方向

作者方向包括:把基准做成持续维护的「活基准」跟踪模型迭代、进一步研究开源模型 storyboard-grid 拆解能力缺失是训练数据还是模型容量问题。基于该成果可延伸的方向:①扩展到更长的分钟级视频与多语言/多文化叙事,验证时序组织指标的可扩展性;②加入交互式/可编辑关键帧条件(局部重绘、关键帧插值)的评测;③把六维分解思路迁移到其他序列条件任务(如分镜到长文、多视角生成);④用本基准的细粒度信号做强化学习或 DPO 微调,针对性提升 transition 合成与 storyboard 理解;⑤研究「语义参考 vs 视觉锚点」两种生成偏好(Seedance vs Gemini)的最优融合策略,让单一模型兼具保真与质量。

复现评估

可复现性中等偏上但有门槛。论文提供主页 https://github.com/cactusqq/KeyFrame-Compass ,但 2026-07-15 刚发布,代码/数据完整发布状态未知;好处是方法论细节都写明:提示模板见附录 E.1,匹配阈值与 KFS 公式见附录 B($\tau_p=12$ dB、$\tau_s=0.65$、PSNR 饱和 50 dB、$w_{pix}=0.4,w_{dino}=0.6$、$\gamma=0.80$),checklist 与 rubric 见 E.3/E.4,采样 8 FPS,5 次重复稳定性与 KFS 敏感性均有报告。难点在于:judge 与感知链依赖 GPT-5.5、Gemini 3.1 Pro 及 DINOv3/SAM 3.1/MonST3R/CLAP 等多模型;9 个被评系统里 7 个是闭源付费 API(Kling、Seedance、Wan2.7、Gemini 等),算力与 API 成本可观,关键帧由 GPT-Image-2、Nano Banana Pro 生成需重跑与人工复核。综合看方法层面可复现、数据与榜单层面受模型可得性制约。