KeyFrame-Compass:关键帧条件视频生成的综合评测基准 KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
首个多关键帧条件视频生成评测基准,含386样本、6项关键帧指标与4维质量评估。
前置知识
多关键帧条件视频生成(Multi-keyframe-conditioned video generation)
指模型以「一串有序参考图像 + 文本提示」为输入,生成一段视频,要求在指定时刻逐一复现这些关键帧,并在相邻关键帧之间合成自然过渡。它区别于传统单图条件生成,需要同时完成视觉保持、时序定位、序列排序和运动合成。
这是 KeyFrame-Compass 要评测的下游任务本身,不理解「保留整个有序序列」这一目标,就无法理解它为什么要把指标拆成 6 个维度。
关键帧匹配流水线(Keyframe matching pipeline)
评测核心机制:先用 MLLM(Gemini 3.1 Pro)推断生成视频真实分镜,把每个输入关键帧映射到对应片段并推导期望时间窗;再用 DINOv3 语义相似度(阈值 $\gamma=0.80$)与 PSNR/SSIM 像素阈值联合筛候选;最后在窗内取 DINOv3 最高者为规范匹配。
它解决了「生成视频不一定遵守一帧一镜假设」这一根本难题,是 6 项关键帧指标能稳定计算的前提。
MLLM-as-judge(多模态大模型作为评判器)
用 GPT-5.5 从指标 checklist 生成可观测条目,再用 Gemini 3.1 Pro 按评分准则(rubric)逐条核对打分。本文进一步把它与专用感知模型(DINOv3、SAM 3.1、MonST3R、CLAP 等)的辅助信号融合,形成「证据落地」的评判。
通用质量 4 维指标(视频质量、时空一致性、指令遵循、音视协调)都依赖这套评判机制,理解其稳定性与局限才能正确解读榜单。
DINOv3 与 PSNR/SSIM 相似度
DINOv3 通过对空间 patch token 做平均池化并 L2 归一化,得到对语义/内容变化鲁棒的余弦相似度;PSNR/SSIM 则刻画像素级保真。本文按 $q_i = 0.4\,s^{pix}_i + 0.6\,c^{dino}_i$ 把两者融合,既看「像不像」又看「是不是同一帧」。
这是判断「关键帧是否被忠实复现」的底层度量,阈值校准(等错误率 $0.7837$)直接决定 Hit Rate 等指标的可信度。
Kendall 秩相关系数 $\tau$
一种衡量两个排列一致性的非参数指标,取值 $[-1,1]$。本文用它比较「输入关键帧顺序」与「匹配帧出现时间顺序」的一致性,并归一化为 $\mathrm{KOC}=(\tau+1)/2\in[0,1]$。
Keyframe Order Consistency(KOC)依赖它来诊断「关键帧顺序是否被打乱」,是时序组织维度的数学基础。
Storyboard grid(故事板网格)输入格式
把同一序列的关键帧拼成一张图喂给只接受单图输入的模型,与「多图列表」相对。两种格式内容、顺序完全一致,用于在不同条件接口间做受控对比。
论文发现多数开源模型无法把网格「拆解」成有序镜头,常整张复现为近静态视频——这是开源模型的核心失败模式之一。
研究动机
当前视频生成越来越依赖关键帧工作流:创作者先用图像生成工具排定关键画面,再让模型把它变成连贯视频。但现有评测体系无法回答「这一整串关键帧是否被按正确顺序、在正确时刻、忠实复现」。通用视频基准(VBench、EvalCrafter、TC-Bench、VBench-2.0)只关心感知质量、时序一致性、提示遵循;图像条件基准(AIGCBench、UI2V-Bench)聚焦单图保持,VideoCanvasBench、ViStoryBench 虽扩展到故事可视化,却仍以视觉条件保持或图像序列连贯为目标,没有把「有序关键帧在指定时间窗被复现」作为显式维度(见表 1 的逐项对比)。多关键帧生成还暴露出多种互不相同的失败模式——关键帧被遗漏、复现失真、时间错位、顺序颠倒、过渡不自然——它们源自视觉保持、时序定位、序列排序、运动合成等不同能力,用一个对齐分数根本无法区分。
本文的目标是作者要打造第一个专门面向「多关键帧条件视频生成」的诊断式基准 KeyFrame-Compass:包含 386 个精挑样本,沿 5 个可控因子(视频结构 one-take/multi-shot、关键帧数 3/6/9/12、提示粒度 minimal/segment-specific、条件接口 multi-image list/storyboard grid、应用域 daily/product/cinematic)做分层评测;并把关键帧执行拆成 6 个可测维度(presence、fidelity、ordering、localization、persistence、uniqueness),同时用 MLLM 评判 + 专用感知模型评估整体质量,最终在 9 个代表性系统上揭示系统性能力短板与失败模式。
与已有工作不同的是,本文的独特切入在于「把对齐拆开 + 把评判落地」。区别于前人用一个端到端对齐分,它把关键帧执行分解成 6 个互补指标,分别对应不同的底层能力;并提出一套分阶段匹配流水线,先让 MLLM 还原生成视频真实分镜结构(而非假设一帧一镜),再在期望时间窗内联合 DINOv3/PSNR/SSIM 定位规范匹配帧,从而容忍「模型不一定照搬结构」这一现实。同时它把 MLLM 评判与专用模型(DINOv3、SAM 3.1、MonST3R、CLAP、ImageBind 等)证据融合,并率先支持 storyboard-grid 输入与音频-视频联合评估(见表 1)。
核心方法
整体思路是「先直觉、后技术」:直觉上,一个好的关键帧条件视频必须同时满足两条彼此独立的轴线——是否照着关键帧计划走、是否本身质量过硬。作者据此把评测切成两大指标组:关键帧响应(6 项)与通用质量(4 维)。技术路线上,先把叙事数据转成结构化场景规范,用 GPT-Image-2 与 Nano Banana Pro 生成关键帧候选,经多模态一致性校验、人工复核与安全过滤后,由 Gemini 3.1 Pro 改写成视频提示;评测时跑分阶段匹配流水线定位每帧,再算 6 项关键帧指标,并用 checklist 协议让 GPT-5.5 出题、Gemini 3.1 Pro 评分,融合专用感知模型证据得到 4 维质量分,全部归一化到 $[0,1]$。
核心创新在于「关键帧执行六维分解 + 证据落地式 MLLM 评判」。与传统基准把保真压成一个分不同,它显式拆出 Hit Rate(是否出现)、Keyframe Similarity(复现得多像)、Order Consistency(顺序对不对)、Position Accuracy(时间准不准)、Persistence(持续够不够)、Response Uniqueness(是否唯一出现)六个维度,分别诊断不同失败模式。另一个本质区别是匹配流水线不假设生成视频遵守一帧一镜,而是先用 Gemini 3.1 Pro 还原真实分镜,再分 one-to-one / multi-to-one / unassigned 三类推导期望时间窗,在窗内按 $c^{dino}\geq 0.80$ 且($\mathrm{PSNR}\geq 12$ 或 $\mathrm{SSIM}\geq 0.65$)筛候选、取 DINOv3 最高者为规范匹配,从而既容忍结构漂移又保证定位可信。
方法步骤详情
完整流程分四步。①数据构造:从 ViStoryBench、VIST、ROCStories 及真实视频转录取得叙事源,转成含分镜、时间布局、关键帧位置与电影注释的结构化场景规范;用 GPT-Image-2 与 Nano Banana Pro 生成候选关键帧,经多模态一致性校验、人工复核与安全筛查后确定,再由 Gemini 3.1 Pro 改写成 minimal 与 segment-specific 两版视频提示。②匹配流水线:先用 Gemini 3.1 Pro 还原生成视频实际分镜并给每帧指派期望时间窗,再在窗内按 DINOv3≥0.80 且(PSNR≥12 dB 或 SSIM≥0.65)筛候选,取最高者为规范匹配,无合格者记为未匹配。③指标计算:在匹配基础上算 6 项关键帧指标;质量侧由 GPT-5.5 出题、Gemini 3.1 Pro 评分,并融合 DINOv3、SAM 3.1、MonST3R、CLAP 等感知证据。④聚合:每个提示模式内关键帧保真与时序组织先相乘再并入组平均,总体分取两模式均值;统一 8 FPS 采样,阈值在 50 样本留出集按等错误率校准,部署用 0.80。
技术新颖性
技术新颖性体现在三处。其一,首次提出可分解的六维关键帧响应指标,每维对应一种独立失败模式(遗漏、失真、错序、错时、flash/freeze、重复出现),告别单一对齐分。其二,分阶段匹配流水线用 MLLM 还原真实分镜再定位,解决了「生成结构与预期不符」这一长期被忽略的工程难题,并通过 DINOv3+PSNR/SSIM 双阈值与等错误率校准保证判定稳健;KFS 对像素参数的敏感性测试显示均值变化不超过 $0.0244$、与默认设置的 Spearman 相关最低 $0.997$。其三,证据落地的评判范式:GPT-5.5 出题、Gemini 3.1 Pro 评分,并按指标特定权重融合专用模型证据(如 MonST3R 把相机运动转成语义描述以排除「相机位移造成的假性主体漂移」),还引入 CLAP/ImageBind/JavisScore 三种音视对齐度量。相对表 1 所列 AIGCBench、ViStoryBench、MSVBench 等,它是唯一同时具备显式关键帧响应指标、多粒度提示控制、storyboard-grid 支持与音视频度量的基准。
实验结果
核心发现是一条贯穿始终的权衡:忠实复现关键帧与生成自然视频难以兼得,没有系统在两条轴线同时最优。在 115 个样本的短视频联合榜上 Seedance 2.0 以总体分 0.807 居首,领先 Gemini-Omni-Flash 0.063,时空一致性与指令遵循均第一;而 LTX-2.3 虽在关键帧保真(0.855)与时序组织(0.899)双第一,总体分却仅 0.659;Gemini-Omni-Flash 正相反,视频质量(0.861)与音视协调(0.640)第一,但关键帧相似度仅 0.371——单看保真会选 LTX-2.3、单看质量会选 Gemini,联合评估才选出 Seedance,证明三种能力不可互换。指令遵循随关键帧密度单调下降:3/6/9&12 帧的指令分依次为 0.849、0.818、0.756。开源模型存在故事板网格理解鸿沟:其余开源命中率均低于 0.28,最强开源与领先闭源总体分差 0.153。人机对齐 5 模型 Spearman ρs 落在 [0.70,1.00],指令遵循达 1.00(p=0.017),多模态评判 5 次重复标准差仅约 0.001。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 短视频联合音视频生成总体能力 | Overall(两 prompt mode 均值,归一化到[0,1]) | Seedance 2.0 = 0.807 | Gemini-Omni-Flash = 0.744(第二名) | 领先第二名 0.063,且在时空一致性与指令遵循均第一 |
| 关键帧保真(短视频) | Keyframe Fidelity | LTX-2.3 = 0.855 | Seedance 2.0 = 0.807、Gemini-Omni-Flash = 0.483 | LTX-2.3 关键帧保真全场第一,但因视频质量低 Overall 仅 0.659,揭示权衡 |
| 视频静态/动态质量 | Video Quality | Gemini-Omni-Flash = 0.861 | LTX-2.3 = 0.557(segment)/ 0.453 DVQ(minimal) | Gemini 视频质量第一但关键帧保真仅 0.483,证明两种能力正交 |
| 指令遵循随关键帧密度变化 | Instruction(VMA 与 AMA 均值) | 3 帧时 0.849,9&12 帧时降至 0.756 | 同模型在 3 帧设置 | 密度增大导致 VMA 从 0.861 跌到 0.682,AMA 稳定在约 0.83 |
| 人机对齐(5 模型排序) | Spearman ρs(人 vs 自动) | Instruction Adherence ρs=1.00(p=0.017) | AV Coordination ρs=0.70(p=0.233,最弱) | 四维 ρs 在 0.70–1.00,Overall 0.90,验证自动榜单可信 |
| 关键帧复现命中率(开源模型) | Hit Rate(segment-specific) | LTX-2.3 = 0.967 | daVinci 0.270 / HunyuanVideo 0.232 / SkyReels 0.272 | 其余开源均 <0.28,暴露 storyboard-grid 拆解能力缺失 |
局限与改进
论文本身未单设 Limitations 小节,短板散见于分析与我的独立观察。其一,整套评测高度依赖闭源 MLLM 评判(GPT-5.5 出题、Gemini 3.1 Pro 评分),存在潜在模型偏好与版本漂移——虽 5 次重复标准差仅约 $0.001$,但跨 judge 模型的系统性偏差未被检验。其二,样本规模 386 相对 AIGCBench 的 3928 偏小,长视频 split 仅 2 个 agent 模型参与,统计功效有限。其三,关键帧相似度阈值仅在 4 个闭源模型 50 个留出样本上校准($\gamma^\star=0.7837$),是否覆盖开源失败分布未验证。其四,关键帧由 GPT-Image-2 与 Nano Banana Pro 生成,可能引入与某些被评模型相近的美学/风格偏置。其五,人机对齐仅 60 案例、5 模型,除 Instruction Adherence($p=0.017$)外其余维度 $p>0.05$,显著性偏弱。其六,9 个被评系统中 7 个为闭源 API,社区难独立复跑全部榜单。
独立分析的弱点
独立来看有几处可改进。①对闭源 MLLM judge 的强依赖:评分质量随 GPT/Gemini 版本变化,且可能与某被评模型同源造成偏好,改进方向是用多 judge 交叉验证、并增加可对齐的感知模型证据占比,或训练专用判别器。②样本与覆盖偏小:386 案例、长视频仅 2 模型,对边缘场景统计力不足,应扩充样本并纳入更多开源与长视频模型。③阈值校准偏闭源:在开源失败模式(如网格整张复现)上阈值未必最优,可在更广模型分布上重校或做按模型自适应阈值。④关键帧由 AI 生成带来的分布偏置:建议补充真实拍摄/人工绘制关键帧子集做对照。⑤开源 storyboard-grid 理解短板虽被诊断但未被量化到训练数据层面:可加「网格拆解成功率」作为独立可控指标,并设计不同网格排版(行数/间距/顺序方向)的扰动实验。⑥音视频指标要求模型支持音频,多数开源静音导致 AV Coordination 缺失,可用文本到音频后处理统一补齐再评。
未来方向
作者方向包括:把基准做成持续维护的「活基准」跟踪模型迭代、进一步研究开源模型 storyboard-grid 拆解能力缺失是训练数据还是模型容量问题。基于该成果可延伸的方向:①扩展到更长的分钟级视频与多语言/多文化叙事,验证时序组织指标的可扩展性;②加入交互式/可编辑关键帧条件(局部重绘、关键帧插值)的评测;③把六维分解思路迁移到其他序列条件任务(如分镜到长文、多视角生成);④用本基准的细粒度信号做强化学习或 DPO 微调,针对性提升 transition 合成与 storyboard 理解;⑤研究「语义参考 vs 视觉锚点」两种生成偏好(Seedance vs Gemini)的最优融合策略,让单一模型兼具保真与质量。
复现评估
可复现性中等偏上但有门槛。论文提供主页 https://github.com/cactusqq/KeyFrame-Compass ,但 2026-07-15 刚发布,代码/数据完整发布状态未知;好处是方法论细节都写明:提示模板见附录 E.1,匹配阈值与 KFS 公式见附录 B($\tau_p=12$ dB、$\tau_s=0.65$、PSNR 饱和 50 dB、$w_{pix}=0.4,w_{dino}=0.6$、$\gamma=0.80$),checklist 与 rubric 见 E.3/E.4,采样 8 FPS,5 次重复稳定性与 KFS 敏感性均有报告。难点在于:judge 与感知链依赖 GPT-5.5、Gemini 3.1 Pro 及 DINOv3/SAM 3.1/MonST3R/CLAP 等多模型;9 个被评系统里 7 个是闭源付费 API(Kling、Seedance、Wan2.7、Gemini 等),算力与 API 成本可观,关键帧由 GPT-Image-2、Nano Banana Pro 生成需重跑与人工复核。综合看方法层面可复现、数据与榜单层面受模型可得性制约。
论文图表
展示基准覆盖三大应用域(daily capture、product visualization、cinematic narrative)与真实/风格化两类视觉内容,每个测试用例给出一组有序关键帧,要求生成视频在指定时刻逐一复现。
一张图讲清「评测的是什么任务、覆盖什么场景」,是理解后续所有指标的入口。