← 返回 2026-07-28

FilmBench:面向电影级视频生成的专业基准评测 FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei 📅 2026-07-27 👍 6 2026-08-02 18:30
参考条件生成 基准测试 多镜头视频 电影语言 自动化评测 视频生成评测

以电影学院级电影语言构建的多镜头T2V/R2V基准,揭示动态美学是当前瓶颈

前置知识

电影语言(Cinematic Language)

电影语言是电影学院一个多世纪积累的专业创作语法,涵盖景别(shot scale,如特写/中景/远景)、镜头运动(camera movement,推拉摇移跟升)、拍摄视角(viewing angle,平视/俯仰)、构图(composition)、焦点(focus)、色调、灯光、场景调度(scene blocking)以及电影级音频设计等维度。它是导演控制观众注意力、推进叙事、传递情绪的核心工具。

本文的全部评测维度都建立在这套电影语言之上,读者必须理解这些维度才能理解为何「拍得清晰」与「电影级」之间有质的差别。

T2V 与 R2V 任务

T2V(Text-to-Video)是「文本提示→视频」的生成任务,输入是结构化分镜描述。R2V(Reference-to-Video)则额外提供一张参考图(场景/道具/角色之一),要求生成的视频同时遵循提示并对参考图保持保真(visual following)。两者共享评测主框架,R2V 额外有 3 个参考保真子指标。

FilmBench 同时评测这两类任务,且发现 R2V 的参考保真冠军与总分冠军并非同一模型,理解任务区分才能读懂榜单背后的结构互补性。

Spearman 等级相关系数 ρ

Spearman ρ 度量两个排名序列的单调一致性,取值 [−1, 1],越接近 1 说明两组排名越一致。常用于验证自动评测器与人类专家排名是否吻合:ρ ≥ 0.9 通常被视作「高度一致」。本文用 2,878 个模型-提示对、约 30% 样本上的人工标注来计算模型级 Spearman ρ。

作者用 ρ = 0.95 (T2V) / 0.96 (R2V) 来论证自动评测器能可靠复现专家排名,是整个 benchmark 可信度的基石。

MLLM-as-Judge 与领域专家模型

MLLM-as-Judge 指用通用多模态大模型(如 Gemini、InternVL)直接当裁判给视频打分;它的优势是通用、零成本,但在专业类别(景别、构图、镜头运动)上常误判。领域专家模型则是针对某个视觉维度专门训练的小模型(如基于 DINO/BEiT/ResNet-18 的分类器,或 InternVL3-14B + LoRA-SFT),在专业标注数据上微调,能达到更高的 macro-F1。

FilmOps 正是为补足通用裁判在电影语言上的短板而设计的,理解这一权衡才能理解为何要专门造一套算子库。

研究动机

近三年视频生成评测虽百花齐放(VBench/VBench-2.0 拆 9–18 个通用维度、VideoScore 学人类偏好、T2V-CompBench/FETV 测属性绑定、MSVBench 测多镜头、VGA-Bench 测美学),但作者指出它们共享三个结构性盲点:其一,提示词来自网络用户、字幕器或 LLM 模板,而非经过验证的专业镜头,输入分布偏离电影内容;其二,隐含内容分布偏向通用、英语、网络风格场景,缺乏对电影类型与文化传统的均衡覆盖;其三,评测维度要么完全忽略景别、镜头运动、灯光、视觉风格、角色表演、音频质量这些电影轴,要么把它们压缩成一个笼统的「美学」分数。结果是现有榜单几乎饱和,而职业电影创作者却把同样的模型输出判定为「不够电影级」。这种评测与生产标准之间的脱节,正是 FilmBench 要解决的核心问题。

本文的目标是构建一个真正电影级的 T2V/R2V 评测基准,使评测标准与电影学院的教学体系、专业导演的生产实践对齐。具体目标包括:让每一个提示词都锚定到一段获奖电影真实镜头,使提示分布贴近电影内容;用电影学院的分级分类法(景别/镜头运动/视角/构图/焦点/色调/风格/表演/音频等)替换粗糙的通用维度;并训练一套能可靠替代人类专家打分的自动评测器,使模型级排名与专家排名的 Spearman ρ 达到 0.95 以上,让榜单既专业又可大规模复现。

与已有工作不同的是,本文的独特切入点是「让模型学会说电影语言,而不只是读懂电影语言」。与 VGA-Bench、MovieBench、AVGen-Bench 等只各自触及电影某一侧面的工作不同,FilmBench 第一次同时做到四件事:由专业导演从获奖影片反推提示词;覆盖 20 个电影类型与中外市场、且绝大多数(1,056/1,169)是多镜头分镜;将电影学院的电影语言教学体系翻译成 3 个一级轴、12 个二级组件、35 个三级子指标(R2V 加 3 个);把音频-对白连续性(含对白清晰度与跨镜头角色音色稳定)作为一等轴。这种「生产语法锚定 + 多镜头 + 多级分级 + 自动评测器」的统一,是已有任何 benchmark 都未达成的。

核心方法

整体思路是「以专业生产流程反哺评测流程」。直觉上:如果职业导演在判断一段视频是否「电影级」时有一套清晰的、可教学的语言体系,那么只要把这套体系翻译成可量化的多级指标,并保证提示词来自真实的电影镜头,就能让评测真正贴近电影标准。技术路线分三步:先由北京电影学院导演团队从获奖影片挑选高压力镜头,用 Gemini 3.1 Pro 反推结构化提示词,再由导演改写为符合分镜规范的剧本(含 @scene/@role/@prop 槽位标签);随后将电影学院的电影语言教学体系整理成三级评测分类法;最后训练一个专家级自动评测器(FilmOps 算子套件 + 评判模型),对每个 L3 子指标输出 1–5 分。

核心创新是把「电影学院教的电影语言」直接做成评测的本体(ontology),而不是另起炉灶造通用维度。这与已有方法的本质区别有三:第一,提示词不是凭空写的,而是从获奖影片反推,每个提示都锚定到一个被验证的专业参考,且大多数是多镜头(vs 既有基准的单一短镜头);第二,分类法不是研究者的主观维度切分,而是电影学院教学体系的直接映射(3 L1 → 12 L2 → 35 L3 + 3 R2V 专属);第三,打分不是依赖通用 MLLM-as-judge(会在景别/构图/镜头运动等专业类别上误判),而是先训练一组针对电影语言维度的专家算子(FilmOps,基于 5,000+ 部真实影视作品、每个算子约 40K–60K 标注样本训练),再用其输出作为评判模型的可靠依据。

方法步骤详情

FilmBench 的构建可拆为四步。第一步『片段挑选』:Hujing 影业与北电导演团队优先挑选奥斯卡、金马、百花等获奖影片,覆盖 20 个电影类型,选多镜头(多数 ≥4 镜头)且高压电影语言的片段。第二步『草稿提示反推』:FilmOps 算子套件配合 Gemini 3.1 Pro,从每个片段反推出原始叙事剧本、电影语言元素与画面元素,由 Gemini 组装成结构化提示草稿。第三步『专家精修』:北电导演团队对每个草稿做筛查、质检、改写、标准化,使其符合专业电影语言规范,并确保分类法中每个 L1 轴与 L2 组件都被覆盖;提示采用『镜头1(中景,平视固定,三分法):在明亮ICU@scene1,年轻女医生@role1……』这种带槽位标签的格式。第四步『打分与聚合』:自动评测器对每个 L3 子指标输出 1–5 分,按 1→0、2→25、3→50、4→75、5→100 线性映射到 0–100;聚合时直接 L3→L1(跳过 L2、各 L3 等权),每个 L1 轴取其 L3 子指标均值,Overall 为三个 L1 轴的等权均值;N/A 分数排除,无音频能力的模型在音频维度上对称处理。

技术新颖性

技术新颖性集中在三处。其一是『反推式提示构造』:把专业导演的判断与强多模态模型(Gemini 3.1 Pro)的反推能力结合,使大规模生成电影级提示成为可能,同时保留人类专家的最终质控,这与 LLM 模板生成有本质差别。其二是『跨体裁算子设计』:FilmOps 按 6 个核心维度(景别/构图/视角/色调/角色布局/镜头运动)定义 55 个子类,5 个帧级、1 个镜头级,分类按叙事/视觉功能而非成像机制定义,使同一标准适用于真人、3D、2D 风格化内容;帧级维度用 DINO/BEiT/ResNet-18,关系/时序维度用 InternVL3-14B + LoRA-SFT,每个算子相对四个通用 MLLM 零样本基线在 macro-F1 上均有显著提升。其三是『R2V 专属的视觉跟随维度』:在主框架外为参考条件生成新增 Visual Following 组件(场景空间/角色外观/道具参考保真),且每个 R2V 提示只对其参考类型对应的子指标打分,避免一刀切——这一设计让作者能首次客观揭示『参考保真冠军 ≠ 总分冠军』的结构互补现象。

FilmBench evaluation taxonomy: 3 L1 axes, 12 L2 components, 35+3 (R2V-only) L3 sub-metrics, built from clips across 20 film genres curated by expert directors.
Figure 1: FilmBench evaluation taxonomy: 3 L1 axes, 12 L2 components, 35+3 (R2V-only) L3 sub-metrics, built from clips across 20 film genres curated by expert directors.
The director-driven reverse-engineering pipeline that turns award-winning film clips into film-grade prompts.
Figure 2: The director-driven reverse-engineering pipeline that turns award-winning film clips into film-grade prompts.

实验结果

作者评测 9 个 T2V 与 7 个 R2V 模型(Seedance 2.0、HappyHorse 1.1/1.0、Kling 3.0/Omni、Veo 3.1、Grok Imagine Video、Vidu Q3/Q2 Pro、Hailuo 2.3),产出 4,635 条 T2V 与 4,578 条 R2V 机器评分,并提炼五点发现。其一『无饱和』:T2V 最高仅 88.93、R2V 最高 86.66,远低于既有网络风格基准的近满分;区分模型的关键不是通用画质,而是电影语言子指标。其二『动态美学瓶颈』:动作表演(T2V 50.8/R2V 46.8)、镜头运动吸引力(54.8/57.5)、角色运动真实度、情绪表演等动态维度全场最低,而锐度/灯光等静态画质维度明显更高。其三『多镜头最难』:T2V 从单镜头到多镜头平均掉 7.9 分(89.2→81.3),最弱模型 Hailuo 2.3 掉 22.8 分,头部模型掉得最少(Seedance −2.3、HappyHorse 1.1 −2.7),退化集中在景别/视角/镜头运动/焦点/剪辑流畅度/跨镜头空间一致。其四『参考条件只压不乱』:R2V 头部组与 T2V 一致,但参考保真冠军(HappyHorse 家族包揽 3 个)与总分冠军(Seedance 2.0)并非同一模型。其五『冠军错配』:Seedance 2.0 仅拿 18/35(T2V)、20/38(R2V)的 L3 冠军,集中在电影语言与表演维度;HappyHorse 1.1 拿 11/35、10/38,集中在角色/音频/场景;4 个 T2V、2 个 R2V 模型一冠未得,揭示单一榜单数字掩盖的结构互补性。

FilmBench three-level taxonomy (3 L1 axes, 12 L2 components, 35 L3 sub-metrics). R2V adds a Visual Following component (+3 L3).
Table 1: FilmBench three-level taxonomy (3 L1 axes, 12 L2 components, 35 L3 sub-metrics). R2V adds a Visual Following component (+3 L3).
L2 component-level human agreement (Spearman ρ), averaged across T2V and R2V.
Table 2: L2 component-level human agreement (Spearman ρ), averaged across T2V and R2V.
Fine-grained, per-dimension FilmBench evaluation on a multi-shot R2V example reverse-engineered from La La Land: Seedance 2.0 (94.97) vs. Vidu Q2 Pro (73.61).
Figure 3: Fine-grained, per-dimension FilmBench evaluation on a multi-shot R2V example reverse-engineered from La La Land: Seedance 2.0 (94.97) vs. Vidu Q2 Pro (73.61).
Overall FilmBench scores (0–100) per model; T2V (N=515) and R2V (N=654).
Figure 5: Overall FilmBench scores (0–100) per model; T2V (N=515) and R2V (N=654).
Cross-model variance per L3 sub-metric (main bars, colored by axis), with L2 inset, computed over merged T2V+R2V model means (Hailuo excluded).
Figure 6: Cross-model variance per L3 sub-metric (main bars, colored by axis), with L2 inset, computed over merged T2V+R2V model means (Hailuo excluded).
Per-model rankings within the L2 components most related to audiovisual language: Cinematic Language (sort key), Scene, and Character & performance.
Figure 8: Per-model rankings within the L2 components most related to audiovisual language: Cinematic Language (sort key), Scene, and Character & performance.
Left: T2V single-shot vs multi-shot mean scores (red Δ); Right: R2V live-action vs animation mean scores.
Figure 12: Left: T2V single-shot vs multi-shot mean scores (red Δ); Right: R2V live-action vs animation mean scores.
R2V visual-following (reference-fidelity) ranking by reference type (scene / prop / character).
Figure 14: R2V visual-following (reference-fidelity) ranking by reference type (scene / prop / character).
查看结构化数据
任务指标本文基线提升
T2V 总分 FilmBench Overall (0–100) Seedance 2.0 = 88.93 Hailuo 2.3 = 68.94(榜尾) 头部与榜尾相差约 20 分,且无模型接近满分
R2V 总分 FilmBench Overall (0–100) Seedance 2.0 = 86.66 Vidu Q2 Pro = 71.45(榜尾) 头部组与 T2V 一致,参考条件未打乱排名
评测器-人类一致性 模型级 Spearman ρ ρ = 0.95 (T2V) / 0.96 (R2V),10/13 个 L2 组件 ρ ≥ 0.78 —(人工基线即 90 名北电专业评分员,2,878 模型-提示对) 自动榜单可靠复现专家模型排名
维度间方差(差异化) 跨模型方差 Instruction Following = 99.4;L3 中镜头运动方差 357.6(最高) Aesthetic 12.6 / Temporal Continuity 5.6 模型差异主要来自电影语言指令跟随
多镜头鲁棒性 单→多镜头分数差 Δ Seedance −2.3 / HappyHorse 1.1 −2.7 Hailuo −22.8 / Veo 3.1 −10.3 头部模型多镜头鲁棒性远超尾部

局限与改进

作者明确承认三类局限。其一,评测器在三个 L2 组件上的人类一致性偏低——音频质量(ρ=0.68)、音频连贯性(ρ=0.68)、剪辑(ρ=0.60),原因是声音保真与剪辑节奏的主观时序行为最难界定,作者在解读细粒度结果时会专门标注。其二,作者在『局限』章节直接声明:FilmBench 专为专业电影/电影内容评测设计,其维度与排名未必反映模型在竖屏短视频、休闲 UGC 等非专业场景的表现。其三,Hailuo 2.3 的音频异常在方差计算时被排除,意味着对最弱模型的细粒度诊断并不完整。从我的观察补充:1,169 个提示词规模仍相对有限(对比视频生成的样本空间),且多镜头退化、动作退化虽被量化,但作者未给出与既有基准(VBench 等)在同一模型上的并排数值对比,难以直接量化『比 web-style 严苛多少』;此外自动评测器依赖 Gemini 3.1 Pro 与 InternVL3-14B,未公开其闭源部分,复现门槛较高。

独立分析的弱点

第一,规模与覆盖仍可扩:1,169 条提示虽涵盖 20 个类型,但对生成模型的庞大样本空间而言仍偏小,且仅中外两市场,可考虑引入更多文化圈(如日韩、欧洲、拉美)的电影传统以提升文化公平性。第二,低一致性维度需补强:音频质量/音频连贯性/剪辑这三个 ρ 仅 0.60–0.68 的维度,建议引入更结构化的剪辑节奏算子(如基于镜头切换时序模型)与音频质量回归器,或补充更细的人类标注锚点(5 点量表 + 文字理由)。第三,单一评判模型的依赖:当前评测器核心闭源部分未开源,社区无法完整复现自动榜单;改进方向是把评判模型也做权重开源或提供可插拔接口。第四,对最弱模型(Hailuo)的诊断不完整——因音频异常被排除在方差分析外,建议对无音频能力或音频异常模型提供专门的旁路评测通道。

未来方向

作者提出的方向包括继续推进向电影级生成系统的研究,并把『动态美学』确认为全行业的共同瓶颈(动作表演/镜头运动吸引力/角色运动真实度/情绪表演全场最低)。基于本成果可延伸的研究有:一是把 FilmOps 算子从评判扩展到训练——将这些电影语言维度作为可微奖励或 RLHF 信号,直接优化模型的电影语言指令跟随能力;二是把『冠军错配』现象作为模型组合的依据,研究是否可用多个专长模型(镜头、场景、角色、音频)协同生成单部影片;三是扩展到更长形态( MovieBench 显示多场景身份一致最多 53%),在 FilmBench 的多镜头基础上进一步引入整段/全片的身份、叙事与音频-对白连续性评测;四是把 R2V 视觉跟随扩展为可控生成(ControlNet 式)的细粒度评测,研究参考保真与电影语言之间的可调权衡。

复现评估

复现性总体较好但存在断层。已开源的部分:FilmOps 在 GitHub(Neo-yk/FilmOps)公开了分类标准、模型权重与推理脚本,FilmBench 数据集发布在 HuggingFace(skylenage/FilmBench),含 515 条 T2V + 654 条 R2V 提示及人工标注;评测聚合规则(1–5→0–100 线性映射、L3→L1 等权、Overall 三轴等权)描述清晰可复算;人类一致性验证(90 名北电评分员、2,878 模型-提示对、Spearman ρ)也透明披露。未开源/高门槛部分:评测器的核心评判模型依赖 Gemini 3.1 Pro 与 InternVL3-14B,Gemini 部分闭源,社区难以端到端复现自动榜单;被评测的 9/7 个生成模型均为商业 API(Seedance/Kling/Veo/Grok/Vidu/Hailuo/HappyHorse),调用成本与配额会限制他人重跑全部 9,213 条评分;算力上 FilmOps 单算子训练约 40K–60K 样本,重现算子训练需要 GPU 资源与专业标注团队。整体难度:数据与算子可中等难度复现,完整自动榜单复现难度较高。