FilmBench:面向电影级视频生成的专业基准评测 FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
以电影学院级电影语言构建的多镜头T2V/R2V基准,揭示动态美学是当前瓶颈
前置知识
电影语言(Cinematic Language)
电影语言是电影学院一个多世纪积累的专业创作语法,涵盖景别(shot scale,如特写/中景/远景)、镜头运动(camera movement,推拉摇移跟升)、拍摄视角(viewing angle,平视/俯仰)、构图(composition)、焦点(focus)、色调、灯光、场景调度(scene blocking)以及电影级音频设计等维度。它是导演控制观众注意力、推进叙事、传递情绪的核心工具。
本文的全部评测维度都建立在这套电影语言之上,读者必须理解这些维度才能理解为何「拍得清晰」与「电影级」之间有质的差别。
T2V 与 R2V 任务
T2V(Text-to-Video)是「文本提示→视频」的生成任务,输入是结构化分镜描述。R2V(Reference-to-Video)则额外提供一张参考图(场景/道具/角色之一),要求生成的视频同时遵循提示并对参考图保持保真(visual following)。两者共享评测主框架,R2V 额外有 3 个参考保真子指标。
FilmBench 同时评测这两类任务,且发现 R2V 的参考保真冠军与总分冠军并非同一模型,理解任务区分才能读懂榜单背后的结构互补性。
Spearman 等级相关系数 ρ
Spearman ρ 度量两个排名序列的单调一致性,取值 [−1, 1],越接近 1 说明两组排名越一致。常用于验证自动评测器与人类专家排名是否吻合:ρ ≥ 0.9 通常被视作「高度一致」。本文用 2,878 个模型-提示对、约 30% 样本上的人工标注来计算模型级 Spearman ρ。
作者用 ρ = 0.95 (T2V) / 0.96 (R2V) 来论证自动评测器能可靠复现专家排名,是整个 benchmark 可信度的基石。
MLLM-as-Judge 与领域专家模型
MLLM-as-Judge 指用通用多模态大模型(如 Gemini、InternVL)直接当裁判给视频打分;它的优势是通用、零成本,但在专业类别(景别、构图、镜头运动)上常误判。领域专家模型则是针对某个视觉维度专门训练的小模型(如基于 DINO/BEiT/ResNet-18 的分类器,或 InternVL3-14B + LoRA-SFT),在专业标注数据上微调,能达到更高的 macro-F1。
FilmOps 正是为补足通用裁判在电影语言上的短板而设计的,理解这一权衡才能理解为何要专门造一套算子库。
研究动机
近三年视频生成评测虽百花齐放(VBench/VBench-2.0 拆 9–18 个通用维度、VideoScore 学人类偏好、T2V-CompBench/FETV 测属性绑定、MSVBench 测多镜头、VGA-Bench 测美学),但作者指出它们共享三个结构性盲点:其一,提示词来自网络用户、字幕器或 LLM 模板,而非经过验证的专业镜头,输入分布偏离电影内容;其二,隐含内容分布偏向通用、英语、网络风格场景,缺乏对电影类型与文化传统的均衡覆盖;其三,评测维度要么完全忽略景别、镜头运动、灯光、视觉风格、角色表演、音频质量这些电影轴,要么把它们压缩成一个笼统的「美学」分数。结果是现有榜单几乎饱和,而职业电影创作者却把同样的模型输出判定为「不够电影级」。这种评测与生产标准之间的脱节,正是 FilmBench 要解决的核心问题。
本文的目标是构建一个真正电影级的 T2V/R2V 评测基准,使评测标准与电影学院的教学体系、专业导演的生产实践对齐。具体目标包括:让每一个提示词都锚定到一段获奖电影真实镜头,使提示分布贴近电影内容;用电影学院的分级分类法(景别/镜头运动/视角/构图/焦点/色调/风格/表演/音频等)替换粗糙的通用维度;并训练一套能可靠替代人类专家打分的自动评测器,使模型级排名与专家排名的 Spearman ρ 达到 0.95 以上,让榜单既专业又可大规模复现。
与已有工作不同的是,本文的独特切入点是「让模型学会说电影语言,而不只是读懂电影语言」。与 VGA-Bench、MovieBench、AVGen-Bench 等只各自触及电影某一侧面的工作不同,FilmBench 第一次同时做到四件事:由专业导演从获奖影片反推提示词;覆盖 20 个电影类型与中外市场、且绝大多数(1,056/1,169)是多镜头分镜;将电影学院的电影语言教学体系翻译成 3 个一级轴、12 个二级组件、35 个三级子指标(R2V 加 3 个);把音频-对白连续性(含对白清晰度与跨镜头角色音色稳定)作为一等轴。这种「生产语法锚定 + 多镜头 + 多级分级 + 自动评测器」的统一,是已有任何 benchmark 都未达成的。
核心方法
整体思路是「以专业生产流程反哺评测流程」。直觉上:如果职业导演在判断一段视频是否「电影级」时有一套清晰的、可教学的语言体系,那么只要把这套体系翻译成可量化的多级指标,并保证提示词来自真实的电影镜头,就能让评测真正贴近电影标准。技术路线分三步:先由北京电影学院导演团队从获奖影片挑选高压力镜头,用 Gemini 3.1 Pro 反推结构化提示词,再由导演改写为符合分镜规范的剧本(含 @scene/@role/@prop 槽位标签);随后将电影学院的电影语言教学体系整理成三级评测分类法;最后训练一个专家级自动评测器(FilmOps 算子套件 + 评判模型),对每个 L3 子指标输出 1–5 分。
核心创新是把「电影学院教的电影语言」直接做成评测的本体(ontology),而不是另起炉灶造通用维度。这与已有方法的本质区别有三:第一,提示词不是凭空写的,而是从获奖影片反推,每个提示都锚定到一个被验证的专业参考,且大多数是多镜头(vs 既有基准的单一短镜头);第二,分类法不是研究者的主观维度切分,而是电影学院教学体系的直接映射(3 L1 → 12 L2 → 35 L3 + 3 R2V 专属);第三,打分不是依赖通用 MLLM-as-judge(会在景别/构图/镜头运动等专业类别上误判),而是先训练一组针对电影语言维度的专家算子(FilmOps,基于 5,000+ 部真实影视作品、每个算子约 40K–60K 标注样本训练),再用其输出作为评判模型的可靠依据。
方法步骤详情
FilmBench 的构建可拆为四步。第一步『片段挑选』:Hujing 影业与北电导演团队优先挑选奥斯卡、金马、百花等获奖影片,覆盖 20 个电影类型,选多镜头(多数 ≥4 镜头)且高压电影语言的片段。第二步『草稿提示反推』:FilmOps 算子套件配合 Gemini 3.1 Pro,从每个片段反推出原始叙事剧本、电影语言元素与画面元素,由 Gemini 组装成结构化提示草稿。第三步『专家精修』:北电导演团队对每个草稿做筛查、质检、改写、标准化,使其符合专业电影语言规范,并确保分类法中每个 L1 轴与 L2 组件都被覆盖;提示采用『镜头1(中景,平视固定,三分法):在明亮ICU@scene1,年轻女医生@role1……』这种带槽位标签的格式。第四步『打分与聚合』:自动评测器对每个 L3 子指标输出 1–5 分,按 1→0、2→25、3→50、4→75、5→100 线性映射到 0–100;聚合时直接 L3→L1(跳过 L2、各 L3 等权),每个 L1 轴取其 L3 子指标均值,Overall 为三个 L1 轴的等权均值;N/A 分数排除,无音频能力的模型在音频维度上对称处理。
技术新颖性
技术新颖性集中在三处。其一是『反推式提示构造』:把专业导演的判断与强多模态模型(Gemini 3.1 Pro)的反推能力结合,使大规模生成电影级提示成为可能,同时保留人类专家的最终质控,这与 LLM 模板生成有本质差别。其二是『跨体裁算子设计』:FilmOps 按 6 个核心维度(景别/构图/视角/色调/角色布局/镜头运动)定义 55 个子类,5 个帧级、1 个镜头级,分类按叙事/视觉功能而非成像机制定义,使同一标准适用于真人、3D、2D 风格化内容;帧级维度用 DINO/BEiT/ResNet-18,关系/时序维度用 InternVL3-14B + LoRA-SFT,每个算子相对四个通用 MLLM 零样本基线在 macro-F1 上均有显著提升。其三是『R2V 专属的视觉跟随维度』:在主框架外为参考条件生成新增 Visual Following 组件(场景空间/角色外观/道具参考保真),且每个 R2V 提示只对其参考类型对应的子指标打分,避免一刀切——这一设计让作者能首次客观揭示『参考保真冠军 ≠ 总分冠军』的结构互补现象。
实验结果
作者评测 9 个 T2V 与 7 个 R2V 模型(Seedance 2.0、HappyHorse 1.1/1.0、Kling 3.0/Omni、Veo 3.1、Grok Imagine Video、Vidu Q3/Q2 Pro、Hailuo 2.3),产出 4,635 条 T2V 与 4,578 条 R2V 机器评分,并提炼五点发现。其一『无饱和』:T2V 最高仅 88.93、R2V 最高 86.66,远低于既有网络风格基准的近满分;区分模型的关键不是通用画质,而是电影语言子指标。其二『动态美学瓶颈』:动作表演(T2V 50.8/R2V 46.8)、镜头运动吸引力(54.8/57.5)、角色运动真实度、情绪表演等动态维度全场最低,而锐度/灯光等静态画质维度明显更高。其三『多镜头最难』:T2V 从单镜头到多镜头平均掉 7.9 分(89.2→81.3),最弱模型 Hailuo 2.3 掉 22.8 分,头部模型掉得最少(Seedance −2.3、HappyHorse 1.1 −2.7),退化集中在景别/视角/镜头运动/焦点/剪辑流畅度/跨镜头空间一致。其四『参考条件只压不乱』:R2V 头部组与 T2V 一致,但参考保真冠军(HappyHorse 家族包揽 3 个)与总分冠军(Seedance 2.0)并非同一模型。其五『冠军错配』:Seedance 2.0 仅拿 18/35(T2V)、20/38(R2V)的 L3 冠军,集中在电影语言与表演维度;HappyHorse 1.1 拿 11/35、10/38,集中在角色/音频/场景;4 个 T2V、2 个 R2V 模型一冠未得,揭示单一榜单数字掩盖的结构互补性。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| T2V 总分 | FilmBench Overall (0–100) | Seedance 2.0 = 88.93 | Hailuo 2.3 = 68.94(榜尾) | 头部与榜尾相差约 20 分,且无模型接近满分 |
| R2V 总分 | FilmBench Overall (0–100) | Seedance 2.0 = 86.66 | Vidu Q2 Pro = 71.45(榜尾) | 头部组与 T2V 一致,参考条件未打乱排名 |
| 评测器-人类一致性 | 模型级 Spearman ρ | ρ = 0.95 (T2V) / 0.96 (R2V),10/13 个 L2 组件 ρ ≥ 0.78 | —(人工基线即 90 名北电专业评分员,2,878 模型-提示对) | 自动榜单可靠复现专家模型排名 |
| 维度间方差(差异化) | 跨模型方差 | Instruction Following = 99.4;L3 中镜头运动方差 357.6(最高) | Aesthetic 12.6 / Temporal Continuity 5.6 | 模型差异主要来自电影语言指令跟随 |
| 多镜头鲁棒性 | 单→多镜头分数差 Δ | Seedance −2.3 / HappyHorse 1.1 −2.7 | Hailuo −22.8 / Veo 3.1 −10.3 | 头部模型多镜头鲁棒性远超尾部 |
局限与改进
作者明确承认三类局限。其一,评测器在三个 L2 组件上的人类一致性偏低——音频质量(ρ=0.68)、音频连贯性(ρ=0.68)、剪辑(ρ=0.60),原因是声音保真与剪辑节奏的主观时序行为最难界定,作者在解读细粒度结果时会专门标注。其二,作者在『局限』章节直接声明:FilmBench 专为专业电影/电影内容评测设计,其维度与排名未必反映模型在竖屏短视频、休闲 UGC 等非专业场景的表现。其三,Hailuo 2.3 的音频异常在方差计算时被排除,意味着对最弱模型的细粒度诊断并不完整。从我的观察补充:1,169 个提示词规模仍相对有限(对比视频生成的样本空间),且多镜头退化、动作退化虽被量化,但作者未给出与既有基准(VBench 等)在同一模型上的并排数值对比,难以直接量化『比 web-style 严苛多少』;此外自动评测器依赖 Gemini 3.1 Pro 与 InternVL3-14B,未公开其闭源部分,复现门槛较高。
独立分析的弱点
第一,规模与覆盖仍可扩:1,169 条提示虽涵盖 20 个类型,但对生成模型的庞大样本空间而言仍偏小,且仅中外两市场,可考虑引入更多文化圈(如日韩、欧洲、拉美)的电影传统以提升文化公平性。第二,低一致性维度需补强:音频质量/音频连贯性/剪辑这三个 ρ 仅 0.60–0.68 的维度,建议引入更结构化的剪辑节奏算子(如基于镜头切换时序模型)与音频质量回归器,或补充更细的人类标注锚点(5 点量表 + 文字理由)。第三,单一评判模型的依赖:当前评测器核心闭源部分未开源,社区无法完整复现自动榜单;改进方向是把评判模型也做权重开源或提供可插拔接口。第四,对最弱模型(Hailuo)的诊断不完整——因音频异常被排除在方差分析外,建议对无音频能力或音频异常模型提供专门的旁路评测通道。
未来方向
作者提出的方向包括继续推进向电影级生成系统的研究,并把『动态美学』确认为全行业的共同瓶颈(动作表演/镜头运动吸引力/角色运动真实度/情绪表演全场最低)。基于本成果可延伸的研究有:一是把 FilmOps 算子从评判扩展到训练——将这些电影语言维度作为可微奖励或 RLHF 信号,直接优化模型的电影语言指令跟随能力;二是把『冠军错配』现象作为模型组合的依据,研究是否可用多个专长模型(镜头、场景、角色、音频)协同生成单部影片;三是扩展到更长形态( MovieBench 显示多场景身份一致最多 53%),在 FilmBench 的多镜头基础上进一步引入整段/全片的身份、叙事与音频-对白连续性评测;四是把 R2V 视觉跟随扩展为可控生成(ControlNet 式)的细粒度评测,研究参考保真与电影语言之间的可调权衡。
复现评估
复现性总体较好但存在断层。已开源的部分:FilmOps 在 GitHub(Neo-yk/FilmOps)公开了分类标准、模型权重与推理脚本,FilmBench 数据集发布在 HuggingFace(skylenage/FilmBench),含 515 条 T2V + 654 条 R2V 提示及人工标注;评测聚合规则(1–5→0–100 线性映射、L3→L1 等权、Overall 三轴等权)描述清晰可复算;人类一致性验证(90 名北电评分员、2,878 模型-提示对、Spearman ρ)也透明披露。未开源/高门槛部分:评测器的核心评判模型依赖 Gemini 3.1 Pro 与 InternVL3-14B,Gemini 部分闭源,社区难以端到端复现自动榜单;被评测的 9/7 个生成模型均为商业 API(Seedance/Kling/Veo/Grok/Vidu/Hailuo/HappyHorse),调用成本与配额会限制他人重跑全部 9,213 条评分;算力上 FilmOps 单算子训练约 40K–60K 样本,重现算子训练需要 GPU 资源与专业标注团队。整体难度:数据与算子可中等难度复现,完整自动榜单复现难度较高。
论文图表
把 10 个最贴近电影工艺的 L3 子指标跨模型均值按降序排列:色调与色彩最高(T2V 95.0、R2V 91.2),动作表演最低(50.8/46.8),镜头运动吸引力倒数第二(54.8/57.5)。镜头运动维度 T2V–R2V 差距最大(69.5 vs 55.6),说明参考条件放大了镜头执行上的差异。
这张图把『动态美学瓶颈』这一全行业发现可视化——静态画质维度高,动态表演/镜头吸引力低,直接指明了未来视频生成最需要突破的方向。