Sci-VBench:面向科学领域的知识与推理密集型视频生成评测基准 Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
首个60学科专家标注的科学视频生成基准,揭示“看着逼真”不等于“机理正确”
前置知识
文本到视频(T2V)生成模型
以扩散模型与大规模 Transformer 结合的视频生成系统,输入文字提示、输出时序连贯的视频,如 Sora-2、Veo-3.1、Wan2.2-5B。近年其视觉保真度、运动连贯性和可控性进步飞快,核心问题随之从“画面像不像”转向“是否忠实实现提示中的事件、约束与时序依赖”。
本文的全部实验对象就是 16 个 T2V 模型,理解这类模型的输入输出形式与常见失败模式,是读懂基准设计和结果分析的门槛。
MLLM-as-Judge(量规条件化评审)
用多模态大语言模型代替人类给生成视频打分的自动评测范式:评审器接收文本提示、生成视频和评分标准,先陈述基于视频的依据,再输出 1–5 整数分。本文进一步做“量规条件化”——每次只提供目标维度的锚点量规,防止跨维度证据泄漏,并用 Qwen3.5-397B-A17B 每个视频-维度独立评 3 次取均值以降低方差。
这是本文自动化评测协议的核心,论文用整个 4.3 节验证它与专家评分的一致性,不理解它就读不懂 Table 3。
评分量规(rubric)
把“好到什么程度给几分”显式化的评分标准:每个维度定义 1–5 分的可观察锚点,写明满分需要哪些证据、部分正确如何界定、哪些缺陷导致低分。本文中提示扎根(PG)、科学因果正确性(SCC)、时空一致性(SC)逐例撰写量规(每条约 280–345 词),低层感知保真度(LPF)则全局共享一份。
量规是本文把专家知识“外置”、让非专家和 MLLM 能按同一专家标准打分的关键载体,是全文方法层面最核心的创新。
评分者一致性指标
衡量不同评分者打分一致程度的统计量。Cohen's $\kappa$ 校正随机一致后衡量分类一致性;二次加权 $\kappa$ 对相邻分数的误差给予部分容忍,适合 1–5 分序数评分;实例级 Pearson 相关 $r$ 衡量两组分数的线性相关程度。本文专家重评 $\kappa=0.842$,相关值普遍以×100 报告(如 82.5 即 $r=0.825$)。
论文对“评测协议是否可靠、评分标准是否可移植”的全部论证都建立在这些指标上,是看懂 Table 3 和可靠性分析的前提。
VBench 与 Vision Tools(VT)
VBench 是视频生成领域最常用的通用评测基准,其 Video Quality 维度包含六项自动指标(主体一致性、运动平滑度、美学质量等)。本文按官方协议计算这六项指标,归一化平均后线性映射到与其他维度相同的 1–5 分区间,记作 Vision Tools(VT)分数,作为低层感知保真度(LPF)的自动代理。
VT 是四维度之一 LPF 的自动实现,也是“感知质量已饱和”这一关键发现(16 个模型挤在 3.79–4.12)的证据来源。
研究动机
视频生成模型在视觉保真度和运动连贯性上进步飞快,Sora-2、Veo-3.1、Wan 2.2 等系统画面高度逼真,但“画面可信”可能掩盖机理错误:视频可以看起来毫无破绽,却违反守恒律、颠倒因果关系或描绘不可能的状态跃迁。评测却没跟上:VBench(946 例)等通用基准只测感知质量与提示对齐,VideoPhy(688 例)、PhyGenBench(160 例)、VideoPhy-2(3,940 例)等推理基准停留在通用物理常识;科学推理评测此前主要面向视频理解而非生成。最接近的并发工作 VideoScience-Bench 只覆盖物理和化学共 200 个专家标注提示,且不发布可复用的评测标准——换一批评分者就可能出现标准漂移,无法让非专家或 MLLM 按同一专家标准打分。多学科、机制级、评分标准可移植的视频生成评测是空白。
本文的目标是构建 Sci-VBench:一个面向科学领域的知识与推理密集型视频生成评测基准,包含 1,253 个由领域专家撰写并经独立复审的生成任务,横跨自然科学、医疗健康、人文社科、工程四大门类共 60 个学科。每个任务由极简生成提示配对一份专家撰写的评测规范:参考指南指明目标概念与预期分阶段现象,量规给出 1–5 分的可观察锚点。设计要求模型生成时间上充分展开、需要科学推理和知识支撑的视频,超越表面视觉合理性。同时建立并验证一套可规模化、可复现的量规评测协议:专家评分为参考标签,自动评测结合基于 VBench 的视觉工具(VT)与量规条件化的 MLLM-as-Judge,并系统检验非专家和 MLLM 评分者拿到规范后与专家判断的一致性。
与已有工作不同的是,本文的独特切入有三点。其一,“最小提示”设计:提示词只描述可观察的初始设置与显式干预(如“橡皮锤快速敲击左膝髌腱”),刻意省略预期机理轨迹和关键现象,模型必须从设置推断机制,而不是复述提示中已写明的结果,杜绝“抄作业”。其二,发布逐例评测规范:参考指南固定任务解读(目标概念、最小机理假设、分阶段故事线并预判非专家的知识盲区),量规把分数锚定在可观察证据上,使专家标准可跨评分者移植——论文用实验证明这一点:非专家带规范后与专家的平均 Pearson 相关从 74.0 升到 82.5。其三,机制驱动、时间展开:所选概念必须有机理 governed 的视觉实现(化学反应动力学、守恒驱动的相互作用、医疗干预反应),现象必须随时间演化,单帧无法满足提示。相比 VideoScience-Bench(200 例、无规范),本文在学科广度(60 对 2 门类)、规模(1,253 对 200)与标准可移植性上均前进一步。
核心方法
整体是“教材引导 + 专家流水线”的基准构建,外加一套经过可靠性验证的评测协议。直觉:要考科学推理,题目必须由领域专家出,且评分标准必须显式化,否则无法规模化复用。构建分五步:(1) 先做用户调研,133 名本科和研究生各撰写两个专家级视频提示并用 Sora、Wan 2.2 生成,作者据此选出 4 大门类 60 个学科;(2) 招募 61 名专家标注者(11 名本科生、45 名研究生、5 名作者),按学科专长匹配任务;(3) 教材引导的提示词标注:从核心课程教材选目标概念,撰写只含初始设置与干预的最小提示(各学科平均 33.3–42.6 词);(4) 为每例撰写约 160 词的参考指南和四维度评分量规(每维 245–345 词);(5) 质量控制:独立专家二次复审、作者终审,另对 200 例抽样做规范独立重写与交叉打分审计。评测协议:LPF 用 VBench 六项指标合成 VT 分数(映射到 1–5),其余三维由量规条件化的 Qwen3.5-397B-A17B 评审,每个视频-维度独立评审 3 次取均值。
核心创新是“专家知识外置”的逐例评测规范 + 量规条件化评审,使专家级评分标准可跨评分者移植。与已有工作的本质区别:现有基准要么不涉及专家(VBench 946 例),要么有专家标注但不发布逐例评分标准(VideoScience-Bench 200 例),导致评分依赖“谁在打分”而非“标准是什么”。Sci-VBench 为每个提示配发参考指南与 1–5 锚点量规,并用两组实验证明可移植性:非专家拿到规范后与专家的实例级 Pearson 相关从 74.0 升到 82.5(SCC 从 68.2 升到 82.5),超过所有受测 MLLM 评审;200 例审计中,由第二标注者独立重写规范、两名评分者交叉打分,二次加权 $\kappa$ 达 PG 0.79、SCC 0.75、SC 0.73,说明分数由发布的规范决定而非撰写者。此外,“最小提示只给设置与干预、隐去结果”的出题方式,把评测从“复述能力”真正转向“机理推断能力”。
方法步骤详情
第一步学科选择:133 名学生各写两个专家级提示并用 Sora、Wan 2.2 生成视频,作者人工分析后确定 60 个学科(核心概念既够专家级、又能从视频证据验证)。第二步概念选取:标注者从目标学科核心教材中选“机理驱动、视频可验证”的概念(化学反应动力学、守恒驱动的相互作用、干预反应),排除无法用视频证据验证正确性的专家概念。第三步最小提示撰写(输入:目标概念;输出:平均 33–43 词的英文提示),只写初始设置与干预,隐去机理轨迹。第四步评测规范:参考指南(约 160 词)写明目标概念、最小机理假设、分阶段现象故事线及视角/可见性约束,并为非专家补充术语注释;量规按 LPF/PG/SCC/SC 四维度给 1–5 锚点,PG/SCC/SC 逐例撰写(280–345 词),LPF 全局共享一份。第五步质控:另一名同领域专家复审提示清晰性与三者一致性,修订后由作者终审;200 例抽样审计中第二标注者独立重写规范并交叉打分。评测执行:每个生成视频由同学科非作者专家按四维度打 1–5 分;自动评测中 VT 由 VBench 六指标归一化映射到 1–5,MLLM 评审只喂单维度量规并要求先给依据再打分,3 次独立评审取均值。
技术新颖性
技术新颖性有四点。(1) 首个同时满足“专家深度参与构建”与“发布可复用逐例评测规范”的多学科视频生成基准,填补 Table 1 所示空白:VBench(946 例)两者皆无,VideoScience-Bench(200 例)有专家无规范,Sci-VBench(1,253 例、60 学科)两者兼具。(2) 量规条件化的单维评审设计:每次评审只提供目标维度的量规,阻断跨维度证据泄漏,配合 3 次独立评审取均值控制方差;其实例级 Pearson 相关(平均 63.4)全面超过 VideoScore(47.5)、VideoScore2(51.6)、VideoReward(47.4)、ETVA(47.9)。(3) 把“评测可移植性”本身作为研究对象,系统量化专家/非专家/MLLM 三类评分者在有、无规范条件下的一致性(专家重评 $\kappa=0.842$),这在视频生成评测中是首次。(4) 双划分设计(full 1,253 / testmini 150:工程 37、医疗 16、自然科学 78、人文社科 19),并用开源模型在两个划分上的全量评测验证 testmini 偏差不超过 0.07,兼顾成本与统计可靠性。
实验结果
16 个前沿模型在 testmini(150 例)上的结果揭示三个核心结论。一是区分系统的是机理而非外观:VBench 代理 VT 几乎持平(3.79–4.12),而自动 SCC 从 1.24 拉开到 3.34,人工 SCC 1.12–3.06,推理维度才是真正的分辨器。二是专有-开源差距集中在推理而非一致性:Gemini-Omni-Flash 综合最佳(自动 3.38、人工 3.18),HappyHorse-1.1(3.15/3.06)、Seedance-2.0(3.14/2.94)次之,均超过 Veo-3.1(2.98/2.80)与 Sora-2(2.98/2.68);最强开源 MiniMax-H3 仅 2.68/2.58,其 SCC 自动分只有 1.63,约为专有最佳的一半,但 Wan2.2-5B 的自动 SC 达 2.79、为全场最高,说明开源输在科学机理而非时序稳定。三是无一模型全学科通吃:Gemini-Omni-Flash 领先三个门类(工程 3.33、自然科学 3.13、人文社科 2.95),医疗被 Sora-2(2.97)夺魁。协议可靠性:专家一致性 $\kappa=0.842$;带规范的非专家平均相关 82.5,高于最佳 MLLM 评审 Qwen3.5-397B-A17B 的 63.4 与 VideoScore2 的 51.6。消融显示 Gemini-3-Flash 重写提示使 HunyuanVideo-1.5 的 SCC 从 1.45 升至 2.20(+51.7%),Wan2.2-5B 从 1.33 升至 1.64(+23.3%),但 SC 仅 +7.5%/+16.5%——显式措辞补得了提示隐含的机理,补不了生成器缺失的机理保真度。错误分析归为三类:指令遵循差、为美观牺牲物理真实性、时序不一致。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 科学因果正确性 SCC(testmini,自动评审) | 1–5 量规分(3 次评审均值) | Gemini-Omni-Flash 3.52(全场最高;人工 3.06) | 最强开源 MiniMax-H3 2.52(人工 1.54);开源底端 LTX-2 仅 1.51 | 较最强开源 +1.00(约 +40%);较开源底端 +2.01 |
| 四维综合平均(testmini,自动评测) | LPF/SC/PG/SCC 无加权平均 | Gemini-Omni-Flash 3.38(人工 3.18) | 上一代最强 Veo-3.1 2.98 / Veo-3.1-Fast 3.00 / Sora-2 2.98 | +0.38–0.40;专有-开源综合差距 3.38 对 2.68 |
| 自动评测与专家评分的一致性 | 实例级 Pearson 相关(×100,四维平均) | 量规条件化 Qwen3.5-397B-A17B:63.4 | VideoScore 47.5 / VideoScore2 51.6 / VideoReward 47.4 / ETVA 47.9 | 较最强已有方法 +11.8,且在四个维度上全部领先 |
| 提示词重写消融(HunyuanVideo-1.5,testmini) | SCC 自动分(1–5) | 重写后 2.20 | 逐字提示基线 1.45 | +51.7%;但仅达专有最佳 3.34 的约 66%,SC 只 +16.5% |
局限与改进
作者承认与可观察到的局限:(1) 专有模型只在 testmini(150 例)上评测——通过商业 API 生成全量成本过高,虽然开源模型验证了 testmini 与全量的偏差不超过 0.07,子学科(医疗仅 16 例)上的结论统计功效有限;(2) LPF 的 VBench 代理已饱和(3.79–4.12)而人工 LPF 分布更宽(2.66–3.76),作者明确指出这只是“就 VBench 代理而言饱和”,代理对真实感知差距无分辨率;(3) MLLM 评审在 LPF(53.5)和 SC(54.5)上与专家的相关性显著低于推理维度(PG 73.9、SCC 71.7),细粒度视觉与时序伪影仍是通用 MLLM 评审的短板;(4) 供应商内容过滤拒绝了 6 条 Gemini-Omni-Flash 与 2 条 Seedance-2.0 提示,相关均值基于成功生成计算;(5) 基准刻意排除无法用视频证据验证的专家概念(如纯理论推导),覆盖面限于“可视机理”;(6) 所有模型的绝对分值偏低(最强模型人工 SCC 也仅 3.06),量规锚点偏严,跨模型相对比较可靠,但绝对分数不宜直接解读为“接近人类水平”。
独立分析的弱点
独立分析的弱点:(1) VT 指标失去分辨力——16 个模型挤在 0.33 分区间(3.79–4.12),无法反映人工 LPF 高达 1.1 分(2.66–3.76)的真实差距,改进方向是校准到人工分数分布的感知指标,或训练专门回归专家 LPF 的评分器。(2) 时序一致性自动评测薄弱——最佳评审器的 SC 相关仅 54.5,可引入光流、目标跟踪特征或关键帧证据链来增强时序判断,而非完全依赖 MLLM 的整体观感。(3) 评审方差控制有限——仅 3 次独立评审取均值,未报告评审间方差及系统性偏差(如对画面美感的偏好),可加入校准集和位置/长度去偏。(4) 专有与开源评测划分不对称——专有模型只在 testmini 上评,医疗门类仅 16 例,“Sora-2 医疗最强”这类结论样本量很小。(5) 提示词重写消融只测了 Wan2.2-5B 和 HunyuanVideo-1.5 两个开源小模型,重写器(Gemini-3-Flash)与被评模型存在耦合,“显式提示能否提升专有前沿模型”仍是未知数,且 +51.7% 的增益可能部分来自重写风格而非机理信息。
未来方向
作者提出的方向:针对错误分析的三类失败(概念误读、为视觉美观牺牲物理真实性、时序不一致)改进指令遵循、机理一致性与时空稳定性。基于本文成果可延伸的研究:(1) 用逐例量规训练专门的机理评测器或奖励模型,把 SCC 变成可优化的训练信号,推动“机理感知”的 T2V 后训练(如 RLHF/RLAIF 直接以量规为奖励);(2) 扩展到音频-视觉联合生成与交互式世界模型评测——许多科学现象伴随声音与干预反馈,纯视觉评测覆盖不全;(3) 自动化错误归因:利用参考指南的分阶段故事线,定位模型在哪个因果阶段断裂,输出结构化诊断而非单一分数;(4) 检验提示重写、智能体多轮规划对专有前沿模型的增益上限,并解耦重写器与被评模型;(5) 对非视频可验证概念引入仿真器作为评测器,扩展基准的概念覆盖;(6) 跨语言提示(如中文)下的机理保真度对比,检验机理理解是否语言无关。
复现评估
复现评估:基准本体(full 1,253 例 + testmini 150 例)与逐例评测规范(参考指南 + 量规)随论文发布,这是最大利好——后续使用者不需要 61 名领域专家即可按同一标准评分,这正是本文发布规范的初衷。自动评测的评审器用开源 Qwen3.5-397B-A17B(MoE 架构、激活约 17B),完整复现需要多卡环境部署该量级模型;门槛较高的团队可用 Qwen3.5-9B(相关 55.7)或 Gemma-4-31B(60.4)替代,牺牲部分与专家的相关性。评审量可控:testmini 150 例 × 3 个推理维度 × 3 次评审,另加 VBench 六指标的 CPU/GPU 轻量计算。生成侧:8 个开源模型可本地生成(需支持视频输出的推理栈与相应显存),8 个专有模型走商业 API,按 testmini 计费尚可负担,全量 1,253 例则成本显著。人工对照部分(非专家评分实验、专家重评 $\kappa$ 验证)需要招募标注者,普通复现可省略。总体判断:协议与数据复现难度中等,主要开销在 16 模型 × 全量基准的生成与评审算力/费用。
论文图表
左上饼图展示 1,253 个专家标注样例在四大门类的分布:自然科学 45.3%(含化学、物理、大气科学、生化与分子生物学等 16 个学科)、医疗健康 23.9%、工程 22.6%、人文社科 8.2%,总计 60 个学科。其余面板给出每个门类一个提示-视频示例(均由 Gemini-Omni-Flash 生成):医疗的膝跳反射检查、人文社科的盲文六点“hello”触摸屏、工程的双斜面橡皮擦与金属块同时释放下滑、自然科学的有序数组顺序搜索 2D 动画,说明每个任务都需要理解底层科学机制才能正确生成。
一图看清基准的学科覆盖面和“机理驱动”任务长什么样,是理解“为什么要科学推理而不只是画面好看”的最直观入口。