← 返回 2026-08-27

VGI-BENCH:探测视频生成模型视觉智能的基准 VGI-BENCH: Probing Visual Intelligence in Video Generation Models

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai 📅 2026-08-20 👍 177 2026-09-01 18:30
VLM-as-Judge 基准评测 扩散模型 视觉推理 视频生成

27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分

前置知识

图像到视频生成(I2V)

视频生成模型的一种条件生成范式:模型接收一张静态图像作为视频首帧,配合文本提示词,生成一段以该图像为起点、符合提示约束的视频。生成时长通常为5到10秒,这也是当前商用与开源视频模型的典型规格。

VGI-BENCH 的全部 810 个实例都采用这种「首帧图+提示词→视频」格式,读懂任务设计与所有实验设置都以此为前提。

扩散模型与去噪轨迹

视频扩散模型通过多步迭代去噪把随机噪声逐步变成视频(本文开源模型默认40步)。每一步的中间潜变量都可以解码成可观看的视频片段,因此「解题状态」如何随去噪步骤演化是可以被观察和标注的。

论文 5.4 节正是通过解码中间去噪状态、标注相邻检查点间的状态转移,来回答「答案在第几步被决定、后期步骤能否自我纠错」这一核心问题。

VLM-as-Judge(大模型裁判)

用视觉语言模型代替人类给生成结果打分的评测范式。本文用 Gemini-3-Flash 按 Completeness 与 Rubric 两条通道评判每个视频,通过与 1100+ 人类偏好对对比(AUC 0.803、pairwise 73.2%)验证其可靠性。

27 个任务、近万条生成视频无法全部人工判分,理解本文的评测协议、成本与误差来源,必须先理解这套裁判设计与消融验证。

过程敏感任务 vs 结果导向任务

结果导向任务只检查最终帧是否正确;过程敏感任务要求中间每一步状态转移都合法且朝目标推进,例如汉诺塔一次只能移动一个圆盘、迷宫小车不得穿墙,即使终态正确,跳步或违规也算失败。

这是 VGI-BENCH 区别于既有基准的核心设计原则,也是其 Completeness×Rubric 双指标评测体系的直接动机。

合成数据 LoRA 微调

用程序化生成的抽象风格任务数据(如 VBVR 的 100 万样本数据集)对预训练视频模型做低成本微调,以期注入空间、规划等推理技能,同时避免人工采集真实推理视频的高昂成本。

5.3 节用三个开源 VBVR 模型研究这种微调的能力能否迁移到真实场景任务,并刻画了迁移边界,这是本文四项诊断分析之一。

研究动机

视频生成模型被宣传为「视觉世界模拟器」甚至「零样本视觉推理器」,但已有评测无法可靠验证这一说法,存在三个具体缺口。其一,输入分布错配:多数推理基准使用线稿或抽象示意图以换取可控性——论文统计 TiVi-Bench 只有约 1/4 乃至 1/9 的输入接近真实照片,VBVR-Bench 则全部由脚本生成、不含任何摄影级输入——而作者的受控对比显示,抽象输入更容易引发画面崩溃和约束忽视,会把「视觉域差距」误读为「推理缺陷」。其二,过程需求缺失:许多现成视觉推理任务(如瑞文推理矩阵、单帧 VQA)直接从输入就能作答,根本不要求模型「演出」场景如何演化,无法检验以帧序列表达推理的能力。其三,难度失控:现有基准混入远超当前可行域的任务,例如超出 5–10 秒生成时长的长时程任务、依赖医学等非视觉专业知识的知识型任务,导致失败样本不可诊断、模型排名失去区分度。

本文的目标是本文要构建一个「贴着当前能力边界」评测视频生成模型视觉智能的基准 VGI-BENCH:包含 27 个任务、810 个实例,每个任务按 Easy/Mid/Hard 三档难度、每档约 10 个实例展开;全部采用真实感输入图像加文本提示的 i2v 格式;只保留「过程敏感」任务,即正确性取决于中间状态演化与规则保持,而非只看最终帧。在此基准上系统评估 9 个视频生成模型(商用与开源)和 11 个图像模型,给出与人类天花板的差距,并从输出失败模式、输入条件敏感性、合成数据微调迁移、内部去噪动力学四个互补角度诊断视频推理行为,最终回答「当前视频模型到底有多少视觉智能、瓶颈在哪里、如何改进」。

与已有工作不同的是,本文的独特切入有三点。其一,把「难度校准」做成硬性流水线而非事后说辞:每个任务先取两个最易实例在 Sora2、Veo3.1、Kling3.0 等 SOTA 模型上预生成测试,只有当「至少一个模型能解出、且至少一个模型会失败」时才被接受,从而同时过滤掉平凡可解与完全不可行的任务,再辅以人工审查。其二,提出 Completeness 与 Rubric 双指标乘法评测,把全局目标推进与局部过程合法设为联合必要条件,堵住「直奔终态篡改场景」和「静止不动不犯规」两类捷径行为。其三,首创把扩散去噪中间态解码为视频、对相邻解码检查点之间的「解题状态转移」进行标注的协议,用转移分布定量回答「答案何时被锁定、后期步骤能否自我纠错」,把扩散语言模型领域关于 self-correction 的讨论第一次严谨地搬到视频生成上。

核心方法

直觉上,本文把视频生成模型当作「用帧序列表达推理过程的视觉推理器」:给它首帧图与目标提示词,看它能否在 5–10 秒内用一串合法中间状态把答案「演」出来。技术路线上,VGI-BENCH 采用双层分类法:第一层把 27 个任务划入四个互斥域——视觉组织、物理操作、结构化谜题、时空动态(各 5/7/8/7 个);第二层用七个非互斥技能标签标注底层能力(Planning 12、Physics 8、Spatial 7、Attribute Grounding 6、Affordance 5、Topology 3、Temporal 3)。每个实例由 16:9 输入图、约束式提示词与任务专属评判标准构成。自动评测由 Gemini-3-Flash 走两通道:全局 Completeness 按三档标准打 0/0.5/1 分;局部 Rubric 对每条清单违规数 $x_i$ 施加逆衰减惩罚 $s_i = 1/(x_i+1)$ 后取平均,最终得分 $\mathrm{Final} = \mathrm{Comp.} \times \mathrm{Rub.}$。另将 16 个任务改编为单图像输出版本。

核心创新是与既有基准在评测哲学上的三点差异。第一,「过程敏感」被形式化为可检测的约束:每条任务 rubric 明确检查中间转移的合法性(如迷宫小车不得穿墙、汉诺塔一次只能移一盘),使「跳过过程直接改出终态」的捷径被记为违规,这是 WorldSimBench 等只看物理合理性的评测做不到的。第二,双指标乘法聚合把完成度与合规性设为联合必要条件:$\mathrm{Final}=\mathrm{Comp.}\times\mathrm{Rub.}$,一段几乎静止的视频能拿高 Rubric 但 Completeness 趋零,一段直接改出目标场景的视频能拿高 Completeness 却被 Rubric 惩罚,任一维度失败都会压低总分。第三,违规计分采用逆衰减 $s_i = 1/(x_i+1)$:首次违规重罚、重复违规边际递减,作者验证换成指数衰减等单调函数定性结论不变。配合自适应粗到细抽帧与滑动窗口,这套裁判与人类偏好的一致性达到 AUC 0.803、pairwise 73.2%。

方法步骤详情

流程分五步。①任务提案:统一 I/O 为「输入图+提示词→5–10 秒视频」,要求过程敏感、解法长度匹配生成时长,按三档难度各约 10 实例展开。②素材构建:输入图来自网络/现成数据集,或用 GPT-Image-2、Nano Banana Pro 依文字或脚本示意图生成,人工在环迭代修正后统一为 16:9;提示词写明目标、允许/禁止动作与背景镜头等控制项;每任务配参考解(图或文本)。③质量控制:预生成过滤——取两个最易实例在 SOTA 模型上测试,「至少一解出且一失败」才接受;再人工审查忠实度、时长与提示清晰度。④自动评判:Completeness 通道以 2fps 抽帧对照三档标准输出 {0, 0.5, 1};Rubric 通道先 4fps 粗扫(10 帧滑窗),标记可疑帧后 8fps 细查,聚合调用去重得违规数 $x_i$,按 $s_i=1/(x_i+1)$ 计分取平均,实例分 $\mathrm{Final}=\mathrm{Comp.}\times\mathrm{Rub.}$。⑤辅助实验:16 任务改编为图像输出(二值判定),并开展人类天花板研究(90 分位时限、严格计分)。

技术新颖性

技术新颖性可从三个层面看。基准设计层面,表 1/表 20 的四维对照显示:PhysGenBench、WorldSimBench 推理需求低;TiVi-Bench、V-ReasonBench、VBVR-Bench 推理需求高但依赖抽象输入且不做可行性校准(只有 TiVi 提供多级难度,且数据未公开);VGI-BENCH 是唯一同时满足高推理需求、真实感输入、过程敏感、难度控制四项的基准。评测器层面,「4fps 粗扫+10 帧滑窗聚焦+8fps 细查+无图像聚合去重」的三段式协议,在成本可控的前提下把瞬态违规(如约 0.1 秒内完成的穿墙)纳入统计,消融显示去掉自适应抽帧或滑窗后 AUC 从 0.803 降至 0.772/0.753,换用 GPT-5-mini、Claude-Haiku-4.5、Qwen3.6-Plus 更是掉到 0.690/0.478/0.624。分析协议层面,去噪状态转移标注(♠不可读/♣稳定/■改变,■再分对→错、错→对、错→错′,仅错→对算自我纠错)是全新工具,它把「模型从不修改」与「模型在错误答案间打转」两种同样失败的叙事区分开来,为自纠错研究提供可复用度量。

Overview of representative tasks in our benchmark
Figure 1: Overview of representative tasks in our benchmark

实验结果

核心发现有五。(1) 排名:Seedance 2.0 以 51.0 居首,次优 MiniMax-H3/Kling 3.0 约 44,开源 Wan2.2/HunyuanVideo-1.5 仅 21.6/19.1 垫底;但双满分严格成功率下,Seedance 仅 14.0%,远低于人类天花板 97.1%。(2) 分域:视觉组织最易(Seedance 60.8),结构化谜题最难(HY1.5 仅 8.9),MiniMax-H3 在此反超至 50.6;技能上 Topology 与 Temporal 全线最弱。(3) 图像对照:16 任务子集上 Nano Banana Pro 55.0 居首,最弱仅 0.8。(4) 诊断:oracle prompt 给完整解仍提升有限;线稿风格改变开源模型排名;VBVR 合成微调使 Wan2.2 总分 21.5→41.2,增益随结构重叠递减(+40.5/+17.1/+6.2),Temporal 反降 11.2;去噪中自我纠错全程<0.9%,错→错′转移达 23.1%–24.8%,后半程稳定率 90.6%。(5) 评测器与人类偏好一致性 0.803/73.2%。

Comparison with related video benchmarks
Table 1: Comparison with related video benchmarks
Evaluation results of video generation models
Table 2: Evaluation results of video generation models
Full per-metric evaluation results of video generation models
Table 11: Full per-metric evaluation results of video generation models
Reliability of our VLM-based evaluator compared with human annotations
Table 3: Reliability of our VLM-based evaluator compared with human annotations
Strict success rate (%) of video generation models on VGI-BENCH
Table 12: Strict success rate (%) of video generation models on VGI-BENCH
Evaluation results of image models on the adapted subset
Table 4: Evaluation results of image models on the adapted subset
Performance of the three released VBVR models and their respective base models, grouped by structural overlap
Table 5: Performance of the three released VBVR models and their respective base models, grouped by structural overlap
Per-domain (top) and per-skill (bottom) performance breakdown for VBVR-Wan2.2 vs. base Wan2.2-I2V
Table 6: Per-domain (top) and per-skill (bottom) performance breakdown for VBVR-Wan2.2 vs. base Wan2.2-I2V
Distribution (%) of solution-state transitions between consecutive decoded denoising steps
Table 7: Distribution (%) of solution-state transitions between consecutive decoded denoising steps
Stability of half-subset evaluation against full-instance evaluation
Table 13: Stability of half-subset evaluation against full-instance evaluation
Per-model performance across the skill tags
Figure 2: Per-model performance across the skill tags
Representative cases in the failure modes
Figure 3: Representative cases in the failure modes
Representative failure cases for the three failure modes
Figure 17: Representative failure cases for the three failure modes
Performance comparison in oracle prompting and in varying input visual styles
Figure 5: Performance comparison in oracle prompting and in varying input visual styles
Decoded frames at different denoising stages
Figure 6: Decoded frames at different denoising stages
查看结构化数据
任务指标本文基线提升
视频视觉推理(全基准 27 任务) Final Score (%) Seedance 2.0:51.0(最高) 次优 MiniMax-H3 44.4 / Kling 3.0 44.0;开源 Wan2.2 仅 21.6 领先次优约 +6.6~7.0 个百分点
结构化谜题域(最难题域) Final Score (%) MiniMax-H3:50.6 Seedance 2.0 44.6;HunyuanVideo-1.5 仅 8.9 开源模型在该域反超最强商用 +6.0
严格端到端成功率(Comp 与 Rub 双满分) Strict Success Rate (%) Seedance 2.0:14.0 人类天花板 97.1 仍有 83.1 个百分点差距,凸显任务远未解决
图像输出改编子集(16 任务) 二值成功率 (%) Nano Banana Pro:55.0 Qwen-Image-3-Pro 42.7 / GPT-Image-2 41.2 领先 +12.3;最弱模型仅 0.8
合成数据微调迁移(与训练分布重叠的任务组) Final Score (%) VBVR-Wan2.2:55.8 基座 Wan2.2-I2V:15.3 +40.5;但非重叠组仅 +6.2,Temporal 技能 −11.2
VLM 裁判与人类偏好一致性 AUC / Pairwise Accuracy Gemini-3-Flash:0.803 / 73.2% 换用 Claude-Haiku-4.5 仅 0.478 / 47.9% +0.325 AUC;自适应抽帧与滑窗各贡献约 0.03

局限与改进

作者明说的局限:所有任务围绕当前模型 5–10 秒生成时长设计,多分钟级长时程推理不在范围内;只覆盖 i2v 与固定 16:9,文本到视频、多图条件、音频条件均未涉及;提示词与 rubric 全部为英文,无多语言评测;任务集定位「代表性」而非穷尽,模型能力提升后需要扩展。我的补充观察:其一,VLM 裁判对细粒度物理与拓扑变化的对齐最弱(Physical Manipulation 域 AUC 0.783、Topology 标签仅 0.731),这些域上的模型得分可能掺有裁判系统性误差;其二,主结果只判每格一半实例,虽经 5 模型×6 任务验证偏移仅 −2.3 且排名不变,但小样本使难度曲线出现 Mid 高于 Easy 的局部倒置,技能级结论(Topology/Temporal 各只有 3 个任务)统计功效有限;其三,人类天花板由论文作者本人标注、无外部被试与报酬,97.1% 可能偏乐观;其四,线艺风格对比仅 7 个任务、oracle prompt 实验仅 7 个任务,结论外推需谨慎。

独立分析的弱点

独立分析的弱点及改进方向:(1) 裁判盲区——8fps 细查仍留有约 0.125 秒的帧间盲区,快速物理交互(碰撞、穿透)可能漏检,且判定完全依赖 Gemini-3-Flash 单一模型,可引入光流一致性检查、多裁判集成或视频原生 VLM 交叉验证;(2) 技能覆盖不均——Topology、Temporal 各仅 3 个任务却支撑「最弱技能」的关键结论,应扩充每标签任务数并用项目反应理论(IRT)做题目校准,消除 Mid 高于 Easy 的难度倒置;(3) 人类基线单薄——全部由 CS 背景的论文作者自评,缺少不同专业与年龄分布,建议外聘被试并报告分位数;(4) 图像改编判定过严——要求背景保持可能把风格变化大但任务正确的输出判为失败(如 BAGEL 的 0.8 分或系低估),可把「任务正确性」与「背景保持」拆成两个独立分数;(5) 去噪分析局限——仅 4 个开源模型、默认 40 步设置,不同采样器、步数、CFG 尺度下行为是否一致未知;(6) 真实感与干扰耦合——真实场景引入的无关视觉变化可能干扰推理本身,缺少同任务的简洁背景受控消融。

未来方向

作者提出的方向:扩展长时程程序化推理任务、支持文本到视频/多图/音频条件、多语言提示与 rubric、随模型能力提升持续扩充电任务集。基于本文成果可自然延伸的方向:(1) 训练侧——把去噪状态转移标注改造成扩散模型的过程奖励信号(类似过程奖励模型 PRM),或按 VGI-BENCH rubric 构造可验证奖励做 RLVR 微调(论文引用的 Zhu et al. 2026 已开启该方向);(2) 自纠错机制——既然答案在前 10% 去噪步数即锁定且错→对转移近乎为零,可探索中途重启、分支采样、按时间步加权的注意力等手段让后期步骤真正改写早期假设;(3) 迁移标度律——系统研究合成数据的规模、多样性与结构覆盖同真实任务增益的关系,并解释 CLOCK_RUNNING 微调后从 32.5 跌至 10.0 这类反例;(4) 裁判进化——用本文 1100+ 人类偏好对训练专用的视频过程评判模型,替代通用 VLM;(5) 世界模型衔接——把 VGI-BENCH 与具身任务(如机器人操作)打通,检验视觉 rollout 能力能否转化为可执行的动作策略。

复现评估

复现条件属中上水平。数据与评测代码承诺以研究友好许可开源(附 Project Page、Data、Code 入口),27 个任务、810 个实例连同参考解与评判标准均在发布范围。算力与成本:商用模型走 API(Sora2 约 $0.10/秒、Veo 3.1 $0.20/秒、Seedance 2.0 $0.15/秒、Kling 3.0 $0.08/秒),开源模型(Wan2.2、HunyuanVideo-1.5、MiniMax-H3 等)在 NVIDIA H20 GPU 上本地推理;主结果用半实例协议控制成本,经 Table 13 验证与全集偏移仅 −2.3 且排名不变。裁判为公开 API 的 Gemini-3-Flash,四段完整 prompt(两通道评判+聚合去重+图像判定)在附录 Table 16–19 全文公开,可靠性验证基于 1100+ 人类偏好对。风险点:部分输入图依赖 GPT-Image-2、Nano Banana Pro 生成,模型版本更替可能导致素材不可完全复刻;商用 API 输出非确定;去噪解码需自建工程管道。综合估计:数千美元级 API 预算加单机多卡即可复现主表。