VGI-BENCH:探测视频生成模型视觉智能的基准 VGI-BENCH: Probing Visual Intelligence in Video Generation Models
27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
前置知识
图像到视频生成(I2V)
视频生成模型的一种条件生成范式:模型接收一张静态图像作为视频首帧,配合文本提示词,生成一段以该图像为起点、符合提示约束的视频。生成时长通常为5到10秒,这也是当前商用与开源视频模型的典型规格。
VGI-BENCH 的全部 810 个实例都采用这种「首帧图+提示词→视频」格式,读懂任务设计与所有实验设置都以此为前提。
扩散模型与去噪轨迹
视频扩散模型通过多步迭代去噪把随机噪声逐步变成视频(本文开源模型默认40步)。每一步的中间潜变量都可以解码成可观看的视频片段,因此「解题状态」如何随去噪步骤演化是可以被观察和标注的。
论文 5.4 节正是通过解码中间去噪状态、标注相邻检查点间的状态转移,来回答「答案在第几步被决定、后期步骤能否自我纠错」这一核心问题。
VLM-as-Judge(大模型裁判)
用视觉语言模型代替人类给生成结果打分的评测范式。本文用 Gemini-3-Flash 按 Completeness 与 Rubric 两条通道评判每个视频,通过与 1100+ 人类偏好对对比(AUC 0.803、pairwise 73.2%)验证其可靠性。
27 个任务、近万条生成视频无法全部人工判分,理解本文的评测协议、成本与误差来源,必须先理解这套裁判设计与消融验证。
过程敏感任务 vs 结果导向任务
结果导向任务只检查最终帧是否正确;过程敏感任务要求中间每一步状态转移都合法且朝目标推进,例如汉诺塔一次只能移动一个圆盘、迷宫小车不得穿墙,即使终态正确,跳步或违规也算失败。
这是 VGI-BENCH 区别于既有基准的核心设计原则,也是其 Completeness×Rubric 双指标评测体系的直接动机。
合成数据 LoRA 微调
用程序化生成的抽象风格任务数据(如 VBVR 的 100 万样本数据集)对预训练视频模型做低成本微调,以期注入空间、规划等推理技能,同时避免人工采集真实推理视频的高昂成本。
5.3 节用三个开源 VBVR 模型研究这种微调的能力能否迁移到真实场景任务,并刻画了迁移边界,这是本文四项诊断分析之一。
研究动机
视频生成模型被宣传为「视觉世界模拟器」甚至「零样本视觉推理器」,但已有评测无法可靠验证这一说法,存在三个具体缺口。其一,输入分布错配:多数推理基准使用线稿或抽象示意图以换取可控性——论文统计 TiVi-Bench 只有约 1/4 乃至 1/9 的输入接近真实照片,VBVR-Bench 则全部由脚本生成、不含任何摄影级输入——而作者的受控对比显示,抽象输入更容易引发画面崩溃和约束忽视,会把「视觉域差距」误读为「推理缺陷」。其二,过程需求缺失:许多现成视觉推理任务(如瑞文推理矩阵、单帧 VQA)直接从输入就能作答,根本不要求模型「演出」场景如何演化,无法检验以帧序列表达推理的能力。其三,难度失控:现有基准混入远超当前可行域的任务,例如超出 5–10 秒生成时长的长时程任务、依赖医学等非视觉专业知识的知识型任务,导致失败样本不可诊断、模型排名失去区分度。
本文的目标是本文要构建一个「贴着当前能力边界」评测视频生成模型视觉智能的基准 VGI-BENCH:包含 27 个任务、810 个实例,每个任务按 Easy/Mid/Hard 三档难度、每档约 10 个实例展开;全部采用真实感输入图像加文本提示的 i2v 格式;只保留「过程敏感」任务,即正确性取决于中间状态演化与规则保持,而非只看最终帧。在此基准上系统评估 9 个视频生成模型(商用与开源)和 11 个图像模型,给出与人类天花板的差距,并从输出失败模式、输入条件敏感性、合成数据微调迁移、内部去噪动力学四个互补角度诊断视频推理行为,最终回答「当前视频模型到底有多少视觉智能、瓶颈在哪里、如何改进」。
与已有工作不同的是,本文的独特切入有三点。其一,把「难度校准」做成硬性流水线而非事后说辞:每个任务先取两个最易实例在 Sora2、Veo3.1、Kling3.0 等 SOTA 模型上预生成测试,只有当「至少一个模型能解出、且至少一个模型会失败」时才被接受,从而同时过滤掉平凡可解与完全不可行的任务,再辅以人工审查。其二,提出 Completeness 与 Rubric 双指标乘法评测,把全局目标推进与局部过程合法设为联合必要条件,堵住「直奔终态篡改场景」和「静止不动不犯规」两类捷径行为。其三,首创把扩散去噪中间态解码为视频、对相邻解码检查点之间的「解题状态转移」进行标注的协议,用转移分布定量回答「答案何时被锁定、后期步骤能否自我纠错」,把扩散语言模型领域关于 self-correction 的讨论第一次严谨地搬到视频生成上。
核心方法
直觉上,本文把视频生成模型当作「用帧序列表达推理过程的视觉推理器」:给它首帧图与目标提示词,看它能否在 5–10 秒内用一串合法中间状态把答案「演」出来。技术路线上,VGI-BENCH 采用双层分类法:第一层把 27 个任务划入四个互斥域——视觉组织、物理操作、结构化谜题、时空动态(各 5/7/8/7 个);第二层用七个非互斥技能标签标注底层能力(Planning 12、Physics 8、Spatial 7、Attribute Grounding 6、Affordance 5、Topology 3、Temporal 3)。每个实例由 16:9 输入图、约束式提示词与任务专属评判标准构成。自动评测由 Gemini-3-Flash 走两通道:全局 Completeness 按三档标准打 0/0.5/1 分;局部 Rubric 对每条清单违规数 $x_i$ 施加逆衰减惩罚 $s_i = 1/(x_i+1)$ 后取平均,最终得分 $\mathrm{Final} = \mathrm{Comp.} \times \mathrm{Rub.}$。另将 16 个任务改编为单图像输出版本。
核心创新是与既有基准在评测哲学上的三点差异。第一,「过程敏感」被形式化为可检测的约束:每条任务 rubric 明确检查中间转移的合法性(如迷宫小车不得穿墙、汉诺塔一次只能移一盘),使「跳过过程直接改出终态」的捷径被记为违规,这是 WorldSimBench 等只看物理合理性的评测做不到的。第二,双指标乘法聚合把完成度与合规性设为联合必要条件:$\mathrm{Final}=\mathrm{Comp.}\times\mathrm{Rub.}$,一段几乎静止的视频能拿高 Rubric 但 Completeness 趋零,一段直接改出目标场景的视频能拿高 Completeness 却被 Rubric 惩罚,任一维度失败都会压低总分。第三,违规计分采用逆衰减 $s_i = 1/(x_i+1)$:首次违规重罚、重复违规边际递减,作者验证换成指数衰减等单调函数定性结论不变。配合自适应粗到细抽帧与滑动窗口,这套裁判与人类偏好的一致性达到 AUC 0.803、pairwise 73.2%。
方法步骤详情
流程分五步。①任务提案:统一 I/O 为「输入图+提示词→5–10 秒视频」,要求过程敏感、解法长度匹配生成时长,按三档难度各约 10 实例展开。②素材构建:输入图来自网络/现成数据集,或用 GPT-Image-2、Nano Banana Pro 依文字或脚本示意图生成,人工在环迭代修正后统一为 16:9;提示词写明目标、允许/禁止动作与背景镜头等控制项;每任务配参考解(图或文本)。③质量控制:预生成过滤——取两个最易实例在 SOTA 模型上测试,「至少一解出且一失败」才接受;再人工审查忠实度、时长与提示清晰度。④自动评判:Completeness 通道以 2fps 抽帧对照三档标准输出 {0, 0.5, 1};Rubric 通道先 4fps 粗扫(10 帧滑窗),标记可疑帧后 8fps 细查,聚合调用去重得违规数 $x_i$,按 $s_i=1/(x_i+1)$ 计分取平均,实例分 $\mathrm{Final}=\mathrm{Comp.}\times\mathrm{Rub.}$。⑤辅助实验:16 任务改编为图像输出(二值判定),并开展人类天花板研究(90 分位时限、严格计分)。
技术新颖性
技术新颖性可从三个层面看。基准设计层面,表 1/表 20 的四维对照显示:PhysGenBench、WorldSimBench 推理需求低;TiVi-Bench、V-ReasonBench、VBVR-Bench 推理需求高但依赖抽象输入且不做可行性校准(只有 TiVi 提供多级难度,且数据未公开);VGI-BENCH 是唯一同时满足高推理需求、真实感输入、过程敏感、难度控制四项的基准。评测器层面,「4fps 粗扫+10 帧滑窗聚焦+8fps 细查+无图像聚合去重」的三段式协议,在成本可控的前提下把瞬态违规(如约 0.1 秒内完成的穿墙)纳入统计,消融显示去掉自适应抽帧或滑窗后 AUC 从 0.803 降至 0.772/0.753,换用 GPT-5-mini、Claude-Haiku-4.5、Qwen3.6-Plus 更是掉到 0.690/0.478/0.624。分析协议层面,去噪状态转移标注(♠不可读/♣稳定/■改变,■再分对→错、错→对、错→错′,仅错→对算自我纠错)是全新工具,它把「模型从不修改」与「模型在错误答案间打转」两种同样失败的叙事区分开来,为自纠错研究提供可复用度量。
实验结果
核心发现有五。(1) 排名:Seedance 2.0 以 51.0 居首,次优 MiniMax-H3/Kling 3.0 约 44,开源 Wan2.2/HunyuanVideo-1.5 仅 21.6/19.1 垫底;但双满分严格成功率下,Seedance 仅 14.0%,远低于人类天花板 97.1%。(2) 分域:视觉组织最易(Seedance 60.8),结构化谜题最难(HY1.5 仅 8.9),MiniMax-H3 在此反超至 50.6;技能上 Topology 与 Temporal 全线最弱。(3) 图像对照:16 任务子集上 Nano Banana Pro 55.0 居首,最弱仅 0.8。(4) 诊断:oracle prompt 给完整解仍提升有限;线稿风格改变开源模型排名;VBVR 合成微调使 Wan2.2 总分 21.5→41.2,增益随结构重叠递减(+40.5/+17.1/+6.2),Temporal 反降 11.2;去噪中自我纠错全程<0.9%,错→错′转移达 23.1%–24.8%,后半程稳定率 90.6%。(5) 评测器与人类偏好一致性 0.803/73.2%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频视觉推理(全基准 27 任务) | Final Score (%) | Seedance 2.0:51.0(最高) | 次优 MiniMax-H3 44.4 / Kling 3.0 44.0;开源 Wan2.2 仅 21.6 | 领先次优约 +6.6~7.0 个百分点 |
| 结构化谜题域(最难题域) | Final Score (%) | MiniMax-H3:50.6 | Seedance 2.0 44.6;HunyuanVideo-1.5 仅 8.9 | 开源模型在该域反超最强商用 +6.0 |
| 严格端到端成功率(Comp 与 Rub 双满分) | Strict Success Rate (%) | Seedance 2.0:14.0 | 人类天花板 97.1 | 仍有 83.1 个百分点差距,凸显任务远未解决 |
| 图像输出改编子集(16 任务) | 二值成功率 (%) | Nano Banana Pro:55.0 | Qwen-Image-3-Pro 42.7 / GPT-Image-2 41.2 | 领先 +12.3;最弱模型仅 0.8 |
| 合成数据微调迁移(与训练分布重叠的任务组) | Final Score (%) | VBVR-Wan2.2:55.8 | 基座 Wan2.2-I2V:15.3 | +40.5;但非重叠组仅 +6.2,Temporal 技能 −11.2 |
| VLM 裁判与人类偏好一致性 | AUC / Pairwise Accuracy | Gemini-3-Flash:0.803 / 73.2% | 换用 Claude-Haiku-4.5 仅 0.478 / 47.9% | +0.325 AUC;自适应抽帧与滑窗各贡献约 0.03 |
局限与改进
作者明说的局限:所有任务围绕当前模型 5–10 秒生成时长设计,多分钟级长时程推理不在范围内;只覆盖 i2v 与固定 16:9,文本到视频、多图条件、音频条件均未涉及;提示词与 rubric 全部为英文,无多语言评测;任务集定位「代表性」而非穷尽,模型能力提升后需要扩展。我的补充观察:其一,VLM 裁判对细粒度物理与拓扑变化的对齐最弱(Physical Manipulation 域 AUC 0.783、Topology 标签仅 0.731),这些域上的模型得分可能掺有裁判系统性误差;其二,主结果只判每格一半实例,虽经 5 模型×6 任务验证偏移仅 −2.3 且排名不变,但小样本使难度曲线出现 Mid 高于 Easy 的局部倒置,技能级结论(Topology/Temporal 各只有 3 个任务)统计功效有限;其三,人类天花板由论文作者本人标注、无外部被试与报酬,97.1% 可能偏乐观;其四,线艺风格对比仅 7 个任务、oracle prompt 实验仅 7 个任务,结论外推需谨慎。
独立分析的弱点
独立分析的弱点及改进方向:(1) 裁判盲区——8fps 细查仍留有约 0.125 秒的帧间盲区,快速物理交互(碰撞、穿透)可能漏检,且判定完全依赖 Gemini-3-Flash 单一模型,可引入光流一致性检查、多裁判集成或视频原生 VLM 交叉验证;(2) 技能覆盖不均——Topology、Temporal 各仅 3 个任务却支撑「最弱技能」的关键结论,应扩充每标签任务数并用项目反应理论(IRT)做题目校准,消除 Mid 高于 Easy 的难度倒置;(3) 人类基线单薄——全部由 CS 背景的论文作者自评,缺少不同专业与年龄分布,建议外聘被试并报告分位数;(4) 图像改编判定过严——要求背景保持可能把风格变化大但任务正确的输出判为失败(如 BAGEL 的 0.8 分或系低估),可把「任务正确性」与「背景保持」拆成两个独立分数;(5) 去噪分析局限——仅 4 个开源模型、默认 40 步设置,不同采样器、步数、CFG 尺度下行为是否一致未知;(6) 真实感与干扰耦合——真实场景引入的无关视觉变化可能干扰推理本身,缺少同任务的简洁背景受控消融。
未来方向
作者提出的方向:扩展长时程程序化推理任务、支持文本到视频/多图/音频条件、多语言提示与 rubric、随模型能力提升持续扩充电任务集。基于本文成果可自然延伸的方向:(1) 训练侧——把去噪状态转移标注改造成扩散模型的过程奖励信号(类似过程奖励模型 PRM),或按 VGI-BENCH rubric 构造可验证奖励做 RLVR 微调(论文引用的 Zhu et al. 2026 已开启该方向);(2) 自纠错机制——既然答案在前 10% 去噪步数即锁定且错→对转移近乎为零,可探索中途重启、分支采样、按时间步加权的注意力等手段让后期步骤真正改写早期假设;(3) 迁移标度律——系统研究合成数据的规模、多样性与结构覆盖同真实任务增益的关系,并解释 CLOCK_RUNNING 微调后从 32.5 跌至 10.0 这类反例;(4) 裁判进化——用本文 1100+ 人类偏好对训练专用的视频过程评判模型,替代通用 VLM;(5) 世界模型衔接——把 VGI-BENCH 与具身任务(如机器人操作)打通,检验视觉 rollout 能力能否转化为可执行的动作策略。
复现评估
复现条件属中上水平。数据与评测代码承诺以研究友好许可开源(附 Project Page、Data、Code 入口),27 个任务、810 个实例连同参考解与评判标准均在发布范围。算力与成本:商用模型走 API(Sora2 约 $0.10/秒、Veo 3.1 $0.20/秒、Seedance 2.0 $0.15/秒、Kling 3.0 $0.08/秒),开源模型(Wan2.2、HunyuanVideo-1.5、MiniMax-H3 等)在 NVIDIA H20 GPU 上本地推理;主结果用半实例协议控制成本,经 Table 13 验证与全集偏移仅 −2.3 且排名不变。裁判为公开 API 的 Gemini-3-Flash,四段完整 prompt(两通道评判+聚合去重+图像判定)在附录 Table 16–19 全文公开,可靠性验证基于 1100+ 人类偏好对。风险点:部分输入图依赖 GPT-Image-2、Nano Banana Pro 生成,模型版本更替可能导致素材不可完全复刻;商用 API 输出非确定;去噪解码需自建工程管道。综合估计:数千美元级 API 预算加单机多卡即可复现主表。
论文图表
同一迷宫任务的真实场景版与线稿版对比:真实场景输入下模型成功解出迷宫;线稿输入下即使提示词明确要求保持迷宫结构与规则,模型仍然失败且结构未被保留。
以具体案例验证核心动机——抽象输入引发的失败更多是视觉域错配而非推理能力问题,评测结论会被输入风格混淆。