← 返回 2026-08-27

Video-IFBench:视频理解场景下多模态大模型指令遵循能力评测基准 Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao 📅 2026-08-26 👍 16 2026-09-01 18:30
LLM-as-Judge 多模态大模型 指令遵循 视频理解 评测基准

首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分

前置知识

多模态大模型(MLLM)

以大语言模型为底座、接入视觉(有时还有音频)编码器的模型,可接收视频帧、图像与文本输入并生成回答。视频场景下通常按固定帧率抽帧或限制帧数送入视觉编码器;omni 全模态模型还能直接消费音频流。代表包括 Gemini、GPT 系列、Qwen-VL/Qwen-Omni、InternVL、Gemma 等。

本文的评测对象就是这些 MLLM,理解其抽帧与音频输入机制才能读懂实验设置,例如 Gemini/Doubao 以 1 FPS 供视频、GPT-5.4 因 API 限制只采样 50 帧、纯视觉模型额外配 Gemini-3-Pro 转写的带时间戳字幕。

指令遵循与约束(语义约束 vs 格式约束)

指令遵循指模型在完成任务之外还须满足用户附加的显式要求。约束分两类:语义约束要求回答内容与输入内容精确对齐(如"只描述 00:20–00:55 之间的事件""按时间顺序排列"),格式约束只管输出形式(如字数范围、JSON 结构、编号列表、必须/禁用关键词)。文本侧经典基准 IFEval 即以可程序验证的格式规则起步。

Video-IFBench 的 39 类约束(22 语义 + 17 格式)与全部指标都建立在"约束可判定"这一框架上;论文的核心结论之一正是语义约束远难于格式约束。

LLM-as-Judge 与 checklist 评测

用一个强 LLM 按评分细则给被评模型的回答打分。Checklist 化是把要求拆成若干二元判定项(每项回答"是/否"),相比整段模糊打分更细粒度、更可复现;能程序化验证的项(长度、正则、JSON 结构)则直接交确定性代码判定,以减少判官偏见。语义项通常还需提供视频证据(judge context)辅助判官。

本文评测协议正是"LLM-as-Judge(语义项)+ 程序化校验(格式项)"的混合方案,判官为 Qwen3.5-397B-A17B-Instruct,并用 35B 小判官做了敏感性消融。

TCSR 与 TISR 任务门控指标

两者都先做任务门控:$t_i \in \{0,1\}$ 表示回答是否覆盖激活指令的全部任务,未过门控记 0 分。$n_i$ 为清单项数、$c_{ij}$ 为第 $j$ 项是否满足。$\mathrm{TCSR}=\frac{1}{N}\sum_{i=1}^{N} t_i \cdot \frac{1}{n_i}\sum_{j=1}^{n_i} c_{ij}$ 度量部分满足程度;$\mathrm{TISR}=\frac{1}{N}\sum_{i=1}^{N} t_i \cdot \prod_{j=1}^{n_i} c_{ij}$ 要求所有清单项同时满足才算对。

论文所有结果表格的数字都是"TCSR / TISR"成对出现,不理解门控逻辑就无法解读为什么 TISR 总是显著低于 TCSR(普遍"满足部分约束但难全对")。

条件指令(Selection / Nested 结构)

Selection 指令给出多个候选条件分支,模型须依据视频实际内容判断哪个条件为真、只执行对应分支上的指令;Nested 进一步把条件组织成树,模型要沿唯一正确的根到叶路径走到底再作答。数据构造时通过事实变换(编辑/否定/组合)保证每道题恰有一条真路径,使答案可精确判定。

条件结构是本文发现的 最大失分区:Nested 上 GPT-5.4 仅 7.6 TISR,最佳开源也只有 28.2。理解这种"先选路、后答题"结构才能明白模型究竟输在视频条件判断还是指令执行。

研究动机

现实用户对视频模型的请求几乎从不只是"描述这段视频",而是附带明确的语义与格式要求:例如分析烹饪教程时,用户可能要求"只描述食材混合之后的步骤,按时间顺序列出并附时间戳"。然而现有视频理解评测——MVBench、Video-MME、TempCompass、MLVU、LongVideoBench、Video-MMMU 等——都以"回答是否正确"为核心,几乎不检验模型是否忠实执行了复杂指令。另一方面,指令遵循评测长期停留在纯文本场景(FollowEval、FollowBench、IFEval、InFoBench),多模态扩展集中在图像侧(MIA-Bench、MM-IFEngine、VC-IFEval)或受限的视频字幕生成(IF-VidCap),没有覆盖带视觉/音频依据的语义约束,更没有多分支条件指令。于是"视频理解准确率高"与"能可靠遵循用户意图"之间存在明显评测空白,模型部署到真实场景时的失败模式无法被现有榜单预测。

本文的目标是本文要建立系统评测视频场景指令遵循能力的基准 Video-IFBench,目标有三。其一,设计覆盖指令复杂度两个维度的指令分类法——任务组合(Single 单任务 / Multi 多任务)与条件结构(Selection 分支选择 / Nested 树形嵌套),覆盖 32 种人工整理的视频任务类型和 39 类响应约束(22 类语义、17 类格式)。其二,用半自动流水线(MLLM 抽取 + 程序化规则 + 人工校验)压低标注成本,构建 1.5K 高质量样本:视频 700 余段、总时长约 49 小时、单段 10 秒到 10 分钟、横跨 10 个领域。其三,设计 LLM-as-Judge 与程序化校验结合的混合评测协议,输出任务门控的 TCSR/TISR 指标,并对 20 余个主流 MLLM(Gemini-3、GPT-5.4、Doubao、Qwen、InternVL、Gemma 系列)做大规模实证,定位当前模型的真实短板。

与已有工作不同的是,本文的独特切入是把"指令遵循"从文本侧的正确性评测问题,改造成"视频内容依据 × 条件结构"的双重考题。与 IF-VidCap 只考受约束字幕不同,这里的约束大量锚定视频细粒度事实(如"只描述 00:20–00:55 的事件""若视频开头出现某标题则执行 A 否则执行 B");与图像侧 IF 基准不同,视频引入了时间定位、时序范围、转场边界、动作相对位置等独有约束类型。最关键的差异在 Selection/Nested 的构造方式:作者先把抽取出的原子事实经编辑(keyboard→screen)、否定(pour water→does not pour water)、编辑加否定组合三种变换制成真假条件池,再生成树形指令并保证恰有一条正确路径,从而能精确测量"按视频内容选对分支再执行"的能力——这是现有视频与多模态基准都没有的评测维度,也让分支数、树深、约束数可以受控变化以做消融。

核心方法

直觉上,评测指令遵循需要一个"可判分的清单":把每条指令拆成若干可独立判定真假的约束项,再看回答满足了多少。Video-IFBench 的技术路线分四块:(1) 视频策展——从 WorldSense、Video-MME、MMBench-Video、FineVideo、LongVALE 等公开来源收集视频并用 MUSIQ 过滤模糊样本,覆盖 10 个领域、时长 10 秒至 10 分钟、总计约 49 小时;(2) 知识池构建——人工整理 6 大类 32 种任务类型(感知识别、时序理解、空间理解、关系交互、逻辑推理、字幕生成)与 39 种约束(22 语义 + 17 格式);(3) 信息抽取与指令生成——用 MLLM 为每个视频抽取全局描述和带时间戳的原子事实列表,据此生成四类指令并为每条指令配检查清单;(4) 全量人工校验。评测端由 LLM-as-Judge 判语义项、确定性程序校验格式项,计算任务门控的 TCSR/TISR 两个指标。

核心创新有二。第一是四模板指令分类法:Single/Multi 只变任务数量(Single 约束数 1–15 可调;Multi 的全局与任务级约束刻意控制在约 3 个以内),从而把"任务数"与"约束数"两个混淆变量解耦,分别做扩展实验;Selection/Nested 则考"视频条件分支",模型必须先依据视频内容判断哪个条件为真、沿树走到正确叶子、再执行叶子上挂的指令。第二是"事实变换造条件"的构造技巧:直接让 MLLM 自由写复杂条件往往得不到足够深的分支,作者改为先把原子事实做三种确定性变换——编辑(最小改动使事实为假,如 keyboard→screen)、否定(pour water→does not pour water)、编辑加否定组合(产生另一真变体)——得到真假条件池,然后生成树结构、采样一个叶子作为唯一真目标,并在每条非目标路径上随机标记一个假节点,保证每题恰有一条有效路径。这使条件复杂度可控、答案可判定,并天然配套好判分清单。

方法步骤详情

流水线共六步。(1) 视频策展:多来源收集 → MUSIQ 质量过滤 → 覆盖 10 领域、700+ 段、约 49 小时。(2) 任务与约束池:分析现有基准样例,人工定义 6 大类 32 种任务与 39 种约束,经多轮清理去除模糊、冗余、难验证项。(3) 信息抽取:MLLM 为每个视频生成全局描述与原子级带时间戳事实列表;长视频按 1 分钟分段顺序处理并维护共享实体记忆,保持人物/物体指代跨段一致。(4) 指令生成:Single/Multi 按目标类型采样任务并限制每类约束出现频率以平衡分布;Selection/Nested 走"事实变换 → 树结构生成 → 采样唯一真叶子 → 非目标路径标记假节点 → 逐节点写条件文本与叶子指令"的多阶段流程。(5) 清单生成:记录每条被采样的约束并配一个二元判定项("是"即满足),语义项附视频依据的 judge context,格式项(长度、JSON、关键词等)走确定性函数校验。(6) 人工校验:核对视频描述、事实、条件分支/路径、清单查询与判官上下文,问题样本修正或丢弃。

技术新颖性

技术新颖性体现在三点。其一,评测维度上首次把"多约束 + 条件分支"作为视频 MLLM 的一等公民:现有视频基准量的是答案对错,文本侧 IFEval 系列没有视频依据,本文把语义约束 × 格式约束 × Single/Multi/Selection/Nested × 32 种任务正交组合成系统能力矩阵。其二,构造方法上用"程序规则 + MLLM"的半自动混合替代纯模型生成:约束采样带频次上限、条件由事实确定性变换而来、唯一真路径由算法保证,使数据复杂度可精确控制(约束数 1–15、分支数 2–4、树深 2–14 均能构造受控子集),直接支撑了约束扩展、深度敏感、分支位置等消融分析。其三,评测协议上 checklist 化加混合判分:LLM-as-Judge 只处理需要视频证据的语义项,可编程验证的格式项交给确定性函数,并设计 TCSR/TISR 两个任务门控指标,把"做没做对题"与"守没守规矩"分开计分,使失败模式可归因。

The data construction pipeline of Video-IFBench
Figure 1: The data construction pipeline of Video-IFBench
Instruction and constraint statistics of Video-IFBench
Figure 3: Instruction and constraint statistics of Video-IFBench

实验结果

在 20 余个模型上的核心发现有五。(1) 整体很难:最强 Gemini-3-Pro 也只有 76.5 TCSR / 54.5 TISR,最佳开源 Qwen3.5-397B-A17B-Think 为 69.6/46.1,GPT-5.4 仅 57.4/30.0;所有模型 TISR 均显著低于 TCSR,说明普遍"满足部分约束但难全对"。(2) 结构差异明显:多数模型 Multi 得分反高于 Single(Gemini-3-Pro Multi 88.6/58.8 对 Single 79.6/52.3),瓶颈不在多任务而在多约束;Selection/Nested 骤降,Nested 最难——Gemini-3-Pro 仅 53.7/46.0,最佳开源 33.0/28.2,GPT-5.4 仅 12.1/7.6。(3) 约束数是主要瓶颈:Single 指令 TISR 随约束数从 1–4 到 9+ 大幅下滑,Gemini-3-Pro 62.7%→46.9%,弱开源模型崩溃(Qwen3-Omni-30B-A3B-Instruct 40.1%→3.5%,Gemma-4-E4B-it 38.4%→7.1%);而任务数从 1–4 增到 9+ 时强模型几乎不变(Gemini-3-Pro 95.6/94.9/96.3)。(4) 语义约束远难于格式约束,Temporal Anchor、Transition Boundary、Temporal Scope、Action-Relative Selection 等时间定位类约束全场低分,说明模型难以对齐细粒度视频证据。(5) 深度与位置敏感:Nested 树深从 2–4 到 8–14,Gemini-3-Pro 任务通过率 64.6%→55.6%、Qwen3.5-397B-Think 40.5%→22.2%;Selection 分支数 2→4 时 Gemini-3-Flash 66.7%→56.5%、Qwen3.5-397B-Instruct 58.0%→39.1%;正确分支越靠后表现越差,暴露位置偏置(Qwen3.5-397B-Think 76.5%→52.9%,Instruct 版 70.6%→29.4%)。此外 Thinking 变体普遍抬升上限但提升不稳定,同族内规模越大性能越好。

Main results on Video-IFBench
Table 1: Main results on Video-IFBench
Scaling analysis of task and constraint complexity
Table 2: Scaling analysis of task and constraint complexity
Task pass rate on Selection instructions using the 3-condition-plus-else subset
Table 3: Task pass rate on Selection instructions using the 3-condition-plus-else subset
Performance distribution on 15 most challenging constraints
Figure 4: Performance distribution on 15 most challenging constraints
Model scaling and semantic-format constraint performance
Figure 5: Model scaling and semantic-format constraint performance
Depth sensitivity on Nested instructions
Figure 6: Depth sensitivity on Nested instructions
查看结构化数据
任务指标本文基线提升
视频指令遵循(全基准 Overall) TCSR / TISR Gemini-3-Pro 76.5 / 54.5(全场第一);最佳开源 Qwen3.5-397B-A17B-Think 69.6 / 46.1 GPT-5.4 57.4 / 30.0;开源 Instruct 模型 TISR 多在 8.6–30.4 区间(如 Qwen2.5-Omni-3B 仅 8.6) Gemini-3-Pro 较 GPT-5.4 高 19.1 TCSR / 24.5 TISR;较最佳开源高 6.9 / 8.4
Nested 条件指令(最难结构) TCSR / TISR Gemini-3-Pro 53.7 / 46.0;最佳开源 Qwen3.5-397B-A17B-Think 33.0 / 28.2 GPT-5.4 仅 12.1 / 7.6;多数开源模型 Nested TISR 在 3.5–11.9 之间 Gemini-3-Pro 较 GPT-5.4 提升 41.6 TCSR / 38.4 TISR
约束数量扩展(Single 指令,9+ 约束) TISR Gemini-3-Pro 46.9%;Qwen3.5-397B-A17B-Think 42.5% 1–4 约束时 Gemini-3-Pro 62.7%、Qwen3-Omni-30B-A3B-Instruct 40.1%、Gemma-4-E4B-it 38.4% 弱开源模型大幅退步:Qwen3-Omni-30B 跌至 3.5%(-36.6 pp)、Gemma-4-E4B 跌至 7.1%(-31.3 pp)
Selection 正确分支位置敏感性 任务通过率 Qwen3.5-397B-Think 位置 1:76.5% → 位置 3:52.9% 同模型 Instruct 版 70.6% → 29.4%;Gemma-4-E4B-it 位置 3 仅 5.9% 位置偏置导致最多 41.2 个百分点差距(Qwen3.5-397B-Instruct),说明模型依赖顺序先验而非逐条件求值

局限与改进

作者承认的局限相对少,可推断的主要有:语义约束判定依赖 LLM-as-Judge(主判官 Qwen3.5-397B-A17B-Instruct),虽在附录用 35B 小判官验证趋势一致,但判官自身偏见难以完全排除;1.5K 样本相对 39 种约束、32 种任务和 4 种结构而言,部分细分类别的样本量有限,统计功效受限。我自己的观察还有五点:(1) 视频取自 WorldSense、Video-MME 等公开基准与平台检索,这些视频很可能已在各模型的训练数据中出现过,存在内容记忆导致的污染风险;(2) 事实列表与条件由 MLLM 抽取生成、仅经人工抽验式校验,残留的事实错误可能让"模型答对却被判错";(3) 评测是单轮指令,不测模型就模糊约束主动澄清的能力,而这恰是真实部署的重要行为;(4) TISR 把全部约束等权相乘,对高约束样本天然苛刻,跨结构(Single vs Multi)直接比较分数时需小心;(5) 论文是诊断性基准,未给出改进方法或训练数据,社区只能用来"体检"而非直接涨分。

独立分析的弱点

独立分析三点主要弱点。第一,条件推理的位置偏置:Qwen3.5-397B-Instruct 在正确分支位于位置 3 时通过率从 70.6% 跌到 29.4%,Gemma-4-E4B-it 在位置 3 仅 5.9%,说明模型并非真正逐一求值条件,而是利用了顺序与表面线索;改进方向是把条件求值显式化——让模型先输出各条件的真假判断再选路径,或在训练中对正确分支位置做均衡化数据增强。第二,约束数量的脆弱性:9+ 约束时弱模型 TISR 崩至个位数,本质是长指令下模型"丢约束";改进方向包括约束感知的自检解码(生成后逐条核对清单再输出)、按约束数量的课程学习训练、以及先规划后作答的结构化生成。第三,时间定位类约束全场低分(Temporal Anchor、Transition Boundary、Temporal Scope),根源是稀疏帧采样叠加弱时间戳感知;改进方向是引入显式时间戳 token、时间定位预训练任务或流式时序编码器。评测侧同样有弱点:语义项的 judge context 与数据出自同一条生成流水线,可能造成判官与数据同源偏置,可用独立模型交叉验证清单来缓解。

未来方向

作者展望是让"忠实执行复杂约束"成为视频 MLLM 的原生训练与评测目标。基于本文成果可延伸的方向包括:(1) 把 Video-IFBench 的 checklist 直接用作可验证奖励(RLVR),对逐条约束满足做强化学习,这是 TISR 天然适配的优化信号;(2) 扩展到小时级长视频与流式交互场景,考察约束在超长上下文中的保持与实时执行(结合 OVO-Bench、PhoStream 一类流式基准的设定);(3) 引入多轮对话式指令跟踪:允许模型就模糊约束反问、用户新增或修改约束,评测增量遵从能力;(4) 对条件指令的位置偏置与分支数脆弱性做机理研究(注意力分析、表示探针),并设计去偏训练策略;(5) 将 39 类约束分类法迁移到音频、图像、文档等模态,形成统一的多模态指令遵循评测族;(6) 进一步自动化数据流水线(更强抽取模型 + 更少人工),让社区可持续扩充样本、任务与约束类型。

复现评估

复现难度中等偏易。数据侧:700+ 视频全部来自公开数据源(WorldSense、Video-MME、MMBench-Video、FineVideo、LongVALE)加关键词检索,构造流水线只需一个较强 MLLM 做抽取与生成(论文未明说抽取用的是哪个模型,复现时需自行选定)、常规程序脚本和一轮人工校验人力,1.5K 样本规模可承受;项目主页 alexios-hub.github.io/Video-IFBench 提供入口,但正文未详述数据包与代码的开源完整性,动手前需先确认发布状态。评测侧:判官为 Qwen3.5-397B-A17B-Instruct(开源权重或 API 皆可,附录显示 35B 判官趋势一致,降低了判官依赖);格式项校验是确定性代码。算力上,闭源模型走 API(注意 Gemini/Doubao 1 FPS、GPT-5.4 上限 50 帧的差异会引入不公平因素),开源模型按各自推荐配置推理,小规模 GPU 集群即可完成主实验;主要成本在 checklist 判定的批量 LLM 调用与人工校验环节。总体属于"数据可再造、协议可照抄、算力门槛低"的基准工作。