Video-IFBench:视频理解场景下多模态大模型指令遵循能力评测基准 Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分
前置知识
多模态大模型(MLLM)
以大语言模型为底座、接入视觉(有时还有音频)编码器的模型,可接收视频帧、图像与文本输入并生成回答。视频场景下通常按固定帧率抽帧或限制帧数送入视觉编码器;omni 全模态模型还能直接消费音频流。代表包括 Gemini、GPT 系列、Qwen-VL/Qwen-Omni、InternVL、Gemma 等。
本文的评测对象就是这些 MLLM,理解其抽帧与音频输入机制才能读懂实验设置,例如 Gemini/Doubao 以 1 FPS 供视频、GPT-5.4 因 API 限制只采样 50 帧、纯视觉模型额外配 Gemini-3-Pro 转写的带时间戳字幕。
指令遵循与约束(语义约束 vs 格式约束)
指令遵循指模型在完成任务之外还须满足用户附加的显式要求。约束分两类:语义约束要求回答内容与输入内容精确对齐(如"只描述 00:20–00:55 之间的事件""按时间顺序排列"),格式约束只管输出形式(如字数范围、JSON 结构、编号列表、必须/禁用关键词)。文本侧经典基准 IFEval 即以可程序验证的格式规则起步。
Video-IFBench 的 39 类约束(22 语义 + 17 格式)与全部指标都建立在"约束可判定"这一框架上;论文的核心结论之一正是语义约束远难于格式约束。
LLM-as-Judge 与 checklist 评测
用一个强 LLM 按评分细则给被评模型的回答打分。Checklist 化是把要求拆成若干二元判定项(每项回答"是/否"),相比整段模糊打分更细粒度、更可复现;能程序化验证的项(长度、正则、JSON 结构)则直接交确定性代码判定,以减少判官偏见。语义项通常还需提供视频证据(judge context)辅助判官。
本文评测协议正是"LLM-as-Judge(语义项)+ 程序化校验(格式项)"的混合方案,判官为 Qwen3.5-397B-A17B-Instruct,并用 35B 小判官做了敏感性消融。
TCSR 与 TISR 任务门控指标
两者都先做任务门控:$t_i \in \{0,1\}$ 表示回答是否覆盖激活指令的全部任务,未过门控记 0 分。$n_i$ 为清单项数、$c_{ij}$ 为第 $j$ 项是否满足。$\mathrm{TCSR}=\frac{1}{N}\sum_{i=1}^{N} t_i \cdot \frac{1}{n_i}\sum_{j=1}^{n_i} c_{ij}$ 度量部分满足程度;$\mathrm{TISR}=\frac{1}{N}\sum_{i=1}^{N} t_i \cdot \prod_{j=1}^{n_i} c_{ij}$ 要求所有清单项同时满足才算对。
论文所有结果表格的数字都是"TCSR / TISR"成对出现,不理解门控逻辑就无法解读为什么 TISR 总是显著低于 TCSR(普遍"满足部分约束但难全对")。
条件指令(Selection / Nested 结构)
Selection 指令给出多个候选条件分支,模型须依据视频实际内容判断哪个条件为真、只执行对应分支上的指令;Nested 进一步把条件组织成树,模型要沿唯一正确的根到叶路径走到底再作答。数据构造时通过事实变换(编辑/否定/组合)保证每道题恰有一条真路径,使答案可精确判定。
条件结构是本文发现的 最大失分区:Nested 上 GPT-5.4 仅 7.6 TISR,最佳开源也只有 28.2。理解这种"先选路、后答题"结构才能明白模型究竟输在视频条件判断还是指令执行。
研究动机
现实用户对视频模型的请求几乎从不只是"描述这段视频",而是附带明确的语义与格式要求:例如分析烹饪教程时,用户可能要求"只描述食材混合之后的步骤,按时间顺序列出并附时间戳"。然而现有视频理解评测——MVBench、Video-MME、TempCompass、MLVU、LongVideoBench、Video-MMMU 等——都以"回答是否正确"为核心,几乎不检验模型是否忠实执行了复杂指令。另一方面,指令遵循评测长期停留在纯文本场景(FollowEval、FollowBench、IFEval、InFoBench),多模态扩展集中在图像侧(MIA-Bench、MM-IFEngine、VC-IFEval)或受限的视频字幕生成(IF-VidCap),没有覆盖带视觉/音频依据的语义约束,更没有多分支条件指令。于是"视频理解准确率高"与"能可靠遵循用户意图"之间存在明显评测空白,模型部署到真实场景时的失败模式无法被现有榜单预测。
本文的目标是本文要建立系统评测视频场景指令遵循能力的基准 Video-IFBench,目标有三。其一,设计覆盖指令复杂度两个维度的指令分类法——任务组合(Single 单任务 / Multi 多任务)与条件结构(Selection 分支选择 / Nested 树形嵌套),覆盖 32 种人工整理的视频任务类型和 39 类响应约束(22 类语义、17 类格式)。其二,用半自动流水线(MLLM 抽取 + 程序化规则 + 人工校验)压低标注成本,构建 1.5K 高质量样本:视频 700 余段、总时长约 49 小时、单段 10 秒到 10 分钟、横跨 10 个领域。其三,设计 LLM-as-Judge 与程序化校验结合的混合评测协议,输出任务门控的 TCSR/TISR 指标,并对 20 余个主流 MLLM(Gemini-3、GPT-5.4、Doubao、Qwen、InternVL、Gemma 系列)做大规模实证,定位当前模型的真实短板。
与已有工作不同的是,本文的独特切入是把"指令遵循"从文本侧的正确性评测问题,改造成"视频内容依据 × 条件结构"的双重考题。与 IF-VidCap 只考受约束字幕不同,这里的约束大量锚定视频细粒度事实(如"只描述 00:20–00:55 的事件""若视频开头出现某标题则执行 A 否则执行 B");与图像侧 IF 基准不同,视频引入了时间定位、时序范围、转场边界、动作相对位置等独有约束类型。最关键的差异在 Selection/Nested 的构造方式:作者先把抽取出的原子事实经编辑(keyboard→screen)、否定(pour water→does not pour water)、编辑加否定组合三种变换制成真假条件池,再生成树形指令并保证恰有一条正确路径,从而能精确测量"按视频内容选对分支再执行"的能力——这是现有视频与多模态基准都没有的评测维度,也让分支数、树深、约束数可以受控变化以做消融。
核心方法
直觉上,评测指令遵循需要一个"可判分的清单":把每条指令拆成若干可独立判定真假的约束项,再看回答满足了多少。Video-IFBench 的技术路线分四块:(1) 视频策展——从 WorldSense、Video-MME、MMBench-Video、FineVideo、LongVALE 等公开来源收集视频并用 MUSIQ 过滤模糊样本,覆盖 10 个领域、时长 10 秒至 10 分钟、总计约 49 小时;(2) 知识池构建——人工整理 6 大类 32 种任务类型(感知识别、时序理解、空间理解、关系交互、逻辑推理、字幕生成)与 39 种约束(22 语义 + 17 格式);(3) 信息抽取与指令生成——用 MLLM 为每个视频抽取全局描述和带时间戳的原子事实列表,据此生成四类指令并为每条指令配检查清单;(4) 全量人工校验。评测端由 LLM-as-Judge 判语义项、确定性程序校验格式项,计算任务门控的 TCSR/TISR 两个指标。
核心创新有二。第一是四模板指令分类法:Single/Multi 只变任务数量(Single 约束数 1–15 可调;Multi 的全局与任务级约束刻意控制在约 3 个以内),从而把"任务数"与"约束数"两个混淆变量解耦,分别做扩展实验;Selection/Nested 则考"视频条件分支",模型必须先依据视频内容判断哪个条件为真、沿树走到正确叶子、再执行叶子上挂的指令。第二是"事实变换造条件"的构造技巧:直接让 MLLM 自由写复杂条件往往得不到足够深的分支,作者改为先把原子事实做三种确定性变换——编辑(最小改动使事实为假,如 keyboard→screen)、否定(pour water→does not pour water)、编辑加否定组合(产生另一真变体)——得到真假条件池,然后生成树结构、采样一个叶子作为唯一真目标,并在每条非目标路径上随机标记一个假节点,保证每题恰有一条有效路径。这使条件复杂度可控、答案可判定,并天然配套好判分清单。
方法步骤详情
流水线共六步。(1) 视频策展:多来源收集 → MUSIQ 质量过滤 → 覆盖 10 领域、700+ 段、约 49 小时。(2) 任务与约束池:分析现有基准样例,人工定义 6 大类 32 种任务与 39 种约束,经多轮清理去除模糊、冗余、难验证项。(3) 信息抽取:MLLM 为每个视频生成全局描述与原子级带时间戳事实列表;长视频按 1 分钟分段顺序处理并维护共享实体记忆,保持人物/物体指代跨段一致。(4) 指令生成:Single/Multi 按目标类型采样任务并限制每类约束出现频率以平衡分布;Selection/Nested 走"事实变换 → 树结构生成 → 采样唯一真叶子 → 非目标路径标记假节点 → 逐节点写条件文本与叶子指令"的多阶段流程。(5) 清单生成:记录每条被采样的约束并配一个二元判定项("是"即满足),语义项附视频依据的 judge context,格式项(长度、JSON、关键词等)走确定性函数校验。(6) 人工校验:核对视频描述、事实、条件分支/路径、清单查询与判官上下文,问题样本修正或丢弃。
技术新颖性
技术新颖性体现在三点。其一,评测维度上首次把"多约束 + 条件分支"作为视频 MLLM 的一等公民:现有视频基准量的是答案对错,文本侧 IFEval 系列没有视频依据,本文把语义约束 × 格式约束 × Single/Multi/Selection/Nested × 32 种任务正交组合成系统能力矩阵。其二,构造方法上用"程序规则 + MLLM"的半自动混合替代纯模型生成:约束采样带频次上限、条件由事实确定性变换而来、唯一真路径由算法保证,使数据复杂度可精确控制(约束数 1–15、分支数 2–4、树深 2–14 均能构造受控子集),直接支撑了约束扩展、深度敏感、分支位置等消融分析。其三,评测协议上 checklist 化加混合判分:LLM-as-Judge 只处理需要视频证据的语义项,可编程验证的格式项交给确定性函数,并设计 TCSR/TISR 两个任务门控指标,把"做没做对题"与"守没守规矩"分开计分,使失败模式可归因。
实验结果
在 20 余个模型上的核心发现有五。(1) 整体很难:最强 Gemini-3-Pro 也只有 76.5 TCSR / 54.5 TISR,最佳开源 Qwen3.5-397B-A17B-Think 为 69.6/46.1,GPT-5.4 仅 57.4/30.0;所有模型 TISR 均显著低于 TCSR,说明普遍"满足部分约束但难全对"。(2) 结构差异明显:多数模型 Multi 得分反高于 Single(Gemini-3-Pro Multi 88.6/58.8 对 Single 79.6/52.3),瓶颈不在多任务而在多约束;Selection/Nested 骤降,Nested 最难——Gemini-3-Pro 仅 53.7/46.0,最佳开源 33.0/28.2,GPT-5.4 仅 12.1/7.6。(3) 约束数是主要瓶颈:Single 指令 TISR 随约束数从 1–4 到 9+ 大幅下滑,Gemini-3-Pro 62.7%→46.9%,弱开源模型崩溃(Qwen3-Omni-30B-A3B-Instruct 40.1%→3.5%,Gemma-4-E4B-it 38.4%→7.1%);而任务数从 1–4 增到 9+ 时强模型几乎不变(Gemini-3-Pro 95.6/94.9/96.3)。(4) 语义约束远难于格式约束,Temporal Anchor、Transition Boundary、Temporal Scope、Action-Relative Selection 等时间定位类约束全场低分,说明模型难以对齐细粒度视频证据。(5) 深度与位置敏感:Nested 树深从 2–4 到 8–14,Gemini-3-Pro 任务通过率 64.6%→55.6%、Qwen3.5-397B-Think 40.5%→22.2%;Selection 分支数 2→4 时 Gemini-3-Flash 66.7%→56.5%、Qwen3.5-397B-Instruct 58.0%→39.1%;正确分支越靠后表现越差,暴露位置偏置(Qwen3.5-397B-Think 76.5%→52.9%,Instruct 版 70.6%→29.4%)。此外 Thinking 变体普遍抬升上限但提升不稳定,同族内规模越大性能越好。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频指令遵循(全基准 Overall) | TCSR / TISR | Gemini-3-Pro 76.5 / 54.5(全场第一);最佳开源 Qwen3.5-397B-A17B-Think 69.6 / 46.1 | GPT-5.4 57.4 / 30.0;开源 Instruct 模型 TISR 多在 8.6–30.4 区间(如 Qwen2.5-Omni-3B 仅 8.6) | Gemini-3-Pro 较 GPT-5.4 高 19.1 TCSR / 24.5 TISR;较最佳开源高 6.9 / 8.4 |
| Nested 条件指令(最难结构) | TCSR / TISR | Gemini-3-Pro 53.7 / 46.0;最佳开源 Qwen3.5-397B-A17B-Think 33.0 / 28.2 | GPT-5.4 仅 12.1 / 7.6;多数开源模型 Nested TISR 在 3.5–11.9 之间 | Gemini-3-Pro 较 GPT-5.4 提升 41.6 TCSR / 38.4 TISR |
| 约束数量扩展(Single 指令,9+ 约束) | TISR | Gemini-3-Pro 46.9%;Qwen3.5-397B-A17B-Think 42.5% | 1–4 约束时 Gemini-3-Pro 62.7%、Qwen3-Omni-30B-A3B-Instruct 40.1%、Gemma-4-E4B-it 38.4% | 弱开源模型大幅退步:Qwen3-Omni-30B 跌至 3.5%(-36.6 pp)、Gemma-4-E4B 跌至 7.1%(-31.3 pp) |
| Selection 正确分支位置敏感性 | 任务通过率 | Qwen3.5-397B-Think 位置 1:76.5% → 位置 3:52.9% | 同模型 Instruct 版 70.6% → 29.4%;Gemma-4-E4B-it 位置 3 仅 5.9% | 位置偏置导致最多 41.2 个百分点差距(Qwen3.5-397B-Instruct),说明模型依赖顺序先验而非逐条件求值 |
局限与改进
作者承认的局限相对少,可推断的主要有:语义约束判定依赖 LLM-as-Judge(主判官 Qwen3.5-397B-A17B-Instruct),虽在附录用 35B 小判官验证趋势一致,但判官自身偏见难以完全排除;1.5K 样本相对 39 种约束、32 种任务和 4 种结构而言,部分细分类别的样本量有限,统计功效受限。我自己的观察还有五点:(1) 视频取自 WorldSense、Video-MME 等公开基准与平台检索,这些视频很可能已在各模型的训练数据中出现过,存在内容记忆导致的污染风险;(2) 事实列表与条件由 MLLM 抽取生成、仅经人工抽验式校验,残留的事实错误可能让"模型答对却被判错";(3) 评测是单轮指令,不测模型就模糊约束主动澄清的能力,而这恰是真实部署的重要行为;(4) TISR 把全部约束等权相乘,对高约束样本天然苛刻,跨结构(Single vs Multi)直接比较分数时需小心;(5) 论文是诊断性基准,未给出改进方法或训练数据,社区只能用来"体检"而非直接涨分。
独立分析的弱点
独立分析三点主要弱点。第一,条件推理的位置偏置:Qwen3.5-397B-Instruct 在正确分支位于位置 3 时通过率从 70.6% 跌到 29.4%,Gemma-4-E4B-it 在位置 3 仅 5.9%,说明模型并非真正逐一求值条件,而是利用了顺序与表面线索;改进方向是把条件求值显式化——让模型先输出各条件的真假判断再选路径,或在训练中对正确分支位置做均衡化数据增强。第二,约束数量的脆弱性:9+ 约束时弱模型 TISR 崩至个位数,本质是长指令下模型"丢约束";改进方向包括约束感知的自检解码(生成后逐条核对清单再输出)、按约束数量的课程学习训练、以及先规划后作答的结构化生成。第三,时间定位类约束全场低分(Temporal Anchor、Transition Boundary、Temporal Scope),根源是稀疏帧采样叠加弱时间戳感知;改进方向是引入显式时间戳 token、时间定位预训练任务或流式时序编码器。评测侧同样有弱点:语义项的 judge context 与数据出自同一条生成流水线,可能造成判官与数据同源偏置,可用独立模型交叉验证清单来缓解。
未来方向
作者展望是让"忠实执行复杂约束"成为视频 MLLM 的原生训练与评测目标。基于本文成果可延伸的方向包括:(1) 把 Video-IFBench 的 checklist 直接用作可验证奖励(RLVR),对逐条约束满足做强化学习,这是 TISR 天然适配的优化信号;(2) 扩展到小时级长视频与流式交互场景,考察约束在超长上下文中的保持与实时执行(结合 OVO-Bench、PhoStream 一类流式基准的设定);(3) 引入多轮对话式指令跟踪:允许模型就模糊约束反问、用户新增或修改约束,评测增量遵从能力;(4) 对条件指令的位置偏置与分支数脆弱性做机理研究(注意力分析、表示探针),并设计去偏训练策略;(5) 将 39 类约束分类法迁移到音频、图像、文档等模态,形成统一的多模态指令遵循评测族;(6) 进一步自动化数据流水线(更强抽取模型 + 更少人工),让社区可持续扩充样本、任务与约束类型。
复现评估
复现难度中等偏易。数据侧:700+ 视频全部来自公开数据源(WorldSense、Video-MME、MMBench-Video、FineVideo、LongVALE)加关键词检索,构造流水线只需一个较强 MLLM 做抽取与生成(论文未明说抽取用的是哪个模型,复现时需自行选定)、常规程序脚本和一轮人工校验人力,1.5K 样本规模可承受;项目主页 alexios-hub.github.io/Video-IFBench 提供入口,但正文未详述数据包与代码的开源完整性,动手前需先确认发布状态。评测侧:判官为 Qwen3.5-397B-A17B-Instruct(开源权重或 API 皆可,附录显示 35B 判官趋势一致,降低了判官依赖);格式项校验是确定性代码。算力上,闭源模型走 API(注意 Gemini/Doubao 1 FPS、GPT-5.4 上限 50 帧的差异会引入不公平因素),开源模型按各自推荐配置推理,小规模 GPU 集群即可完成主实验;主要成本在 checklist 判定的批量 LLM 调用与人工校验环节。总体属于"数据可再造、协议可照抄、算力门槛低"的基准工作。
论文图表
数据集级统计:(a) 四类指令类型分布——Single 约 34.0%、Multi 约 27.3%、Selection 与 Nested 各约 19.4%;(b) 视频领域分布(General、Arts&Entertainment、Science&Technology、Lifestyle、Education、Sports&Fitness、News、Travel、Finance、Games 等 10 域)与时长分布(10 秒到 10 分钟)。
展示基准的覆盖广度与分布均衡性,说明结论不是在窄分布上得出的;也为复现者提供目标数据画像。