← 返回 2026-09-11

TempCloze:检验视频大模型能否识别缺失中段的视频完形填空基准 TempCloze: Can Video-LLMs Identify the Missing Middle?

Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du 📅 2026-09-01 👍 18 2026-09-12 18:30
Video-LLM 基准评测 完形填空 时序推理 视频理解

首尾片段完形填空式评测揭示视频LLM的时序对齐瓶颈

前置知识

Video-LLM(视频大语言模型)

将 LLM 与视觉编码器结合、以帧序列形式处理视频的多模态模型。典型做法是把视频均匀采样为若干帧,逐帧编码成视觉 token 后拼进语言模型上下文,再输出文本答案。文中评测的 Qwen3-VL、InternVL3.5、Gemini、GPT 等都属于这一类,按是否启用思维链推理分为 thinking(T)与 instruct(I)两种模式。

本文的评测对象就是 31 个这样的模型,理解其帧采样与上下文拼接的工作方式,才能明白为什么模型会丢失时序边界、混淆事件方向。

完形填空(Cloze)范式

源自 Taylor (1953) 的心理测量方法:挖掉上下文中的一部分,让被测者根据剩余内容补全。NLP 中广泛用于预训练(如 BERT 的掩码语言建模),视频领域也曾被 VideoBERT、VCP 用作自监督训练目标。本文把它系统性地用作 Video-LLM 的评测协议:给定开头 $B=C_{0,s}$ 与结尾 $E=C_{e,T}$,从 4 个候选中选出真正的缺失中段 $M=C_{s,e}$。

整个基准的任务形式、记号体系 $V=[B|M|E]$ 和干扰项设计都建立在 cloze 概念上,不懂 cloze 就无法理解干扰项为何要这样构造。

语言捷径与选项偏差

指模型不真正理解视频,而是利用问题措辞、选项之间的相关性、答案分布等表面语言规律猜对答案的现象。此前研究发现,预训练语言模型在完全不看视频的情况下仍能在 VideoQA 基准上超出随机基线 25% 以上,说明许多时序理解高分实际来自语言先验。

这是本文构建纯视觉评测的根本动机——所有候选都来自同一视频且共享场景物体,就是为了封死这类捷径。

Farnebäck 光流

一种经典的两帧稠密光流算法,通过多项式展开估计图像中每个像素在相邻帧间的运动向量。光流幅度反映画面运动剧烈程度:静止镜头的幅度接近 0,持续运动的视频则有较大平均值。本文用它做无监督的静态视频过滤,要求候选缺口的平均光流幅度大于 1.0。

它保证每个缺失中段都包含真实运动事件,防止模型靠单帧外观匹配作弊,是数据管线中运动过滤的关键一环。

Pass@k 与测试时扩展

对同一道题在温度 $T=0.7$ 下独立采样 $k$ 次,只要有一次答对即算通过,即 $\text{Pass@k}=\Pr[\exists\, i\le k:\hat{y}_i=y]$。它刻画模型能力的概率上界:Pass@k 高而 Pass@1 低说明模型会做但不稳定。本文还考察了帧密度(每段 8→20 帧)与可见跨度(端点→全片)两类输入侧扩展。

第 4.4 节的行为敏感性分析全部围绕这些扩展展开,是理解模型成绩是否稳定、加算力是否有用等结论的前提。

研究动机

现有视频时序推理评测几乎都以语言为中介。早期 VideoQA 数据集如 TGIF-QA、NExT-QA、ActivityNet-QA 让模型回答文字问题;TempCompass、TVBench、TemporalBench 等时序基准也只是把任务换成事件排序、时刻定位等文字选项。这种形式留下了大量语言捷径:模型可以利用选项措辞、答案间相关性或语言先验得分——预训练语言模型在完全不看视频的情况下就能超出随机基线 25% 以上。近年来 LongVideoBench、MVBench、VideoMME 把上下文拉长、问题变细,但看文字答题的范式未变,高分究竟反映视频理解还是语言猜题,始终说不清。更关键的是,这些基准把语义、时间、运动混在自然语言问题里,无法区分模型到底弱在不知道发生了什么(语义),还是不知道发生在何时(时间对齐),抑或不知道如何展开(进程)。

本文的目标是本文目标是构建一个不经语言中介、直接考察视觉时序推理的基准 TempCloze。任务形式为视频完形填空:只给模型看视频的开头片段 $B$ 和结尾片段 $E$,要求从 4 个候选中选出真正的缺失中段 $M$。正确答案不仅要与视频视觉相关,还必须恰好占据两个可见片段之间的时间位置,从而同时考察什么事件该发生(Semantic)、应何时发生(Alignment)与该如何展开(Progression)。基准从 7 个公开来源筛选出 1,521 条 12–90 秒、平均 31.3 秒的视频,每条沿三个维度各实例化一道四选一题目,并对 10 个专有和 21 个开源 Video-LLM 做系统评测,定位当前模型的时序短板并给出错误模式与行为敏感性的细粒度分析。

与已有工作不同的是,独特切入是把 cloze 从文本填空改造成视频片段填空,并让干扰项全部来自同一源视频。此前 MovieFIB、FIBER 虽采用视频填空形式,但填的是文字描述;VideoBERT、VCP、VideoMAE 把掩码预测用作预训练目标而非评测协议。TempCloze 则用受控时间编辑构造干扰项:Semantic 干扰项取不重叠区间,Alignment 干扰项把正确区间平移(Advanced/Deferred)或扩宽(Expanded),Progression 干扰项倒放、乱序或重复该区间。这些干扰项在内容上依然合理、只错在时间结构上,迫使模型比较视觉时序证据而非做外观匹配;候选共享场景与物体进一步封死外观捷径,使每个错误都能直接归因到具体的时序能力缺陷上。

核心方法

直觉上,一个真正理解视频的模型应该能凭开头和结尾推断中间发生了什么、发生在何时。技术上,把视频定义为区间 $(0,T)$ 上的 $V=[C_{0,s}\,|\,C_{s,e}\,|\,C_{e,T}]=[B|M|E]$,对每个维度 $d\in\{S,A,P\}$ 构造候选集 $Y_d=\{M,D_1^d,D_2^d,D_3^d\}$,模型四选一。数据管线分两层:先过滤——保留 12–90 秒视频,用 GPT-o3 阅读密集字幕剔除事件不连贯、中段不受约束的样本,再按码率不低于 200 kbps、清晰度不低于 30 过滤低质量片段;再生成缺口——从视频中央 50% 时间线采样长度为全片 20%–40% 的缺失区间,用 Farnebäck 光流验证平均幅度大于 1.0(最多重采样 3 次)。最终从 LVD-2M、EgoLife、MiraData、FAVOR、CaReBench、Video-TT、Daily-Omni 七个来源保留 1,521 条视频。评测时每段 bin-centered 均匀采样 16 帧,6 个片段共 96 帧,开源模型用 vLLM 部署在 A6000 GPU 上。

核心创新是同源三维受控干扰项。与随机抽取负样本不同,所有候选都与正确中段共享场景和物体,外观上几乎无法区分,区别只在时间结构:Semantic 维度考察是什么,干扰项 $D^S=C_{u,u+\ell}$ 取与目标区间 $(s,e)$ 完全不重叠的等长片段,选对需要识别上下文暗示的事件内容;Alignment 维度考察何时,干扰项保持内容合理但扰动时间边界——Advanced $C_{s-\delta,e-\delta}$ 与 Deferred $C_{s+\delta,e+\delta}$ 分别把区间前移、后移 $\delta=\ell/2$,Expanded $C_{s-\delta_1,e+\delta_2}$ 向两侧各扩宽 $\ell/2$,选对需要精确感知时间边界;Progression 维度考察如何展开,Reversed 把正确段倒放、Reordered 按置换 $\pi$ 打乱子事件顺序、Repeated 重复短子段,选对需要感知事件方向、次序与动作连续性。与已有方法的本质区别在于:错误类型被参数化了,模型错选哪一类干扰项,就能直接诊断出是哪种时序能力缺失。

方法步骤详情

构建分六步。第一步时长与 LLM 过滤:按元数据保留 12–90 秒视频,利用 LVD-2M、MiraData 自带的时间密集字幕,先用 GPT-o3 判断事件是否时序连贯、上下文能否约束一个有意义的缺失中段(提示词见附录 G.1),无字幕来源先用 Gemini-2.5-Pro 补字幕;LVD-2M 的 82,196 条输入经时长、LLM、质量、光流四道过滤后仅剩 515 条(总过滤率 99.37%)。第二步质量过滤:剔除码率低于 200 kbps 或清晰度低于 30 的片段。第三步缺口采样:缺口从中央 50% 时间线抽取,长度占全片 20%–40%,保证两侧都有上下文并避免边界平凡情况。第四步运动验证:Farnebäck 光流平均幅度须大于 1.0,最多重采样 3 次,滤掉静态视频。第五步干扰项合成:按 S/A/P 三维各生成 3 个同源干扰项。第六步质量控制:边界帧零匹配检查(18,252 个候选片段首尾 1–3 帧与上下文零重合)、边缘基线仅 26.35%、5 名标注者对 300 条视频的适用性评分平均 4.13/5 且无不可用评分。评测阶段每片段 bin-centered 采 16 帧,避开端点防止边界帧泄漏。

技术新颖性

新颖性有三层。评测协议层:cloze 首次从视频表征学习的训练目标(VideoBERT、VCP、MaskFeat、VideoMAE)转为 Video-LLM 的纯视觉诊断任务,候选比较取代问答生成,绕开了语言中介。干扰项构造层:用精确的区间代数参数化错误——平移量 $\delta=\ell/2\in[0.1T,0.2T]$、扩宽、倒放、分区重排、子段重复,每种编辑对应一种可命名的时序缺陷,因此图 3 的错误热图能直接读出 Alignment 错误集中于 Expanded、Progression 错误集中于 Reversed 这样的归因结论。防作弊设计层:bin-centered 采样保证候选边界帧与上下文零重合(表 5),边缘基线 26.35% 仅略高于均匀分布 25%(表 7),单帧输入让 Seed1.8 从 83.43% 崩到 17.31%(表 8),三重检查证明任务必须依赖多帧时序证据而非任何捷径,这是与现有多数视频基准最大的差别。

Overview of TempCloze. Given the beginning and ending clips, models are asked to identify the true missing middle. Distractors are constructed along three dimensions: Semantic, Alignment and Progression.
Figure 1: Overview of TempCloze. Given the beginning and ending clips, models are asked to identify the true missing middle. Distractors are constructed along three dimensions: Semantic, Alignment and Progression.
Human annotation interface. Annotators viewed the same clips as the models.
Figure 11: Human annotation interface. Annotators viewed the same clips as the models.

实验结果

主实验(表 2,1,521 题 × 3 维度)分三层。绝对水平:人类均值 97.00%、全对 3/3 92.00%;最佳模型 Seed1.8(thinking)均值 88.58%、3/3 仅 70.81%;专有模型平均 62.19%,开源平均 32.51%,Grok4.1 的 24.11% 近乎随机。维度结构:Semantic 最易(专有平均 70.73%,Seed1.8 非思考 96.25% 已与人类持平),Progression 次之(67.72%),Alignment 是瓶颈(专有仅 48.13%,开源 26.54%,Seed1.6 低至 17.83%,人类达 98.00%)。视频级:专有 3/3 33.24% 对开源 7.15%,差距从维度级 1.9 倍放大到 4.6 倍。错误归因(图 3、表 3):Alignment 错误集中于 Expanded(Seed1.8-I 达 75%),Progression 错误集中于 Reversed(GPT-5.4 达 67%);混合维度时 Alignment 吸引最多错误(Gemini2.5-Pro 份额 19.7%)。行为敏感性(表 4、图 4–7):候选顺序打乱后均值稳定(方差<4 点)但选择翻换率达 32.4%–60.7%;ending-only 上下文最弱(Seed-1.6 在 Progression 上 46%,beginning-only 达 80%);可见跨度扩到全片时 Alignment 全面下滑;帧密度 8→20 无增益;Pass@5 使 Gemini2.5-Pro 提升约 30 点但不改维度排序。思维链两面性:Seed1.8 靠 Alignment +14.99 使均值 +5.15,Qwen3VL-32B 开思考后 Semantic −26.30、Progression −37.53。

Main results on TempCloze. Dimension Accuracy reports Semantic, Alignment, and Progression accuracy; Cumulative Accuracy reports the fraction of videos with at least one, at least two, or all three dimensions correct.
Table 2: Main results on TempCloze. Dimension Accuracy reports Semantic, Alignment, and Progression accuracy; Cumulative Accuracy reports the fraction of videos with at least one, at least two, or all three dimensions correct.
TempCloze-Mixed error attribution (%). The Alignment and Progression options are each randomly sampled from one of three designed variants.
Table 3: TempCloze-Mixed error attribution (%). The Alignment and Progression options are each randomly sampled from one of three designed variants.
Effect of candidate order permutation on TempCloze-Hard across representative models. Disp. denotes accuracy dispersion. FR denotes Flip Rate, and CFR denotes Clip Flip Rate.
Table 4: Effect of candidate order permutation on TempCloze-Hard across representative models. Disp. denotes accuracy dispersion. FR denotes Flip Rate, and CFR denotes Clip Flip Rate.
Exact boundary-frame matches in sampled candidates.
Table 5: Exact boundary-frame matches in sampled candidates.
Edge baseline, measured by the mean probability (%) assigned to the ground-truth candidate.
Table 7: Edge baseline, measured by the mean probability (%) assigned to the ground-truth candidate.
Original multi-frame evaluation versus the single-frame baseline. All values are percentages.
Table 8: Original multi-frame evaluation versus the single-frame baseline. All values are percentages.
Source-level filtering statistics.
Table 9: Source-level filtering statistics.
Gemini2.5-Pro statistics by source.
Table 10: Gemini2.5-Pro statistics by source.
Human validation of filtered video suitability.
Table 12: Human validation of filtered video suitability.
Effect of thinking variants.
Table 13: Effect of thinking variants.
Pairwise comparison of dimension-level accuracy on TempCloze across leading models.
Figure 2: Pairwise comparison of dimension-level accuracy on TempCloze across leading models.
Error proportions for alignment and progression distractors. Darker cells indicate higher error rates.
Figure 3: Error proportions for alignment and progression distractors. Darker cells indicate higher error rates.
Effect of context direction ablation on TempCloze-Hard across representative models.
Figure 4: Effect of context direction ablation on TempCloze-Hard across representative models.
Effect of visible span scaling on TempCloze-Hard across representative models.
Figure 5: Effect of visible span scaling on TempCloze-Hard across representative models.
Effect of sampling density scaling on TempCloze-Hard across representative models.
Figure 6: Effect of sampling density scaling on TempCloze-Hard across representative models.
Effect of test-time scaling on TempCloze-Hard across representative models.
Figure 7: Effect of test-time scaling on TempCloze-Hard across representative models.
Top metrics of proprietary and open-source models on TempCloze.
Figure 8: Top metrics of proprietary and open-source models on TempCloze.
Video-level breakdown across models.
Figure 9: Video-level breakdown across models.
查看结构化数据
任务指标本文基线提升
TempCloze 缺失中段四选一(三维度平均) 平均准确率 Mean (%) 88.58(Seed1.8-Thinking,最佳模型) 人类 97.00;随机 25.00 最佳模型仍落后人类 8.42 个百分点,约为随机基线的 3.5 倍
Alignment 时序对齐维度 维度准确率 (%) 76.92(Seed1.8-T);专有平均 48.13;开源平均 26.54 人类 98.00;随机 25.00 最佳模型落后人类 21.08 个百分点,是三个维度中人机差距最大的一项,被确认为主要瓶颈
Semantic 事件语义维度 维度准确率 (%) 96.25(Seed1.8 非思考) 人类 96.00 基本追平人类,说明强模型已能识别合理的事件内容
视频级全对(3/3 累计准确率) 3/3 准确率 (%) 70.81(Seed1.8-T);开源最佳 35.77(Qwen3.5-397B-T) 人类 92.00;随机 1.56 距人类差 21.19 点;专有平均 33.24 对开源 7.15,差距达 4.6 倍
单帧输入对照(诊断任务依赖性) 平均准确率 (%) 17.31(Seed1.8 单帧版) 多帧版 83.43 下降 66.12 个百分点,证明该任务无法靠单帧外观捷径完成

局限与改进

作者明确承认:TempCloze 是受控诊断基准而非视频理解的全景度量,不覆盖开放式生成、对话式叙事理解、音频推理与无约束未来预测;固定四选一格式意味着分数只能相对设计好的备选来解释;来源集中于长镜头、自我中心和精细运动视频,无法覆盖所有领域与机位风格;模型结果只是当前 API 的快照,解码行为与视频输入限制都会随时间变化。我补充几点观察:其一,Alignment 的 Expanded 干扰项包含正确内容加两侧额外上下文,选择它在某种程度上是求稳策略,把这类错误完全归为时序失败可能偏重;其二,候选翻换率高达 60.7% 说明单次评测方差可观,而置换实验只在 150 条的 Hard 子集、4 个代表模型上做;其三,人类基线仅基于 100 个视频且要求两名标注者一致才算对,协议严格但样本量小;其四,用 GPT-o3 做数据筛选,而被评模型中也包含 OpenAI 系模型,存在轻微的循环性风险。

独立分析的弱点

独立分析可见四个弱点。第一,缺口只占全片 20%–40%、视频不超过 90 秒,所谓缺失中段仍是短时程插值,与真正的长视频时序规划尚有距离——改进方向是引入多缺口与分钟级视频,检验模型能否在更长程依赖下定位中段。第二,三维独立评测把每条视频实例化三次,而更接近真实理解的 Mixed 混合维度集只有 300 条、Hard 集只有 150 条,统计功效有限——应扩大混合集规模并为各子集报告置信区间。第三,任务输出是单个选项字母,无法区分精确知道时间边界与排除法猜对,候选顺序翻换率(CFR 最高 60.7%)暗示部分正确答案并不稳定——可要求模型同时输出所选区间的时间戳,作为辅助监督信号验证其真实定位能力。第四,帧密度增加反而稀释证据(图 6),暴露模型缺乏关键帧选择机制,这更像模型缺陷而非基准缺陷——基准侧可增加帧预算自适应协议,度量每帧信息效率。此外 Thinking 模式在 Qwen3VL 系列上大幅伤害 Semantic 与 Progression(最多 −37.53 点)的现象值得单独解剖,论文目前只给出总分与分维度对比。

未来方向

作者在结论中提出四个方向:视频原生架构(不把视频当作图像序列处理)、能同时整合前后两个时间方向的机制、从长上下文中挑选关键证据的选择机制、以及显式表示时间结构;未来基准应面向更长视频并继续控制语言捷径。基于本文成果还可延伸:把三维干扰项搬进训练环节——用 cloze 选择任务做拒绝采样或强化学习的奖励信号,直接对齐边界与方向两类失败模式;将 TempCloze 与时刻定位(temporal grounding)联通,让模型直接预测缺口区间坐标而非仅做选择;把候选顺序置换、上下文方向消融固化为一套时序稳健性标准测试,纳入模型评测常规流程;扩展到音视频联合 cloze(论文已声明不覆盖音频推理);以及系统研究思维链为何会丢失视觉证据——例如 Qwen3VL-32B 开启思考后 Progression 暴跌 37.53 点,可能是冗长推理链挤占了视觉 token 的注意力资源,值得做注意力干预实验验证。

复现评估

复现条件较好。代码与基准已在 GitHub 开源(CedricPei/Temporal-Cloze);1,521 条视频全部来自 7 个公开数据集,过滤管线每一步的统计在表 9 完整给出,GPT-o3 适用性判断与评测使用的完整提示词在附录 G 全文公开;人类基线协议(5 名标注者、Streamlit 界面、双标一致规则)在附录 C 描述并配有界面截图。算力方面,21 个开源模型用 vLLM 部署在 A6000 GPU 上,单卡级算力即可复现;专有模型部分需要 10 个商业 API 的调用预算——每维度 1,521 题、每题 96 帧,行为敏感性分析还需多次候选置换与温度采样,费用可观但规模可控。主要工作量在于下载与筛选原始视频(仅 LVD-2M 输入就达 82,196 条)以及复现质量过滤阈值(码率、清晰度、光流)的实现细节。整体属于中等难度:协议透明、提示词齐全,但涉及多模型 API 编排与大规模视频预处理。