VideoGAIA:面向通用AI助手的智能体视频理解基准 VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
前置知识
多模态大语言模型 (MLLM)
多模态大语言模型是同时处理文本、图像(及视频)等多种模态的通用模型。它通常以一个大语言模型为骨干,通过视觉编码器把图像帧映射到语言嵌入空间,从而能对视频抽帧序列进行描述、问答与推理。其能力覆盖视觉识别、时序理解和知识调用,是本文被评测的对象。
本文的全部结论都建立在'前沿 MLLM 在新基准上表现如何'之上,理解 MLLM 的输入表示(抽帧、OCR)和能力边界(感知强、工具弱)是读懂实验结果的前提。
ReAct 智能体循环
ReAct 是一种让模型交替进行'推理'与'行动'的智能体框架:模型每轮先输出思考,再发起一次工具调用(如搜索网页、查看页面),工具结果返回后进入下一轮,直到模型给出最终答案或达到步数上限。本文用统一 ReAct 循环、最多 40 步预算来评测所有模型。
VideoGAIA 的核心就是把视频理解放进这种多轮循环里评测,三个工具(web search、page visit、thinking with videos)如何被调用直接决定了论文的工具分析与错误分析结论。
视频锚点与证据接地
视频锚点是从画面中抽取的可复用视觉证据单元,可以是物体、画面文字、Logo、地点、人物、动作或空间关系。'证据接地'指任务生成时先显式列出这些锚点,再把目标属性与之绑定,使问题必须依赖多个画面线索加外部检索才能作答,而不是单帧或常识即可解决。
锚点机制是 VideoGAIA 数据流水线和质量控制的核心:每个任务至少依赖两个锚点、锚点消融不可删,这保证了基准测的是跨模态证据整合而非单帧识别。
pass@1 准确率
pass@1 表示模型在单次尝试中答对的比例。对于开放式答案,本文用 GPT-5.5 作为裁判,将模型预测与人工核验的参考答案比对判定对错;同一设置独立运行三次取平均,以降低智能体轨迹的随机方差。DeepSeek-V4-Pro 仅在主裁判多次重试仍无输出时兜底。
论文所有表格和排行榜的数字都是 pass@1(三次运行平均),理解其裁判协议和方差控制方式,才能正确解读'所有模型低于 60%'这一核心结论。
研究动机
现有视频理解评测已经接近饱和。在 Video-MME、VideoMMMU、MLVU 等广泛采用的基准上,最强的多模态大模型(如 Qwen3.7-Plus、GPT-5.5、Gemini 3.1 一代)准确率已逼近 90%,说明'看一段视频、答一道封闭式问题'的单轮范式基本被解决了。这类基准是封闭世界的:视频固定、问题预定义、答案多为选择题,模型既不需要判断应该检查哪些画面证据,也不需要访问任何外部信息。与此同时,AI 正从对话机器人转向通用生产力工具,工具使用、长程推理、信息聚合和上下文管理等关键能力仍在发展中、远未成熟,而视频智能体的发展与评估恰恰严重缺位——社区缺少一个能区分'感知能力强'与'会把视频当作证据去解决现实任务'的公开基准,导致视频方向的评测与智能体时代的实际需求脱节。
本文的目标是本文的目标是构建 VideoGAIA,一个面向通用 AI 助手的智能体视频理解基准:把视频理解从单轮问答重构为多轮、工具增强的交互过程,要求模型迭代地感知视频、调用外部工具(网页搜索、网页阅读、视频回看)、跨轮整合多模态证据并给出开放式答案。具体交付物包括:271 个经三人专家独立核验、人机协同设计的任务,覆盖文化、地理、日常生活、历史、科技、经济六大门类和 L1/L2 两档难度;以及在完全相同的智能体框架下对 20 个前沿 MLLM 的统一评测与深入的错误诊断。作者希望以此推动领域从传统视频理解向智能体视频理解过渡,为下一代模型提供高质量、有时效性的评测台。
与已有工作不同的是,已有视频智能体工作的切入点各有局限:VideoAgent 系列聚焦视频内部的迭代证据选择与检索管线,Deep Video Discovery、VideoChat-A1、VideoThinker 关注视频内的多粒度检索与粗到细检查,VideoWebArena 评估执行视频教程技能的智能体,Video-BrowseComp、VideoDR、LongVidSearch 虽结合搜索或多跳推理但多为受控环境或特定流程。VideoGAIA 的独特之处有三:一是任务在开放网络上完成,答案实体通过视觉指代表达隐藏、必须从视频提取线索后再检索真实网页;二是把'工具必要性'作为硬筛选条件,无工具能答对的题一律剔除;三是首次在统一 harness(相同提示词、工具、帧分辨率、40 步预算)下对 20 个前沿 MLLM 做同台对比,使排行榜具有公平的横向可比性。
核心方法
直觉上,现实任务中视频往往只是证据源之一:比如问'视频中那台透明后盖手机用的是哪款芯片',画面只能给出品牌和外观线索,芯片的正式营销名必须上网查证。因此评测应考察模型能否从画面提取线索、主动决定还缺什么信息、检索外部来源并综合验证。技术路线分两半:数据侧是一条从 10 万公开视频出发的人机协同流水线——逐帧字幕与 OCR、锚点抽取、证据接地任务生成、六阶段质量控制(评分规则质检、跨模态过滤、工具必要性评估、安全筛查、人工众包标注),最终收敛为 271 道任务;评测侧是统一的 ReAct 风格智能体循环:模型收到问题与均匀抽取的 20 个粗帧,可在最多 40 步内交替推理并调用网页搜索、页面访问、带视频思考(从自选时间段再抽最多 20 帧)三个工具,pass@1 取三次独立运行的平均,由 GPT-5.5 裁判判定开放式答案。
核心创新是把'视频理解'重新定义为'以视频为证据源完成具体现实任务'的多轮智能体过程,并用数据构造手段保证这一点不可退化。与传统单轮视频 QA 的本质区别在于三个硬约束:每题必须依赖至少两个视频锚点、不能从单帧或题面推出答案;答案实体必须用视觉指代表达隐藏(如'透明后盖的银色手机'而非直接给型号),且参考答案是唯一的规范性事实;解题链必须包含从视频证据到外部网页的至少两跳网络推理。最关键的是'工具必要性'筛选——禁用所有工具后让 Gemini-3.1-Pro、GPT-5.5、Claude-Opus-4.7 直答,任何一者答对即删除该题。这些设计保证基准真正测量适应性证据获取与跨源验证,而非世界知识记忆或单帧感知,这正是它区别于 Video-MME 等饱和基准的根本所在。
方法步骤详情
数据构造分六步。第一步逐帧字幕:视频按 1 FPS 采样、每段最多 24 帧,超过 180 秒的最多处理 4 段(上限约 96 帧),Gemini-3.1-Pro 生成详细视觉描述并用 OCR 提取画面文字。第二步任务生成:Claude-Opus-4.7 从描述与 OCR 抽取 2-5 个可复用锚点(物体、文字、Logo、地点、人物、动作、空间关系);GPT-5.5 据此提出目标属性与候选答案,锚点加属性拼成搜索查询,经 Serper API 检索、Jina API 把网页转为文本,每个种子视频最多产出 3 个候选。第三步评分规则质检:硬约束(至少两跳网络推理、答案被网页原文支持、至少两个锚点等)通过后,由 Claude-Opus-4.8 按六项标准打分,每项 1-2 分满分 12,≥8 分保留。第四步跨模态过滤:Gemini 只看视频、GPT-5.5 只看网页分别解题,并做锚点消融,任一单模态可解或锚点皆可删则剔除。第五步工具必要性:三模型禁用工具直答,任一答对即删。第六步安全筛查与人工标注:剩 847 个候选由 15 名标注员超 100 小时独立解题,三人全票直接保留、两票进入仲裁,最终得 271 题($L_1$ 62 题、$L_2$ 209 题)。
技术新颖性
技术新颖性体现在三个层面。数据工程上,10 万视频经层层负向验证压缩到 271 题(通过率约 0.27%),每题都被证明'单模态不可解、无工具不可解、锚点不可删',这种以排除法保证任务性质的流水线在视频基准中少见;开放式答案配规范参考值避免了选择题带来的线索泄露。评测协议上,所有模型共享相同提示词、工具集、帧分辨率与 40 步预算,且工具输出不原文进入上下文而由被测模型自行总结后再传给下一轮,既公平又考验上下文管理;GPT-5.5 裁判加三次运行平均控制了开放式判分与智能体随机性带来的方差。分析范式上,论文对 615 条错误轨迹做互斥主因归类(视频感知、网络检索、证据推理、答案表述、智能体执行五类),并统计每个模型的工具调用构成,使基准不仅能排名,还能诊断失败模式——这是从'分数基准'走向'诊断基准'的设计。
实验结果
统一 agent loop 下评测 20 个前沿 MLLM,271 题 pass@1 全部落在 30%-60%:最高 Seed2.0-Pro 58.30%,其次 Qwen3.7-Plus 56.09%、Kimi-K3 54.61%,而同批模型在 Video-MME 已近 90%。家族代际总体为正(Kimi 系 49.82%→52.77%→54.61%,GLM 46.86%→50.18%,Gemini 43.91%→50.92%),但 Claude 是反例:Opus-4.7(34.69%)与 Opus-4.8(36.90%)低于 Opus-4.6 的 47.97%,说明通用能力提升不自动转化为可靠的多模态工具使用。难度上 $L_1$→$L_2$ 全线下滑 22.70-29.75 个百分点,如 Qwen3.7-Plus 从 79.03% 跌至 49.28%。工具分析:网页搜索占调用的 60.5%-90.6%,页面访问≤14%,Kimi-K3 把 25.5% 调用用于视频回看;Gemini-3.1-Pro 调用 2557 次反而不如只调 262 次的 GPT-5.5 准确,证明多调用≠高分。对 615 条错误轨迹的审计显示:视频感知是所有模型最大错误源(36.8%-48.0%),网页检索 20.3%-31.0%,证据推理 14.2%-28.6%,答案表述仅 2.4%-3.3%;GPT-5.5 有 13.4% 执行错误(动作格式解析失败),其余模型<5%。案例中 Seed2.0-Pro 以排气管几何形状区分 CR125/CR250 答对 249cc,Claude-Opus-4.8 把模糊画面误读为 'MAX 125cc' 且不验证竞争假设即提交而失败。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 智能体视频理解(VideoGAIA 总体,agent loop) | pass@1 (%) | Seed2.0-Pro 58.30(全场最高) | 最弱模型 Claude-Opus-4.7 34.69 | 最强与最弱相差 23.61 个百分点,但所有 20 个模型均低于 60% |
| 同一批前沿模型在传统基准(Video-MME) | 准确率 (%) | VideoGAIA 上最高 58.30 | Video-MME 上最强模型接近 90(已饱和) | 约 -31.7 个百分点,凸显基准难度代差 |
| 难度分层(Qwen3.7-Plus,L1 对 L2) | pass@1 (%) | L1 79.03 | L2 49.28 | -29.75 个百分点(三大强模型的 L1→L2 落差为 22.70-29.75) |
| 分类别最佳(Daily Life 日常生活) | pass@1 (%) | Kimi-K3 65.57 | Claude-Opus-4.7 31.15(同类最弱) | +34.42 个百分点;Seed2.0-Pro 另在 Geography 60.32 与 Technology 66.67 领先 |
局限与改进
作者承认的局限包括:经济类只有 6 道题,其分项百分比必须谨慎解读;整体 271 题的规模偏小,类别级结论的统计功效有限。我自己的观察还有几点:其一,视频工具纯视觉、不提供音频,语音承载的信息(口播、采访)被系统性排除;其二,视频平均仅 34.90 秒(范围 2.74-566.68 秒),长视频的时序导航能力覆盖不足;其三,评测给每个模型固定的 20 个粗帧加最多 20 个细帧,错误分析中占比最高的'视频感知错误'(36.8%-48.0%)部分可能源自输入表示的先天限制而非模型能力缺陷;其四,判分依赖 GPT-5.5 单一裁判,而 GPT-5.5 本身也是被测模型之一,存在潜在偏置;其五,流水线从 10 万视频到 271 题的通过率仅约 0.27%,标注成本高(15 人超 100 小时),难以频繁迭代扩容。
独立分析的弱点
第一,规模与类别失衡:271 题、经济类仅 6 题,使分类别对比(如 Seed2.0-Pro 在 Economics 50.00%)几乎无置信度可言,改进方向是扩大种子视频池并按类别分层配额,或对每题报告置信区间。第二,裁判结构性偏置:GPT-5.5 既参赛又当唯一裁判,其自身错误判分可能系统性偏向相似风格的输出,改进方向是多裁判集成加人工抽检校准,并公开判分一致性数据。第三,帧表示上限:错误分析中视频感知占 36.8%-48.0%,但均匀抽 20 帧可能根本没拍到瞬态线索(如一闪而过的铭牌),部分失败应归咎于 harness 而非模型,改进方向是自适应关键帧选择或流式视频接口,并报告不同帧预算下的性能曲线。第四,无音频通道且视频偏短,改进方向是加入 ASR 字幕工具并纳入 10 分钟以上的长视频任务。第五,开放式答案的规范化判分虽使答案表述类错误仅 2.4%-3.3%,但 '249 cc' 与 '249cc' 这类表面差异仍可能被误判,可引入答案别名表。第六,数据通过率仅约 0.27%,建议开源中间产物与过滤脚本以便社区低成本续造。
未来方向
作者提出的方向是把 VideoGAIA 用作严格试验台,推动模型架构、训练策略与智能体框架的研究,使视频智能体真正能以视频为证据完成现实任务并带来生产力增益。基于本文成果可自然延伸的工作包括:以 VideoGAIA 式任务为奖励信号的强化学习,专门训练'何时调用哪个工具、何时停止'的自适应证据获取策略(论文已证明调用次数与准确率无关,GPT-5.5 用 262 次调用胜过 Gemini 的 2557 次);针对最大错误源的视频感知,研究细粒度时序定位与关键帧选择;同一模型在不同 harness 下的方差研究,把智能体框架工程正式化为研究对象;加入音频与跨语言(如中文)版本以拓宽任务面;把论文的五类错误主因分类发展为基准自带的自动诊断指标,实现持续的错误画像;以及探索 L2 难度之上的 L3 任务,因为最强模型 L2 已跌至 33.01%-53.11%,尚有充足的下探空间。
复现评估
开源情况良好:代码在 GitHub(zfkarl/VideoGAIA),数据集在 HuggingFace(Karl28/VideoGAIA),基准协议在论文中描述得足够详细(ReAct 循环、三工具、40 步上限、20 粗帧加最多 20 细帧、三次运行平均、GPT-5.5 裁判加 DeepSeek-V4-Pro 兜底)。复现评测的主要门槛是 API 成本而非算力:需要调用 GPT-5.5、Claude、Gemini、Qwen、Kimi、Seed 等 20 个商业模型,且智能体循环每题最多 40 步、每结果跑三遍,Gemini-3.1-Pro 单模型就产生了 2557 次工具调用,费用可观;裁判同样需要 API key。若要复现数据构造流水线,还需 Gemini-3.1-Pro、Claude-Opus-4.7/4.8、GPT-5.5 以及 Serper 和 Jina 的付费 API,加上人工三重审核(原文用 15 名标注员超 100 小时),完整复制难度较高。对普通研究者而言,合理的路径是下载现成数据集、只复现评测端,并对少数模型抽样验证,整体属于中等偏高的复现成本。
论文图表
左右对比传统基准与 VideoGAIA:左侧 Video-MME 式任务是单轮对话、感知中心、封闭选项(如'壁炉上方有几只红袜子',四选一),Qwen3.7-Plus 可轻松答对;右侧 VideoGAIA 任务是多轮对话、智能体中心、开放式答案、开放世界证据(如要求根据画面中'日本制造'外壳、RC 阀、红色车身等线索查证某款手机的正式芯片营销名),即使配备工具,模型准确率也大幅下降。
这张图一图道破论文动机:同一个前沿模型在传统基准接近满分、在 VideoGAIA 上却大幅下滑,直观展示了'单轮视频 QA 饱和'与'智能体视频理解远未解决'的反差,是理解全文立论的最佳入口。