← 返回 2026-08-24

OmniAssistBench:面向全模态大模型的助手式交互评测基准 OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan 📅 2026-08-21 👍 28 2026-08-29 18:30
全模态大模型 多轮交互 流式视频理解 视频助手 评测基准

以先验知识固定交互路径并逆向改造网络视频,系统评测全模态大模型的实时视频助手能力。

前置知识

Omni-LLM(全模态大语言模型)

能同时接收视频帧、音频、文本等多种模态输入的大语言模型,部分还支持语音实时输出,代表包括 Gemini 系列、Qwen3-Omni、Qwen2.5-Omni、MiniCPM-o、VITA-1.5 等。它们通常以流式方式处理连续音视频,在检测到用户指令时才触发推理,被视为实时视频助手的候选载体。

本文的全部任务设计与被测对象都围绕这类模型的输入输出形态(同时消费音视频、按轮次响应)展开,不理解其工作方式就无法理解基准为何如此设计。

交互式理解与路径分叉

传统视频理解中模型回答不影响视频内容,属于被动分析;交互式理解中助手的回复会改变用户后续行为。同一个用户目标(如做拿铁)可经多条合理路径达成,每条路径对应的后续视频都不同,静态离线数据集无法动态替换视频去匹配模型不可预测的回复。

路径分叉是本文要攻克的核心评测难题,先验知识固定路径、逆向工程视频等所有方法设计都为此而生,是理解全文动机的钥匙。

LLM-as-Judge 与评分 rubric

用强 LLM(本文为 GPT-5)按预先定义的评分准则代替人工为开放回答打分。本文 rubric 含三个维度:准确性与完整性(是否覆盖关键点短语)、冗余度(惩罚无关信息与幻觉,防止堆砌视频字幕刷关键词的捷径)、静默约束(该沉默时是否精确输出 [KEEP QUIET]),5 分制最后归一化到百分制。

论文所有实验数字都出自这套自动评判体系,理解 60 分及格线、40 分表示理解但事实错误等口径,才能正确解读模型成绩的含义。

教师强制(Teacher Forcing)

源自循环神经网络训练的经典技巧:解码时用真实历史替代模型自身的历史输出。本文将其借用到评测中——计算第 $T$ 轮回答时,把前 $T-1$ 轮的模型回复全部替换为标准答案,以隔离历史错误累积对当前轮的影响,从而检验多轮任务偏难是否真由错误传播导致。

这是论文四组消融实验之一,用于回答'多轮任务更难是否只是误差累积'这一方法论质疑,其结论直接影响对多轮评测设计合理性的判断。

有效上下文与视频 token 预算

视频输入按帧编码为 token 消耗模型上下文窗口,每秒帧数乘以每帧 token 数决定模型能'记住'多长的视频。例如 MiniCPM-o-2.6 的 32k 窗口在 1 FPS 采样下约容纳 380 秒视频,而 Qwen 系每帧编码 token 更多,有效记忆仅约 80 秒;超限时需用先进先出策略淘汰最老历史。

长视频多轮交互的成绩高度受此约束,论文把上下文耗尽列为四大瓶颈之一,分辨率消融实验也正是围绕'帧数换分辨率'的取舍展开的。

研究动机

现有视频理解基准(Video-MME、MVBench、EgoSchema 等)几乎都是静态单轮范式:给一段完整视频配若干文字问答,模型的回答完全不会改变视频内容,因此可以海量收集网络视频直接标注。但真实助手场景的根本不同在于,模型的回复会直接决定用户接下来的动作,从而产生分叉的交互路径:同样是'教用户做拿铁',助手可以让用户先萃取 Espresso 再准备牛奶,也可以反过来,两条路径对应的后续视频完全不同。静态数据集无法动态替换视频输入去匹配模型不可预测的回复,研究者也不可能穷举所有路径并准备对应视频,标准评测流水线在交互场景下彻底失效。而已有的交互评测尝试各有缺陷:ProactiveVideoQA 只测主动响应单一能力,OmniMMI 把说话人识别这类纯感知任务也归入主动推理,EgoLife 只有单轮文本多选题,LifeEval 只含 1 分钟以内的短视频,领域内缺少一套完整的助手式交互评测体系。

本文的目标是本文的目标是构建一个能严谨模拟实时视频助手多轮交互的基准 OmniAssistBench。具体包括三点:其一,解决路径分叉导致的不可评测问题,让任何模型都能在完全相同的测试条件下公平比较;其二,覆盖从基础感知(社交感知、时序感知、指代感知、非音频提示跟随)到高级目标导向能力(上下文感知响应、主动响应、过程跟踪)的完整能力栈,并用 3 个专门实拍的真实案例考察多能力组合的长时场景;其三,建立开放问答加 LLM 自动评分的统一协议,规避多选题的信息泄露捷径,系统评测 5 个闭源与 5 个开源全模态模型,定位它们成为可靠助手的具体瓶颈。最终基准含 300 个视频、685 组问答,平均视频时长 182.25 秒。

与已有工作不同的是,本文的独特切入是用'先验知识固定路径 + 逆向工程现有视频'把理论上不可行的动态评测改造成可行的离线评测。作者不从零录制人机交互(这类完整录像数据几乎不存在),而是反向操作:先从源视频内容中归纳出唯一规范流程作为先验显式告知模型,例如'做拿铁必须先萃取 Espresso 再准备牛奶',把现实中合理的路径多样性排除在评测变量之外;再按这条固定路径把完整的互联网视频切分成多轮片段、嵌入用户指令,模拟逐步交互。此外,作者明确选择全人工标注而非当前主流的自动化数据管线,理由是任务聚焦的细微非显著细节常被 Omni-LLM 生成的字幕遗漏,且高级任务的用户目标无法仅凭视频 caption 推得——这条严谨的 pipeline 耗费了超过 1000 个专家工时。

核心方法

直觉上,与其真的让模型与用户实时交互,不如提前'录制'一场假想的完美交互:先规定唯一交互路径,再沿这条路径反向剪辑现成视频。技术路线分四步。第一步场景设计与视频收集:专家与大模型协作头脑风暴关键场景,按细节剧情(如'3 人以上持续出现且其中一人在讲话')从 YouTube 及动作识别、教学视频、情绪分析等现有数据集中筛选素材,实在找不到的剧情自行拍摄补充;第二步 QA 设计:基于用户目标与先验知识编写开放问答,每题标注一个标准答案句和 1-3 个关键点短语;第三步视频剪辑与指令嵌入:所有问题经 TTS 转语音、音量均衡后嵌入对应片段末尾,手势与手写提示以画中画视频片段嵌入,用户目标以屏幕字幕呈现,非时序任务统一裁剪到 30-180 秒、约 1080p 分辨率;第四步质量精修:用 Gemini-3-Pro 等强模型检查标注完整性,把措辞不同但逻辑正确的回答补录为替代参考答案,提升评分鲁棒性。

核心创新有两点。第一是先验知识固定交互路径:面对'同一目标多条可行路径'这一评测死结,本文不从数据端穷举路径,而是从任务端消灭分歧——评测方从源视频归纳唯一规范流程(如拿铁'先 Espresso 后牛奶')作为先验提供给模型,明确要求模型严格按此路径引导用户,即使先加牛奶在现实中同样成立也算错。这既让静态数据集重新可用,又降低评测对模型内部知识的依赖,本质区别于传统基准'从视频里被动找答案'的出题逻辑。第二是离线模拟在线交互:把用户提问以 TTS 音频嵌在每段视频末尾(或以画中画呈现手势、手写提示),模型只在检测到用户指令时才发起推理,与真实流式助手'检测到指令才前向'的机制对齐;多轮片段之间保持严格的时间戳连续。再配合开放问答加关键点评分,避免了多选题中选项泄露答案捷径的问题。

方法步骤详情

完整流程与数据规格如下。每个样本由视频段、嵌入其中的提问、标准答案句和 1-3 个关键点短语构成,多轮片段之间时间戳严格连续。共 300 个视频、685 组问答、平均 182.25 秒:基础层含社交感知 67 视频(49.46 秒)、时序感知 47 个(77.03 秒)、指代感知 49 个(40.86 秒)、非音频提示跟随 30 视频 76 问答(149.84 秒、约 2 轮);高级层含上下文感知响应 20 个(119.62 秒)、主动响应 32 视频 133 问答(209.03 秒、约 4 轮)、过程跟踪 52 视频 246 问答(249.21 秒、约 5 轮);3 个实拍案例(12 人会议、盲人辅助、三人手工制作)各约 15 轮、平均 1016.13 秒。评分协议:GPT-5 按 5 分制 rubric 从准确完整性、冗余度、静默约束三维度打分并归一化到 0-100:60 分为及格线,40 分表示理解指令但事实错误,20 分以下为根本未理解;主动响应任务要求该沉默时精确输出 '[KEEP QUIET]'。推理时视频 1 FPS 采样,上下文超限按先进先出淘汰最老历史。

技术新颖性

与最近邻工作对比可看清新颖性:ProactiveVideoQA 只覆盖'何时该响应'单一维度;OmniMMI 虽区分流式理解与主动推理,却把说话人识别这类感知任务归入主动推理,且未处理路径分叉;EgoLife 有长视频社交跟踪但仅单轮文本多选题;LifeEval 只测 1 分钟内短视频。本文首次给出'基础感知—高级任务—真实案例'的完整两层体系(7 大任务、16 子任务、3 个专门实拍案例),并提出先验知识固定路径这一解决分叉难题的全新标注范式。任务设计上,画中画手势/OCR 指令、TTS 语音嵌入式提问、时间严格连续的多轮切分、惩罚冗余与幻觉的 rubric 均为现有基准所无。方法论上,作者坚持全人工标注并系统论证了自动化管线不可行的原因(细微非显著细节与用户目标无法从 caption 推得),这与当前'用大模型自动造数据'的主流做法形成鲜明对照,也解释了 1000+ 工时的成本来源。

Task construction of OmniAssistBench
Figure 2: Task construction of OmniAssistBench
The 4-step data construction process of OmniAssistBench (taking Multitask Tracking as an example)
Figure 4: The 4-step data construction process of OmniAssistBench (taking Multitask Tracking as an example)
Examples of 5 typical tasks in OmniAssistBench: GPF, OPF, CR, MT, and MER
Figure 5: Examples of 5 typical tasks in OmniAssistBench: GPF, OPF, CR, MT, and MER
Examples of key plots and questions of the 3 Real World Cases
Figure 6: Examples of key plots and questions of the 3 Real World Cases

实验结果

Gemini-3-Pro 66.4 分居首,开源最佳 Qwen3-Omni-Instruct 51.2,VITA-1.5 仅 24.6;头部模型能听懂却答不准不全。基础层视觉感知弱:难辨非显著目标与相似干扰物,目标超 10 个即下滑;手势跟随 GPF 全线崩溃:Gemini-3-Pro 仅 55.0,Doubao 29.5、MiMo 27.2、Qwen3.5-Omni 21.0。高级层四大瓶颈:①上下文有限:MiniCPM-o-2.6 的 32k 窗口仅容约 380 秒视频,Qwen 系仅约 80 秒;②延迟响应失败:对背景人声抢答而非等待目标;③跨轮遗忘:被新输入带偏即丢失初始目标;④多任务跟踪除 Gemini-3-Pro 外均挂不回 TODO 任务。真实案例闭源均分 51.2 对开源 34.8,Gemini-3-Pro 68.0、比上代高逾 20 分,但仍跟踪不了移出画面的小物件、读不懂手绘地图。消融:缺任一模态即普遍降分,主动响应纯视觉反升;三 judge 相关 $r \geq 0.75$;360p 换约 50 秒上下文,总分 51.2→52.7 甚微,真实案例反降至 30.8。

Statistics of the dataset grouped by second-level task categories
Table 1: Statistics of the dataset grouped by second-level task categories
Performance comparison on Basic Interactive Understanding tasks
Table 2: Performance comparison on Basic Interactive Understanding tasks
Performance comparison on Advanced Interactive Understanding tasks and Real World Cases
Table 3: Performance comparison on Advanced Interactive Understanding tasks and Real World Cases
The Scoring Rubric used in OmniAssistBench
Table 4: The Scoring Rubric used in OmniAssistBench
Detailed table of all Advanced Understanding sub-tasks
Table 5: Detailed table of all Advanced Understanding sub-tasks
Detailed table of all Basic Understanding sub-tasks
Table 6: Detailed table of all Basic Understanding sub-tasks
Detailed evaluation scores of candidate models assessed by three different judge LLMs (Basic tasks)
Table 7: Detailed evaluation scores of candidate models assessed by three different judge LLMs (Basic tasks)
Detailed evaluation scores of candidate models assessed by three different judge LLMs (Advanced tasks and Real World Cases)
Table 8: Detailed evaluation scores of candidate models assessed by three different judge LLMs (Advanced tasks and Real World Cases)
Evaluation results comparison of 4 representative models at sub-task level
Figure 7: Evaluation results comparison of 4 representative models at sub-task level
Major-task level performance comparison under original, visual-only, and audio-only input conditions
Figure 8: Major-task level performance comparison under original, visual-only, and audio-only input conditions
Heat maps of Pearson correlation coefficients between evaluation scores from different judge LLMs
Figure 9: Heat maps of Pearson correlation coefficients between evaluation scores from different judge LLMs
Performance comparison on multi-turn tasks under the common setting and the teacher forcing setting
Figure 10: Performance comparison on multi-turn tasks under the common setting and the teacher forcing setting
Performance comparison of Qwen3-Omni-Instruct under different input video frame sizes (1080p and 360p)
Figure 11: Performance comparison of Qwen3-Omni-Instruct under different input video frame sizes (1080p and 360p)
查看结构化数据
任务指标本文基线提升
全基准综合(Overall Avg.) LLM judge 归一化百分制(0-100) Gemini-3-Pro 66.4(所有模型中最高) 开源最佳 Qwen3-Omni-Instruct 51.2;最弱 VITA-1.5 仅 24.6 最佳闭源领先最佳开源 15.2 分
手势提示跟随(GPF) 归一化百分制(0-100) Gemini-3-Pro 55.0(该子任务最高) 其余模型 21.0-43.2(Qwen3.5-Omni-Plus 21.0、MiMo-V2-Omni 27.2) 全体模型最低分子任务之一,普遍比其他基础子任务低 20 分以上
真实案例(Real World Cases 平均) 归一化百分制(0-100) Gemini-3-Pro 68.0 Gemini-2.5-Pro 44.8;开源模型平均 34.8 Gemini 代际提升逾 20 分,但绝对水平仍远低于基础任务
Judge 一致性检验 Pearson 相关系数 $r$ GPT-5/GLM-5/DeepSeek-v3.2 两两 $r \geq 0.75$,多数 $\geq 0.8$ —(方法学验证,无传统基线) 证明 LLM-as-Judge 评分对 judge 选择稳健

局限与改进

作者承认的局限:构建成本极高,300 个视频、685 组问答加 3 个实拍案例共耗 1000+ 专家工时,规模难以扩大;真实案例只有 3 个、47 组问答,统计功效有限;主题覆盖常见日常场景但远非全部。我自己的观察:第一,强制唯一路径的代价是模型可能给出更合理或更高效的替代方案却被判错,这会把研究导向'死板指令跟随'而非'真正有帮助',与助手的初心相悖;第二,TTS 合成语音音色单一,与真实用户的口音、语速和噪声环境有差距,语音感知相关成绩可能偏乐观;第三,静默约束要求精确输出 '[KEEP QUIET]',rubric 中描述现状(Descriptive)也只能得 4 分,可能过严;第四,上下文管理统一采用先进先出淘汰,这本身就伤害长程任务,而摘要式记忆、检索式记忆等替代策略未被探索;第五,1 FPS 采样可能丢失快节奏手势与动作细节,这或许部分解释了 GPF 的全线低分;第六,FIFO 与分辨率消融均只在 Qwen3-Omni-Instruct 一个模型上做,结论普适性有待验证。

独立分析的弱点

独立分析出的弱点及改进方向:其一,规模与成本瓶颈——1000+ 专家小时只换来 685 组问答,扩展到万级样本不现实,可探索'强模型批量生成候选剧情与 QA、专家只做抽检与终审'的半自动管线,或用可控视频生成模型按脚本合成稀缺剧情;其二,唯一路径假设过强——把路径多样性从评测中剔除虽换来可行性,却丢掉了'择优建议'这一助手核心价值,可为每条合理路径分别标注关键点、按模型实际选择的路径匹配评分;其三,回合制离线模拟仍有失真——真实助手面对的是连续音视频流与随时打断,基准无法测响应延迟与打断处理,可接入流式推理框架做真在线评测并记录时延指标;其四,judge 系统性偏差——虽验证了三个 LLM judge 相互一致,但一致性高不代表无共同偏差(例如同时偏好冗长回答),应补充人工重评子集做校准;其五,案例层样本过少——3 个案例的单题方差足以掩盖模型间差异,可按同一脚本多机位、多演员拍摄变体扩充;其六,[KEEP QUIET] 精确 token 匹配偏严,可改为语义级'是否保持静默'判定。

未来方向

作者明确指出的方向对应四大瓶颈:提升视觉提示(手势等非言语指令)理解所需的训练数据与建模能力、引入超越原始上下文窗口的长期记忆机制、培养延迟响应的抑制控制(学会何时闭嘴)、保持跨轮上下文(在干扰下锁定初始用户目标)。在此基础上可延伸:把基准升级为动态交互环境,用世界模型或真人按模型输出即兴反应,真正评测路径分叉下的引导能力;把 '[KEEP QUIET]' 扩展为连续的响应时机策略学习,与置信度估计结合;探索检索式记忆、交互摘要压缩以突破上下文瓶颈;把手势理解、地图导航、多物品状态跟踪等失败模式转化为针对性训练数据;若用该基准做强化学习奖励源,须警惕模型过拟合到唯一路径,可结合路径无关的'帮助度'评价。数据层面,覆盖更多语言、口音与嘈杂场景,以及更多残障辅助场景,是通往普惠助手的必经之路。

复现评估

复现评估:论文公开了项目主页(xianyunsun.github.io/OmniAssistBench/),任务体系、16 个子任务定义与完整评分 rubric(附录 A)描述得足够细致,附录 C 还给出 GPT-5/GLM-5/DeepSeek-v3.2 三个 judge 的逐项分数,方法学透明度较高;但数据集本身(是否完整开源以主页为准)的复现门槛极高:1000+ 专家小时的人工筛选、脚本设计、TTS 嵌入与逐帧剪辑,外加 3 个案例需要真人按剧本实拍(12 人会议、盲人辅助、三人手工制作均需多人配合与道具),普通团队几乎无法重造。算力方面评测侧需求适中:10 个模型均以官方推荐配置推理,视频 1 FPS 采样、约 1080p,最长片段约 20 分钟需较大上下文窗口并配合 FIFO 管理;判分需调用 GPT-5(或已验证一致性的 GLM-5/DeepSeek-v3.2 替代),API 成本与 685 组问答的量级相当。综合判断:若基准数据随主页开源,复现'评测'为中等难度;复现'数据构建'则非常困难。