MMOOC:面向多模态大语言模型上下文外评测的综合基准 MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
提出41K规模的MMOOC基准,联合评估多模态大模型的拒答能力与抗干扰鲁棒回答能力
前置知识
Out-of-Context(OOC,上下文外问题)
指图像与问题组合中,即使结合通用世界知识,现有视觉证据也不足以支撑可靠回答的情形。典型如视觉错误前提(问题假设图中存在实际不存在的物体)、遮挡导致的未知空间关系、图片分辨率过低无法读取文字等。此时模型的正确行为是明确拒答并说明理由,而不是编造答案。
OOC 是本文评测的第一大类对象,五类 OOC(MA/VFP/USPC/ULS/MKB)构成了基准的'应拒答'侧,理解这个概念才能理解拒答率指标在衡量什么。
Shifted In-Context(移位上下文内问题)
指问题中混入了误导性前提、干扰信息或叙事错配,但核心视觉查询仍然可以从图像中回答的情形。例如'夜里那只猫坐在哪?'中'夜里'是无依据的干扰,但猫的位置可见。理想模型应忽略干扰回答可见部分,而不是整题拒答。
这是本文区别于以往拒答基准的关键设计:此前工作几乎只测'该拒的会不会拒',而 Shifted IC 测的是'不该拒的会不会被过度拒答'。
LLM-as-a-Judge(大模型裁判)
用强语言模型代替人工对开放回答打分的评测协议。本文使用 GPT-5.6、Claude Opus 5、DeepSeek-V4-Pro 三个互不参与数据生成和被测集合的裁判独立评分后取平均,评分档位为 $\{0, 0.25, 0.5, 0.75, 1\}$,并随机抽取 2000 条回答做人工校验。
本文的理性度指标(Answer/Refusal Rationality)完全依赖裁判协议,其人机一致率(拒答 96.78%、理性度 89.34%)决定了指标的可信度。
SFT 与 DPO(后训练对齐方法)
SFT(监督微调)用带标准答案的指令数据直接微调模型行为;DPO(直接偏好优化)用成对的偏好/非偏好回答训练模型偏向更优回答,无需训练奖励模型。两者都是把模型行为对齐到期望策略(如'证据不足时拒答')的常用后训练手段。
论文实验部分用 SFT 和 DPO 证明 MMOOC 上的失败模式可以通过对齐改善,同时揭示了对齐带来的通用能力(MMStar)下降的权衡。
拒答率与理性度(Rref / Rrat)
拒答率 $R_{ref}=\frac{1}{N_{OOC}}\sum_{i=1}^{N_{OOC}}\mathbb{I}(r_i=1)$ 衡量模型对真正无法回答的问题正确弃权的比例;理性度 $R_{rat}$ 由裁判评估模型是否正确识别了缺失信息并给出有据的解释。二者平均得到 OOC 综合分 $S_{OOC}$。
只看拒答率会鼓励'一律拒答'的退化策略,理性度指标强制模型解释拒答理由,是防止指标被博弈的关键设计。
研究动机
多模态大模型(MLLM)在真实应用中经常遇到视觉输入无法支撑用户提问的情况:继续硬答会产生幻觉和误导,一律拒答又会损害可用性。然而现有评测只覆盖了这个问题的一面。例如 SNIFFER(1.9K 样本)和 UPD(2.0K)只测模型是否拒绝无解问题;HaloQuest(7.8K)和 MoHoBench(12K)虽覆盖多种 OOC 设定,但仅支持 VQA 一种问答格式,视觉场景也以感知为主;CLIP-UP(1.4K)考虑了多选与 VQA,却没有在移位上下文条件下评估多样的 OOC 设定。更关键的是,这些基准几乎都忽略了'干扰存在但问题仍可回答'的 Shifted IC 场景——此时模型若因过度保守而拒答,同样是失败,且这种失败此前完全没有被量化过。Table 1 显示,此前所有基准在'干扰鲁棒性'一列均未覆盖,规模最大仅 14K(NOPE),与真实用户提问的多样性相差甚远。
本文的目标是本文的目标是构建一个能同时考核'该拒时拒、该答时答'的大规模校准评测基准。具体包括:将规模扩展到 41K 以上图文问答对;覆盖 Yes/No、多选(MCQ)、开放式 VQA 三种问题格式,避免结论被单一格式绑架;定义 8 种上下文偏移类型——5 类真正无法回答的 OOC(多模态歧义 MA、视觉错误前提 VFP、不确定空间与物理上下文 USPC、不清晰逻辑与符号 ULS、缺失知识背景 MKB)和 3 类仍可回答的 Shifted IC(误导前提 MP、部分可回答 PA、图文错配 IQM);横跨从粗细粒度感知到空间与逻辑推理的 6 种视觉场景;并配套 Accuracy、Answer Rationality、Refusal Rate、Refusal Rationality 四个指标与多裁判协议,对 18 个开源与闭源 MLLM 做系统评测。
与已有工作不同的是,本文的独特切入角度是把'拒答'与'坚持回答'放进同一个校准框架。此前工作把 OOC 当作单纯的幻觉规避或不可回答识别问题,而本文指出:真实用户的问题常带有干扰项,可靠模型的标志不是拒得越多越好,而是能依据图文证据判断答案是否仍被支持。为此 MMOOC 首次将 Shifted IC 三类别(MP/PA/IQM)与 OOC 五类别并列成层级分类体系,要求模型在 PA 中只回答可见部分(如'自行车什么颜色、骑手叫什么?'应只答颜色),在 IQM 中穿过错误叙事仍给出事实答案。同时引入 Distractor Robustness 维度和三裁判理性度评分,把'答得对'与'答得有理'分开考核,再用人工复核校验裁判——这套'双重行为 + 双重质量'的设计是此前所有拒答基准都不具备的。
核心方法
直觉上,一个可靠的 MLLM 应该像人一样先判断'图里的证据够不够回答这个问题',再决定作答或拒答。MMOOC 据此设计分层分类体系:样本先按图文证据是否支持答案二分为 Shifted IC 与 OOC,再按扰动或失败的首要来源归入单一类别,以减少表面相似类别间的重叠。数据层面采用两条互补管线:一是沿用 MoHoBench 的 ICL(上下文学习)范式,用 Qwen3.5-122B-A10B、GPT-4o 和 o1 为新收集的图像生成接地描述、Shifted IC/OOC 问题及解释,多模型并用以增加语言风格与推理模式的多样性;二是纳入人工设计的问题,并按 UPD 的 Auto Shuffle 方法从 MME、MMStar、OK-VQA 派生额外 OOC 样本,保留人工撰写的视觉内容与语言多样性。质量上先让 GPT-4o、o1、o3 独立判断可答性、三者一致才保留,再全量人工复核。评测用 $S_{IC}=\frac{1}{2}(Acc+Acc_{rat})$ 与 $S_{OOC}=\frac{1}{2}(R_{ref}+R_{rat})$ 汇总两类行为。
核心创新是'校准感知'的双重评测:不只问模型会不会拒答 OOC,还问它会不会在干扰存在时仍然作答。与 MoHoBench 等只覆盖不可回答情形不同,MMOOC 在其四类 OOC 之上新增 USPC(遮挡区域、画外内容、不确定物理关系),并将 MKB 明确归入应拒答一侧;同时首次把 PA(部分可回答)设为独立类别——理想行为是'回答可见部分、声明不可知部分',这比整体拒答难得多,需要细粒度的证据校准。第二点是理性度评分:裁判不只看最终答案对错,还检查模型是否正确识别了缺失信息并给出连贯、有据的解释,评分取 $\{0,0.25,0.5,0.75,1\}$ 五档。第三点是防偏多裁判协议:GPT-5.6、Claude Opus 5、DeepSeek-V4-Pro 三个模型独立打分后取平均,且均不参与数据生成、过滤和被测模型集合;人工评估显示人机在拒答判定上一致率达 96.78%。
方法步骤详情
构建分四步。第一步数据生成:ICL 管线以 Qwen3.5-122B-A10B、GPT-4o、o1 为新图像生成描述、问题与解释;人工管线覆盖自然困难的 OOC 场景;Auto Shuffle 管线从 MME、MMStar、OK-VQA 保留人工撰写内容并注入错配上下文。第二步过滤:GPT-4o、o1、o3 独立评估每个图文对能否可靠回答,仅当三者一致时保留,剔除生成错误与边界不稳样本。第三步人工验证:标注者核查可答性判断与参考答案、类别与解释的一致性、问题是否自然;小错修正、无效样本删除、分歧交由第三人仲裁。第四步质量检验:平均回答长度 26.69、Self-BLEU 2.00、语义相似度 0.09,全面优于 HaloQuest(8.84/42.24/0.41)、MoHoBench(17.05/36.78/0.39)与 UPD。评测阶段计算 $Acc=\frac{1}{N_{IC}}\sum_{i=1}^{N_{IC}}\mathbb{I}(\hat{y}_i=y_i)$、$R_{ref}=\frac{1}{N_{OOC}}\sum_{i=1}^{N_{OOC}}\mathbb{I}(r_i=1)$ 及对应的理性度均值,再取平均得到 $S_{IC}$、$S_{OOC}$;最后随机抽 2000 条回答做人工评估校验裁判。
技术新颖性
技术新颖性体现在四个方面。其一,规模与覆盖度:41K 样本、8 种偏移类型、3 种问答格式、6 种视觉场景,全面超过此前最大 14K、最多 4 类偏移的基准(Table 1)。其二,类别体系:在 MoHoBench 四类 OOC 基础上新增 USPC,把 MKB 归入需拒答侧,并首创 PA 与 IQM 两个 Shifted IC 类别,使'干扰下的正确回答'成为可量化的评测目标——这是对'拒答=可靠性'这一旧范式的直接修正。其三,度量设计:把格式敏感的 Accuracy 与内容质量的 Rationality 分开计算再平均($S_{IC}=\frac{1}{2}(Acc+Acc_{rat})$),既避免 VQA 宽松匹配造成的虚高掩盖拒答失败,也避免单一二值指标掩盖推理错误;多裁判平均进一步抑制单一模型家族偏置。其四,质量流程:三模型一致过滤加全量人工复核,配合 96.78%/89.34% 的人机一致率验证和最低的模板化指标(Self-BLEU 2.00),为后续基准树立了可参照的数据质量标准。
实验结果
核心结论有六条。第一,OOC 拒答依然很难:Qwen3-VL-2B 在 USPC 的 YesNo/VQA 上仅 5.75/8.25,LLaVA-1.5-7B 多数单元格低于 10,USPC 与 ULS 是最难类别。第二,规模不保证 OOC 鲁棒(Figure 5):Qwen3.5-122B-A10B 并未稳定超过更小的 Qwen3-VL 变体。第三,闭源上限更高但不一致:o1 整体最强(YesNo MA 57.50、VQA MKB 76.25),Gemini-3.1-Pro 意外疲软(YesNo MA 仅 4.75),Claude-Opus-4.6 在 MCQ/VQA 的多数 OOC 单元格低于 20。第四,Shifted IC 得分普遍高于 OOC,但 PA-VQA 仍是重灾区:Gemini-3.1-Pro 仅 22.75、Claude-Opus-4.6 仅 32.25,明显落后于 Qwen3.5-122B-A10B 的 72.25,闭源并不统一占优。第五,后训练有效但有代价(Table 5):Qwen3-VL-2B 经 SFT 后 IC 76.00→90.00、Rref 8.00→38.00,但 MMStar 从 64.19 降到 58.95;Qwen3-VL-8B 的 SFT 使 Rref 32.00→46.00,MMStar 65.13→61.39;DPO 增益普遍小于 SFT。第六,提示与鲁棒性(Figure 6-8):refusal prompt 提升 OOC 却拉低 IC(过度拒答),CoT prompt 权衡最佳;o1 对误导性用户提示敏感,对高斯噪声却几乎不退化,说明其短板在上下文鲁棒性而非底层视觉鲁棒性。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OOC 拒答对齐(Qwen3-VL-2B,SFT vs Vanilla) | Rref 拒答率 | 38.00(SFT) | 8.00(Vanilla) | +30.00 |
| Shifted IC 鲁棒回答(Qwen3-VL-2B,SFT vs Vanilla) | IC Accuracy | 90.00(SFT) | 76.00(Vanilla) | +14.00 |
| 通用多模态能力(SFT 的副作用) | MMStar Accuracy | 58.95(SFT 后) | 64.19(Vanilla) | -5.24(对齐代价) |
| OOC 拒答(闭源模型横向对比) | 综合 S_OOC(Rref+Rrat 均值) | o1:YesNo MA 57.50 / VQA MKB 76.25 | Gemini-3.1-Pro:YesNo MA 仅 4.75 | 闭源内部差距超过 50 分 |
| Shifted IC 部分可回答(PA-VQA) | S_IC | Qwen3.5-122B-A10B 72.25 | Claude-Opus-4.6 32.25 / Gemini-3.1-Pro 22.75 | 开源反超闭源最多 49.5 分 |
局限与改进
作者明确承认 MMOOC 目前只覆盖图文交互,向视频、音频和具身环境扩展是未来工作。我的补充观察有五点。其一,生成与过滤依赖 GPT-4o/o1/o3、裁判依赖 GPT-5.6/Claude Opus 5/DeepSeek-V4-Pro 等闭源 API,虽然作者声称裁判与生成模型、被测集合互不重叠,但论文未报告三个裁判之间的分歧分布,系统性偏置难以排除。其二,正确拒答由裁判二值判定($r_i\in\{0,1\}$),对 PA 类'部分回答'的边界判定天然不稳定——理性度的人机一致率 89.34% 明显低于拒答判定的 96.78%,说明该环节噪声更大。其三,Auto Shuffle 样本派生自 MME/MMStar/OK-VQA 等公开基准,若社区将其用于训练会有数据泄漏风险。其四,SFT 带来 3-5 点 MMStar 下降的对齐代价只被报告、未被解决。其五,USPC、ULS 等抽象类别的边界即便经过三人仲裁仍可能存在人类层面的争议,类别间互斥性缺少定量验证(如交叉标注一致率)。
独立分析的弱点
弱点一:指标对答案格式敏感,Yes/No 的二元判断天然放大波动(论文自己也承认 YesNo 因硬二值决策而最难),改进方向是引入置信度校准指标(如期望校准误差 ECE)或选择性预测的 risk-coverage 曲线,量化'何时拒答'的最优阈值而非仅看行为。弱点二:SFT 对齐带来 MMStar 平均 3-5 点的下降,说明现有拒答数据会侵蚀通用多模态能力,改进方向是在对齐数据中混入通用多模态指令做联合训练,或用 LoRA/专家路由把拒答行为隔离在独立参数子空间。弱点三:后训练实验只覆盖 3 个模型(Qwen3-VL-2B/8B、InternVL3-2B),'SFT 优于 DPO'的结论是否随模型家族和规模变化仍未知。弱点四:提示工程实验只在 Qwen3-VL-8B 上进行,CoT 优于 refusal prompt 的权衡结论需要更大模型与更多提示变体验证。弱点五:o1 对误导性用户提示敏感这一发现很有价值,但论文未给出缓解方案,例如在评测中加入系统提示防御或上下文清洗的对比实验会使结论更完整。
未来方向
作者提出的方向是把 MMOOC 从图文扩展到视频、音频和具身环境,这些模态中上下文不完整的问题更普遍、拒答决策也更关键。在此之上可以延伸:把 MMOOC 用作训练资源,配合拒绝感知的偏好优化,在不牺牲 MMStar 的前提下提升 OOC 鲁棒性,直接回应本文发现的对齐权衡;引入校准曲线与 conformal prediction,为'何时拒答'提供有统计保证的决策规则;将理性度评分扩展为过程级监督,训练模型对 PA 类别显式输出'可答部分/不可答部分'的结构化答案;研究多轮对话中被用户追问误导后的行为恢复与自我纠错;考察跨语言的 OOC 表现差异;以及对裁判模型做持续元评测,用人工标注子集校准并公开裁判偏差报告,使 LLM-as-a-Judge 协议本身可审计。
复现评估
论文声明 MMOOC 将公开发布,首页提供 Project Page、Code、Dataset 入口,41K 图文对及八类别标注的开放是最大利好。复现门槛主要在三处:其一,生成与过滤阶段依赖 GPT-4o、o1、o3,裁判依赖 GPT-5.6、Claude Opus 5、DeepSeek-V4-Pro,对 18 个模型全量推理的 API 成本不低,闭源环节无法完全离线复现;其二,全量人工复核与 2000 条人工评估需要持续标注预算,个人团队难以复制同等质量流程;其三,开源模型评测(Qwen3-VL 系列、InternVL3、Gemma-4、Llama-4-Maverick 等)均为公开权重,需要多卡 GPU 但无技术障碍。总体评估:复用公开数据做训练或子集评测的难度中等,完整复现整条数据构建与多裁判评测管线的难度中偏上,主要成本在 API 调用与人工标注;后训练实验(SFT/DPO)涉及的均为 2B-8B 模型,单机多卡即可完成,这部分复现门槛最低。
论文图表
三栏对比图:传统基准只包含可回答的常规问题(如问猫的颜色);拒答基准只包含应拒绝的不可回答问题(如问图中不存在的桌子的颜色);MMOOC 则同时包含两类——既有'干扰存在但可回答'的现实问题(猫坐在长椅上而非桌上,仍能回答颜色),也有'真正不可回答'的问题(图中没有桌子,应拒答),并要求模型对两者给出不同行为。
这张图用最直观的方式呈现了论文的核心动机:可靠性不是单向的拒答能力,而是'拒答与坚持回答'的联合校准,是理解全文设计哲学的入口。