← 返回 2026-07-15

Blind-Spots-Bench:评估多模态模型的盲区 Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé 📅 2026-07-09 👍 30 2026-07-19 18:30
benchmark evaluation multimodal reasoning vision-language

用235道人能轻松解出、AI却频频翻车的题,诊断前沿模型的顽固盲区

前置知识

基准饱和(Benchmark Saturation)

指当前顶尖模型在 MMMU、GPQA、HLE 等精心设计的基准上分数已接近或超过人类专家,几近触及天花板的现象。饱和意味着现有测试难以继续区分模型之间的真实能力差异,也掩盖了模型在更细粒度、更底层能力上的缺陷。

理解饱和现象才能明白作者为何要构造一组'人觉得简单但模型做错'的题来暴露隐藏盲区。

Vision-Language Model(VLM)

一类同时接受图像与文本输入并输出文本的多模态模型,如 Gemini-3-Pro、GPT-5、Qwen3-VL。它需要在文本、图文混排、空间感知、计数等多种格式间工作,是本文评测的核心对象之一。

本文覆盖 text-only、multi-to-text、image-gen 三种格式,必须理解 VLM 才能区分不同格式的评测难度。

自动评分管线(Solver-Grader Pipeline)

用'求解模型'直接答题、再用独立的'评分模型'(本文用 gemini-3-flash)对答案做二元判定的两阶段框架。评分模型可调用代码执行来精确核对计数、子串等硬约束,从而自动处理大批量开放式输出。

这是整篇论文评测的方法论基础,理解它才能评判结果可信度与潜在偏差。

mean@k 与 pass@k

mean@k 表示 k 次独立尝试的平均准确率;pass@k 表示 k 次内至少答对一次的概率。本文文本题取 k=4,图像生成因成本高取 k=1。

结果表中的核心指标,区分'平均发挥'与'潜力上限'两种视角。

研究动机

现代前沿模型在数学、编程、推理与视觉等基准上表现强劲,Gemini-3、GPT-5 等在 MMMU、GPQA、Humanity's Last Exam 上几近饱和,甚至接近或超过人类专家。然而这些模型仍在人类看来近乎平凡的任务上意外翻车:生成长度精确为 $N$ 的字符串、画一只五条腿的狗、画指定时刻的钟表、解简单数独。这些失败指向空间推理、逻辑一致性与字符级操控等持续存在的盲区,但现有聚合型基准把分数平均后恰恰掩盖了这些细粒度弱点,无法区分模型到底在哪种底层能力上掉链子。

本文的目标是本文要构建一个能系统、可复现地暴露前沿模型盲区的基准 blind-spots-bench:包含 235 道人类轻松、模型却频繁失败的开放题,为每题配备结构化参考解、问题格式标注与一套面向多模态的细粒度任务分类法(三大类十二子类),并开发端到端自动评分流水线,对 32 个 LLM/VLM 与 6 个图像生成模型共 38 个系统做出可比较的评测,量化闭源与开源、不同任务类型之间的能力差距。最终目标是把'模型在哪类能力上有顽固盲区'这一问题从模糊的总体印象,转化为可定位、可追踪、可对比的诊断结论,为模型研发提供回归测试式的诊断工具,弥补现有饱和基准无法区分细粒度弱点的缺陷。

与已有工作不同的是,已有基准要么像 MMMU、GPQA、BIG-Bench 只给聚合分数而无法拆解具体能力短板,要么像 MME、MM-Vet、SIV-Bench 的能力维度过于粗或过于泛;而 GSM-Symbolic、VarBench 这类扰动基准只生成已有题的变体。本文的独特切入在于:题目全部来自真实场景中前沿模型的'自然失败',而非人工臆造,并配以三级十二子类的细分类法与失败模式标注,使评测既能反映真实弱点,又能定位到具体能力维度。

核心方法

整体思路是'从失败中提炼诊断题':先从一门研究生 AI 课程的 287 道原始题中清洗、去重、标注,得到 235 道'人类简单但模型失败'的样本;再为每题撰写含期望答案、必要条件与常见失败模式的参考解,并打上 text-only/multi-to-text/image-gen 三种格式标签与三级任务分类;最后用基于 Inspect AI 的两阶段流水线评测 38 个模型。直觉上,这些题形如'人之常情'的简单任务,技术路线则把它们组织成可量化、可分类、可自动评分的诊断集合。

核心创新在于用'细粒度任务分类法 + 结构化参考解'把盲区诊断从模糊的'模型不行'升级为'模型在某类子任务上不行'。与已有基准的本质区别是:题目源于真实场景中前沿模型的自然失败、配以可操作的失败模式清单,并由带代码执行能力的评分模型做二元判定,从而既能定位盲区类型,又能比较模型间互补的强弱项。作者明确强调没有任何单一模型在所有任务上称王,并把同源(同家族、不同规模)模型连成曲线追踪盲区随版本演进的修复速度。这一'按能力维度拆解失败'的诊断视角,是本文相对传统一维排行榜的根本性贡献,也是它能为模型研发提供可操作改进信号的关键。

方法步骤详情

第一步数据采集:让学生在 2025 年 10 月各出 5 道简单却让前沿聊天机器人答错的题,收集约 287 道。第二步清洗标注:过滤过难或重复项,归一化格式,为每题撰写结构化参考解(含正确答案、必要条件与失败模式,失败模式来自学生交互实测错误加至少三位标注者补充)。第三步打标签:格式分 text-only(占 46.2%)、image-gen(35.6%)、multi-to-text(18.2%);任务分 Object-centric、Abstract reasoning、Language and knowledge 三大类共 12 子类。第四步质检:人工核验、难度阈值过滤、消歧修正。第五步评测:solver 模型答题(无 in-context 与 CoT),grader 模型 gemini-3-flash 带代码执行判二值;文本题 k=4,图像 k=1;thinking 模式开启、medium effort、输出上限 32768 token。第六步验证:抽样 100+ 条人工核对一致性,并检验是否偏向 Google 系模型。

技术新颖性

技术新颖性有三点:一是引入一套为该数据集量身定做的三级十二子类分类法,并把多子任务题的失败类型按响应动态归类,实现远超聚合分数的可解释失败分析;二是把参考解设计成可被带代码执行的评分模型直接核验的形式,使计数、子串等硬约束能自动精确判定,减少主观偏差;三是首次在一个统一框架内横向对比文本 LLM、VLM 与专用图像生成模型,并辅以人工一致性核验(文本 96.6%、图像 90.9%)与同源评分偏差检验(未发现显著偏 Google),让开放式输出的自动评测具备可信度。

Representative examples from the dataset
Figure 2: Representative examples from the dataset
Question format composition (Left); Task category composition (Right)
Figure 3: Question format composition (Left); Task category composition (Right)

实验结果

总榜上 Gemini-3.1-Pro 最强,文本准确率约 83.3%、多模态约 66.9%;GPT-5.5 文本高达约 84% 但视觉仅 58.7%;开源阵营 GLM-5.2 以约 74% 文本准确率居首,Qwen3.5-397B文本约 71%、多模态约 48%,超越更大 Kimi-K2.6 与 DeepSeek-V4-Pro。闭源领先开源约 10 个百分点,即便 AAII 基准分数相当盲区题仍拉开差距,提示公开基准高估了非主流任务鲁棒性。图像生成 Gemini-3-Pro-Image 以 54.8% 居首但每百样本约 19.23 美元,GPT-Image-2 51.2% 紧随且便宜约 4 倍。细粒度视觉感知是普遍瓶颈:属性识别最强仅 41.67%、感知计数仅 57.14%。工具使用效应不一,Gemini-3.1-Flash 提升明显而 GPT-5.4、Qwen3.5-397B 反降,因模型常写对代码却贴错输入。规模并非总涨点:Qwen3.5-122B 在多个抽象推理子任务上比 35B 掉 10–14%。人工-评分一致性文本 96.6%、图像 90.9%,未发现显著偏 Google。

LLM and VLM model results by evaluation subset (mean@4, pass@4, output tokens, cost)
Table 1: LLM and VLM model results by evaluation subset (mean@4, pass@4, output tokens, cost)
Image-generation model results
Table 2: Image-generation model results
Delta in performance and tokens when enabling code execution for text-only problems
Table 3: Delta in performance and tokens when enabling code execution for text-only problems
Accuracy on blind-spots-bench vs. average cost for 100 samples
Figure 4: Accuracy on blind-spots-bench vs. average cost for 100 samples
Performance comparison of leading image generation and VLM models on the largest-sample subtasks
Figure 5: Performance comparison of leading image generation and VLM models on the largest-sample subtasks
查看结构化数据
任务指标本文基线提升
文本盲区题(text-only) mean@4 准确率 Gemini-3.1-Pro 83.3%;GPT-5.5 84%;GLM-5.2 73.8%(开源最佳) AAII 等通用基准上闭源与开源分数接近 在分数相当的模型间仍拉开约 10 个百分点,揭示通用基准被高估
多模态盲区题(multi-to-text) mean@4 准确率 Gemini-3.1-Pro 66.9%;GPT-5.2 50%;Qwen3.5-122B 48.8% 文本能力更强的模型 凸显文本优势难以迁移到视觉感知,开源与闭源多模态差距更大
图像生成(image-gen) mean@1 准确率与成本 Gemini-3-Pro-Image 54.8% @ 每百样本 19.23 美元;GPT-Image-2 51.2% @ 5.26 美元 Gemini-2.5-flash-image 22.6% 新一代模型大幅提升,且 GPT-Image-2 成本效益约为 Gemini 的 4 倍
感知计数子任务 最强模型 mean@k 准确率 57.14%(21 题) 多数模型仅 30%–40% 证明细粒度视觉感知是所有模型共同瓶颈,本基准能精准定位此类盲区
自动评分可信度 人工-评分一致率 文本 96.6%;图像生成 90.9% 为大规模自动评测提供可靠保障,并排除同源评分偏差

局限与改进

作者坦承三方面不足:数据规模偏小且子任务间不平衡(如属性识别仅 6 题、感知计数 21 题),影响统计可靠性;题目由学生针对特定两个前沿模型设计,可能偏向那些模型的弱点而遗漏别的失败类型;且未提供人类基线,无法直接量化人机差距。我的补充观察:评分仍依赖单一模型 gemini-3-flash,虽做了偏差检验但样本有限;图像生成仅评了闭源专用模型,缺开源生成模型,难以全面;所有模型固定 medium effort、无 CoT,未探索更长思考或更强的 prompting 策略下盲区是否缓解。

独立分析的弱点

其一,数据规模与子任务平衡不足,置信区间较宽(如文本误差约 ±3.2–4.2 个百分点),改进方向是扩样并按子任务配额,可借助模型自动生成同类变体来快速扩充。其二,评分依赖 gemini-3-flash 单一裁判,建议引入多裁判集成或更强的裁判模型并对比,降低系统性误判风险。其三,image-gen 缺开源模型与人类基线,应补入 SD、FLUX 等开源生成模型并采集人类答题率作为参照,直接刻画人机鸿沟。其四,固定 medium effort 与无 CoT 的设定可能低估模型潜力,未来可扫不同思考强度与采样参数,给出盲区对计算量的敏感度曲线。

未来方向

作者方向:扩大每个子任务的样本量、补充人类基线、降低对特定模型弱点的偏倚。基于成果可延伸的方向:一是把盲区分类法做成动态诊断 API,开发者可上传失败案例自动归类与定位短板;二是研究盲区'可治愈性'——哪些盲区靠更长推理或工具调用能修复、哪些是架构性缺陷;三是把基准接入模型迭代闭环,跟踪同家族版本(如 Gemini-2.5→3→3.1)的盲区演进趋势,作为模型研发的回归测试集;四是探索盲区与训练数据、token 化方式(如子词化导致字符级失败)的因果关系。

复现评估

复现性较好:数据集(235 题)已在 HuggingFace 公开(matsant01/blind-spots-bench),评测管线基于开源的 Inspect AI 框架(MIT 许可),代码仓库(matteosantelmo/reasoning-blind-spots)与 grader 提示词(Appendix B)一并放出,模型配置详见 Appendix D。难点在于算力与成本:38 个模型中开源权重通过 EPFL 的 RCP AIaaS(vLLM 部署)访问,闭源 API 调用费用可观(如 Gemini-3.1-Pro 多模态约每百样本 2.49 美元、GPT-5.5 约 4.8 美元),图像生成单次成本高故仅 k=1。个人研究者完整复现全表需相当预算,但用其已公开的子集与裁判可在小规模上验证关键结论。