PerceptionBench:评估多模态大语言模型的原子视觉感知能力 PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
从42个基准的模型失败中归纳10项原子感知能力并构建3000题评测集
前置知识
多模态大语言模型 (MLLM)
把大语言模型的推理与语言能力扩展到图像、视频等多种模态的模型,能同时接收文字和图片并生成回答,是当前 AI 的主流形态(如 GPT、Gemini、Kimi、Qwen)。下游推理无法可靠恢复被漏看或读错的视觉信息,因此感知错误会传染到推理。
本文所有评测对象就是 MLLM;不理解'看图说话'模型的输入输出方式,就无法理解作者为何要把视觉感知从推理与知识中单独切出来评测。
视觉感知 vs 推理 vs 知识
感知指从图像中提取事实(颜色、数量、位置、文字);推理指在已提取事实之上做逻辑推断;知识指模型自带的领域常识(如篮球一节 12 分钟)。这三者在端到端任务里常被混在一起打分,导致错误无法干净归因。
全文核心论点是'感知是推理的前置基础却最易被掩盖';不区分这三者就读不懂作者为什么要做原子拆解和最早错误优先归因。
失败归因 (Failure Attribution)
对一个错误回答,回溯其完整推理轨迹,定位最早出错的那一步并打开放词汇标签的做法。本文遵循'最早错误优先'规则:只要链中出现读错的视觉事实,就把失败归到感知链上最早出错的那一步。
这是构建统一错误分类树的方法论核心,也是'能力从模型失败中归纳'这件事得以成立的关键工具,直接产出十项原子能力的定义。
原子能力 (Atomic Capability)
只考查单一感知维度、难度纯粹来自该维度而非推理或知识的能力单元,例如'数数''读文字''判断相对方向'。每道原子题答案短且唯一,且只隔离一项能力。
PerceptionBench 全部 3000 题都围绕十项原子能力组织;理解'原子'的含义才能理解基准如何做到感知与推理的干净分离。
饱和样本与难度校准
当前所有前沿模型都能稳定答对的题缺乏诊断价值。本文用四模型集成,仅当某题被全部模型在所有轮次都答对才判为'饱和'剔除,其余按通过率分三个难度层;四模型与被评的 16 个模型互不相交。
它解释了为什么基准对 2026 年最强模型仍有区分度,也说明难度是相对'当前模型群'而非某个具体模型来定义的。
研究动机
现有的多模态大模型(MLLM)评测大多围绕端到端任务展开。整体性基准如 MMMU、MathVista 在多步问题上打分,其成绩同时依赖感知、推理与外部知识三个因素,因此无论答对还是答错都无法干净归因到感知本身——读错图与想错逻辑纠缠在一起。另一类应用导向基准如 OCRBench、ScreenSpot 虽更直接地测感知,但它们是自顶向下、由设计者先验预定义类别,每个基准只覆盖感知能力的一个窄切片(如 OCR 或 GUI 定位),覆盖范围被特定应用域塑造。作者对 42 个开源基准做了失败归因分析(Figure 3),发现每个基准的失败几乎集中在一两种错误类型上,且跨基准的错误类型分布重叠很弱。这意味着现有评测套件只能拼凑出感知失败空间的稀疏、互补碎片,无法系统诊断一个模型到底缺哪项感知能力。
本文的目标是本文目标是构建一个能干净隔离视觉感知、并能系统覆盖感知能力全空间的基准 PerceptionBench。具体而言:每道题只考查单一的原子感知能力,答案短且唯一,难度来自感知而非推理或知识;能力类别不应由设计者先验决定,而应从前沿模型在 42 个现有基准上的真实失败中自底向上归纳;最终评测要能给出细粒度的能力画像,揭示总分接近的模型之间在哪些感知维度上分化。作者希望据此回答一个核心问题:当前最强的 MLLM 在原子感知上到底有多强、哪些能力是共同瓶颈。
与已有工作不同的是,独特的切入角度在于'失败驱动'而非'先验驱动'。绝大多数基准按任务边界或设计者预设类别划分,而 PerceptionBench 把能力结构从模型的失败中反向挖掘出来:对每条失败样本的推理轨迹做最早错误优先归因,再用 LLM 聚类合并语义等价的错误标签,得到一棵统一分类树,其感知分支自然定义出十项原子能力。这种'从模型缺什么出发'的视角让评测直接对齐当前模型的真实薄弱点,而非设计师想象的能力;同时所有问题都经过能力对齐、视觉接地与人工三重校验,保证难度真的源于感知。这是它与 BLINK、TET、VisFactor 等感知中心基准(仍靠设计者先验自顶向下分类)的本质区别。
核心方法
PerceptionBench 采用三阶段自底向上构建管线。第一阶段是失败驱动的能力发现:在 42 个覆盖文档、OCR、图表、GUI、视觉定位、科学图、遥感、自然图像等域的基准上跑一组前沿 MLLM,收集答错样本,用一个更强的前沿模型分析每条失败的完整推理轨迹,用自由形式指出最早出错阶段并打开放词汇标签,再聚类合并得到统一分类树(五大类、22 个细类),其感知分支即为十项原子能力。第二阶段是题目选择与构造:用四模型集成剔除'所有模型都答对'的饱和题并按通过率分层;把感知类失败拆解成只考单一能力的原子子题,并用补充图像新写题目;用 ISC 描述子做去重,阈值 $0.95$。第三阶段是多阶段校验(能力对齐、视觉接地、人工复核)。最终从 17000+ 内部池中分层采样出 3000 题发布版。
核心创新是'最早错误优先(first-error-priority)的失败归因'与'能力从失败中归纳'两点的结合。归因遵循一条规则:只要推理链中出现任何被读错的视觉事实,就把失败归到感知链上最早出错的那一步,而不管后续推理是否也错;只有当所有视觉事实都被正确提取时,才归到推理或知识类。这避免了把感知错误误判为推理错误的常见偏差。其次是'能力继承':每个由失败拆解出的原子子题直接继承归因阶段的能力标签,因此每道题都锚定在一个被实证观察到的感知弱点上。这种从失败反推能力结构、再把能力结构作为评测骨架的做法,在认识论上与所有自顶向下、先验定义类别的基准根本不同。
方法步骤详情
完整步骤如下。(1) 收集 42 个开源基准的视觉域,跑前沿 MLLM 取答错样本形成候选失败池。(2) 对每条失败,把问题、图像、参考答案与模型推理轨迹一起喂给更强的分析模型,产出自由形式错误分析并打开放词汇标签。(3) 用 LLM 聚类合并语义等价标签,得到五大类 22 细类的统一分类树,取感知类的十项作为原子能力。(4) 难度筛选:四模型集成,仅当某题被全部模型在所有轮次都答对才判为饱和剔除,其余按通过率分三个难度层。(5) 感知拆解:给标注员原始题、错误分析与能力标签,要求拆成只考单一能力的原子子题并继承标签。(6) 视觉补充:从公开网络和内部数据补充图像、新写题目,用 ISC 描述子对 LAION/Common Crawl 算余弦相似度,超过 $0.95$ 的近重复或泄露图像丢弃。(7) 最终筛选:对新题同样用集成筛除饱和题。(8) 多阶段校验:能力对齐校验、视觉接地校验、独立人工复核,不合格的修正或剔除。(9) 从 17000+ 内部池按能力均衡与难度分层采出 3000 题发布。其中 1800 题来自拆解,1200 题来自新写。
技术新颖性
新颖性体现在四点。第一,分类学不是先验定义而是从 42 个基准的前沿模型失败中归纳,使评测天然对齐当前模型的真实弱点;作者还量化证明了现有基准的失败类型分布重叠很弱(Figure 3、Figure 8),说明确实没有小集合能覆盖整个失败空间。第二,最早错误优先的归因规则把感知错误从推理错误中干净剥离,避免了 MMMU/MathVista 式的混淆。第三,感知拆解把多步原题分解为只考单一能力的原子子题,使每题难度纯粹来自感知;同时通过四模型集成双向筛除饱和题(构造前和构造后各筛一次),既保证基准对前沿模型仍有区分度,又避免坍缩到纯对抗样本。第四,发布版只是 17000+ 内部池的代表性子集,作者用 Pearson 相关 $r = 0.84$ 验证了发布子集在逐能力难度结构上忠实代表全集,把评测成本压到约五分之一。
实验结果
在 16 个前沿 MLLM(10 闭源、6 开源)上评测,判官为 GPT-oss-120B,在 300 条人工比对中达成 99.7% 一致。核心发现:第一,原子感知远未解决——无任何模型超过 60%,最高的 GPT-5.6-Sol 仅 59.7%,开源冠军 Kimi K3 以 58.5% 落后其 1.2 个点却超过所有其余闭源模型(Gemini-3.1-Pro 56.2%、GPT-5.5 55.8%),最弱的 GLM-4.6V 仅 32.5%。第二,能力极不均衡:感知相关幻觉平均最低仅 36.7%,远低于视觉关系 53.2%、OCR 52.4%、定位 52.0%;总分第一的 GPT-5.6-Sol 在定位上高达 76.7%,但幻觉只有 26.9%(全场最低之一),而中游的 Gemini-3.5-Flash 反以 50.6% 拿下幻觉第一。第三,总分相近的模型画像分化剧烈:GPT-5.5(55.8%)与 Gemini-3.1-Pro(56.2%)总分差不到 1 点,但定位差 13 点、OCR 与细粒度识别各差约 8 点。第四,可靠性实验显示总分跨 4 次运行标准差很小(Kimi K3 std 0.32、GPT-5.6-Sol std 0.17),但 pass@$4$ 与 pass$4$ 鸿沟巨大(GPT-5.6-Sol 72.9 vs 46.9),说明单题感知并不稳定,部分准确率来自不稳定预测。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| PerceptionBench 总体准确率 | Overall accuracy (3000 题) | GPT-5.6-Sol 59.7% 居首,Kimi K3 58.5%(开源冠军) | Gemini-3.1-Pro 56.2%、GPT-5.5 55.8%、Claude-Fable-5 57.2%、GLM-4.6V 32.5% | 开源 Kimi K3 仅落后闭源冠军 1.2 个点,但无任何模型突破 60% 阈值 |
| 感知相关幻觉能力 | Hallucination 准确率(越低越易幻觉) | Gemini-3.5-Flash 50.6% 最强,GPT-5.6-Sol 仅 26.9% | 全模型平均 36.7%,是十项能力里最低 | 揭示'总分领先≠幻觉少'的反转:激进作答模型在幻觉题上系统性失败 |
| 视觉定位能力 | Localization 准确率 | GPT-5.6-Sol 76.7%、Claude-Fable-5 70.4%、Kimi K3 70.3% | GPT-5.5 65.8%;平均 52.0% | GPT-5.6-Sol 在定位上达全场最高,与其幻觉低分形成强烈对比 |
| 评测稳定性与一致性 | std / pass@4 / pass4(4 次独立运行) | Kimi K3 std 0.32、pass@4 73.9、pass4 42.7 | GPT-5.6-Sol std 0.17、pass@4 72.9、pass4 46.9;Gemini-3.5-Flash std 0.64 | 总分稳定但 pass@4 与 pass4 差距达 26–38 点,暴露单题感知行为不稳定 |
| 发布子集代表性 | 逐能力准确率 Pearson 相关 | 发布 3000 题 vs 完整 17000+ 池 | 全集略难于发布版 | r = 0.84,证明发布版忠实代表全集难度结构,评测成本降到约 1/5 |
局限与改进
作者承认的局限主要有三点。其一,分类学是从当前模型代的失败归纳的,反映的是今天的弱点而非感知的固定结构;模型进步后分类树需重新归纳、集成难度也需重新校准。其二,失败归因依赖一个更强的分析模型,残余的归因误差会传播到能力标签;当前沿模型最早出错步骤发生迁移时,同一题可能被归到不同类别。其三,PerceptionBench 刻意只测感知,因此能力分数不能直接预测端到端任务表现,应与任务导向基准配套使用。我自己的观察:3000 题里某些能力样本数偏少(如上下文整合与 OCR 各仅 255 题,占 8.5%),逐能力方差估计可能偏大;判官 GPT-oss-120B 虽在 300 条上达 99.7% 一致,但它在长尾开放回答上的鲁棒性未被充分验证;此外发布版未公开每题的图像来源与原基准映射,难以做污染的独立复现。
独立分析的弱点
独立分析的弱点与改进方向如下。第一,能力类别依赖当前模型代,存在'评测漂移'——建议引入滚动重归纳机制并维护版本化的能力树与难度层,使基准可随模型进化。第二,归因依赖单一强分析模型,易引入系统性偏差——可引入多分析模型投票或人在回路的归因校准,并对每个能力标签附上置信度。第三,幻觉能力的样本设计可能偏向'识别不存在物'的单一形态——可扩展到更广义的感知可信度校准(如显式置信度阈值、'我不知道'选项),区分'错答'与'幻觉答'。第四,发布子集部分能力样本数偏少(OCR/上下文整合仅 255 题)——可对弱样本数能力做定向扩充或用分层 bootstrap 给出置信区间。第五,未给出感知能力与下游任务的相关性——可补充'感知能力到端到端任务表现'的回归分析,量化感知瓶颈的实际影响。
未来方向
作者提出的方向:随模型迭代周期性重归纳分类树与重校准集成难度;探索把失败驱动管线扩展到非感知能力(推理、知识)的细粒度诊断。基于成果可延伸的方向:把 PerceptionBench 用作训练信号而非纯评测——对每项原子能力做定向数据增强或偏好优化,验证逐能力提升能否带来下游任务收益;把失败归因管线做成持续监控工具,追踪新模型发布后的能力画像迁移;构建感知能力的因果图,分析十项能力之间的依赖与迁移关系;针对最弱的感知幻觉能力,研究'拒绝回答'与'置信度校准'是否能系统提升 pass$4$ 一致性,从而把'不稳定预测'转化为'可靠感知'。
复现评估
复现性整体较好。代码与数据已开源在 https://github.com/MoonshotAI/PerceptionBench,博客见 https://www.kimi.com/blog/perception-bench。论文给出了完整的分类学(附录 B)、许可信息(附录 C)、评测 prompt(附录 E),判官模型 GPT-oss-120B 也是公开模型。难处在于:评测需要调用 16 个前沿闭源/开源 MLLM 的最高推理档(GPT-5.5 'xhigh'、GPT-5.6-Sol/Claude-Fable-5/Claude-Opus-4.8/Kimi K3 'max'、Gemini 系列/Seed-2.1-Pro 'high'),API 成本与排队时间可观;完整内部池 17000+ 题的图像与标注未全部发布,独立重建全集不可行;四模型集成筛题所用的具体成员模型与运行配置也未完全公开,他人难以从零复现构造过程。但用发布版 3000 题复现排行榜本身可行,作者也提供了逐能力、逐模型、多次运行的 std 数据便于比对。
论文图表
左侧展示现有基准(如读比赛剩余时间)需要定位+OCR+知识+推理多步协同,无法归因到单一感知能力;右侧展示 PerceptionBench 把感知拆成定位、属性、计数、关系、深度与3D 等原子子题,每题只考一项。
它点明本文要解决的核心问题——现有基准混淆感知与推理,而 PerceptionBench 通过原子拆解实现干净归因,是理解动机的关键。
热力图,行是 22 种错误类型(按全局频率排序,感知类加粗),列是 42 个基准(按主导错误类型排序)。每个基准的失败几乎只集中在一两种错误类型上,跨基准分布重叠很弱,十项感知错误几乎在所有基准中反复出现。
这是'失败驱动'主张的实证基础——定量证明没有任何小集合基准能覆盖感知失败空间,从而为从 42 个基准归纳统一分类树提供正当性。