← 返回 2026-07-30

CLBench-V:从证据定位到知识获取的多模态上下文学习评测基准 CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang 📅 2026-07-28 👍 49 2026-08-04 18:30
上下文学习 基准评测 多模态大模型 视觉问答 长文档理解

提出多模态上下文学习三级能力评测基准,最强模型总分仅0.28

前置知识

上下文学习(In-Context Learning, ICL)

一种免训练的推理范式:模型在推理时从给定上下文中提取并应用任务相关的事实、规则、流程或模式,而不是只依赖预训练参数化记忆。典型形式包括少样本示例、规则注入、新信息应用。研究显示,即便面对完全相同的上下文,不同模型在“识别相关信息、正确应用、避免用先验覆盖上下文”三项能力上差异极大,且证据使用会随输入长度、证据位置、视觉项数量而退化。

本文的核心命题就是评测“模型能否学会并利用上下文”,这是理解全篇三层能力层次的钥匙。

多模态大语言模型(MLLM/VLM)

能同时处理文本与图像(含文档、图表、地图、场景、网页截图等)的大模型,通常用视觉编码器把图像切成视觉 token 再与文本 token 拼接送入 Transformer。本文评测的 InternVL3.5-30B-A3B、Qwen3.6-27B、Qwen3.5-Plus、Doubao-Seed-2.0-Lite、Kimi-K2.6、GPT-5.4 均属此类,且普遍具备长上下文窗口。

评测对象就是多模态模型,且本文反复强调“能看图像”并不等于“能用好上下文”,这是其反直觉结论的来源。

长上下文建模(Long-context Modeling)

研究如何让模型在远超训练长度的输入上仍能有效利用证据。已知问题包括“lost in the middle”(中间证据易被忽略)、位置敏感性、干扰项密度影响等。针式测试(needle-in-a-haystack)是常用探针。本文用这类工作作对照,指出“上下文容量”与“上下文学习”是两回事:能访问长输入 ≠ 能内化上下文定义的规则。

理解这一点才能看懂作者为何把检索/感知只当作 L0 的前提,而把更高阶的能力留给 L1、L2。

杜邦分析(DuPont Analysis)

一种把净资产收益率 ROE 拆解为三个驱动因子的财务分析方法:$$\text{ROE} = \text{净利润率} \times \text{资产周转率} \times \text{权益乘数}.$$ 模型需从转换后的财报中分别定位净利润、营收、总资产、股东权益等数值,再代入上式相乘。这是本文新建的两个数据集之一(Financial Report ROE),评测 L1 新信息应用能力。

理解杜邦分解才能看懂为何财报任务被归为 L1(公式已知,仅数值是新的),以及 InternVL3.5 因超长上下文在此得 0 分的含义。

LLM-as-Judge(大模型评判)

用一个强 LLM 对开放性答案打分(语义等价判断),常输出 True/False 或 correct_count 等结构化结果。优点是能处理无标准答案的开放任务,缺点是会引入评判模型自身的偏见。本文 14 个子集中有 5 个依赖 LLM 评判,并专门用 Table 4 分析了“换评判模型分数变化多少”。

评判可靠性是本文的独立实验章节,理解它才能判断报告分数的可信区间,也是复现与横向对比的关键变量。

研究动机

现有多模态评测存在三个具体短板。其一,上下文学习评测几乎只覆盖纯文本:CL-Bench、LongBench 等让模型跟随新规则、处理陌生信息或避免依赖先验,但场景被限制在文本内;而现实里科学发现靠图表传达、财务指标散落在转换后的报告各页、空间决策依赖地图、场景与网页。其二,已有图表/文档基准(DocVQA、ChartQA)与宽泛多图套件(MMMU、MMBench、MIRBench)测的是“读字、读版式、跨域推理与证据绑定”,却把“上下文利用”当成不可分的整体,难以定位模型究竟是在视觉访问、信息误用、还是忽视上下文定义的知识上失败——这正是 Dou 等人 (2026) 指出的诊断盲区。其三,受控的视觉针测试(needle-in-a-haystack 及其扩展)虽能隔离检索在证据位置、干扰项密度变化下的表现,并揭示模型在更长上下文、更密视觉干扰下证据使用会退化,但它们只测“检索”,不测“学会”。此外,高质量上下文学习任务人工标注成本极高,现有图文指令数据虽证明系统性构造有价值,却无法保证长上下文依赖与诊断式评测。

本文的目标是本文要建立一个严格、可诊断的多模态上下文学习评测基准 CLBench-V,达成四个可衡量目标。第一,把多模态上下文学习形式化为覆盖“上下文定位—新信息应用—新知识学习”的三级能力层次,使失败可被归因到具体环节。第二,构造一个多来源基准,把转换后的公开数据集与新建的领域任务(医疗论文结论推断、财报 ROE 分析)纳入同一规范化 schema 与评测接口。第三,用统一推理与打分框架覆盖科学、金融、长文档、空间推理、网页式视觉问答等多个领域,对六个近期多模态模型做公平对比,并给出最佳总分这一可量化的“饱和度”指标。第四,额外分析 LLM 评判可靠性、上下文长度、图像数量、答案类型与典型失败模式,让读者能判断“哪个环节、在什么条件下、为什么崩”,而非只得到一个笼统分数。

与已有工作不同的是,本文的独特切入角度是把 CL-Bench“超越检索的上下文学习”动机首次系统地推到多模态场景,并补上被忽视的诊断维度。已有工作要么纯文本(CL-Bench、LongBench),要么把多模态上下文利用看成单一能力,无法区分“看到了但没用对”与“根本没看到”。CLBench-V 抓住三个被忽视的点:(1) 按上下文“贡献什么”(待定位的证据/待应用的新信息/待习得的新知识)而非按任务难度划分层次,使层次在分析上彼此独立、在因果上层层累积;(2) 选用近期医疗论文(结果进入预训练的概率低)来缓解信息泄漏,并设计截断在 Result 章节之前的评测版,迫使模型“推断”而非“复制”结论;(3) 用 Qwen3.5-Plus 做转换期拒绝采样加人工复核,在规模化与任务专属质量之间取得平衡,这是多数基准缺少的工程环节。

核心方法

直觉上,CLBench-V 像一次分层的“上下文体检”:先查模型能否“看见并锚定”证据(接地),再查能否“用对”已锚定的信息(应用),最后查能否“学会”上下文定义的新规则(知识习得)。三层是累积的——接地失败会阻断信息应用,信息应用失败会阻断知识学习——但三者分析上独立,能分别暴露不同失败模式。技术路线分三块:(1) 三级能力层次定义评测目标;(2) 两条数据流水线,即公开基准的统一转换加筛选、以及面向能力空缺的新建任务;(3) 统一推理与评分框架,对所有 14 个子集复用同一套 prompt、元数据字段、答案抽取与评测器分发,仅在答案格式不同时切换任务专属指标。层次之外还按模型侧需求、多模态操作、上下文复杂度、答案格式、评测类型等正交维度刻画任务,使“同一层次但压力点不同”的两个任务也能被区分开来。基准规模为 3,443 条实例。

核心创新是把多模态上下文学习显式拆解为按“上下文贡献什么”定义的三级层次,而非按任务难度或模态划分。L0 Context Grounding 要求定位、阅读、组合证据但不需要学新规则(如地铁图线路规划 ReasonMap、高分辨率视觉搜索 Insight-O3、体育空间智能 CourtSI);L1 New Information Application 要求用上下文提供的新事实/数值/案例,套用模型已会的推理能力(如财报 ROE 的杜邦分析、长文档 QA、网页式最终答案任务);L2 New Knowledge Learning 要求从上下文中习得新规则、新发现、新任务语义并迁移到作答(如图渲染版 CL-Bench 表格、论文结论推断)。这与已有方法的本质区别在于:以往基准要么把“上下文利用”平均成一个总分,要么只测检索/感知;而 CLBench-V 的层次设计能把“接地失败”“信息误用”“忽视上下文定义知识”三类失败分离,让诊断从“分数低”细化到“哪一步崩”。作者据此把失败归纳为六类:证据缺失、证据错绑、上下文误用、先验覆盖、归纳不全、格式失败。

方法步骤详情

完整流程分四步。第一步数据整合(Data Integration):把候选公开基准(Pix2Fact、MMLongBench、PRISMM-Bench、ReasonMap、InSight-o3、MIRBench、ZeroBench、CourtSI、BrowseComp-V3、CL-Bench 等)转为统一输入输出格式,再按四条准则筛选——视觉依赖(答案不能仅靠 OCR 文本或图像字幕解开)、低无关上下文(不让评测退化为纯长文本针搜索)、多跳偏好(优先跨区域/跨图/跨模态/跨字段绑定的组合推理,减少单跨度查找捷径)、范围排除(不含视频任务);筛选用 Qwen3.5-Plus 做转换期拒绝采样剔除可走捷径的样本,再做人工复核保留高质量样本并做归一化(嵌入选项、保留 Markdown 与图渲染两版、保留拓扑字段、把原基准假设外部检索的证据移入上下文)。第二步数据构造(Data Construction):财报 ROE 分析把 PDF 转为 Markdown 式多模态文档,要求模型按杜邦分解 $\text{ROE} = \text{净利润率} \times \text{资产周转率} \times \text{权益乘数}$ 计算;论文结论推断收集近期医疗论文,构造“含 Result 章节的参考版”生成参考结论,以及“仅到 Result 前的评测版”,测试时让模型预测论文会支持的结论,共保留 581 例。第三步评测协议:MCQ 用选项抽取加精确匹配,数值用归一化精确匹配/容差匹配/MAE,路线用核验端点、有效线路、换乘连续性的拓扑评判器,开放任务用答案抽取后做 rubric 或语义 LLM 评判。第四步打分:论文结论推断用列表级评判器估计 $N_{hit}$ 与 $N_{extra}$ 后按 $s_{paper} = \max\left(0,\, \frac{N_{hit} - N_{extra}}{N_{ref}}\right)$ 计分,扣除项惩罚过度预测。

技术新颖性

技术新颖性体现在四个对比。相对 LongBench/CL-Bench(纯文本):首次把“超越检索的上下文学习”动机系统推到多模态,覆盖文本、图像、表格、图、文档版式混合的证据。相对 MMMU/MMBench/多图套件(多模态但测参数化知识或跨域推理):刻意把必需知识放在上下文里、选用近期论文降低泄漏,使评测聚焦“学自上下文”而非“记自预训练”。相对 needle-in-a-haystack 及多模态扩展(只测检索):三级层次把检索/感知只当作 L0 的前提,重点诊断 L1 信息应用与 L2 知识习得这两类更高阶、更被忽视的能力。相对单数据集基准:统一 schema 加统一推理评分框架让 14 个子集在保留任务专属指标的同时跨层可比,且用拒绝采样加人工复核做规模化质量控制。这些差异共同把 CLBench-V 定位成一个“诊断式”而非“刷分式”基准,作者明确把它与受控记忆探针、长上下文建模工作定位为互补而非替代。

Overview of CLBench-V:多模态上下文、三级能力层次与三类常见失败模式
Figure 1: Overview of CLBench-V:多模态上下文、三级能力层次与三类常见失败模式

实验结果

在 3,443 条实例、六个多模态模型上的核心发现是:多模态上下文学习远未饱和,最强总分仅 0.2847(InternVL3.5-30B-A3B),没有任何单一模型家族逼近上限。层次拆解显示模型以截然不同的方式失败:InternVL3.5-30B-A3B 拿下最高总分、最强 L0 接地(0.3080)及最强 L2 知识(0.3536),但 L1 信息应用仅 0.1313,为全场最差,说明它能锚定证据、能习得知识,却在“应用文档专属数值”上崩盘;Qwen3.5-Plus 恰恰相反,L1 最强(0.2954)但 L0 接地最弱(0.1507);GPT-5.4 在 L2 知识上仅 0.0694,几乎学不会上下文定义的新规则。数据集层面异质性极大,没有模型通吃:Kimi-K2.6 在三个 ReasonMap 子集全夺冠(ReasonMap-Short 高达 0.6800),InternVL3.5 在 Paper Conclusion(0.4120)与 MIRBench(0.4807)领先,却因超出上下文长度在 Financial Report ROE 直接得 0.0000;Qwen3.6-27B 在 InSight-O3 拿到 0.5724 的全场最高单值。Pix2Fact、BrowseComp-V3、CL-Bench-Table、CourtSI 对全部模型都极难,最高分多在 0.2 以下,说明视觉事实接地、网页证据合成、上下文定义规则遵循、空间智能是普遍短板。评判可靠性方面,换评判模型分数变化不可忽略:Qwen3-VL-4B-Instruct 平均最高(0.2122),Qwen3-VL-32B-Instruct 最低(0.1564),相差约 0.0558。复杂度分析显示 token 长度与分数几乎无关(Qwen3.6-27B 的 Pearson $r = -0.0042$),真正决定成败的是输入是否越过模型可用上下文上限;图像数量则因模型而异——InternVL3.5 图像越多越好(剔除财报后 Spearman $\rho = 0.2317$),Qwen3.6 反而变差($\rho = -0.0402$)。

CLBench-V 按能力层次组织的当前构成
Table 1: CLBench-V 按能力层次组织的当前构成
按三级能力层次汇总的主结果
Table 2: 按三级能力层次汇总的主结果
已完成子集的数据集级结果
Table 3: 已完成子集的数据集级结果
六个被评模型的能力画像(Capability Profiles)
Figure 2: 六个被评模型的能力画像(Capability Profiles)
查看结构化数据
任务指标本文基线提升
CLBench-V 总分(Overall) sample-weighted 综合分 InternVL3.5-30B-A3B = 0.2847 其余五模型 0.1850–0.1991 最强模型也仅约 0.28,整体远未饱和
L0 Context Grounding 层次加权分 InternVL3.5-30B-A3B = 0.3080 Qwen3.5-Plus = 0.1507(最弱) 接地能力模型间差距达约 2 倍
L1 New Information Application 层次加权分 Qwen3.5-Plus = 0.2954 InternVL3.5-30B-A3B = 0.1313(最弱) L1 与 L0 冠军分属不同模型,能力互补性弱
L2 New Knowledge Learning 层次加权分 InternVL3.5-30B-A3B = 0.3536 GPT-5.4 = 0.0694(最弱) L2 模型间差距极大,GPT-5.4 几乎学不会新规则
Paper Conclusion 推断(L2) paper-level score InternVL3.5-30B-A3B = 0.4120 GPT-5.4 = 0.0792 单数据集上模型差距超过 5 倍
LLM 评判一致性(开放任务) macro 平均分 Qwen3-VL-4B-Instruct = 0.2122(最高) Qwen3-VL-32B-Instruct = 0.1564(最低) 换评判模型分数差约 0.0558,需透明披露评判者

局限与改进

作者明确承认四点局限:一是整合了异构数据源,各子集标注风格与评测协议不统一;二是部分子集规模偏小(Pix2Fact 仅 43 例、ReasonMap-Plus 仅 37 例、BrowseComp-V3 仅 57 例),应作为诊断探针而非完整任务分布来解读;三是多个开放任务必须依赖 LLM 评判,即便做了答案抽取与 rubric 设计仍可能带入评判模型偏见;四是财报任务目前只评最终 ROE 值,尚未对杜邦中间步骤完整打分。我额外观察到几点:论文自述为“初步结果”,仅六个模型,结论的统计稳健性有限;Qwen3.6-27B 同时是被评模型与主评判模型,存在评判污染嫌疑;层次归属有一定主观性(如 MIRBench 被标为 L0–L1 边界、PRISMM-Bench 标为 L1–L2 边界),且汇总时把 MIRBench 全部归入 L0、PRISMM-Bench 全部归入 L1,会影响跨层分数的解读;财报任务存在中英文混合(prompt 原为中文)的潜在影响未充分讨论。

独立分析的弱点

独立分析有三个弱点。第一,层次归属依赖人工判断、边界数据集(MIRBench 的 L0–L1、PRISMM-Bench 的 L1–L2)归属会改变汇总结论——例如 MIRBench 1063 例是全基准最大子集,把它整体塞进 L0 会让 InternVL 的 L0 分数被其 MIRBench 0.4807 强势拉高,掩盖其它 L0 任务的薄弱;改进方向是为每个实例标注一个“层次置信度”,或用消融把同一任务在多层重复打分,减少单一归属带来的归因偏差。第二,论文结论推断的打分高度依赖参考结论集的质量与完备性,且 $s_{paper}$ 的 $N_{extra}$ 惩罚可能同时压制合理但未被参考集覆盖的新颖结论,使模型倾向于保守少答;改进方向是用多位专家交叉标注参考集、并引入部分得分而非全有全无,同时报告召回与精确两条曲线。第三,评判污染与评判校准问题:Qwen3.6-27B 既参赛又当主评判,且 Table 4 显示换评判模型分数差最高达 0.0558,部分子集(如 Pix2Fact)的冠军随评判者翻转;改进方向是用与所有参赛模型不同家族的评判模型、报告多评判模型的一致率(如 Cohen's $\kappa$)而非单一分数,并补充人类基线以标定绝对天花板。第四,跨模态绑定未被单独测量,建议增加专门的“跨图实体–数值绑定”探针。

未来方向

作者提出的方向:扩充更多模型、补全杜邦中间步骤打分、校准 LLM 评判并透明披露评判模型、扩大小规模子集以增强统计稳健性。基于成果可延伸的方向:一是把三级层次推广到视频与准视频多帧推理(目前刻意排除),验证层次是否在时序场景仍成立;二是引入“层次混淆矩阵”量化失败在层间传播的因果链,例如多少 L2 错误其实源于上游 L0 接地失败;三是把 L2 知识习得与持续学习/在线学习结合,测试模型能否在多轮上下文中累积习得的知识而非每轮重置;四是构造对抗性版本(主动插入与上下文矛盾的先验诱导),量化“先验覆盖”失败的鲁棒性边界;五是用 CLBench-V 做 SFT/RL 训练信号,专门提升 L1 信息应用这一普遍最薄弱的环节,并观察提升是否会损害 L0/L2。

复现评估

代码已在 https://github.com/IamLihua/CLBench-V 开源,公开基准部分遵循原数据集用途并保留来源标注,新建任务基于公开可得的医疗论文与公开发布的企业财报。论文明确披露 AI 辅助仅用于格式转换、脚本起草、prompt 组织与初步质检,而所有基准定义、过滤标准、评测协议与论断均经作者人工复核。复现成本主要是模型 API 调用(六个模型含 GPT-5.4 与多个国产大模型)与评判模型调用(多个 Qwen3-VL 尺寸);论文给出 token 长度分布(Table 5),如财报 ROE 有 135 例落在 64k–128k、70 例超过 128k token,便于估算上下文成本,并解释了 InternVL3.5 在财报上超长得 0 的原因。论文还提供了完整的 prompt 模板(附录 B)、答案抽取与评测器脚本。整体复现难度中等:数据与代码齐全,但因任务横跨多领域、需调用多个闭源 API 且依赖 LLM 评判,逐数据集复跑成本不低,对评判模型的透明披露与多评判一致性报告是减少横向对比争议的关键。