CURV:通过课程式视觉接地推理增强图表理解 CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
课程学习框架让多模态模型内化视觉接地推理,图表问答性能提升高达20.5%
前置知识
图表问答(Chart Question Answering, CQA)
图表问答任务要求模型阅读柱状图、折线图、散点图、饼图、热力图、雷达图等各种数据可视化图表,并回答关于其中数值、趋势、比较关系的问题。它本质上是一个多模态任务,模型既要完成视觉感知(识别坐标轴、图例、数值、颜色编码),又要完成逻辑推理(比较、求和、求差、百分比、排序等)。与普通图文理解不同,CQA 对数值精度要求极高,图表中的几何结构和空间关系需要被准确解读,是衡量多模态大模型细粒度视觉理解与量化推理能力的代表性基准。
本文研究的正是 CQA 任务,理解 CQA 的特殊挑战(细粒度数值感知 + 多步逻辑推理)是理解论文为何要引入视觉接地和课程学习的基础。
多模态大语言模型(MLLM)
多模态大语言模型(如 GPT-4o、Qwen2.5-VL、InternVL3、Llama-3.2-Vision、Gemma-3)是在大规模图文数据上预训练的神经网络,能同时处理图像和文本输入并生成文本输出。它通常由一个视觉编码器(如 ViT)提取图像特征、一个大语言模型处理文本和融合后的多模态表示构成。当前 MLLM 的核心瓶颈在于:视觉感知错误是多模态推理失败的主要原因,模型常常在读取图表具体数值、定位区域时出错,导致后续推理与视觉证据脱节。
本文的所有方法都是针对 MLLM 的内在能力不足而设计的,CURV 通过微调多个开源 MLLM(Qwen2.5-VL 3B/7B、InternVL3 1B/2B/8B)来内化视觉推理能力,理解 MLLM 的工作机制与局限是读懂论文的前提。
思维链推理(Chain-of-Thought, CoT)
思维链推理指模型在给出最终答案前,先逐步生成中间推理步骤(如「先读取 A 的值,再读取 B 的值,然后求差」),再据此得出结论。CoT 已被证明能有效分解复杂问题、提升逻辑正确性。但传统 CoT 通常是「外在」的——靠提示词(prompt)激发,而非模型固有能力;且 CoT 与视觉证据之间缺乏对齐,模型可能「想一套、看一套」。本文区分了外在 CoT(extrinsic,靠提示)和内在推理(intrinsic,靠训练内化)。
本文的核心论点之一就是:外在 CoT 和外在视觉提示虽有帮助,但 MLLM 缺乏内在的视觉接地推理能力,因此需要通过课程学习把这种能力内化进模型权重。理解 CoT 的内在/外在之分是把握论文动机的关键。
课程学习(Curriculum Learning, CL)
课程学习借鉴人类「由易到难」的学习方式,让模型先在简单样本上训练,再逐步过渡到复杂样本,从而学到更稳健、更可泛化的表示。本文设计了一个三级课程:从单操作基础推理(Level 1),到多步组合(Level 2),再到多图表嵌套复合任务(Level 3),并在视觉维度上从低级图表组件逐步到高级图表结构。课程学习的难点在于如何系统地构造难度递增的数据并控制质量。
「课程式」是本文方法的标题级核心特征,CURV 通过课程学习让模型循序渐进地掌握视觉接地推理。论文还专门做了消融实验,证明在 Level 1+2 上打基础比只在 Level 3 上训练更有效。
视觉接地(Visual Grounding)
视觉接地指将文本/推理与图像中的具体空间区域建立对应关系——即让模型「指着」图像的某一部分来证明它的论断。本文设计了三种视觉接地策略:applied(把注意力掩码叠加高亮到原图相应区域)、boxed(画边界框框出区域)、cropped(裁剪出区域放大)。视觉接地把抽象推理锚定到具体视觉证据上,是消除「推理与视觉脱节」的关键机制。损失上用 IoU 变体 CIOU、GIOU 来衡量预测区域与真值区域的重合度。
「视觉接地推理」是本文方法的灵魂。CURV 的两阶段训练(Stage I 学接地、Stage II 学交错推理)以及 applied/boxed/cropped 三种接地策略的对比,全部围绕如何让推理步骤与视觉区域对齐展开。
研究动机
现有 MLLM 在图表问答上存在三个根本性缺陷。第一,分解能力不足:模型难以把复杂问题分解成连贯的推理链,常产生不一致或逻辑有误的中间步骤。第二,交错视觉推理薄弱:模型不能准确地把每个推理步骤锚定到图表的对应区域,常读错数值或关注错误区域。第三,组合能力差:模型难以把逻辑推理和视觉接地跨多步整合成交错的连贯链条,导致「感知、推理、结论」三者脱节。论文用 GPT-4o 在 CharXiv 上 60 个样本的初步实验佐证:直接作答(A 模式)准确率仅 43.33%;令人意外的是,仅给推理提示(RA 模式)反而提升 +10.00%;而把推理与人标注的视觉信息结合(RVA 模式)暴涨到 86.67%,提升高达 +43.33%。这说明模型本身缺乏逻辑分解和视觉推理能力,只有外部强加上下文才有所缓解。
本文的目标是本文的目标是把外在的 CoT 提示和外在视觉线索这两种「拐杖」,内化为 MLLM 自身固有的视觉接地推理能力,使其无需任何外部辅助就能自主完成「边看边想」。具体而言,作者希望模型能:把 CQA 重新形式化为多步视觉接地推理过程 $f_\theta : (I, Q) \rightarrow \{(R_1, V_1), (R_2, V_2), \ldots, (R_T, V_T)\} \rightarrow A$,其中每一步推理 $R_t$ 都配对一个视觉聚焦区域 $V_t$;通过两阶段课程训练,让模型逐步从单操作推理过渡到复杂多图嵌套任务;并验证这种内化能力能泛化到真实图表基准和域外多模态推理任务。最终目标是验证「动态视觉接地 + 课程学习」能系统性地、跨模型、跨规模地提升图表理解。
与已有工作不同的是,本文的独特切入角度有三点。其一,不同于以往靠提示词或外挂视觉工具(如检测器、裁剪器)来辅助的方法,CURV 通过训练把这种能力写进模型权重,实现「自包含」的视觉推理,推理时不再依赖外部辅助。其二,不同于把 CQA 当作端到端映射 $f_\theta : (I, Q) \rightarrow A$ 的做法,CURV 显式建模「推理步—视觉区域」的交错对齐,并用专门的接地损失(CIOU/GIOU)监督。其三,不同于单一难度训练,CURV 引入系统化课程学习(CCQA 数据集,三级课程、五种细粒度层级、7 种图表类型、30 个领域类别),并辅以元学习式数据构造(每张基础图生成大量 query-reason-ground-answer 四元组),强制模型学可迁移的视觉推理技能而非记忆具体外观。
核心方法
CURV 的整体思路是:受人类认知启发——人类会把复杂多模态问题分解成逐步推理链,每一步都伴随着对图像相应区域的动态视觉聚焦,再把这些接地步骤组合成连贯解。技术路线上,CURV 把 CQA 重新形式化为多步视觉接地推理 $f_\theta : (I, Q) \rightarrow \{(R_1, V_1), \ldots, (R_T, V_T)\} \rightarrow A$,其中 $R_t$ 是第 $t$ 步自然语言推理,$V_t$ 是锚定该步的视觉区域。它是一个两阶段课程学习框架:Stage I(视觉接地 RV)让模型学会预测每步推理对应的视觉聚焦区域;Stage II(交错视觉推理 RVA)让模型把上一步产生的视觉聚焦应用到原图上构造「接地视觉状态」$I_t$,并把它作为下一步推理的额外视觉输入,从而动态调整视觉注意力。整个框架配合 applied/boxed/cropped 三种视觉接地策略和三级课程数据(CCQA)共同实现。
核心创新在于把「外在辅助」转化为「内在能力」,并通过显式的视觉接地作为推理与视觉之间的桥梁。与已有方法的本质区别有三:第一,传统 MLLM 学的是端到端映射 $f_\theta : (I, Q) \rightarrow A$,缺乏中间推理结构和动态视觉锚定;CURV 则显式监督每步推理的视觉区域,把接地作为中间对齐信号而非终极目标(论文专门做了显式 vs 隐式接地的消融,显式接地高出 +8.78%)。第二,CURV 设计了两阶段课程,Stage I 先单独把「接地」学会,Stage II 再学「接地辅助下的交错推理」,形成由易到难的能力栈。第三,CURV 引入了系统化的课程数据生成(CCQA),通过模板化合成保证标注精度,并用元学习范式对每张图生成大量不同任务,避免视觉过拟合,强调可迁移的推理技能。
方法步骤详情
方法分六步。第一步,形式化:给定图表 $I\in\mathbb{R}^{H\times W\times C}$ 和问题 $Q$,输出交错链 $\{(R_t,V_t)\}_{t=1}^{T}$ 与答案 $A$。第二步,Stage I 视觉接地:模型预测第 $t$ 步推理 $R_t$ 的视觉聚焦 $V_t=f_\theta^{(S1)}(I,Q,\{R_{t'},V_{t'}\},R_t)$,损失 $L^{(S1)}=\sum_t L_V(V_t,V_t^*)$。第三步,Stage II 交错推理:把 $V_t$ 应用到 $I$ 得接地视觉状态 $I_t$(applied/boxed/cropped),生成 $(R_t,V_t)=f_\theta^{(S2)}(I,Q,\{R_{t'},V_{t'}\!\rightarrow\!I_{t'}\})$,目标 $L^{(S2)}=\lambda_R\sum_t L_R+\lambda_V\sum_t L_V+\lambda_A L_A$。第四步,接地实现:applied 掩码高亮、boxed 画框、cropped 裁剪放大。第五步,CCQA 课程:图表分解为低级组件,覆盖 7 类图表、30 领域、3 级课程与 5 个层级,GPT-4o 生成绘图数据,每张图经模板实例化生成大量四元组以鼓励迁移。第六步,训练范式可选 SFT/RL/二者组合,推理时自回归输出推理步、聚焦与答案。
技术新颖性
技术新颖性体现在五点。第一,首次把 CQA 系统地重新形式化为多步视觉接地推理,并设计两阶段课程把接地能力从「外在工具」内化为「模型固有能力」,显式接地的消融证明它比隐式接地高 +8.78%。第二,提出可扩展的合成 CQA 数据生成方法,通过模板把所有图表特定特征替换为绘图数据,保证标注精度,并能系统化控制推理深度 $D$(嵌套函数 $f_1(f_2(\ldots(f_D(x))))$ 的最大层数)和推理步数 $T$。第三,构建 CCQA 数据集,支持 4 种生成模式、3 种视觉接地策略、5 个细粒度层级和多级评估指标,填补了课程式图表推理数据的空白。第四,提出应用型接地(applied)优于边界框(boxed)的发现——后者看似直观但收益反而不及直接掩码高亮;cropped 在分辨率降低 16 倍的情况下仍能取得 +7.93%(acc@MLLM)和 +9.92%(acc@0.0)的提升,展现了聚焦放大的潜力。第五,框架兼容 SFT、RL 及二者组合,CURV 应用到 RL 上获得 +12.58% 提升,SFT+RL 组合进一步提升到 +17.04%,兼顾了性能与计算开销权衡。
实验结果
核心发现:其一,CCQA 上 CURV 微调模型 6 个指标持续领先:单阶段最高 +14.85%、两阶段最高 +20.92%;CURV@Applied(Qwen2.5-VL-7B)比基础模型高 +15.65%、比 GPT 模型高 +12.22%。其二,仅单图($D<3$)训练即迁移到多图($D\geq3$),Qwen2.5-VL-7B +7.10%。其三,真实基准持续泛化,如 Applied(InternVL3-8B)ChartQA 78.28(基线 74.56)、CharXiv 40.20(基线 24.30)、ChartMuseum 26.23(基线 15.02),四项基准均 $\geq$+1.20%。其四,域外(MathVista/MMMU-Pro)最高 +10.20%,如 InternVL3-8B MathVista 75.37(基线 68.80)、MMMU-Pro 30.81(基线 16.36)。其五,RL +12.58%、SFT+RL +17.04%、显式接地优于隐式 +8.78%;多图定位 +4.68%、关系 +2.42%;基础学习(Level 1+2)更均衡。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| CCQA 课程图表问答(自建基准) | acc@MLLM 及多级 acc@X | CURV@Applied(Qwen2.5-VL-7B)两阶段 Level 1 acc@MLLM 69.86、acc@0.0 66.79 | Qwen2.5-VL-7B 基础模型 Level 1 acc@MLLM 54.21、acc@0.0 50.79;GPT-4o 57.64 | 两阶段训练绝对提升最高 20.92%,比基础模型高 +15.65%,比 GPT 模型高 +12.22% |
| CharXiv 推理子集(真实图表) | acc(百分比) | Applied(InternVL3-8B)40.20 | InternVL3-8B 基础模型 24.30 | +15.90 个绝对百分点 |
| ChartQA(真实图表问答) | acc(百分比) | Applied(InternVL3-8B)78.28 | InternVL3-8B 基础模型 74.56 | +3.72 |
| ChartMuseum 视觉子集 | acc(百分比) | Applied(InternVL3-8B)26.23 | InternVL3-8B 基础模型 15.02 | +11.21 |
| MMMU-Pro(域外多模态推理) | acc(百分比) | Applied(InternVL3-8B)30.81 | InternVL3-8B 基础模型 16.36 | +14.45(域外整体最高 +10.20%) |
| CQA 初步分析(GPT-4o) | acc(百分比,CharXiv 60 样本) | RVA 模式 86.67 | A 模式 43.33 | +43.33 |
局限与改进
局限性有几方面。其一,训练数据完全为合成数据(CCQA 用模板生成),与真实图表分布仍有差距,泛化上限受限于 7 类图表、30 个领域的覆盖。其二,模型规模受限,最大仅微调到 7B/8B,未在更大模型(如 70B)上验证课程范式是否持续收益。其三,多图(Level 3)性能绝对值仍偏低($\leq$42.54%),与单图(最高 80.43%)差距大,跨子图组合推理仍是难题。其四,cropped 接地受限于放大分辨率与计算开销权衡(分辨率降 16 倍),applied 与 boxed 在不同图表类型上效果不稳定(雷达图收益最低),三种策略缺乏自适应选择机制。其五,评估依赖 MLLM-as-judge(GPT-4.1-mini)可能引入偏差,规则判官对开放性答案仍有限制。我的观察:论文未在主文报告训练计算量、超参数,未明确权重与数据是否开源(仅给项目主页),且课程「5 个层级」「30 个领域」的具体定义散落附录,主文可读性受限。
独立分析的弱点
第一个弱点是合成数据对真实图表的覆盖不足。CCQA 仅含 7 类图表、30 个领域,真实世界图表的样式、配色、标注、噪声远比合成丰富。改进方向是用真实图表增强训练数据,或引入风格迁移/数据增广,并补充更多图表类型(如桑基图、树图、地理图)。第二个弱点是接地策略选择缺乏自适应性。applied/boxed/cropped 在不同图表类型上效果不一(雷达图普遍最差),但模型无法按场景切换。改进方向是训练一个路由器根据图表类型和推理步动态选择接地策略,或设计可学习的统一接地机制。第三个弱点是跨多图组合推理能力仍弱(Level 3 $\leq$42.54%)。改进方向是专门设计多图课程与跨子图注意力机制,强化对分散视觉证据的关系建模。第四个弱点是模型规模与算力验证不足,仅到 8B,且 RL 与 SFT 的算力开销权衡(Table 8)显示 RL 收益伴随高开销。改进方向是在更大模型上验证扩展律,并探索更高效的 RL 变体(如离线 RL、奖励 shaping)。第五个弱点是评估对 MLLM-as-judge 的依赖与潜在偏差。改进方向是发展更鲁棒的规则评估与人工评估结合的多维体系。
未来方向
作者明确提出 CURV 为开发 MLLM 自包含视觉推理能力奠定了基础,未来可从外在辅助全面走向内在接地视觉推理。基于本文成果可延伸的方向包括:第一,将课程式视觉接地推理扩展到图表之外的更多模态(如文档理解、科学图示、UI 理解、视频推理),验证动态视觉接地的普适性。第二,把 applied/boxed/cropped 升级为可学习/自适应的统一接地模块,避免人工策略选择。第三,研究更强的多图与长程组合推理课程,专门攻克 Level 3 的跨子图瓶颈。第四,探索 CURV 与更大模型(数十亿到千亿参数)的扩展律,以及在更高效 RL(如 GRPO、离线 RL、过程奖励)下的表现。第五,把视觉接地能力与工具使用(如检索、代码执行)结合,让模型在需要时调用外部裁剪/检测工具辅助推理。第六,将 CCQA 的合成范式推广到自动生成任意领域的课程数据,降低人工标注成本。第七,研究显式视觉接地是否能改善模型可解释性与可信度(如让模型给出可审计的视觉证据链)。
复现评估
复现性中等偏上但有关键缺口。论文提供项目主页 https://xhguo7.github.io/CURV/ 并称代码可用,但主文未给训练超参数(学习率、批量、步数、$\lambda_R/\lambda_V/\lambda_A$ 取值)、GPU 类型与训练时长,这些散落附录(§G.1、§C)。CCQA 设计原则(7 类图表、30 领域、3 级课程、5 层级、模板实例化)描述较完整,理论上可复现合成流程,但领域清单与 GPT-4o 生成提示词需查附录。评估协议透明:同时给出 acc@MLLM(GPT-4.1-mini 判官)、acc@range(规则判官,含 acc@0.0/0.05/0.1/0.2 四档)、微观指标(ROUGE-L、BLEU、METEOR、BERTScore、余弦相似度)及 IoU 变体(CIOU/GIOU)。模型选择覆盖 5 个基础模型(Qwen2.5-VL 3B/7B、InternVL3 1B/2B/8B),实验充分。完整复现需附录细节与开源配合,微调 7B/8B 需相当算力。
论文图表
图展示了从「外在辅助」到「内在视觉接地推理」的范式转变。左侧描绘传统 MLLM 依赖外在 CoT 提示和外在视觉线索(如人工标注区域)来回答图表问题;右侧描绘 CURV 的目标——模型内化这两种能力,能够自主地随着推理动态地在图像的目标区域间切换焦点,形成视觉接地推理链。它形象地说明了人类受认知理论启发的解题方式:分解、逐步接地、组合。
这张图是理解整篇论文动机的钥匙。它一句话点明了 CURV 的核心主张:把外在的「拐杖」内化为模型固有能力,是论文所有方法设计的出发点。
图展示在 CCQA 1800 个样本(均匀分布于 $D_1, D_2, D_3$ 三个推理深度)上,GPT-4o(上)和 Qwen2.5-VL-7B(下)在四种模式下的表现。即便课程难度递增($1\leq D\leq 3$),配上推理或视觉辅助都能提升性能,二者结合时提升最大,一致印证「外在辅助通过结构化推理与视觉接地增强图表理解」。
这张图把初步分析从 CharXiv 推广到自建 CCQA 并覆盖多个推理深度,进一步巩固了核心假设:MLLM 可以通过视觉接地推理内化这些能力,为后续 CURV 方法做铺垫。