← 返回 2026-08-17

通往通用科学人工智能之路:科学图像的多模态理解 A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden 📅 2026-08-14 👍 4 2026-08-22 18:30
基准数据集 多模态AI 数字图书馆 材料科学 科学图像理解 视觉问答

以ALD/E-ImageMiner基准为支点,规划科学图像多模态理解的长期评测路线图

前置知识

原子层沉积/刻蚀(ALD/E)

一种逐循环进行的表面自限性薄膜技术:交替通入前驱体脉冲、吹扫与反应步骤,每个循环只沉积或去除约一个原子层,因此循环数可精确控制膜厚。相关文献图表密集呈现每循环生长量(GPC/EPC)、脉冲时序、工艺窗口、XRD/光谱与结构-性能关系。

本文基准的1,951张图全部取自ALD/E实验与仿真出版物,VQA问题围绕前驱体暴露、吹扫、外延关系等领域概念设计,不懂ALD/E就无法理解四个问题家族的划分逻辑。

视觉语言模型(VLM)

将视觉编码器与大型语言模型连接的模型,把图像转化为token后与文本联合输入语言模型,从而支持看图描述、图表问答等任务,代表如GPT-4V、Gemini、LLaVA系列。典型失败模式包括误读坐标轴与图例、幻觉或遗漏密集图中的数据点、忽视空间关系。

本文讨论的评测对象正是VLM在科学图像上的能力边界;论文引用MaCBench、MAC等结果说明通用VLM的性能并不能可靠迁移到科学图表。

视觉问答(VQA)与Bloom分类法

VQA要求模型根据图像回答自然语言问题。Bloom教育目标分类法(修订版)把认知深度分为记忆、理解、应用、分析、评价、创造六级,原本用于课程与试题设计。本文把它借作科学VQA的问题设计脚手架,并明确声明不假设模型计算等价于人类认知。

理解Bloom分类法才能明白作者为何把问题分为四大家族、为何向'创造'层级扩展是路线图的高潮,这是全文方法论的核心框架。

图表转表格与科学图像基准

图表转表格要求模型把散点图、折线图还原为结构化数值表,评价指标如RCLS检查数值坐标、轴标签与系列标签的对应关系。现有基准FigureQA、DVQA、PlotQA多为程序化合成图表,ChartQA虽有20,882张真实图表但来自网络的经济/社会可视化,与科学出版物的谱图、显微图、工艺示意图差异巨大。

论文正是瞄准通用图表基准与科学图像之间的空白提出领域基准,了解这一脉络才能理解其差异化定位。

研究动机

科学文献中的图表与表格承载着最核心的实验证据,但对数字图书馆和多模态AI系统而言,它们长期只是'不可区分的图像对象',无法被索引、检索和机器推理。近年通用视觉语言模型虽然在自然图像描述和VQA上表现出色,但在科学图表上表现不均衡:MaCBench评测显示模型在实验室器材识别、直接数值提取上很强,但涉及空间推理、跨模态综合、多步推断时性能显著下降;MAC基准(基于期刊封面故事构建)表明模型严重依赖文本线索,移除后性能骤降;GPT-4V等模型甚至难以在较简单场景中可靠绑定物体、属性与空间关系。材料科学图表转表格研究(PolyCompChartIE、MetalThermoChartIE)更直接地暴露了问题:先进模型能识别坐标轴、图例和总体趋势,却在标记密集、含拟合曲线的散点图中幻觉或遗漏数据点,数值保真度差。此外ChartInsights揭示细粒度图表分析薄弱,FlowLearn显示流程图任务表现波动大。这些缺陷制约了结构化实验数据抽取、证据检索、视觉文献综述与科学问答等应用。

本文的目标是本文是一篇愿景/展望论文(ICDAR 2026竞赛的姊妹篇),目标是借助ALD/E-ImageMiner基准与竞赛的组织经验,为未来的科学图像挑战赛回答两个问题:应该测量什么能力、评测范围应如何演进。具体包括四件事:第一,剖析基准的四个任务(图分类、数据表抽取、摘要、VQA)如何探测从视觉定位、定量读取到领域推理、证据论证的递进能力;第二,介绍基于Bloom修订分类法的问题设计方法论;第三,提出把'从图像获得科学概念理解'确立为多模态AI与数字图书馆的长期基准目标;第四,规划图类型与学科领域扩展、情境化解释、跨面板/跨文档综合、假设评估、溯源、不确定性、反事实锚定与开放式多模态研究等未来方向,把ICDAR 2026挑战连接到可验证多模态科学AI的更宏大议程。

与已有工作不同的是,现有工作的空白在于三个层面的脱节。其一,图表理解基准(FigureQA、DVQA、PlotQA、StructChart/SimChart9K、ChartQA)以合成或通用网络图表为主,与科学出版物中的专业图形(谱图、显微镜图、分子/反应图、工艺流程、装置示意图、复合面板)差异巨大;材料科学方向虽有PolyCompChartIE等,但局限于散点图转表格。其二,科学VLM评测(MaCBench、MAC、GPT-4V绑定问题研究、ChartInsights、FlowLearn)揭示了弱点,但缺少在同一批领域专家标注图像上对多种能力的联合评测。其三,数字图书馆系统(如结合Open Research Knowledge Graph的ORKGEx)虽然引入了视觉-语言方法,但对领域特定解释、面板级定位、数值保真抽取的支持仍然有限。本文的独特切入是:不提出新模型,而是以专家标注、领域锚定的ALD/E基准为测试床,把模糊的'理解'分解为可独立评分的能力谱系,用Bloom问题设计系统化,再给出连接科研全生命周期(文献发现→证据综合→假设→实验→评估)的路线图。

核心方法

直觉上,科学图像理解应是一条'看见→读取→理解→推理→论证'的递进阶梯,而不是单一的看图说话。本文的'方法'是基准与评测设计:ALD/E-ImageMiner包含来自205篇ALD/E实验与仿真出版物的1,951张图,组织为49个图类别(折线/多折线图、谱图、散点图、热图、分子结构与反应图、能带图、装置图、工艺流程图、复合图像面板等),标注四大互补任务——任务1图分类(识别信息载体形式)、任务2数据表抽取(以结构与数值保真恢复定量关系)、任务3摘要(提炼图的中心科学信息)、任务4 VQA(从视觉感知向领域锚定科学推理的显式跃迁)。VQA刻意采用Bloom修订分类法作为问题设计脚手架,围绕四个领域问题家族展开,配以yes/no、事实型、列表、段落四种答案格式,既能测精确识别也能测显式推理。数据准备上用MinerU从每篇出版物抽取结构化文本与高分辨率图,复合图的每个子图人工关联面板字母并用机器可读边界框 $(x, y, width, height)$ 定位,使注释、视觉输入与评测确定性地指向同一面板。

核心创新是把'科学概念理解'这一模糊目标操作化、可评分化。与以物体识别或直接查表为主的通用VQA数据集本质不同,本文有三点关键设计。第一,能力递进映射:四个任务分别探测表示形式识别、定量结构恢复、中心信息提炼、领域推理,构成对'理解'的互补且独立可评的操作化探针。第二,Bloom知情的问题设计:问题分为过程导向、比较/趋势、结构-性能、应用/性能四大家族,同一张图可支撑从记忆/理解级的事实问题到分析/评价级的因果与判断问题(例如'为什么吹扫步骤必要'需要理解+分析,'改变脉冲条件会怎样'需要应用),作者明确声明这只是问题设计框架、问题家族与Bloom层级并非刚性对应。第三,面板级机器可读锚定:每个子图标注字母与边界框(如示例中面板b为(623, 40, 508, 436)像素),问题可以配合裁剪区域一起提供给VLM;作者诚实说明不假设边界框本身能提升模型性能,其价值在于让注释、输入与评测始终指向预期的目标区域。

方法步骤详情

完整流程分五步。第一步,文档解析:用MinerU抽取每篇出版物的结构化文本与高清图,全文与图题存入content.json,图与注释分目录组织。第二步,面板定位:复合图各子图人工关联面板字母,用机器可读边界框 $(x, y, width, height)$定位,如示例面板a为(15, 55, 597, 392)、b为(623, 40, 508, 436),与面板相关的问题可连同裁剪区域呈现给模型。第三步,分类注释:为每个面板标注49类中的图类型,示例中a为分子结构图、b为极坐标玫瑰图、c-d为谱图、e为堆叠谱图。第四步,任务注释:生成数据表抽取目标与摘要,按四个问题家族与四种答案格式设计VQA问题,如'能否在蓝宝石上外延生长 $\\mathrm{PbI_2}$?'(是/否)、'为何在 $25.95^\circ$ 测量极图?'(段落式,涉及 $\mathrm{PbI_2}$ 与蓝宝石的不对称反射及外延取向关系)、'什么暗示薄膜无序?'(事实型,FWHM $=13^\\circ/9^\\circ$ 的β/α扫描)。第五步,评测发布:配套提交指南与官方评测脚本,经Codabench四个榜单持续评分。

技术新颖性

本文不训练模型,其新颖性在评测学层面。首先,它是ALD/E领域首个专家标注、领域锚定、覆盖49类异质图型的科学图像基准的愿景延伸,相比ChartQA的网络图表或PolyCompChartIE的单一散点图类型,覆盖了科学证据编码的多种视觉语言(轴与图例、谱峰、化学记号、空间关系、领域视觉惯例)。其次,Bloom分类法作为问题设计脚手架是明确的方法论贡献——它不是把问题粗分为易/难,而是按认知操作(记忆/理解/应用/分析/评价,未来扩展到创造)组织,并诚实地承认问题家族与Bloom层级非刚性对应。第三,面板级边界框提供'注释-图像-评测'三方一致的确定性锚定,并定位为机器可读的证据定位机制而非性能提升手段。第四,提出结构化'认识记录'(证据-假设-检验-修订的显式链接)替代不可靠的自由链式思考,以及反事实扰动(删除面板、篡改数值、交换标签、加入矛盾证据)来检验模型是否真正锚定于证据——这直接针对'解释可能不忠实'(unfaithful explanation)这一已知问题,评测思想对所有科学VLM研究都有普遍借鉴价值。

Reproduced from Figure 3 in Mattinen et al., Van der Waals epitaxy of continuous thin films of 2D materials using atomic layer deposition in low temperature and low vacuum conditions. The ALD/E-ImageMiner classification annotations identify (a) a molecular structure diagram, (b) a polar chart (rose chart), (c-d) spectra charts, and (e) a stacked spectra chart. The figure also supports domain-grounded questions concerning epitaxial growth, crystallographic orientation, and disorder in PbI2 films grown on sapphire.
Figure 1: Reproduced from Figure 3 in Mattinen et al., Van der Waals epitaxy of continuous thin films of 2D materials using atomic layer deposition in low temperature and low vacuum conditions. The ALD/E-ImageMiner classification annotations identify (a) a molecular structure diagram, (b) a polar chart (rose chart), (c-d) spectra charts, and (e) a stacked spectra chart. The figure also supports domain-grounded questions concerning epitaxial growth, crystallographic orientation, and disorder in PbI2 films grown on sapphire.

实验结果

必须说明:本文是愿景论文,未报告新的模型实验或竞赛成绩(参赛系统成绩见同期ICDAR竞赛报告),其'结果'体现在基准资产与设计示范。核心交付:发布含205篇出版物、1,951张图、49个类别的专家标注数据集(HuggingFace: SciKnowOrg/ALD-E-ImageMiner);四个Codabench榜单(12901/12902/12908/12909)无限期开放;评测脚本与提交指南开源。概念性验证来自多头面板示例(源自Mattinen等人的 $\\mathrm{PbI_2}$/蓝宝石外延工作):五个面板a-e分别标注为分子结构图、极坐标玫瑰图、两张谱图、堆叠谱图;四个标注问题覆盖三个问题家族与三种答案格式,涉及 $25.95^\\circ$ 极图测量原因、FWHM $=13^\\circ/9^\\circ$ 的β/α扫描揭示的面内/面外无序、面内XRD确认不存在 $30^\\circ/90^\\circ$ 畴等领域推理,并示范了Bloom'创造'层级的Eu-HQA FRET工作流设计题。这证明'面板级标注+边界框+多家族问题'可把复杂科学图变成可机读、可评测的对象。

Panel-level bounding boxes for Figure 1.
Table 1: Panel-level bounding boxes for Figure 1.
查看结构化数据
任务指标本文基线提升
任务1:图分类 分类准确率(49类) 未报告(愿景论文,参赛系统成绩见ICDAR 2026竞赛报告) 通用图表基准模型 首次提供ALD/E领域49类异质科学图像的专家标注分类评测,Codabench榜单12901持续开放
任务2:数据表抽取 结构与数值保真度 未报告(愿景论文) ChartQA/PolyCompChartIE类抽取基线 面向密集标记、拟合曲线、多系列的真实科学图,强调数值保真而非泛化趋势描述,榜单12902
任务3:摘要 摘要质量(自动+人工) 未报告(愿景论文) 通用图表描述模型 要求提炼图的中心科学信息而非转录,榜单12909
任务4:视觉问答(VQA) 按问题家族与答案格式的准确率 未报告(愿景论文) 通用VQA数据集(FigureQA/DVQA/PlotQA/ChartQA) 首次引入四个领域问题家族×四种答案格式的Bloom知情设计,含面板级边界框锚定,榜单12908

局限与改进

作者坦承的局限:边界框并非用来提升模型性能,只提供确定性的证据锚定;Bloom问题家族与认知层级并非刚性对应,同一张图可支撑不同层级的问题;竞赛结果不在本文呈现。我的补充观察:第一,领域单一——全部来自ALD/E文献,向其他材料子领域乃至化学/电子/生物医学工程迁移时标注成本高;第二,许可是混合权利、非商业,图图像沿用源出版物条款且刻意排除PDF,无整体开放许可,限制了训练用途与再分发;第三,VQA段落式答案的自动评分困难,论文提出要评价'科学连贯性'却未给出具体指标设计;第四,路线图中的假设评估、反事实锚定、开放式'影子挑战'均停留在概念阶段,无试点实验验证其可行性与评分协议;第五,1,951张图相对通用基准规模偏小,且本文未披露四个问题家族的实际问题数量分布与任何模型基线成绩,定量图景需回溯竞赛报告。

独立分析的弱点

具体弱点与改进方向:1)标注瓶颈:领域专家标注205篇文献的1,951张图已耗多人月(12位作者中10位专职标注),扩展到SEM/TEM/相图/电路图等新图型不可持续;可探索专家标注+大模型预标注+人工校验的半自动流水线,并公布标注者间一致性指标。2)评分可靠性缺失:段落答案与开放式研究提案依赖专家评审,难以大规模自动化;应开展LLM-as-judge与人工评审的校准研究,公开评分细则。3)反事实与'创造'任务无实现细节:删除面板、篡改数值的扰动生成器,以及评估工作流'阶段完整性/排序/可行性'的指标均未定义;可先在50-100张图上做小规模试点并发布协议。4)跨文档综合需要全文与实验条件,但语料不含PDF(版权原因),使跨文档任务难以第三方复现;可推动与出版商协商或改用开放获取子集。5)透明度:未披露各问题家族/答案格式的样本分布与模型在此之上的表现差异,建议随数据集发布问题级元数据,便于按Bloom层级诊断模型短板。

未来方向

作者提出的方向:向Bloom'创造'层级扩展——要求模型在显式约束下设计科学上合理的工作流或材料方案(如Eu-HQA FRET应用的三步ALD/MLD流程),评估要素覆盖、排序、可行性与对缺失信息的处理;图型与领域扩展——材料科学内先扩展薄膜合成与表征、半导体工艺、二维材料、催化、电化学/电池、光伏、聚合物、陶瓷、复合材料,再进入化工(反应器/流程图)、电子工程(电路/时序图)、机械航空航天(应力场/仿真/CAD)与生物医学工程;分子与Markush结构图转SMILES/CXSMILES以支持程序化结构检索;情境化解释任务(区分图中可见、文中报告、需领域知识的结论);假设形成-判别检验-证据修订任务与结构化认识记录;跨面板/跨文档综合与处理-结构-性能网络构建;反事实锚定、溯源(要求答案引用支持面板/边界框/数值/段落)与证据不足时弃权;开放式多模态'影子挑战'(以未发表或保留研究的文献集为材料评估AI代理)。基于此可延伸:与学术知识图谱和语义检索生态集成,构建可检索的视觉证据库;把数值保真与证据引用作为强化学习的奖励信号训练VLM。

复现评估

复现条件很好:数据与标注在GitHub(sciknoworg/ALD-E-ImageMiner)与HuggingFace(SciKnowOrg/ALD-E-ImageMiner)公开,含图图像、机器可读注释与元数据、content.json结构化文本、官方评测脚本与提交格式指南;四个Codabench榜单(12901/12902/12908/12909)无限期开放,可直接提交评测。项目由德国研究基金会DFG资助(Grant ID: 460234259,NFDI4 DataScience倡议)。注意点:注释与元数据为CC BY 4.0,但图图像沿用各自源出版物的权利条款,混合权利、非商业,无整体开放许可,再分发需逐图核对来源,PDF被刻意排除;数据准备依赖MinerU抽取文本与图。算力需求低——本文本身无模型训练,复现四任务评测只需VLM推理级算力(单卡即可)。总体而言,复现'基准使用与任务评测'容易(开源脚本+公开榜单),复现'数据集扩展/再标注'则受版权与专家标注成本限制,难度中等偏高。