← 返回 2026-08-04

ICDAR 2026 原子层沉积/刻蚀(ALD/E)科学图表信息抽取竞赛 ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

Fahad Ahmed, Sören Auer, Jennifer D'Souza 📅 2026-07-29 👍 5 2026-08-09 18:30
ALD/ALE 信息抽取 基准数据集 多模态大模型 科学图表理解 视觉问答

首个 ALD/E 科学图表理解基准与竞赛,揭示多模态模型在数据抽取与推理上的瓶颈

前置知识

原子层沉积/刻蚀(ALD/ALE)

ALD(Atomic Layer Deposition)与 ALE(Atomic Layer Etching)是半导体制造与材料科学中的底层技术,能在原子尺度精确控制薄膜沉积或材料去除,是先进电子与纳米器件的核心工艺。本论文所有图表均来自 ALD/ALE 研究文献,包含能带图、相图、光谱图、反应机制图等高度专业化的科学可视化。

理解本文必须知道数据来源为何高度专业化:通用图表数据集无法覆盖这些域内语义,这也是论文提出新基准的根本动机。

大型视觉语言模型(LVLM)

LVLM 是能同时处理图像与文本的多模态大模型,如 Qwen2.5-VL-7B-Instruct、Qwen3.5-9B、GLM-4.6V-Flash、Intern VL 3.5 8b 等。它们将视觉编码器与语言模型对齐,可执行图像描述、分类、问答等任务,但在需要精细数值读取与领域推理的科学图表上表现受限。

本文评测的全部基线与参赛方法都建立在 LVLM 之上,理解其能力边界是解读各任务结果的前提。

LoRA / QLoRA / DPO / GRPO

LoRA 通过低秩矩阵实现参数高效微调;QLoRA 在此基础上引入量化以进一步节省显存。DPO(Direct Preference Optimization)利用偏好对(含难负样本)直接对齐模型输出;GRPO(Group Relative Policy Optimization)是一种基于组相对优势的强化学习对齐方法。这些是参赛团队提升 LVLM 在下游任务表现的主流技术。

前 5 名方案几乎都组合使用了 SFT+LoRA/DPO/GRPO,不懂这些技术就无法理解方法差异与得分差距来源。

ROUGE / BERTScore / TEDS / RMS

ROUGE-1/2/L 基于词 n-gram 重叠评价生成文本;BERTScore-F1 用预训练模型嵌入计算语义相似度;TEDS(Tree Edit Distance Similarity)通过树编辑距离衡量结构化表格相似度;RMS(Relative Mapping Similarity)评估图表数据点的相对映射一致性。这四类指标分别用于总结、VQA、数据抽取任务。

四个任务的最终排名分都是这些指标的加权组合,掌握其定义才能解读各榜单得分含义。

Fleiss' Kappa(标注一致性)

Fleiss' Kappa 衡量多名标注者在分类任务上的一致性,取值范围 $[-1, 1]$,0.4–0.6 为中等一致。本文在 5 篇共享论文上测得 $\kappa = 0.46$,说明标注质量属中等水平。

标注一致性直接决定基准的可信度上限,是评估该数据集能否支撑可靠评测的关键。

研究动机

当前多模态 AI 在自然图像上表现优异,却在科学图表上严重失能,根本原因是缺乏领域专用数据集与配套的推理能力。已有的 ICDAR 科学图表理解竞赛虽有贡献,却无法完整刻画端到端真实场景;通用图表数据集要么聚焦真实世界要么使用合成数据,而材料科学领域的数据集在规模、量化图表数量与任务设计上都十分有限。这种空白导致没有大规模、专家审校的数据集能够支撑对真实领域科学图表进行端到端多模态推理的系统评测,研究者无法可靠回答“现有多模态模型到底有多理解科学图表”这一关键问题。

本文的目标是本文目标是构建首个面向 ALD/E 材料科学的端到端科学图表理解基准 Sci-ImageMiner,并依托 ICDAR 2026 举办社区竞赛,系统回答三个研究问题:RQ1 现有多模态模型对领域科学图表的理解与推理能力如何;RQ2 哪些方法能显著提升模型能力;RQ3 哪些任务即便对 SOTA 模型也最具挑战。为此团队从 205 篇文献中收集 1,951 张图表,设计 4 个递进任务(分类、数据抽取、总结、VQA),并招募 68 名参赛者提交 1,263 份评测结果。

与已有工作不同的是,本文的独特切入在于三点结合:第一,首次专门面向 ALD/E 这一高度专业化领域,覆盖实验与仿真两类研究;第二,由 10 名具有硕博至博士后资质的领域专家完成标注,并以 Bloom 修订分类法指导 VQA 设计,使问题从过程导向、比较/趋势、结构-性质到应用/性能逐层加深;第三,支持子图级边界框标注与统一 JSON Schema,并把分类→数据抽取→总结→VQA 串成端到端管线,而非孤立评测单一任务。这种“领域深度 + 专家质量 + 端到端递进”的组合在已有基准中是缺失的。

核心方法

整体思路是“以高质量专家数据集驱动社区竞赛,再用竞赛结果反演模型瓶颈”。技术上分两条线:数据线用 MinerU 从 205 篇 PDF 中抽取结构化 JSON 文本与高分辨率 JPEG 图表,并建立 49 类图表分类法;标注线先由 Qwen2.5-VL-7B-Instruct 对分类、数据抽取、总结三任务做自动预标注,VQA 则完全留给人工以保证推理质量,10 名专家每人负责 25 篇、共享 5 篇用于测 IAA(Fleiss' $\kappa = 0.46$)。竞赛在 CodaBench 上为每个任务单独开赛道,2026 年 1 月 9 日开发阶段启动、3 月 16 日进入评测、4 月 8 日截止,共收到 68 名参赛者、1,263 份提交。

核心创新是“递进式端到端任务设计”:四个任务并非互相独立,而是按照认知难度逐级提升——分类(语义归类)→ 数据抽取(精确数值还原)→ 总结(高层语义压缩)→ VQA(领域推理)。各任务评测指标按公式加权,例如 Task 2 为 $\frac{1}{2}(\text{RMS}) + \frac{1}{2}(\text{TEDS})$,Task 3 为 $\frac{1}{2}\cdot\frac{R_1+R_2+R_L}{3} + \frac{1}{2}(\text{BERTScore-F1})$,Task 4 为 $\frac{1}{4}(\text{Paragraph}) + \frac{1}{4}(\text{Factoid}) + \frac{1}{4}(\text{List}) + \frac{1}{4}(\text{Yes/No})$。这与以往“单点任务”基准本质不同,能同时暴露感知、抽取与推理三类瓶颈。

方法步骤详情

完整流程为:(1) 收集 205 篇 ALD/E 文献;(2) 用 MinerU 抽取结构化 JSON 与高清 JPEG,保持语义结构与视觉保真;(3) 制定 49 类图表分类法并公开可视化;(4) 自研多用户 Web 标注平台,支持子图级边界框与统一 Schema;(5) 用 Qwen2.5-VL-7B-Instruct 对三任务预标注,VQA 留人工;(6) 10 名专家每人 25 篇,5 篇共享算 IAA,双周自动校验后整合发布;(7) 划分 Train/Dev/Test:128/20/57 篇,对应 1,180/201/570 张图,ALD 与 ALE、实验与仿真四象限均衡;(8) CodaBench 分任务开赛道,提供评测脚本,统计 1,263 份提交并排名。

技术新颖性

新颖性体现在四方面:领域上首次专攻 ALD/E 材料科学,填补通用基准无法触及的空白;标注上由硕博/博士后级专家完成且对 VQA 完全人工标注,并以 Bloom 分类法分级设计问题;任务上把四个任务组织成端到端递进管线,并定义统一的加权评分公式;工程上自研多用户标注平台并自动化双周校验,保证 1,951 张图表标注的可扩展与一致性。这些组合在已有 ICDAR 竞赛与材料科学数据集中均无先例,使其成为首个同时具备领域深度、专家质量与端到端推理评测能力的科学图表基准。

Overview of the Sci-ImageMiner benchmark end-to-end curation workflow.
Fig. 1: Overview of the Sci-ImageMiner benchmark end-to-end curation workflow.
Illustration describing the Sci-ImageMiner dataset organization hierarchy.
Fig. 2: Illustration describing the Sci-ImageMiner dataset organization hierarchy.

实验结果

核心结论是:模型在分类与总结上表现尚可,但在数据抽取与 VQA 上明显吃力。Task 1 分类:冠军 Ricoh_SRCB 用分层微调 + 双图(全局/裁剪)推理,F1 达 0.81,基线 Gemma 4 E4B 8b 仅 0.68,IIT_PATNA_CV_1 把分类重构成 Qwen2.5-VL-7B-Instruct 生成任务获 0.77。Task 2 数据抽取:TeleOCR-VL 用结构感知训练+合成数据+集成,加权分 41.81(RMS 17.23、TEDS 66.39),基线 Qwen 3 VL 8b 为 35.97;即便最强队伍 RMS 也仅约 17,精确数值还原极难。Task 3 总结:DeepVitminC 借 RAG 上下文+对齐微调获加权 0.56,基线 Intern VL 3.5 8b 为 0.48。Task 4 VQA 最弱:DeepVitminC 加权仅 0.31,基线 Molmo2 8b 为 0.20;Factoid 的 EM 最高仅 0.09,Yes/No 的 F1 仅 0.42。综合看,没有任何单一模型在全部任务上占优,证实科学图表推理仍是开放难题。

Overview of the Sci-ImageMiner Dataset Statistics.
Table 1: Overview of the Sci-ImageMiner Dataset Statistics.
Top-20 annotated figures in Sci-ImageMiner benchmark dataset (count and percentage).
Table 2: Top-20 annotated figures in Sci-ImageMiner benchmark dataset (count and percentage).
Task 1 Classification scores for the best baseline and top-5 teams.
Table 4: Task 1 Classification scores for the best baseline and top-5 teams.
Task 3 Summarization scores for the best baseline and top-5 teams.
Table 7: Task 3 Summarization scores for the best baseline and top-5 teams.
查看结构化数据
任务指标本文基线提升
Task 1 分类(49 类,F1-score) F1-score Ricoh_SRCB 0.81 Gemma 4 E4B 8b 0.68 +0.13
Task 2 数据抽取(加权分) 加权 = 0.5·RMS + 0.5·TEDS TeleOCR-VL 41.81(RMS 17.23, TEDS 66.39) Qwen 3 VL 8b 35.97 +5.84
Task 3 总结(加权分) 加权 = 0.5·(R1+R2+RL)/3 + 0.5·BERTScore-F1 DeepVitminC 0.56 Intern VL 3.5 8b 0.48 +0.08
Task 4 视觉问答(加权分) 四类答案加权平均 DeepVitminC 0.31(Factoid EM 0.09) Molmo2 8b 0.20 +0.11

局限与改进

作者承认的局限包括:IAA 仅为 Fleiss' $\kappa = 0.46$(中等一致),标注质量有提升空间;数据集只覆盖 ALD/E 单一领域,泛化性未验证;参赛方法大多依赖 Qwen 系列骨干,多样性有限;评测阶段 GRPO 等对齐方法因初始化与数据分布问题收益有限。从结果看,VQA 的 Factoid 精确匹配最高仅 0.09、Yes/No 的 F1 仅 0.42,说明即便是冠军方案在精细数值与领域推理上仍远未实用;同时 Task 2 的 RMS 普遍低于 20,反映数值级精度还原的系统性短板。这些数字本身就是对当前多模态科学推理能力的严厉警示。

独立分析的弱点

其一,领域过窄:仅 ALD/E,难以推广到催化、电池、生物材料等其他图表密集领域,建议构建跨子领域联合基准并测试迁移性。其二,标注一致性偏低:$\kappa=0.46$ 会引入标签噪声,尤其在 Factoid/List 等需精确答案的任务上拉低评测上限,建议引入多轮对抗式校验与更高 IAA 目标。其三,数据抽取数值精度差:RMS 仅约 17,说明模型读轴、估值能力弱,改进方向是引入坐标回归头或基于 OCR 的几何对齐。其四,VQA 推理薄弱:Factoid EM 仅 0.09,应探索显式工具调用(如先抽表再问答)与思维链结构化。其五,参赛方法同质化(多为 Qwen+LoRA),缺乏对 MoE、扩散式理解等新范式的系统比较。

未来方向

作者展望包括:扩展到更多科学领域、提升标注与对齐方法、构建统一框架同时优化数据工程、提示设计、模型适配与推理期校验。基于成果可延伸的方向有:把四个任务串成端到端管线(如先分类→抽表→总结→问答)并联合训练,利用 Vassilis Sioros 与 VLMinators 提出的“顺序上下文链”思路;引入更高 IAA 的对抗式标注;针对 ALD/E 之外的材料体系做迁移学习;研究弱监督/合成数据(参考 TeleOCR-VL)缓解标注稀缺;并把 TEDS/RMS 等指标与人类偏好对齐,发展更贴近实用性的评测协议。

复现评估

复现性整体较好:Sci-ImageMiner 数据集与评测脚本在 CC BY 4.0 协议下于 GitHub 公开,49 类分类法、标注工具、基线提示词均可获取,基线复现路径清晰。难点在于参赛方法的完整复现:多数前 5 名方案依赖对 7B–35B 量级 LVLM 的 LoRA/QLoRA/DPO/GRPO 微调,需要数张高端 GPU 与较多工程量;合成数据生成、集成推理等环节细节未必全部公开;CodaBench 提交榜单可对照但私有测试集需走官方渠道。整体属“数据集易复用、顶尖方法中等难度复现”的层级。