AskChem:以声明为中心的化学文献综合基础设施 AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
将论文分解为可溯源的原子声明,重构化学跨论文检索的基础设施
前置知识
检索增强生成(RAG)
检索增强生成是一类在生成回答前先从外部知识库检索相关证据,再让大语言模型基于检索到的内容生成回答的方法。其核心动机是缓解 LLM 的知识过时和事实幻觉:模型不再仅依赖参数记忆,而是条件化于检索到的真实文档。关键组件包括查询重写、检索器(稀疏关键词如 BM25/FTS5 或稠密向量)、重排序与融合、以及最终的阅读器。AskChem 属于这一范式,但把检索单元从'文档'细化到'溯源声明',并加入分面结构和证据图作为额外导航。
理解 RAG 的基本框架是读懂 AskChem 设计动机的前提:它正是为解决文档级 RAG 在跨论文综合任务上粒度过粗、来源不可验证的问题而生。
全文检索与倒数排名融合(FTS5 + RRF)
FTS5 是 SQLite 的全文搜索引擎模块,支持对文本建立倒排索引并按 BM25 等相关性打分,适合基于关键词的精确匹配。倒数排名融合(Reciprocal Rank Fusion)则把多个独立排序的结果列表合并成一个最终排序,每篇文档的得分是其在各列表中排名的倒数之和,公式为 $RRF(d) = \sum_{r \in R} \frac{1}{k + \mathrm{rank}_r(d)}$(典型 $k=60$)。它的优点是无需校准各检索器的分数尺度即可融合。AskChem 的混合检索就是 FTS5 声明文本召回、论文级召回、分类节点召回、稠密向量召回,最后用 RRF 合并。
AskChem 的检索引擎是这套混合检索,读懂论文的搜索结果为何能同时兼顾精确匹配与语义召回,需要理解 FTS5 与 RRF。
声明抽取与信息抽取(Claim/Information Extraction)
信息抽取指从非结构化文本中识别结构化事实的任务,经典设定包括命名实体识别、关系抽取、事件抽取。声明抽取是其面向科学文献的特化:用模型(这里是 LLM)把论文中的句子转化为原子化、有类型、带结构化字段(如反应物、条件、测量值)的断言。关键约束是必须携带溯源信息——源 DOI 和逐字引用——否则无法验证。AskChem 用 JSON schema 约束解码确保抽取输出格式合法,并对必需溯源字段做校验。
AskChem 的核心数据来自声明抽取管线,理解这一步骤才能理解为什么'声明'可以作为检索单元以及它的质量边界在哪。
分面分类法与证据图谱
分面分类法(faceted taxonomy)是按多个正交维度(facets,如反应类型、物质类别、应用)对同一组对象进行分层组织的结构,每个对象可被分到多个维度的路径下(如 coupling/cross_coupling/suzuki),常用于电商和文献浏览。证据图谱则是一种知识图谱,节点是声明、边是带类型的语义关系(supports/contradicts/extends/derives_from/cites_as_evidence),并附带置信度和溯源。两者的共同点是把无结构的发现组织成可导航的网络。
分面分类、证据图谱和生命分类法是 AskChem 叠加在声明存储之上的三种互补导航结构,理解它们才能理解论文的'三视图'设计。
Model Context Protocol(MCP)
Model Context Protocol 是 Anthropic 提出的开放协议,用于让 AI 智能体以标准化方式访问外部工具和数据源。它定义了一组接口规范,使智能体能够调用服务器暴露的资源、提示模板和工具,而无需为每个数据源定制集成。AskChem 提供了 MCP 服务器,把声明检索、声明查询、证据邻域查询等能力暴露给智能体,使 AI 能直接获取溯源声明而非自行爬取论文。
AskChem 的一大卖点是同时服务人类和 AI 智能体,MCP 是其面向智能体的关键接入方式,理解它才能评估其作为基础设施的可用性。
研究动机
化学文献综合往往需要把散布在许多出版物中的具体发现拼装起来,但现有文献检索系统主要返回排好序的文档列表。例如,当化学家问'哪些电催化剂可用于 $\mathrm{CO_2}$ 还原为 CO,法拉第效率是多少?'时,答案分布在很多论文中,表现为关于催化剂、反应条件、测量值和机理的个别发现,留下科学家自行打开论文、定位相关证据、核对报告数值、再手动组装答案。这种以文档为中心的接口与科学家和 AI 智能体实际使用文献的方式日益不匹配:LLM 智能体现在会综述论文并规划实验,但继承了其检索工具的局限——文档检索不直接暴露声明级别的证据、领域组织方式或综合所需的文档间关系。当被要求从参数记忆回答时,LLM 可能编造看起来合理的引用,例如论文报告纯 GPT-5.5 在一个问题上 14 个引用 DOI 中有 6 个在 CrossRef 上无法解析。
本文的目标是本文的目标是构建一个以声明为中心的化学文献综合基础设施 AskChem,让溯源的、可验证的科学声明(而非论文)成为搜索、浏览和智能体访问的中心对象。具体目标包括四点:第一,部署一个覆盖 2.4M 条声明、来自 147K 篇论文(1925–2026)的溯源声明存储;第二,在共享声明存储之上提供互补结构——用于分层检索和浏览的稳定分面分类法、连接声明间关系的证据图谱、按科学原理组织的探索性生命分类法;第三,通过 Web UI、REST API、SDK 和 MCP 服务器为人类和智能体提供接口;第四,构建 AskChem-Bench 跨论文化学搜索评测套件,衡量引用溯源性与相关性,并验证声明中心检索能否消除引用幻觉。
与已有工作不同的是,本文的独特切入角度在于彻底改变检索单元:从'论文'变为'溯源的原子声明'。正如 Segment Anything Model 把图像分解为可复用区域,AskChem 用 LLM 把论文分割成声明。通过直接索引声明,用户可检索具体发现、检查证据、组装跨论文答案,而无需先阅读过滤整篇文档。与 Reaxys/SciFinder 等专有策展的反应/物质数据库、PubChem/ChEMBL 等开放分子库、Semantic Scholar/Google Scholar 等论文元数据库不同,AskChem 暴露的是溯源叙事声明之上的分面结构和证据关系。与生成式答案助手(Paperclip、Edison Scientific、NotebookLM Deep Research)不同,AskChem 暴露的是持久化的、可复用的、人类和智能体都可访问的声明存储基础设施,而非一次性答案。
核心方法
AskChem 的整体思路是:先用 LLM 把论文分割成原子声明并强制溯源,再在共享声明存储上叠加三种互补导航结构,最后通过统一 REST schema 同时服务 Web 界面和智能体接口。直觉上,它把'每篇论文'这个检索单元换成'每个溯源声明'——每个声明是一个原子化、有类型的科学断言,由源 DOI 和逐字引用(或显式证据定位器)锚定,并含结构化字段(反应物、条件、测量、材料)和抽取置信度。三种结构分别是:稳定分面分类法(按声明'关于什么'组织,如反应类型、物质类别、应用、技术、机理主题)、证据图谱(按声明间'如何关联'组织,如 supports/contradicts/extends/derives_from)、探索性生命分类法(按'什么原理支配'组织)。三者共享同一声明标识符,使搜索、分层浏览和图遍历返回相同溯源对象。当前实时索引含 2.4M 声明、147K 论文、307K 分类节点、171K 证据边,存储于 SQLite + FTS5 全文索引 + 向量索引,由 FastAPI 服务。
核心创新点在于把'溯源的科学声明'提升为一等检索对象,并在其上叠加语料诱导但稳定化的结构。与已有方法的本质区别有三:第一,检索单元是声明而非文档——每个声明携带源 DOI 和逐字引用或显式证据定位器,部署索引中 100% 的 2.4M 声明都是溯源的(带声明类型、源 DOI、逐字引用),可逐条验证;第二,结构是诱导并稳定化的,而非强加预定义本体——分类路径在消化论文时诱导,再通过规范 L1 路由、同义词归一化和近重复子类模糊聚类,得到持久化 L1/L2/L3 路径,既语料驱动又适合生产检索;第三,三种结构(分面分类、证据图谱、生命分类)共享同一声明标识,分别回答'关于什么/如何关联/什么支配'三个互补问题,让搜索、浏览和图遍历返回相同溯源对象而非割裂摘要。这让声明可被搜索、分组、链接和验证,是'声明即检索单元'的彻底范式转移。
方法步骤详情
方法分四步。步骤1(声明抽取)两条互补管线:高通量抽取器用 GPT-5-mini 处理论文标题+摘要,覆盖 102K 论文;深度全文抽取器用 Gemini 3.1 Pro 原生 PDF(Vertex AI 批处理)覆盖 44K 论文,捕获摘要中常缺的假设、局限、意外发现类型。每次抽取返回结构化 JSON,按声明 schema 验证(必需溯源字段、数值范围、化学字段),不合法则自动重试。声明类型以 Property 964K、Method 331K、Comparison 233K、Mechanism 222K 居前。步骤2(分面分类)诱导路径后经规范 L1 路由、同义词归一、模糊聚类稳定化为持久 L1/L2/L3,含五个内容视图(反应类型、物质类别、应用、技术、机理主题)加声明类型/测量/时间/作者视图。步骤3(证据图谱)第二遍抽取发射有向边(supports/contradicts/extends/derives_from/cites_as_evidence),带置信度与溯源,共 171,342 条边。步骤4(检索与服务)混合 /search 结合 FTS5 文本召回、论文级召回、分类节点召回、稠密向量召回,用倒数排名融合(RRF)合并;同一 REST schema 服务 Web/REST/SDK/MCP,支持阅读列表、作者网络、订阅。
技术新颖性
技术新颖性体现在多个层面。在表示层面,提出溯源声明表示——每个声明是带类型断言、源 DOI、逐字引用或证据定位器、结构化字段和置信度的复合对象,2.4M 声明 100% 溯源,并区分逐字引用与全文结构化证据(后者用 location_in_paper + 结构化证据定位)。在分类法层面,创新在于'诱导+稳定化'范式:不强加预定义化学本体,而从语料诱导路径再规范化为生产可用的持久分类,既避免手工本体覆盖局限又避免纯 LLM 诱导不稳定。在图层面,把证据关系抽取做成检索之上的关系层(而非检索替代品),/api/claims/{id}/neighborhood 暴露出入边,专家审计得 97.9% 边类型精度。在评测层面,提出 AskChem-Bench(30 个跨论文问题,覆盖条件聚合、时序追踪、矛盾浮现三类任务),用 CrossRef 验证每个 DOI,用校准在 100 个专家标签(93% 一致,$\kappa=0.914$)的 Gemini 3.1 Pro 判官评分。系统层面,单库 SQLite+FTS5+向量联合查询 2.4M 声明、307K 节点、171K 边,同时服务人类与智能体。
实验结果
核心发现沿四个研究问题。RQ1(声明是否溯源):部署索引中 100% 的 2.4M 声明携带声明类型、源 DOI 和逐字引用,66% 为全文声明、99.9% 源 DOI 经 CrossRef 验证。RQ2(结构是否可靠):证据图谱经专家审计,148 条边分层抽样中 146 条可判定、143 条类型正确,边类型精度 97.9%;但分面分类位置正确性未做大规模专家验证,生命分类为探索性。RQ3(声明中心检索是否改善跨论文综合):在 AskChem-Bench 30 个问题上,纯 GPT-5.5 的 DOI 存在率仅 88.3%、引用密度 9.6,而 +AskChem 达 100% DOI 存在率、18.1 引用密度/答案(五系统最高),论文相关性 2.15(最高)、On-topic≥2 达 86.6%、近期高影响 18.5%(最高)。Figure 6 同一问题(ca04),纯 GPT-5.5 编造 14 个 DOI 中的 6 个,而 AskChem 检索的 22 个 DOI 全部可验证且与摘要逐字一致。但 Edison Scientific 在定量细节密度(29.2 vs 5.9)和切题率(89.7%)上略高。RQ4(语料规模):服务经统一 REST schema 联合查询 2.4M 声明、307K 节点、171K 边,同时服务 Web/SDK/MCP。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨论文化学问答 DOI 可解析性 | DOI existence (%) — CrossRef 可解析比例 | +AskChem 100% | LLM only 88.3%;Edison Scientific 99.1%;NotebookLM 93.7% | 相对纯 LLM 提升 11.7 个百分点,彻底消除引用幻觉 |
| 引用密度 | Citation density — 每个答案的可验证 DOI 数 | +AskChem 18.1 | LLM only 9.6;Paperclip 7.5;Edison 10.7;NotebookLM 7.9 | 约为纯 LLM 的 1.9 倍,五系统最高 |
| 论文相关性 | Paper relevance (0–3) — Gemini 3.1 Pro 判官 | +AskChem 2.15 | LLM only 1.66;Edison 2.07;NotebookLM 1.84 | 相对纯 LLM 提升约 0.49 分,五系统最高 |
| 证据边类型精度 | Edge-type precision — 专家审计 | 97.9%(146 可判定中 143 正确) | —(无直接基线) | 证明证据图谱关系质量可用于导航 |
局限与改进
作者承认的局限包括:第一,语料只覆盖化学的一小部分,摘要抽取比全文抽取浅——仅 44K 论文做深度全文抽取、102K 论文仅有摘要级声明,深度声明类型(假设、局限、意外发现)覆盖不足。第二,LLM 生成的声明、关系和分类位置可能出错;AskChem-Bench 衡量的是 30 个问题上的溯源度而非完整事实准确性或用户效用。第三,基于字符串的分类归一化可能合并不同类别或保留近重复,且检索增益未单独隔离归因到分类召回或语义召回。第四,对比中 Edison Scientific(闭源智能体深度研究系统)在引用链接定量细节(grounded specificity 29.2 vs 5.9)和切题率(89.7% vs 86.6%)上略优,说明声明中心方法在定量密度上并非最优。我自己的观察:评测规模仅 30 题,结论受样本量限制;分面分类和生命分类的位置正确性缺乏大规模专家验证(仅声明边做了审计);检索增益没有消融实验单独归因到各召回信号,难以判断 FTS5、向量、分类各自的贡献。
独立分析的弱点
第一个弱点是评测规模与归因不足。AskChem-Bench 仅 30 题,虽然覆盖条件聚合、时序追踪、矛盾浮现三类任务但统计稳健性有限;且没有消融实验隔离分面分类召回、向量召回、FTS5 各自对最终效果的贡献,难以判断哪个信号最关键。改进方向:扩大 benchmark、做分信号消融。第二个弱点是语料深度不均。66% 声明来自全文但只覆盖 44K 论文,102K 论文仅有摘要级声明,深度声明类型(假设、局限、意外发现)覆盖不足。改进方向:扩展全文 PDF 抽取到更多论文。第三个弱点是分类位置可靠性。分面分类用于生产检索但未做专家位置验证,生命分类被明确定义为'探索性'而非'已验证本体',字符串归一化可能误合并近义但不同的类别(如 near-duplicate 或 distinct categories)。改进方向:引入语义化归一化(基于嵌入聚类而非字符串匹配)并对分类位置做专家审计。第四个弱点是声明语义正确性。所有检查只建立可溯源性(traceability)而非语义正确性,声明可能溯源但仍误读来源含义。改进方向:加入声明-引用一致性判别器,自动检测抽取出的声明与其逐字引用是否真正相符。
未来方向
作者提出的未来方向包括:扩展语料覆盖更多化学子领域;增加全文抽取深度;改进字符串分类归一化;隔离分类召回带来的检索增益;对分类位置做专家验证。基于本文成果可延伸的方向有:第一,将声明中心范式迁移到化学之外的领域(生物医学、材料科学、临床医学),验证其作为通用科学文献基础设施的普适性;第二,强化证据图谱的'矛盾浮现'能力,主动检测跨论文冲突并提醒用户,而非仅作为被动导航;第三,把生命分类法从探索性提升为可验证本体,结合专家众包和声明级投票;第四,研究声明级检索对下游科学发现的实际影响(如辅助实验规划、自动化文献综述、假设生成),用真实用户研究衡量效用而非仅 30 题 benchmark;第五,扩展智能体接口(MCP)使其能执行多步声明推理与假设检验,从'检索工具'进化为'研究助手';第六,探索声明存储如何与实验数据库(如 Reaxys)互操作,融合叙述性声明与结构化反应数据。
复现评估
复现性良好。AskChem 已上线(https://askchem.org),MIT 许可源代码在 GitHub(github.com/bingyan4science/askchem),CC-BY 索引快照在 HuggingFace(huggingface.co/datasets/bing-yan/askchem),并提供录屏演示。抽取器细节公开:摘要抽取用 GPT-5-mini 处理标题+摘要,深度抽取用 Gemini 3.1 Pro 原生 PDF(Vertex AI 批处理),均用 JSON 对象约束解码、provider 默认温度、无效或 schema 不合法时自动重试,提示和 schema 随源码发布。AskChem-Bench 的完整问题、方法学、任务级结果、录制索引快照、重跑脚本在 https://askchem.org/api/benchmark,判官用 Gemini 3.1 Pro,校准在 100 个专家标签(93% 一致,$\kappa=0.914$)。主要复现成本在于 LLM 抽取 API(生成 2.4M 声明需大量调用,致谢提及 NYU GCP 资助)和 PDF 全文获取(开放获取可用,付费墙内容不可再分发,公共索引只暴露声明文本与溯源)。综合为中等难度:需 LLM API 预算与 SQLite+FTS5+向量混合检索工程实现。
论文图表
图展示了 AskChem 网页界面的实际检索效果:对一个化学问题(如'哪些电催化剂可将 CO2 还原为 CO'),界面返回的不是论文列表,而是一条条溯源声明,每条声明附带源 DOI、逐字引用和结构化字段(反应物、催化剂、产物、选择性等)。例如一条来自 DOI 10.1002/anie.201914977 的声明显示 Ni SA-N2-C 催化剂实现 98% 的 CO 法拉第效率、转换频率 $1622\ \mathrm{h^{-1}}$。界面让用户直接看到可验证的具体发现而非整篇文档。
这张图是理解论文核心主张('声明即检索单元')的最直观证据,展示了溯源声明在真实界面中的样子,奠定了整篇论文的设计基调。
图对比了同一问题('CO2 还原为 CO/甲酸盐的电催化剂')在两种设置下的回答。纯 GPT-5.5 编造了类似'Au nanoneedles: ~95% FE for CO'的引用 [10.1021/jacs.7b00392],14 个引用 DOI 中 6 个在 CrossRef 无法解析,具体数值无法验证。而 GPT-5.5 + AskChem 给出的'原子级分散 Fe3+ 位点:过电位 360 mV,$j_{\mathrm{CO}} = 20\ \mathrm{mA\ cm^{-2}}$'(10.1126/science.aaw7515),22 个引用 DOI 全部验证通过,报告值与源摘要逐字一致。
这张图是评估 RQ3(声明中心检索是否改善跨论文综合)最具说服力的案例证据,直接对比了纯 LLM 的引用幻觉与 AskChem 接地后的可验证性,是论文最核心的结果展示。