DianShi-RxnDB:面向研究者与AI智能体的全自动流水线构建大规模细粒度有机反应数据平台 DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents
全自动流水线从158万专利抽取2400万条可溯源细粒度有机反应记录,服务研究者与AI智能体
前置知识
SMILES 与 Reaction SMILES
SMILES 是用一串 ASCII 字符线性表示分子结构的语言,例如阿司匹林写作 CC(=O)Oc1ccccc1C(=O)O;Reaction SMILES 在此基础上用 ">" 分隔反应物、试剂/介质和产物三段,使整个反应能以纯文本形式被计算机存储、检索和去重。
数据库中所有物质与反应实例都以规范化 SMILES 表示,检索、去重、模板抽取等全部功能都建立在这种表示之上,看懂示例记录必须先理解它。
原子映射与原子守恒(Atom Mapping / Atom Conservation)
原子映射是给反应物和产物中的原子建立一一对应关系,追踪每个原子在反应中的去向,RXNMapper 等工具可自动完成;原子守恒检查则验证反应前后原子种类与数量是否平衡,是判断一条反应记录在化学上是否合理的基本规则。
论文用 RXNMapper 生成原子映射并做原子守恒等规则检查,构成自动合格性评估的核心,2400万条实例中 61.7%(约1480万条)因此被标记为合格。
反应模板(Reaction Template / SMARTS)
反应模板用 SMARTS 语言描述一类反应共享的局部结构变换规律(例如"酰氯+胺→酰胺"),抽象掉具体分子骨架,是从具体反应实例泛化出可复用反应规则的关键表示,广泛用于数据驱动的逆合成规划。
数据库用 LocalRetro 和 RDChiral 两套工具分别生成并维护约119万和186万条去重模板,理解模板才能理解该数据库在逆合成方向的应用布局。
Pistachio 与商业反应数据库
Pistachio 是 NextMove Software 维护的商业反应数据库,从专利文本与图像两个通道抽取反应,报告规模约2100万条,支持段级溯源,需付费访问;同类商业库还有 Reaxys(约7300万条)和 CAS Reactions(约1.5亿条)。
论文将 Pistachio(2025Q2 版)作为外部对比对象,在去重后记录数、表示粒度和字段一致率三个维度做了匹配样本比较,它是理解本文优势声明所必需的参照系。
MCP(Model Context Protocol,模型上下文协议)
MCP 是一种开放协议,让 AI 智能体以标准化方式调用外部工具和数据源:服务方把检索能力封装成可组合的结构化工具,智能体可以多步调用,把上一步返回的数据库标识符或化学表示作为下一步调用的输入,形成检索链。
本文除 Web 界面外专门提供 MCP 服务,使智能体能做多步结构化反应检索(如案例中 11个候选反应组→1个目标组→53条实例),是平台的两大使用入口之一。
逆合成分析(Retrosynthesis)
逆合成分析从目标产物出发反向拆解出可行前体和反应路径,是有机合成设计的核心方法论;数据驱动的逆合成依赖大规模反应数据来学习模板或训练神经模型,数据规模与字段质量直接决定规划质量。
作者明确预告下一份技术报告将基于该数据底座做逆合成研究,这是 DianShi-RxnDB 最重要的下游应用方向,也是理解其长期定位的背景。
研究动机
有机合成知识大量沉淀在专利文献中,但对反应先例检索和 AI4Chem 研究真正有用的反应记录,不仅要描述反应物到产物的结构变化,还要包含参与者角色、用量、温度、时间、产率和实验操作步骤等细节。这些信息分散在专利正文、反应式图片、表格和实施例中,一个实验的描述可能横跨多个段落,需要结合通用制备方法和文内交叉引用才能准确理解。现有开放数据集覆盖严重不足:USPTO-Lowe 约375万条(1976–2016)但只有文档级溯源,CJHIF 约322万条仅有反应物/产物和产率且未定位出处,USPTO-LLM 仅约24.7万条;而信息更全的 Pistachio(约2100万条)、Reaxys(约7300万条)、CAS Reactions(约1.5亿条)都是付费订阅,机器访问和批量使用也受许可限制。整体上,领域缺乏规模大、字段细、可逐段溯源、且对研究者和 AI 智能体免费开放的统一反应数据基础。
本文的目标是本文的目标是构建大规模、细粒度的有机反应数据平台 DianShi-RxnDB(点石,取"点石成金"之意):用覆盖专利文本、图片和反应式三种载体的全自动信息抽取与归一化流水线,把 USPTO 与 EPO 在1976–2025年间发表的有机合成专利,转化为结构化的单步"反应实例"(Reaction Instance)。每条实例记录反应物/产物的结构表示、五类参与者角色、逐物质用量与当量、温度、时间、产率和实验操作步骤,并链接回源专利及其文档内的段级位置;同时建立 Substance、Reaction Instance、Reaction Group、Reference 四类对象间的结构化关系。在同一数据底座上,平台还要提供面向研究者的 Web 工作台(检索、筛选、实例对比、源文核验)和面向 AI 智能体的 MCP 服务(可组合的多步结构化检索工具),并以免费非商业方式开放。
与已有工作不同的是,本文的独特切入角度有三点。第一是彻底的自动化与规模化:不依赖人工整理,用 LLM(DeepSeek-V3-0324,部署于华为昇腾910C)处理专利实验文本、用 MinerU.Chem 解析图片与反应式,把 LLM 抽取从 USPTO-LLM 的约24.7万条规模一举推进到158万篇专利、2400万条实例。第二是"不合并的实例+段级溯源":不像很多数据集把同一反应物-产物组合压缩成一条记录,本文让每条实例独立保留条件、产率、步骤和源文段落位置, Reaction Group 只做聚簇不做融合,用户可以逐段回到专利原文核对——这种可验证性在开放数据集中非常少见。第三是双接口一体化设计:同一数据底座同时服务人类研究者(Web 检索/对比/溯源)和 AI 智能体(MCP 可组合多步检索),并且连未通过合格性检查的记录也保留入库供用户自查,这种"数据+平台+智能体工具"的整体定位区别于单纯发布数据文件的学术数据集,也区别于黑盒收费的商业数据库。
核心方法
整体思路可以用一条流水线概括:先把海量专利筛到"与有机合成相关且有全文"的子集,再从文本、图片、反应式三种载体中自动抽取实验信息并结构化,最后用化学规则自动把关、全程保留溯源。技术路线分四步:第一步语料构建,从 20,256,438 条源专利记录(USPTO 12,377,492 条 + EPO 7,878,946 条)出发,按 IPC 分类的有机化学相关性过滤保留 2,512,925 条,源内合并去重(合并同一申请的不同公开版本)后剩 1,968,230 条,USPTO/EPO 跨源去重后剩 1,757,755 条,再剔除无可用全文的记录,最终 1,580,939 篇专利进入抽取环节。第二步信息抽取,DeepSeek-V3-0324 负责解析实验文本(昇腾910C 上部署,DeepLink 提供软硬件适配与推理运行时支持),MinerU.Chem 负责解析图片和反应式中的化学结构。第三步结构化组织,产出带反应 SMILES、五类参与者角色、用量/当量、温度/时间等条件、产率、38类操作类型结构化步骤的 Reaction Instance。第四步自动合格性评估,用 RXNMapper 生成原子映射并做原子守恒等规则检查,14,808,205 条(61.7%)通过获得"合格"标记,未通过的 9,191,031 条(38.3%)也连同抽取信息和溯源关系一并保留。
核心创新在于把反应知识组织为"不合并的实例 + 组 + 溯源"三层结构。已有开放数据集大多把反应压缩为反应物-产物对(如 USPTO-Lowe),商业库虽细但黑盒且收费;本文坚持每条 Reaction Instance 独立保留条件、产率、步骤和段级出处,同一规范化反应物-产物组合的多条实例归入同一个 Reaction Group 供横向对比而不融合字段——例如水杨酸+乙酸酐合成阿司匹林的目标组内有53条实例,硫酸催化 50°C/20分钟/70% 产率与加入 SOMS/二氯甲烷/40°C/97% 产率的记录可以直接并列比较。第二个关键设计是自动合格性分层:通过 RXNMapper 原子映射与原子守恒检查的记录标记为合格,未通过的也不删除而是带标记保留,把质量决策权交给用户而非静默丢弃。第三个关键设计是双接口:Web 工作台负责交互检索、实例对比和源文核对,MCP 把物质/反应组/实例/专利检索封装为四个可组合工具,支持智能体多步检索(案例中按产物结构检索到11个候选反应组→锁定1个目标组→确认53条实例→本次条件查询返回20条)。
方法步骤详情
第一步,语料筛选:输入 USPTO/EPO 专利元数据记录共 20,256,438 条,按 IPC 分类号做有机化学相关性过滤输出 2,512,925 条;随后合并同一来源的重复申请记录和不同公开版本(保守保留元数据不足以判定者),再做 USPTO 与 EPO 跨源去重,最后剔除无可用全文的 176,816 条,得到 1,580,939 篇进入抽取流水线的专利,其中 608,309 篇最终关联到至少一条保留的反应实例。第二步,多模态抽取:文本通道由 DeepSeek-V3-0324 识别有机合成实验内容,解析参与者及其角色、用量、条件、产率与操作描述;图片通道由 MinerU.Chem 解析反应式和结构图。两路信息组织为 Reaction Instance,字段包括反应 SMILES(附置信度,如示例中86.80%)、Reactant/Product/Reagent/Catalyst/Solvent 角色标注、温度/时间/压力/气氛、产率、按38种操作类型(Add、Stir、Filter、Purify、Quench 等)结构化的逐步实验操作、后处理描述以及源专利段落原文。第三步,对象关联:6,261,797 个 Substance 通过参与者关系连接实例并统计在各角色下的出现次数,608,309 个 Reference 记录专利元数据并锚定文档内位置,6,580,963 个 Reaction Group 按规范化反应物-产物组合聚簇实例,另用 LocalRetro 和 RDChiral 生成两套独立模板集合(约119万和186万条)。第四步,合格性评估:对每条实例运行 RXNMapper 原子映射与原子守恒等规则检查,输出"合格/未合格"状态,两种状态均入库并保留完整抽取信息。
技术新颖性
技术新颖性体现在四个方面。其一,规模化的全自动 LLM 抽取:此前 USPTO-LLM 用 LLM 抽取仅覆盖约24.7万条记录,本文用 DeepSeek-V3-0324 加 MinerU.Chem 把 LLM 抽取推进到约2400万条实例、158万篇专利,并同时覆盖文本与图像两种模态,这在公开反应数据建设中是数量级式的跨越。其二,溯源与验证粒度:与 Pistachio 同为段级溯源,但本文额外提供文档内编号(如"Intermediate 68")、源行号、完整段落原文、SMILES 置信度、缺失原子检查等验证诊断维度——Table 8 的对照检查显示 Pistachio 对应记录没有独立 Catalyst 字段、没有阶段级反应对象、没有专门的后处理(workup)字段、也没有验证诊断。其三,更细的角色体系:明确区分 Reagent 与 Catalyst(Pistachio 用宽泛的 Agent 类别),并设专门 Workup 字段和38类操作类型的结构化步骤。其四,开放性与服务形态:免费非商业的 Web+MCP 双入口,对数十年间结构化反应数据被商业库垄断的局面给出替代方案。需要指出的是,流水线只给出了能力级描述,具体技术细节将留待后续技术报告,因此其新颖性更多体现在系统工程、数据组织与服务设计层面,而非某个单点算法。
实验结果
核心结果分三块。① 数据规模:从 20,256,438 条源记录层层筛出 1,580,939 篇专利,产出 23,999,236 条反应实例,其中 14,808,205 条(61.7%)通过自动合格性检查;关联 608,309 篇源专利、6,261,797 个物质、6,580,963 个反应组,以及 LocalRetro 约119万/RDChiral 约186万条模板。② 内部人工质量评估:从合格实例总体随机抽样 1,300 条,由有机化学背景评审独立对照源专利逐字段核对(双人独立标注、分歧触发第三人重评、多数票定案),共 6,500 个字段判定,微平均准确率 $\text{MicroAccuracy} = \sum_f C_f / \sum_f N_f = 6042/6500 = 92.95\%$;分字段看 Catalyst 最高 97.31%(1265/1300)、Yield 94.85%、Reactant 94.31%、Solvent 93.69%、Reagent 最低 84.62%(1100/1300),作者把 Reagent 偏低归因于试剂与其他角色的边界强依赖具体反应语境,并归纳出后处理物质误记、参与者重复与角色错配、跨段落信息漏抽、多步骤边界混淆四类系统性错误。③ 与 Pistachio(2025Q2 版)的外部匹配对比:在 100 篇美国专利匹配样本中,按反应物-产物去重后 DianShi 保留 4,093/4,222 条,Pistachio 仅保留 2,992/3,630 条(其638条重复中含115条文本内部、89条图像内部、434条文本-图像通道重叠),保留比 1.368 倍($4093/2992 \approx 1.368$);在 58 篇专利的 660 对源段落完全匹配的反应对上,六个字段的完全一致率全部更高:Reactant 97.42% vs 94.39%、Reagent 87.27% vs 84.09%、Catalyst 86.21% vs 83.79%、Solvent 95.30% vs 93.18%、Product 92.27% vs 91.52%、Yield 99.39% vs 81.06%(差距最大 +18.33 个百分点,但部分源于表示策略差异——Pistachio 在无显式百分比时会用产品质量和化学计量推断产率,而 DianShi 只记录源文显式百分比)。阿司匹林案例演示了两条等效检索路径:Web 路径从产物结构检索到84条实例再锁定含53条实例的目标组并回溯源专利核对(US10407376B2:硫酸催化、50°C、20分钟、70%产率),MCP 路径由智能体完成 11个候选组→1个目标组→53条实例→本次返回20条→关联专利的多步检索。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 合格实例字段质量(内部人工评估,n=1300) | 五字段微平均准确率 | 92.95%(6042/6500) | 无外部基线(单库内部抽检) | 不适用;分字段为 Catalyst 97.31%、Yield 94.85%、Reactant 94.31%、Solvent 93.69%、Reagent 84.62% |
| 反应记录去重后规模(100篇美国专利匹配样本) | 去重后保留记录数 | 4,093(原始4,222) | Pistachio 2,992(原始3,630) | 1.368 倍(Pistachio 因文本/图像双通道重复多 removed 638 条 vs 本文129条) |
| 字段级完全一致率 vs 源文本参考(660对源段落匹配反应) | 字段完全一致率(exact agreement) | 六字段全部领先:Yield 99.39%、Reactant 97.42%、Solvent 95.30%、Reagent 87.27%、Catalyst 86.21%、Product 92.27% | Pistachio:Yield 81.06%、Reactant 94.39%、Solvent 93.18%、Reagent 84.09%、Catalyst 83.79%、Product 91.52% | Yield +18.33pp(最大,部分为表示策略差异)、Reagent +3.18pp、Reactant +3.03pp、Catalyst +2.42pp、Solvent +2.12pp、Product +0.75pp |
局限与改进
作者承认的局限:数据仅覆盖 USPTO/EPO 专利(1976–2025),不含期刊论文和未发表实验知识,覆盖范围还受专利记录合并规则和数据库更新周期影响;人工质量评估只针对合格实例总体的五个字段(微平均 92.95%),不代表未合格实例的质量、未评估字段的准确性或数据库召回率;自动抽取仍会产生字段遗漏、重复记录、角色错误和步骤边界错误。笔者的补充观察:其一,合格率仅 61.7%,意味着约 38.3%(9,191,031 条)未通过原子守恒等检查的记录仍留在库中,若下游用户或 AI 智能体不主动区分状态,容易把化学上不守恒的记录当作可靠先例;其二,Reagent 字段 84.62% 的准确率对反应条件预测是实质性标签噪声,且错误模式(后处理/纯化物质误记为试剂或溶剂)是系统性的而非随机噪声;其三,与 Pistachio 的对比基于 100 篇专利和 660 对样本、未外推到全库,且 Yield 一致率差距部分来自"显式百分比 vs 推断值"的表示策略而非纯抽取质量差异;其四,抽取流水线只有能力级描述、技术细节未公开,社区暂无法复现或迁移该构建过程;其五,尚未给出任何下游任务基准(产率预测、条件预测、逆合成)来证明细粒度数据的实际价值,案例研究也只有阿司匹林一个示例。
独立分析的弱点
独立分析的弱点及改进方向:第一,未合格记录的使用边界模糊——919万条未通过检查的记录保留在库,MCP/Web 若不强制区分合格状态,智能体检索到的"先例"可能原子不守恒,建议在 API 层默认过滤未合格记录并提供质量分层参数。第二,Reagent/Solvent/Catalyst 角色边界错误集中(Reagent 84.62%),后续可用源专利全文上下文加第二轮 LLM 复核、或针对四类系统性错误(后处理物质、重复参与者、括号内紧凑表达、跨段引用)做定向修复,这批修正数据本身还可以作为细粒度化学信息抽取的训练集发布。第三,跨段落解析弱(后段产率漏抽、括号内溶剂遗漏),可引入文档级长上下文模型或专利实施例结构解析器;多步骤实验被合并为单条记录的问题需要专门的步骤边界检测模块。第四,版本化与获取渠道不足:目前只有 Web/MCP 在线访问(快照 2026-06-25),没有批量下载和 DOI 固定版本,大规模模型训练的可行性和科研可引用性都受影响。第五,对比样本过小:去重对比仅 100 篇专利、字段对比仅 660 对,且由 GPT-5.6-sol 做语义裁决本身引入裁判模型偏差,应扩大样本并对裁决做人工抽检校准。第六,对算力与成本的披露不足:158万篇专利的 LLM 抽取成本、昇腾910C 的吞吐量都未报告,影响他人估算迁移到期刊文献的可行性。
未来方向
作者提出的方向:扩大有机反应数据来源(期刊文章等)、持续改进数据质量、增强面向研究者和 AI 智能体的检索与源文核验能力、拓展更广泛的有机化学研究场景;下一份技术报告将聚焦把该数据底座应用于逆合成任务并给出初步研究成果。基于本文成果可以延伸的方向:① 把人工评估扩展到全部字段(用量、当量、压力、气氛、操作步骤)并发布评估集,成为化学信息抽取的社区基准;② 用该库训练并评测条件预测与产率预测模型,在 USPTO-50k 等标准基准上量化细粒度字段(催化剂、当量、浓度、后处理)相对 USPTO-Lowe 的增益;③ 面向智能体的化学工作流评测:把 MCP 工具与代码执行、实验规划结合,构建"检索→对比→建议条件→溯源核验"的端到端闭环基准;④ 自动化溯源核查:用 LLM 自动比对结构化字段与源段落,把千级人工抽检扩展到亿级字段的全量核查;⑤ 打通电化学、光化学等新兴反应类型的文献库,弥补专利公开滞后的时效问题;⑥ 未合格记录的修复流水线,把 38.3% 的未通过记录尽可能转化为合格数据。
复现评估
复现评估:作为平台用户非常容易——Web 工作台在 https://dianshi.opendatalab.org.cn/,MCP 服务在 https://dianshi.opendatalab.org.cn/mcp,非商业使用免费,可直接验证检索、对比、溯源功能。论文对评估协议的记录相当详尽:附录 A 给出对象定义与三种专利计数口径(2,025万源记录/158万抽取语料/60.8万关联专利不可混用),附录 C 给出人工评估的双人独立标注+分歧触发第三人重评+多数票流程和 $Accuracy_f = C_f/N_f$ 等统计定义,附录 D 给出与 Pistachio 的去重规则、角色词表对齐方案和 GPT-5.6-sol 辅助裁决协议。但要完整复现数据构建目前不可行:① 抽取流水线只有能力级描述,DeepSeek-V3-0324 与 MinerU.Chem 的具体提示词、解析与归一化细节明确留待后续技术报告;② 论文未说明提供数据集批量下载,主要通过在线接口访问,2400万条数据用于大规模模型训练的获取路径存疑;③ 与 Pistachio 的外部对比依赖商业授权数据(2025Q2 版),外部研究者难以完全复现该对比;④ 内部抽检需有机化学背景评审(1,300条×5字段),成本较高但协议清晰可照做。总体:复现"使用与验证"容易,复现"数据构建"尚不可行,算力方面仅知 LLM 部署在华为昇腾910C 上。
论文图表