← 返回 2026-08-20

化学合理性感知的单步逆合成大语言模型训练 Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov 📅 2026-08-19 👍 33 2026-08-25 18:30
化学信息学 单步逆合成 合成规划 大语言模型 强化学习

Top-K提示+化学合理性奖励训练出超越传统模型的大语言模型逆合成系统

前置知识

单步逆合成(SSRS)

逆合成是从目标分子反向推导合成路线的经典分析方法:把目标分子拆解为更简单的反应物,递归进行直到得到商业可得的砌块。单步逆合成模型只负责其中一步——给定目标分子的 SMILES,输出一组可能的反应物(一条切断方案),不做多步递归。它通常与多步搜索引擎配合构成计算机辅助合成规划(CASP)系统。传统模型如 LocalRetro、MHNreact、RetroKNN 基于模板或检索,天然能输出 top-K 排序候选列表。

本文的任务正是训练 LLM 完成单步逆合成并与这些传统模型在多答案协议下对比;理解 SSRS 的输入输出形式才能看懂 Top-K 评估协议和指标设计的动机。

SMILES

SMILES 是用 ASCII 字符串线性表示分子结构的语言,例如苯写作 c1ccccc1,原子、键、环和分支都有语法规则。同一个分子可写出多种等价写法,其中规范(canonical)形式唯一。逆合成模型普遍以『产物 SMILES 进、反应物 SMILES 出』的方式建模,LLM 则把分子当作文本 token 序列处理,常需扩展专用词表。

论文所有数据、奖励(合法 SMILES 校验、规范化去重)和多样性度量都建立在 SMILES 之上;理解非规范随机遍历数据增强与 SMILES 专用 token 也需要这个背景。

ChemCensor 与化学合理性

ChemCensor 是 Insilico Medicine 开源的规则驱动验证器:把反应拆解为反应中心(发生键变化/电荷变化的原子集合)与官能团签名(不受转化影响的基团集合),在参考先例库(如 USPTO 专利反应)中匹配打分。匹配到的反应中心上下文越具体,置信度层级越高,分数范围 0-5,0 表示无先例支撑、视为化学上不合理。相比神经打分器,它透明、可控、无需训练。

它既是本文的核心评估指标(Av. PT-Top-K CC)又是强化微调的奖励信号;不理解其打分机制就无法判断结论可信度,也理解不了作者承认的『循环性』争议。

GRPO(组相对策略优化)

GRPO 是 DeepSeekMath 提出的在线强化学习微调算法:对每个提示采样一组(本文为 8 个)回答,用组内奖励的相对优势(减去组均值并归一化)替代价值网络作为优势估计,配合 KL 正则约束策略不偏离参考模型。相比 PPO 省去价值模型,特别适合奖励可程序化计算的场景,如数学、代码和本文的化学验证器打分。

本文 RFT 阶段用单奖励 GRPO(组大小 8、KL 权重 0.1、学习率 $10^{-6}$)把 ChemCensor 合理性与新颖性信号注入模型,是最终超越传统模型的关键一步。

Top-K 评估指标(Av. PT-Top-K CC / Max CC)

对每个目标分子收集模型若干条互异预测并按 ChemCensor 分数排序:Max CC 是每目标最高分在目标集上的平均;Av. PT-Top-K CC 是每目标前 K 条独特预测的平均分再对目标取平均(@3/@5/@10 即 K=3/5/10)。Max 衡量『最好的一条有多好』,Top-K 系列对多样性敏感——预测越互异且各自合理,@10 越高。

论文所有结论都用这些指标表述:Top-K 训练模式的价值正是通过 Av. PT-Top-10 从 0.38 到 0.98 的 2.5 倍跃升体现的,不懂指标定义就读不懂主表。

USPTO 基准与数据泄漏

USPTO-full 是从美国专利文本挖掘的约 95 万条反应数据集,USPTO-50K 是其精选子集,长期作为逆合成标准基准。其缺陷是每个产品平均只有约 1 条参考反应(约 89.7 万产品对约 95.1 万反应),且测试与训练同源——模型可能背答案。本文发现传统模型在 497 个测试目标上 Max CC 接近 5(几乎逐字命中先例),481/497 的产品在 USPTO-full 中不超过 3 条参考反应。

它解释了作者为何主张 OOD 基准(URSA-expert-2026)与合理性评估,也解释了用虚拟合成引擎构建 USPTO-XL 多路径数据增广的动机。

研究动机

单步逆合成(SSRS)本质上是一对多问题:同一目标分子往往可经多条不同的切断策略合成,但主流评估协议仍沿用单答案精确匹配(如 USPTO-50K 的 Top-K accuracy),把『猜中那一条参考答案』当作成功。作者此前基于 URSA 框架的基准测试(Zagribelnyy et al., 2026b)表明,通用大语言模型虽有望成为 SSRS 模型,但整体仍逊于 LocalRetro、MHNreact、RetroKNN 等最佳传统模型。问题在三处叠加:其一,USPTO 数据集每产品平均仅约 1 条反应(约 89.7 万产品对约 95.1 万反应),参考答案稀疏导致多样性无法被奖励;其二,USPTO-50K 类基准存在泄漏——传统模型在 Max CC 指标上高达 4.84-4.86(上限 5,几乎逐字命中专利先例),且 497 个测试目标中 481 个在 USPTO-full 里不超过 3 条参考反应;其三,LLM 以 Top-1 模式被逐条提示,单次只给一个答案,多样性潜能完全没被激发。

本文的目标是本文的具体目标是训练一个化学合理性感知的大语言模型,在分布外(OOD)的 URSA-expert-2026 基准(100 个专家确认可合成、与公开反应数据集不相交的新分子)上超越最佳传统 SSRS 模型,并建立一套更合理的多答案训练与评估范式。分解为四点:(1)提出 Top-K prompting 作为 LLM 训练与推理的最佳实践,让单次提示直接输出 15 条互不相同的预测,捕捉逆合成的一对多本质;(2)构建 CREED-CCV-2+USPTO-XL 超大规模训练集——368 万个独立产品、4564 万条经 ChemCensor 验证的反应,弥补 USPTO 每产品仅约 1 条反应的结构性缺陷;(3)在 26 亿参数的 LFM2 基座上完成 SFT 与 GRPO 强化微调,用 ChemCensor 合理性奖励和新颖性奖励直接优化输出的化学合理性与多样性;(4)通过反应唯一性交叉分析厘清 LLM 与传统模型各自探索的化学空间,为集成式逆合成系统指明方向。

与已有工作不同的是,本文的独特切入角度有三层。第一,把『多样性』从推理技巧升级为训练目标:以往工作只在推理阶段做多次采样或 self-consistency,Top-K 模式则让模型在单次生成中就被要求给出 15 条互异答案,且 SFT 数据本身以每产品多条切断路径的形态组织(平均约 12.4 条/产品),多样性行为是被显式教出来的。第二,用规则驱动的化学验证器 ChemCensor 作为可优化的奖励:它基于反应中心与官能团签名在专利先例库中的匹配置信度打分(0-5 分),把『化学上说得通』变成 RL 可直接最大化的标量,绕开了昂贵且主观的专家标注。第三,作者坦诚承认训练与评估共用 ChemCensor 存在部分循环性,但将其论证为功能性设计选择——目标是给终端用户最有实用价值的模型,而非追逐无偏的学术指标。此外,新颖性奖励专门鼓励生成训练集之外但 CC>0 的反应物,从机制上直接对冲记忆化。

核心方法

直观上,作者想让一个 26 亿参数的小模型学会『像化学家一样对一个目标分子一口气给出 15 条互不相同的合理切断方案』。技术路线分三步。第一步是数据:用虚拟合成引擎 VSE 配合约 3000 个专家编码的双向反应模板,从 ChEMBL v34 化合物和 USPTO 独立产品出发穷举逆反应,经 ChemCensor v1.1.1 验证、合并去重后得到 CREED-CCV-2+USPTO-XL——3,680,906 个产品、45,649,785 条反应,每产品平均约 12.4 条候选路径。第二步是监督微调:以 LFM2 2.6B 为基座,在 Top-K 模式下训练 50,000 步,词表加入 SMILES 专用 token,思维链前置确定性模块(输入实体及其 BRICS 片段的规范 SMILES)。第三步是在线强化微调:单奖励 GRPO,组大小 8、学习率 $10^{-6}$、KL 系数 0.1,奖励为 6 个分量的加权和,主项是权重各 1.0 的 ChemCensor 合理性与新颖性。最终模型 C3LM-LFM2-RFT-CC-NR 在 OOD 基准上登顶。

核心创新是把『一对多』作为一等公民贯穿训练与推理两端,与已有方法的本质区别有三。(1)传统 SSRS 模型(LocalRetro、MHNreact、RetroKNN 等)天然输出 top-K 排序列表,而 LLM 此前只被 Top-1 单答案提示评估——本文的 Top-K 提示模式在模板后附加指令 Give me 15 different answers,每目标用 3 个随机模板、每模板最多收集 15 组反应物并独立打分后取均值,让 LLM 首次在多答案协议下与传统模型公平对比。(2)训练侧同步采用 Top-K 模式:仅把训练模式从 Top-1 切换到 Top-K,就使 Av. PT-Top-10 从 0.38 升至 0.98(超过 2.5 倍),增益甚至大于把数据集扩大 7.2 倍(+0.29)。(3)奖励设计上,ChemCensor 奖励把反应在先例库中的匹配置信度重标定为 0-1 标量,新颖性奖励二值化奖励『不在 CREED 穷举列表且 CC>0』的反应物,两者共同把模型推向『合理但新颖』的化学空间边缘而非训练集记忆。

方法步骤详情

方法分四阶段。阶段一,数据构建:ChEMBL v34 化合物与 USPTO 产品经虚拟合成引擎 VSE,用约 3000 个专家编码双向模板穷举逆反应,与旧 CREED-CCV 合并去重后由 ChemCensor v1.1.1 验证,得 CREED-CCV-2(约 290 万产品、3600 万反应)与 USPTO-XL(约 86 万产品、1060 万反应),合成含 3,680,906 产品、45,649,785 反应的训练集,按产品不相交 0.8/0.1/0.1 划分。阶段二,SFT:LFM2 2.6B 基座扩展 SMILES 专用词表并做非规范随机遍历增强,思维链前置 BRICS 片段模块,Top-K 模式训练 50,000 步。阶段三,RFT:GRPO 训练 1,000 步,学习率 $10^{-6}$、KL 权重 0.1、组大小 8、每步 64 组;奖励 $R = 0.1R_{\text{fmt}} + 0.5R_{\text{SMILES}} + 1.0R_{\text{CC}} + 0.2R_{\text{uniq}} + 0.1R_{\text{k}} + 1.0R_{\text{novel}}$,$R_{\text{CC}}$ 把分数从 (0,5) 重标定到 (0,1)、非法 SMILES 记 -1,$R_{\text{novel}}$ 奖励 CREED 列表外且 CC>0 的反应物。阶段四,评估:URSA-expert-2026(100 个 OOD 分子)与 USPTO-50K-test-mini(497 目标)上计算 Max CC 与 Av. PT-Top-K CC,传统模型经 Syntheseus 生成 15 条后同协议计分。整个流程的关键在于每步输入输出明确:模板枚举产出候选反应,ChemCensor 过滤留下有先例支撑的子集,SFT 教会模型单次输出多条互异答案的格式,RFT 则在同一格式下优化每条答案的合理性与互异性。

技术新颖性

技术新颖性体现在四方面。其一,Top-K 训练范式是新的:此前 LLM 逆合成工作(含作者团队前作)都用单答案提示,多样性只能靠多次采样拼凑;本文首次证明『单次生成 K 条互异答案』可以显式训练,且模式切换的增益(Av. PT-Top-10 +0.60)大于数据扩大 7.2 倍的增益(+0.29),确立了基准实践。其二,数据构造路径不同于文献挖掘:CREED-CCV-2+USPTO-XL 由模板引擎主动合成多路径数据,每产品平均约 12.4 条经验证候选,且按产品(而非反应)划分数据集以防泄漏。其三,奖励工程细粒度:6 个分量分别约束思维格式、SMILES 语法、化学合理性、答案唯一性、数量匹配与新颖性,作者通过消融量化了 CC 奖励(+0.04/+0.07/+0.06/+0.02)与新颖性奖励(+0.08/+0.06/+0.08/+0.08)的独立贡献。其四,与 MHNreact 的反应集合交叉分析是一个评估方法论贡献——首次在结构上揭示 LLM 与传统模型探索互补的化学空间,这是单答案精确匹配基准原则上无法观察到的发现。

Data-generation pipeline for the CREED-CCV-2+USPTO-XL training set.
Figure 2: Data-generation pipeline for the CREED-CCV-2+USPTO-XL training set.

实验结果

发现一:Top-K 提示大幅提升 LLM 并改变排名——URSA 的 Av. PT-Top-10 CC 上 Gemini 3.1 Pro 从 0.28 升至 1.08(+0.80)成为最佳 LLM,Grok-4.1 从 0.47 到 0.86,GPT 5.2 反降(0.14→0.12),作者据此建议基准改用 Top-K 模式。发现二:Top-K 训练使 C3LM 的 Max/@3/@5/@10 提升 +0.30/+0.62/+0.70/+0.60,Top-10 提升 2.5 倍以上(0.38→0.98)。发现三:数据集扩大 7.2 倍再贡献 +0.12/+0.13/+0.17/+0.29。发现四:RFT 加分后,C3LM-LFM2-RFT-CC-NR 在 URSA 达 Max 2.16、@3 1.94、@5 1.73、@10 1.37,全面超越最佳传统模型 MHNreact(2.05/1.84/1.62/1.28)、LocalRetro(2.11/1.85/1.59/1.22)与所有 LLM(GPT 5.5 为 1.94/1.68/1.46/1.05);USPTO-50K-test-mini 上 @10 为 1.85、仅次 MHNreact 的 1.90,而传统模型 Max CC 达 4.84-4.86 暴露记忆泄漏。发现五:仅 C3LM-3(+0.4)与 C3LM-5(+0.3)比 MHNreact 产出更多独有合理反应,最佳通用 LLM 均为负(Gemini 3.1 Pro 为 -2.7);30 模型合并前沿达 2.25/2.15/2.04/1.81,距最佳单模型仍有 +0.44(@10)空间,支持集成。结论对 ChemCensor 版本与先例库替换稳健。值得注意的是,@3/@5/@10 上的增益普遍大于 Max 指标,说明各阶段改进主要来自预测多样性的提升而非单点最佳预测的改善,这正是 Top-K 范式的设计意图所在。

Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v1.1.1, USPTO-full as the source of synthetic precedents.
Table 1: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v1.1.1, USPTO-full as the source of synthetic precedents.
C3LM family inventory. TD-1 = CREED-CCV + USPTO; TD-2 = CREED-CCV-2 + USPTO-XL. ∗Trained in prior work.
Table 2: C3LM family inventory. TD-1 = CREED-CCV + USPTO; TD-2 = CREED-CCV-2 + USPTO-XL. ∗Trained in prior work.
Full plausibility-based evaluation in the single-step retrosynthesis Top-K mode.
Table 3: Full plausibility-based evaluation in the single-step retrosynthesis Top-K mode.
Plausibility-based evaluation in the single-step retrosynthesis Top-1 (single-answer) mode.
Table 4: Plausibility-based evaluation in the single-step retrosynthesis Top-1 (single-answer) mode.
Intersection of predicted reactions for URSA-expert-2026 benchmark set with the reference conventional model MHNreact.
Table 5: Intersection of predicted reactions for URSA-expert-2026 benchmark set with the reference conventional model MHNreact.
Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. ChemCensor-U2P2 reference database (USPTO-full ∪ Pistachio Q3 2023).
Table 6: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. ChemCensor-U2P2 reference database (USPTO-full ∪ Pistachio Q3 2023).
Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. ChemCensor v0.5.2.
Table 7: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. ChemCensor v0.5.2.
Comparison of representative top-performing models from each model tier, normalized by metric-specific frontier scores.
Figure 1: Comparison of representative top-performing models from each model tier, normalized by metric-specific frontier scores.
Top-1 → Top-K transition on URSA-expert-2026 (Av. PT-Top-10 CC). Hollow = Top-1 task, filled = Top-K task; line length is the gain ∆ = Top-K − Top-1 (right column, sorted).
Figure 3: Top-1 → Top-K transition on URSA-expert-2026 (Av. PT-Top-10 CC). Hollow = Top-1 task, filled = Top-K task; line length is the gain ∆ = Top-K − Top-1 (right column, sorted).
Intersection between the reactions predicted for the URSA-expert-2026 benchmark set by each LLM and those predicted by MHNreact.
Figure 4: Intersection between the reactions predicted for the URSA-expert-2026 benchmark set by each LLM and those predicted by MHNreact.
Intersection of reactions predicted by LLMs and the conventional SSRS model MHNreact. Values on the right show the difference between the number of reactions unique to the model and those unique to MHNreact (model − MHNreact).
Figure 5: Intersection of reactions predicted by LLMs and the conventional SSRS model MHNreact. Values on the right show the difference between the number of reactions unique to the model and those unique to MHNreact (model − MHNreact).
Intersection of reactions predicted for X404-1768-5005 by C3LM-LFM2-CREED-CCV-2+USPTO-XL and MHNreact.
Figure 6: Intersection of reactions predicted for X404-1768-5005 by C3LM-LFM2-CREED-CCV-2+USPTO-XL and MHNreact.
查看结构化数据
任务指标本文基线提升
单步逆合成(OOD,URSA-expert-2026,100 个专家确认分子) Av. PT-Top-10 CC(ChemCensor v1.1.1,USPTO-full 先例) C3LM-LFM2-RFT-CC-NR:1.37 最佳传统模型 MHNreact 1.28;最佳通用 LLM Gemini 3.1 Pro 1.08 较 MHNreact +0.09(约 +7%),较最佳 LLM +0.29(约 +27%)
单步逆合成(URSA-expert-2026) Av. PT-Max CC 2.16 LocalRetro 2.11(传统最佳);GPT 5.5 1.94(LLM 最佳) +0.05 vs LocalRetro;+0.22 vs 最佳 LLM
单步逆合成(URSA-expert-2026) Av. PT-Top-3 CC 1.94 LocalRetro 1.85;MHNreact 1.84 +0.09 vs 最佳传统模型
单步逆合成(USPTO-50K-test-mini,497 目标) Av. PT-Top-10 CC 1.85(全场第二) MHNreact 1.90(第一) -0.05 略逊;但传统模型 Max CC≈4.84-4.86 暴露数据泄漏,该指标可信度存疑
训练模式消融(CREED-CCV+USPTO,SFT) Av. PT-Top-10 CC(URSA-expert-2026) 0.98(Top-K 训练) 0.38(Top-1 训练) +0.60,提升超过 2.5 倍
数据规模消融(CREED-CCV+USPTO→CREED-CCV-2+USPTO-XL,反应量 ×7.2) Av. PT-Top-10 CC(URSA-expert-2026) 1.27 0.98(小数据集) +0.29
RFT 消融(SFT→+CC 奖励→+新颖性奖励) Av. PT-Top-10 CC(URSA-expert-2026) 1.37(CC+NR) 1.27(仅 SFT) +0.10,其中 CC 奖励 +0.02、新颖性奖励 +0.08

局限与改进

作者承认的局限:(1)训练奖励与评估指标共用 ChemCensor,存在部分循环性,提升部分来自对优化目标的直接拟合,作者辩称这是面向实用性的功能性设计;(2)ChemCensor 不考虑反应条件、溶剂、纯化等实际实验参数,先例库限于专利衍生反应空间;(3)化学多样性仅用 SMILES 精确字符串匹配衡量,缺乏反应类或机理层面的比较;(4)训练数据由模板引擎生成,可能偏向特定化学模式、缺失未知的新型化学转化。我的补充观察:(1)URSA-expert-2026 仅 100 个目标分子,@10 指标上对 MHNreact 的 +0.09 优势很小且未报告方差或显著性检验;(2)基座仅 2.6B 参数,未探索规模效应;(3)全程无湿实验验证,合理性代理与真实可合成性之间的鸿沟未知;(4)传统模型在 USPTO-50K 上 Max CC≈4.9 的泄漏现象反衬该基准已不适任,论文仍将其列为第二基准;(5)新颖性奖励只要求 CC>0(最低置信度档),可能强化『勉强不违规』的低质量反应。

独立分析的弱点

独立分析可见的弱点及其改进方向:其一,合理性不等于可操作性——ChemCensor 只验证反应中心与官能团上下文在先例库中有支撑,不预测产率、条件与选择性,模型给出的『合理』反应在真实实验室未必可行,改进方向是把条件预测模型或产率估计纳入奖励函数。其二,多样性度量过于字面:两条切断策略同族、仅因试剂不同即被计为互异,应引入反应类/机理聚类后的多样性度量。其三,循环性带来评估激励错位风险:后续工作若继续在同一指标上刷分会加剧对 ChemCensor 的过拟合,建议引入留出的专家盲评集作为外部锚点。其四,OOD 基准规模太小:100 个分子不足以区分头部模型(前四名 Max CC 差距仅约 0.25),应扩大并报告置信区间。其五,Top-K 推理协议下每目标需 3 次完整生成(每次 15 答案),推理成本对 API 模型不低,可探索蒸馏到单次高多样性生成。其六,新颖性奖励以『不在 CREED 穷举列表』为条件,若约 3000 个模板覆盖偏窄,模型可能被引导向模板空间内的低价值区域而非真正的新化学,可用多样性正则或机理级新颖性替代。

未来方向

未来方向可从四条线延伸。作者明确提出或暗示的:(1)集成式逆合成系统——传统模型与 LLM 的化学空间互补,30 个模型联合前沿(URSA @10 达 1.81)显著高于任何单模型(最佳 1.37),值得研究用学习的路由器或重排器替代简单并集;(2)把反应条件(溶剂、温度、催化剂)纳入 ChemCensor 式评分与训练奖励,弥补当前只看反应中心的缺陷;(3)将先例库扩展到专利之外(文献、电子实验记录),并加入机理层面的多样性度量。基于本文成果可自然延伸的:(4)把 Top-K 范式推进到多步合成规划,让路线搜索每一步都消费多样的单步候选,提升整条路线的成功率;(5)规模定律研究——2.6B 模型已能超越传统模型,更大基座配合同款数据与奖励的收益曲线值得测绘;(6)闭环验证——把高 CC、高新颖性预测送入自动化合成平台做湿实验,校准合理性代理与真实可行性的相关性;(7)奖励鲁棒性——对抗性探测新颖性奖励能否被低质量反应利用,并探索基于反应类聚类的多样性奖励替代 SMILES 精确匹配。

复现评估

复现难度中等,组件部分可得。开源:ChemCensor 源码在 GitHub(insilicomedicine/ChemCensor),基准持续更新于 dddbench.insilico.com;基座 LFM2 2.6B 有公开 checkpoint;GRPO、Syntheseus、LocalRetro/MHNreact 等基线均公开。数据:CREED 系列在前作已介绍,但本文未明确声明 4565 万反应的 CREED-CCV-2+USPTO-XL 已开放下载,VSE 引擎与约 3000 个专家模板的可用性也未说明,是最大不确定点。算力:SFT 50,000 步、每步 524,288 tokens 上下文,RFT 1,000 步、每步 64 组乘 8 样本,暗示需多卡高端 GPU,论文未披露具体数量与时长。可行路线:拿不到完整数据时,可用公开 USPTO-full 复刻 Top-K SFT——作者已证明仅切换训练模式即带来 2.5 倍 Top-10 提升,该结论在较小数据上也成立;ChemCensor 奖励可直接调用开源实现。总体而言,评估侧复现容易(商业 API 模型除外),训练侧依赖数据发布与可观算力。