3D-Fit:空间约束下大语言模型结合分子生成能力基准测试 Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
提出3D-Fit基准,评测LLM在多重3D空间约束下的分子生成能力
前置知识
基于结构的药物设计 (Structure-Based Drug Design, SBDD)
SBDD 利用靶点蛋白的三维结构,结合其他空间约束,来生成能够结合到蛋白口袋(pocket)的候选小分子。蛋白口袋是蛋白表面能容纳配体的空腔,由构成空腔几何与理化环境的残基原子确定。本文中口袋通过对参考配体中心 10 Å 距离截断内的所有残基原子来界定。SBDD 的核心目标是让生成分子在三维空间中既满足结合几何,又满足药效、成药性等多重约束。
整篇论文的背景与评测目标都建立在 SBDD 之上:理解什么是口袋、配体如何与蛋白残基相互作用,才能理解 3D-Fit 所评测的四类空间约束,以及为什么把分子准确放进口袋并形成正确相互作用是难度极高的任务。
口袋条件扩散模型 (Pocket-Conditioned Diffusion Models)
这是一类用 SE(3)-等变扩散过程联合生成分子坐标与原子类型的专用模型,典型代表有 TargetDiff、MolDiff、DiffSBDD、DiffBP、MolSnapper、PocketXMol、PDMD 等。它们以蛋白口袋为条件,去噪式地生成三维分子。部分工作还支持辅助几何条件,如锚定片段(DiffDec、FDC-Diff)、药效团点(MolSnapper)或强制口袋-配体相互作用(IPDiff、DiffPharma)。本文把它们作为 LLM 的强基线对照。
本文要回答的核心问题是:通用 LLM 在三维分子生成上与这些最先进的专用扩散模型差距多大。不理解扩散基线的能力和它们各自支持的条件类型,就无法理解作者为何挑选 MolSnapper、PocketXMol、DiffSBDD 等作为对照,也无法判断 LLM 的成绩是好是坏。
药效团 (Pharmacophore) 与锚定片段 (Anchor Fragment)
药效团点描述配体与靶点识别结合所必需的相互作用特征(氢键供体/受体、疏水基团、芳环、正/负可电离基团等)的三维空间排布,是靶点相关的可解释结合模式抽象。锚定片段则是参考配体结合构象中被期望保留或近似重现的化学重要子结构,本文用 BRICS 算法切分出含 3–8 个重原子的片段。两者都是约束分子生成几何的常见手段。
药效团点和锚定片段是 3D-Fit 的两类核心空间约束,论文发现 LLM 在这两类约束上表现最好(因为约束的文本描述与输出条目形式高度相似),而在强制相互作用点上表现差。理解这两个概念才能理解论文关于'约束形式越接近输出形式越容易被满足'的核心洞察。
PoseBusters 与 UniDock 评分
PoseBusters 是一套三维分子合理性检查工具,本文将其分为分子内(PB Intra:键长、键角、内部空间位阻、芳环平面性、非芳环非平面性、双键平面性)与分子间(PB Inter:蛋白-配体最大距离、最小距离、体积重叠)两组指标。UniDock 则是分子对接打分(中位数,单位 kcal/mol,越低越好),本文以 $-6$ kcal/mol 为阈值,高于该值用红色标红,表示结合力弱或存在严重空间冲突。
这两个是论文最核心的评测指标。PB Intra/PB Inter 衡量分子自身构象合理性与相对蛋白的放置合理性,UniDock 评分则直接衡量结合强度。理解它们的含义和阈值,才能看懂四张结果表里哪些数字是'好'的,也才能理解'LLM 满足了局部约束但几何不合理'这一核心结论。
SDF 与简化 SDF (Simplified SDF) 分子表示
SDF(Structure-Data File)是描述分子三维结构的经典文本格式,包含原子坐标、电荷和键连接表,但含大量冗余字段。本文提出简化 SDF:先逐行列出每个原子的索引、符号、坐标、电荷,再以'原子对+键型'方式列出连接性,丢弃冗余字段并使用显式索引。例如丝氨酸两性离子形式可被大幅压缩。该格式既贴近 LLM 训练语料中 SDF 家族,又显著减少 token 数与格式脆弱性。
输出格式的选择是 3D-Fit 的关键技术贡献之一。论文实验表明简化 SDF 在几乎所有指标上都优于 SMILES+XYZ 这类 token 高效表示,作者假设正是因为主流 LLM 见过大量 SDF 类语料,且能先写坐标再写连接。不理解输出格式就无法理解作者如何让 LLM 可靠地产出可解析的三维分子。
研究动机
基于结构的药物设计(SBDD)需要在三维空间中同时满足多种异质空间要求,例如生成分子既要贴合蛋白口袋几何,又要复现关键结合相互作用、保留锚定片段、满足药效团点。专用扩散模型(如 TargetDiff、MolDiff、DiffSBDD、MolSnapper 等)在标准口袋条件下生成质量领先,但要把多种尺度、刚性、重要性各异甚至互相冲突的约束塞进同一生成过程仍非常困难,需要精细的模型设计、条件编码与稳健的训练/推理。另一方面,大语言模型在计算化学与药物发现任务上进展迅速,天然擅长处理复杂指令、同时满足多重约束,少数工作(XYZTransformer、BindGPT、nach0-pc)还用文本形式的 3D 结构训练了专用语言模型。然而通用 LLM 是否真正具备显式推理物理与三维空间环境的能力,基本未被系统验证——这是一个明显的认知空白。
本文的目标是本文目标是系统评估当前最先进的通用 LLM 能否在复杂 3D 分子设计中'看懂、推理、并准确生成'满足广泛几何结构约束的配体。具体而言,作者想突破仅有口袋条件的配体生成范式,引入更丰富、结构上更明确的生成条件(特定相互作用模式、药效团特征、片段锚定),反映药物化学家在形成分子假设时常用的标准。为此作者构建了基于 CrossDocked2020 与 PLINDER 测试复合物的合成基准数据集,并提出 3D-Fit 框架:评测口袋条件、单约束(锚定片段/药效团)、强制相互作用、以及多约束组合下的生成质量,分析 LLM 的成功率与失败模式,并与最先进的扩散方法对比。
与已有工作不同的是,本文独特切入角度有三:第一,把条件空间从单一'口袋'扩展到蛋白口袋+强制口袋-配体相互作用+锚定片段+药效团点的多属性组合,并为每类约束设计了 token 高效的文本描述,使通用 LLM 无需重训即可接受这些 3D 条件。第二,提出简化 SDF 输出格式与专门的提示协议,专门为三维分子生成而设计,并做消融证明其优于 SMILES+XYZ。第三,第四类'四约束联合'设定没有任何已知的扩散或其他模型原生支持,而 LLM 只需提示即可在该设定下被评测,凸显了 LLM 在多条件灵活性上的独特优势。这种'统一文本条件+统一文本输出+多条件渐进评测'的组合是以往单点工作所没有的。
核心方法
3D-Fit 是一个对多重 3D 条件进行施加与评测的分子生成框架。直觉上:把蛋白口袋、相互作用、锚定片段、药效团点全部转写成 LLM 能直接读懂的紧凑文本,让 LLM 用统一的简化 SDF 格式吐出三维分子,再用对接打分与 PoseBusters 双支柱来判定成功与否。技术路线上,框架以任意口袋-配体复合物测试集为条件来源(本文用 CrossDocked2020 v1.3 与 PLINDER 2024-06/v2),每个测试样本以蛋白口袋为主条件,最多叠加三个附加条件(强制相互作用、锚定片段、药效团点)。对每个样本的口袋-配体复合物在每条坐标轴上随机平移最多 50 Å,以防 LLM 因测试集泄漏而记忆坐标。模型以温度 1.0、top-p 1.0、最多 8192 新 token(不含推理 token)、推理强度设为'high'进行采样,且禁用联网搜索与外部工具。
核心创新在于'用文本统一表征一切 3D 条件与输出'。蛋白口袋用按残基顺序的紧凑描述,每条氨基酸写作'Residue 3, TYR',再逐原子写出名称与三位小数坐标(如'CB at (3.255, −1.106, 8.438)'),并采用氢去除的蛋白进一步省 token;相互作用写作'Hydrophobic interaction with Residue 13, GLU, Chain A';锚定原子写作'Carbon (C) within 0.5 Angstroms of (x, y, z)'用球容差区域约束;药效团点写作'Hydrogen bond acceptor within 0.5 Angstroms of (x, y, z)',方向性留给模型从口袋描述推断。输出端用简化 SDF 取代冗余的 PDB/SDF。这套设计与以往'专用模型+专用几何编码'本质不同:它不训练新模型,而是榨取通用 LLM 的指令遵循与对 SDF 类语料的已有知识,使多条件生成在提示层面即可组合。作者也通过消融证明简化 SDF 在几乎所有指标上优于 SMILES+XYZ。
方法步骤详情
方法分四步。第一步数据准备遵循五原则:(i) 文献一致测试划分(CrossDocked 用下采样版 test split 0,PLINDER 用官方测试集);(ii) 配体与蛋白需能被 ProDy 与 RDKit 加载;(iii) CrossDocked 仅保留 RMSD $< 0.5$ Å 且 Vina 打分 $< -6$ 的复合物;(iv) 保留重原子数 $> 25$ 的类药分子;(v) 口袋取距参考配体中心 10 Å 内残基。最终 CrossDocked 948 个、PLINDER 505 个复合物。第二步条件采样:相互作用用 ProLIF 提取随机取 1 条;锚定片段用 BRICS 切分选 3–8 重原子片段;药效团点用 Pmapper 注解随机取 1 个。第三步把条件文本连统一提示喂给 LLM 产出简化 SDF。第四步评测:报告全部输出的 SR,再评估分子有效性(Parsed、N Hvy、RO5)、PoseBusters(PB Intra/PB Inter)及条件满足度(UniDock 打分+各条件点三维放置判定,区分 Raw 优化前与 Optimized 优化后)。
技术新颖性
技术新颖性体现在四点。其一,首个覆盖四类空间约束、并能渐进叠加的多条件三维分子生成基准,且对每个结构提供多套空间条件,数据规模与鲁棒计算指标齐备,区别于 CBGBench(偏 2D 子结构)、POKMOL-3D(仅 32 个靶点口袋)、Durian、MolGenBench 等已有基准。其二,提出 token 高效的口袋/相互作用/片段/药效团文本表示与简化 SDF 输出,专门为 LLM 评测而设计,并经消融验证优于 SMILES+XYZ,作者归因于 LLM 训练语料中 SDF 家族占比高且'先坐标后连接'更友好。其三,评测协议兼顾双支柱:既看局部条件是否被满足,又看 PoseBusters 分子内外合理性与 UniDock 结合打分,能区分'约束被满足但几何崩坏'的情形。其四,第四类四约束联合设定任何已知扩散模型都无法原生支持,而 LLM 仅靠提示即可被评测,凸显了 LLM 在多条件组合灵活性上的独特价值。
实验结果
结果揭示清晰规律:LLM 展现遵循空间约束的新兴能力,但仍落后最强专用扩散模型。仅口袋条件(Table 1)下最强 LLM 为 GPT 5.5,优化后 UniDock 打分 CrossDocked(CD) $-6.5$、PLINDER(PL) $-6.1$,PB Inter 达 99/100,Parsed 接近 99–100%,但分子内合理性 PB Intra 仅约 23/30;最强扩散 MolSnapper 达 UniDock CD $-6.8$→$-8.6$、PL $-6.2$→$-8.2$。关键发现:所有 LLM 原始(Raw)UniDock 打分均高于 $-6$ 阈值甚至为正,说明原始构象与口袋严重冲突;优化后约 $-6$ 至 $-7$ 区间但仍不及扩散模型。另一核心规律是'加约束反提升口袋指标':四约束(Table 4)下 GPT 5.5 的 PB Inter 达 CD/PL 99/99。此外 LLM 在锚定片段与药效团点上 SR 高,强制相互作用点上差;GPT 5.5、Opus 4.8、Gemini 3.1 较强,Qwen 3.5、GLM 5 落后。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 仅口袋条件 3D 分子生成 (CrossDocked/PLINDER) | UniDock 打分 (中位数 kcal/mol,越低越好) | GPT 5.5 优化后 CD -6.5 / PL -6.1;LLM 原始打分均 > -6 | MolSnapper CD -8.6 / PL -8.2;PocketXMol CD -8.2 / PL -7.1 | LLM 仍落后最强扩散约 1.6-2.5 kcal/mol,但经优化可达中等等级 |
| 仅口袋条件分子间合理性 | PoseBusters Inter-Molecular 通过率 (%) | GPT 5.5 优化后 CD 99 / PL 100 (原始仅 6/9) | MolSnapper CD 99 / PL 98 | LLM 优化后分子间合理性接近专用模型,但原始构象极差 |
| 仅口袋条件分子内合理性 | PoseBusters Intra-Molecular 通过率 (%) | GPT 5.5 CD 23 / PL 30 | MolSnapper CD 89 / PL 90;DiffSBDD CD 70 / PL 71 | LLM 分子内构象合理性明显弱于专用模型,差距悬殊 |
| 四约束联合生成 (口袋+相互作用+锚定+药效团) | Pocket PB Inter 与条件 SR (%) | GPT 5.5 PB Inter CD/PL 99/99,多条件下口袋指标提升 | 无原生支持该设定的扩散模型 | LLM 在该全新设定下唯一可评测,多约束反而改善口袋放置 |
局限与改进
作者承认三方面局限:其一,实验结果缺乏统计显著性检验,作者权衡后选择评测更多可用模型而牺牲显著性分析;其二,锚定片段采用随机片段而非药化上重要的骨架(scaffold),将其视为与化学有效性和蛋白环境无关的纯 3D 约束;其三,尽管所开发的采样策略支持更多药效团点与强制相互作用点,实验中每类仅用 1 个点。我额外观察到:第一,扩散模型与 LLM 的对比并非完全公平,专用模型针对特定条件子集训练,而 LLM 是零样本提示;第二,PB Inter 高通过率并不等价于好的结合姿势(DiffSBDD、DiffPharma、SeFMol、IPDiff、BindDM 能过很多分子间过滤但 UniDock 打分偏弱),单一指标易误导;第三,原始构象普遍很差这一现象说明 LLM 输出的几何质量高度依赖后处理优化,若去掉 UniDock 优化,LLM 实用性会大打折扣。
独立分析的弱点
弱点一:LLM 输出分子的内部构象合理性差(PB Intra 仅约 20-40%),意味着生成的键长、键角、环平面性等常出错,改进方向是引入三维几何约束的后验修复或几何感知的解码约束。弱点二:原始(未优化)构象与口袋严重冲突,Raw UniDock 打分普遍高于 $-6$ 甚至为正,改进方向是在生成时显式建模口袋排斥体积或加入对接引导的拒绝采样。弱点三:在抽象的强制相互作用点上表现差,说明 LLM 对特定蛋白-配体相互作用理解不足,改进方向是用相互作用-构象对齐的示例做少样本提示或微调。弱点四:评测缺乏统计显著性,且只随机取 1 个药效团/相互作用点,未压测高约束密度,改进方向是增加每个样本的条件数与重复采样并做置信区间估计。弱点五:LLM 与专用扩散模型对比并非完全同条件(零样本提示 vs 专项训练),改进方向是补充'同样数据微调的 LLM'对照组以隔离能力来源。
未来方向
作者明确提及:3D-Fit 框架支持额外的运行时采样与未来强化学习应用,只要测试复合物不用于训练即可;作者希望该基准推动领域专用训练、更好的三维分子表示、以及更可靠的多约束 SBDD 评测。基于成果可延伸的方向包括:其一,将简化 SDF 与多条件文本表示用于对开源 LLM 的监督微调或 RLHF,专门提升三维几何合理性;其二,把 LLM 的多条件灵活性与扩散模型的几何质量结合,构建'LLM 提议+扩散精修'的两阶段混合生成器;其三,扩展到骨架(而非随机片段)锚定与多药效团/多相互作用的高密度约束设定,逼近真实药化场景;其四,引入对接引导的推理时搜索(如 beam search + UniDock 反馈)以直接改善原始构象质量。作者也强调需要误用感知过滤、高风险场景的访问控制与化学结构安全防护。
复现评估
复现性整体较好。作者声明基准代码与数据可通过 https://github.com/insilicomedicine/bench-3d-fit 获取,数据基于公开的 CrossDocked2020 v1.3(948 个复合物)与 PLINDER 2024-06/v2(505 个复合物)测试集,条件提取依赖成熟开源库 ProDy、RDKit、ProLIF、Pmapper、PoseBusters、UniDock,评测流程标准化。LLM 评测参数明确(温度 1.0、top-p 1.0、最多 8192 新 token、推理强度 high、禁联网与工具),但闭源模型(GPT 5.5、Opus、Gemini、Grok)版本会随时间漂移,长尾复现存在风险;开源模型(Qwen-3.5、DeepSeek v3.2、GLM-5)可固定权重。算力方面,评测主要消耗 API 调用费用与对接计算,未见超大训练成本。主要难点在于完整复现需要 API 额度、对接工具链配置,以及严格对齐论文中的条件采样随机种子,这些是潜在门槛。
论文图表