TriGlue:面向分子胶诱导三元复合物生成的生物启发式生成模型 TriGlue: a Biology-Inspired Generative Model for Generating Molecular Glue-Induced Ternary Complex
生物启发框架,同时生成分子胶并组装三元复合物。
前置知识
分子胶降解剂(MGDs)
一类结构简单、药物样的小分子,通过结合E3泛素连接酶并重塑其作用表面,招募并稳定目标蛋白(POI),形成E3-胶-POI三元复合物。随后E2酶将泛素转移到POI,被泛素化的POI由蛋白酶体识别并降解,完成靶向蛋白降解。分子胶不同于PROTAC,分子量更小、口服性更好。
理解MGD作用机制是读懂本文把任务拆解为'界面估计+三元复合物生成'两个阶段的生物学依据。
三元复合物(Ternary Complex)
由受体蛋白R、目标蛋白T和小分子配体M三者共同构成的结合体,记为$C=(R,M,T)$。在分子胶场景中,三元复合物的形成决定降解能否发生。本文把复合物中的蛋白表示为残基级图(节点为氨基酸、边为k近邻),配体表示为原子级分子图,并需预测未结合目标蛋白的刚体位姿。
三元复合物生成是本文的核心任务,所有损失函数和评估指标都围绕这个三方结构展开。
SE(3)等变性
SE(3)是三维空间中的旋转-平移群。一个模型具有SE(3)等变性意味着对输入做任意旋转平移变换,输出会做相同变换。这对3D分子与蛋白建模至关重要,因为物理相互作用不依赖于坐标系朝向。本文用EGNN编码蛋白获得等变坐标$Z\in\mathbb{R}^{3\times N}$,并用黎曼流匹配在$SO(3)$上建模旋转。
等变性是界面估计和刚体变换流的数学基础,不理解它就难以看懂Kabsch对齐和$SO(3)$上的flow matching。
流匹配(Flow Matching)
一种连续时间生成范式,通过学习一个向量场把简单先验分布(如高斯噪声或均匀旋转)连续地传输到数据分布。相比扩散模型,流匹配训练更稳定、采样更快。本文为三个量分别建流:旋转用$SO(3)$上的黎曼测地线插值$R_t=\exp_{R_0}(t\log_{R_0}(R_1))$,平移和坐标用欧氏线性插值,原子类型用概率单纯形上的插值。
三元生成网络的三条流(刚体变换/坐标/原子类型)是本文方法主体,理解流匹配才能看懂联合训练目标$\mathcal{L}_{flow}$。
刚体变换与Kabsch算法
刚体变换$X_T=R\tilde{X}_T+t$($R\in SO(3)$,$t\in\mathbb{R}^3$)描述未结合蛋白如何旋转平移到结合位姿。Kabsch算法通过交叉协方差矩阵的奇异值分解$A=U_2 S U_1^\top$给出最优旋转$R^*$和平移$t^*$,是可微的对齐方法。本文用它从虚拟界面点得到一阶刚体初值,再做迭代残差精修。
刚体变换流是三元复合物组装的关键,Kabsch初值+so(3)残差精修是该模块的核心设计。
研究动机
分子胶降解剂是靶向蛋白降解的前沿策略,但计算设计几乎空白。传统发现依赖昂贵耗时的实验筛选,迄今仅鉴定出几百种分子胶。现有AI药物设计方法(如AR、TargetDiff、PocketXMol)本质为二元蛋白-配体结合设计,它们假设单一蛋白上存在预定义结合口袋,无法同时处理配体生成、蛋白-蛋白对接与三元复合物组装这三件紧密耦合的事。DeepTernary虽能预测三元结构,却只针对已知配体做结构预测,不涉及从头药物设计。更棘手的是,分子胶介导的蛋白-蛋白界面在复合物组装前是未知的、无法直接观测,而该界面的兼容性恰恰决定三元复合物能否稳定形成,这构成了根本性难点。
本文的目标是本文的目标是给定一个已结合构象的受体蛋白$R$和一个未知位姿的未结合目标蛋白$\tilde{T}$,从头生成一个小分子$M$,使其诱导$R$与$T$形成有功能的三元复合物,即学习条件分布$p(C|R,\tilde{T})$。这要求同时输出三样东西:全新的分子胶结构(原子坐标$x$与原子类型$a$)、把目标蛋白摆到正确位姿的刚体变换$(R,t)$,以及一个合理的蛋白-蛋白界面。作者希望生成物既化学合法(高QED、可合成性SA合理)、又有强结合亲和力(AutoDock Vina指标低),同时蛋白对接几何上合理(DockQ高、RMSD低)。
与已有工作不同的是,本文的独特切入角度是'生物启发的因式分解':把生成分布拆成界面估计与界面条件下的复合物生成两段——$p(C|R,\tilde{T})=p(I_R,I_{\tilde{T}}|R,\tilde{T})\cdot p((R,M,T)|I_R,I_{\tilde{T}},R,\tilde{T})$。这一分解严格对应分子胶作用的真实生物学过程(先重塑界面再组装复合物),把一个艰难的联合建模问题化为两个可控子任务,且不需要预先给定结合口袋——这是与所有基于口袋的结构化药物设计方法的本质区别。再用椭球参数化几何约束来保证估计出的界面在3D空间中有明确的位置和方向性。
核心方法
TriGlue的整体思路是先直觉后技术:既然分子胶的作用机制是'结合一个蛋白→重塑表面→招募第二个蛋白',那就分两步——先从两个单体蛋白推断它们之间会形成什么样的界面,再在界面引导下同时生成分子胶并对接两个蛋白。技术上由两个耦合模块构成。模块一是SE(3)等变的界面估计模块:用4层EGNN(隐藏维128)编码两个单体,用K个虚拟界面点以注意力加权聚合坐标来捕捉'软表面区域',再用椭球参数化(中心$\mu$、协方差$\Sigma$)约束这些点的几何分布,损失$\mathcal{L}_{ellip}=\|\hat\mu-\mu\|_2^2+\|\hat\Sigma-\Sigma\|_F^2$。模块二是界面条件下的三元流网络,含刚体变换流、坐标流、原子类型流三条独立flow matching。
核心创新点有两处。第一是椭球参数化界面表示:把抽象的虚拟界面点对齐到由界面残基Cα坐标算出的高斯椭球(一阶矩$\mu$+二阶矩$\Sigma$),使界面先验具有可解释的几何意义(位置与各向异性延展),而非松散的点云。第二是'一阶Kabsch初值+迭代so(3)残差精修'的刚体变换流:先用可微Kabsch从虚拟界面点算出$(R^*,t^*)$初值,再用RT块在李代数$\mathfrak{so}(3)$上预测残量$\Delta\omega$并经指数映射$R^*=\exp([\Delta\omega_\times])R^*$精修,同时用界面校正目标蛋白坐标$\hat X_T=R^*\tilde X_T+t^*$。与已有方法的本质区别在于:它是首个同时做分子胶从头生成与三元复合物重建的方法,且把界面先验显式注入生成过程。
方法步骤详情
完整步骤:(1)蛋白编码——把受体$R$、目标$\tilde T$作为残基图,经4层EGNN得到不变特征$F$与等变坐标$Z$。(2)全局虚拟界面——K个注意力头对坐标加权聚合得到虚拟界面点$Y_R,Y_{\tilde T}$,用椭球矩对齐损失训练。(3)三元潜编码——IPA块把两条蛋白与加噪配体编码到统一不变空间。(4)刚体变换流——可微Kabsch给出旋转平移初值$(R^*,t^*)$,RT块在李代数so(3)预测残量并经指数映射迭代精修,损失$\mathcal{L}_{RT}$对旋转用SO(3)黎曼流、对平移用欧氏流。(5)坐标流——先用界面校正目标坐标$\hat X_T=R^*\tilde X_T+t^*$,再用双层消息传递(配体内+蛋白-配体)更新原子坐标,损失$\mathcal{L}_{coor}$。(6)原子类型流——把原子身份映到概率单纯形做连续流,损失$\mathcal{L}_{type}$。(7)联合训练目标$\mathcal{L}_{flow}$加权四条损失,权重设为{0.008, 1.0, 1.0, 10.0}。
技术新颖性
技术新颖性体现在四方面。一是问题定义新:首次把分子胶设计形式化为三元复合物的条件生成任务$p(C|R,\tilde T)$,并明确指出三大挑战(界面未知、界面条件生成、三组件紧耦合)。二是生物启发因式分解,把生成分布写成界面估计与界面条件生成两段乘积,既忠实机理又降维了建模难度。三是椭球几何约束的界面表示,相比PeSTo/ScanNet的残基级点预测,本文用一阶/二阶矩对齐使界面具备方向与延展信息,在JSD、W2、Center-L2、LogDet误差四项指标上全面更优。四是统一的多模态流匹配框架,把旋转($SO(3)$黎曼流)、平移与原子坐标(欧氏流)、原子类型(单纯形流)纳入同一三元去噪网络,并用界面校正把刚体先验注入坐标生成。
实验结果
核心发现分四块。分子生成(Table 1,基线给口袋而本文不给):TriGlue取最低平均RMSD 5.22(AR 8.16、TargetDiff 6.27、PocketXMol 6.74);Vina dock平均-8.28、中位-8.85全面领先,仅Vina min略逊PocketXMol;QED平均0.67、中位0.77最高,但SA(0.58/0.66)逊于PocketXMol(0.79/0.78),归因于后者约$10^8$分子大数据集。蛋白对接(Fig. 3):TriGlue接受率35.2%优于DeepTernary 30.8%,长尾更轻,但DeepTernary最佳情况更高。界面估计(Table 2):本文JSD 0.47±0.15、W2距离12.65±7.89、Center-L2 10.99±7.47、LogDet误差3.83±5.01,全面优于PeSTo/ScanNet(W2约58)。消融(Fig. 6):去椭球先验与去界面校正都使对接变差,去校正更致命,DockQ从0.22降到0.15;t-SNE显示界面特征按结构功能聚成紧致分离的簇。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 生成分子的配体放置精度 | RMSD (↓, 平均) | 5.22 | PocketXMol 6.74 / TargetDiff 6.27 / AR 8.16 | 相比最佳基线PocketXMol,RMSD从6.74降至5.22,降低约22.6%,且本文无需口袋信息 |
| 生成分子结合亲和力 | Vina dock (↓, 平均/中位) | -8.28 / -8.85 | TargetDiff -7.55 / -7.86 ; PocketXMol -7.69 / -7.65 | 平均亲和力提升约0.6-0.7 Vina单位,中位最佳 |
| 药物样性 | QED (↑, 平均/中位) | 0.67 / 0.77 | AR 0.51/0.54 ; TargetDiff 0.47/0.53 ; PocketXMol 0.47/0.49 | 平均QED较次优提升约31%,分子更类药 |
| 蛋白-蛋白对接质量 | DockQ>0.23接受率 | 35.2% | DeepTernary 30.8% | 接受率提升约4.4个百分点,长尾更轻 |
| 椭球界面估计 | Wasserstein-2距离 (↓) | 12.65±7.89 | PeSTo 58.26 / ScanNet 58.96 | W2距离降低约78%,几何对齐显著更优 |
局限与改进
作者承认的局限:SA(可合成性)得分0.58/0.66逊于PocketXMol的0.79/0.78,原因是训练数据规模差异(后者约$10^8$分子覆盖更广化学空间);对接上DeepTernary的最佳情况性能高于本文,说明本文在极端优秀样本上还有差距。我观察到的局限:评估主要依赖AutoDock Vina打分与DockQ等计算指标,缺乏湿实验验证生成分子是否真能诱导降解;任务设定中受体被假设处于已结合构象,回避了受体侧的柔性/诱导契合问题;消融只做了两个变体,未对K(虚拟点数)、EGNN层数、损失权重$\lambda$做系统敏感性分析;数据集TernaryDB来自PDB,可能偏向易结晶的复合物,对真正药物相关E3连接酶(如CRBN、VHL)的覆盖与泛化未充分讨论。
独立分析的弱点
弱点一:化学空间覆盖不足导致SA偏低——改进方向是引入更大规模分子预训练(如用约$10^8$分子预训练配体流)或加入可合成性约束作为奖励,做条件或强化式微调。弱点二:刚体假设过强,未建模蛋白主链/侧链柔性——改进方向是引入受体的构象系综或在小范围柔性refinement上精修,尤其处理诱导契合效应。弱点三:缺乏实验闭环,纯计算指标无法保证生物活性——改进方向是与高通量降解实验(如PROTAC/分子胶筛选平台)对接做主动学习闭环验证。弱点四:界面校正模块依赖一阶Kabsch初值,当两个蛋白本就不应相互作用时可能给出误导性对接——改进方向是加入'是否可成胶'的可信度打分头,对不可成胶对早停。弱点五:仅评估静态结构,未考虑动力学稳定性与泛素化后续步骤——可结合分子动力学模拟评估复合物寿命。
未来方向
作者隐含的未来方向:扩展到更广E3连接酶(CRBN、VHL等 clinically relevant)与更多靶点,并把方法迁移到PROTAC等连接子介导的三元系统。基于成果可延伸的方向:一是把界面先验思想推广到其他'界面决定产物'的生成任务(如抗体-抗原-佐剂、激酶-支架-底物);二是用更大分子预训练模型替换坐标/原子类型流以提升SA与新颖性;三是与实验筛选结合形成干湿闭环,把Vina/DockQ换成真实降解活性做奖励微调;四是从静态结构扩展到动力学,预测三元复合物的形成动力学与 ubiquitination 效率;五是探索多目标采样,在亲和力、选择性、ADMET之间做帕累托前沿搜索,向真正可成药分子靠拢。
复现评估
复现评估较好。代码已在 https://github.com/yuliangyan0807/molecular-glue-design 公开。数据集TernaryDB(22,303个三元复合物,源自PDB)为公开资源,并用MMseqs2按序列相似性聚类、排除已知分子胶复合物以防泄漏,划分与统计在附录G.1给出。训练细节充分:界面模块EGNN 4层、隐藏128、AdamW学习率$5\times10^{-4}$余弦退火1200轮;三元去噪网络用2个IPA块、隐藏128、AdamW线性衰减($5\times10^{-4}$到$4\times10^{-4}$)800轮;损失权重$\{0.008,1.0,1.0,10.0\}$;硬件为8块NVIDIA L40 GPU。基线描述、评估指标(Vina/DockQ/RMSD/QED/SA)在附录G.2-G.4给出。主要门槛是8卡L40的算力需求与PDB衍生数据集的工程处理,但方法与超参透明,整体可复现。
论文图表
图示分子胶降解剂在靶向蛋白降解中的六步机制:分子胶结合E3泛素连接酶并重塑其表面①②、招募并稳定目标蛋白POI形成三元复合物③④、E2转移泛素到POI⑤、蛋白酶体识别并降解泛素化POI⑥。
这张图建立了全文的生物学动机:理解MGD作用机制才能理解作者为何把生成任务拆成'界面估计+三元复合物生成',是motivation章节的核心图。