Chamaileon:基于上下文建模与混合采样的跨上下文结合蛋白设计 Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling
让单条蛋白序列同时适配同一靶点的多种构象或多个不同靶点。
前置知识
结合蛋白设计(Binder Design)
给定一个靶点蛋白的三维结构,从头设计一条全新的蛋白序列,使其能够高亲和力、高特异性地结合到靶点的某个界面上。主流方法如 RFdiffusion、AlphaProteo、BindCraft 通常把靶点结构当条件,用扩散/流匹配模型联合生成结合蛋白的序列和主链结构。
本文要解决的核心任务就是结合蛋白设计,但扩展到多上下文场景;不理解单状态单靶点设计,就无法理解它突破了什么。
多状态与多靶点设计(MS / MT)
多状态(Multi-State, MS)指同一条结合蛋白要绑定同一靶点蛋白在不同功能态下的多个构象;多靶点(Multi-Target, MT)指同一条序列要结合序列/结构不同的多个靶点。两者本质都是“一条序列同时满足多个结合约束”,因此可统一为“跨上下文”问题。
本文把 MS 和 MT 统一成“Cross-Context Binder Design”是全文的核心抽象,理解这个统一视角才能理解 I3CD 和 MoPS 为何能同时处理两类任务。
离散流模型(Discrete Flow Models, DFM)
把连续空间的 flow matching 推广到离散状态空间,用连续时间马尔可夫链(CTMC)的速率矩阵 $R_t$ 描述概率流演化。蛋白序列(20 种氨基酸)通过掩码插值 $p_{t|1}(x_t|x_1)=\mathrm{Cat}(t\delta_{x_t,x_1}+(1-t)\delta_{x_t,M})$ 从掩码状态逐步解码到真实氨基酸。
I3CD 的序列通道就是用 DFM 建模的,理解 $R_t^\theta(x_t,j)=\mathbb{E}_{p_\theta^{1|t}}[R_t(x_t,j|x_1)]$ 和交叉熵训练目标才能看懂训练损失和采样更新。
多模态流匹配(Multimodal Flow Matching)
一个蛋白残基包含 Cα 平移 $x_d\in\mathbb{R}^3$(欧氏空间)、旋转矩阵 $r_d\in SO(3)$(黎曼流形)和氨基酸类型 $a_d$(离散空间)。多模态流匹配用各自合适的几何在不同流形上做去噪,并通过独立的时间调度 $t$ 和 $\tilde{t}$ 耦合序列与结构。
I3CD 的关键创新——序列和结构用解耦的噪声调度——就建立在这个多模态框架上,是支持跨上下文设计的基础。
AlphaFold-Multimer 评估指标(ipAE / pLDDT / scRMSD)
ipAE(interface predicted Aligned Error)衡量链间界面预测的对齐误差;binder pLDDT 是结合蛋白每残基的置信度;binder scRMSD 是把设计的序列重新折叠后与设计结构比较的自洽 RMSD。论文判定成功的标准是 ipAE ≤ 10 Å、pLDDT ≥ 70、scRMSD ≤ 5 Å。
所有实验结果(Table 1、2、5、6)都以这三个指标为核心,beam search 的打分函数 $S(i)$ 也由它们构成,不理解指标就读不懂结果。
In-context 生成与正向折叠
In-context 生成源于计算机视觉:把干净参考信号和噪声生成目标拼接,靠 self-attention 隐式捕捉条件依赖。正向折叠(forward folding)指给定序列预测其结构,是逆向折叠(inverse folding)的逆问题。本文用正向折叠作为“桥梁”,让同一序列在不同构象轨迹间传递。
I3CD 借鉴 in-context 思想做靶点-结合蛋白联合建模,MoPS 用正向折叠把序列信息从一个构象复制到另一个构象,这是 MoPS 能在缺数据下工作的关键。
研究动机
现有从头结合蛋白设计方法(RFdiffusion、AlphaProteo、BindCraft、BoltzDesign1 等)几乎都把任务当作“一对一”问题:针对单个靶点结构、单个结合目标进行优化。这一假设虽然便于基准测试,却与生物学和治疗学中的功能导向需求严重脱节。一方面,许多蛋白质通过在多个构象状态间切换来发挥功能(如信号传导中的别构调控),针对单一快照优化的结合蛋白在靶点重塑表位时可能丧失亲和力——这种多状态(MS)结合蛋白设计要求同时兼容大尺度全局重排的状态依赖界面几何。另一方面,临床疗效常需多靶点协同调控(如双特异性抗体 mosunetuzumab、bimekizumab),希望一条序列满足“结合 A 和 B 但不结合 C”的选择性模式——这是多靶点(MT)设计。然而现有流水线要么逐靶点优化、要么朴素联合优化导致非特异性、要么顺序优化过度拟合某一条件而失败。即使最新的多状态方法(ProteinGenerator、DynamicMPNN、ProDiT、Conformational Biasing)也只关注内在骨架异质性,无法生成能外部调控靶点能量景观的调节型结合蛋白。
本文的目标是本文的目标是构建一个统一的“跨上下文结合蛋白设计”框架。作者把“上下文”定义为任何需要结合的蛋白界面,无论来自同一蛋白的不同构象态(MS)还是不同靶点(MT)。理想中的跨上下文结合蛋白应能结合指定界面、回避其他界面,因此结合蛋白设计本质成为“多对一映射”问题——成功与否由跨上下文集合的综合满足度决定,而非单一界面上的峰值表现。围绕这一目标,论文提出三件事:(1)训练范式 I3CD(In-Context Complex Co-Design),解耦序列与结构的噪声调度以在多构象间维持序列一致性;(2)推理策略 MoPS(Mixture-of-Paths Sampling),在缺数据下迭代优化单条序列使其横跨多个结构上下文;(3)新建基准 CROSS,专门评估多状态和多靶点结合蛋白设计。
与已有工作不同的是,本文的独特切入点在于发现 MS 与 MT 共享同一计算结构——一条序列须在显式权衡下满足多个结合约束——从而提出“跨上下文”这一统一抽象,而以往工作都是把它们割裂对待。这一抽象暴露了现有架构的三处根本缺陷:(i)缺乏解耦的序列-结构噪声调度,无法在多构象联合建模时保持序列一致;(ii)缺乏推理时优化以平衡相互冲突的结构约束;(iii)缺乏跨上下文集合的综合评估。作者进一步借鉴计算机视觉中的 in-context 生成(干净条件 + 噪声目标拼接 + self-attention)并将其推广到多模态蛋白数据,又把正向折叠当作跨构象传递序列信息的“桥梁”,从而绕开多构象配对数据极度稀缺的瓶颈——PDB 中只有约 11,800 个 NMR 系综,仅覆盖 21% 的 CATH 超家族。
核心方法
Chamaileon 整体思路是“先让模型学会条件化地联合去噪靶点-结合蛋白复合物,再在推理时用单条序列把多个上下文的能量约束缝合起来”。技术分三层。第一层是训练范式 I3CD:受视觉 in-context 生成启发,把干净靶点信号与加噪结合蛋白信号在平移、旋转、氨基酸三类模态上拼接喂入图神经网络,靠 self-attention 隐式学习靶点-结合蛋白联合依赖;关键在于用两套独立时间调度 $t$、$\tilde{t}$ 分别腐蚀结合蛋白的序列和结构,让模型在任意噪声强度组合下都能捕捉二者耦合,为跨上下文设计铺路。第二层是推理策略 MoPS:把生成轨迹沿时间离散成 $N$ 段,初始化两个共享序列但结构不同的构象;第一段对构象 0 做联合序列-结构去噪,提取更新后的序列作为条件,对构象 1 做“序列条件生成(正向折叠)”同步推进;下一段交换角色,交替进行到终点,单条序列被反复在两套结构约束间迭代优化。第三层是 beam search:在每个区间边界用复合打分 $S(i)$ 评估 $L$ 条平行轨迹并保留最优者。整套方法用 CROSS 基准评测,形成训练-采样-评估闭环。
最核心的创新是把“正向折叠当作跨构象桥梁”与“解耦噪声调度”结合起来,从而在不引入端到端多状态模型的情况下完成跨上下文设计。直观地说:MoPS 并非训练一个吃 $K$ 个靶点输出 $K$ 个构象的大模型(这条路被数据稀缺和架构刚性卡死),而是只用单状态 I3CD 模型,靠推理时的“角色轮换”让序列在多条结构轨迹间往返穿梭——每段由一条构象负责联合更新序列和自身结构,另一条则通过正向折叠把新序列翻译成自己的坐标。这与 ProteinGenerator 的“对并行轨迹 logit 取平均”、DynamicMPNN 的“学多骨架条件分布”、ProDiT 的“耦合结构扩散”有本质区别:那些方法只建模内在骨架异质性,而 MoPS 是在主动操纵靶点的能量景观。其次,为给结构采样注入 beam search 所需的随机性,作者基于 Fokker-Planck 方程把确定性 ODE 流匹配改写成 SDE,引入噪声项 $\sigma_t$ 并修正漂移项,使翻译模态采样变成 Euler-Maruyama 随机过程。
方法步骤详情
训练(I3CD):取干净靶点 $T_{1,1}$ 与结合蛋白 $B_{1,1}$;对结合蛋白序列、结构分别按 $\tilde{t}$、$t$ 加噪得 $B_{t,\tilde{t}}$,靶点保持干净;二者在三类模态上拼接,加热点掩码 $M_H$ 与时间嵌入,预测 $\hat{B}_{1,1}$;用混合离散-连续流匹配损失(式 6)优化,含翻译 MSE、旋转对数似然与氨基酸交叉熵。推理(MoPS):时间轴离散为 $t_{\tau_0}{=}0<\cdots<t_{\tau_N}{=}1$,初始化两构象共享序列 $a^0{=}a^1$ 但结构不同。第一区间构象 0 走 I3CD 联合去噪(式 7)更新 $x^0,r^0,a^0$;提取新序列作条件对构象 1 做正向折叠(式 8)。下一区间交换角色迭代至终点。Beam search:每段从最优种子并行采 $L$ 条,按 $S(i)$(ipAE、pLDDT、scRMSD 归一化加权)选最优作下段种子;平移模态经 ODE→SDE 化注入 $\sigma_t$ 噪声提供随机性。流程可循环扩展到任意 $K$ 个构象且零额外开销。
技术新颖性
技术新颖性体现在五点。其一,首次提出“跨上下文结合蛋白设计”的统一抽象,把 MS 与 MT 归约为同一种“多对一”映射。其二,I3CD 把视觉领域的 in-context 生成范式首次搬到多模态蛋白数据上,靶点作为条件、结合蛋白作为目标,靠 self-attention 隐式建模依赖。其三,解耦的噪声调度 $t$、$\tilde{t}$ 让序列与结构在不同噪声下协同训练,这是维持跨构象序列一致性的关键。其四,MoPS 用正向折叠做跨构象桥梁,完全绕开多状态配对数据稀缺问题——不需要训多状态模型,单状态 I3CD 即可推理时完成跨上下文设计;并通过 ODE→SDE 的 Fokker-Planck 推导(式 37)为连续模态注入 beam search 所需随机性。其五,框架天然支持“主动负设计”——只需在打分函数中翻转非期望靶点上的得分并在 MoPS 中只交替期望靶点,无需改架构即能排斥非期望构象(Table 6 验证)。此外算法可循环扩展到任意 $K$ 个构象(附录 B、Figure 7),保持 $K$ 条完整轨迹、零额外开销。
实验结果
在 CROSS(100 条)上,完整 Chamaileon 两构象分别取得 ipAE 4.32/4.23、pLDDT 90.6/88.7、scRMSD 1.96/2.07,独特成功 8/10,双构象同时成功(Both Success)7 例。“无 MoPS”基线两构象独特成功严重失衡(17 vs 2)、双成功仅 2;“无 beam search”双成功降到 5。超参上,beam 候选数 $L$ 是主要驱动力(1→4 双成功 5→7),MoPS 频率越小双成功越高(freq=100 的 1 到 freq=10 的 7)。与基线对比(Table 2):RFDiffusion+ProteinMPNN 与 BindCraft 双成功均 0,Chamaileon 达 7,BindCraft ipAE 高达 19.1/18.2。单状态任务:I3CD 独特成功 0.7、新颖性 0.546,对比 APM 的 1.2、0.615,归因于模型规模差 9 倍(21.8M vs 199.6M)。结构分析揭示微调、双面、大切换三种适配模式;主动负设计(Table 6)证明可绑定两上下文并排斥第三上下文。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨上下文结合蛋白设计(双构象同时成功数) | Both Success(在两构象上同时通过 ipAE≤10/pLDDT≥70/scRMSD≤5Å 的独特聚类数) | 7(完整 Chamaileon) | 0(RFDiffusion+ProteinMPNN) / 0(BindCraft 交替优化) / 2(无 MoPS) / 5(无 beam search) | 在没有任何现成跨上下文方法可比的情况下,相对最强构造基线从 0 提升到 7,证明跨上下文设计可行 |
| 跨上下文界面质量(构象 0 / 构象 1) | ipAE(越低越好) | 4.32 / 4.23 | Baseline1: 4.85 / 4.73;Baseline2: 19.1 / 18.2;无 MoPS: 6.26 / 6.27 | 相对 BindCraft 风格基线(18-19)降低约 4 倍;相对自身无 MoPS 也明显改善 |
| 跨上下文结合蛋白结构自洽性 | binder pLDDT / scRMSD(Å) | 90.6/1.96 与 88.7/2.07 | Baseline2: 67.7/1.37 与 68.1/3.20(pLDDT 远低于阈值) | pLDDT 显著高于基线,scRMSD 同时保持在 2Å 左右,兼顾置信度与自洽性 |
| 单状态结合蛋白设计(新颖性) | TM-Score novelty(越低越新颖) | 0.546(I3CD,21.8M 参数) | 0.615(APM,199.6M 参数) | 在模型小 9 倍的情况下,设计新颖性反而更优 |
| 主动负设计 | 非期望上下文 ipAE(越高越好,表示不结合) | 24.0(2-act.&1-neg. 模式) | 22.2(2-context 正向设计,未做负设计) | 通过对非期望靶点取负分,使其结合被有效排斥,无需修改架构 |
局限与改进
作者坦承的局限主要有三:其一,基础模型规模偏小(21.8M 参数,远小于 APM 的 199.6M),导致单状态任务成功率落后于 SOTA(独特成功 0.7 vs 1.2);其二,多靶点(MT)设计本质上极难,在 7 例双成功中只有 1 例是真正意义的多靶点(两靶点仅 94% 序列一致性,ipAE 3.32/3.16),占 14.3%,与 CROSS 中 15% 的 MT 比例吻合,说明 MT 仍主要是“概念验证”;其三,评测依赖 AlphaFold2-Multimer,其本身在多靶点结合保真度评估上的能力有限。我额外观察到几点:CROSS 仅 100 条且通过严格质量筛选,规模偏小,统计显著性有限;以 95% 序列相似度界定“多靶点”可能掩盖了真正的跨靶点难度;全部为 in silico 评估,无湿实验验证;MoPS 频率为 50 时双成功骤降到 1(Table 1),方法对超参较敏感;SDE 注入的噪声虽服务于 beam search,但可能在高置信区域引入不必要扰动。
独立分析的弱点
弱点一:基础模型容量不足。21.8M 参数导致单状态任务被 APM 反超,建议沿 Proteina、Boltz 等方向做参数和数据的协同扩展,或用预训练蛋白语言模型/结构预测模型初始化。弱点二:真正 MT 设计能力薄弱。7 例双成功仅 1 例 MT,建议专门构建更大规模、靶点序列差异更大的 MT 数据集,并在 MoPS 中引入更精细的靶点对齐先验。弱点三:评测过度依赖 AF2-Multimer。AF2 自身对多构象/多靶点保真度有限,建议引入 Chai-1、Boltz-2 等独立预测器做交叉验证,并补充 MD 模拟和湿实验结合 assay。弱点四:CROSS 规模小且质量筛选严格,统计稳健性不足,建议扩展到全 1,867 候选并报告置信区间。弱点五:方法对 MoPS 频率敏感(freq=50 双成功仅 1,freq=10/20 才到 7),缺乏自适应频率调度机制,建议根据构象 RMSD 差异动态调整切换频率。弱点六:SDE 噪声尺度 $\sigma_t$ 的选择缺乏系统消融,可能在不同任务上需要不同设定。
未来方向
作者明确指出三个延伸方向:(1)从离散状态推广到连续构象景观,处理靶点的连续动力学而非少数快照;(2)整合更精细的生物物理先验以增强界面互补性;(3)把跨上下文建模推向“可编程”的调节效应与多特异性治疗,覆盖别构调控、广谱中和、构象系综操控等场景。基于本文成果我认为还可延伸:把 I3CD 与 AlphaProteo/Boltz 级别的大模型结合做 scale-up;用 RLHF/Flow-GRPO 思路把 AF2 评分直接做成可微奖励,端到端优化 beam search 打分;把 MoPS 的循环机制用于设计三态以上的逻辑门结合蛋白(如“结合 A、B 不结合 C、D”);探索主动负设计与肿瘤逃逸靶点排斥的结合;将框架迁移到抗体 CDR 设计、酶-底物多状态结合等其他多上下文场景。
复现评估
复现友好度较高。代码已开源在 https://github.com/caohengyuan/Chamaileon。训练数据来自公开 PDB,过滤规则明确(分辨率 ≤5Å、链长 ≥16、总长 ≤512、最近残基对 <8Å、ipAE ≤10Å、pLDDT ≥80、ipTM ≥0.5),最终 60,692 对;CROSS 基准基于公开 CoDNaS 簇构建,从 1,867 候选筛到 100 条的过程与复合打分都给出。训练配置详尽:8×A100 80GB、AdamW、动态 batch、88 epochs。关键超参在 Table 1、Table 7 系统消融(默认 $\omega_{ipae}=0.5,\omega_{plddt}=0.3,\omega_{rmsd}=0.2$,$L=4$,MoPS freq=10)。算法 1 给出 MoPS+beam search 伪代码,附录 A/C 给出 DFM 与 ODE→SDE 完整推导。主要门槛在于:需 8 张 A100 级算力;AF2-Multimer 评估耗时;模型仅 21.8M 参数,复现者需自行决定是否放大规模,否则单状态性能难追 SOTA。
论文图表
左图展示多状态(MS)设计:同一靶点的非活性态与活性态两个构象,需要一条结合蛋白在靶点功能切换、表位重塑后仍维持界面兼容;右图展示多靶点(MT)设计:同一条序列需高亲和力结合不同蛋白上的相似表位。
这张图直接定义了全文的核心问题抽象——把 MS 和 MT 统一为‘跨上下文’,是理解所有后续方法的入口。