大型发现模型:经验校准的开放式科学搜索 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
LLM提议候选、高斯过程校准不确定性,采集函数统一调度推理算力与昂贵实验,实现跨域科学发现
前置知识
贝叶斯优化(BO)与采集函数
一种面向昂贵黑盒函数的全局优化方法:用概率代理模型(通常是高斯过程)拟合已观测的(设计, 回报)数据,得到每个候选点的预测均值 $\mu(x)$ 与不确定性 $\sigma(x)$,再由采集函数决定下一个评估点——例如 UCB 取 $a_t(x)=\mu_t(x)+\sqrt{\beta_t}\,\sigma_t(x)$,或期望改进 EI。采集函数在“选当前预测最优”(利用)与“选信息量大的点”(探索)之间自动权衡。
LDM 的价值信号就是 BO 的采集函数,论文的方法构造、理论分析和“EI/UCB 优于后验均值”的消融实验都建立在这套语言之上。
高斯过程(GP)
函数空间上的贝叶斯非参数模型:以正定核 $k(x,x')$ 刻画设计点之间的相似性,先验是函数上的分布,观测数据后可闭式得到后验,对任意候选给出预测均值 $\mu_t(x)$ 与方差 $\sigma^2_t(x)$。它样本效率高、支持精确贝叶斯更新、在未探索区域给出有原则的不确定性估计,但精确推断的代价是观测数量的三次方复杂度。
LDM 用 GP 作为奖励代理模型,论文 regret 界中的信息增益项 $\gamma_T$ 与“GP 立方复杂度限制规模”这一局限都直接源于 GP 的数学性质。
KL 正则化变分策略与 Gibbs 变分原理
形如 $\max_q \mathbb{E}_{x\sim q}[a(x)] - \frac{1}{\eta}\mathrm{KL}(q\|p)$ 的优化问题,其唯一最优解是指数倾斜分布 $\pi(x) \propto p(x)\exp\{\eta a(x)\}$。它是最大熵强化学习、control-as-inference 和 KL 正则化 RLHF 等方法的共同数学基础,$\eta$ 控制偏离参考分布 $p$ 的强度。
论文公式 (2)(3) 的核心搜索分布由此导出;$\eta$ 的含义(LLM 先验与采集价值的权衡)以及两个极限情形($\eta\to 0$ 纯 LLM、$\alpha\to 0$ 纯 BO)的讨论都依赖这一原理。
测试时计算与 best-of-N 搜索
不改变模型权重,而是在推理阶段生成多个候选($N$ 个采样、思维链、树搜索等),再用验证器或打分器挑出最好的一个。在数学、代码等“解难找但易验证”的领域收益显著,且性能随候选数 $N$ 增长(测试时扩展律),代表系统包括 OpenAI o1 与 DeepSeek-R1。
LDM 把这一范式推广到反馈昂贵、没有廉价验证器的科学领域:候选池大小 $N$ 就是其测试时算力的旋钮,消融实验(N4H4 vs N8H8)正是检验这一扩展行为。
认识论象限与利用-探索-发现三模式
论文借用 Rumsfeld 矩阵把设计空间分为四类:已知已知(已评估且理解,$\sigma$ 小)、已知未知(可表示但不确定,$\sigma$ 大)、未知已知(外部数据库中存在但未检索)、未知未知(当前搜索根本够不着)。对应三种操作:利用(在已知已知中选优)、探索(评估已知未知以降低不确定性)、发现(扩展搜索支撑集,把未知未知变为已知未知)。
这是全文的形式语言:LDM 的“发现”机制(反思扩展搜索维度)与相关消融都围绕“发现 ≠ 探索”这一区分展开,不理解它就无法读懂论文的核心主张。
Pareto 前沿与超体积(Hypervolume)
多目标优化中,Pareto 前沿是无法在不牺牲任一目标的情况下同时改进的解集合;超体积以固定参考点度量前沿所支配区域的体积,是常用的多目标综合指标,越大越好。期望超体积改进(EHVI)是把这一指标变成采集函数的标准做法。
分子实验(KRAS G12D 双目标)以超体积为主指标、EHVI 为采集函数,理解该指标才能正确解读 27.325 vs 16.751 等实验数字。
研究动机
科学发现需要在巨大、结构化且开放的设计空间(分子、蛋白序列、计算机程序)上优化评估昂贵的目标函数,现有两条路线各有硬伤。纯 LLM 路线:LLM 的似然与自我评估并不能可靠代理外部科学属性和校准的认知不确定性——Gupta et al. (2025) 发现 LLM 在 BO 任务中对实验反馈几乎不敏感,线性 bandit 和 GP 优化稳定胜过 LLM agent;PaperBench 上最强 agent 复现 ICML 论文仅得 21.0%(PhD 对照 41.4%),ResearchClawBench 上最强自主 agent 只得 21.5/50。具体到本文测试床,Karpathy 的 AutoResearch 中 LLM-only 反思循环从 val_bpb=1.0069 出发,约 255 次训练运行后停滞在 0.9767,难以继续改进。纯统计路线(BO):虽然提供校准的不确定性和样本高效的实验分配,但搜索空间和候选生成机制必须预先指定——组合 BO(TURBO/COMBO)面对 $20^{11}$ 的抗体 CDRH3 序列空间难以有效提出候选,带字符串核的多目标 MOBO 在约 40 次评估后就被困在有限的化学区域而停滞。
本文的目标是本文的目标是构建一个通用的“发现引擎”:把科学发现形式化为预算受限的序贯逆向设计问题——在无法枚举的设计空间 $\mathcal{X}$ 中,代理每轮决定“下一个评估哪个候选”。理想系统应同时具备两种互补能力:(1) 像 LLM 那样在结构化空间(程序文本、氨基酸序列、SMILES)中提出并修改语义合理的新候选,持续扩展搜索前沿;(2) 像 BO 那样基于少量昂贵观测建立校准的概率代理,用不确定性感知的价值信号(而非模型内部置信度或语言合理性)来分配测试时算力与实验预算。验证标准是同一套框架在三个差异巨大的领域——神经网络训练程序搜索(AutoResearch)、抗体 CDRH3 设计、KRAS G12D 多目标分子优化——都超过 LLM-only 反思与传统统计搜索两类基线,并有清晰的 regret 理论刻画。
与已有工作不同的是,独特切入点有三层。第一,论文借用 Rumsfeld 矩阵把“不确定性”与“可达性”分开:已知已知/已知未知/未知已知/未知未知四个认识论象限,并把传统 BO 的利用-探索二分扩展为利用-探索-发现三分——发现不是“评估一个未测候选”(那只是探索),而是改变搜索支撑集本身,让此前不可表达的候选家族进入可建模范围。第二,把 LLM 形式化为无限臂赌博机中的“储库”(reservoir)$p_{\theta,\alpha}(\cdot|C_t)$:臂(设计)无法预先列出,只能按储库分布逐步揭示,这使 LLM 的角色被严格限定为候选发生器而非价值评估器,直接回应了“LLM 不确定性不可靠”的实证批评。第三,用 Gibbs 变分原理导出闭式的采集倾斜分布 $\pi_t \propto p_{\theta,\alpha}\exp\{\eta a_t\}$,使采集函数(而非奖励模型分数)成为同时支配推理算力分配与实验预算的唯一价值信号,把测试时扩展从廉价验证器域推广到昂贵黑盒反馈域。
核心方法
直觉上:LLM 是“语义搜索引擎”,决定能提出什么;GP 是“经验校准器”,基于已评估数据 $D_t$ 给出每个候选的预测均值 $\mu_t(x)$ 与认知不确定性 $\sigma_t(x)$;采集函数 $a_t(x)$(如 UCB:$a_t=\mu_t+\sqrt{\beta_t}\sigma_t$)把二者合成为“值不值得继续投入”的决策价值,同时调度两件事——测试时算力往哪些候选细化分支上花、昂贵实验名额给谁。技术路线是一个循环:每轮先确定活动决策域 $A_t=\mathrm{supp}\,p_{\theta,\alpha}(\cdot|C_t)$(LLM 直接生成候选,或间接参数化一个搜索区域让外部采样器填充),在其上用 $D_t$ 拟合 GP 后验;然后从 LLM 抽取 $N$ 个候选并逐个打采集分,按 $\mathrm{softmax}(\exp\{\eta a_t\})$ 随机采样(Gumbel-top-b)或确定性 top-b 选出评估批次 $B_t$;外部评估返回含噪奖励 $r\approx R(x)+\epsilon$ 后更新数据集 $D_{t+1}$ 与上下文 $C_{t+1}$。当进度停滞,反思机制让 LLM 重新参数化搜索空间(增删维度),触发“发现”步骤。跨任务层面还有一个慢循环:把高预算搜索积累的(状态、候选、采集值)轨迹做成 LDM-TTS 数据集,按采集权重蒸馏回模型权重。
核心创新是用“采集价值”而非“奖励分数”作为搜索与训练的监督信号。已有 LLM 研究系统要么依赖人类偏好价值(RLHF 对齐),要么依赖可验证答案的验证价值(RLVR/o1 式推理),要么直接模仿高奖励的最终解;LDM 则学习“当前研究状态下,下一个实验动作的认知价值”——它同时平衡预测质量 $\mu_t$、认知不确定性 $\sigma_t$、约束满足与 Pareto 前沿扩张,因此一个动作即使不立刻最大化均值也可能极有价值(类比 AlphaZero 的 Move 37:走出高信息量的探索手)。数学上,KL 正则化目标 $\max_q \mathbb{E}_q[a_t] - \frac{1}{\eta}\mathrm{KL}(q\|p_{\theta,\alpha})$ 的最优解是指数倾斜分布 $\pi_t(x)=\frac{1}{Z_t}p_{\theta,\alpha}(x|C_t)\exp\{\eta a_t(x)\}$,该公式把两个已有范式统一为极限情形:$\eta\to 0$ 退化为纯 LLM 生成搜索,$\alpha\to 0$ 且 $\eta$ 大则回到经典 BO。与 LLAMBO、OPRO、BoChemian 等 LLM-BO 混合方法的本质区别在于:校准的贝叶斯后验被显式保留,LLM 只充当候选储库,采集函数直接决定推理算力分配而不只是事后过滤器。
方法步骤详情
完整流程(Algorithm 1/2)是六步循环。(1) 更新活动域 $A_t\leftarrow\mathrm{supp}\,p_{\theta,\alpha}(\cdot|C_t)$:由 LLM 上下文 $C_t$(含全部评估历史、代理预测、约束反馈、反思总结)决定本轮可搜索的参数化子空间。(2) 在 $A_t$ 上用 $D_t$ 拟合 GP(依域选 RBF 核或 SMILES 子序列字符串核),得后验 $\mu_t,\sigma_t$。(3) 构造采集函数:单目标用 EI 或 UCB $a_t=\mu_t+\sqrt{\beta_t}\sigma_t$,多目标用 EHVI。(4) 采集引导的推理时采样:从 LLM 抽取 $N$ 个候选 $\hat{x}_{t,1..N}$(AutoResearch 中 $N\in\{4,8\}$,每个再扩展 $H$ 个假设/细化分支,如 N8H8 每轮打分 64 个节点),逐个计算采集分,确定性模式取 top-b,随机模式按权重 $w_i=\exp\{\eta s_i\}$ 做 Gumbel-top-b 无放回采样得批次 $B_t$。(5) 将 $B_t$ 送外部评估器(nanoGPT 固定 300 秒训练、Absolut! 结合能、AutoDock Vina+神经网络打分),观测 $r_{t,i}=R(x_{t,i})+\epsilon_{t,i}$。(6) 更新 $D_{t+1}$ 与 $C_{t+1}$,若代理检测到停滞区间则调用 LLM 追加反思反馈、扩展搜索维度;$T$ 轮后返回观测到的最优解。慢循环:把 $(C_t, \text{候选池}, \text{采集值})$ 记入 TTS 数据集,按归一化权重 $\bar{w}_{t,i}$ 以加权自回归目标 $\mathcal{L}_{SFT}(\phi)=-\sum \bar{w}_{t,i}[\lambda_z \log p_\phi(z_{t,i}|C_t)+\log p_\phi(\hat{x}_{t,i}|C_t,z_{t,i})]$ 蒸馏,其中 $z_{t,i}$ 是解释“为什么这个实验值得做”的自然语言理由($\lambda_z=1$ 为推理增强模式)。
技术新颖性
技术新颖性体现在四点。其一,架构分工新:不同于 LLAMBO(LLM 兼做温启动/代理/采样)、OPRO(LLM 做优化器)等把 LLM 深度嵌入 BO 各环节的方案,LDM 响应 Gupta et al. 与 Kristiadi et al. 的负面实证结论,让 LLM 只做候选储库、显式保留 GP 校准后验,分工清晰且各司其职。其二,理论新:regret 分解把无限臂赌博机的 discovery gap(储库覆盖半径 $r_{cov,t}$ 的 Hölder 项 $\frac{L}{T}\sum r_{cov,t}^\chi$)、经典 GP-UCB 信息增益项 $\sqrt{C_\lambda\beta_T\gamma_T/T}$ 与倾斜采样 shortfall(含 $\kappa_t(\zeta_t)$——储库在近最优采集集上的概率质量)统一到一个界中,明确刻画了 LLM 影响性能的两条路径:缩小覆盖半径、增大近最优质量。其三,蒸馏目标新:LDM-TTS 微调以状态相关的采集价值为监督,训练的是“研究管理者”而非“解题者”,并附带自然语言 rationale,把标量采集值转化为可分配更多测试 token 的“发现推理”。其四,“发现”操作被算法化:通过反思驱动的动态特征集/搜索维度扩展,把开放空间的支撑扩展变成可执行、可在消融中验证的机制(去掉它则提前收敛到更差平台)。
实验结果
三大领域、消融与微调的主要数字如下。AutoResearch:从共同起点 val_bpb=1.0069 出发,LDM 在 615 次实验内降到 0.93421(绝对下降 0.0727),是 LLM-only 反思基线(约 255 次实验后停滞于 0.9767,仅降 0.0301)的 2.4 倍;纯 LLM 研究循环($\eta=0$ 消融)跑满 875 次实验也只到约 0.956,说明瓶颈在价值信号而非提议表达力;B200 同硬件排行榜上 LDM 仅用 59 次运行达 0.902291,优于 forge(0.9264)与 overmind(0.9274)。保留的改动包括 n-gram 哈希记忆(−0.0275)、QK-norm(−0.0137)、模型变窄 768→640(−0.0109)、窗口注意力+softcap(−0.0108)等。抗体设计:5 个 PDB 抗原各 200 次评估,Policy 变体全面优于 Direct 变体,LDM_Policy_Max 在 1FBI_X 达 −113.1±1.6(AntBO 为 −113.6±2.0)、1NSN_S 达 −104.7±1.0(Pure LLM 仅 −87.7±2.6),五抗原平均结合能相对 LLM-only 降低 18.2%,达到与专用方法 AntBO 相当的水平。分子优化:80 次评估内 LDM Direct-Softmax 超体积 27.325±5.475,较 MOBO(16.751)提升 63.1%、较 Pure LLM(13.794)提升 62.4%;MOBO 约 40 次评估后停滞,LDM 持续扩张前沿。消融:测试时预算 N8H8 优于 N4H4;LCB/UCB 优于 EI、更优于仅用后验均值(N8H8 Mean 仅约 0.99);去掉发现机制则提前收敛到更差平台。微调:Qwen3.5-9B 学生经推理增强蒸馏后在 AutoResearch 达 0.9788,超过 Qwen3-Coder-30B 参考的 0.9801;KRAS G12D 上达 26.660±2.608(未微调基板 16.489±5.867,教师 DeepSeek V4 Flash 24.548±3.589);任务级 OOD 模型(从未见过任何蛋白质任务)在 5 个抗原中的 4 个上追平域内模型。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AutoResearch 神经网络训练程序搜索(H100,300 秒/次) | 验证 BPB 绝对下降量(越低越好) | LDM 从 1.0069 降至 0.93421(615 次实验,下降 0.0727);B200 排行榜 0.902291(仅 59 次运行) | LLM-only 反思基线降至 0.9767(约 255 次实验,下降 0.0301);排行榜 forge 0.9264、overmind 0.9274 | BPB 降幅为基线的 2.4 倍;排行榜上以 1/4 的运行次数反超 |
| 抗体 CDRH3 设计(Absolut! 模拟器,5 抗原 × 200 次评估) | 平均结合能 ΔG(kcal/mol,越低越好) | LDM_Policy_Max:1FBI_X −113.1±1.6、1NSN_S −104.7±1.0、1OB1_C −108.4±1.7、1ADQ_A −110.8±0.9;五抗原平均相对 LLM-only 降低 18.2% | Pure LLM 各抗原 −85.4~−95.5;专用方法 AntBO −92.1~−113.6;TURBO/COMBO 更弱 | 相对 LLM-only 结合能降低 18.2%,整体达到与领域专用 AntBO 相当的水平 |
| KRAS G12D 多目标分子优化(Vina 对接分 + NN 活性,80 次评估) | Pareto 前沿超体积(越高越好) | LDM Direct-Softmax 27.325±5.475(最优单条轨迹达 33.63);ReaSyn-Softmax 21.707±3.676 | MOBO 16.751±2.562、随机搜索 16.826±3.085、Pure LLM 13.794±3.054 | 相对经典 BO +63.1%,相对 LLM-only +62.4%(>60%) |
| 发现微调:AutoResearch(80 次迭代) | 最终 best val_bpb | 微调 Qwen3.5-9B+CoT 0.9788 | Qwen3-Coder-30B 参考 0.9801;基板 Qwen3.5-9B 无 CoT 0.9965 | 9B 学生超过 30B 教师参考模型 |
| 发现微调跨任务迁移:KRAS G12D | Pareto 超体积 | 微调 Qwen3.5-9B+CoT 26.660±2.608 | 未微调 Qwen3.5-9B 16.489±5.867;教师 DeepSeek V4 Flash+CoT 24.548±3.589 | 较未微调基板 +62%,且超过高预算教师模型 |
局限与改进
作者承认的局限:精确 GP 的三次方复杂度限制实验预算规模;批量候选采样带来大量 LLM 推理开销;核函数与特征表示需按领域人工定制,跨域自动化不足;性能受 LLM 预训练知识覆盖约束(抗体域开源 LLM 先验弱,Direct 变体几乎不比 standalone LLM 好);闭环只利用进程内观测,未纳入文献与数据库等“未知已知”;存在代理模型误设与 reward exploitation 风险。我的补充观察:其一,三个领域全部使用 in-silico 验证器(Absolut! 格点结合能、AutoDock Vina 对接分、神经网络活性打分),没有任何湿实验验证,“发现”的真实科学意义打折——Vina 与 NN 打分都存在可被 LLM 利用的伪影,Figure 10 中 MW 599、LogP 7.2 的长全氟链候选成药性明显存疑;其二,AutoResearch 保留的改动(QK-norm、Muon、值嵌入等)多为社区已知技巧,LDM 的贡献更像高效重组而非机制发明;其三,2.4×、18.2% 等相对指标依赖 LLM-only 基线的提示与模型配置是否充分调优;其四,批次评估仅用 Gumbel-top-b 边缘采样,缺少考虑候选间信息冗余的批采集设计;其五,理论界依赖 UCB 校准与单侧 Hölder 条件,对实际使用的 EI/LCB 只是启发式支撑。
独立分析的弱点
独立弱点分析(每条附改进方向)。(1) 代理可扩展性:精确 GP 在观测数上千后不可用,字符串核也难捕捉长程化学语义——可换稀疏 GP/变分诱导点,或用预训练分子/蛋白嵌入加深度核,甚至让 LLM 提议核结构。(2) Reward hacking:LLM 候选可能利用 Vina/NN 评分伪影(如超长全氟链、极端 LogP),当前仅靠约束检查不够——可引入集成代理间分歧作为额外惩罚、在采集中加入合成可及性(SA)约束、或定期用高保真评估抽查高采集候选。(3) 批次选择:Gumbel-top-b 只按边缘采集分采样,忽略候选间信息冗余,并行预算下可能重复探索同一区域——可用 qEI、determinantal 点过程类批采集。(4) 停滞检测与反思触发是启发式的,何时扩展搜索维度缺乏统计依据——可形式化为核空间中的变更点检测或后验预测检验。(5) 反思只改维度不改核先验,跨任务时特征语义漂移(程序特征 vs 序列特征)导致代理需重新拟合——可学习共享表征空间。(6) 蒸馏目前只用加权 SFT,学生分布随自身 rollout 偏移后无在线纠偏——可扩展为以采集值为优势估计的强化学习后训练,这也是论文自己指出的方向。(7) 湿实验的延迟、失败与噪声重试未被建模,闭环假设评估即时返回。
未来方向
作者明确提出的方向:引入记忆检索与联邦发现机制,把外部数据库、已发表实验结果和并行探索进程中的“未知已知”纳入闭环;用稀疏高斯过程(Snelson & Ghahramani; Titsias)同时缓解上下文容量与计算复杂度;探索端到端的代理规格化——让 LLM 自主学习核函数与先验设定,消除人工跨域适配;推进发现式后训练,用偏好学习与强化学习把采集引导的决策逻辑进一步内化进模型生成分布。基于成果可延伸的方向:其一,异构成本下的 cost-aware 采集,一次湿实验从几秒到数周不等,应把成本归一化的 EI/UCB 与实验排程结合;其二,多智能体并行发现——多个 LDM 共享全局代理与发现记忆,显式实现论文留白的 unknown-knowns 读写操作;其三,把 LDM-TTS 从加权 SFT 升级为 RL 后训练(采集值即优势信号),并检验任务级 OOD 迁移的边界——论文发现 1H0D_C 这类需要 de novo motif 设计的窄最优是失败案例,说明“候选选择能力”可迁移而“新颖设计能力”不能;其四,理论延伸:把 Hölder 正则性与核条件放松到神经代理情形,并给出 $\kappa_t(\zeta_t)$ 的经验估计方法;其五,建立真实湿实验闭环基准,验证框架在延迟、噪声、失败重试下的鲁棒性。
复现评估
复现条件较好。代码与基准已开源(github.com/yzailab/Large-Discovery-Models,本文为 LDM v0.1 首发),论文给出完整算法伪代码(Algorithm 1/2)、闭式公式与附录 C/D/E 的实现细节(GP 后验推导、Gumbel-top-b、消融与 OOD 数据)。三个实验环境均为数字验证器,无需湿实验:AutoResearch 用 nanoGPT 固定 300 秒/次训练,H100 上 615 次实验约需 51 GPU 小时外加 LLM 推理开销,另有 B200 排行榜配置,学生模型 Qwen3.5-9B 与参考模型 Qwen3-Coder-30B 均开源;抗体任务用开源 Absolut! 模拟器(CPU 可跑,5 抗原 × 200 评估);分子任务用 AutoDock Vina 加神经网络打分。GP/EI/UCB/EHVI/Gumbel-top-b 均有 BoTorch/GPyTorch 现成实现。难度评估:核心循环(LLM 提议 + GP 打分 + 倾斜采样)工程上不复杂,熟悉 BoTorch 的工程师数天可复现单域测试时搜索版本;主要成本在 LDM-TTS 微调管线——需要用强模型(含 DeepSeek V4 Flash 等闭源 API)做高预算教师搜索、构造带 rationale 的加权数据、再对 9B 模型做 SFT,算力与 API 花费不小,且论文自述“中间数据构造与后处理决定学生学到什么”,对齐结果需仔细核对附录。综合难度:中等。
论文图表
对比三代范式:LLM Chat(2020-2024,自回归预测下一个 token,如 GPT-3.5)、LLM Reasoning(2024-2026,测试时计算+廉价验证器选择答案,如 OpenAI-o1、DeepSeek-R1)、LLM Discovery(本文 LDM,2026-):用“提议方案→实验验证→观测反馈→LDM 设计”的循环,在验证昂贵且开放的设计空间中进行科学发现。
一图定位论文的研究谱系与核心卖点:LDM 是把测试时计算从“易验证域”推广到“昂贵黑盒验证域”的第三次范式跃迁。
经验科学发现循环示意图:智能体基于信念生成候选设计/假设,经反思与细化后选择子集接受验证,通过实验获得观测,再用观测更新信念、引导下一轮搜索。
这是定义 1(经验科学发现)的操作化图示,说明本文把发现视为带外部评估器的序贯决策过程,是全文问题的形式起点。
(A) Rumsfeld 矩阵的改编版,按搜索意识与目标不确定性划分四象限:已知已知(理解透彻可供利用)、已知未知(已表示但不确定,可通过探索消解)、未知已知(外部存在但需检索)、未知未知(尚未被表示,需发现)。(B) 科学智能体经由检索、发现、探索在设计空间的三个认知区域间移动。
引入利用-探索-发现三操作的概念框架,是全文的形式语言;“发现 ≠ 探索”这一核心区分(发现改变搜索支撑集)完全建立在此图之上。
两个头条结果:(a) AutoResearch 上同 H100 配置的对比——LLM-only 基线 255 次实验后停滞于 val_bpb≈0.9767,LDM 615 次实验降到 0.9342,从共同起点 1.0069 的降幅 0.0727 是基线 0.0301 的 2.4 倍;(b) 抗体 1NSN_S 的最终结合能:Pure LLM −91.1±3.2(n=5)、中间为 BO 类基线 −99.5±4.8(n=10)、LDM −104.7±1.0(n=5),越低越好。
用最直观的两个实验预先展示全文论点:LLM-only 与 BO 的短板恰好互补,而 LDM 同时补齐两者。