← 返回 2026-08-11

混合嵌套框架:在LLM驱动优化中解耦结构与参数 A Hybrid Nested Harness for Decoupling Structure and Parameters in LLM-Driven Optimization

Víctor Gallego 📅 2026-08-08 👍 9 2026-08-16 18:30
CMA-ES LLM驱动优化 双层优化 贝叶斯推断 进化搜索

外层LLM提结构草图、内层数值求解器调参数,消除参数混叠

前置知识

LLM 驱动的进化搜索

把冻结的大语言模型放进迭代循环充当变异算子:每轮生成一个可执行工件(策略函数、训练脚本、概率模型重参数化等),由适应度函数 $f$ 评分,再把分数与编译诊断作为结构化反馈喂回下一轮。FunSearch、AlphaEvolve 等科学发现系统都属于这一架构。

本文的出发点正是这一范式——作者指出现有系统让 LLM 在同一次文本生成里既改结构又调参数,是算力浪费和错误淘汰好结构的根源。

CMA-ES

协方差矩阵自适应进化策略,一种无梯度连续黑盒优化器:维护一个多元高斯分布,依据历史成功样本自适应更新均值与协方差,把采样质量逐步集中到有希望区域,通常几十到上百次评估即可在低维空间收敛。

它是本文内层'填参数洞'的主力求解器,也是'纯数值优化'基线;其样本效率是成本论证(内层开销仅 10–100%)的关键。

双层优化

目标嵌套目标的优化问题:外层变量决定内层问题的形式,内层最优值反过来定义外层目标。本文形式化为 $\tau^\star=\arg\max_\tau F(\tau)$,其中 $F(\tau)=\max_{\theta\in\Theta(\tau)} f(\tau,\theta)$:外层搜结构 $\tau$,内层调参数 $\theta$。

整个方法的数学骨架就是把这一经典结构分配给'变量类型匹配'的两类求解器,理解它才能读懂 Proposition 1。

变分推断(VI)与 NUTS

VI 用梯度法(如 Adam)最大化 ELBO,把后验逼近变成可微优化;NUTS 是哈密顿蒙特卡洛的自适应变体,warmup 阶段学习质量矩阵(线性预条件子)。二者是贝叶斯推断的标准工具,代表'优化一个分布'的两种内层求解器。

第三组实验用它们替换 CMA-ES 做内层,检验框架对求解器选择的无关性,并导出 VI 与 NUTS 在仿射变换上的不对称预测。

参数混叠(parametric aliasing)

当外层只观察到一个标量分数 $f(\tau,\bar\theta(\tau))$ 时,'结构本身好坏'与'参数猜得好不好'两种信号塌缩在一起:真正的最优结构可能仅因默认参数太差而被错误淘汰。本文定义调参差距 $\Delta(\tau)=F(\tau)-f(\tau,\bar\theta(\tau))\ge 0$ 来量化这种信息损失。

这是全文要解决的核心失败模式:Proposition 1 给出理论刻画,Eq. (4) 给出'优势 ∝ $E[\Delta]$'的可证伪预测。

仿真校准(SBC)

一种无需真值后验的正确性门控:从先验采 $\theta^\star$,生成数据 $y\sim p(\cdot|\theta^\star)$,推断后把 $\theta^\star$ 在后验样本中的秩统计出来;若采样器加重参数化正确,秩应均匀分布,Bonferroni 校正后的 KS 偏离即报警。

贝叶斯实验用它做 reference-free 检验,识破了 $ heta=C anh(z)$ 这种'好采样但目标后验错误'的陷阱,而 ESS、$\hat R$ 和雅可比测试全部误报为合格。

研究动机

以 FunSearch、AlphaEvolve 为代表的 LLM 驱动进化搜索系统把冻结的 LLM 当作单一算子:每一轮模型同时改写程序结构(分支、辅助函数定义、控制流)和嵌入代码里的连续数值(阈值、学习率、缩放系数),在一次文本生成里完成全部搜索。问题在于 LLM 是出了名的差数值优化器(Yang et al., 2023),只能靠试错式离散跳跃调参数,浪费大量 token 与算力。具体失败场景:在元优化器实验中,LLM 提出的动量/自适应梯度算法在默认参数下会过冲发散,未调优的猜测直接得到 $\infty$ 或平台期分数,纯文本搜索便断定'这个结构不行'而将其淘汰——即使该结构本身是全局最优的。作者把这一失败模式形式化为参数混叠:结构质量与参数猜测质量两种信号塌缩进同一个标量奖励 $f(\tau,\bar\theta(\tau))$,外层选择因此系统性偏向'参数好猜的结构'而非'结构本身好'的候选,把真正值得探索的解过早丢掉。

本文的目标是本文的目标是把 LLM 搜索算子按变量类型做正交分解,给出可实现算法、理论保证与可证伪预测。具体而言:(1) 将候选程序分解为结构草图 $\tau$ 与参数向量 $\theta$,把搜索形式化为双层目标 $\tau^\star=\arg\max_\tau\max_\theta f(\tau,\theta)$:外层由冻结 LLM 提议结构,内层由专门数值求解器(CMA-ES、梯度法、MCMC)在预算 $B_{in}=100$ 内把参数调到最优;(2) 定义并证明参数去混叠性质:外层按调优后的结构价值 $F(\tau)$ 而非未调优猜测 $f(\tau,\bar\theta)$ 排名,可避免淘汰真实最优结构;(3) 给出混合优势与平均调参差距 $E[\Delta]$ 成正比的可证伪预测,并在元优化器、系统/社会困境策略、近似贝叶斯推断三个科学域上验证,同时量化额外成本(因 $c_{ev}/c_{llm}\sim 10^{-2}$–$10^{-3}$,仅 10–100% 开销)。

与已有工作不同的是,已有工作分成几条互不相交的路线:FunSearch/AlphaEvolve 类系统把结构与常数当一体突变;OPRO 等'LLM 即优化器'路线恰恰让模型做它最不擅长的连续搜索;GEPA、textual-gradient 等反思式 prompt 进化只处理文本、从不补数值常数。作者的独特切入是按变量类型分解算子:文本归 LLM(利用预训练先验),数字归匹配的数值求解器(利用采样效率),中间用轻量的 manifest 接口显式交接,且两层全部可插拔——任何文本优化器配任何数值优化器。更难得的是,作者没有停留在算法层面,而是把混叠概念从 prompt 优化推广到混合设定、证明去混叠命题、提出'优势 ∝ $E[\Delta]$'的可证伪预测并用三个域的实验检验(Table 1 热图验证),把工程技巧上升为有理论刻画、有适用边界(NFL 分析)的方法论。

核心方法

直觉:一个优化解由两种性质迥异的决策组成——结构(程序拓扑:分支、硬逻辑、辅助函数)依赖知识先验,LLM 擅长;参数(嵌在结构里的数值:阈值、学习率)是连续黑盒优化,传统求解器比 LLM 高效得多。据此混合嵌套搜索的流程是:外层冻结 LLM 提出带数值空洞的结构草图 $\tau$,并为每个空洞 $j$ 输出 manifest $(\ell_j,u_j,\mathrm{type}_j,\bar\theta_j)$,即下界、上界、类型(cont/int/log/pow2)与模型自己的猜测值;内层数值优化器 Tune 以 $\bar\theta$ 为热启动,在 $B_{in}=100$ 次评估内把参数调到 $\theta^\star(\tau)$,返回 $\hat F(\tau)\approx\max_\theta f(\tau,\theta)$;系统按调优后的 $\hat F$ 而非未调优猜测评分晋级,并把 $\hat F(\tau_{k-1})$、$\theta^\star$、编译诊断等结构化反馈喂给下一轮。外层接受规则可以是 (1+1) 进化循环,也可换 GEPA 反思式 prompt 进化;内层可换 CMA-ES、Adam 上的 VI、NUTS。总成本 $C_{hyb}=K(c_{llm}+B_{in}c_{ev})$,相对 vanilla 的 $K c_{llm}$ 只多出因子 $(1+c_{ev}/(c_{llm}B_{in}))$,实测约 10–100%。

核心创新是把 LLM 算子按变量类型因式分解,并证明这消除了参数混叠。数学上定义结构价值 $F(\tau)=\max_{\theta\in\Theta(\tau)}f(\tau,\theta)$,目标变为 $\tau^\star=\arg\max_\tau F(\tau)$。vanilla 搜索观察未调优分数 $g_{van}(\tau)=f(\tau,\bar\theta(\tau))$,混合搜索观察 $g_{hyb}(\tau)=\hat F(\tau)\approx F(\tau)$;两者之差定义调参差距 $\Delta(\tau)=F(\tau)-f(\tau,\bar\theta(\tau))\ge 0$,即结构在模型猜测参数下'留在桌面上的分数'。Proposition 1 证明:在 $\varepsilon$-准确内层下,vanilla 会在 $\Delta(\tau^\star)-\Delta(\tau')>F(\tau^\star)-F(\tau')$ 时错误淘汰全局最优结构,而混合搜索至多在 $2\varepsilon$ 边界内不犯此错;当 $F\perp\Delta$ 独立时,混合优势分解为选择项(随 $\Delta$ 的跨结构方差增大)与调参项(随 $E[\Delta]$ 增大),由此得到可证伪预测:混合优势 ∝ $E_{\tau\sim M}[\Delta(\tau)]$。当 $\Delta\approx 0$(如不需要数值参数的策略)两法重合——ellipsoid 上打平的实验结果与理论一致。

方法步骤详情

算法 1 的完整流程:(1) 初始化——向 LLM 发系统提示 $p$ 请求'提出初始结构 + manifest',得到草图 $\tau_0$ 与每个数值空洞的 $(\ell_j,u_j,\mathrm{type}_j,\bar\theta_j)$;类型支持连续、整数、对数尺度、2 的幂,整数与幂坐标在采样时投影回可行格点。(2) 内层调优——非可微黑盒目标用 CMA-ES($\bar\theta$ 热启动),可微量用梯度法,要优化分布时用 MCMC(如 NUTS warmup 的质量矩阵自适应),预算 $B_{in}=100$ 次评估,返回 $\hat F_0$ 与 $\theta^\star_0$ 作为初始 incumbent。(3) 外层循环 $k=1,\dots,K$——LLM 以反馈 $q(\tau^\star,V^\star,\theta^\star,\mathrm{diag})$ 变异结构,反馈里是调优后的真实分数而非模型原始猜测;Validate$(\tau_k)$ 检查草图可执行(含编译诊断),失败则跳过;再 Tune 得 $\hat F_k$;若 $\hat F_k>V^\star$ 则按 (1+1) 规则晋级 incumbent。(4) 防过拟合——适应度取多样本聚合均值,另设 held-out 评估只在调优后的 incumbent 上评一次;贝叶斯域用 SBC 做 reference-free 门控。全程适应度函数对 LLM 隐藏,模型只见接口与结构描述,$\Delta$ 是模型真实的数值计算失误。

技术新颖性

技术新颖性有四层。第一,分解视角:现有系统(FunSearch、AlphaEvolve、自动 agent 设计、端到端 autoresearch)都把结构突变与常数修改塞进同一次文本生成,本文首次按变量类型因式分解该算子,并用实验证明内层数值调优器与外层正交——既改进 (1+1) 循环,也能叠加在 GEPA 之上(外层更强时混合优势从约 10–20% 缩到 5–10%,但在调参重要的 regime 从不反转)。第二,理论贡献:把 Cheng et al. 2024、GEPA 的多信号去混叠思想推广到混合设定,证明按调优值排名可避免系统性淘汰最优结构,并给出优势与 $E[\Delta]$ 成正比的可证伪量化预测。第三,接口设计:manifest 把'哪些数值该调、范围与尺度是什么'显式化,与无需调优的常数(如维度大小)区分开,让 LLM 明确委托数值搜索。第四,成本论证:利用 $c_{ev}\ll c_{llm}$ 的现实不对称(rollout 秒级、高思考预算 LLM 调用分钟级),证明用便宜内层榨干昂贵 LLM 提案的价值,为 FunSearch 后续的样本效率目标提供了系统性实现。

Hybrid nested search: 冻结 LLM 提议带数值空洞的文本草图与 manifest,内层优化器调优后按调优值评分晋级
Figure 1: Hybrid nested search: 冻结 LLM 提议带数值空洞的文本草图与 manifest,内层优化器调优后按调优值评分晋级

实验结果

三大域、三策略(vanilla/纯数值/hybrid)系统对比。(1) 元优化器:LLM 为五个隐藏 2 维目标写优化算法,CMA-ES 调超参,测试 GLM-5.2、Opus 4.8、Gemini 3.5 Flash 三个模型。rosenbrock 上 vanilla 损失 $2.1\times10^{-4}$,hybrid 降到 $1.5\times10^{-12}$;rastrigin 上 19.2 降到 1.22,甚至超过 oracle CMA-ES 的 9.95;ackley 上 13.1 降到 $3.3\times10^{-9}$,提升达 12 个数量级;ellipsoid 打平($E[\Delta]=1.1$ 但默认参数已近盆地);schwefel 405 降到 297。收敛曲线显示 LLM 提议并调优的结构在多模态 rastrigin/ackley 上胜过直接跑 CMA-ES。(2) 可执行策略:Can't Be Late 调度器 costly regime 成本 $126.9 降到 $120.5(5.0%);Cloudcast inter 域 hybrid $168.7,胜过 vanilla $213.3 与纯 CMA-ES $317.4(1.9 倍);Cleanup 社会困境 hybrid 在 9/9 模型×种子中福利最高,heavy 域 $U$ 从 0.34 升到 0.58,三个模型独立收敛到同一 deadzone+ramp+cap 算法族(0.582);ramp 政策未调时最差($U=-0.10$)调优后最好(0.582),vanilla 晋级 sigmoid 政策只到 0.480,约 21% 福利损失于混叠。换 GEPA 做外层后 hybrid 仍在 6/8 regime 胜出。(3) 贝叶斯推断:gauss_rot(VI 内层)+37.7 nats;funnel(NUTS)+3.12 decades;eight_schools +2.17 decades;$D=18$ 的 sticky horseshoe 上 identity+adaptation 有 520 个发散、ESS/grad 仅 $6.2\times10^{-4}$,五个模型全部找到 SBC 认证的重参数化(ESS/grad 提升 10–24 倍),0/25 个活跃提案被 SBC 拒绝;banana($D=10$)上 vanilla 与 hybrid 提出同一个二次剪切 $b\leftarrow b-ca^2$,唯一区别是曲率常数 $c$:vanilla ELBO $-74.1$,hybrid 调优后 $-13.2$,+60.9 nats 全部来自调一个隐藏参数;VI 找到 $c$ 后 NUTS 再在去弯空间采样,+1.57 decades(约 37 倍),构成 NeuTra 式两级内层组合。Table 1 中 $E[\Delta]$ 列与优势列共享热图梯度,直接验证 Eq. (4)。

三大问题家族代表性结果:vanilla/纯数值/hybrid 三策略对比,含 $E[\Delta]$ 与混合优势的热图列
Table 1: 三大问题家族代表性结果:vanilla/纯数值/hybrid 三策略对比,含 $E[\Delta]$ 与混合优势的热图列
完整结果列表(Appendix D,分块 A–I)
Table 2: 完整结果列表(Appendix D,分块 A–I)
Meta-optimizers: (a) 每个函数的最终损失 vanilla($\circ$) vs hybrid($\star$);(b) best-so-far 收敛曲线
Figure 2: Meta-optimizers: (a) 每个函数的最终损失 vanilla($\circ$) vs hybrid($\star$);(b) best-so-far 收敛曲线
Cloudcast 各 regime 成本对比 (a)(b) 与 hybrid 优势随 $E[\Delta]$ 增长的趋势 (c)
Figure 3: Cloudcast 各 regime 成本对比 (a)(b) 与 hybrid 优势随 $E[\Delta]$ 增长的趋势 (c)
Cleanup 序贯社会困境:9/9 模型×种子 hybrid 福利最高,优势随难度单调增长
Figure 4: Cleanup 序贯社会困境:9/9 模型×种子 hybrid 福利最高,优势随难度单调增长
查看结构化数据
任务指标本文基线提升
元优化器 · ackley(隐藏 2 维目标,CMA-ES 内层) 最终损失(越低越好) hybrid $3.3\times10^{-9}$ vanilla 联合搜索 13.1;oracle CMA-ES $4.4\times10^{-12}$ 较 vanilla +13.1,且以结构先验逼近纯 CMA-ES 水平
元优化器 · rastrigin(多模态) 最终损失 hybrid 1.22 vanilla 19.2;oracle CMA-ES 9.95 +18.0,并超过 oracle CMA-ES
Can't Be Late 云调度器(costly regime,Gemini 3.5 Flash) 经济成本 $(越低越好) hybrid $120.5 vanilla $126.9;纯 CMA-ES $124.4 5.0%
Cloudcast 多云广播路由(inter 域) 成本 $ hybrid $168.7 vanilla $213.3;纯 CMA-ES(手工拓扑)$317.4 较 vanilla 20.9%,较纯 CMA-ES 1.9 倍
Cleanup 序贯社会困境(heavy 难度,自博弈评估) 功利主义福利 $U$(越高越好) hybrid 0.58 vanilla 0.34;纯 CMA-ES 0.26 1.70 倍;9/9 模型×种子全胜
贝叶斯推断 · gauss_rot(VI 内层) ELBO(nats,越高越好) hybrid 4.30 vanilla $-33.4$ +37.7 nats(仿射控制下 VI 专属收益)
贝叶斯推断 · horseshoe 回归($D=18$,NUTS,Gemini 3.1 Pro) ESS/grad(越高越好) hybrid $1.48\times10^{-2}$(SBC 认证,0/25 拒绝) identity+质量矩阵自适应 $6.2\times10^{-4}$(520 个发散) +1.37 decades,五模型均 10–24 倍
贝叶斯推断 · banana 弯曲山脊($D=10$,VI 内层) ELBO hybrid $-13.2$(同一剪切结构、调优曲率 $c$) vanilla $-74.1$(同一结构、猜测曲率);纯数值 $-174$ +60.9 nats,全部来自单个隐藏参数调优

局限与改进

作者明确承认四点:manifest 必须可解析,混合整数空洞需要更专门的求解器;通用型 CMA-ES 超过几十维就退化,空洞数 $h(\tau)$ 必须封顶,高维空洞需要神经内层算子(留作未来工作);存在新颖性天花板,方法最好用作 human-in-the-loop 副驾而非自主前沿系统;在 NFL 定理下任何优越性声明都限于特定目标类——作者自己界定适用条件:问题近似可分解、有结构先验、$E[\Delta]$ 不可忽略、评估便宜,并预测 ellipsoid、intra-cloud 路由、schwefel 这类低 $\Delta$ 情形只会打平。我的补充观察:Proposition 1 的优势分解依赖 $F\perp\Delta$ 独立性假设,但现实中 LLM 的参数猜测偏差可能与结构质量相关(越复杂的结构参数越难猜),会削弱预测精度;$E[\Delta]$ 的经验估计本身需要额外内层调优计算,成本模型未计入;三个域的规模都很小(2 维函数、gridworld、$D\le 18$),最昂贵的真实训练场景恰是 Remark 1 承认 CMA-ES 不适用、而论文未实验验证的空白;防过拟合只靠聚合分数加一次 held-out 评估,更强的内层优化器依然是更强的过拟合器,SBC 门控也只在贝叶斯域部署。

独立分析的弱点

第一,内层求解器的维度瓶颈:CMA-ES 超过几十维失效,而真实深度学习调参动辄上百维。改进方向:用轴对齐/稀疏 CMA、贝叶斯优化或学习式代理模型替换内层,或让 LLM 在 manifest 中做敏感度排序、只暴露高敏空洞。第二,成本模型在昂贵评估域反转:当 $c_{ev}$ 是一次完整训练时 $B_{in}=100$ 次评估不可行。改进方向:多保真度策略(低保真 CMA-ES 预筛 + 高保真微调)、跨结构摊销(共享热启动、Hyperband 式预算分配)、按 $\hat\Delta$ 在线估计自适应分配内层预算。第三,独立性假设过强:$F\perp\Delta$ 在结构复杂度与参数敏感度相关时不成立,Eq. (4) 可能系统性偏移。改进方向:把 $\hat\Delta(\tau)$ 估计放进外层反馈,让模型学会偏好'可调优'结构,并实证测量相关性结构。第四,实验规模偏小且偏合成:缺少真实训练 run、GPU kernel 等高价值场景。改进方向:在 NAS、CUDA kernel 自动调优、RL 超参搜索上复验优势是否保持。第五,manifest 依赖模型自律输出:解析失败即整轮作废(Validate 后 continue),浪费一次昂贵 LLM 调用。改进方向:类型化 DSL 约束解码保证可解析,diff-based 自动 hole 发现降低对 prompt 遵循度的依赖。

未来方向

作者提出:用神经内层算子处理高维空洞;为混合整数空洞引入专门求解器;继续把方法定位为人类协作的 copilot。基于成果可延伸的方向:其一,把 $\hat\Delta(\tau)$ 在线估计融入外层反馈形成自适应内层预算分配,并检验独立性假设被违背时 Eq. (4) 的偏移规律;其二,把 SBC 这类 reference-free 门控推广到其他域——物理仿真器校验、RL 策略的对抗回放——系统解决'强内层=强过拟合'的普遍问题;其三,两级内层组合(VI 先找非线性变换、NUTS 再在去弯空间采样,banana 实验已给出 NeuTra 式 +1.57 decades 约 37 倍的雏形)可系统化为多保真流水线;其四,与自动化实验平台结合,让 $f$ 是真实训练/编译/基准测试,验证成本反转场景下的摊销策略;其五,理论上松弛 $\varepsilon$-准确性与独立性假设,给出有限预算下更紧的优势界;其六,反向应用同一框架联合优化 prompt 文本与解码连续参数(温度、top-p),让 GEPA 类方法的数值常数也获得内层调优。

复现评估

代码开源于 github.com/vicgalle/hybrid-nested-search,论文 8 页正文加附录(含 Proposition 1 证明、完整结果 Table 2、发现工件画廊 Appendix C)。模型依赖:GLM-5.2、Opus 4.8、Gemini 3.5 Flash、Gemini 3.1 Pro(部分实验),均为可获取的商业模型。基准基本开放:spot 调度器(Wu et al. 2024)、Cloudcast(Wooders et al. 2024)、Cleanup gridworld(Hughes et al. 2018,多智能体基准)、贝叶斯任务(funnel、eight_schools、horseshoe、banana 均为标准测试问题,VI/NUTS 可用 NumPyro 类开源栈,CMA-ES 有成熟实现)。算力需求低:单次 rollout 秒级,LLM 调用分钟级,内层预算固定 $B_{in}=100$ 次评估,目标是 2 维函数、gridworld 和 $D\le 18$ 推断,内层循环单卡甚至 CPU 即可,主要开销是 API 调用费。复现难点:prompt 模板与反馈格式的细节未完全展示、随机性较大(每策略 $N=3$ 提案)、GEPA 集成需要额外工程。总体评估:复现难度中等偏低,非常适合作为'LLM + 经典优化器'混合系统的实现参考。