← 返回 2026-08-12

孟德尔哥德尔机:基于比较式进化的递归自改进编码智能体 Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma 📅 2026-08-07 👍 26 2026-08-17 18:30
LLM智能体 编码智能体 自进化系统 进化搜索 递归自改进

以跨任务与跨谱系的比较证据改造自修改算子,Polyglot 成绩从50.8%升至93.2%

前置知识

自改进编码智能体与哥德尔机谱系(DGM/HGM)

哥德尔机(Schmidhuber, 2003)设想一个只在能证明修改有益时才改写自身代码的自指系统。近年 LLM 编码智能体把它经验化:智能体以可执行代码(提示词、工具、控制流,统称脚手架 scaffold)为躯体,自主阅读并改写自己的源码,再在基准上评测。DGM(Zhang et al., 2026a)维护一个不断扩张的智能体档案树,每次迭代采样一个变体作为下一次自修改的种子;HGM(Wang et al., 2026)进一步把它形式化为固定预算下的树搜索问题,用后代聚合生产力(clade 级证据)引导扩展与评测的预算分配。

MGM 直接建立在这条 DGM→HGM 谱系之上,完整继承其档案树、评测—扩展框架与符号体系($\Phi$、$\varphi$、$U(a)$、Beta 后验等),不理解这一背景就无法分清 MGM 相对前作到底改了哪一环、哪些部件被原样保留。

基因型、表现型与反应规范(reaction norm)

遗传学中,基因型是生物的遗传构成,表现型是它在特定环境下的可观测性状;反应规范(Woltereck, 1909; Pigliucci, 2001)描述同一基因型在不同环境下表达出的表现型集合——同一份基因组在多种环境中反复出现的异常模式,往往指向基因型级的稳定缺陷而非环境偶发事故。MGM 把智能体源码视为基因型,把评测轨迹与二元成败结果 $r(a,\tau)\in\{0,1\}$ 视为表现型,把同一智能体跨多任务的成败模式视为其反应规范。

MGM 三个自修改算子正是按'比较什么'划分命名的:反应规范突变 $\Phi_{RM}$ 比较同一基因型跨任务的表现型,跨谱系杂交 $\Phi_{CH}$ 比较不同基因型在同一任务下的表现型。不懂这些概念就无法理解算子设计的诊断逻辑。

汤普森采样与 Beta 后验

汤普森采样是处理'探索新选项 vs 利用已知好选项'两难的经典策略:为每个选项维护成功概率的后验分布(常用 Beta 分布),每轮从各后验各采样一个值,选采样值最大者。HGM 用 $\pi_a \sim \mathrm{Beta}(\kappa(1+n_s(a)), \kappa(1+n_f(a)))$ 为档案中每个智能体节点的效用建模,$n_s/n_f$ 是该节点已评任务的成败数,$\kappa$ 控制探索强度;clade 级后验则聚合整棵子树的成败数,用于引导扩展。

MGM 原样继承了 HGM 的 $\pi$ 采样策略来决定'何时评测、扩展哪个节点',其全部创新只在'扩展如何被执行'这一环。明确哪些机制未被改动,才能准确界定论文的贡献边界。

SWE-bench 系列与 Polyglot 基准

SWE-bench 给模型一个真实 GitHub 仓库和自然语言 issue,以生成的补丁能否通过对应 PR 的测试评判成败;Verified 是人工核验子集,Pro 加入更长程、跨 6 种语言的高难度任务,Multilingual 覆盖 9 种语言 42 个仓库。Polyglot(Aider)是多语言代码编辑基准,覆盖 C++/Go/Java/JavaScript/Python/Rust。论文用各基准的 60 任务子集做进化训练,用全集或留出子集做评测。

全部实验结论都建立在这四个基准上;'在 Polyglot-60 上进化、零样本迁移到 SWE-bench Pro/Multilingual'是证明进化出的改进是通用工作流而非过拟合的核心证据,必须先知道各基准分别考察什么,才能读懂迁移实验的含义。

加性适应度景观与汉明距离

进化计算中,适应度景观把每个候选解映射到一个适应度值;加性(additive)模型假设各基因座的贡献相互独立、可线性叠加,不含上位交互(epistasis)。论文的代理模型把每个智能体表示为二值向量 $g\in\{0,1\}^L$,每个基因座对应一个最小脚手架能力(如定位、推理、编辑、验证),与神谕基因型的汉明距离 $d(g)=\sum_{\ell}\mathbb{1}[g_\ell\neq g^*_\ell]$ 度量差距;任务 $\tau$ 要求 $k$ 个基因座全部正确才成功,故 $P(r=1\mid d)=\left(\frac{L-d}{L}\right)^k$。

第 4 节的命题 1 与全部蒙特卡洛模拟都在这个代理模型上展开,它是'为什么比较证据优于单轨迹证据'这一核心主张的形式化载体;读懂它才能看懂诊断压缩(diagnostic compression)的推导。

研究动机

以 DGM 和 HGM 为代表的自改进编码智能体已经能在 SWE-bench、Polyglot 等基准上通过改写自身脚手架代码持续涨分,但它们共享一个被忽视的瓶颈:每次自修改的条件证据只有单个智能体在单个任务上的一条轨迹,通常还是最近一次失败。这种单轨迹证据噪声极大——一条失败轨迹可能源于任务特有的偶然因素(如某个仓库的特殊环境配置)、一次糟糕的局部决策,也可能是脚手架设计层面的真实缺陷,负责改代码的编辑器(LLM)几乎无法区分这三者。更浪费的是,随着进化推进,档案树中积累了所有变体在所有已评任务上的完整轨迹与成败记录,但现有方法只把这个不断膨胀的档案当'排行榜'用于采样选节点,其背后丰富的比较信号完全被闲置。结果就是编辑器经常把任务特异性事故误诊为基因型缺陷、开出过拟合特定任务的'药方',或在没有任何对照的情况下盲目修补,宝贵的评测预算被低质量自修改消耗殆尽。

本文的目标是本文的目标是在完全不增加额外任务评测的前提下,把档案中已有的轨迹数据转化为更高诊断质量的'受控比较证据',从而提高每一次自修改的有效修复概率,让自改进在相同预算下收敛得更快、终点更高。具体而言,MGM 要在 HGM 式的固定预算树搜索框架下(同样的 200 次 $\varphi$-评测加 24 次 $\Phi$-扩展、同一祖先智能体、同一骨干模型)明确超越 HGM。同时,作者希望进化出的改进是工作流层面的可复用能力,而不是对某个基准或某个骨干模型怪癖的过拟合——即进化后的脚手架应能零样本迁移到未见过的基准(SWE-bench Pro、SWE-bench Multilingual)和不同的骨干 LLM(DeepSeek-V4 系列)上依然有效。作者还想要理论支撑:在一个可控的加性适应度景观代理模型中,严格证明并经蒙特卡洛模拟验证'比较证据严格优于单轨迹证据'这一设计直觉,并说明增益的确来自诊断质量而非算力差异。

与已有工作不同的是,此前工作的改进都集中在'档案管理与采样策略'两端:DGM 把自改进重构为开放式进化、维护扩张的档案树;HGM 再把预算分配形式化为树搜索、用 clade 级后代生产力估计决定扩展谁、何时停止评测。而进化链条中最核心的一步——被选中节点究竟拿着什么证据去修改自己的代码——始终停留在'单智能体单轨迹',未被系统研究。MGM 的独特切入是把孟德尔遗传学'通过受控比较分离可遗传效应'的方法论引入自修改环节:一次可靠的基因定位需要两种对照——同一基因型在不同环境下的重复表型(反应规范),以及不同基因型在同一环境下的差异表型(杂交对照)。这一视角把原本被白白浪费的档案存量数据变成零成本的对照实验,将改进焦点从'搜索哪个节点'转移到'给编辑器看什么',是对整个 DGM/HGM 谱系的正交互补,而非又一轮采样策略微调。

核心方法

直觉上,MGM 把每一次自修改当成一次遗传学诊断实验:编辑器像遗传学家,单条失败轨迹如同只有一个病人的病例,难以定位病因;而有了同一病人在多种环境下的病史(反应规范)或另一名健康对照者的病历(跨谱系对照),因果缺陷就能被显著收窄。技术上,MGM 延用 HGM 的评测—扩展框架:$\pi$ 策略用节点级与 clade 级 Beta 后验 $\mathrm{Beta}(\kappa(1+n_s),\kappa(1+n_f))$ 做汤普森采样,在'给某节点做一次任务评测'与'扩展进化树'之间分配预算。MGM 的改动集中在扩展环节:把原来单一的 $\Phi$ 算子按可用证据类型拆成三个子算子——克隆突变 $\Phi_{CM}$(单智能体单轨迹)、反应规范突变 $\Phi_{RM}$(同一智能体跨任务)、跨谱系杂交 $\Phi_{CH}$(同任务跨谱系)。扩展被触发时先构建合格算子集 $\Omega_i$,再按可配置权重 $\lambda_{CM}=0.10$、$\lambda_{RM}=0.45$、$\lambda_{CH}=0.45$ 采样执行。三个算子全部直接取材于档案中例行评测已积累的轨迹,因此不产生任何额外评测开销。此外 MGM 维护一个全局失败任务池 $P_t=\bigcup_i F_i$,采样新任务时给池中任务赋权重 $\beta_{fail}$、其余任务权重 1,以提升单次评测的诊断价值并刻意制造跨谱系任务重叠,为 $\Phi_{CH}$ 创造可用对照。

核心创新是'比较式自修改':把诊断质量而非搜索策略当作自改进的真瓶颈。三个算子对应三种受控比较设计。$\Phi_{CM}$ 保留 HGM 式的单轨迹修改,作为档案尚小或无法构造可靠对照时的兜底,其证据为 $E_{CM}(i,\tau)=\{(\varphi(a_i,\tau), r(a_i,\tau))\}$。$\Phi_{RM}$ 要求同一智能体至少在 $m_{RM}=2$ 个任务上有轨迹,把目标失败任务 $\tau_t$ 与参考任务 $\tau_r$(优先也选失败的)的两条轨迹并列交给编辑器,让它寻找'反复出现或形成对比的行为模式'并实施一次通用改进——因为跨任务重复失败更可能暴露基因型级缺陷而非偶然事故。$\Phi_{CH}$ 则在两个谱系对同一共享任务 $\tau_t$ 非双方皆解出时(式 13 的条件 $\exists j\neq i, \exists \tau_t\in S_i\cap S_j$),把目标与参考智能体的两条轨迹放在一起,让失败方向参考方'提取可迁移的行为特质并适配到自己的代码库'。与遗传算法的交叉操作有本质区别:MGM 绝不把一个智能体的源文件拼接到另一个里,只做行为层面的类比迁移,避免带入任务特定实现。相对于已有方法的本质变化是:编辑器拿到的证据从'一个数据点'变成'一组受控对照',诊断不确定性被系统性压缩。

方法步骤详情

完整流程(Algorithm 1)如下。第 0 步:评测初始祖先 $a_0$,初始化档案 $\mathcal{A}=\{(a_0, r(a_0,\mathcal{B}))\}$ 与空失败池 $P$。第一步(决策):$\pi$ 策略决定本步做 $\varphi$-评测还是 $\Phi$-扩展。评测分支:按汤普森采样选节点 $a$,从该节点未试过的任务中采样 $\tau$——落在失败池中的任务权重 $\beta_{fail}$、其余权重 1(式 17);执行评测,把轨迹与结果写入档案,失败则把 $\tau$ 并入 $P$。扩展分支:采样父节点 $a'$,扫描档案构建合格算子集 $\Omega_i\subseteq\{\Phi_{CM},\Phi_{RM},\Phi_{CH}\}$——$\Phi_{CM}$ 只要 $F_i\neq\emptyset$ 即可用;$\Phi_{RM}$ 要求 $|S_i|\geq m_{RM}$ 且存在失败轨迹作目标、另一条作参考;$\Phi_{CH}$ 要求存在另一谱系节点与 $a'$ 尝试过同一共享任务且非双方都解出。随后按 $Pr(\sigma\mid i)=\lambda_\sigma/\sum_{\sigma'\in\Omega_i}\lambda_{\sigma'}$ 采样算子,构造对应证据 $E_\sigma$,交给 LLM 编辑器执行 $a'\leftarrow\Phi_\sigma(a_t, E_\sigma)$,产出合法子代则挂入档案,$\Omega_i$ 为空则退回评测。$\Phi_{CH}$ 的主谱系规则(附录 A.2):恰有一方解出共享任务时,失败方为被编辑的主谱系、成功方为供体,子代挂在失败谱系下;双方皆败时选效用较高一方为主目标、另一方作对照,用于诊断互补的失败模式。

技术新颖性

技术新颖性有四层。其一,问题重定义:首次把'自修改证据的质量'从搜索框架中剥离出来单独优化,指出 DGM/HGM 的短板不在选哪个节点、而在喂给编辑器什么。其二,算子设计:反应规范突变与跨谱系杂交都是从档案存量数据中'免费'构造对照实验,把孟德尔受控比较思想操作化为可执行的自修改协议,这在自改进智能体文献中是首次;失败任务池则通过制造谱系间任务重叠进一步放大对照的可用性。其三,理论刻画:在加性景观下证明命题 1——编辑器的有效修复概率 $p_\sigma^f = s\cdot\Pr_{\ell\sim C_\sigma(E)}[\ell\in M(a)]$ 由候选缺陷集 $C_\sigma(E)$ 中真缺陷的密度决定;$\Phi_{RM}$ 把候选集从整个任务所需区域 $R_{\tau_t}$ 压缩到交集 $R_{\tau_t}\cap R_{\tau_r}$,其期望大小 $1+\frac{(k-1)^2}{L-1} s\cdot\frac{c}{k}=p_{CM}^f$。其四,工程零成本:所有证据来自例行评测的副产物,三个算子成本强制相等($c_{CM}=c_{RM}=c_{CH}=c_\varphi$),使性能增益与算力投入彻底解耦——这是 HGM 与 MGM 对比实验能够公平归因的关键设计。

Mendel Gödel Machine. MGM organizes self-modification via controlled inheritance based on evidence across tasks and lineages.
Figure 1: Mendel Gödel Machine. MGM organizes self-modification via controlled inheritance based on evidence across tasks and lineages.
Additive fitness landscape model. Each agent a carries a binary genotype with loci that are either correct or mismatched relative to an oracle a∞.
Figure 3: Additive fitness landscape model. Each agent a carries a binary genotype with loci that are either correct or mismatched relative to an oracle a∞.
Illustration of Cross-lineage Hybridization. Nodes are colored by their outcome on the shared diagnostic task javascript__queen-attack.
Figure 10: Illustration of Cross-lineage Hybridization. Nodes are colored by their outcome on the shared diagnostic task javascript__queen-attack.

实验结果

主实验(Table 1;Qwen3.6-35B-A3B 骨干,预算 200 次 $\varphi$-评测 + 24 次 $\Phi$-扩展,8×H100):SWE-bench Verified-60 上两者同一起点 68.3%,HGM 升至 73.3%(+5.0 个百分点),MGM 升至 78.3%(+10.0);Polyglot-60 上起点同为 50.8%,HGM 至 77.9%(+27.1),MGM 至 93.2%(+42.4);耗时几乎相同(Polyglot 上 MGM 40.14h 甚至快于 HGM 的 44.20h),Figure 6 显示各算子 token 开销同量级,排除了'多花算力'的解释。全量评测(E.1/Figure 7):MGM 智能体解出 Polyglot-225 中的 210 题(93.3%),各语言为 C++ 25/26、Go 36/39、Java 43/47、JavaScript 46/49、Python 33/34、Rust 27/30;Figure 2 显示其超过 GPT-5 的 88.0%(参数约少 117 倍),把 Polyglot 进化的脚手架迁移到 DeepSeek-V4-Pro 后达 96.9%。跨基准零样本迁移(Table 2):Polyglot 进化的脚手架在 SWE-bench Pro 上 16.7%→26.7%(+10.0,而 HGM 反降至 13.3%),Multilingual 上 41.7%→55.0%(+13.3,HGM 仅 +1.6)。跨模型迁移(Table 3):SWE-bench Verified-60 进化的脚手架换 DeepSeek-V4-Flash 后 HGM 60.0%、MGM 66.7%;换 V4-Pro 后 HGM 70.0%、MGM 75.0%;两模型平均 47.5%(初始)→65.0%(HGM)→70.8%(MGM)。消融(Table 4):完整 MGM 93.2%,去 $\Phi_{RM}$ 降至 79.7%(+28.9),去 $\Phi_{CH}$ 降至 74.6%(+23.8),三者耗时相当,说明两个比较算子分别贡献约 13.5 与 18.6 个百分点。模拟(Figure 4/5):在所有初始距离 $d_0\in\{10,20,40,80\}$ 与优势比 $\rho\in\{1.2,1.5,2.0\}$ 下 MGM 收敛更快、终态均值最低且分布最紧凑;$\rho=1$(比较证据无诊断优势)时退化为 HGM 式行为,验证增益确来自诊断压缩。骨干分析(Table 7/8):更大的编码特化模型 Qwen3-Coder-Next-80B-A3B 只把脚手架提升到 41.7%(初始 33.3%),远低于 35B 的 Qwen3.6(78.3%);两者在 GPQA 上差 11.51 分、HMMT Feb 2025 上差 20.49 分,说明失败诊断所需的通用推理能力比参数量与编码特化更关键。案例层面(Figure 10、H.1/H.2、Figure 11):MGM 发现的最佳 Polyglot 智能体沿 initial→#2→#9→#16 累积了'先读后写提示'(杂交)、'两阶段契约提取+自审'(反应规范)、'测试驱动验证循环,最多 5 次迭代修复'(反应规范)三层通用改造;其技能在语义空间中紧密聚集于'测试契约提取/API 契约遵守/实现前验证',而 HGM 的技能更分散。

Performance of coding agents evolved on SWE-bench Verified and Polyglot. Results evolved using Qwen3.6-35B-A3B after 200 φ-evaluations and 24 Φ-expansions.
Table 1: Performance of coding agents evolved on SWE-bench Verified and Polyglot. Results evolved using Qwen3.6-35B-A3B after 200 φ-evaluations and 24 Φ-expansions.
Cross-benchmark generalization from Polyglot to SWE-bench Pro and SWE-bench Multilingual.
Table 2: Cross-benchmark generalization from Polyglot to SWE-bench Pro and SWE-bench Multilingual.
Cross-model transfer on SWE-bench Verified-60. The scaffolds evolved on Qwen3.6-35B-A3B are evaluated with the LLM backbone replaced.
Table 3: Cross-model transfer on SWE-bench Verified-60. The scaffolds evolved on Qwen3.6-35B-A3B are evaluated with the LLM backbone replaced.
Ablation study. All variants are evaluated under the same computational budget of 200 evaluations on Polyglot-60.
Table 4: Ablation study. All variants are evaluated under the same computational budget of 200 evaluations on Polyglot-60.
Parameter settings for simulation. All edit costs are equal so that the HGM–MGM comparison isolates diagnostic quality alone.
Table 5: Parameter settings for simulation. All edit costs are equal so that the HGM–MGM comparison isolates diagnostic quality alone.
Hyper-parameter settings used in all experiments.
Table 6: Hyper-parameter settings used in all experiments.
Performance of coding agents evolved on SWE-bench Verified with different models.
Table 7: Performance of coding agents evolved on SWE-bench Verified with different models.
Performance comparison between models. Results are compared across general knowledge, science, and mathematics reasoning benchmarks.
Table 8: Performance comparison between models. Results are compared across general knowledge, science, and mathematics reasoning benchmarks.
Polyglot performance. Result marked with asterisk is from Polyglot-60; all other scores are from the complete Polyglot-2251.
Figure 2: Polyglot performance. Result marked with asterisk is from Polyglot-60; all other scores are from the complete Polyglot-2251.
Simulated final performance distribution. Rows vary the initial edit distance d0; columns vary ρ.
Figure 5: Simulated final performance distribution. Rows vary the initial edit distance d0; columns vary ρ.
Token costs of each operators for HGM and MGM evolved on Polyglot.
Figure 6: Token costs of each operators for HGM and MGM evolved on Polyglot.
Polyglot-225 performance of the MGM-discovered agent by language.
Figure 7: Polyglot-225 performance of the MGM-discovered agent by language.
Evolution trees of MGM, HGM, and MGM's ablated variants. Results after 200 φ-evaluations and 24 Φ-expansions on Polyglot.
Figure 8: Evolution trees of MGM, HGM, and MGM's ablated variants. Results after 200 φ-evaluations and 24 Φ-expansions on Polyglot.
Final per-node utilities for MGM, HGM, and the ablations. Each point is one of the 24 evolved nodes.
Figure 9: Final per-node utilities for MGM, HGM, and the ablations. Each point is one of the 24 evolved nodes.
Semantic visualization of evolved skills. A content-level view of the evolved 'To Implement' descriptions from MGM and HGM.
Figure 11: Semantic visualization of evolved skills. A content-level view of the evolved 'To Implement' descriptions from MGM and HGM.
查看结构化数据
任务指标本文基线提升
SWE-bench Verified-60(仓库级 issue 修复) 解决率 % MGM 78.3%(初始 68.3%) HGM 73.3% 较 HGM +5.0 个百分点,较初始 +10.0
Polyglot-60(多语言代码编辑) 解决率 % MGM 93.2%(初始 50.8%) HGM 77.9% 较 HGM +15.3 个百分点,较初始 +42.4
Polyglot-225 全量(Qwen3.6-35B-A3B + MGM) 解决率 % 93.3%(210/225) GPT-5 88.0%(公开榜单) +5.3 个百分点,参数量约少 117 倍
Polyglot-225 全量(DeepSeek-V4-Pro + MGM 迁移脚手架) 解决率 % 96.9% GPT-5 88.0% +8.9 个百分点
SWE-bench Pro-60(Polyglot 进化后零样本迁移) 解决率 % MGM 26.7% 初始 16.7%,HGM 13.3% 较初始 +10.0,较 HGM +13.4
SWE-bench Multilingual 子集(零样本迁移) 解决率 % MGM 55.0% 初始 41.7%,HGM 43.3% 较初始 +13.3,较 HGM +11.7
SWE-bench Verified-60 跨模型迁移(DeepSeek-V4-Pro) 解决率 % MGM 75.0% 初始 45.0%,HGM 70.0% 较初始 +30.0,较 HGM +5.0
消融实验(Polyglot-60) 解决率 % 完整 MGM 93.2% 去 ΦRM 79.7%,去 ΦCH 74.6% 两个比较算子分别贡献 13.5 与 18.6 个百分点
蒙特卡洛代理模拟(100 种子,预算 500) 到神谕基因型的汉明距离(越低越好) MGM 在所有 d0 与 ρ>1 设定下均值最低、方差最小 DGM(均匀预算)与 HGM(自适应预算) 收敛更快;ρ=1 时优势消失,证明增益源于诊断质量

局限与改进

作者承认的局限:自改进实验昂贵(每次进化需数十 GPU 小时),限制了独立种子数与超参扫描广度;MGM 依赖历史——$\Phi_{RM}$ 需要同一智能体的多条轨迹、$\Phi_{CH}$ 需要跨谱系任务重叠,档案小或失败未积累时会退化为单轨迹基线;比较证据的质量并不保证编辑结果的正确性、通用性与可维护性,实际修改仍由 LLM 编辑器产出,好证据可能被浪费;比较证据只有在骨干模型有能力从轨迹中诊断失败机理时才有用;形式分析与模拟基于加性适应度代理,未涵盖真实脚手架的复杂性;主实验在固定 60 任务子集、单一预算档上进行,子集选择与种子多样性带来方差不确定性;结论仅限沙箱内的编码智能体,不能外推到非编码场景与真实软件维护。我的补充观察:其一,60 任务子集样本很小,SWE-bench Pro 上 16.7%→26.7% 只差 4 道题,未报置信区间;其二,Table 6 中 $\beta_{fail}=1.0$ 意味着失败池加权在正式实验中实际未生效(与普通任务等权),论文强调的'集中评测于高信息量任务'的机制形同虚设,跨谱系重叠只能靠运气形成;其三,附录 F.2 正文称 Qwen3.6 下 MGM 达 61.7%,而 Table 1/7 均为 78.3%,正文与表格数字不一致;其四,Figure 2 中与 GPT-5、o3、Gemini 等闭源模型的对比引用公开榜单分数,评测协议、提示与算力并不同轴;其五,每次进化仅 24 次扩展、单次运行,进化搜索的高方差未被多种子量化。

独立分析的弱点

独立分析有五个弱点。第一,冷启动退化:进化初期档案近乎空白,$\Phi_{RM}$ 与 $\Phi_{CH}$ 均不可用,MGM 等价于 HGM,而许多团队并没有 200 次评测的预算把档案'养大';改进方向是跨项目共享档案,或先用合成任务预热档案再上真实基准。第二,编辑器单点瓶颈:证据变好只提升'提名正确缺陷'的概率,最终改写仍由一次 LLM 调用完成,失败编辑既浪费预算(24 次扩展对 200 次评测,约占扩展预算的全部失败份额),还可能引入回归缺陷;改进方向是给候选子代加廉价静态检查、行为回归测试或多编辑器投票机制。第三,比较算子的可用性依赖任务重叠:Polyglot 训练只有 60 个任务,双败对照尤其稀缺,$\lambda_{CH}=0.45$ 的高权重可能经常落空(合格集为空只能退回评测);改进方向是把 $\beta_{fail}$ 真正调成大于 1 的主动任务课程,或显式优化谱系间重叠度。第四,理论模型与现实脱节:加性景观假设缺陷稀疏、独立、可加,而真实脚手架的缺陷存在强交互——一条错误的系统提示可能同时破坏定位、编辑、验证多个能力,命题 1 的定量结论未必迁移;改进方向是引入上位性项与噪声的景观模型,检验比较算子的优势在何种相关结构下保持。第五,统计强度弱:所有主结论来自单次进化运行,Figure 5 中方法间分布存在明显重叠区,至少应报告 3–5 个随机种子的均值与置信区间,否则 +5 个百分点级别的差距难以与搜索噪声区分。

未来方向

作者明确提出的方向:利用'小而便宜的骨干上进化、再迁移到更强模型'的可扩展路径(Polyglot 脚手架迁移 DeepSeek-V4-Pro 达 96.9% 已是雏形);与运行时自适应方法互补结合——如先离线进化出稳健基座(MGM),再在线特化到当前 issue(Live-SWE-agent 类方法),类似'策略学习 vs 测试时推理'的分工;把算子从编码智能体扩展到非编码智能体与开放式真实软件维护场景。基于本文成果可自然延伸的研究:一是把二轨迹比较推广为多轨迹/多供体的加权比较,或维护显式的'技能库'记忆,使可迁移特质不依赖编辑器临场归纳;二是让算子权重 $\lambda_{CM}/\lambda_{RM}/\lambda_{CH}$ 与失败池加权 $\beta_{fail}$ 变为可学习的自适应量(在 bandit 之上再套一层元 bandit);三是把比较进化与参数级训练(对 scaffold 做强化学习微调)混合,检验'诊断压缩'能否同样提升梯度信号的样本效率;四是理论上把加性景观扩展到带上位性与评测噪声的设定,给出比较算子的收敛速率界;五是安全方向——为自修改谱系建立审计、回滚与'遗传病'检测机制,论文伦理章节已警告错误或对抗性自编辑会在后代中持久化,这在小规模实验中易被忽视但在部署中致命。

复现评估

复现条件在同类工作中属上乘,但算力门槛高。代码已开源(github.com/RealLcz/MGM),项目页 reallcz.github.io/MGM;四个基准全部公开,附录 D 逐条列出 SWE-bench Pro 与 Multilingual 所用 60 任务的完整清单,排除子集选择歧义;模拟与实验的超参完整披露(Table 5:$L=100$、$k=5$、$n_{seeds}=100$ 等;Table 6:$\lambda_{CM}=0.10$、$\lambda_{RM}=\lambda_{CH}=0.45$、$m_{RM}=2$、$\beta_{fail}=1.0$);附录 C.1 详述环境:8×NVIDIA H100(80GB)加约 2TB 主存,vLLM 部署 Qwen3.6-35B-A3B(最大上下文 262,144 token,temperature 1.0、top-p 0.95、top-k 20),任务跑在无网络的 Apptainer 容器中,DeepSeek-V4 经官方 API 调用。复现一次完整进化约需 40–150 小时墙钟时间(Table 1/7),对小实验室偏贵但可行;主要不确定性是进化随机性——论文只报单次运行,严格复现应跑多种子。一个便利条件是附录 H.1/H.2 给出了最佳智能体的完整代码 diff,可直接部署验证其 93.2%(Polyglot)/78.3%(SWE-bench)成绩,而不必重跑整个进化过程。总体评估:开源程度与文档详尽度高,复现难度中高,瓶颈在算力与时间而非信息缺失。