← 返回 2026-08-26

Metaⁿ:以涌现深度实现递归自我提升 Meta^n: Recursive Self-Improvement through Emergent Depth

Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang 📅 2026-08-25 👍 14 2026-08-30 18:30
LLM智能体 元认知 程序合成 进化搜索 递归自我提升

固定元操作Ω并递归作用于其自身输出,构建深度自增长、角色涌现的自我提升智能体栈

前置知识

元推理与怪圈

元推理指系统跳出自身推理链、对推理过程本身进行推理并得出超出原有链条的新见解的能力(Russell & Wefald 的元认知传统)。Hofstadter 在《哥德尔、艾舍尔、巴赫》中提出怪圈概念:系统的自身规则被递归应用、反作用于自身产物,智能与自我感从中涌现。

本文的核心问题正是系统如何走出自身,Meta^n 的设计就是一次受控的怪圈实现,理解这一思想才能看清它与自我修改智能体的本质区别。

实现元深度

论文提出的定量标尺:相对 0 层求解器,1 层过程修改求解器,2 层过程修改 1 层过程,依此类推;驱动层是控制修改但自身从不被修改的组件。实现元深度指一次运行中行为实际发生变化的最高层级,而非架构名义允许的深度。

它是论文划分三大范式的依据:手工元系统深度为 1,自我修改智能体约 2.5,Meta^n 实测生长到 3-6 层,三种系统的差距全部由这个概念刻画。

进化程序搜索

维护候选程序种群、按适应度加权选择父代、经变异生成子代的自动搜索范式,代表工作有 FunSearch、AlphaEvolve、OpenEvolve,常配合岛屿模型或 MAP-Elites 等多样性机制,广泛用于发现数学构造与优化算法。

Meta^n 的进化档案编排直接继承该范式,且主要基线 OpenEvolve 就是此类系统,两者的样本效率对比(29 对 378 次候选评估)是实验论证的核心。

自我修改智能体

让 LLM 智能体重写自己源代码的一部分以求改进的系统,如 Gödel Agent、Darwin Gödel Machine、HyperAgents。理论上可无限递归,实践中为避免自我损坏必须冻结某个驱动层(动作 API、档案维护或外层评估循环),实现元深度被封在约 2.5。

它们是本文第二类基线,作者对 Gödel Agent 的崩溃—修正—架构瓶颈分析(修正配置下 0.451/0.527 分,预算×10 也只到 0.628)是理解本文贡献的关键对照。

层间条件化与乘性覆盖

运行阶段每层前处理接收上层传下的上下文字符串并输出自己的版本,逐层精炼:深层设定战略框架,浅层在框架内填充战术细节。若深度 $d$ 有 $k_d$ 种行为,条件化可表达至多 $\prod_{d=2}^{n} k_d$ 种联合配置,而无条件平坦架构只有 $\sum_d k_d$ 种($n=4, k_d=3$ 时为 27 对 9)。

消融实验证明这一上下文传递通道解释了约 72% 的递归增益,是全文最重要的定量结论,读懂它才能理解递归为何有效。

研究动机

现有自我提升 LLM 智能体对失败的主流反应是自我精炼:同一机制生成、诊断并修复答案,本质是单层反思,只改进答案而不改进产生答案的过程。引入显式元层的方案则各有限制:手工元系统(FunSearch、AlphaEvolve、OpenEvolve、ADAS 等)把搜索循环、变异算子、选择规则全部冻结在求解器之外,实现元深度为 1,求解器在改进而改进器永不改变;自我修改智能体(Gödel Agent、DGM、HyperAgents 等)让代理改写自身源码,理论上深度无界,实践中为避免自我损坏必须冻结某个驱动层,实现元深度被封在约 2.5。这构成两难:递归改进器以稳定性换深度,而现存系统一律以冻结驱动层收场,恰好封死递归想换取的深度。具体后果可见于 CO-Bench:Gödel Agent 发布式接口要求单个求解函数覆盖 36 个异构 NP 难任务,在两个骨干上都崩溃到约 0.000;在 assignment_problem 上,单次调用脚本因 import 沙箱中不存在的 scipy 得 0 分后,平坦自精炼只会反复尝试同类基于 import 的解法,永远跳不出局部循环。

本文的目标是本文目标是构造一个不牺牲稳定性即可持续加深元层级的自我提升系统。核心设计要求:保持一个固定的通用元操作 $\Omega$ 不变,让递归发生在操作的输入上而非操作本身,使每次应用都基于严格更大的信息集进行推理;栈的深度不由人预设,由收敛自然决定,当 $\Omega$ 再也找不到改进时停止生长。实证目标是在三种求解基底(Python 源码、Docker 终端、固定下游模型的提示重写)、八个基准族(CO-Bench 36 个 NP 难问题、AlphaEvolve Math、四域符号回归、AlgoTune、ARC-AGI-2 120 任务、TerminalBench 2.0 89 任务、Symptom2Disease、LawBench)与两个骨干(Gemma 4 31B-IT、GPT-5.2)上全面超越 Gödel Agent 与 OpenEvolve;机理目标则是首次证明元深度超过 2 会产生结构性不同的层级而非冗余层级,并通过消融精确定位递归增益的来源通道。

与已有工作不同的是,本文的独特切入是把自我改进的对象从改进器本身转移到改进器的输入上。以往工作都在递归改进器但失稳与冻结驱动层而深度封顶之间二选一,Meta^n 用操作固定、输入递归直接消解这对矛盾:$\Omega$ 从不改变所以不可能破坏系统,它的输入(下层执行轨迹加上产生这些轨迹的代码栈)又严格增长,所以每层都站在比上一层更高的视角。作者进一步把设计问题重新表述为信息问题——增益来自给 $\Omega$ 更多可读的东西,而非改写 $\Omega$ 本身,这使任何 $d>2$ 层的增益都能干净地归因于更丰富的输入。第二个独特视角是把深度当作可观测的涌现现象:尽管提示从未指派角色,不同深度的层展现出战术原语、专业化库、回滚修正等结构性分工,这是以往只到深度 2 的系统在原理上无法呈现的现象。

核心方法

直觉上,Meta^n 像一条不断自我包装的流水线:底层是普通 LLM 求解器 $S_1$,其上每层由固定元操作 $\Omega$ 用同一段提示模板生成,包装器 $M_d$ 把新层套在 $S_{d-1}$ 之外,形成嵌套调用 $S_d = M_d \circ \cdots \circ M_2 \circ S_1$。$\Omega$ 接收此前深度的全部任务轨迹 $\{\tau_i^{(d-1)}\}$、代码栈 $[C_2,\dots,C_{d-1}]$、任务描述 $\mathcal{T}$ 和深度 $d$,输出 $C_d = (f_{\text{pre}}^{(d)}, \mathcal{L}^{(d)})$,即战略前处理加可复用助手函数库。深度由收敛决定:$\Omega$ 返回空代码、连续 $P$ 层改进低于容差 $\epsilon \cdot R$、或达到最大深度 $D$ 时停止。编排分线性深化与进化档案两种,后者维护候选链种群搜索层链。实验在 Gemma 4 31B-IT 与 GPT-5.2 上以种子 42/43/44 报告三种子均值±标准差。

核心创新是递归输入而非递归操作。与自我修改智能体不同,$\Omega$ 这段提示模板在所有深度、所有基准上从不改变,系统不可能被自己的改写破坏;与手工元系统不同,$\Omega$ 的输入严格递增——从深度 3 起它同时读到下层的执行轨迹和产生这些轨迹的代码栈,而平坦自精炼循环无论迭代多少次都只看得到轨迹日志。这使 $\Omega$ 能完成归因式推理:LawBench 案例中深度 3 的穷尽法律分析指令使分数从 0.807 回归到 0.773,深度 4 的 $\Omega$ 读到 $[C_2, C_3]$ 后把回归归因于指令而非同时发布的 reconcile_labels 助手,于是回滚策略、保留助手、恢复到 0.833,平坦循环做不到这种归因。层间条件化还带来乘性覆盖:各层 $k_d$ 种行为可组合出 $\prod_{d=2}^{n} k_d$ 种联合配置,远超平坦架构的 $\sum_d k_d$。消融定量支持:去掉递归后 CO-Bench 档案最佳从 0.845 跌至 0.714,其中层间上下文通道解释约 72% 的递归增益,代码库约 15%,其余约 13% 来自递归机制本身。

方法步骤详情

流程分五步。第一步,$S_1$ 对 $N$ 个任务运行(单次或 8 轮观察-行动循环),留下轨迹 $\tau$。第二步构建步:$\Omega$ 以轨迹 $\{\tau_i^{(d-1)}\}$、代码栈 $[C_2,\dots,C_{d-1}]$、任务集 $\mathcal{T}$ 和深度 $d$ 为输入,输出 rationale、pre_process 与函数库块,组装成 $C_d=(f_{\text{pre}}^{(d)}, \mathcal{L}^{(d)})$。第三步运行步:$M_d$ 用最外层前处理生成 $\text{ctx}_d$ 并向内逐层精炼,求解器在合并上下文下返回脚本,联合库前置进脚本(同名深层覆盖)并经静态验证与冒烟测试,沙箱执行产出轨迹。第四步,线性编排贪心加深至触发停止条件。第五步,进化档案按 $w(c) \propto \bar{S}(c) + \alpha/(1+\text{children}(c))$ 采样 $B$ 个父链、各生 $K$ 个子链并循环温度,输出档案最佳 $\bar{S}^\star$ 与最佳单链。

技术新颖性

技术新颖性体现在四个层面。第一,范式层面:论文首次把自我提升组织为递归 n 层元这第三个范式,与手工单层元(深度 1)和自指单层元(深度约 2.5)并列,并以实现元深度这一定量标尺严格区分三者。第二,机制层面:冻结操作、递归输入是深度-稳定性两难的第三种解法——此前所有自修改系统都以冻结驱动层收场,而 $\Omega$ 永不改变使稳定性由构造保证,深度由收敛自由生长,实测所有运行都在深度 3 到 6 之间自然收敛。第三,现象层面:首次演示元深度超过 2 产生结构性不同的层级——回滚角色在深度 2 严格为零、深度 3 才出现(代码基底 55%、提示基底 33%),战术原语在深度 3 峰值 45% 后随专用库接管衰减到 17%,全程没有提示指派角色。第四,工程层面:$\Omega$ 从跨任务失败模式中提炼可迁移代码库,36 个 CO-Bench 获胜求解器中 22 个调用其发出的函数,simulated_annealing 传播到 15 个获胜者;OpenEvolve 的逐工件进化无法在单次运行内共享跨任务模式,导致 Meta^n 以约 13 倍更少的候选评估(29 对 378)胜出。

Meta^n at a glance
Figure 1: Meta^n at a glance
The two phases of a meta-layer, traced through a LawBench charge prediction run
Figure 3: The two phases of a meta-layer, traced through a LawBench charge prediction run

实验结果

结果覆盖八基准。CO-Bench 上 GPT-5.2 档案最佳 0.870 领先 OE 0.702 达 +0.168(种子区间不重叠),Gödel Agent 仅 0.527。ARC-AGI-2 held-out 上它是唯一非零系统:0.331±0.010(单链 0.123),OE 0.003、GA 0.054。AlphaEvolve Math 上 GPT-5.2 达 0.917 对 OE 0.726;AlgoTune 加速 ×15.10 对 ×10.45,例外:agentic 反低于 single-shot(×18.47);TB2 上 Gemma 两种子分别 +0.21/+0.23。提示重写基准边际缩小:LawBench 0.815 领先 GA +0.040。消融显示条件化占递归增益约 72%、代码库约 15%、机制约 13%,GA 预算×10 也只到 0.628。深度上 $d2 \to d3$ 平均增益 $-0.006$ 但 41% 任务对回归,深度 ≥4 候选赢下 31% CO-Bench 任务,consolidation 从 0.502 提到 0.71±0.02 且零回归。

Metan agentic vs. prior self-improving agents (Gemma 4 31B-IT)
Table 1: Metan agentic vs. prior self-improving agents (Gemma 4 31B-IT)
Cross-model condition: GPT-5.2 backbone
Table 2: Cross-model condition: GPT-5.2 backbone
Component ablations
Table 3: Component ablations
Metan variants, single-shot vs. agentic, on four representative benchmarks
Figure 4: Metan variants, single-shot vs. agentic, on four representative benchmarks
Search progress on CO-Bench, LawBench, and Symptom2Disease
Figure 5: Search progress on CO-Bench, LawBench, and Symptom2Disease
Emergent layer roles by depth, split by solver substrate
Figure 6: Emergent layer roles by depth, split by solver substrate
查看结构化数据
任务指标本文基线提升
CO-Bench(36 个 NP 难优化问题,GPT-5.2) held-out 测试平均分 Meta^n 档案最佳 0.870±0.011 OpenEvolve 0.702±0.025;Gödel Agent 0.527±0.033 +0.168,逐种子区间不重叠
ARC-AGI-2(120 任务 held-out,GPT-5.2) held-out 测试准确率 0.331±0.010(最佳单链 0.123) OpenEvolve 0.003±0.001;Gödel Agent 0.054±0.006 唯一得分非零的系统,类别性优势
AlphaEvolve Math(GPT-5.2) 基准分 0.917±0.016 OpenEvolve 0.726±0.046;Gödel Agent 0.674±0.068 +0.191
AlgoTune(Gemma 4 31B-IT,agentic) 运行速度提升倍数 ×15.10±2.4 OpenEvolve ×10.45±1.8;Gödel Agent ×13.22±2.7 +4.65×
LawBench 罪名预测(Gemma) F1 0.815±0.013(档案最佳) Gödel Agent 0.775±0.023;OpenEvolve 0.745±0.034 +0.040 / +0.070
TerminalBench 2.0(89 任务,Gemma agentic) 13 类别平均分 从种子 0.258 提升 +0.23 仅与自身种子对比(基线未适配 Docker 基底) +0.23;GPT-5.2 agentic 达 0.634
符号回归(4 域均值,GPT-5.2) 四域平均分 5.03±0.20 OpenEvolve 3.70±0.13;Gödel Agent 2.45±1.63 +1.33

局限与改进

作者承认的局限有三:一是基础求解器与每次 $\Omega$ 调用用同一模型,虽干净分离了深度与能力增益,但未测试强模型做 $\Omega$、弱模型做底层的部署形态;二是文本分类基准上与 OE 的领先幅度逐种子区间重叠,作者不声明显著性;三是统计口径不统一——TB2 标准差按 13 个任务类别而非种子计算、GPT-5.2 下仅单种子 s42,AlphaEvolve Math、AlgoTune、SR 无 held-out 划分。我的补充观察:其一,涌现角色分析依赖两个 LLM 评分者,整体 Cohen's $\kappa$ 仅 0.59、最抽象两类只有 0.30-0.37,且 trace 摘要格式随深度变化,作者也承认这会脚手架注意力分工,涌现与格式驱动的边界不清;其二,agentic 模式 token 成本是 single-shot 的 4-10 倍;其三,档案最佳与最佳单链差 0.06-0.07 说明单链部署损失明显,consolidation 的零回归保证只在 8 任务带上验证;其四,SWE-Bench 上种子已足够强、$\Omega$ 从未激活,框架价值依赖种子与上限之间的空间。

独立分析的弱点

有四个弱点。其一,计算经济学:agentic 每 8 次调用使 token 成本达 single-shot 的 4-10 倍,档案每次迭代还评估 $B \times K$ 条候选链;改进方向是蒸馏缓存 $\Omega$ 产物、训练判别器预测各链胜负。其二,对评估器反馈质量的依赖:$\Omega$ 的诊断完全建立在 $\text{eval}(t_i, s) \in [0,1]$ 的标量分数与轨迹之上,在反馈稀疏、噪声大或只有二元成败的领域归因推理会显著退化;改进方向是引入置信度估计或 LLM 诊断。其三,部署侧可观测性缺口:archive-best 与 best-chain 差 0.06-0.07 意味着部署需知道每任务该用哪条链,而 consolidation 的零回归保证仅在 8 任务带上验证;改进方向是把 consolidation 设为默认编排。其四,归因可信度:$\kappa = 0.59$ 的标注与随深度变化的 trace 格式模糊了涌现与设计的边界,深度 3 处 41% 任务对回归、18% 大幅下降,干扰仍靠更深层 $\Omega$ 事后修复;改进方向是固定格式做受控扫描。

未来方向

作者提出三个方向:用更强的模型担任 $\Omega$ 而让较弱模型做基础求解器,检验只升级改进器时深度是否仍划算;把层间传递的自由文本上下文替换为结构化或类型化表示,进一步提高条件化通道(已占递归增益约 72%)的效率;系统研究栈的有用深度上限,因为现有运行都在深度 3-6 间因 $\Omega$ 找不到改进而收敛,尚不清楚是信息瓶颈还是能力瓶颈。基于成果我还可延伸几条:其一,跨运行的持久元记忆——把某基准习得的代码库(如 simulated_annealing 已传播到 15/36 获胜者)作为新任务的初始 $\mathcal{L}$,检验元知识能否跨基准复用;其二,异构栈——不同深度用不同规模模型,量化每层边际收益;其三,把读轨迹加读代码的 $\Omega$ 范式搬到代码之外,如科学实验设计与数据分析流程的递归改进;其四,理论侧刻画 $\prod_{d=2}^{n} k_d$ 覆盖上界的可达条件,以及层间干扰何时能被回滚机制完全修复;其五,把 consolidation 的单调保证与进化档案结合为默认编排,消除对事后修复的依赖,并探索层间上下文的压缩表示以降低 token 成本。

复现评估

复现条件较好。代码已在 GitHub 开源(minnesotanlp/meta-n),$\Omega$ 是单个固定提示模板,附录 F 给出深度 2 完整输出示例,附录 C 列出各基准超参数。所有基准均为公开数据集:CO-Bench、ARC-AGI-2、TerminalBench 2.0、AlgoTune、LawBench、Symptom2Disease 及符号回归四域。算力成本主要是 LLM API 调用而非训练:需访问 Gemma 4 31B-IT 与 GPT-5.2,参考量级包括 OpenEvolve 在提示基准上约 485K token 预算、GA 对比实验累计 17M token、Meta^n 在 CO-Bench 仅约 29 次候选评估,agentic 成本为 single-shot 的 4-10 倍。随机性由种子 42/43/44 控制。基础设施需 Python 沙箱与 Docker(TB2),注入代码有静态验证与冒烟测试两道安全闸。总体难度中高:核心算法清晰、伪代码在附录 E.1,但多任务编排与八基准适配工程量不小,GPT-5.2 API 费用对个人研究者不低。