← 返回 2026-07-31

Frontis-MA1:面向机器学习工程递归自我改进的AI4AI元进化智能体 Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang 📅 2026-07-30 👍 180 2026-08-05 19:06
AI4AI RLVR 代码智能体 强化学习 机器学习工程 进化搜索 递归自我改进

开源全栈OpenMLE训练元进化智能体,MLE-Bench Lite奖牌率达71.21%。

前置知识

递归自我改进 (Recursive Self-Improvement, RSI)

RSI 指一个 AI 系统能改进「构建下一代 AI 的过程本身」,每一次升级后的系统又能进一步提升其后续版本的生成过程,形成持续自我强化的闭环。它是 AI4AI 方向的远景终点,要求智能体不仅能一次性生成更强的方案,还能持续地检查数据、提出算法、执行实验、诊断失败并决定下一份算力投向哪里。

本文将 RSI 作为终极目标框架,OpenMLE 只是这条路径上「从进化迈向元进化」的一个具体可执行步骤,理解 RSI 才能把握论文定位。

AI4AI 与元进化 (Meta-Evolution)

AI4AI 指 AI 系统参与创建或改进其他 AI 系统,包括训练代码、模型结构、算法、智能体 harness 等。进化 (Evolution) 描述优化过程:AI 根据执行反馈反复修改候选系统。元进化 (Meta-Evolution) 在进化之上多闭合一层学习回路,把进化轨迹复用来训练「提出未来修改」的模型本身,让改进者自身被训练。

Frontis-MA1 的 MA 正是 Meta-evolution Agent 的缩写,论文核心创新就是把训练与推理围绕同一组原子算子耦合,形成元进化回路。

机器学习工程 (MLE) 智能体与 MLE-Bench

MLE 智能体要为真实任务构建机器学习方案,并通过执行反馈迭代改进,轨迹通常从可行 pipeline 出发,经过反复实验逼近强人工或前沿模型方案。MLE-Bench 是基于 Kaggle 比赛的端到端评测,其 Lite 子集固定 22 个任务,以 Valid Rate、Medal Average(获得任意 Kaggle 奖牌的任务比例)和 Human Rank(超过的人类参赛者比例)作为聚合指标。

MLE-Bench Lite 是本文主战场,所有 39.39%→71.21% 的关键数字都在此基准上,理解其任务与指标才能解读实验结果。

RLVR 与 GRPO 风格的策略学习

RLVR (Reinforcement Learning with Verifiable Rewards) 用可执行验证器产生的标量奖励做强化学习,已在数学和代码推理上取得强能力。GRPO 是常见实现:对一个 prompt 采样一组回答,用组内归一化的优势做裁剪策略目标更新。本文沿用 GRPO 框架,但把组归一化优势替换为「熵型优势 (entropic advantage)」以放大上尾信号。

OpenMLE-ERL 的 RL 阶段是论文核心训练机制,需要理解 RLVR/GRPO 才能看懂自适应奖励界、熵型优势、异步 rollout 等创新。

进化式程序搜索与 AIRA-Evo

进化式程序搜索维护一个候选程序种群,通过选择父代、施加变换(如变异、交叉)、执行评估、保留优秀个体的循环来优化代码。AIRA-Evo 是其中一类种群循环框架,使用 Draft/Improve/Debug/Crossover 四类算子。本文 OpenMLE-Evo 沿用 AIRA-Evo 风格种群循环,但重新设计如何利用执行证据:结构化经验记录、多因子父代选择、按需记忆合成。

OpenMLE-Evo 的所有改进都对照「原始 AIRA-Evo」来量化,理解 AIRA-Evo 才能看懂 -41.7% token、+84.3% 新最优更新率等对比数字。

SFT 监督微调与算子级训练

SFT (Supervised Fine-Tuning) 用高质量示范数据微调模型。本文采用「执行接地的预算自适应 SFT」:在沙箱执行采样程序,按有效性和任务分数保留样本,达到配额或耗尽预算即停止,让困难任务获得更多尝试。关键创新是不训练完整轨迹,而是训练四个原子算子 Draft/Improve/Debug/Crossover 作为可被不同搜索算法复用的接口。

SFT 是 RL 前的暖启动阶段,26,259 条示范构成发布语料,理解算子级训练才能看懂为什么训练与推理能共享同一接口。

研究动机

AI 能力的增长已不单靠人类工程师,越来越多 AI 系统在写代码、跑实验、搜索设计并参与构建下一代 AI,这条 AI4AI 路径的远景是递归自我改进 RSI。机器学习工程 (MLE) 是 AI4AI 最直接的实例化:智能体要为真实任务构建 ML 方案并基于执行反馈迭代改进,每次迭代消耗时间和算力,结果可能在几分钟到几小时后才返回,反馈延迟、噪声大、异构,是研究智能体如何改进 AI 系统的高难度试验台。然而既有工作被割裂成三条互补却互不衔接的支线:纯推理时搜索 (Du et al., Fang et al., AIRA)、构建可执行任务环境 (MLE-Dojo, MLE-Smith)、用执行反馈后训练智能体 (AceGRPO, MLE-Dojo)。论文审计发现,在公开系统中没有任何一个同时覆盖「可扩展任务与环境构建 + 执行接地的智能体后训练 + 部署训练后模型的进化式 harness」这完整闭环,更缺乏复现整个循环所需的工件。同时评测算力极为受限:MLE-Bench Lite 上大多数报告使用远超本文的每任务预算,而本文仅用单卡 RTX 4090、12GB 显存、12 小时每任务预算。

本文的目标是构建一个开源、全栈、可复现的 OpenMLE 技术方案,把可验证环境、执行接地的后训练与测试时进化搜索连接为一个经过验证的工作流,用以在可执行 MLE 中研究递归自我改进。具体目标包括:(1) 提供可扩展、质量可控的可执行任务与环境 (OpenMLE-Gym);(2) 用执行反馈训练可复用的 Draft/Improve/Debug/Crossover 算子 (OpenMLE-ERL);(3) 用经验引导的长程搜索 harness 组合这些算子 (OpenMLE-Evo);(4) 在该栈上后训练并发布主模型 Frontis-MA1-35B 及伴随模型 Frontis-MA1-30B。在 MLE-Bench Lite 的 12 小时/任务、单卡 4090、12GB 显存预算下,把奖牌均值从基座 Qwen3.6-35B-A3B 的 39.39% 大幅提升,并验证训练增益与搜索增益可叠加、可跨骨干网复现、可迁移到 NatureBench Lite 这类竞赛外科研任务。

与已有工作不同的是,本文的独特切入角度是「共享算子接口」这一设计原则:把 Draft、Improve、Debug、Crossover 这四个原子程序进化算子同时作为后训练的优化目标与推理时搜索的组合单元。被验证的进化转移用 SFT 与 RL 监督训练同样的变换,搜索随后再组合这些变换,使训练后的模型本身成为进化 harness 的「变异引擎」,从而闭合「元进化回路」——改进者自身被训练。这与既有方法有本质区别:纯推理时搜索依赖冻结骨干网及其 prompt 提供变换能力;纯后训练工作不把学习到的策略统一组织在与长程搜索共享的接口周围;个别桥接系统 (MLE-Dojo, AceGRPO) 只覆盖部分子集。OpenMLE 同时强调可扩展任务构建(5,758 个质量门控任务)、执行接地的算子训练与经验引导的搜索三者联动的可复现完整闭环,并把 OpenMLE-Evo-Max 通过「与评测基准不相交的跨任务先验蒸馏 + 异步多 GPU 并行搜索」进一步逼近 GPT-5.6 Sol 与 Kimi K3 这类 2.8T 量级前沿模型。

核心方法

整体思路是先把 MLE 抽象为「程序进化下的可执行优化」:给定任务 $\tau$,搜索算法在第 $t$ 步选择算子 $a_t$ 并构造算子上下文 $c_t$,模型按策略 $g_\theta(\cdot\mid\tau,a_t,c_t)$ 采样程序 $p_t$,沙箱 $E$ 执行后由任务评测器 $R_\tau$ 返回分数 $s_t$,目标是在有限预算内找到签名分数最高的候选 $p^\star=\arg\max_{t\in I}\tilde s_t$。在此之上 OpenMLE 分三层落地:环境层 OpenMLE-Gym 把异构 Kaggle 资产统一成「任务包 + 隔离沙箱 + 结构化反馈 + 任务特定评测器」的标准合约;学习层 OpenMLE-ERL 用执行接地的 SFT 与 RL 训练四个原子算子;搜索层 OpenMLE-Evo 用结构化经验、多因子父代选择与按需记忆合成把训练好的算子组合成长程搜索。三层共享同一组算子接口,形成元进化回路:进化经验回流训练同一个变换模型,模型又驱动后续进化。

核心创新是「同一组原子算子在训练与推理两端共享接口」。Draft/Improve/Debug/Crossover 既是 SFT 与 RL 的优化目标,也是搜索 harness 实际调用的程序变换,通过最小化进化损失 $\mathcal{L}_{\text{evo}}$ 让 $g_\theta$ 给高执行分程序更高概率。本质区别:以往搜索依赖冻结模型或 prompt 提供变换、以往后训练不围绕搜索共享接口组织策略;OpenMLE 让被验证进化转移直接监督搜索后组合的变换,使训练后模型成为进化 harness 的变异引擎。配套:自适应奖励界 $r_{\text{base}}=\text{clip}\left(\frac{\tilde s-b_w}{b_b-b_w},0,1\right)^\alpha$ 由 on-policy 分数前沿动态收紧避免区间塌缩;熵型优势 $A_i^{\text{ent}}\approx\frac{e^{\beta r_i}}{\sum_{j\neq i}e^{\beta r_j}}-\frac{1}{G-1}$ 放大上尾信号;异步 rollout 不等最慢任务。

方法步骤详情

第一步任务构建:从 Curated Anchors(156 锚点)、Kaggle Datasets(3,362 个)、Kaggle Competitions(2,240 个,排除与 MLE-Bench 重叠竞赛)三类来源,统一映射到标准任务包。第二步质量过滤:LLM 过滤器沿任务有效性、数据充分性、原始数据使用、任务复杂度、数据质量五维度严格门控,得可执行任务集。第三步 SFT 暖启动:并行路径独立采样完整 Draft 解,进化路径施加 Improve/Debug/Crossover 并回溯保留高质量轨迹段,合并 26,259 例;预算自适应停止让易任务早停。第四步 RL:自适应界把原始分映射 $[0,1]$,熵型优势替换 GRPO 组归一化,按三因子适应度(父代奖励+子奖励方差+访问冷却)选有信息量父代;异步 rollout 解耦最慢任务。第五步搜索:每节点存经验卡聚合全局板,按「质量+相对改进+方法族新颖度」softmax 选父代,按需合成记忆并按算子检索相关祖先、兄弟与错误签名构造有界上下文。

技术新颖性

技术新颖性四点。(1) 共享算子接口使训练与推理形成元进化耦合,被验证进化转移直接监督搜索后组合的变换,是把 AI4AI 从概念落到可执行工作流的关键工程化。(2) 自适应奖励界从 on-policy 分数前沿动态推导更紧的界,叠加熵型优势按指数集中上尾,把 barely viable 提交与顶尖候选在学习信号上明显区分,对应 RL 曲线「测试 medal 率 24.2→34.8,+0.089」与「最佳候选优势 6.39 vs 1.58,约 4.0 倍上尾信号」。(3) 三因子父代选择用质量/进展/新颖度联合打分取代纯分数 softmax,使一个分数第 6 但进展第 1 的父代(右鲸检测 Parent B)选择概率从 10.47% 升到 17.09%(+63.2% 相对),保住结构互补分支。(4) 按需记忆合成与算子条件有界上下文,把 Improve 平均 prompt 从 102.8K 降到 35.7K(-65.3%)、99 分位 389.0K→54.3K(-86.1%)。这些机制共同把每百万 token 新最优更新率从 1.77 提到 3.27(+84.3%)。

OpenMLE-Gym task curation and executable format
Figure 3: OpenMLE-Gym task curation and executable format
Scale and composition of OpenMLE-Gym
Figure 4: Scale and composition of OpenMLE-Gym
Overview of the OpenMLE training and inference workflow
Figure 5: Overview of the OpenMLE training and inference workflow
Learning from executed rollouts
Figure 7: Learning from executed rollouts
OpenMLE-Evo Search Harness
Figure 9: OpenMLE-Evo Search Harness
Single-branch repair versus targeted Crossover on nomad2018
Figure 17: Single-branch repair versus targeted Crossover on nomad2018
Score-only versus three-factor parent selection on right-whale detection
Figure 18: Score-only versus three-factor parent selection on right-whale detection

实验结果

核心发现在 MLE-Bench Lite 三层评测展开。模型层:相同 OpenMLE-Evo harness 下,Frontis-MA1-35B 把奖牌均值从基座 Qwen3.6-35B-A3B 的 39.39% 提升到 60.61%,Human Rank 0.5828→0.7647。harness 层:固定模型横评 OpenMLE-Evo 一致优于通用 scaffold 与原版 AIRA-Evo(53.03%→60.61%)。系统层:叠加 OpenMLE-Evo-Max(先验蒸馏+异步并行)后达 71.21%、Human Rank 0.8126,超 GPT-5.5+Codex 的 68.18% 共 3.03 个百分点,逼近 GPT-5.6/K3 的 72.73%。30B 伴随模型复现同方向:34.85%→53.03%→66.67%。机制上 Improve+Crossover 贡献 85%–92% 增益、每百万 token 新最优率 +84.3%。NatureBench Lite 迁移:换模型 Match-SOTA 50%→70%,换 harness 20%→50%,组合 7/10。

MLE-Bench Lite results
Table 1: MLE-Bench Lite results
Results on NatureBench Lite
Table 2: Results on NatureBench Lite
Results on MLE-Bench Lite
Figure 1: Results on MLE-Bench Lite
RL training curves for Frontis-MA1-35B
Figure 6: RL training curves for Frontis-MA1-35B
Effect of upper-tail reward shaping
Figure 8: Effect of upper-tail reward shaping
Model performance on MLE-Bench Lite under the common OpenMLE-Evo harness
Figure 10: Model performance on MLE-Bench Lite under the common OpenMLE-Evo harness
Harness comparison on MLE-Bench Lite
Figure 11: Harness comparison on MLE-Bench Lite
Cross-harness Medal Rate evolution over the 22-task MLE-Bench Lite subset
Figure 12: Cross-harness Medal Rate evolution over the 22-task MLE-Bench Lite subset
Cross-model search trajectories on leaf-classification
Figure 13: Cross-model search trajectories on leaf-classification
Cross-model search trajectories on mlsp-2013-birds
Figure 14: Cross-model search trajectories on mlsp-2013-birds
Gold, Silver, and Bronze decomposition
Figure 15: Gold, Silver, and Bronze decomposition
Search efficiency and context-length comparison
Figure 16: Search efficiency and context-length comparison
Modality-stratified results on MLE-Bench Lite
Figure 19: Modality-stratified results on MLE-Bench Lite
查看结构化数据
任务指标本文基线提升
MLE-Bench Lite(22 任务,Kaggle 风格端到端 ML 比赛) Medal Average(获得任意 Kaggle 奖牌的任务比例,3 次独立运行均值) Frontis-MA1-35B + OpenMLE-Evo-Max = 71.21%(Human Rank 0.8126,Valid Rate 22/22) 基座 Qwen3.6-35B-A3B + 同 OpenMLE-Evo = 39.39%;GPT-5.5 + Codex = 68.18% 相对基座 +31.82 个百分点;相对 GPT-5.5+Codex +3.03 个百分点;同 harness 下后训练单独贡献 +21.22 个百分点
MLE-Bench Lite 跨骨干网复现(30B 伴随模型) Medal Average Frontis-MA1-30B + OpenMLE-Evo-Max = 66.67%(Human Rank 0.8053) Qwen3-30B-A3B-Thinking-2507 + 同 OpenMLE-Evo = 34.85% +31.82 个百分点;同 harness 后训练贡献 +18.18 个百分点,方向与 35B 一致
MLE-Bench Lite 同模型 harness 对照(Frontis-MA1-35B) Medal Average OpenMLE-Evo = 60.61% 原版 AIRA-Evo = 53.03% +7.58 个百分点,证明专门搜索 vs 通用编码 scaffold 的增益
NatureBench Lite(10 任务,跨六科研域,4 小时/任务,复现 Nature 系论文结果) Match-SOTA(相对差距 $g\geq 0$ 的任务比例) Frontis-MA1-35B + OpenMLE-Evo NB adapter = 70%(7/10),Surpass-SOTA 30%(3/10) 基座 Qwen3.6-35B-A3B + 同 adapter = 50%;基座 + 原 AIRA-Evo = 20% 换模型 +20 个百分点;换 harness +30 个百分点,证明训练与搜索均迁移到竞赛外科研任务
搜索效率(66 个任务-run 同 seed 同 12h 预算) 每百万模型 token 的新最优验证更新数 OpenMLE-Evo = 3.27 原版 AIRA-Evo = 1.77 +84.3%,且总 token -41.7%、Improve 平均 prompt -65.3%

局限与改进

作者明确承认五条能力边界:(1) 改进目标主要来自已执行方案的可测结果,只能判断「程序能否跑通、分数多高」,无法充分反映研究方向是否值得继续投入,系统更擅长优化解而非判断哪些想法值得追求;(2) 当前通过外部进化 harness 组合训练好的算子,分离虽让训练与搜索可行,但限制了模型自主发起的动作范围;(3) 智能体只参与改进外部 ML 工件这一小部分,离 RSI 要求的「参与语言模型自身改进」还很远;(4) 进化主要作用于候选解,进化系统本身基本固定;(5) 父代选择只用质量/进展/新颖度三因子且权重手工设定,大量已记录证据未被利用。我自己观察到的局限:迁移评测仅 10 任务、统计力弱;OpenMLE-Evo-Max 的增益部分来自跨任务先验蒸馏与异步多 GPU 并行,难归因为纯模型元能力;受源数据许可限制 5,758 个任务中仅 1,415 个发布完整任务包,其余 4,343 个仅发布 prepare.py/metric.py 脚本,复现训练分布有障碍;评测固定在单卡 4090 12GB/12h,未报告更大算力下的扩展曲线。

独立分析的弱点

弱点一:父代选择三因子权重 ($\lambda_s,\lambda_\Delta,\lambda_n$) 与熵型优势 $\beta$ 都是手工调参,论文未给系统超参搜索,任务分布偏移时可能失效——应把权重设为可学习或做任务自适应加权。弱点二:迁移证据仅在 10 任务 NatureBench Lite 上,且 Claude Opus 4.7、GLM-5.2 已达 100% Match-SOTA,Frontis 的 70% 距前沿仍有差距——应扩到完整 90 任务并补 RE-Bench、PaperBench 等异构基准。弱点三:OpenMLE-Evo-Max 增益部分来自跨任务先验蒸馏与异步多 GPU 并行,这种「外部知识注入+并行度提升」难归因为模型元能力本身——应设计消融分别量化蒸馏与并行贡献。弱点四:训练算子依赖沙箱执行反馈,单次可能分钟到小时级,RL 收集成本高、受限于沙箱吞吐——应引入代理评分(静态代码特征、轻量 surrogate)做预筛选。弱点五:进化系统本身固定,未实现「进化系统自我进化」——应把搜索策略、记忆合成模板也作为可进化对象。

未来方向

作者明确提出五条未来方向,对应五条局限:丰富「改进改进者」的目标函数(加入假设质量、推理过程、批评、可迁移策略等信号,而不仅是最终性能);把进化搜索与通用编码智能体整合,让人群探索与灵活 agentic 求解统一;让智能体参与 AI 开发流程更大份额,尤其是语言模型自身的改进;把进化系统自身作为进化对象;把经验引导扩展为可学习、任务自适应的因子权重,甚至让搜索策略自己发现预测性经验信号。基于本文成果可延伸的方向:把 OpenMLE 栈迁移到 RE-Bench、PostTrainBench、PaperBench 等更开放的 AI R&D 与论文复现基准,验证元进化能力是否真正跨域;研究 Frontis-MA1 能否用自身生成的进化轨迹继续自我后训练,向真正的自举 RSI 闭环靠近;探索把四个算子扩展为更丰富的程序变换空间(如 NAS、自动超参优化、自动数据增强),并让算子本身可被学习增删;把多智能体协作引入进化 harness,让不同智能体分别负责假设生成、批评、验证,形成分工更细的元进化系统。

复现评估

复现评估较高。作者承诺发布数据集、训练与评测代码、沙箱基础设施、搜索 harness 代码与后训练 checkpoint,并提供 Frontis-MA1-35B 与 30B 权重,使完整工作流可复现。但需注意:受源数据许可限制,5,758 个任务中仅 1,415 个发布完整任务包数据,其余 4,343 个仅发布 prepare.py 与 metric.py 脚本,复现方需自行从 Kaggle 下载,可能有版本漂移;SFT 语料 26,259 例与算子 prompt 模板在附录 B/C 详述,关键超参(自适应界、熵型 $\beta$、三因子权重 1.0/0.6/0.3)有给出;RL 训练曲线在图 6,但完整 RL 算力需求未明确披露,从规模看(35B+大量沙箱执行)复现成本高,需多卡 GPU 与大规模沙箱集群;评测协议透明(22 任务、3 次独立运行、12h/任务、单卡 4090 12GB),附录 D.1 给重复评测均值±标准差(如 34.8±4.3)。综合:方法代码开源度高,但完整复现训练阶段算力要求高。