优化器即智能体:跨提示词、程序与机器学习工作流的推理驱动搜索 The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
单一工具调用智能体内化搜索策略,统一优化提示词、程序与ML工作流。
前置知识
LLM作为语义优化器
指用大语言模型在大型离散文本空间(如系统提示词、程序代码、训练配置)上做优化:LLM基于执行反馈提出结构化编辑,外部搜索机制指导探索与选择。代表方法有OPRO(基于分数历史)、DSPy/TextGrad(文本梯度)、AlphaEvolve/GEPA(进化式)。本文挑战的核心范式是LLM只当'突变器'而搜索策略由外部控制器决定。
理解这一点才能看懂本文的根本创新——把搜索策略从外部数学元启发式搬进智能体的推理过程,让LLM自己决定分支、评估、预算分配与恢复。
外部搜索控制器
贝叶斯优化、bandits(多臂老虎机)、进化搜索等数学元启发式算法。它们决定从哪个候选分支、跑哪些评估、如何分配预算、如何从停滞恢复。在传统LLM优化框架中这些是硬编码的外循环,LLM仅在循环内贡献局部语义编辑。
ReASearch的'controller-light'设计正是要剥离这些外部控制器,把它们内化为智能体通过工具调用实现的推理步骤。
代码智能体与python_exec工具
具备文件I/O、Python/Bash执行能力的LLM智能体。python_exec是最关键工具,它把智能体从纯文本推理者转变为计算推理者:能写分析脚本、计算评估日志统计、编程识别失败模式、求解线性规划。本文的ReASearch本质上是一个简单的代码智能体加上领域工具集。
理解代码智能体范式才能理解为何'推理搜索'能涌现出双重验证、因果诊断、数学抽象等原本需要手工算法组件才能实现的行为。
持久记忆与上下文压缩
为支持长时间跨度优化,智能体配备两类机制:当token超阈值或主动修剪时调用compaction工具总结交互历史;维护lessons.md持久文件,记录'什么有效/什么失败/下一步试什么'及关键经验观察。这是跨多轮形成假设、积累教训的基础。
记忆是ReASearch在长轨迹任务(如EPLB停滞120轮后突破、圆堆积LP嵌入)上超越单次代码生成方法(AdaEvolve)的关键能力。
ARC-AGI-2与算法发现问题
ARC-AGI-2是视觉推理基准,要求从少量示例推断变换规则;圆堆积、Heilbronn三角形是经典几何优化问题,TXN/EPLB是系统编程调度问题。这些都是'单实例硬问题',需要测试时针对特定实例优化,是程序进化任务的主要测试床。
这些benchmark上的结果(如ARC-AGI-2测试准确率50% vs 12.5%)是证明ReASearch程序进化能力最重要的实验证据。
研究动机
在现代AI中优化文本工件——系统提示词、程序代码、训练配置——是核心挑战。传统数学优化方法在大型离散空间上操作,却无法利用自然语言与代码的丰富语义结构。为此,近期大量工作把LLM当作语义优化器:LLM基于执行反馈提出结构化编辑,而外部搜索机制(贝叶斯优化、bandits、进化搜索)指导探索与选择。无论是基于分数历史优化的OPRO、文本梯度框架如DSPy和TextGrad,还是基于规划与进化的系统如AlphaEvolve、GEPA、ShinkaEvolve、AdaEvolve,都遵循一个共同设计:LLM仅作为'突变器'(mutator)在硬编码循环内贡献语义编辑,而战略搜索决策(从哪个候选分支、跑哪些评估、如何分配预算、如何从停滞恢复)全部由外部算法控制器决定。这种'控制器-LLM'分离架构虽推动了领域发展,但限制了搜索灵活性,使LLM无法利用跨轮次的持续推理与因果诊断能力,也使搜索策略难以适应不同任务结构。
本文的目标是本文目标是系统回答一个根本问题:一个工具调用型LLM智能体究竟能内化多少原本由外部数学元启发式承担的搜索策略?作者提出ReASearch(Reasoning-driven Agentic Search)框架,将优化循环完全交给单一推理智能体管理,使其自主决定测试什么、何时验证、何时回退、何时停止探索转而利用强候选。具体目标包括:(1) 构建一个controller-light框架,把核心优化操作打包为工具而非硬编码外循环;(2) 用同一智能体脚手架同时优化提示词、程序、ML工作流三类模态;(3) 在14个多样任务上证明统一框架能与专用优化系统竞争甚至超越,达成相对强基线2%到40%的提升;(4) 系统分析智能体轨迹,识别从推理中自然涌现的类优化器行为模式(候选验证、假设驱动修正、复用先验教训、回退恢复、自适应探索)。
与已有工作不同的是,本文的独特切入角度是把'搜索策略'从外部数学元启发式搬进智能体的推理过程。与近期仅展示智能体自动化特定ML流水线的概念验证项目不同,ReASearch首次系统评估了跨模态的内化搜索。核心洞察是:在丰富反馈环境中,前沿工具调用智能体能内化先前委托给外部数学元启发式的大部分搜索逻辑。作者不再让LLM作为'提议生成器'被手工启发式引导,而是让智能体主动分析结果、分配预算,并通过持久记忆在长时间跨度上精炼策略。这种'reasoning is the engine'的视角把优化问题重新表述为序列推理问题,使同一脚手架通过仅切换工具集和系统提示词即可处理三类完全不同的任务,本质上回答了'推理本身能否作为开放式搜索的强大引擎'。
核心方法
ReASearch的整体思路是把文本工件优化重新表述为序列推理问题。设$\mathcal{Z}$为文本工件空间(提示词、程序、训练配置),给定任务实例$x\sim\mathcal{D}$和工件$z\in\mathcal{Z}$,系统生成输出$Y\sim P(\cdot|x,z)$并获得奖励$r(x,Y)$,目标是$z^\star\in\arg\max_{z\in\mathcal{Z}}\mathbb{E}_{x\sim\mathcal{D}}[\mathbb{E}_{Y\sim P(\cdot|x,z)}[r(x,Y)]]$。当目标与具体输入无关(如算法发现问题)时外层期望消失,简化为最大化工件自身期望奖励。技术路线上,作者实现了一个简单的代码智能体,具备文件I/O、Python/Bash执行和轻量记忆模块。每回合智能体接收编码领域指导和当前优化状态的系统提示词及交互历史,推理下一步调用哪个工具。核心循环任务无关:所有任务特定信息仅通过工具集$\mathcal{A}_T$和系统提示词两个接口提供。其中python_exec最关键,把智能体从纯文本推理者转变为计算推理者,能写分析脚本、计算14个任务的评估日志统计、识别失败模式。为支持长时间跨度优化,还配备上下文压缩(compaction工具)和持久记忆(lessons.md文件)。
核心创新点是'将搜索逻辑从外部控制器内化到智能体推理中'。与以往方法(ADAS、AHE、AlphaEvolve、OPRO、DSPy、TextGrad、AdaEvolve等)的本质区别在于:先前方法用LLM做局部编辑,候选选择和优化目标由外部启发式算法决定;而ReASearch把整个优化过程通过工具暴露,让智能体完全掌控搜索程序。这意味着没有固定的外循环搜索流程:从哪个候选分支、何时验证、如何分配预算、如何从停滞恢复,全部由智能体推理决定。作者强调'controller-light'——只有必要的执行循环骨架是硬编码的,14个任务上的核心优化操作都打包为工具。关键好处是:智能体能形成跨多轮的假设、积累教训、做因果诊断,并能涌现出原本需要手工算法组件才能实现的行为(双重验证、回退恢复、自适应探索、数学抽象、复合算法等)。这本质上把优化从'算法问题'转化为'推理问题'。
方法步骤详情
方法步骤分五阶段:(1) 初始化——智能体读取基线工件(系统提示词/程序/训练脚本)和任务特定系统提示词,后者编码领域指导和当前优化状态。(2) 推理-执行循环——每回合智能体基于历史和记忆推理下一步,调用三类工具:评估类(提示词场景get_next_minibatch、call_student_model_batch、validate_candidate;程序场景evaluate;ML场景run_experiment)、编辑类(edit_code路由到独立子智能体保持主上下文干净,另有验证子智能体检查编辑有效性)、记忆类(compaction压缩、lessons.md读写)。(3) 分析诊断——智能体调用python_exec写分析脚本,检查中间行为、隔离测试子组件、计算训练曲线统计、识别失败模式,例如EPLB诊断出捐赠约束是瓶颈。(4) 持续记忆——token超阈值时调用压缩工具总结历史;维护lessons.md记录'什么有效/什么失败/下一步试什么'及关键经验观察,这是跨多轮形成假设的基础。(5) 终止选择——最终回合指令智能体基于完整评估历史和累积教训选择最终工件或合成新工件,而非仅选最高验证分候选(这对数据稀缺场景如AIME和Terminal-Bench尤其有用,智能体最终选择可在测试集上超过最高验证分候选)。每步输入是当前状态+历史+记忆,输出是工具调用或终止决策。
技术新颖性
技术新颖性体现在四个方面:(1) 统一性——同一智能体脚手架通过仅切换工具集和系统提示词即可处理三类完全不同的任务(提示词、程序、ML工作流),这是首次系统的跨模态内化搜索评估,覆盖14个多样任务。(2) 控制器轻量化——把核心优化操作打包为工具而非硬编码外循环,python_exec作为通用计算推理工具使智能体能做统计分析(如计算每步wall-clock时间、验证LP可解性)而非仅文本推理,这是区别于纯文本梯度方法的关键。(3) 主智能体-子智能体分工——edit_code路由到独立子智能体保持主上下文干净,验证子智能体检查编辑是否有效并尊重任务约束,但高层分析与诊断刻意保留在主智能体内以保留跨轮推理上下文、避免智能体间信息丢失、降低协调复杂度。(4) 涌现行为——双重验证、复用过去失败、刻意回退、自适应探索、因果诊断、数学抽象、复合算法、先分析后编码等行为无需任何额外启发式控制即从推理中涌现。与传统方法相比,ReASearch不依赖外部数学元启发式,证明了'推理本身可以作为开放式搜索的强大引擎'这一更宽广的视角。
实验结果
核心发现按三领域逐一分析。提示词优化(Table 1):AIME从GEPA的50.67提升到52.00,GSM8K从82.11到83.40,HotpotQA从65.80到67.60,Terminal-Bench 2.0提升最大(42.22→53.33,+11.11个百分点);完整ReASearch运行API费用低于$20(含缓存),与GEPA成本相当。程序进化(Tables 2-5):圆堆积ReASearch Sonnet 4.6在多个n值上匹配或超越人类已知最优(如n=32的2.940 vs 人类2.939);Heilbronn在多个n值接近人类最优;TXN任务GPT-5达4237(AdaEvolve 3636),EPLB达0.2305(AdaEvolve 0.1976);ARC-AGI-2 Sonnet 4.6测试准确率50.0%,远超AdaEvolve的12.5%,训练准确率85.0%。ML工作流(Table 6):ReASearch以更少token取得更强表现。NanoGPT两者统计上不可区分(0.976±0.008 vs 0.974±0.010);IMG-100从78.59提升到83.99;Atari Q*bert从1250±180跃升到4500±320;MuJoCo从3986±410到5267±480;Crypto相关性从0.0999到0.1110,Kaggle排名从29名到第6名,仅15个实验内即从36名到6名。涌现行为分析(Figure 5):提示词和程序优化中超过70%工具调用用于Python推理;典型模式包括EPLB因果诊断从0.21突破到0.23、Heilbronn n=12发现8重对称将24维折叠为2参数($2\sqrt{3}-v-0.5=0$)、圆堆积LP作为内循环嵌入随机搜索、IMG-100正确epoch数诊断使准确率65.75%→79.86%、AMP作为VRAM使能者解锁更深架构+CutMix+EMA协同增益82.38%→84.03%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AIME 2025 数学推理(系统提示词优化) | 测试集准确率 | 52.00±0.67 | GEPA 50.67±1.15(基线未优化46.00±1.33) | 比GEPA +1.33个百分点,比未优化基线 +6.00 |
| Terminal-Bench 2.0 软件工程(系统提示词优化) | 测试集准确率 | 53.33±1.96 | GEPA 42.22±1.28(基线35.56±1.48) | 比GEPA +11.11个百分点,提示词优化四任务中提升最大 |
| Circle Packing 圆堆积(程序进化,n=32) | 填充密度 | ReASearch Sonnet 4.6 = 2.940 | 人类已知最优 2.939;AdaEvolve Sonnet 4.6 = 2.810 | 超越人类已知最优结果,多个n值上刷新 |
| ARC-AGI-2 视觉推理(程序进化) | 测试集准确率 | ReASearch Sonnet 4.6 = 50.0%(训练85.0%) | AdaEvolve Sonnet 4.6 = 12.5%(GPT-5 = 11.7%) | 测试准确率4倍于AdaEvolve,是程序进化最显著提升 |
| IMG-100 图像分类(ML工作流优化) | 测试集准确率 | 83.99±1.10 | Claude Code 78.59±1.40(基线63.51±0.85) | 比Claude Code +5.40个百分点 |
| Atari Q*bert 强化学习(ML工作流优化) | 平均奖励 | 4500±320 | Claude Code 1250±180(基线475±90) | 比Claude Code提升约3.6倍,最显著的ML工作流增益 |
| DRW Crypto 加密预测(Kaggle,ML工作流优化) | 相关性系数(Kaggle私有榜排名) | 0.1110±0.0024(排名6) | Claude Code 0.0999(排名29);基线0.0953(排名36) | 仅15个实验内从第36名跃升到第6名,展示真实竞赛场景潜力 |
局限与改进
作者承认的局限性:每个设置仅3次独立运行取平均,统计稳健性有限;仅用Claude Sonnet 4.6和GPT-5两个骨干模型,未系统研究模型规模效应;统一框架虽controller-light但仍需任务特定系统提示词模板和工具集设计;总墙钟预算和每实验训练时长匹配可能不完全公平(作者做了matched-instruction对比并声称差距来自harness而非指令)。我自己观察到的局限:(1) 成本/效率权衡不透明——尽管单任务API费用低于$20,但14任务×3运行的总成本与墙钟时间未明确披露,与专用系统的全成本对比缺失;(2) 复现门槛高——智能体行为高度依赖骨干模型版本('Claude Sonnet 4.6'未来可能不可用或行为变化),且无开源代码承诺;(3) 涌现行为难以保证/调控——同设置不同运行可能产生截然不同轨迹,缺乏运行间方差与失败率分析;(4) 任务特定调优'minimal beyond domain-level system prompt'的说法需谨慎,系统提示词本身可能编码大量领域知识,'轻量化'边界模糊;(5) EPLB、Heilbronn等任务高度依赖特定骨干(Sonnet 4.6强于GPT-5),暗示方法对模型推理能力极敏感。
独立分析的弱点
弱点1:搜索行为的可控性与可解释性。智能体涌现行为(双重验证、回退、数学抽象)虽有趣但难以保证出现或调控,同设置不同种子运行可能产生完全不同结果,论文仅报告平均而未展示运行间方差与失败率。改进方向:行为概率分析、显式行为提示词引导、方差与失败案例库报告。弱点2:对骨干模型的强依赖。论文使用Claude Sonnet 4.6和GPT-5这两个特定前沿模型,圆堆积、EPLB等任务上Sonnet 4.6与GPT-5差距悬殊(如Heilbronn n=14 GPT-5仅0.02260 vs Sonnet 0.02429),暗示存在能力门槛,weaker模型可能完全无法涌现优化器行为。改进方向:系统消融模型规模与能力、研究能力门槛曲线、设计对弱模型更友好的工具抽象。弱点3:评估预算公平性。智能体的多轮推理成本(token、API延迟、上下文压缩)与专用系统的固定预算难以严格对等,Claude Code对比中差距被归因于harness而非指令,这种归因本身需更严格消融。改进方向:报告含所有开销的总dollar成本与严格wall-clock匹配。弱点4:长轨迹失败模式未充分分析。何时智能体陷入局部最优、何时记忆(lessons.md积累错误教训)反而误导搜索、何时python_exec分析错误导致错误结论,均未系统讨论。改进方向:失败案例分析、记忆污染研究、停滞检测与主动恢复。弱点5:任务边界与扩展性。14任务虽多样但相对狭窄(圆堆积、ARC、Kaggle等特定benchmark),未覆盖真实生产场景(分布式训练、多目标优化、约束优化、长周期科研)。改进方向:扩展到工业ML流水线、多目标帕累托优化、跨任务迁移。
未来方向
作者明确提出的方向:(1) 更深入分析涌现行为模式与智能体能力的关系——哪些行为依赖哪些模型推理能力,建立行为-能力映射;(2) 扩展到更多任务模态和真实场景,验证框架通用性边界。基于成果可延伸的方向:(1) 将ReASearch应用于自动科研闭环——给定研究问题自动设计实验、假设验证、数据分析、论文写作,把'优化器即智能体'推广到'研究者即智能体';(2) 多智能体协作优化——当前单智能体受上下文窗口与认知负荷限制,可设计专家分工的多智能体系统(架构探索、超参精调、因果诊断、数学抽象专家),通过共享lessons.md协同;(3) 与传统优化方法混合——在智能体推理弱的地方(精细数值/凸优化)嵌入传统求解器(本文圆堆积已嵌入LP)作为工具,形成'reasoning + numerical'混合搜索;(4) 在线学习与元优化——让智能体从多次运行学习优化策略本身,把lessons.md升级为跨运行可迁移策略库,实现元层面自我改进;(5) 应用于AI安全与对齐——用agent-as-optimizer优化对齐目标函数、奖励模型、安全约束、红队提示词;(6) 理论分析——形式化研究'推理搜索'与'算法搜索'的等价性与互补性,建立内化搜索能力的理论框架与复杂度界。
复现评估
复现评估:论文截至当前文档未提供开源代码或数据集链接(无明确GitHub仓库),这是重大复现障碍。数据方面,所用benchmark(AIME 2025、GSM8K、HotpotQA、Terminal-Bench 2.0、ARC-AGI-2、Circle Packing、Heilbronn、NanoGPT、IMG-100、Atari Q*bert、MuJoCo、DRW Crypto Kaggle)多数公开可得,但Terminal-Bench 2.0和部分benchmark需特定访问权限,DRW Crypto有竞赛数据限制。算力方面,提示词优化单任务API费用低于$20(含缓存),但ML工作流任务需GPU训练(每实验5-30分钟),总成本较高;程序进化需评估器调用预算(圆堆积/Heilbronn 500 per n,ARC-AGI-2 100 per puzzle,EPLB/TXN 500)。复现难度高,主要原因:(1) 智能体行为依赖特定模型版本(Claude Sonnet 4.6、GPT-5),未来模型迭代或下线将导致结果不可重复;(2) 工具集和系统提示词的精确内容未完整披露,而它们对结果影响巨大;(3) 涌现行为本质上是概率性的,即使复现也可能得到不同轨迹与略不同最终结果,14任务×3运行的样本量偏小;(4) 缺乏开源实现使得社区难以验证关键细节(上下文压缩策略、lessons.md格式、子智能体提示词)。建议作者开源代码、prompt模板、工具定义与示例轨迹以提升可复现性,这对声称'轻量controller'的方法尤为重要。
论文图表
该图将ReASearch与现有方法(ADAS、AHE、AlphaEvolve、OPRO、DSPy、AutoHarness、DGM、AdalFlow、DeltaEvolve、CodeEvolve、AdaEvolve、PACEvolve、AutoResearch、TextGrad、GEPA、ShinkaEvolve等)放在一个定位空间中比较,直观展示ReASearch在'控制器轻量化/智能体内化搜索'维度上的独特位置。
这张图是理解论文定位的关键——它一眼厘清了ReASearch与传统LLM优化方法谱系的关系,帮助读者理解本文并非又一个专用优化器,而是范式上的转移。