← 返回 2026-08-26

面向长程智能体执行框架的递归式经验–工作记忆演化 Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang 📅 2026-08-25 👍 25 2026-08-30 18:30
Agent Harness LLM智能体 技能演化 智能体记忆 递归自我改进 长程任务

用经校验的工作记忆驱动技能调用,以结构化证据定位失败并定向演化记忆,实现冻结模型的递归自我改进

前置知识

Agent Harness(智能体执行框架)

包裹在底层 LLM 之外的一层执行系统,负责协调记忆存取、技能调用、任务状态跟踪、工具交互与结果验证。模型本身只负责生成动作,何时检索经验、何时更新进度、何时结束回合等决策都由 harness 代为执行。Anthropic 的 Claude Code、各类 CLI agent 都属于这一层。

本文的核心主张是:递归自我改进的正确落点不是模型权重,而是 harness 中的记忆控制层。不理解 harness 的概念,就无法理解为什么作者说「基础模型完全冻结,改进仍然发生」。

经验记忆与技能库(Experiential / Skill Memory)

把可复用的执行经验(工作流、代码技能、操作守则)以文件形式持久化存储的机制,本文采用 Anthropic Agent Skills 格式。新任务到来时检索相关条目注入上下文,让模型复用以往教训。Voyager、AWM、ExpeL 都属于这一传统。

Recuris 的演化对象就是技能库 $\mathcal{E}_k$ 及其配套组件,理解技能库是什么,才能理解「往里面加一条技能、改一个触发谓词」为什么算一次记忆演化。

工作记忆(Working Memory, WM)

跟踪当前任务进展的紧凑状态结构:每个目标记录内容、状态(pending/done/blocked)、支持证据和阻塞项。它持续回答「哪些完成了、哪些还没做、证据是什么」,区别于不断增长、混有噪声的原始交互历史。

本文的关键设计是用 WM 作为技能检索的查询接口(state-grounded invocation),并用校验器防止状态幻觉。消融显示 WM 单独贡献了 $\tau^2$-Retail 上 +23.9 个百分点中的绝大部分。

递归自我改进(Recursive Self-Improvement, RSI)

系统利用自身运行产生的经验来改进自己,且改进后的系统又会产生新的经验用于后续改进,形成自我强化的循环。经典构想是 Schmidhuber 的 Gödel machine;LLM 时代则体现为让 agent 改写自己的 scaffold、工作流或记忆。

本文把 RSI 限定在「有界递归」:只有 $\mathcal{M}_k=(\mathcal{E}_k,\mathcal{W}_k,\rho_k,\mathcal{C}_k)$ 四个记忆组件可变,模型与外层流程固定。这是理解论文定位与安全性论证的钥匙。

$\tau^2$-Bench 与长程评测

$\tau^2$-Bench 是双控制工具调用对话基准:agent 在受策略约束的工具环境下满足模拟用户请求,只有数据库实际发生要求的变化才算成功。任务附带参考读写动作列表,可分别统计 read recall 和 required-write recall,区分「知道该做什么」和「真的做了」。

论文最有洞察力的分析(长程失败是执行问题而非检索问题:所有变体 read recall 都在 88.0–97.9%,差距全在 write 路径)就是靠这套指标做出的。

任务聚类配对 Bootstrap 置信区间

一种针对 agent 评测的统计方法:以任务为聚类单元重采样(论文用 10,000 次),计算成功率的 95% 置信区间,并做配对比较与 McNemar 精确检验。同一任务的多次尝试高度相关,普通二项检验会高估显著性。

论文用 † 符号标记区间排除零的结果,大量结论(如「EM 单独无效」「Airline 上只是方向而非效应」)都依赖这套协议。读懂它才能判断哪些数字是硬结论、哪些只是趋势。

研究动机

长程任务中 LLM 智能体的一个顽固缺陷是:随着交互历史增长,智能体逐渐丢失未完成目标的踪迹,技能调用也与当前任务状态脱节。现有经验记忆方法的检索信号要么是最初的指令,要么是完整的交互历史,两者都随执行推进而失真——初始指令不再反映当前问题,增长的历史则混着已完成步骤、过时信息、未决需求和执行噪声。论文用数据把这个问题钉死:在 $\tau^2$-Retail 上,所有变体(包括裸基线)的 read-action recall 都稳定在 88.0–97.9%,说明检索和「搞清楚该做什么」根本不是瓶颈;真正的失败在执行侧——基线智能体在 42% 需要写操作的回合中一条写操作都没执行就结束了,而「知道要写」到「真的写下去」之间隔着不断漂移的任务状态。更深层的问题是:经验在积累,但 harness 组织、选择和改进这些经验的记忆机制本身却是固定的,这正是 RSI 的核心障碍。

本文的目标是本文要构建一个能让智能体在完全冻结基础模型的前提下持续变强的长程 harness。具体拆成三个目标:其一,在任务内部,用工作记忆维护一个经过证据校验的任务状态,并让技能检索以这个状态而非完整历史为条件,使「何时调用哪个技能」始终锚定在当前待办事项上;其二,把每次执行变成结构化证据,使得一次失败可以被定位到记忆系统中具体该负责任的组件(技能内容、状态规范、调用策略或校验器),而不是只知道「失败了」;其三,在任务之间,用一个固定的 Meta-Agent 读取这些证据,提出只波及被指控组件的局部补丁,并通过固定的验证门控决定是否采纳,从而形成一个有边界的递归记忆演化循环。

与已有工作不同的是,论文的独特切入是把「记忆怎么用」和「记忆怎么改」当作两个正交但耦合的问题同时解决。现有工作几乎都聚焦在「存什么」:Voyager 存代码技能、AWM 归纳工作流、ExpeL 提炼洞见,但对「何时、如何调用」要么把技能整块塞进上下文,要么放手让模型自己决定——而模型自主调用已被证明不可靠。少数按执行上下文检索的系统(AutoGuide、SGDR)用的也是原始观测的相似度匹配,跟随环境「看起来像什么」而非智能体「已确认完成了什么」。在记忆演化一侧,现有方法的准入标准是模型自评有用或单个聚合分数提升,诊断单元和修补单元常常不一致。Recuris 的链路「EM–WM 耦合 → 结构化证据 → 失败定位 → 定向演化」让被诊断的对象和被修改的对象首次严格对齐。

核心方法

先说直觉:智能体失败常常不是不知道该做什么,而是做了的没被记住、该做的没被触发。Recuris 给每个任务配一个不断被工具回执校验的进度账本(工作记忆),并在关键时刻(比如智能体起草了一个会改数据库的工具调用时)根据账本现状精准投放对应的技能文件;任务失败后,完整记录「什么状态下调了什么技能、做了什么、看到什么、状态怎么改、校验器怎么说」的结构化轨迹让 Meta-Agent 能像读病历一样定位病灶,只修补被牵连的器官。技术路线是一个双循环架构。任务内循环是 $w_t \xrightarrow{\rho_k} \mathcal{E}_t \xrightarrow{\pi_\theta,\mathcal{T}} (a_t,o_t) \xrightarrow{U_{\mathcal{W}_k},\mathcal{C}_k,K} \tilde{w}_{t+1}$:工作状态驱动检索,模型执行,校验器把关状态更新。跨任务循环维护技能记忆 $\mathcal{M}_k=(\mathcal{E}_k,\mathcal{W}_k,\rho_k,\mathcal{C}_k)$,每轮产生结构化轨迹 $\Gamma_k$,固定的定位、修补、门控流程把它变成 $\mathcal{M}_{k+1}$。基础 LLM、工具集、Meta-Agent 与门控全程不变。

核心创新有两条。第一是「证据接地」的双向解耦:状态更新提议 $\tilde{w}_{t+1}=U_{\mathcal{W}_k}(w_t,a_t,o_t)$ 由模型提出,但只有校验集合 $\mathcal{C}_k$ 依据环境观测 $o_t$(结构化工具回执或任务专属评估器)认可的变化才会被固定内核 $K$ 提交,目标从 pending 变 done 必须满足 $\mathcal{C}_{k,g}(w_t,\tilde{w}_{t+1},a_t,o_t)=1$——口头确认和「调用了工具」都不算完成证据。这与既有工作里「模型自己写状态」或「固定规则维护状态」有本质区别:显式状态不等于可信状态,Recuris 把提议权和承诺权分开。第二是把这种耦合当作演化的可观测性基础设施:因为每步都记录 $(w_t,\mathcal{E}_t,a_t,o_t,\tilde{w}_{t+1},c_t)$,失败不再只是一个 0/1 结果,而是能归因到 $\mathcal{E}$(技能缺失/缺陷)、$\mathcal{W}$(目标遗漏/状态错误)、$\rho$(调用时机错/无关)、$\mathcal{C}$(该收没收/不该收乱收)四个组件之一的诊断证据,从而支持组件级定向修补而非全盘重写。

方法步骤详情

完整流程分五步。第一步,任务内执行:harness 在规范 $\mathcal{W}_k$ 下从任务初始化 $w_0$,每个目标记录内容、pending/done/blocked 状态、支持证据与阻塞项。技能调用由一族 deliverer 组成:call-time invocation 在智能体起草状态变更工具调用时触发(此时调用并不执行,harness 返回合成 not-executed 结果,让检索到的技能在真正动手前进入上下文),检索键是该调用点名的工具名,两个 $\tau^2$ 域都用它;boundary invocation 在回合边界按 $w_t$ 上的谓词触发,Terminal-Bench 记忆用 first_turn 谓词在开局投放一次。每步产出 $\mathcal{E}_t=\rho_k(x,w_t,e_t,\mathcal{E}_k)$。第二步,状态更新:提议 $\tilde{w}_{t+1}$,校验决策 $c_t=\mathcal{C}_k(w_t,\tilde{w}_{t+1},a_t,o_t)$,内核只提交被支持的变更。第三步,轨迹记录:$\Gamma_k$ 完整保存每步的状态、检索、动作、观测、提议与校验结果及最终成败 $y_k$。第四步,失败定位与修补:失败的回合交给固定定位函数 $D_k=A_{\text{fixed}}(\Gamma_k,\mathcal{M}_k)=\{(f_j,z_j)\}$,把每个诊断出的失败 $f_j$ 归因到 $z_j\in\{\mathcal{E},\mathcal{W},\rho,\mathcal{C}\}$;修补阶段为每个被牵连组件生成一个编辑 $\Delta m_z=P_{\text{fixed}}(\Gamma_k,\mathcal{M}_k,D_k,z)$,用算子 $\oplus_{Z_k}$ 只改被指控组件、其余原样复制。第五步,门控准入:$\mathcal{M}_{k+1}=\mathcal{M}_k^+$ 当且仅当 $G_{\text{fixed}}$ 判定候选既修复了源失败任务、又不回归含锚点任务的保留开发集,否则弃用。另有测试时适应模式:单任务 $N$ 次尝试预算内,Meta-Agent 只看任务指令、失败轨迹和一个「验证器给了 0 分」的比特(看不到验证器本身),修补经验记忆后重试至首次成功。

技术新颖性

技术新颖性体现在四个层面。检索层面,state-grounded invocation 把检索条件从「任务长什么样」换成「已验证完成了什么」,且触发谓词与检索键本身都是可演化组件 $\rho_k$ 的一部分,而非人工设计定死;论文证明在技能库逐字节相同的条件下,把调用权交给模型(每轮注入全部技能)比按状态调用低 18.0 个百分点且更贵。验证层面,提议/承诺分离加上显式完成谓词,是对「自写状态不可信」这一已知问题的机制化回答。演化层面,修补空间被约束为四个可解释的记忆组件、每个编辑绑定一个被诊断的失败,且准入要同时通过修复性与不回归性检验(含锚点任务),这比「聚合分数提升就保留」的既有准入严格得多;递归被刻意限制在记忆控制层内,模型与改进流程全程冻结。实验设计层面也有方法学贡献:结构化轨迹使注入故障的组件定位准确率从任务结果的 13.0% 提升到 64.8%;用双 Meta-Agent 独立实现(Claude Code 与 DeepSeek Harness)收敛到同一修复家族来证明「证据池而非改进器承载了演化」,这是同类工作少见的对照严谨度。

Overview of Recuris.
Figure 3: Overview of Recuris.
Case study of verified EM–WM coupling on τ²-Retail Task 91.
Figure 8: Case study of verified EM–WM coupling on τ²-Retail Task 91.

实验结果

主结果覆盖 4 个基准 × 10 个模型:37 个完成的模型–基准对中 35 对获得提升(Table 1)。前沿模型并未饱和:$\tau^2$-Retail 上 GPT-5.6 Sol 从 58.3 升至 76.1(+17.8†)、Claude Opus 5 从 72.4 升至 87.9(+15.6†,超出无 Recuris 时任何模型的最佳成绩 9.7 分)、部署模型 Doubao-2.0-Pro 从 58.1 升至 81.4(+23.3†);$\tau^2$-Airline 上 GPT-5.6 Sol +7.0†;SkillFlow 上 Qwen3.6-27B 从 42.2 升至 58.7(+16.6†)、35B 从 35.3 升至 48.8(+13.5†)。增益随任务变长而扩大而非衰减:按任务内在完成时长分位数,优势从最短组的 +12.5 升至最长组(>31 轮)的 +32.2,六类长程失败模式下降 20–86%(幻觉式完成 ↓86%、漏写 ↓80%)。消融(Table 2/3)拆出机制:read recall 各变体都在 88.0–97.9%,差距全在写路径——Recuris 的 required-write recall 比基线高 26.7 分,基线 42% 的需写回合零写入 vs Recuris 16%;EM 单独 +2.0(不显著),WM 单独 +23.9†,EM+WM +25.4†;模型自主调用同库技能得 65.6,比无技能的 82.0 还低,每成功多花 147k 对 101k tokens。机制消融呈双重分离(Fig. 6):write review 在 Airline 关键(−13.5 分)而 Retail 无关(−0.7),status board 正好相反(−17.3),事后审计型 truth guard 虽拒绝了 172 次不实完成声明却从不关键。演化侧(Table 4-6):注入故障定位 macro 准确率从结果的 13.0%、原始轨迹的 37.0% 升至结构化轨迹的 64.8%;三次演化运行在 86 个保留任务上全部以排除零的区间超过 $\mathcal{M}_0$(+9.01 至 +17.44,峰值 $\mathcal{M}_2$ 71.51 vs 54.07),且成绩与 required-write recall 的相关性 $r=0.97$,说明是执行性增益;Claude Code 与 DeepSeek Harness 两个独立实现的 Meta-Agent 终点相差仅 −1.45 [−7.85, +4.65]($p=0.72$),小于同一包两次重跑的噪声带 [−6.98, +7.27],且不约而同学到同一修复家族(服务请求授权字段+执行门检查+反升级技能)。门控安全性:接受的补丁只破坏 42 个锚点任务中已稳定的 4 个(9.5%),显著低于重跑噪声的 25.9%($p=0.013$)。跨模型迁移(Table 7):在部署模型上演化出的单一包原封不动提升 GPT-5.6 Sol +17.8、Opus 5 +15.6、Gemini 3.7 Flash +4.8,且最强目标模型终点最高(87.9 对部署模型上的 81.4),说明它不是弱模型拐杖。测试时适应(Table 8/9):Terminal-Bench 2.1 上 53/87(60.9%)对基线 34.5%,但其中 +26.4 来自重试预算本身;等预算下适应只 +2.3($p=0.774$),不过 per-attempt avg@4 在 56 个学到技能的任务上从 17.4 升至 21.9(四组切法一致向好),深查的单任务 16 次采样下裸智能体解 8 次、种子记忆 7 次、适应后 15 次($p=0.006$)。

Recuris improves task success where the task family has shared structure, and its value does not follow model scale.
Table 1: Recuris improves task success where the task family has shared structure, and its value does not follow model scale.
Coupling both memories gives the strongest variant in each domain.
Table 2: Coupling both memories gives the strongest variant in each domain.
Control over skill invocation matters more than skill content.
Table 3: Control over skill invocation matters more than skill content.
Structured traces make component faults observable, and the gain is concentrated on the faults the transcript cannot show.
Table 4: Structured traces make component faults observable, and the gain is concentrated on the faults the transcript cannot show.
Recursive evolution yields consistent held-out gains, and a second round compounds them.
Table 5: Recursive evolution yields consistent held-out gains, and a second round compounds them.
Swapping the Meta-Agent from Claude Code to DeepSeek Harness reproduces the gain, the endpoint and the learned components.
Table 6: Swapping the Meta-Agent from Claude Code to DeepSeek Harness reproduces the gain, the endpoint and the learned components.
One package, evolved on a mid-sized deployment model, lifts frontier models it never saw.
Table 7: One package, evolved on a mid-sized deployment model, lifts frontier models it never saw.
Terminal-Bench 2.1, decomposed: the attempt budget carries the headline, and the memory terms are read at a matched budget.
Table 8: Terminal-Bench 2.1, decomposed: the attempt budget carries the headline, and the memory terms are read at a matched budget.
Per-attempt success, the metric extra attempts cannot move.
Table 9: Per-attempt success, the metric extra attempts cannot move.
Recuris improves task success from 3B open-weight models to frontier models.
Figure 1: Recuris improves task success from 3B open-weight models to frontier models.
Long-horizon failure is an execution problem, not a retrieval problem.
Figure 4: Long-horizon failure is an execution problem, not a retrieval problem.
Coupling of EM and WM.
Figure 5: Coupling of EM and WM.
The critical mechanism differs between domains.
Figure 6: The critical mechanism differs between domains.
State-grounded invocation recovers required writes the agent would otherwise omit.
Figure 7: State-grounded invocation recovers required writes the agent would otherwise omit.
Held-out gains are consistent across evolution runs, and finer than the in-round gate can resolve.
Figure 9: Held-out gains are consistent across evolution runs, and finer than the in-round gate can resolve.
Illustration of component-specific Skill Memory evolution.
Figure 10: Illustration of component-specific Skill Memory evolution.
查看结构化数据
任务指标本文基线提升
$\tau^2$-Retail 工具调用对话 avg@4 任务成功率 (%) GPT-5.6 Sol + Recuris 76.1 GPT-5.6 Sol 单独 58.3 +17.8(CI 排除零)
$\tau^2$-Retail 工具调用对话 avg@4 任务成功率 (%) Claude Opus 5 + Recuris 87.9 Claude Opus 5 单独 72.4 +15.6(无 Recuris 时全场最佳仅 78.2)
$\tau^2$-Retail 工具调用对话 avg@4 任务成功率 (%) Doubao-2.0-Pro + Recuris 81.4 Doubao-2.0-Pro 单独 58.1 +23.3(部署模型上的最大单点增益)
$\tau^2$-Airline 工具调用对话 avg@4 任务成功率 (%) GPT-5.6 Sol + Recuris 86.0 GPT-5.6 Sol 单独 79.0 +7.0(CI 排除零)
SkillFlow 终身技能发现 avg@4 任务成功率 (%) Qwen3.6-27B + Recuris 58.7 Qwen3.6-27B 单独 42.2 +16.6(CI 排除零)
SkillFlow 终身技能发现 avg@4 任务成功率 (%) Qwen3.6-35B + Recuris 48.8 Qwen3.6-35B 单独 35.3 +13.5(CI 排除零)
$\tau^2$-Retail 最长任务组(>31 轮) 任务成功率提升 (pp) +32.2 agent 单独 优势随时程单调扩大(四分位 +12.5→+20.0→+27.9→+28.7→+32.2)
记忆组件故障归因(注入实验) macro 定位准确率 (%) 结构化轨迹 $\Gamma$ 64.8 仅任务结果 13.0 / 原始轨迹 37.0 接近翻倍(macro-F1 从 10.4 升至 63.4)
Terminal-Bench 2.1 测试时适应 预算内解题数 / 87 适应 + 4 次预算 53 (60.9%) Terminus-2 单次 30 (34.5%) +26.4,但等预算对照显示学习净贡献仅 +2.3($p=0.774$)

局限与改进

作者明确承认的局限:第一,$\tau^2$-Airline 仅 50 任务,该列所有置信区间都含零,作者自己读作「方向而非效应」;第二,Terminal-Bench 2.1 缺乏任务族共享结构,十三次跨任务演化运行一个补丁都未能通过门控,说明方法依赖任务间可复用的失败模式;第三,测试时适应的收益在此样本量下区间均含零,只能报告一致性方向;第四,校验器组件 $\mathcal{C}$ 在 $\tau^2$-Retail 上移除后通过率零变化,注入实验中该类故障无法在「校验不起约束作用」的域上测试;第五,迁移是有条件的——两个 Airline 谱系在其保留任务上不显著,因为基线已高达 73.0%/81.0%,没有留下可修复的失败类型。我自己的观察:其一,$\tau^2$ 域使用模拟用户且部署模型同时扮演用户,真实生产环境的用户不可控性未被检验;其二,八个接受的补丁净增 51 条技能且存留 17 对近重复条目,记忆单调膨胀,长周期(数百轮演化)下的检索干扰与维护成本未测;其三,每步校验与状态提议的 token 与延迟开销只在「每次成功 agent tokens」维度报告(101k vs 基线 116k),未给出逐步延迟;其四,关键机制随域而变(双重分离)虽支撑了自适应演化的必要性,但也意味着把系统部署到新域时需要先经历失败才能学会,冷启动成本没有被量化;其五,评估的 37/40 对中部分格子缺失(如 SkillFlow 对前沿模型未测),跨模型迁移结论主要建立在 $\tau^2$-Retail 上。

独立分析的弱点

弱点一:关键机制域依赖。write review 与 status board 的双重分离说明没有任何固定组件配置在所有域上最优,而这恰恰意味着部署新域时系统必须先失败若干次才能定位关键机制——改进方向是把 Fig. 6 式的机制归因做成在线进行的小规模主动探测,用少量探针任务快速识别新域的承载机制,缩短冷启动。弱点二:跨任务演化依赖共享结构,孤立任务只有重试级的边际收益(等预算 +2.3 不显著)。改进方向是把测试时适应学到的单任务技能做成跨任务可检索的抽象层,比如让 Meta-Agent 在写入时强制提炼任务无关的步骤骨架,并跨任务去重合并。弱点三:记忆只增不减,51 条新技能与 17 对近重复会让上下文选择和检索质量长期承压。改进方向如作者暗示,把剪枝算子加入更新集:基于调用频次、贡献归因(每次成功回溯引用的技能)和近重复聚类做门控删除。弱点四:校验器的假阴性(false-pending)只能事后归因修补,且作者发现事后型 truth guard 从不关键——错误已经发生,审计无法撤销。改进方向是把更多校验前移到动作执行前(call-time 检查已完成这件事),并让校验谓词本身可用反例自动测试。弱点五:失败归因是「修复决策」而非因果判定,Meta-Agent 误判组件时补丁必然无效(论文中 Run C 第四轮回吐大部分收益即是此类)。改进方向是引入 A/B 式反事实补丁:对归因不确定的失败并行生成两个不同组件的候选,让门控数据本身来消歧。弱点六:所有 $\tau^2$ 结论建立在模拟用户与程序化验证器上,SkillFlow 之外缺乏人类在环或真实 API 环境(如浏览器、代码仓库级长任务)的证据。

未来方向

作者层面提出的延伸:把剪枝算子加入补丁空间(近重复技能的存在使其自然且低风险);在「校验真正起约束作用」的域上测试并演化校验器组件 $\mathcal{C}$;测试时适应与跨任务演化两种模式的混合调度。基于其成果可自然延伸的方向:其一,多模型协同演化——目前单一部署模型的失败塑造记忆,若让多个异构模型的失败流汇入同一证据池,可能学到更普适的纪律性技能,论文已暗示单源记忆能迁移到 10 个模型,多源值得系统研究;其二,把「有界递归」的形式化做实:$\mathcal{M}_k\to\Gamma_k\to D_k\to\mathcal{M}_k^+\to\mathcal{M}_{k+1}$ 这个循环的收敛性、补丁空间的单调性与锚点门控的安全性目前只有经验证据,值得给出理论刻画;其三,与权重更新正交结合——记忆层解决「何时做对的事」,可与轻量微调(教会「怎么做」)叠加,验证两层改进是否可加;其四,更长的时程与流式任务:当前基准最长 31+ 轮,多天、跨会话的持续任务中工作记忆的持久化与状态恢复是空白;其五,把结构化轨迹 $\Gamma$ 作为通用诊断中间表示开放出来,供其他 harness(哪怕不用 Recuris 架构)复用其失败定位价值;其六,降低 Meta-Agent 成本,目前每轮演化需要完整的失败轨迹分析加门控重跑,蒸馏出小型专用定位模型会更实用。

复现评估

复现条件总体友好。代码开源于 github.com/Gen-Verse/Recuris;四个基准全部公开可得($\tau^2$-Bench 的 Retail 114 任务/Airline 50 任务、SkillFlow 166 任务带自带验证脚本、Terminal-Bench 2.1 的 87 个 Docker 化任务);技能记忆是人类可读的 agent-skill 文件,学到的 51 条技能可直接审计(论文还做了 93 条技能的事后审计确认无任务专属硬编码值)。主要成本在评测侧:每个配置 $k=4$ 次尝试、单次上限 200 步,仅 $\tau^2$-Retail 一个变体就是 456 个回合,乘以 5 个耦合消融变体、10 个模型和多个演化轮次,API 调用量可观;涉及 GPT-5.6 Sol、Claude Opus 5、Gemini 3.7 Flash、Doubao-2.0-Pro 等商业模型,没有大规模 GPU 集群也能复现,但预算不低。方法侧的关键复现点:演化固定在 16 个训练任务上、门控用 12 个开发任务(含锚点)、86 个保留任务冻结不动,划分在任何运行前固定且论文附录 C 给出;Meta-Agent 构建在 Claude Code 上,DeepSeek Harness 复现已证明可替换。难度评估:跑通推理侧(加载演化好的记忆做评测)中等偏易;完整复现演化循环需仔细遵循统计协议(任务聚类配对 bootstrap 10,000 次重采样、McNemar 检验)与门控阈值,属于中等偏难,但论文协议描述异常详尽,是目前 agent 记忆工作里统计规范性最好的之一。