← 返回 2026-08-05

PAST-Bench:个人智能体递归自我改进基础能力的归因评测基准 PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang 📅 2026-08-04 👍 33 2026-08-10 18:30
Agent框架 个人智能体 性能归因 持久化记忆 经验复用 评测基准 递归自我改进

评测个人智能体跨会话复用经验是否真正带来提升的归因基准

前置知识

递归自我改进 (Recursive Self-Improvement, RSI)

指 AI 系统利用自身运行过程中产生的经验来提升未来能力的性质。强形式 RSI 涉及修改模型参数或学习算法,而本文聚焦于更操作性的层次——个人智能体跨会话保留并复用经验。RSI 要求系统先识别有用经验、保存到会话之外、在相关时检索、正确应用、并在过时时修订。

这是整篇论文的概念锚点。作者强调他们评测的不是完整 RSI,而是其行为与基础设施基础(online self-evolution),理解这层区分才能明白 PAST-Bench 的定位和边界。

个人智能体 (Personal AI Agent)

一类持久化跨会话存在的智能体,能够读取消息、操作用户工作区、调用工具,并在数天数月间积累文件、记忆、技能与会话历史。典型框架如 Hermes、OpenClaw,记忆层系统如 Mem0、LangGraph 提供可编辑记忆、交互派生事实、时序知识图谱、程序化技能文件等底物。个人智能体是 RSI 的天然用户落地测试场。

本文的评测对象就是个人智能体。要理解为何需要新的评测范式,必须先理解这类系统把交互变为可改变未来行为的'经验'这一关键属性。

在线自我演化 (Online Self-Evolution)

个人智能体通过复用先前交互中积累的经验来改变未来行为,且无需模型重训练、无需提示优化、无需长上下文适配。它是 RSI 的具体化,但还不是 RSI 的完整形式,而是更强递归改进可赖以构建的行为与基础设施底物。PAST-Bench 的评测单位正是这种在线演化能力。

这是论文严格定义的被测能力,理解它才能区分 PAST-Bench 与一般 Agent 基准的目标——它问的是'同一用户跨未来任务是否变得更好',而非'能否解当前任务'。

性能归因 (Performance Attribution)

将 later-session 的性能提升归因到正确原因的问题。如果性能变好,增益可能来自保留的经验,也可能来自基座模型、运行时、提示、检索捷径、任务难度或评分噪声。作者把评测自我演化本质归结为一个性能归因问题,需要 matched control 才能剥离出真正的'经验复用'贡献。

这是本文相对现有基准的最核心方法论创新点。所有 matched on/off 对照、mechanism evidence 都服务于这个归因目标,不抓住它就抓不住论文的价值。

任务族与剧集序列 (Task Family & Episode Sequence)

评测单位是一个任务族——一个有序的 fresh-session 剧集序列,共享潜在规则(记忆)、可复用工件(程序复用)、一次修正(更新)或预置参考(信息收集)。四种剧集角色:Cold(首接触)、Learn(沉淀目标)、Evaluation(探查复用)、Control(无保留/干扰/陈旧/错误机制)。框架的易失上下文在剧集间被清空。

理解任务族与剧集角色是读懂所有表格的前提。matched on/off 对照与四能力分解都建立在这个评测单元之上,公式 $\Delta_f = S^{w/\text{-evolve}}_f - S^{w/\text{-o-evolve}}_f$ 直接依赖此结构。

研究动机

个人智能体如今能跨会话持久存在,读取消息、操作用户工作区、调用工具,并在数天数月间累积文件、记忆、技能与会话历史(如 Hermes、OpenClaw、Mem0、LangGraph 等框架把持久工作区、记忆、技能、工具执行作为一等运行时组件)。然而保留的经验是否真的让它在未来任务上表现更好,至今没有被系统检验。问题在于:积累经验并不保证改进——智能体可能存错证据、检索无关记忆、复用脆弱流程、或把陈旧状态套用到新任务。更关键的是,现有交互式 Agent 基准(GAIA、AgentBench、VisualWebArena、WorkArena、OSWorld)只在 fresh session 上做一次性 per-task 打分,把基座模型能力、提示、工具策略、保留经验全混进一个数字;记忆与技能基准(LongMemEval、LoCoMo、SkillsBench)只孤立地测某一成分,缺乏能剥离保留经验与基座/运行时贡献的 matched 对照。因此 later-session 的提升究竟来自经验复用还是基座模型、运行时、检索捷径、任务难度、评分噪声,根本无法分辨。

本文的目标是本文要构建一个面向自我演化的性能归因基准 PAST-Bench:在 matched 的开关持久化条件下,量化保留经验是否、以及在哪些能力上提升后续任务表现,并通过 trace 级机制证据判断提升是否走了声称的'保存-检索-应用-修订'路径。具体目标包括:(1)以任务族为评测单元,用 matched on/off 对照把 with/without 的差距做成可直接比较的强设计控制;(2)覆盖记忆、程序复用、信息收集、更新四种对持久状态提出不同需求的能力;(3)同时支持固定框架换模型、固定模型换框架两种隔离比较;(4)用机制证据分(Mech)补充任务分,避免'写而不读'或'走错底物'仍获分的误判。最终用基准做诊断,并据此设计可被逐机制消融的新框架 Hermes+。

与已有工作不同的是,PAST-Bench 与现有基准的本质区别在于评测单元是任务族内的剧集序列而非单一任务实例:早期剧集给智能体机会保存可复用经验,晚期剧集检验是否复用,matched control 剧集剥离持久化使任何增益都能对无持久化基线读出。它采用严格的上下文清空协议,使跨剧集提升只能流经持久底物(记忆库、技能文件、playbook、被编辑规则),而非残存的提示重叠。表 1 显示它是首个同时支持四轴的基准——跨会话保留经验、固定框架模型比较、固定模型框架比较、超越一次性成功的 trace 级诊断。这种'任务分 + 机制证据双轨'的设计正是现有基准(包括 SkillsBench、AgentBoard)所缺失的归因能力。

核心方法

直觉上 PAST-Bench 把评测从'能否解当前任务'转为'跨未来任务是否变得更好'。技术路线分三层:第一层任务族构造——为四种能力(记忆、程序复用、信息收集、更新)设计有序 fresh-session 剧集序列,共 26 场景、204 剧集(记忆 5/41、程序复用 8/64、信息收集 6/48、更新 7/51),每族含 no-retention、distractor、stale、wrong-mechanism 四类 control 剧集,分别排除提示捷径、表面记忆、陈旧复用、写错底物。第二层 matched 消融——每个 evaluation 剧集同时在持久化开 ($w/$) 与持久化关 ($w/o$) 下评分,共享相同提示、评分器、工具栈、种子,使差距最可能归因于持久层。第三层双指标——主指标自我演化间隙 $\Delta_f = S_f^{w/} - S_f^{w/o}$(族内 per-episode 任务分 $s_e\in[0,1]$ 均值之差),能力级为族宏平均;辅指标 Mech 基于记忆读写、技能打补丁、会话搜索、工件 diff、更新正确性。$\Delta_f$ 须越过 control 上界才被接受。

核心创新是把评测从'单点分数'升级为'轨迹级性能归因',并用 matched on/off 对照 + trace 级机制证据两路并检。第一路 matched ablation 用同一任务族、同一提示/评分器/工具/种子,只翻转持久化开关,使 with/without 差距最可能归因于持久层而非模型方差或任务漂移——这是一种强设计控制而非因果证明。第二路 mechanism evidence 直接读保存工件与运行时遥测,验证提升是否走了声称的底物路径:一个只写不读、或通过错误底物成功的智能体不应仅凭 $\Delta$ 获分。这种双轨设计暴露出'同样分数背后的不同机制'这一隐藏现象——例如 Hermes 与 nanobot 同为 $\Delta=+0.13$,但 Mech 分别是 0.64 与 0.57,因为 nanobot 几乎全靠单能力且无一致的 write-then-read 痕迹。与已有方法的本质区别:它评的不是任务,而是任务序列内状态的跨剧集复用。

方法步骤详情

完整步骤:(1)能力与任务族设计:记忆族植入单条 read-mostly 条款;程序复用族测有序执行与正确工具组合;信息收集族把工件预置到底物并植入 yield 错误答案的默认;更新族给第二权威写并测旧状态是否泄漏。(2)剧集角色编排:Cold 测首接触、Learn(更新族含 Update 剧集)沉淀目标、Evaluation 探查复用(触发措辞移除)、Control 做四类对照。(3)运行 matched ablation:$w/o$ 拒绝族内状态、$w/$ 允许,共享 seed/提示/评分器/工具。(4)打分:任务分 $s_e\in[0,1]$,族内均值得 $S_f$,族级 $\Delta_f = S_f^{w/} - S_f^{w/o}$,能力级为族宏平均;cold 分仅用于校准,持久化关闭基线是 matched $w/o$。(5)采集机制证据与(6)接受判据:$\Delta_f$ 须越过 control 上界且 Mech 须走对路径。(7)诊断驱动设计:把失败归为五类,每类对应一个 loop 阶段,设计 E1–E5 独立可消融机制得到 Hermes+。

技术新颖性

技术新颖性有三层。第一,评测单元创新:以任务族内剧集序列取代单任务实例,并强制上下文清空,使任何提升只能经持久底物而非残存提示重叠——这与'长上下文保留可见'或'无中断状态跨任务传播'两类现有 regime 形成根本区别。第二,归因双轨:matched on/off 对照 + trace 级 mechanism evidence 共同把'分数提升'与'机制符合'解耦,首次让'同 $\Delta$ 不同机制'可被度量。第三,诊断-设计闭环:把框架失败归到五个不相交类别(计划不先查状态、保存事实形式难复用、解出流程未存为可执行技能、行动前跳过已存证据、修正后旧证据仍活跃),每类归一个 loop 阶段,每阶段一个可独立启停的机制(E1 Plan、E2 Render、E3 Route、E4 Gate、E5 Close),实现逐机制可消融。作者选 Hermes 做干预是因为它是集合中唯一暴露 agent loop 而无预实例化持久栈的框架,正好满足逐机制消融所需的'干净 substrate'属性。

Task family distribution of PAST-Bench across the four capability categories.
Figure 2: Task family distribution of PAST-Bench across the four capability categories.
Runtime insertion points in Hermes+.
Figure 3: Runtime insertion points in Hermes+.

实验结果

核心发现四条。其一,框架跨基座模型稳健但受益子任务依赖模型优势:表 2 固定 Hermes 换 7 模型,全部从持久化获益(Overall $\Delta$ 从 +0.13 到 +0.24),但增益集中点随模型而变——GPT-5.4 均摊记忆(38%)/更新(35%),GLM-5.1 近半在更新(46%),Kimi K2.6 近半在记忆(49%);模型已擅长处恰是经验复用最受益处,单一 Overall $\Delta$ 会讲错故事。其二,框架子类型优势多样:表 3 固定 MiniMax-M2.7 换框架,ZeroClaw 抬记忆却丢程序,nanobot 60% 压在更新却几乎不改善记忆,Agent-Zero 四能三项退化($\Delta=-0.08$),Hermes 是唯一四能全正向基线;Hermes+ 抬记忆/信息/更新但程序略降 −0.02;同 $\Delta$ 可藏不同机制——nanobot 与 Hermes 同为 +0.13 但 Mech 分别 0.57 与 0.64。其三,单机制各司其诊断:表 4 中 E2 记忆持久分 0.80、E3 程序 $\Delta=+0.10$、E4 信息 $\Delta=+0.17$、E5 更新 $\Delta=+0.16$;Hermes+ 全开 Overall $\Delta$ +0.13→+0.15、Mech 0.64→0.73,更新 0.74/+0.24 呈超可加。其四,该 +0.02 差异小于 run-to-run 变化(0.13±0.04 vs 0.15±0.06),故非稳定总体增益;表 6 中 Hermes+ + GPT-5.4 平最高配置 $\Delta=+0.24$/Mech 0.80。

Comparison with representative benchmarks.
Table 1: Comparison with representative benchmarks.
Overall performance of PAST-Bench with Hermes agent.
Table 2: Overall performance of PAST-Bench with Hermes agent.
Fixed-model agent comparison on the four PAST-Bench capabilities.
Table 3: Fixed-model agent comparison on the four PAST-Bench capabilities.
Single-mechanism ablations on PAST-Bench.
Table 4: Single-mechanism ablations on PAST-Bench.
Focused Procedural interaction diagnosis.
Table 5: Focused Procedural interaction diagnosis.
Hermes+ across five base models.
Table 6: Hermes+ across five base models.
查看结构化数据
任务指标本文基线提升
PAST-Bench 自我演化评测(固定 Hermes 框架,7 模型) Overall Δ(持久化开/关族平衡差) GPT-5.4 达最高 +0.24(Mech 0.80);MiniMax-M2.7 为 +0.13(Mech 0.64) GLM-5.1 +0.20、Kimi K2.6 +0.17、DeepSeek-V4-Pro +0.17、Claude Sonnet 4.6 +0.20、Claude Opus 4.6 +0.19 全部 7 模型均从持久化获益,跨架构稳健
固定模型框架比较(MiniMax-M2.7) Overall Δ / Mech Hermes+ +0.15 / 0.73;Hermes +0.13 / 0.64 nanobot +0.13/0.57、ZeroClaw +0.12/0.55、Agent-Zero −0.08/0.39 Hermes+ 同时抬高 Overall Δ 与 Mech,且为唯一四能全正后改进更新
单机制消融(MiniMax-M2.7) 目标能力持久化分 / Δ E2 记忆 0.80/+0.30、E3 程序 Δ+0.10、E4 信息 Δ+0.17、E5 更新 0.70/+0.16 Base Hermes Overall 0.66/+0.13 每个机制各支持其诊断目标;Hermes+ 全开 Overall Δ +0.15、更新超可加 +0.24
Hermes+ 跨 5 模型迁移 Overall Δ / Mech GPT-5.4 +0.24/0.80、Sonnet 4.6 +0.22/0.77、MiniMax-M2.7 +0.15/0.73 对应 Hermes 基线 3/5 配置匹配或改进,但 DeepSeek-V4-Pro 与 Opus 4.6 略退,迁移正向但不一致

局限与改进

作者明确承认的局限:其一,Overall $\Delta$ 提升量(+0.13→+0.15)小于 run-to-run 变化(Hermes 0.13±0.04、Hermes+ 0.15±0.06),故不把 Hermes+ 解读为稳定总体增益,仅 Update 的 +0.12→+0.24 是较清晰均值移动(但 $\sigma_\Delta$ 从 0.01 升到 0.09)。其二,Hermes+ 效果跨能力与跨模型不一致:程序略降(−0.02),DeepSeek-V4-Pro 与 Claude Opus 4.6 略退,故其为诊断脚手架而非通用改进。其三,机制证据分度量的是与预期持久路径的一致性而非因果必要性,尚未结合反事实干预。其四,任务族为合成构造、孤立评测,能力空间仅四类,未覆盖更强递归改进形式。我额外观察到:仅 3 次运行、单模型调参后迁移,统计样本偏小;Hermes 选型虽合理却使其余框架只能作 off-the-shelf 基线、不可对称消融;基准当前规模(26 场景、204 剧集)相对 GAIA/AgentBoard 仍偏小,生态效度有限。

独立分析的弱点

独立分析的弱点与改进方向:第一,统计稳健性不足——Overall 增益(+0.02)落在 run-to-run 噪声内,仅 3 次运行难立显著性;应扩大运行次数并报 bootstrapped 置信区间,对 Update 的 $\sigma_\Delta$ 升高做方差来源分析。第二,单模型调参致迁移不一致——Hermes+ 仅在 MiniMax-M2.7 调参,迁移到 DeepSeek-V4-Pro/Opus 4.6 略退;可按模型自适应路由 E1–E5(与作者'自适应路由'未来工作呼应)。第三,机制证据非因果——现 Mech 只判一致性,建议引入反事实干预(删除/替换/损坏候选工件后测行为变化)并支持多条语义等价持久路径。第四,能力覆盖窄——仅四类基础能力,未含工具策略自获取、长程规划自修订、多智能体协调等更强 RSI 形态。第五,E2 在程序能力呈负作用(表 5 中 w/o E2 反把 Δ 从 +0.085 提到 +0.108),提示结构化记忆渲染与技能路由存在干扰,需自适应机制决定'某段经验归哪种持久面'。

未来方向

作者明确未来方向有四。其一,提升生态效度与时序广度:纳入人写与交互派生场景、更长任务序列、一族经验影响另一族的设定,测试智能体能否在更长时域保持有用状态、跨领域迁移经验、避免独立获取的记忆/程序/修正间干扰。其二,扩展能力空间至四类之外,评测智能体是否获取此前不具备的工具策略、构造并修订长程计划、跨多智能体协调经验、改进'决定存/取/验/改什么'的元机制本身,以区分'仅复用保留状态'与'改进自身学习过程'。其三,强化机制归因:结合 trace 证据与反事实干预(删除/替换/腐蚀候选工件后测行为变化),支持多条语义等价持久路径,并做大规度人注路径标注与不确定性估计。其四,未来智能体应学会在记忆/技能/会话历史间动态路由经验,检测冲突、冗余与陈旧状态,并在精度、延迟、token 成本约束下决定持久面归属。可延伸:把 matched on/off 范式推广到多智能体与工具生成场景、用 E1–E5 做在线自适应启停、把 mechanism evidence 与因果干预结合成更强认证机制。

复现评估

复现评估:代码已开源(https://github.com/Gen-Verse/PAST-Bench),并附完整可复现细节——附录 B 给出任务分定义(公式 1)、机制证据聚合(公式 2)、control 上界与每族 rubric;附录 A 给出任务族分类、构造与质量控制、trace 机制案例(图 4–8);附录 E 给出上下文与持久处理、模型推理设置、Agent 限制与重试策略;附录 D.6 给出每集 token/wall-time 成本(表 12)。基准规模适中(26 场景、204 剧集、四能力),主要可变成本在 LLM 推理与多次 matched on/off 运行(每评估剧集需跑两种条件 ×3 次)。复现难点有三:一是 matched on/off 需精确控制各框架持久层接口(附录 C 描述四框架支持各异);二是对 trace 遥测的依赖要求各框架暴露一致的读写/技能/会话搜索信号;三是 Hermes+ 的 E1–E5 为 Hermes 特定 loop 插入点,迁移到其他框架需重新定位。给定 API 访问与开源代码,中等算力即可复现主表(表 2/3/4)。