SAM:面向长时程推理智能体的状态自适应记忆 SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
将长时程智能体的记忆管理建模为状态自适应问题,通过线索-页面架构实现意图驱动的记忆检索
前置知识
长时程智能体推理
智能体需要在扩展的时间范围内与环境交互,持续收集证据、跟踪进度,并根据不断增长的交互历史选择后续动作。每个步骤 $(a_t, o_t)$ 包含思考、工具调用、观察和部分结论,形成一个异构的轨迹 $ au_t = (a_1, o_1), (a_2, o_2), ..., (a_t, o_t)$。随着 $t$ 增长,直接在上下文中携带整个轨迹变得低效,因为相关决策信息往往分散在时间遥远的交互中
这是本文要解决的核心问题,理解这个概念才能明白为什么需要状态自适应记忆
GRPO (Group Relative Policy Optimization)
一种强化学习算法,通过在共享的父上下文中采样多个动作形成一个组,利用组内兄弟动作作为局部基线来计算优势值。这种设计将信用分配限制在局部状态上,避免了全局基线的高方差问题。更新时使用裁剪的代理目标,其中 $r_i( heta) = M_ heta(a_i|c) / M_{ heta_{old}}(a_i|c)$
SAM的OAT-GRPO是在GRPO基础上扩展的,理解GRPO才能理解OAT-GRPO的改进点
状态自适应记忆
将记忆访问建模为依赖于智能体当前决策状态的动态过程。在步骤 $t$,智能体的决策状态 $s_t = \phi( au_t, x)$ 捕获了已确立什么、已解决什么、还需要做什么这三个方面。目标是构建支持上下文 $ ilde{C}_t ?pprox I(s_t)$,使得 $a_{t+1} \sim \pi(\cdot | x, ilde{C}_t)$。这里 $I(s_t)$ 表示对当前决策状态最有用的信息,不是显式估计,而是概念性区分
这是本文的理论基础,整个SAM框架都建立在这个视角上
研究动机
长时程智能体推理面临的核心挑战是上下文管理问题。随着交互历史增长,历史变得长而异构,交织着思考、工具调用、观察和部分结论。例如在BrowseComp任务中,智能体需要浏览多个网页来回答问题,早期遇到的信息可能看起来无关紧要,但在后期可能成为选择下一步动作、排除错误分支或解释新获得证据的关键。现有方法主要通过截断历史、折叠成紧凑摘要或检索选定部分来处理,但这些方法在长时程轨迹上表现不佳:有用信息可能分散在遥远的步骤中,其重要性只有随着任务展开才会变得明显。在BrowseComp-ZH跨语言搜索和WideSearch广泛探索等任务中,信息可能跨越数十个交互回合才变得相关,简单的时间窗口或摘要难以保留这些延迟相关的关键信息
本文的目标是本文的目标是将长时程上下文管理重新表述为状态自适应记忆问题,强调对时间上遥远信息的需求驱动访问,而不仅仅是基于近期性的压缩。目标是构建一个独立的记忆框架,能够将正在进行的交互整合成紧凑的记忆线索,同时保存原始轨迹页面用于意图驱动的回忆。这个框架应该能够在不重新训练底层骨架的情况下,让智能体根据当前需求重构时间上遥远的信息,并且通过专家引导的监督学习和强化学习来优化记忆模块,使其与轨迹级别的效用对齐
与已有工作不同的是,本文的独特切入角度在于将记忆建模为一个独立的能力,而不是吸收到特定的智能体骨架中。现有方法要么将记忆作为智能体策略的一部分(通过动作空间的上下文编辑操作),要么将历史替换为摘要(损失性代理方法),要么在未压缩的历史上检索(检索历史方法)。SAM则不同:它将记忆视为一个独立的外部模块,通过线索-页面架构解耦轻量级的写入时整合和意图条件的读取时重构。记忆模型首先通过专家监督从强LLM(Claude-4.5-Opus和GPT-5.4)获得初始能力,然后通过OAT-GRPO在全智能体-环境循环中端到端优化,使其与延迟的轨迹级别决策效用对齐。这种设计使得同一个记忆模块可以跨不同的智能体骨架重用,而不需要重新训练骨架
核心方法
SAM的整体思路是将长时程历史从被动负担转变为可导航的记忆空间。当交互历史达到预定义容量时,SAM将其划分为连续的页面,为每个页面生成紧凑的记忆线索作为轻量级摘要和入口点,同时将原始页面存储在外部。在推理时,智能体可以发出带有意图的回忆请求,选择相关的线索,SAM则根据当前意图从对应的原始页面重构决策相关信息。这种设计分离了短期连续性(通过未压缩的近期上下文)、长期指导(通过记忆线索)和详细过去的恢复(通过意图驱动的回忆)。优化方面,SAM首先通过专家引导的监督学习从强LLM获得初始记忆行为,然后通过OAT-GRPO在全智能体-环境循环中端到端优化,使记忆与轨迹级别的决策效用对齐
SAM的核心创新点在于将线索不视为历史的替代品,而是作为底层页面的轻量级句柄。这与现有方法有本质区别:摘要方法将历史压缩成固定形式的替代品,检索方法直接返回预压缩的片段,而SAM的线索只是指向原始页面的指针,真正的内容是在回忆时根据当前意图从原始页面重构的。这种意图驱动的重构使得同一个页面可以根据不同的回忆意图返回不同的信息,而不是一成不变的摘要。例如,在早期阶段可能需要了解页面中"已确立什么",在后期可能需要"排除了什么"或"什么可能再次变得重要",SAM可以根据当前意图动态提取相关信息
方法步骤详情
SAM包含三个主要步骤。首先是基于页面的情节整合:当近期活跃上下文达到预定义容量(如64K tokens)时,SAM将交互历史划分为连续的页面,其中块大小受token预算限制。对于每个页面,记忆模型生成紧凑的记忆线索,捕捉该页面对延续相关的贡献,如已确立什么、排除了什么、未解决什么、什么可能再次重要。整合后,原始页面从活跃上下文中移除,线索保留在记忆库中,原始页面存储在外部页面存储中。第二是智能体引导的线索选择:在步骤t,智能体观察任务、当前活跃上下文和记忆线索。如果需要额外的过去信息,智能体发出带有意图的回忆请求,选择候选线索子集。这个选择不是由手工制作的检索分数决定的,而是由智能体自己根据其当前状态做出的。第三是意图驱动的情节回忆:选定的线索识别出底层页面,在回忆意图条件下,记忆模型顺序访问这些页面并提取对当前需求最相关的信息。回忆的内容然后注入到智能体的活跃上下文中用于后续推理。最终的活跃上下文包含任务、未压缩的近期上下文提供短期连续性、记忆线索提供轻量级长期指导、以及回忆内容恢复当前决策所需的详细过去信息
技术新颖性
SAM的技术新颖性体现在多个方面。首先是线索-页面架构的解耦设计:写入时的简单页面级整合和读取时的意图条件重构分离,使得SAM可以保持在线上下文轻量级的同时保留可能再次变得相关的信息访问。其次是记忆作为独立能力的优化范式:SAM通过两阶段训练(专家引导的监督学习和OAT-GRPO强化学习)将记忆从强LLM转移到紧凑的记忆模型,然后与轨迹级别的效用对齐。OAT-GRPO本身是一个新颖的贡献,它沿两个设计轴扩展了GRPO:一是将rollout结构化为记忆调用树,在每个记忆动作处暴露兄弟组并将结果信用传播回每个单独的记忆输出;二是在每个动作节点注入由前沿模型委员会计算的神谕锚定奖励。树结构化的结果奖励通过记忆调用树将稀疏的二元任务结果分配到每个记忆动作节点,节点的结果值是其子树中所有叶子的蒙特卡洛均值。神谕锚定的可恢复性奖励通过三个前沿模型(GPT-5.4、GLM-4.7、DeepSeek-V4-Flash)的并集近似目标空间,GPT-5.4作为单独的评估器对每个候选在相关性、覆盖率和一致性上评分0-10(重新缩放到[0, 1])。两个奖励结合成每动作信号,其中alpha平衡结果奖励和可恢复性奖励
实验结果
SAM在四个长时程智能体基准测试中始终优于强基线。在GLM-4.7骨架上,SAM在BrowseComp上达到56.5%,BrowseComp-ZH上64.2%,HLE上38.2%,WideSearch上69.2%,四基准平均57.0%,优于w/o CM(43.5, 52.5, 37.2, 65.4, 49.4)和所有启发式基线(discard-tool: 49.0, 62.5, 36.5, 66.3, 53.6;recent-k: 51.5, 61.2, 37.2, 67.1, 54.3;summary: 53.5, 59.0, 37.5, 68.3, 54.6)。在Qwen3.5-35B-A3B骨架上,SAM在BrowseComp上42.2%,BrowseComp-ZH上46.5%,HLE上37.2%,WideSearch上69.1%,四基准平均48.8%,同样优于所有基线。关键发现是同一个SAM模块泛化跨基准和骨架:单个Qwen3.5-9B记忆模型,训练一次,在所有评估的骨架-基准单元中驱动最佳分数,包括长范围英语浏览、跨语言搜索、广泛探索和知识密集型科学推理,以及在两个异构骨架(专有GLM和开源Qwen3.5)上。相比之下,启发式基线在基准之间翻转相对排名,确认SAM的改进是记忆机制本身的属性,而不是任何基准或骨架特定的耦合。消融实验表明,移除SFT或OAT-GRPO都导致一致的下降,确认两个阶段是互补而非冗余的。SAM在21-40、41-80、大于80交互回合桶中都均匀高于每个基线,SAM-over-summary差距即使在80回合后仍然可见。SAM在32K-128K的页面大小上都击败无记忆基线,最佳设置在32K-64K,小到保持语义聚焦,大到避免急切整合
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| BrowseComp (长范围网页浏览) | 准确率 | 56.5% (GLM-4.7) / 42.2% (Qwen3.5-35B-A3B) | Summary 53.5% (GLM-4.7) / 39.5% (Qwen3.5-35B-A3B) | +3.0% / +2.7% |
| BrowseComp-ZH (跨语言多跳搜索) | 准确率 | 64.2% (GLM-4.7) / 46.5% (Qwen3.5-35B-A3B) | Recent-k 61.2% (GLM-4.7) / 45.0% (Qwen3.5-35B-A3B) | +3.0% / +1.5% |
| HLE (知识密集型科学推理) | 准确率 | 38.2% (GLM-4.7) / 37.2% (Qwen3.5-35B-A3B) | Summary 37.5% (GLM-4.7) / 35.2% (Qwen3.5-35B-A3B) | +0.7% / +2.0% |
| WideSearch (广泛探索) | 准确率 | 69.2% (GLM-4.7) / 69.1% (Qwen3.5-35B-A3B) | Summary 68.3% (GLM-4.7) / 66.8% (Qwen3.5-35B-A3B) | +0.9% / +2.3% |
局限与改进
作者承认的局限性包括:SAM目前仅限于单智能体轨迹,尚未扩展到多智能体或协作场景;记忆模型的训练依赖于专家traces(来自OpenSeeker和OpenResearcher),这些数据的质量和多样性可能限制模型的泛化能力;在高并发场景下,外部页面存储的访问可能成为性能瓶颈。我观察到的局限性包括:SAM的整合策略是基于信息预算的简单页面划分,没有考虑语义边界,这可能导致相关信息被分散到不同页面;意图驱动的回忆依赖于智能体的意图表达质量,如果智能体不能准确表达其回忆需求,SAM的效果会受限;SAM的优化需要复杂的树结构化rollout和委员会评估,训练成本较高;在128K页面大小设置下,SAM在BrowseComp上表现不佳,表明SAM对整合粒度敏感,可能需要自适应的页面大小策略
独立分析的弱点
SAM在几个方面存在独立分析的弱点。第一,整合策略过于简单:基于token预算的页面划分可能破坏语义连贯性,相关信息被分散到不同页面会影响回忆效果。改进方向是引入语义感知的整合策略,例如使用句子嵌入或主题模型来识别语义边界,或动态调整页面大小以保持每个页面的语义聚焦。第二,意图表达质量敏感:SAM假设智能体能够准确表达其回忆需求,但实际上智能体的意图表达可能模糊或不完整。改进方向是设计更强的意图理解机制,例如通过多轮澄清或意图补全来增强回忆的准确性。第三,训练成本高:OAT-GRPO需要树结构化rollout和委员会评估,每个记忆动作需要多个分支和多个前沿模型的评分。改进方向是优化训练效率,例如通过并行化、缓存或使用更轻量的评估模型。第四,并发性能瓶颈:外部页面存储的访问可能成为高并发场景下的瓶颈。改进方向是优化存储访问模式,例如使用缓存、预取或分布式存储
未来方向
作者提出的未来工作方向包括:扩展SAM到多智能体场景,让多个智能体共享或交换记忆;探索动态页面大小策略,根据内容复杂度自适应调整整合粒度;研究更复杂的检索机制,例如层次化记忆或跨轨迹记忆。基于SAM的成果可以延伸的方向包括:端到端的智能体-记忆联合训练,而不是冻结骨架只训练记忆;层次化记忆系统,区分短期工作记忆、长期情景记忆和语义记忆;将SAM应用于其他长时程任务,如代码生成、数学推理或长期规划;研究记忆的可解释性,让智能体能够解释为什么需要回忆某个页面;探索记忆的压缩和持久化,例如将重要页面长期存储甚至跨任务重用
复现评估
SAM的开源情况较好,代码已在GitHub(https://github.com/qhjqhj00/cabeza)发布。训练数据来自公开发布的智能体轨迹:OpenSeeker(11.7K QA对,每个注释完整的轮次智能体轨迹)和OpenResearcher(互补的深度研究数据集,包含多消息工具增强轨迹)。这些数据都是公开可获取的。评估基准也是公开的:BrowseComp、BrowseComp-ZH、WideSearch和HLE。论文提供了完整的实验设置:128K上下文窗口,管理例程在64K触发,固定的解码超参数,每个查询轮次上限。训练细节在附录中提供。算力需求方面,记忆模型使用Qwen3.5-9B,专家模型使用Claude-4.5-Opus和GPT-5.4,评估委员会使用GPT-5.4、GLM-4.7、DeepSeek-V4-Flash,这些模型都是公开可访问的或可以通过API获取。总体而言,SAM的复现难度中等偏上,主要挑战在于获取前沿模型的API访问和足够的算力进行RL训练
论文图表