← 返回 2026-07-31

MemHarness:让智能体重构而非回放记忆 MemHarness: Memory Is Reconstructed, Not Replayed

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai 📅 2026-07-30 👍 15 2026-08-05 19:06
GRPO LLM智能体 POMDP 强化学习 经验重构 记忆增强 负迁移

用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练

前置知识

记忆增强智能体 (Memory-Augmented Agent)

一类把过去交互轨迹蒸馏成自然语言「经验/原则」存入外部记忆库,遇到新任务时用语义检索取回相关经验并拼进上下文来指导决策的 LLM 智能体范式。典型做法(Reflexion、ExpeL、Mem0、SimpleMem)都是「检索即回放」:取回的经验原样插入 prompt。每个记忆条目可抽象为 $m_i=(e_i, o^{src}_i)$,$e_i$ 是策略摘要,$o^{src}_i$ 是来源状态。

MemHarness 全部立论都建立在批判这种「逐字回放 (verbatim replay)」范式之上——它指出检索相关性不等于动作可用性,回放与当前状态错配的记忆会引发负迁移,因此必须读懂这条主线才能理解为什么要做重构。

GRPO (Group Relative Policy Optimization)

一种基于组的策略优化算法:对同一任务采样一组 $G$ 条轨迹 $\{\tau_i\}$,用组内归一化算优势 $A_i=(R(\tau_i)-\text{mean})/\text{std}$,免训练独立价值网络;再用 PPO 风格截断替代目标 $L^{CLIP}=\min(r_iA_i,\,\text{clip}(r_i,1-\epsilon,1+\epsilon)A_i)$,并加 KL 正则 $\beta D_{KL}[\pi_\theta\|\pi_{ref}]$ 约束策略不偏离参考模型。本文 $G=8$、$\epsilon=0.2$、$\beta=0.01$。

MemHarness 最大技术难点是没有重构标注数据,作者把重构输出 $g_t$ 当作隐变量,靠 GRPO 仅用任务级稀疏奖励(成功 $+10$、失败 $0$)端到端学会「何时接受、改写、拒绝」记忆。理解 GRPO 才能看懂奖励设计 $R=R_{outcome}+0.1\,R_{format}$ 与训练动态曲线。

POMDP 与部分可观测决策

把交互式决策建模为部分可观测马尔可夫决策过程 $\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{O},P,R)$,$\mathcal{S}/\mathcal{A}/\mathcal{O}$ 分别是状态/动作/观测空间,$P$ 为转移、$R$ 为奖励。因部分可观测,策略 $\pi_\theta$ 只能基于近期历史窗 $h_t=(o_{t-w+1},a_{t-w+1},\dots,o_t)$ 决策,目标是最大化期望回报 $\mathbb{E}[\sum_t R(s_t,a_t)]$。本文历史窗 $w=3$。

ALFWorld、WebShop 这类文本交互环境正是 POMDP,状态每步都变(房间布局、商品价格),这正是「历史经验与当前状态存在 gap」、逐字回放会失配的根源;POMDP 的形式化也让五阶段流程(观察-检索-批判-重构-行动)有了数学对应。

负迁移 (Negative Transfer)

把「过去有用的经验」直接套到新情境反而降低性能的现象。本文有明确量化:把朴素外部记忆接到 GRPO 上,ALFWorld 上 Mem0+GRPO 仅 $52.0\%$、SimpleMem+GRPO 仅 $54.5\%$,远低于纯 GRPO 的 $76.4\%$——记忆成了噪声而非帮助。根因是记忆条目形成时的环境条件与当前状态不同。

MemHarness 核心目标就是消除负迁移。消融表里「w/o reconstruction」「RL+Raw Memory」都退化甚至劣于纯 RL,是论证「回放有害、重构必要」的关键证据链。

冷启动与交互协议对齐 (Cold-Start SFT)

进入 RL 前用小规模监督数据让模型先学会「按格式检索-重构-行动」。本文每基准构造 200 条含记忆检索的多轮交互轨迹 + 200 条轨迹-记忆摘要对,由 GPT-5.1 离线生成、SFT 2 个 epoch、学习率 $1\times10^{-5}$。冷启动模型本身任务能力很弱(ALFWorld 仅 $7.6\%$ SR),只为对齐协议格式。

这是理解实验设置的必要前提:冷启动只解决「会不会用记忆和输出格式」,真正的决策与重构能力全部由后续 GRPO 习得。表 2 的「Cold Start Model」行直观证明「没有 RL 一切免谈」。

研究动机

当前主流的记忆增强 LLM 智能体遵循「逐字回放 (verbatim replay)」范式:检索到的轨迹或经验被当作静态记录,直接拼进 prompt 再生成动作,把「检索相关性」等同于「动作可用性」。但交互任务状态方差极高——一条语义相关、却在不同环境条件下形成的记忆,往往与当前状态不适配,频繁引发负迁移。论文给出确凿量化:ALFWorld 上把朴素外部记忆接到 GRPO,Mem0+GRPO 只拿到 $52.0\%$、SimpleMem+GRPO 仅 $54.5\%$ 的平均成功率,远低于纯 GRPO 的 $76.4\%$;案例(图 12)里一条描述「把信用卡放到咖啡桌」的记忆被原样回放,会把幻觉对象「credit card」「coffee table」注入上下文,诱使智能体输出非法动作。另一条「内化为参数」的路线虽能做状态条件生成,却把经验影响隐藏在权重里,难以追溯和修正。所以现状是:显式记忆可追溯但不适配、参数记忆自适应但不可检视。

本文的目标是作者想找一个「中间地带」:既保留显式、可归因的外部记忆库(保留可检视性与可修正性),又能针对当前状态动态地把取回的经验「重构」成与之对齐的指导,而非原样回放。具体目标有三:(1) 在动作生成前显式插入「批判 + 重构」环节,把记忆从「静态 prompt 片段」升级为「上下文敏感的指导」;(2) 让这种重构能力无需任何人类标注,完全靠任务级稀疏奖励端到端涌现;(3) 用同一个策略模型同时承担批判、重构与动作生成(共享参数 $\theta$),实现显式记忆可追溯性与参数化重构自适应性的统一。

与已有工作不同的是,本文的独特切入点来自认知科学——人类记忆是「重构式 (reconstructive)」而非「再生式」的:回忆不会原封不动地恢复过去,而是用当下线索与先验知识重新组织、改编后再指导行为。论文据此把记忆指导决策拆成与重构过程平行的五阶段(环境观察→经验检索→记忆批判→上下文重构→动作生成),并提出 MemHarness:在「检索」与「行动」之间显式插一段「状态条件化重构」。这与已有工作有三点本质不同:(i) 区别于 Reflexion/ExpeL/Mem0——它们把检索直接连到动作,本文多了可学习的中间适配层;(ii) 区别于把经验内化进权重的工作——本文保留可检视的显式记忆,但用统一策略参数化其重构;(iii) 区别于 MemRL/EvolveR——本文靠 GRPO 把重构当隐变量去学,而非注入原样经验。

核心方法

方法的直觉是:与其回放一条可能过时的经验,不如先拿当前状态去「批判」它、再「改写」成与现状对齐的简短指导,最后才据此行动。技术上 MemHarness 把这套流程落到三段式推理管线(图 2):(1) 记忆检索——策略依据历史窗 $h_t$ 决定是否发起查询 $q_t$,检索器从记忆库 $\mathcal{B}=\{m_i=(e_i,o^{src}_i)\}$ 返回 top-$k$ 条相关经验 $\mathcal{E}_t$;(2) 上下文记忆重构——同一策略 $\pi_\theta$ 把任务 $T$、历史 $h_t$ 和检索到的 $(e_i,o^{src}_i)$ 拼成重构上下文 $x^{recon}=T\oplus h_t\oplus\bigoplus_i(e_i,o^{src}_i)$,生成状态专属指导 $g_t\sim\pi_\theta(\cdot|x^{recon})$,若判定不可用则输出 $\langle\text{EMPTY}\rangle$ 走自我推理 $p_{self}$;(3) 动作生成——同一策略基于 $h_t$ 和 $\tilde g_t$ 输出可执行动作 $a_t$。重构与动作生成共享参数 $\theta$、联合训练,$g_t$ 作为无标注隐变量仅用 GRPO 任务级奖励端到端优化。记忆库由策略自己从轨迹蒸馏并按 Laplace 平滑效用分 $s(p)=(c_{succ}+1)/(c_{use}+2)$ 在线维护,用 BGE-M3 向量化、Milvus 存储并检索 top-3。

核心创新是在「检索」与「动作」之间显式塞入一段「状态条件化重构」,并把这种重构能力当作可学习的隐变量过程、靠 GRPO 端到端习得。与已有方法的本质区别有三:(1) 与「检索即回放」类(MemRL、EvolveR、Mem0+GRPO)相比——它们把 $\mathcal{E}_t$ 原样拼进动作上下文 $a_t\sim\pi_\theta(\cdot|T,h_t,\mathcal{E}_t)$,本文先重构再行动 $a_t\sim\pi_\theta(\cdot|T,h_t,\tilde g_t)$,把记忆从「静态片段」变成「上下文敏感指导」,这是消除负迁移的关键(表 2 去掉重构性能从 $85.2\%$ 跌到 $79.6\%$);(2) 与把经验参数化的工作相比——本文保留显式可追溯记忆,但用统一策略 $\pi_\theta$ 同时参数化批判与重构,兼顾可检视性与自适应性;(3) 与通用 LLM 改写相比——消融显示用 Qwen2.5-7B-Instruct 做「通用重构」只拿 $77.7\%$,证明重构必须与动作生成端到端联合训练。更巧妙的是,重构目标在训练中会成为「隐式指导」,即便推理时关掉记忆(w/o memory)策略仍达 $83.0\%$,本质上提升了内在推理能力。

方法步骤详情

分训练与推理两部分。**记忆库维护**:初始为空,训练时保留 $50\%$ 的 GRPO 轨迹(成功/失败均衡)由策略蒸馏为 JSON 结构化原则 $(e_i,o^{src}_i)$ 入库;写入时按余弦相似度去重(阈值 $0.85$,WebShop 开启、ALFWorld 关闭),检索时先取大候选池再嵌入去重截到 top-$k=3$,并按效用分 $s(p)=(c_{succ}+1)/(c_{use}+2)$ 周期剪枝(阈值 $0.3$,被检索满 3 次后才判)。**推理三段式**:① 历史窗 $h_t$($w=3$)送入策略,若需要则输出检索查询 $q_t$ 取回 $\mathcal{E}_t$;② 把 $T,h_t,\{(e_i,o^{src}_i)\}$ 拼成 $x^{recon}$,策略生成 $g_t$——不可用则 $g_t=\langle\text{EMPTY}\rangle$ 由映射 $f$ 给出 $\tilde g_t=p_{self}$,否则 $\tilde g_t=g_t$;③ 策略基于 $(T,h_t,\tilde g_t)$ 输出 think→action。**训练**:先冷启动 SFT(每基准 200 条交互+200 条摘要轨迹,GPT-5.1 离线生成,2 epoch,lr $1\times10^{-5}$)对齐协议;再用 GRPO,每 prompt 采样 $G=8$ 条轨迹、组内归一化算优势 $A_i=(R(\tau_i)-\bar R)/\sigma_R$,奖励 $R(\tau_i)=R_{outcome}+0.1\,R_{format}$,$R_{outcome}\in\{0,10\}$,$R_{format}$ 等权考核「每步恰好一个 think/action 块、单集 1–5 次 retrieve、严格英文」;轨迹级 $A_i$ 平摊给思考、重构、动作全部 token,Adam 优化(lr $1\times10^{-6}$,clip $\epsilon=0.2$,KL $\beta=0.01$),批大小 256/64,vLLM rollout。

技术新颖性

技术新颖性可拆四点:(i) 五阶段重构式记忆观——首次把认知科学的「重构 vs 再生」系统迁移到智能体记忆,将记忆指导决策形式化为「观察-检索-批判-重构-行动」五阶段,提供概念框架(图 1 对比 prior 重放/人类重构/MemHarness 重构三种范式)。(ii) 重构当隐变量、无监督端到端——最关键的突破:没有重构标注,作者把 $g_t$ 视为隐含推理过程,仅靠 $R_{outcome}\in\{0,10\}$ 的任务级奖励驱动 GRPO,让「何时接受、改写还是拒绝」自动涌现,绕开昂贵人工标注。(iii) 单一统一策略 + 显式/参数记忆的桥接——批判、重构、动作生成共享 $\theta$,兼顾可追溯与状态自适应,消融证明必须端到端训练(通用 LLM 重构 $77.7\%$ vs 本工作 $85.2\%$)。(iv) 重构作为隐式训练指导——一个反直觉发现:即使推理时彻底关掉记忆,「w/o memory」仍达 $83.0\%$(ALFWorld)/$73.6\%$(WebShop),远超纯 RL 的 $76.4\%$/$66.1\%$,说明重构目标在训练阶段反向塑造了更强的内在推理能力,把「记忆增强」与「策略增强」统一起来。

Overview of the MemHarness framework
Figure 2: Overview of the MemHarness framework
ALFWorld case: preventing hallucination via reconstruction
Figure 12: ALFWorld case: preventing hallucination via reconstruction

实验结果

**主结果(表 1)**:MemHarness 在 ALFWorld 六类任务平均成功率 $85.2\%$、WebShop 成功率 $75.6\%$(评分 $87.4$),均最佳。以 7B 体型在 ALFWorld 领先 Gemini-2.5-Pro($62.1\%$)$23.1$ 个百分点、WebShop 领先 $39.7$ 个百分点;对纯 RL 基线 GRPO 分别 $+8.8\%$($76.4\to85.2$)/$+9.5\%$($66.1\to75.6$)。关键反直觉:朴素回放让 Mem0+GRPO 跌到 $52.0\%$、MemRL 仅 $24.0\%$,全劣于纯 GRPO——MemHarness 靠重构扭转负迁移。**消融(表 2)**:冷启动 ALFWorld 仅 $7.6\%$ 证明 RL 必需;RL+Raw Memory $70.1\%$、w/o reconstruction $79.6\%$ 都低于完整模型,证明原样回放引入噪声;w/o memory $83.0\%$ 仍远超纯 RL,证明重构目标反向增强内在推理;通用 LLM 重构 $77.7\%$ 证明必须策略内部端到端学习。**OOD(表 3)**:未见过的 ALFWorld 布局上 MemHarness 拿 $85.9\%$,明显超过 RL+Raw Memory $76.3\%$,w/o reconstruction 仅 $82.4\%$ 证明回放在 OOD 下尤其有害。**机制深挖(表 4)**:移除来源状态 $o^{src}$ 后 ALFWorld 从 $85.2\%$ 掉到 $80.0\%$;换随机来源状态,拒绝率从 $8.7\%$ 飙到 $13.3\%$(WebShop $56.0\%\to63.3\%$),证明策略确实在比对历史与当前状态;1000 条反事实探针显示最小事实编辑会让接受→拒绝。**训练动态(图 3/4)**:ALFWorld 收敛到稀疏策略(每轨迹 2–3 次检索),WebShop 维持高频检索并持续过滤;含接受重构的轨迹成功率始终高于含拒绝的。

Main results on AlfWorld and WebShop
Table 1: Main results on AlfWorld and WebShop
Ablation studies on the components of MemHarness
Table 2: Ablation studies on the components of MemHarness
Performance on the ALFWorld Out-of-Distribution evaluation
Table 3: Performance on the ALFWorld Out-of-Distribution evaluation
Analysis of memory reconstruction
Table 4: Analysis of memory reconstruction
Evolution of memory usage behaviors during RL training
Figure 3: Evolution of memory usage behaviors during RL training
Training dynamics of success rates conditioned on memory decisions
Figure 4: Training dynamics of success rates conditioned on memory decisions
查看结构化数据
任务指标本文基线提升
ALFWorld 具身家务(6 子任务平均成功率) Avg. Success Rate (%) MemHarness 85.2%(Pick 87.0 / Look 78.6 / Clean 97.0 / Heat 87.5 / Cool 71.4 / Pick2 90.0) 纯 GRPO 76.4%;Gemini-2.5-Pro 62.1%;Mem0+GRPO 52.0%;SimpleMem+GRPO 54.5%;EvolveR 70.1% 相对纯 GRPO +8.8 个百分点;相对 Gemini-2.5-Pro +23.1 个百分点;相对最强记忆增强 RL 基线 EvolveR +15.1 个百分点
WebShop 在线购物 Success Rate (%) / Task Score MemHarness SR 75.6%、Score 87.4 纯 GRPO SR 66.1%;Gemini-2.5-Pro SR 35.9%;EvolveR SR 72.6%/Score 84.1;Mem0+GRPO SR 37.5% SR 相对纯 GRPO +9.5 个百分点、相对 Gemini-2.5-Pro +39.7 个百分点;Score 相对 EvolveR +3.3
ALFWorld 分布外(OOD,未见布局) Avg. Success Rate (%) MemHarness 85.9% RL + Raw Memory 76.3%;w/o reconstruction 82.4%;w/o memory 83.0% 相对最强对照 RL+Raw Memory +9.6 个百分点,证明重构在 OOD 下消除回放噪声
消融:推理时去掉记忆(验证内在推理提升) ALFWorld Avg. SR (%) w/o memory 83.0% 纯 RL Only (GRPO) 76.4% 即便完全不使用记忆,仍比纯 RL 高 6.6 个百分点——重构训练目标作为隐式指导反向增强了策略

局限与改进

作者承认的局限集中在规模与场景:策略骨架固定为 Qwen2.5-7B-Instruct,未验证更大模型(「重构目标作为隐式指导提升内在推理」是否随规模增强未知);仅评测 ALFWorld、WebShop 两个交互基准,对开放世界、长视野、连续动作空间等更复杂环境的泛化性未涉及;输出严格限制英文,多语种能力未考察;记忆库依赖策略自己蒸馏,冷启动数据由 GPT-5.1 离线生成(虽不参与训练评估,仍是昂贵外部依赖)。我额外观察到三点:(1) 奖励设计高度依赖 $R_{format}$ 的结构化约束(必须严格 think/action/retrieve_memory 标签、1–5 次检索),这套「agentic 协议」换到协议更自由的环境时格式奖励可能失效;(2) 评测只用成功率/任务分等终态指标,缺少对重构文本本身质量、一致性、可解释性的定量度量(反事实探针仅 1000 条且离线);(3) 检索固定 top-3 + BGE-M3,未与更强检索器/重排序消融,记忆子系统对最终增益的边际贡献未单独量化。

独立分析的弱点

弱点一:记忆子系统固定假设限制了上限。检索固定 top-$k=3$、嵌入固定 BGE-M3、去重阈值硬编码($0.85$),都没有随任务自适应。改进方向是让 $k$、检索器、相似度阈值都成为策略可学习的动作或用上下文 bandit 在线调,甚至用交叉编码器重排序提升召回质量,从源头减少「检索到不可用记忆」。弱点二:奖励高度依赖结构化格式约束。$R_{format}$ 强制 think/action/retrieve_memory 标签与 1–5 次检索,换到协议自由的环境(开放对话、连续控制)会失效;改进方向是设计协议无关的过程奖励,或引入检索质量/重构信息量的密集奖励(如重构与最终动作的互信息)替代纯格式奖励。弱点三:缺重构文本定量评估。现有评测只看终态成功率,反事实探针仅 1000 条且离线;可建立在线的重构质量指标(覆盖度、保真度、必要性)并纳入奖励或监控。弱点四:对 GPT-5.1 冷启动与蒸馏的依赖限制了完全自主训练;可用自蒸馏/自冷启动或规则模板替代,做「无外部强 LLM」的纯净复现。弱点五:规模与场景单一,仅 7B、仅两基准;可把骨干扩到 32B/70B 并迁移到多模态具身、浏览器/操作系统 agent、代码 agent 验证「重构范式」普适性。

未来方向

作者明确指向两条:scaling 到更大模型,以及拓展到开放世界环境。基于成果可延伸方向我补充四点:(1) 重构作为通用推理范式——既然「w/o memory」仍提升内在推理,可把重构目标从「记忆适配」推广为通用的「先批判再行动」隐式思维链训练范式,应用到不依赖记忆的推理/数学/代码任务,看是否同样能当隐式指导提升基线。(2) 多记忆协同与层次化重构——当前只重构单条 top-3,可设计多记忆投票、矛盾消解、跨 episode 的层次化原则聚合(类似经验的「归纳-演绎」双轮),让记忆库随训练演化出层级。(3) 重构的可解释性工具——把重构过程显式可视化(接受/改写/拒绝的归因图谱),给「策略为什么这么做」提供可审计界面,呼应论文强调的「可追溯性」。(4) 与参数记忆的深度融合——结合持续学习/知识编辑,研究显式重构记忆如何被周期性蒸馏回参数(经验固化),形成「参数↔显式」双向流动,进一步逼近人类记忆的巩固机制。

复现评估

复现门槛中等偏高、可复现性较好。**有利的**:论文给出 GitHub 仓库 https://github.com/KnowledgeXLab/MemHarness;附录 A 详列超参(GRPO 组大小 $G=8$、采样温度 1.0、lr $1\times10^{-6}$、clip $\epsilon=0.2$、KL $\beta=0.01$、批大小 256/64、历史窗 $w=3$、vLLM 利用率 0.75);附录 C 完整给出所有 prompt 模板(环境反馈、重构、摘要、fallback、反事实探针);记忆子系统(BGE-M3 + Milvus + top-3 + Laplace 效用剪枝)描述充分;ALFWorld/WebShop 均为公开基准,所有可训练基线用同一骨干 Qwen2.5-7B-Instruct 保证公平。**不利的**:(1) 冷启动 SFT 数据(400 例/基准)和反事实探针(1000 例/基准)依赖 GPT-5.1 离线生成,未公开种子与生成脚本,换 LLM 难完全对齐;(2) 训练需 veRL 框架 + 128 并行环境 + vLLM,单组 $G=8$×16 共 128 条 rollout,算力门槛显著(论文未报 GPU 数量与时长);(3) 记忆库随训练在线增长,结果对随机种子、去重阈值($0.85$)较敏感。综合看,熟悉 veRL/verl-agent 的团队能在数周内复现主表趋势,但要逐位对齐数字需相当工程投入。