MemHarness:让智能体重构而非回放记忆 MemHarness: Memory Is Reconstructed, Not Replayed
用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练
前置知识
记忆增强智能体 (Memory-Augmented Agent)
一类把过去交互轨迹蒸馏成自然语言「经验/原则」存入外部记忆库,遇到新任务时用语义检索取回相关经验并拼进上下文来指导决策的 LLM 智能体范式。典型做法(Reflexion、ExpeL、Mem0、SimpleMem)都是「检索即回放」:取回的经验原样插入 prompt。每个记忆条目可抽象为 $m_i=(e_i, o^{src}_i)$,$e_i$ 是策略摘要,$o^{src}_i$ 是来源状态。
MemHarness 全部立论都建立在批判这种「逐字回放 (verbatim replay)」范式之上——它指出检索相关性不等于动作可用性,回放与当前状态错配的记忆会引发负迁移,因此必须读懂这条主线才能理解为什么要做重构。
GRPO (Group Relative Policy Optimization)
一种基于组的策略优化算法:对同一任务采样一组 $G$ 条轨迹 $\{\tau_i\}$,用组内归一化算优势 $A_i=(R(\tau_i)-\text{mean})/\text{std}$,免训练独立价值网络;再用 PPO 风格截断替代目标 $L^{CLIP}=\min(r_iA_i,\,\text{clip}(r_i,1-\epsilon,1+\epsilon)A_i)$,并加 KL 正则 $\beta D_{KL}[\pi_\theta\|\pi_{ref}]$ 约束策略不偏离参考模型。本文 $G=8$、$\epsilon=0.2$、$\beta=0.01$。
MemHarness 最大技术难点是没有重构标注数据,作者把重构输出 $g_t$ 当作隐变量,靠 GRPO 仅用任务级稀疏奖励(成功 $+10$、失败 $0$)端到端学会「何时接受、改写、拒绝」记忆。理解 GRPO 才能看懂奖励设计 $R=R_{outcome}+0.1\,R_{format}$ 与训练动态曲线。
POMDP 与部分可观测决策
把交互式决策建模为部分可观测马尔可夫决策过程 $\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{O},P,R)$,$\mathcal{S}/\mathcal{A}/\mathcal{O}$ 分别是状态/动作/观测空间,$P$ 为转移、$R$ 为奖励。因部分可观测,策略 $\pi_\theta$ 只能基于近期历史窗 $h_t=(o_{t-w+1},a_{t-w+1},\dots,o_t)$ 决策,目标是最大化期望回报 $\mathbb{E}[\sum_t R(s_t,a_t)]$。本文历史窗 $w=3$。
ALFWorld、WebShop 这类文本交互环境正是 POMDP,状态每步都变(房间布局、商品价格),这正是「历史经验与当前状态存在 gap」、逐字回放会失配的根源;POMDP 的形式化也让五阶段流程(观察-检索-批判-重构-行动)有了数学对应。
负迁移 (Negative Transfer)
把「过去有用的经验」直接套到新情境反而降低性能的现象。本文有明确量化:把朴素外部记忆接到 GRPO 上,ALFWorld 上 Mem0+GRPO 仅 $52.0\%$、SimpleMem+GRPO 仅 $54.5\%$,远低于纯 GRPO 的 $76.4\%$——记忆成了噪声而非帮助。根因是记忆条目形成时的环境条件与当前状态不同。
MemHarness 核心目标就是消除负迁移。消融表里「w/o reconstruction」「RL+Raw Memory」都退化甚至劣于纯 RL,是论证「回放有害、重构必要」的关键证据链。
冷启动与交互协议对齐 (Cold-Start SFT)
进入 RL 前用小规模监督数据让模型先学会「按格式检索-重构-行动」。本文每基准构造 200 条含记忆检索的多轮交互轨迹 + 200 条轨迹-记忆摘要对,由 GPT-5.1 离线生成、SFT 2 个 epoch、学习率 $1\times10^{-5}$。冷启动模型本身任务能力很弱(ALFWorld 仅 $7.6\%$ SR),只为对齐协议格式。
这是理解实验设置的必要前提:冷启动只解决「会不会用记忆和输出格式」,真正的决策与重构能力全部由后续 GRPO 习得。表 2 的「Cold Start Model」行直观证明「没有 RL 一切免谈」。
研究动机
当前主流的记忆增强 LLM 智能体遵循「逐字回放 (verbatim replay)」范式:检索到的轨迹或经验被当作静态记录,直接拼进 prompt 再生成动作,把「检索相关性」等同于「动作可用性」。但交互任务状态方差极高——一条语义相关、却在不同环境条件下形成的记忆,往往与当前状态不适配,频繁引发负迁移。论文给出确凿量化:ALFWorld 上把朴素外部记忆接到 GRPO,Mem0+GRPO 只拿到 $52.0\%$、SimpleMem+GRPO 仅 $54.5\%$ 的平均成功率,远低于纯 GRPO 的 $76.4\%$;案例(图 12)里一条描述「把信用卡放到咖啡桌」的记忆被原样回放,会把幻觉对象「credit card」「coffee table」注入上下文,诱使智能体输出非法动作。另一条「内化为参数」的路线虽能做状态条件生成,却把经验影响隐藏在权重里,难以追溯和修正。所以现状是:显式记忆可追溯但不适配、参数记忆自适应但不可检视。
本文的目标是作者想找一个「中间地带」:既保留显式、可归因的外部记忆库(保留可检视性与可修正性),又能针对当前状态动态地把取回的经验「重构」成与之对齐的指导,而非原样回放。具体目标有三:(1) 在动作生成前显式插入「批判 + 重构」环节,把记忆从「静态 prompt 片段」升级为「上下文敏感的指导」;(2) 让这种重构能力无需任何人类标注,完全靠任务级稀疏奖励端到端涌现;(3) 用同一个策略模型同时承担批判、重构与动作生成(共享参数 $\theta$),实现显式记忆可追溯性与参数化重构自适应性的统一。
与已有工作不同的是,本文的独特切入点来自认知科学——人类记忆是「重构式 (reconstructive)」而非「再生式」的:回忆不会原封不动地恢复过去,而是用当下线索与先验知识重新组织、改编后再指导行为。论文据此把记忆指导决策拆成与重构过程平行的五阶段(环境观察→经验检索→记忆批判→上下文重构→动作生成),并提出 MemHarness:在「检索」与「行动」之间显式插一段「状态条件化重构」。这与已有工作有三点本质不同:(i) 区别于 Reflexion/ExpeL/Mem0——它们把检索直接连到动作,本文多了可学习的中间适配层;(ii) 区别于把经验内化进权重的工作——本文保留可检视的显式记忆,但用统一策略参数化其重构;(iii) 区别于 MemRL/EvolveR——本文靠 GRPO 把重构当隐变量去学,而非注入原样经验。
核心方法
方法的直觉是:与其回放一条可能过时的经验,不如先拿当前状态去「批判」它、再「改写」成与现状对齐的简短指导,最后才据此行动。技术上 MemHarness 把这套流程落到三段式推理管线(图 2):(1) 记忆检索——策略依据历史窗 $h_t$ 决定是否发起查询 $q_t$,检索器从记忆库 $\mathcal{B}=\{m_i=(e_i,o^{src}_i)\}$ 返回 top-$k$ 条相关经验 $\mathcal{E}_t$;(2) 上下文记忆重构——同一策略 $\pi_\theta$ 把任务 $T$、历史 $h_t$ 和检索到的 $(e_i,o^{src}_i)$ 拼成重构上下文 $x^{recon}=T\oplus h_t\oplus\bigoplus_i(e_i,o^{src}_i)$,生成状态专属指导 $g_t\sim\pi_\theta(\cdot|x^{recon})$,若判定不可用则输出 $\langle\text{EMPTY}\rangle$ 走自我推理 $p_{self}$;(3) 动作生成——同一策略基于 $h_t$ 和 $\tilde g_t$ 输出可执行动作 $a_t$。重构与动作生成共享参数 $\theta$、联合训练,$g_t$ 作为无标注隐变量仅用 GRPO 任务级奖励端到端优化。记忆库由策略自己从轨迹蒸馏并按 Laplace 平滑效用分 $s(p)=(c_{succ}+1)/(c_{use}+2)$ 在线维护,用 BGE-M3 向量化、Milvus 存储并检索 top-3。
核心创新是在「检索」与「动作」之间显式塞入一段「状态条件化重构」,并把这种重构能力当作可学习的隐变量过程、靠 GRPO 端到端习得。与已有方法的本质区别有三:(1) 与「检索即回放」类(MemRL、EvolveR、Mem0+GRPO)相比——它们把 $\mathcal{E}_t$ 原样拼进动作上下文 $a_t\sim\pi_\theta(\cdot|T,h_t,\mathcal{E}_t)$,本文先重构再行动 $a_t\sim\pi_\theta(\cdot|T,h_t,\tilde g_t)$,把记忆从「静态片段」变成「上下文敏感指导」,这是消除负迁移的关键(表 2 去掉重构性能从 $85.2\%$ 跌到 $79.6\%$);(2) 与把经验参数化的工作相比——本文保留显式可追溯记忆,但用统一策略 $\pi_\theta$ 同时参数化批判与重构,兼顾可检视性与自适应性;(3) 与通用 LLM 改写相比——消融显示用 Qwen2.5-7B-Instruct 做「通用重构」只拿 $77.7\%$,证明重构必须与动作生成端到端联合训练。更巧妙的是,重构目标在训练中会成为「隐式指导」,即便推理时关掉记忆(w/o memory)策略仍达 $83.0\%$,本质上提升了内在推理能力。
方法步骤详情
分训练与推理两部分。**记忆库维护**:初始为空,训练时保留 $50\%$ 的 GRPO 轨迹(成功/失败均衡)由策略蒸馏为 JSON 结构化原则 $(e_i,o^{src}_i)$ 入库;写入时按余弦相似度去重(阈值 $0.85$,WebShop 开启、ALFWorld 关闭),检索时先取大候选池再嵌入去重截到 top-$k=3$,并按效用分 $s(p)=(c_{succ}+1)/(c_{use}+2)$ 周期剪枝(阈值 $0.3$,被检索满 3 次后才判)。**推理三段式**:① 历史窗 $h_t$($w=3$)送入策略,若需要则输出检索查询 $q_t$ 取回 $\mathcal{E}_t$;② 把 $T,h_t,\{(e_i,o^{src}_i)\}$ 拼成 $x^{recon}$,策略生成 $g_t$——不可用则 $g_t=\langle\text{EMPTY}\rangle$ 由映射 $f$ 给出 $\tilde g_t=p_{self}$,否则 $\tilde g_t=g_t$;③ 策略基于 $(T,h_t,\tilde g_t)$ 输出 think→action。**训练**:先冷启动 SFT(每基准 200 条交互+200 条摘要轨迹,GPT-5.1 离线生成,2 epoch,lr $1\times10^{-5}$)对齐协议;再用 GRPO,每 prompt 采样 $G=8$ 条轨迹、组内归一化算优势 $A_i=(R(\tau_i)-\bar R)/\sigma_R$,奖励 $R(\tau_i)=R_{outcome}+0.1\,R_{format}$,$R_{outcome}\in\{0,10\}$,$R_{format}$ 等权考核「每步恰好一个 think/action 块、单集 1–5 次 retrieve、严格英文」;轨迹级 $A_i$ 平摊给思考、重构、动作全部 token,Adam 优化(lr $1\times10^{-6}$,clip $\epsilon=0.2$,KL $\beta=0.01$),批大小 256/64,vLLM rollout。
技术新颖性
技术新颖性可拆四点:(i) 五阶段重构式记忆观——首次把认知科学的「重构 vs 再生」系统迁移到智能体记忆,将记忆指导决策形式化为「观察-检索-批判-重构-行动」五阶段,提供概念框架(图 1 对比 prior 重放/人类重构/MemHarness 重构三种范式)。(ii) 重构当隐变量、无监督端到端——最关键的突破:没有重构标注,作者把 $g_t$ 视为隐含推理过程,仅靠 $R_{outcome}\in\{0,10\}$ 的任务级奖励驱动 GRPO,让「何时接受、改写还是拒绝」自动涌现,绕开昂贵人工标注。(iii) 单一统一策略 + 显式/参数记忆的桥接——批判、重构、动作生成共享 $\theta$,兼顾可追溯与状态自适应,消融证明必须端到端训练(通用 LLM 重构 $77.7\%$ vs 本工作 $85.2\%$)。(iv) 重构作为隐式训练指导——一个反直觉发现:即使推理时彻底关掉记忆,「w/o memory」仍达 $83.0\%$(ALFWorld)/$73.6\%$(WebShop),远超纯 RL 的 $76.4\%$/$66.1\%$,说明重构目标在训练阶段反向塑造了更强的内在推理能力,把「记忆增强」与「策略增强」统一起来。
实验结果
**主结果(表 1)**:MemHarness 在 ALFWorld 六类任务平均成功率 $85.2\%$、WebShop 成功率 $75.6\%$(评分 $87.4$),均最佳。以 7B 体型在 ALFWorld 领先 Gemini-2.5-Pro($62.1\%$)$23.1$ 个百分点、WebShop 领先 $39.7$ 个百分点;对纯 RL 基线 GRPO 分别 $+8.8\%$($76.4\to85.2$)/$+9.5\%$($66.1\to75.6$)。关键反直觉:朴素回放让 Mem0+GRPO 跌到 $52.0\%$、MemRL 仅 $24.0\%$,全劣于纯 GRPO——MemHarness 靠重构扭转负迁移。**消融(表 2)**:冷启动 ALFWorld 仅 $7.6\%$ 证明 RL 必需;RL+Raw Memory $70.1\%$、w/o reconstruction $79.6\%$ 都低于完整模型,证明原样回放引入噪声;w/o memory $83.0\%$ 仍远超纯 RL,证明重构目标反向增强内在推理;通用 LLM 重构 $77.7\%$ 证明必须策略内部端到端学习。**OOD(表 3)**:未见过的 ALFWorld 布局上 MemHarness 拿 $85.9\%$,明显超过 RL+Raw Memory $76.3\%$,w/o reconstruction 仅 $82.4\%$ 证明回放在 OOD 下尤其有害。**机制深挖(表 4)**:移除来源状态 $o^{src}$ 后 ALFWorld 从 $85.2\%$ 掉到 $80.0\%$;换随机来源状态,拒绝率从 $8.7\%$ 飙到 $13.3\%$(WebShop $56.0\%\to63.3\%$),证明策略确实在比对历史与当前状态;1000 条反事实探针显示最小事实编辑会让接受→拒绝。**训练动态(图 3/4)**:ALFWorld 收敛到稀疏策略(每轨迹 2–3 次检索),WebShop 维持高频检索并持续过滤;含接受重构的轨迹成功率始终高于含拒绝的。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld 具身家务(6 子任务平均成功率) | Avg. Success Rate (%) | MemHarness 85.2%(Pick 87.0 / Look 78.6 / Clean 97.0 / Heat 87.5 / Cool 71.4 / Pick2 90.0) | 纯 GRPO 76.4%;Gemini-2.5-Pro 62.1%;Mem0+GRPO 52.0%;SimpleMem+GRPO 54.5%;EvolveR 70.1% | 相对纯 GRPO +8.8 个百分点;相对 Gemini-2.5-Pro +23.1 个百分点;相对最强记忆增强 RL 基线 EvolveR +15.1 个百分点 |
| WebShop 在线购物 | Success Rate (%) / Task Score | MemHarness SR 75.6%、Score 87.4 | 纯 GRPO SR 66.1%;Gemini-2.5-Pro SR 35.9%;EvolveR SR 72.6%/Score 84.1;Mem0+GRPO SR 37.5% | SR 相对纯 GRPO +9.5 个百分点、相对 Gemini-2.5-Pro +39.7 个百分点;Score 相对 EvolveR +3.3 |
| ALFWorld 分布外(OOD,未见布局) | Avg. Success Rate (%) | MemHarness 85.9% | RL + Raw Memory 76.3%;w/o reconstruction 82.4%;w/o memory 83.0% | 相对最强对照 RL+Raw Memory +9.6 个百分点,证明重构在 OOD 下消除回放噪声 |
| 消融:推理时去掉记忆(验证内在推理提升) | ALFWorld Avg. SR (%) | w/o memory 83.0% | 纯 RL Only (GRPO) 76.4% | 即便完全不使用记忆,仍比纯 RL 高 6.6 个百分点——重构训练目标作为隐式指导反向增强了策略 |
局限与改进
作者承认的局限集中在规模与场景:策略骨架固定为 Qwen2.5-7B-Instruct,未验证更大模型(「重构目标作为隐式指导提升内在推理」是否随规模增强未知);仅评测 ALFWorld、WebShop 两个交互基准,对开放世界、长视野、连续动作空间等更复杂环境的泛化性未涉及;输出严格限制英文,多语种能力未考察;记忆库依赖策略自己蒸馏,冷启动数据由 GPT-5.1 离线生成(虽不参与训练评估,仍是昂贵外部依赖)。我额外观察到三点:(1) 奖励设计高度依赖 $R_{format}$ 的结构化约束(必须严格 think/action/retrieve_memory 标签、1–5 次检索),这套「agentic 协议」换到协议更自由的环境时格式奖励可能失效;(2) 评测只用成功率/任务分等终态指标,缺少对重构文本本身质量、一致性、可解释性的定量度量(反事实探针仅 1000 条且离线);(3) 检索固定 top-3 + BGE-M3,未与更强检索器/重排序消融,记忆子系统对最终增益的边际贡献未单独量化。
独立分析的弱点
弱点一:记忆子系统固定假设限制了上限。检索固定 top-$k=3$、嵌入固定 BGE-M3、去重阈值硬编码($0.85$),都没有随任务自适应。改进方向是让 $k$、检索器、相似度阈值都成为策略可学习的动作或用上下文 bandit 在线调,甚至用交叉编码器重排序提升召回质量,从源头减少「检索到不可用记忆」。弱点二:奖励高度依赖结构化格式约束。$R_{format}$ 强制 think/action/retrieve_memory 标签与 1–5 次检索,换到协议自由的环境(开放对话、连续控制)会失效;改进方向是设计协议无关的过程奖励,或引入检索质量/重构信息量的密集奖励(如重构与最终动作的互信息)替代纯格式奖励。弱点三:缺重构文本定量评估。现有评测只看终态成功率,反事实探针仅 1000 条且离线;可建立在线的重构质量指标(覆盖度、保真度、必要性)并纳入奖励或监控。弱点四:对 GPT-5.1 冷启动与蒸馏的依赖限制了完全自主训练;可用自蒸馏/自冷启动或规则模板替代,做「无外部强 LLM」的纯净复现。弱点五:规模与场景单一,仅 7B、仅两基准;可把骨干扩到 32B/70B 并迁移到多模态具身、浏览器/操作系统 agent、代码 agent 验证「重构范式」普适性。
未来方向
作者明确指向两条:scaling 到更大模型,以及拓展到开放世界环境。基于成果可延伸方向我补充四点:(1) 重构作为通用推理范式——既然「w/o memory」仍提升内在推理,可把重构目标从「记忆适配」推广为通用的「先批判再行动」隐式思维链训练范式,应用到不依赖记忆的推理/数学/代码任务,看是否同样能当隐式指导提升基线。(2) 多记忆协同与层次化重构——当前只重构单条 top-3,可设计多记忆投票、矛盾消解、跨 episode 的层次化原则聚合(类似经验的「归纳-演绎」双轮),让记忆库随训练演化出层级。(3) 重构的可解释性工具——把重构过程显式可视化(接受/改写/拒绝的归因图谱),给「策略为什么这么做」提供可审计界面,呼应论文强调的「可追溯性」。(4) 与参数记忆的深度融合——结合持续学习/知识编辑,研究显式重构记忆如何被周期性蒸馏回参数(经验固化),形成「参数↔显式」双向流动,进一步逼近人类记忆的巩固机制。
复现评估
复现门槛中等偏高、可复现性较好。**有利的**:论文给出 GitHub 仓库 https://github.com/KnowledgeXLab/MemHarness;附录 A 详列超参(GRPO 组大小 $G=8$、采样温度 1.0、lr $1\times10^{-6}$、clip $\epsilon=0.2$、KL $\beta=0.01$、批大小 256/64、历史窗 $w=3$、vLLM 利用率 0.75);附录 C 完整给出所有 prompt 模板(环境反馈、重构、摘要、fallback、反事实探针);记忆子系统(BGE-M3 + Milvus + top-3 + Laplace 效用剪枝)描述充分;ALFWorld/WebShop 均为公开基准,所有可训练基线用同一骨干 Qwen2.5-7B-Instruct 保证公平。**不利的**:(1) 冷启动 SFT 数据(400 例/基准)和反事实探针(1000 例/基准)依赖 GPT-5.1 离线生成,未公开种子与生成脚本,换 LLM 难完全对齐;(2) 训练需 veRL 框架 + 128 并行环境 + vLLM,单组 $G=8$×16 共 128 条 rollout,算力门槛显著(论文未报 GPU 数量与时长);(3) 记忆库随训练在线增长,结果对随机种子、去重阈值($0.85$)较敏感。综合看,熟悉 veRL/verl-agent 的团队能在数周内复现主表趋势,但要逐位对齐数字需相当工程投入。
论文图表
三栏对比记忆利用范式:上栏「Prior methods」把检索直接连到动作生成(replay,易状态失配);中栏「Human memory」展示人类在检索与行动之间引入评估-改编的中间过程;下栏「MemHarness」受此启发把检索到的记忆重构为状态对齐的指导。用简笔示意展示了「retrieve→critique→reconstruct→action」的流程差异。
这是论文核心论点的最佳一图——直观呈现「为什么逐字回放有害、人类/本文为何要重构」,是理解全部动机与方法的入口。
案例:任务要求多项属性约束的女鞋。检索到的记忆是抽象启发式「仔细核对标题与属性再点 ID」。MemHarness 重构阶段执行该启发式——扫描当前噪声观测、对齐用户约束,直接输出确切目标 ID(B06W51MMKY: Alegria Women's Kourtney 符合全部约束),把抽象规则变成可操作的具体目标。
展示重构在 WebShop 这种长文本、高噪声环境如何把抽象原则落成具体行动目标,与图 12 共同覆盖两基准的重构行为模式。