善用记忆:记忆智能体中记忆基底的全面评估 Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents
受控评估11种记忆基底:无单一基底全胜,需按任务体制动态路由
前置知识
记忆基底(memory substrate)
记忆基底指智能体记忆被表示和存储的底层介质。同样是“记住用户从东京搬到了旧金山”,可以存成向量数据库里的稠密嵌入、BM25 倒排索引、压缩后的 gist 文本摘要、带链接的演化笔记、实体-关系图、多层摘要树、蒸馏出的策略或技能包,甚至直接写进模型权重(LoRA)或 KV 缓存激活。不同基底在写入成本、检索质量、可检查性、随历史增长时的退化方式上差异巨大。
本文的核心问题就是“在什么运行体制下该用哪种记忆基底”,不理解基底的概念就无法理解 11 种方法(M1–M11)的分类、表格的行标签以及对比结论。
外部记忆与内部记忆
外部记忆指存储在模型之外的数据结构(向量、文本记录、图、树、蒸馏抽象),通过显式的 Write/Read/Manage 操作访问;内部记忆指编码进模型权重(参数化更新如 LoRA 微调)或 KV 缓存激活(如全上下文预填充、情景聚类重预填充)的信息,在生成时被隐式访问、没有独立检索步骤。两类记忆的成本结构完全不同:外部记忆读写都有显式开销,内部记忆省去检索但牺牲可检查性与可扩展性。
论文采用这一分类法组织设计空间:M1–M8 属外部记忆,M9–M11 属内部记忆,Table 1 和 Table 2 都按 External/Internal 分组呈现结果。
top-k 检索与检索广度
top-k 检索指每次查询从记忆库按相似度取出得分最高的 $k$ 条记录拼进上下文。$k$ 是召回与干扰之间的旋钮:$k$ 越大命中金标证据的概率越高,但引入的无关 token 也越多。本文在 LoCoMo 上扫描 $k \in \{1,2,5,10,20\}$,在 ALFWorld 上扫描 $k \in \{1,2,3,4,5\}$,并设置空检索块的无记忆对照,发现 $k$ 的效应方向随任务体制反转。
检索深度是论文最核心的自变量之一,“多检索帮助 QA 但伤害智能体决策”以及配套的注意力探针实验都建立在理解 $k$ 的含义之上。
Pareto 前沿
在同时考虑性能与延迟(或成本)的多目标比较中,若不存在另一个方法在两个维度上都不差且至少一维严格更好,则该方法为 Pareto 最优;所有 Pareto 最优点构成 Pareto 前沿,前沿之外的方法被称为“被 Pareto 支配”,即付出相同甚至更高代价却效果更差。这是判断“值得不值得用”的标准工具。
论文用性能–延迟平面刻画 11 个基底(Figure 3),发现 QA 体制与智能体体制的 Pareto 前沿由不相交的基底占据,这是“必须做基底路由”的直接证据。
LLM-as-a-judge 与 P4 指标
对开放长文本问答,精确匹配和 token F1 无法衡量回答质量,通常让一个固定模型(本文统一用 GPT-4o-mini)按共享评审模板给生成答案打分。论文 26 项指标中 P4 即该 LLM 评审分(↑越高越好),近似人工评分但评审模型自身的偏差会传导进结果。
Table 1 中所有用户中心基准(LoCoMo、LME-S、MAB 三能力)的主指标都是 P4,表格的绿红标注、加粗胜负判定都依赖对这一指标的理解。
研究动机
记忆正在成为长程 LLM 智能体的核心基础设施,但现有评估几乎无法回答“在什么运行体制下该用哪种记忆基底”。作者对 2023–2026 年 52 个记忆增强系统做了全景调查(Figure 1),发现三大缺陷:其一,基准高度集中,62% 的“基准×系统”对只来自 LoCoMo 和 LongMemEval 两个对话型数据集,智能体型任务几乎无人检验;其二,指标与骨干覆盖窄,所有系统都报告准确率,但只有 21% 报告任何效率维度,管理成本和压缩比完全无人报告,且 81% 的系统只用 GPT 系模型做唯一骨干,无法把基底效应与模型特性解耦;其三,评估浅表,一半系统只在单一基准上测试且零效率指标,没有任何系统同时做到广覆盖与完整效率报告。结果是我们只知道谁登顶了某个榜单,却不知道在什么工况下换个基底会更好——而这恰恰是通用记忆系统做路由决策所必需的经验信号。
本文的目标是本文的目标是构建首个以记忆基底为唯一受控变量的“线束式评估”:在完全相同的交互历史、脚手架、提示模板和辅助 LLM 设定下,横向比较 11 种记忆方法(覆盖外部与内部两大类、7 个基底家族),在 3 个骨干模型(Qwen3-8B、Qwen3-32B-AWQ、Gemma-4-26B-A4B-IT)和 4 个基准(用户中心的 LoCoMo、MemoryAgentBench,智能体中心的 ALFWorld、BigCodeBench-Hard)上,用 26 项性能与效率指标量化每个基底的收益与代价。论文明确要回答两个问题:智能体的行为(任务性能与效率)中有多少可归因于基底本身;以及这种归因是否随运行体制——任务类型、检索深度 $k$、历史长度——保持稳定。
与已有工作不同的是,已有工作要么各自提出一种记忆系统并在固定配置下自证优劣,要么只做定性综述。本文的独特切入在于把“记忆基底”当作可控实验变量加以隔离:采用外部记忆(模型外的向量、文本、图、树)与内部记忆(权重、KV 缓存激活)的分类法,统一实现 11 种方法并暴露相同接口;评估范围从流行的对话问答扩展到具身规划与代码生成等智能体体制;并首次把 26 项部署关键成本指标(写入延迟、检索延迟、管理调用、总 token、总墙钟时间等)作为一等公民纳入。此外,检索深度 $k$ 扫描加注意力探针的诊断设计,把“为什么多检索反而有害”压到了注意力分配层面,这在以往的基准报告里是没有的。
核心方法
整体思路很直观:既然要回答“该用哪种记忆”,就把其余一切固定,只让记忆方式变化。作者按外部/内部分类实现 11 个基底:M1 稠密向量与 M2 稀疏 BM25(Flat 家族,无 LLM 调用,构成检索下限);M3 Gist 摘要索引;M4 演化笔记与 M5 双层实体-关系图(Structural);M6 递归聚类摘要的层级树(Hierarchical);M7 蒸馏策略与 M8 技能包(Refinement,把经验压缩为抽象);M9 LoRA 适配器微调(Weight);M10 全上下文与 M11 情景聚类重预填充(Activation)。全部基底通过 vLLM 部署在 4×H200 上接入相同骨干,辅助 LLM 统一固定为 GPT-4o-mini,评审用同一模板。四基准覆盖两种体制:用户中心(LoCoMo 10 段对话 1986 题、MAB 的 LME-S/LRU/TTL/CR 四能力)考验召回;智能体中心(ALFWorld 134 个 unseen 任务、BigCodeBench-Hard 148 题)考验精确动作序列。每次运行记录 26 项性能与效率指标。
核心创新是把“选记忆”从设计期的一次性承诺变成运行期可路由的决策,并用受控实验提供路由信号。与已有工作的本质区别有三点。第一,单一变量原则:骨干、提示、辅助 LLM、检索接口全部固定,性能差异可干净归因到基底本身,而不是系统各自的工程调优。第二,体制(regime)感知:同一基底在对话 QA 与智能体决策两种体制下表现可以完全反转——图结构在 QA 领先、在 ALFWorld 被 Pareto 支配,论文据此主张通用记忆必须按体制路由。第三,机制级诊断:用注意力探针把检索深度的影响追溯到 token 注意力分配的迁移,而非停留在端到端分数。由此提炼出一条设计规则:用读的广度换写的深度——每个查询少检索几条,把预算投向写入时的蒸馏与结构化。
方法步骤详情
实验分四步。第一步,搭建统一线束:所有方法暴露 Write/Read/Manage 接口,对相同交互历史执行写入与检索;骨干为 Qwen3-8B、Qwen3-32B-AWQ、Gemma-4-26B-A4B-IT(vLLM,4×H200),辅助与评审模型固定为 GPT-4o-mini。第二步,主实验:每个基底在四基准上运行,记录 26 项指标(EM、token F1、评审分 P4、TSR、Pass@1 及存储、延迟等效率项)。三处刻意排除:M7 只适用含轨迹的智能体任务,M9 与 Gemma 的 A4B MoE 路由不兼容,M10 因累积上下文超窗不进智能体基准。第三步,检索深度消融:LoCoMo 上扫 $k \in \{1,2,5,10,20\}$,ALFWorld 上扫 $k \in \{1,2,3,4,5\}$,并设空检索块对照。第四步,压力测试:在 MAB 冲突解决上把对话长度从 6K 拉到 32K、262K token,固定题池、金标与评审;另对 Qwen3-8B 最后一层上层注意力做 System/Retrieved/Context/Cue 四区域分桶探针。
技术新颖性
技术新颖性体现在三方面。其一,这是首个对智能体记忆做“约束式”横向评估的工作:此前 Zep、Mem0、MemGPT 等系统各自报告自家基准上的最优成绩,从未有人在同一脚手架下隔离基底变量;论文还把这三个生产系统移入附录的辅助成本分析,以保持主实验的可比性。其二,指标体系首次把部署成本做成一等公民:26 项指标中约一半是效率类(写入延迟、检索延迟、管理调用、总墙钟时间等),而此前 52 个系统中只有 21% 报告过任何效率维度,管理成本与压缩比无人报告。其三,诊断方法的组合创新:检索深度扫描与注意力探针配对,直接证明“注意力稀释”在两种体制下机制相同但后果相反——答案所在区域不同决定了多检索是增益还是毒药,这为“检索广度是体制条件超参数”提供了机制层面的证据,而非仅是相关性观察。
实验结果
核心发现有四点。第一,没有基底全面获胜:双层图 M5 在 LoCoMo 三骨干上 P4 为 0.648/0.683/0.719、LME-S 上也最优;但 M5 在 ALFWorld 上 TSR 仅 23.1%,被蒸馏策略 M7 的 32.1%(NoMem 22.4%)压制;M11 在 Qwen3-8B 上把 TSR 从 5.7% 翻倍至 11.9%;M9(LoRA)最弱(0.379)。第二,检索广度效应随体制反转:LoCoMo 上 P4 随 $k$ 单调上升,ALFWorld 上 TSR 随 $k$ 下降;探针显示检索块注意力质量在 LoCoMo 从 0.05 升至 0.66、任务上下文从 0.34 跌至 0.10。第三,成本重尾且常无回报:LME-S 上 M4 花 234 秒/查询反不如 M2 的 7.3 秒;BCB 上 M2(19.6%)以 1/6 延迟反超 M5(16.2%)。第四,可扩展性是第三条路由轴:CR 从 6K 到 262K,M8 从 0.32 升至 0.51(延迟 1s→10s),M5 至 0.48 但图重建延迟陡增,M9 停滞于 0.18–0.22。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LoCoMo 多会话对话问答(用户中心) | LLM 评审分 P4(GPT-4o-mini judge) | 最优基底 M5 双层图:Qwen3-8B 0.648 / Qwen3-32B 0.683 / Gemma-4 0.719 | 结构家族 M4 仅 0.435–0.476;内部记忆 M9 LoRA 仅 0.379–0.399 | 相对最差外部基底 M4 提升约 0.15–0.24 P4,且 M2 稀疏检索以 0.33–2.37 秒的延迟提供性价比参考 |
| ALFWorld-unseen 具身规划(智能体中心) | 任务成功率 TSR | M7 蒸馏策略 32.1%(Qwen3-32B,$k{=}1$);M11 情景重预填充 11.9%(Qwen3-8B) | 无记忆基线 NoMem:22.4%(Qwen3-32B)/ 5.7%(Qwen3-8B) | M7 相对 NoMem +9.7%;M11 相对 NoMem 翻倍;图结构 M5 仅 23.1%,被精炼家族反超 |
| BigCodeBench-Hard 代码生成(智能体中心) | Pass@1 | M5 双层图 15.5%(Qwen3-8B)/ 20.9%(Gemma-4);M2 稀疏检索 19.6%(Qwen3-32B) | NoMem:8.1% / 14.2% / 17.6% | Gemma-4 上 M5 较 NoMem +6.7%;但 Qwen3-32B 上 M2 以约 1/6 延迟反超 M5(19.6% vs 16.2%) |
| MAB 冲突解决(CR)长上下文可扩展性 | P4 与每查询延迟(6K→32K→262K token) | M8 技能包 0.32→0.51(延迟约 1s→10s);M5 0.28→0.48;M10 0.27→0.47 | M9 LoRA 停滞在 0.18–0.22;M4/M5 在 262K 时图重建延迟陡增 | 精炼家族在质量与延迟增长率上同时占优,读代价与输入长度无关 |
| MAB LRU/TTL/LME-S 能力矩阵 | P4 与每查询延迟 E15(秒) | LRU 上 M10 领先 Qwen3-8B(0.676);TTL 上 M3/M8 占优(0.640–0.850);CR 上 M5 在 2/3 个模型领先 | M4 演化笔记在 LME-S 延迟高达 225–234 秒/查询,质量反低于 M2(7.3 秒) | 证明逐能力最优基底不同,排除单一基底通用记忆 |
局限与改进
作者承认的局限包括:代码“录用后公开”,当前无法直接复核;Zep、Mem0、MemGPT 三个生产系统因辅助 LLM 预算差异被移出主对比,通用结论对它们是否成立有待验证;M7/M9/M10 的条件性排除使对比矩阵部分缺失;评审模型固定为 GPT-4o-mini,P4 可能与真实质量有偏差。我自己的观察还有四点:其一,各基底是作者对 A-Mem、LightRAG、RAPTOR 等的复现实现,超参调优程度未必达到原系统最佳状态,“某家族被支配”的结论可能偏强;其二,主表未报告方差与显著性,Qwen3-8B 与 32B 在 ALFWorld 上方向不一致(M1 5.2 低于 NoMem 5.7 而 32B 上 M1 27.6 高于 22.4),说明存在不小的模型×基底交互噪声;其三,注意力探针只在 Qwen3-8B 上做,且属相关性证据;其四,M9 的微调成本没有进入 26 项指标的成本核算,对内部记忆不公平。
独立分析的弱点
独立分析几点弱点。第一,单次运行、无置信区间:ALFWorld 只有 134 个任务,TSR 上 3–5 个百分点的差异可能落在噪声范围内,建议每格跑 3–5 个随机种子并报告 bootstrap 置信区间,尤其“M2 21.6% 低于 NoMem 22.4%”这类细粒度结论。第二,LLM-as-judge 的系统性偏差:GPT-4o-mini 可能偏爱更长或更流畅的答案,而 M10 全上下文恰好产生更冗长的回复,其在 LoCoMo 上 0.589 的 P4 或被高估,建议加入人工评注子集或多评审器交叉验证。第三,效率指标未区分一次性成本与稳态成本:M6 层级树的构建开销被吸收进首个查询,主表延迟因此失真,应引入摊销延迟与稳态延迟两列。第四,注意力探针是相关性的,可通过注意力重加权或上下文剪枝等干预实验验证因果。第五,生态效度限于四个文本基准,缺少多模态记忆、工具调用轨迹记忆等新兴场景,且所有检索都基于相似度,未测试符号化精确查询。
未来方向
论文指出的方向是通用记忆必须走多基底组合与路由:由精炼型基底维护抽象策略、结构型与文本型基底存事实、激活型与 Flat 基底保留原始经验,由 harness 按查询把请求路由到与其“承重区域”匹配的基底。在此之上可以延伸:其一,学习型路由器——把体制特征(任务类型、历史长度、当前查询形态)作为输入,训练轻量分类器在线选择基底与检索深度 $k$;其二,自适应检索深度——利用注意力探针信号动态调整 $k$,在注意力开始从任务上下文流失时自动收缩;其三,混合写入管线——同一经验同时写入多种表示,按边际质量收益分配写入预算;其四,把可扩展性轴纳入基准设计,构造 1M token 级长程压力测试;其五,研究路由本身的失败模式与回退策略,例如路由错误时的降级读取与多基底并行投票。
复现评估
复现难度中等偏高。数据全部公开:LoCoMo、MemoryAgentBench(含 LongMemEval-S 子集)、ALFWorld、BigCodeBench-Hard 均为开源基准;三个骨干(Qwen3-8B、Qwen3-32B-AWQ、Gemma-4-26B-A4B-IT)为开放权重,vLLM 部署即可,但需 4×H200 级别算力,262K token 的 CR 压力测试对显存与 KV 缓存要求最高。辅助与评审依赖 GPT-4o-mini API,会产生不可忽视的调用费用,尤其 M4/M5 的图构建与实体抽取需要大量辅助调用。11 个基底的实现、26 项指标定义(附录 D 表 6)与各能力定义(附录 C)论文承诺完整给出,但代码“录用后公开”,目前只能按正文与附录自行复刻;其中 M9 的 LoRA 微调数据构造与 M7 的轨迹评审管线是最容易引入偏差、也最难对齐原文的两个环节,复现者应优先固定这两处的随机性与数据版本。
论文图表
三联图: 基准采用集中度——62% 的“基准×系统”对集中在 LoCoMo 与 LongMemEval 两个对话型数据集,智能体任务几乎无人使用; 指标覆盖——所有系统都报告准确率,但仅 21% 报告任何效率指标,81% 只用 GPT 系骨干; 广度与效率——半数系统只用单一基准且零效率指标,没有任何系统同时做到广覆盖与完整效率报告,52 个系统的散点无一落在“广覆盖+高效率报告”象限。
这是动机部分的核心证据:用大规模调查数据证明现有评估无法提供体制级路由信号,直接引出本文受控线束评估的必要性。