← 返回 2026-08-04

Zero-Mem:面向LLM智能体的零token记忆操作 Zero-Mem: Zero-Token Memory Operations for LLM Agents

Yilin Xiao, Zhehan Zhu, Yujing Zhang, Jin Chen, Zijin Hong, Luyao Zhuang, Qinggang Zhang, Shengyuan Chen, Xiaocao Ouyang, Lingfei Ren, Xiao Huang 📅 2026-07-31 👍 11 2026-08-09 18:30
LLM智能体记忆 实体-上下文图 时序层次检索 证据校准 零token记忆操作

保留原始交互痕迹,用实体-上下文图与时序层次做零LLM调用的记忆检索

前置知识

LLM智能体记忆函数

智能体在多轮、跨会话交互中累积历史 H=(s1,...,sT),每条痕迹 si 可含用户消息、助手回复或动作、工具观测、时间戳、说话人与会话元数据。给定查询 q,记忆系统从历史中检索相关信息构成证据集 R(q)=Memory(q,H),再由读取器 LLM 生成答案 a=Reader(q,R(q))。难点是既要忠实保留信息,又要按正确的实体/会话/时序状态召回证据。

Zero-Mem 整个框架就是对该记忆函数的非生成式实例化,理解这一输入输出契约才能看懂后续四个组件。

生成式记忆与原始检索两种范式

生成式记忆用额外 LLM 调用对经验做摘要、反思或生成结构化笔记(如 Mem0 的增删改查工具调用、A-Mem 的 Zettelkasten 笔记、Zep 的时序知识图谱),再以这些产物中介后续检索;原始检索则直接在未经改写的完整历史上做词法或稠密相似度搜索。前者省存储但牺牲溯源,后者保真但难处理分布式证据与跨会话歧义。

本文的动机正是质疑生成式中介是否必要,必须先理解这两种范式及其各自代价,才能体会零 token 运作机制的突破点。

实体-上下文图与共现边

一种二部式结构 G=(Vd∪Ve,Ede∪Edd),Vd 为上下文单元节点,Ve 为实体节点。当在上下文单元 di 中检测到实体 e 时添加实体-上下文边,权重为出现频率归一化 w(di,e)=c(e,di)/∑_{e′∈E(di)}c(e′,di);相邻上下文单元之间再加邻接边以保留局部连续性。该图由非生成式 NER(如 spaCy)构建,只记录观测到的共现,不推断语义三元组。

这是 Zero-Mem 关系视图与图传播检索的基础,理解边权与共现语义,才能看懂证据如何在图上扩散与对齐。

Personalized PageRank

个性化 PageRank 是图节点排序算法,通过一个偏好/重置向量 rq 把随机游走偏向查询相关节点,迭代式 πq=(1−γ)rq+γP⊤πq 求解稳态分布,γ∈(0,1) 为阻尼因子,P 为行归一化转移矩阵。它能在图上把证据分数从与查询对齐的种子实体扩散到相关的上下文节点。

图视图用个性化 PageRank 在实体-上下文图上分配证据分数,是 Zero-Mem 关系检索的核心打分机制。

BM25词法检索与稠密嵌入(BGE-M3)

BM25 是基于词频与逆文档频率的词法统计匹配,擅长精确实体名、日期、数字、标题与引号短语;稠密嵌入(本文用 BGE-M3)提供语义相似度,在表面重叠弱时充当语义锚点。在 Zero-Mem 中两者仅用于索引、播种和打分,绝不生成或改写记忆内容。

这两种访问信号是 Zero-Mem 建索引、对齐实体、精排结果的基础,理解其互补性才能看懂双视图融合。

研究动机

现有 LLM 智能体记忆系统大多依赖额外的 LLM 调用来操作记忆:Mem0 用 LLM 工具调用做增删改查,A-Mem 按 Zettelkasten 方法生成带关键词与标签的结构化笔记,Zep 构建时序知识图谱,还有系统做反思、分层抽象与图谱索引、生成并演化相互链接的记忆记录。这把记忆管理变成了反复发生的生成式工作负载。论文 Table 2 给出具体代价:SimpleMem 处理一次评测消耗约 1410 万 token(每查询约 9153 token)、总耗时约 8365 秒(每查询 5.43 秒);GAM 消耗约 2857 万 token(每查询约 18552 token)、总耗时约 9237 秒(每查询 6.0 秒);即便最省 token 的 LightMem 也消耗约 87.7 万 token。更严重的是,当生成式抽象中介后续检索时,被省略的细节、被合并的主语或被模糊的时序更新,会削弱对原始交互的溯源能力,使证据变得不再忠实。

本文的目标是定义并实例化一种新的运作机制——零 token 记忆操作(zero-token memory operations):在最终问答之外的每一个环节,包括记忆构建、组织、路由、检索、证据闭合、读前证据校准与读后答案校准,都不调用 LLM、不消耗任何 LLM 输入或输出 token;编码器(NER、嵌入、BM25)计算与最终读取推理单独计费。目标是同时保留超越扁平相似度的结构化访问(关系 + 时序),并维持有竞争力的答案质量、降低延迟。整个流水线中读取器 LLM 是唯一的 LLM 依赖阶段,其他记忆操作全部 token-free。

与已有工作不同的是,以往的提效工作只是减少而非消除生成式开销:SimpleMem 用语义结构化压缩、在线语义合成与意图感知检索规划降 token,LightMem 把部分操作下放到小模型并解耦在线检索与离线整合,但二者都仍在记忆生命周期内保留生成式处理,没有任何一个把最终问答设为唯一的 LLM 阶段。相反的原始检索策略虽能保真,但扁平词法/稠密检索会把不同用户、会话或时序状态下语义相似的痕迹搞混,且在证据分散于多次交互时失效。Zero-Mem 的独特切入角度是:把记忆操作重新表述为对带溯源信息的交互痕迹做结构化证据选择,既不生成中间表示,又通过非生成式的关系图与时序层次获得结构化能力,从而兼得原始痕迹的忠实性与结构化检索的表达力。

核心方法

直觉是:与其用生成式摘要替换历史,不如把原始痕迹当作权威来源,并在其上派生两个互补的非生成式视图。实体-上下文图捕获观测到的共现与痕迹邻接,提供关系访问;时序层次(turn/window/episode/local)保留会话局部性与会话级状态。查询时先建轻量画像 φ(q)={subject, keywords, answer-type, temporal-cues, boundary} 路由并加权两个视图;再用查询逐视图分数归一化融合排名,证据闭合补充关系桥接与局部邻居,最后确定性校准过滤/排序证据并检查读后答案。框架由四个组件构成:溯源保留的无 token 记忆基底、查询条件证据路由、双视图证据检索与闭合、确定性证据校准。只有最终读取器是一次 LLM 调用,其余记忆操作全部不消耗 token。

核心创新是把记忆重新表述为对带溯源信息的痕迹做无 token 的结构化证据选择。与生成式系统的本质区别在于:Zero-Mem 的图只记录观测到的共现与痕迹邻接,绝不生成语义三元组或推断关系——NER 用 spaCy 这类非生成式模型,图上的关系都是被观测到而非被发明的。关系视图用个性化 PageRank πq=(1−γ)rq+γP⊤πq 在共现图上扩散证据;时序视图用从粗到细的搜索 Uepisode→Uwindow→Uturn→Ulocal。一个全局共享的主视图权重 ρ 按查询类型协调两视图(主视图 ρ、次视图 1−ρ),而非把二者当独立来源;闭合 C(q)=Dedup(M(q)∪Ng(M(q))∪Nh(M(q))) 给主候选补上关系桥接与局部邻居。

方法步骤详情

基底阶段保留每个上下文单元的原文与溯源元数据(来源 id、会话时间、边界 id),用非生成式 NER 建实体-上下文图,边权 w(di,e)=c(e,di)/∑c(e′,di),邻接边连相邻单元;并按四粒度建时序层次,BM25+BGE-M3 索引全部单元。查询阶段先从查询与元数据(不用 gold 答案)建画像 φ(q),据此判定 Route(q)∈{relational,local} 并赋 ρ/(1−ρ)。图视图用余弦 η0(e∣q)=cos(e,ê) 对齐实体,经传播与个性化 PageRank πq=(1−γ)rq+γP⊤πq 扩散分数,并用词法匹配精排;层次视图从粗到细检索并用兼容性信号精排。随后逐视图归一化 Ŝv(d),融合 Sfuse=ρŜprimary+(1−ρ)Ŝsecondary,再补 Ng 桥接与 Nh 邻居并去重。最后确定性校准 R(q)=Rank(Filter(C(q),φ(q))) 过滤排序证据,读取器产 a0,由 a=Calibrate(a0,q,A(q),R(q),φ(q)) 校验。仅最终读取器是 LLM。

技术新颖性

技术新颖性有四点。其一,首次形式化零 token 记忆操作这一运作机制,把记忆操作成本与读取器推理成本隔离开来。其二,溯源保留设计——每个派生单元都携带来源 id,使被召回的证据可追溯到被观测的交互,而非模型生成的陈述。其三,非生成式双视图协调:图记录观测到的共现(不推断三元组)+ 多粒度时序层次,由查询相关的 ρ 融合。其四,用确定性证据校准与答案校准替代基于 LLM 的验证。这与 Zep(LLM 构建的时序 KG)、Mem0/Mem0g(LLM 工具调用更新)、A-Mem(LLM 笔记)、HippoRAG 都不同。消融印证两视图互补:图单视图 62.50、层次单视图 54.88、完整模型 72.07 F1。

Overview of Zero-Mem
Figure 2: Overview of Zero-Mem

实验结果

LoCoMo(Table 1)两读取器下 Zero-Mem 均最佳:GPT-4o-mini 平均 F1/BLEU-1 为 59.15/52.96,比最强基线 GAM(53.75/47.51) 提升 +5.40/+5.45,单跳、时序、开放域均第一,多跳与 GAM 接近;Qwen2.5-14B 为 57.57/51.41,全项第一。HotpotQA(Table 3)在 56K/224K/448K 上下文下 F1 均最高,GPT-4o-mini 为 72.07/66.43/65.04,平均高 5.52 分,448K 仍领先。效率(Table 2)token 消耗为 0(基线 SimpleMem 1410 万、GAM 2857 万、LightMem 87.7 万),总耗时 334.77s、每查询 0.22s,比 LightMem 降 57.6%。消融(Fig 3)完整模型 72.07/69.66,仅图 62.50、仅层次 54.88、去闭合 67.90、去校准 70.13 F1,印证互补。检索预算 top-1→top-5 时 F1 由 52.59 升到 59.15,top-10 最佳。

Performance comparison on LoCoMo
Table 1: Performance comparison on LoCoMo
Efficiency comparison under a unified experimental configuration
Table 2: Efficiency comparison under a unified experimental configuration
Performance comparison (F1 score) on HotpotQA
Table 3: Performance comparison (F1 score) on HotpotQA
Ablation study on HotpotQA
Figure 3: Ablation study on HotpotQA
Effect of the retrieval budget on LoCoMo
Figure 4: Effect of the retrieval budget on LoCoMo
查看结构化数据
任务指标本文基线提升
LoCoMo 长期对话记忆(四类问题平均) F1(GPT-4o-mini 读取器) 59.15 GAM 53.75 +5.40(相对 +10.0%)
HotpotQA 长上下文多跳问答(448K token) F1(GPT-4o-mini 读取器) 65.04 GAM 59.81 +5.23
记忆操作的 LLM token 消耗 token/查询 0 LightMem 569.54 100% 降低
记忆操作延迟 秒/查询 0.22 LightMem 0.51 57.6% 降低

局限与改进

作者承认的局限:评测聚焦在 QA 类基准(LoCoMo、HotpotQA);「零 token」并不等于零计算——编码器(spaCy NER、BGE-M3 嵌入、BM25)与最终读取器仍消耗 GPU/CPU,这部分被单独计费。我自己观察到的几点:其一,主实验固定 top-5 以对齐基线,但 Fig 4 显示 top-10 还能再得 +0.65 F1 / +0.83 BLEU-1,说明性能仍有未兑现的上限。其二,非生成式 NER(spaCy)可能漏掉 NER 词表外的领域专有实体,限制图覆盖率。其三,γ 与 ρ 在所有实验中都固定为 0.6,跨数据集的敏感性未充分探讨。其四,实体对齐用稠密余弦(式 8),当实体嵌入相近时可能错配。其五,仅在对话/QA 上评测,未触及智能体决策、工具使用或流式在线记忆更新等场景。

独立分析的弱点

弱点一:静态记忆——Zero-Mem 从完整历史 H 一次性构建基底,对痕迹持续增长的流式/在线插入支持弱;改进方向是设计增量式的图与层次更新。弱点二:NER 质量瓶颈——spaCy 限制实体覆盖;可引入轻量的领域自适应或基于嵌入的实体链接。弱点三:超参固定——全局 γ=ρ=0.6;可改为按 φ(q) 自适应或学习路由权重。弱点四:评测范围窄——仅 QA,记忆驱动动作的真实智能体任务(规划、工具使用)未覆盖;可扩展到智能体基准。弱点五:图只记观测共现、不能推断隐含关系;可在保留溯源前提下引入可选的轻量符号推理做桥接。

未来方向

作者隐含方向:把结构化证据选择推广到更依赖记忆的智能体场景;代码与实现细节在同行评审后开源(github.com/TheMoon0815/Zero-mem)。基于成果可延伸:其一,面向流式智能体的在线/增量记忆构建;其二,扩展到多模态痕迹(图像、工具输出);其三,把非生成式基底与偶发的离线生成式整合结合,在保留溯源的同时实现长期遗忘/压缩;其四,用学习到的双视图路由替代确定性信号;其五,把零 token 原则迁移到规划/工作流等其他智能体记忆;其六,跨用户共享记忆并配合隐私保护的溯源机制。

复现评估

代码承诺在同行评审后于 github.com/TheMoon0815/Zero-mem 开源。构建模块均为开源/现成:spaCy NER、BGE-M3 嵌入、BM25、PageRank;骨干 LLM 为 GPT-4o-mini(API)与 Qwen2.5-14B(开源)。基准 LoCoMo、HotpotQA 均公开。硬件为 NVIDIA RTX 4090;超参已给出(γ=ρ=0.6,top-5)。复现难度中等:方法流水线组件较多(路由、融合、闭合、校准),部分细节散布在图与公式中;答案校准里的列表裁剪/归一化等仅高层描述;编码器计算虽被单独计费但确切的批处理/成本未详述。鉴于代码将开源、依赖都是标准件,整体可复现性较好。