← 返回 2026-08-14

LycheeMemory V2:基于语义分段级整合的 LLM 智能体高效长期记忆框架 LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation

Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li, Bonian Jia, Baotian Hu, Min Zhang 📅 2026-08-13 👍 14 2026-08-19 18:30
LLM智能体 成本效率 检索增强生成 长期记忆

将逐轮记忆整合改为语义分段批量编码,准确率与构建成本双优

前置知识

Eager Consolidation(逐轮即时整合)

现有长期记忆系统(如 Mem0、A-Mem)在每轮或每次短交互结束后立即调用 LLM 做事实抽取、摘要或记忆更新,并可能与历史记忆建立链接。记忆语义虽丰富,但 LLM 调用频率与对话轮数线性相关,token 成本随对话增长快速累积,是本文要替代的范式。

本文的核心动机就是用分段级批处理替代逐轮整合,所有效率对比(如 A-Mem 构建 1459.9K token vs 本文 204.1K)都以它为参照,不懂它就无法理解论文的效率主张。

语义嵌入与余弦相似度

把文本映射为稠密向量后,两向量夹角的余弦值(1 为完全同向,0 为正交)衡量语义相近程度。本文用余弦相似度定义语义惊喜分 $s_t$ 与段内凝聚度 $\mathrm{Coh}(V)$,作为对话分段的边界信号,全程无需 LLM 参与,只用 text-embedding-3-small 等嵌入模型。

论文的分段边界检测完全建立在嵌入相似度的数学判定上,是理解方法第一环节(在线语义分段)以及'构建为何便宜'的关键基础。

LoCoMo 与 LongMemEval-S 基准

两个长期对话记忆评测集:LoCoMo 含 10 段多会话陪伴式对话(平均约 600 轮、16K token),保留 1540 道题,分单跳、多跳、时间推理、开放域四类;LongMemEval-S 含 500 段任务型对话(平均约 115K token)、500 道题,覆盖单会话用户/助手事实、偏好追踪、多会话推理、知识更新、时间推理六类。

论文全部主实验与消融都在这两个基准上完成,判分统一用 GPT-4o-Mini 的 LLM judge;理解各题类构成才能读懂分类别结果和消融中哪类掉分最多。

倒数排序融合(RRF)

多路检索结果的融合方法:候选文档 $d$ 的最终得分为 $\mathrm{RRF}(d)=\sum_{j=1}^{m}\frac{1}{\kappa+\mathrm{rank}_j(d)}$,其中 $\mathrm{rank}_j(d)$ 是它在第 $j$ 路召回中的排名,$\kappa$ 是平滑常数。排名越靠前贡献越大,且对各通道原始分数尺度差异不敏感。

LycheeMemory 查询时把查询规划产生的多条路线、每条路线的四类召回通道候选都用 RRF 合并再重排选择,是检索阶段把'结构化+语义'证据拼在一起的核心机制。

指代消解与时间归一化(写侧)

指代消解是把'他/它/那个地方'等代词和省略式指代还原为具体实体;时间归一化是按会话时间戳把'上周三'等相对时间转为绝对日期。对话文本一旦脱离上下文,这两类信息会退化,因此要么写入时解决,要么查询时用 LLM 补救。

本文选择在分段编码时一次性做写侧消解(借助参考上下文 $\rho_k$),使每条记忆记录自包含,从而免去查询时的多轮补偿——消融显示去掉跨段上下文准确率从 89.22% 掉到 81.56%。

研究动机

现有长期记忆系统普遍采用逐轮即时整合(eager consolidation):Mem0 每轮对话后调用 LLM 抽取并更新事实,A-Mem 在此之上构建 Zettelkasten 式关联笔记并动态演化记忆,这使记忆构建变成高频 LLM 操作,token 成本随对话增长快速累积——论文实测 A-Mem 在 LoCoMo 上构建消耗高达 1459.9K token,Mem0 达 1520.8K。一种省钱的思路是存粗粒度摘要,但长期记忆问答往往依赖细粒度证据:实体、时间表达式、指代关系、上下文小细节,粗摘要会把它们丢掉,例如 MemoryOS 在 LoCoMo 时间推理上只有 47.66%。反过来,靠扩大 top-$k$ 检索或多跳 LLM 推理来补召回,又会把开销转移到查询侧。因此关键挑战不只是'存多少历史',而是以什么粒度整合信息,同时把构建与检索两端的成本都控制住。

本文的目标是本文的目标是设计一个成本高效的 LLM 智能体长期记忆框架,在不增加查询时 token 开销的前提下,大幅降低构建侧成本并提升长期记忆问答准确率。具体来说:以 GPT-4.1-Mini 等为骨干,在 LoCoMo 与 LongMemEval-S 两个基准上与 Full Context、Naive RAG、Mem0、A-Mem、MemoryOS、TiMem 等代表性方法全面比较;把记忆编码的 LLM 调用从每轮一次($T$ 次)降到每段一次($|S|$ 次);同时保持每条记录自包含,使检索阶段无需多轮迭代推理或盲目扩大上下文。最终论文实现了 LoCoMo 89.22%、LongMemEval-S 92.20% 的总体准确率,构建 token 较 A-Mem 分别降低 86.0% 与 75.9%,查询 token 也低于 A-Mem(LoCoMo 上 4.01K 对 5.56K)。

与已有工作不同的是,本文的独特切入角度是把'记忆整合粒度'当作长期记忆系统的效率杠杆,而不是继续优化存什么内容或怎么检索。已有省钱方案要么在逐轮高频写入之后再做压缩(MemRefine 的预算式删合并)、用确定性打分替代 LLM 管理(DMF)、用嵌入准入策略决定是否入库(MemRouter),要么把复杂度移到查询时的迭代检索(EviMem 的缺信息驱动迭代、MemFlow 的操作路由)。同属分段级构建的 SeCom 与 HiMem 分别面向检索前压缩和分层情景记忆,而 LycheeMemory V2 专注在线写侧效率本身:用嵌入边界检测决定批次的语义组成,使多次交互共享一次编码调用,再用有界跨段消解上下文保证记录自包含——三个设计全部服务于'降低写频率但不丢细粒度证据'这一目标。

核心方法

直觉上对话是事件驱动的:连续几轮交换往往属于同一语义事件,对每轮都调用 LLM 整合是浪费。LycheeMemory 分构建与检索两阶段。构建阶段:在线语义分段器把对话流 $C=\{x_1,\dots,x_T\}$(每轮 $x_t$ 含用户消息和助手回复)切成语义连贯的段 $S_k$,每段定稿后调用一次 LLM,将其编码为带类型、实体、主题、时间、出处的记忆记录,并输出跨段消解状态;记录进入 append-only 存储,并从记录元数据派生出实体、主题、时间等结构化索引,这一步零额外 LLM 调用。检索阶段:查询规划器用一次 LLM 调用把问题连同近期上下文分解为多条带约束的召回路线,随后四类确定性召回通道(直接记录、结构化节点、时间、原始轮次)并行取证据,经 RRF 融合、可选重排与多样性选择后生成答案。生成侧对每个问题只花两次 LLM 调用(规划+回答),其余全是嵌入查找与算术运算。

核心创新是'语义分段级批处理整合'。与逐轮即时整合的本质区别在于:LLM 编码调用次数从与轮数 $T$ 线性相关降为与段数 $|S|$ 线性相关(LoCoMo 上平均每段约 5.8 轮),构建 token 因此从 A-Mem 的 1459.9K 降到 204.1K(-86.0%)。但批处理不是机械固定窗口——消融实验显示固定窗口虽然更省(174.7K),总体准确率却从 89.22% 掉到 82.40%,多跳和开放域掉分最多。本文用语义惊喜 $s_t=1-\max(\mathrm{sim}(e_t,c_k),\ \mathrm{sim}(e_t,h_k))$(新交换偏离段质心和局部轨迹的程度)与凝聚度下降 $d_t$ 共同决定段在哪断开,保住事件边界与时间证据的完整性。'批处理降成本、语义边界保精度'这两个效应可以被消融干净地分离,是论文最重要的发现。

方法步骤详情

第一步在线语义分段:把每轮交换嵌入为向量 $e_t$,维护当前段质心 $c_k$ 与最近交换嵌入 $h_k$,计算语义惊喜 $s_t$ 和凝聚度下降 $d_t=\max(0,\ \mathrm{Coh}(S_k)-\mathrm{Coh}(S_k\cup\{x_t\}))$,再结合 token 长度压力 $L_t$ 与轮数压力 $N_t$ 得到边界概率 $p_t=\sigma\big(b+w_s\phi(s_t)+w_c d_t+w_l L_t+w_n N_t\big)$,超过阈值 $\delta=0.50$ 或触及硬 token 上限即定稿当前段,否则把 $x_t$ 追加进去。第二步分段级编码:LLM 收到段文本与参考上下文 $\rho_k$,单次完成原子信息抽取、指代消解、相对时间归一化,输出记录 $r_i=(id_i,\ \tau_i,\ text_i,\ E_i,\ K_i,\ T_i,\ src_i)$——类型 $\tau_i$ 取自事实/偏好/事件/约束/流程/失败模式/工具能力七类模式,附实体集 $E_i$、主题 $K_i$、归一化时间 $T_i$ 与源轮次链接 $src_i$——以及消解状态 $d_k$;下一段的参考上下文为 $\rho_{k+1}=(d_k;\ \mathrm{Recent}(R_{k-m:k}))$,截断到固定预算以防提示随历史无限增长。第三步结构化组织:从记录元数据派生实体、主题、实体-主题、时间、事件帧五类证据节点建索引,纯嵌入与簿记操作。第四步查询规划与多路召回:规划器输出 $\Pi(q,H_q)=(y,\{R_1,\dots,R_m\})$,每条路线含目标、搜索词、结构与时间约束;四通道(记录向量、证据节点扩展、时间过滤、原始轮次)并行召回,按 $\mathrm{RRF}(d)=\sum_j \frac{1}{\kappa+\mathrm{rank}_j(d)}$ 融合,可选跨编码器重排,再做多样性感知选择,最后把选中记录连同类型、时间、出处序列化为答案生成的上下文。

技术新颖性

技术新颖性体现在三点。其一,写侧触发机制新:分段边界决策完全基于嵌入相似度的数学判定($s_t$、$d_t$、压力项加权过 sigmoid),无 LLM 参与,把'何时整合'变成近乎零成本的计算,与 Mem0/A-Mem 的每轮强制整合形成鲜明对照。其二,记录表示新:每条记录是带有限类型模式、实体、主题、归一化时间与源轮次链接的自包含单元,且有界跨段消解上下文 $\rho_k$ 让代词、别名等跨段指代在写入时就解决——消融证明去掉它准确率从 89.22% 掉到 81.56%。其三,检索侧'一次规划+确定性执行':与 EviMem、MemFlow 的迭代式检索不同,只在规划用一次 LLM,其余召回、RRF 融合、重排、选择均为嵌入查找与算术运算,因此查询 token(LoCoMo 4.01K)反而低于 A-Mem(5.56K),证明准确率提升不是靠查询时堆上下文换来的。

Overview of LYCHEEMEMORY
Figure 3: Overview of LYCHEEMEMORY

实验结果

主实验用 GPT-4.1-Mini 与 GPT-4o-Mini 双骨干,判分统一为 GPT-4o-Mini。GPT-4.1-Mini 下:LoCoMo 总体 89.22%,超过 Full Context(84.80%)4.42pp、最强记忆基线 TiMem(83.77%)5.45pp、A-Mem(68.83%)20.39pp,其中多跳 87.23%(A-Mem 59.93%,+27.3pp)、开放域 67.71%(+25.0pp)、时间推理 86.60%(+13.7pp);LongMemEval-S 总体 92.20%,比 Full Context(66.20%)高 26pp,时间推理 87.22% 对 A-Mem 的 52.63%,单会话用户/助手事实达 100.00%/98.21%。GPT-4o-Mini 下为 78.90%/78.80%,仍全面领先但优势收窄(+2.47pp/+1.00pp)。成本上:LoCoMo 构建 token 仅 204.1K,比 A-Mem 低 86.0%、比 Mem0 低 86.6%、比 TiMem(489.5K)低 58.3%;LongMemEval-S 上 304.7K,比 A-Mem 低 75.9%;查询 token LoCoMo 4.01K(A-Mem 5.56K,-27.9%;TiMem 10.71K,-62.6%)、LongMemEval-S 8.88K(A-Mem 15.46K,-42.6%)。消融五组结论清晰:换 eager 构建掉 7.34pp 且构建 token 涨 316%;固定窗口省 token 但掉到 82.40%;摘要级记录掉 8.44pp(时间推理 86.60%→73.83%);仅用记录向量召回掉 7.47pp;去掉融合/重排/多样性选择暴跌 22.6pp 至 66.62%;边界阈值 $\delta$ 在 0.30–0.70 间准确率仅波动 1.04pp(88.18%–89.22%),对超参不敏感。

Main results on LoCoMo with GPT-4.1-Mini and GPT-4o-Mini
Table 1: Main results on LoCoMo with GPT-4.1-Mini and GPT-4o-Mini
Main results on LongMemEval-S with GPT-4.1-Mini and GPT-4o-Mini
Table 2: Main results on LongMemEval-S with GPT-4.1-Mini and GPT-4o-Mini
Construction-side ablation on LoCoMo with GPT-4.1-Mini
Table 3: Construction-side ablation on LoCoMo with GPT-4.1-Mini
Representation-side ablation on LoCoMo with GPT-4.1-Mini
Table 4: Representation-side ablation on LoCoMo with GPT-4.1-Mini
Retrieval-side ablation on LoCoMo with GPT-4.1-Mini
Table 5: Retrieval-side ablation on LoCoMo with GPT-4.1-Mini
LYCHEEMEMORY achieves superior accuracy with substantially lower consolidation cost under GPT-4.1-Mini
Figure 1: LYCHEEMEMORY achieves superior accuracy with substantially lower consolidation cost under GPT-4.1-Mini
Accuracy-cost comparison using GPT-4.1-Mini
Figure 4: Accuracy-cost comparison using GPT-4.1-Mini
Boundary-threshold sensitivity on LoCoMo with GPT-4.1-Mini
Figure 5: Boundary-threshold sensitivity on LoCoMo with GPT-4.1-Mini
查看结构化数据
任务指标本文基线提升
LoCoMo 长期记忆问答(GPT-4.1-Mini) 总体准确率(1540 题,LLM judge) 89.22% Full Context 84.80%;最强记忆系统 TiMem 83.77%;A-Mem 68.83% +4.42pp vs Full Context;+5.45pp vs TiMem;+20.39pp vs A-Mem
LongMemEval-S 长期记忆问答(GPT-4.1-Mini) 总体准确率(500 题,官方 yes/no judge) 92.20% Full Context 66.20%;最强基线 TiMem 75.80%;A-Mem 71.60% +26.00pp vs Full Context;+16.40pp vs TiMem;+20.60pp vs A-Mem
记忆构建成本(LoCoMo,GPT-4.1-Mini) 构建 token(K,每对话平均,越低越好) 204.1K A-Mem 1459.9K;Mem0 1520.8K;TiMem 489.5K -86.0% vs A-Mem;-86.6% vs Mem0;-58.3% vs TiMem
记忆构建成本(LongMemEval-S,GPT-4.1-Mini) 构建 token(K,每对话-问题实例平均) 304.7K A-Mem 1264.3K;TiMem 620.9K -75.9% vs A-Mem;-50.9% vs TiMem
查询成本(LoCoMo,GPT-4.1-Mini) 查询 token(K/题) 4.01K A-Mem 5.56K;TiMem 10.71K -27.9% vs A-Mem;-62.6% vs TiMem
查询成本(LongMemEval-S,GPT-4.1-Mini) 查询 token(K/题) 8.88K A-Mem 15.46K;TiMem 11.36K -42.6% vs A-Mem;-21.8% vs TiMem

局限与改进

作者承认并经分析可见的局限:其一,评测限于文本对话 QA,LoCoMo 上 Full Context 仍有 84.80%,说明该基准渐趋饱和,本文与 Full Context 的差距(+4.42pp)远小于在更长上下文的 LongMemEval-S 上的差距(+26pp),结论强度部分依赖长上下文场景;其二,GPT-4o-Mini 下增益明显收窄(LongMemEval-S 仅 +1.00pp),弱骨干/弱嵌入下方法是否依旧成立存疑;其三,MemoryOS 在偏好追踪上达 100%(GPT-4.1-Mini),高于本文的 90.00%,专用用户画像模块在特定查询类上仍有优势;其四,append-only 存储没有记忆遗忘、合并或淘汰机制,数千轮以上真实长程使用中存储与检索的可扩展性未验证;其五,边界检测强依赖 text-embedding-3-small 的语义空间质量,跨语言与领域漂移下的分段稳定性未测;其六,效率报告只计 token,未给索引构建时间、存储占用与端到端延迟。

独立分析的弱点

独立分析的弱点:一是边界权重($b,w_s,w_c,w_l,w_n$)与硬 token 上限没有消融,只验证了阈值 $\delta$ 的敏感性,在话题切换极快的场景(如客服多工单穿插)下段可能过大,改进方向是对每个数据集自适应学习边界参数或引入元级别的分段策略选择;二是查询规划是单次调用,若规划器误判问题类型或漏掉时间约束,下游确定性召回无法自我纠正——LongMemEval-S 知识更新类在 GPT-4o-Mini 下只有 74.36%,低于 LightMem 的 83.12%,可为高不确定性问题加规划校验或回退到迭代检索;三是四通道召回加五类索引带来工程与存储复杂度,论文未报告索引大小和构建耗时,生产落地需要补齐成本模型;四是基准评测的写入流只有对话轮,真实智能体还有工具调用结果、系统消息等异构输入,分段器与编码 prompt 对这些输入的鲁棒性未验证;五是记录类型模式固定为七类,面向新领域(如代码助手)需要重新设计模式,泛化成本未讨论。

未来方向

作者在结论中提出三个方向:把分段级证据构建范式从纯文本对话 QA 扩展到多模态记忆、更丰富的偏好建模、面向部署的记忆治理。基于本文成果还可延伸:用轻量模型或强化学习替代手工边界分数,进一步优化分段质量与成本的帕累托前沿;为 append-only 存储引入遗忘、合并与冲突消解策略,解决记忆无限膨胀并显式处理知识更新类问题;把查询规划器与智能体的工具调用、任务规划统一,使记忆检索成为整体行动规划的一环;探索按用户价值或下游任务收益自适应调整整合粒度的联合优化目标;在开源小模型与真实生产日志上验证方法的外部效度,并补充延迟、存储、索引维护等系统工程指标的报告。

复现评估

复现友好度较高:附录完整给出了分段编码、查询规划、答案生成的 prompt 模板(F.1–F.3)、两个基准的构成与官方判分协议(A)、算法伪代码(B)、实现细节(C,含嵌入模型与重排器配置)、token 核算口径(D)以及全部消融变体定义(E)。骨干为 GPT-4.1-Mini/GPT-4o-Mini(temperature=0),嵌入用 text-embedding-3-small,重排用 bge-reranker-v2-m3,全部是公开可得的组件;LoCoMo 与 LongMemEval-S 数据集公开。算力上纯推理即可,构建约 204–305K token/对话,成本可控。主要不确定点:论文未给出开源代码链接,边界分数的权重 $b,w_s,w_c,w_l,w_n$、阈值 $\delta=0.50$、token 硬上限、段长上限等超参的具体取值散落在附录 C,需要读者按附录提示摸索对齐;LLM judge 本身也有随机性。总体复现难度中等,工作量主要在工程细节与超参对齐。