← 返回 2026-07-27

智能体上下文管理:把记忆与成本当作生命周期与架构问题 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

Gaurav Dadhich 📅 2026-07-23 👍 25 2026-08-01 18:30
LLM Agent 上下文压缩 上下文管理 智能体记忆 检索增强

把记忆重构为五原语生命周期,以验证式压缩实现线性成本与保真。

前置知识

上下文窗口 (Context Window)

LLM 单次推理能读入的最大 token 数。生产级 agent 每轮都要把会话历史、提示、工具定义、工具输出全部塞进窗口。全文反复出现的 token 预算 $W$、每轮增量 $t$ 都围绕它展开。

理解全文成本论证的前提:为什么 full-append 会变成 $O(n^2)$、为什么需要压缩到固定预算 $W$。

Full-append 与 token 成本 $O(n^2)$

朴素做法是每轮把整段历史重发给模型。$n$ 轮会话累计输入约 $\sum_{k=1}^{n} k\cdot t = t\,n(n+1)/2 \approx t\,n^2/2$。按 token 计费,成本随会话长度的平方增长,这是论文经济论证的基石。

论文据此论证‘托管式生命周期是必需而非锦上添花’,是 motivation 的核心数学。

向量检索 / 关键词检索 / 图检索

向量检索用 embedding 语义相似度找文档,关键词检索(如 Tantivy)按词项精确匹配,图检索沿实体-关系边做多跳遍历。论文 file-vs-vector 研究显示:CodeXGLUE 上向量 0.91 vs 关键词 0.29 MRR,而 SciQ 上关键词 0.81 vs 向量 0.61,各自覆盖对方的盲区。

论文主张混合检索(向量+图+关键词)以闭合‘推理充分性’缺口,是 method 与 results 的关键背景。

上下文压缩 (Compaction)

当相关上下文超出预算时压缩它。朴素摘要是有损且未验证的:先前工作把 18,282 token 压成 122 token,准确率从 66.7% 跌到 57.1%,还不如不给上下文(‘准确率悬崖’)。论文提出‘验证式压缩’,返回信息损失校验分数与压缩比。

这是五原语之一,也是论文相对竞品的核心技术新颖点,直接对应经济论证中的‘线性成本+保真’。

记忆作用域层级 (Scope Hierarchy)

论文把上下文作用域从窄到广分为 user(个人)、customer(组织)、client(平台运营方),外加独立的 global knowledge layer(仅做实体规范化)。所有原语都在每个 scope 上运作,按‘最窄优先’检索并强制隔离。

这是论文区别于‘只按 user 聚合’的记忆工具的关键维度,也是 B2B 多租户场景的卖点。

研究动机

生产级 AI agent 失败多半不是因为推理能力不足,而是管不住上下文窗口里不断堆积的会话历史、巨型提示、工具定义与膨胀的工具输出。截至 2025 年,多数企业都在试水 AI agent,但能在单一业务职能内真正规模化的不到 10%,大量试点永远毕不了业。具体故障模式包括:长会话中忘掉用户早先说过的话或同会话内工具返回的信息、跨多 agent 交接时自相矛盾、上下文被塞爆后产生幻觉、且每一轮都更贵。对某流行记忆库的一次审计显示,32 天内累积了 10,134 条记录,只有 38 条可用,垃圾率高达 99.6%。成本侧,朴素 full-append 的累计输入约 $\sum_{k=1}^{n} k\cdot t = t\,n(n+1)/2 \approx t\,n^2/2 = O(n^2)$;而粗暴摘要虽能把成本压成线性,却制造‘准确率悬崖’——把 18,282 token 压成 122 token 后准确率从 66.7% 跌到 57.1%,反而劣于不给上下文。

本文的目标是本文目标是把 agent 记忆问题重新定义为‘智能体上下文管理’(ACM)这一完整生命周期学科,分解为五个原语——架构设计 (Architecting)、摄取 (Ingesting)、作用域 (Scoping)、预取 (Anticipating)、压缩与巩固 (Compacting & Consolidation)——并跨 user→customer→client 作用域层级与独立全局知识层运作。作者想造出一个能达到‘效率前沿’的系统:在保持(已验证的)保真度下实现线性 token 成本 $O(n)$,同时严格保证组织级隔离。他们提供参考实现 Maximem Synap,把五个原语作为相互耦合的整体而非拼凑工具来落地,并用两个公开基准(LongMemEval、LoCoMo)和原创的 file-vs-vector 检索研究来定量支撑经济与信息论论证,证明托管式生命周期是必需而非可选。

与已有工作不同的是,现有记忆工具把问题框定为‘存储与检索’,只优化 write 与 read 两个时刻;但生产 agent 每轮要面对五次不同决策(什么值得留、用什么结构留、本轮该带哪一小部分、下一轮会需要什么、超预算时怎么压缩而不错丢)。论文的独特切入是:(1) 把上下文视为从采集到退役的完整生命周期,而非一处仓库;(2) 引入组织级作用域层级并强制隔离,避免把组织结构拍平到单一 user 桶导致跨用户泄漏或丢失组织上下文;(3) 把‘预取式 anticipation’从检索中独立出来,借鉴计算机系统的投机预取;(4) 让 compaction 变成可验证操作而非‘赌一把’。作者调研的商业系统(Mem0、Zep、SuperMemory、Cognee、Letta)在自家公开材料中均未同时声称‘按 agent 用途生成式记忆架构’、‘查询预测式预取’和‘损失可验证压缩’——这正是 ACM 框架增益最大的地方。

核心方法

整体思路是‘记忆不是仓库,而是五个原语耦合的生命周期系统’。直觉:架构选择决定了其余四个原语该做什么(客服 agent 与编程 agent 需要不同类别、留存、压缩策略),所以要把上下文当整体系统而非五个独立工具。技术路线:定义五原语——Architecting(按 agent 用途经 LLM 推理生成定制记忆架构,选类别、抽取、存储、检索、压缩策略)、Ingesting(异步队列化管线:qualify→抽取 5 大类记忆+实体/关系/时效→实体消解→多库持久化)、Scoping(按 user→customer→client 最窄优先检索,混合向量+图+关键词)、Anticipating(根据 agent 行为预测下一轮需要的上下文并预取,把检索挪出关键路径)、Compacting & Consolidation(带信息损失校验、验证分数、压缩比与自动重试的可验证压缩)。所有原语在三层作用域上运作,外加仅做实体规范化的全局知识层。集成模式收敛为每次模型调用前后的三段调用:scoped FETCH → 验证式 COMPACT → MODEL → 异步 INGEST。

核心创新是把‘记忆(仓库)’重构为‘上下文管理(五决策生命周期)’。与已有方法的本质区别有四:(1) Architecting 经 LLM 推理为每个 agent 生成定制记忆架构,而非通用固定 schema——这是抽取质量(推理链第一环)最关键的杠杆,也是五原语‘耦合’论的具体化身。(2) Compaction 带显式质量契约:每次压缩返回验证分数与压缩比,低于阈值则自动以更温和策略重试;把压缩当‘可验证操作’而非‘赌一把’。这正是让迭代压缩安全的前提——未验证的迭代会漂移进 Section 3.2 的上下文崩塌。(3) Anticipation 是‘查询预测式预取’而非缓存:缓存重放重复查询,预取则从 agent 演化行为预测尚未请求的上下文,当前命中率 60%+。(4) Scope 是一等公民,隔离在存储层(每租户命名空间)与查询层(scope 谓词)双重强制,身份由凭证派生而非客户端声明。

方法步骤详情

集成遵循 Listing 1 的三段调用(每次模型调用前后):(1) `FETCH(query, scope)` 按 user→customer→client 最窄优先做 scoped 检索,走向量+图混合管线并按 token 预算裁剪、打溯源标签;(2) `COMPACT(conversation)` 做验证式压缩,检查关键信息能否从压缩结果恢复,输出验证分数与压缩比,低于阈值自动以更温和策略重试;(3) `MODEL(assemble(retrieved, compacted, recent_turns))` 拼给模型;(4) `INGEST(turn, scope)` 异步、立即返回 ID。连接时 Architecting 用用途描述生成记忆架构。Ingestion 后台异步抽取事实/偏好/情节/时效事件与实体关系,实体消解走置信度级联(精确→词法→语义→上下文),跨关系/图/向量库持久化。压缩每 $p$ 轮触发、系数 $c$,总成本 $N W (1+c/p)$ 保持线性,100/200/500 轮省约 80%/90%/96%。

技术新颖性

技术新颖性集中在五点:(1) 验证式压缩——多数摘要工具‘赌一把’地压缩,本文检查可恢复性并重试,使迭代压缩安全(关键论断:未验证迭代会漂移进上下文崩塌)。(2) 生成式 per-agent 架构设计——竞品用开发者定义块或事后涌现结构,Synap 用 LLM 推理从用途描述生成架构。(3) 把 anticipation 作为独立原语而非缓存——从 agent 行为预测下一轮需要什么,命中率 60%+,把检索挪出关键路径。(4) 多库存储(ChromaDB 向量+Neo4j 图+Postgres 关系+对象/时序/缓存)并在查询时加 scope 谓词,而非靠应用层判断隔离。(5) file-vs-vector 研究量化了‘向量税’(建索引比关键词慢 60–100×)并揭示双方各有盲区:语义鸿沟大处向量胜(CodeXGLUE NL→code 0.91 vs 0.29 MRR,‘sort a list’ 命中 bubble_sort),实体具体处关键词胜(SciQ 0.81 vs 0.61,‘mitochondria’ 是键而非相似概念),多跳略偏关键词,从而为‘混合检索’提供经验动机。

The five-primitive context lifecycle
Figure 1: The five-primitive context lifecycle
File-vs-Vector motivating study (configuration and caveats: Appendix B)
Figure 4: File-vs-Vector motivating study (configuration and caveats: Appendix B)
Reference architecture (block level)
Figure 5: Reference architecture (block level)

实验结果

Table 2 配置(gpt-5-mini 作答+判官;排除 LoCoMo 对抗性 Cat 5)下,Synap 在 LongMemEval 整体 92.0%(460/500),LoCoMo Cat 1–4 达 93.2%。LongMemEval 分类别:user/preference/knowledge-update/temporal-reasoning 全 100%,single-session-assistant 87.5%(49/56),multi-session 仅 75.2%(100/133)——残差错误集中在须跨会话拼接信息的 multi-session,即推理充分性难点;LoCoMo 最强 multi-hop 97.3%、最弱 single-hop 88.8%。横向(非正面对比)SuperMemory 81.6–85.2%、Zep 71.2%,Mem0/Letta 未公布。关键:Synap 用更小的 gpt-5-mini 就拿 92%,增益来自上下文层。验证式压缩相对 $O(n^2)$ full-append 在 100/200/500 轮省约 80/90/96%。

Production failure modes and the primitive whose absence produces them
Table 1: Production failure modes and the primitive whose absence produces them
Evaluation configuration (full methodology)
Table 2: Evaluation configuration (full methodology)
Published LongMemEval results (each vendor's own methodology; self-reported; not a controlled comparison)
Table 3: Published LongMemEval results (each vendor's own methodology; self-reported; not a controlled comparison)
Systems × primitive coverage
Table 4: Systems × primitive coverage
查看结构化数据
任务指标本文基线提升
LongMemEval(长多会话记忆,500 题 6 类) overall accuracy (%) 92.0% (460/500, gpt-5-mini 答题+判官) Zep 71.2% (gpt-4o);SuperMemory 85.2%/84.6%/81.6% (更大模型) 在更小答案模型下高出约 7–21 个点(非受控对比,各家方法学不同)
LoCoMo(超长会话 QA,~300 轮) accuracy (Cat 1–4, 排除对抗性 Cat 5) 93.2% 原论文/Mem0/Zep 按惯例排除 Cat 5(含/不含移动 10+ 分) 与公开记录一致;分类别 multi-hop 97.3% 最强,single-hop 88.8% 最弱
token 成本(会话长度缩放) 累计输入 token 渐近阶 $O(n)$(验证式压缩,$N\cdot W\cdot(1+c/p)$) full-append $\approx t\,n^2/2 = O(n^2)$ t=500,W=4000,p=8,c=2 时 100/200/500 轮分别省 ~80%/90%/96%

局限与改进

作者自承:两个基准只衡量会话召回与基于召回内容的推理,未衡量生产负载下的延迟、单任务 token 成本或随上下文增长的‘context rot’鲁棒性;LoCoMo Cat 5(对抗性、衡量弃答)的纳入与否会让头条分移动 10+ 分,是最常见的不可比来源;Table 3 各家方法学不同故不可直接 head-to-head;per-run 产物(答案、检索上下文、判官裁决)当前仅按需提供而非公开。我的观察:(1) 全文没有任何延迟数字,尽管‘anticipation 把检索挪出关键路径’是核心设计主张;(2) 最具新意的机制(验证打分过程、预取预测、架构生成)是 proprietarily 未公开的,使其更像‘立场论文+产品报告’而非可复现研究;(3) file-vs-vector 研究是单操作者、无 chunking、规模小,作者自己也声明仅作 motivation 而非受控基准;(4) 注脚把一条 97.8% 自我纠正为 99.6% 垃圾率,显示自报数据的脆弱。

独立分析的弱点

(1) 机制黑箱——验证打分过程、预取预测、架构生成这三项最具新意的部分被刻意不描述,无法独立复现或审视;改进方向:至少公开验证打分的判定流程与阈值。(2) 缺延迟评估——全文没有 p50/p99 端到端延迟,而 anticipation 的全部价值就在延迟;改进:补一组真实负载下的延迟基准。(3) 基准敏感性——分数随答案模型、判官、摄入粒度、对抗类别处理移动数点乃至 10+ 点,Table 2 的全配置披露虽好但仍难横向比较;改进:作者已预告要做一个同时度量准确率+延迟+token 效率+context rot 的新基准,这正是社区最缺的。(4) 经济论证假设每轮均匀加 $t$ token 且忽略了有界上下文对推理质量本身的折损(lost-in-the-middle);改进:在真实工作负载上实证 $O(n^2)$ vs $O(n)$ 与质量曲线。(5) 多租户隔离主张缺对抗性评估(prompt injection、scope 逃逸);改进:补红队式的隔离与泄漏测试。

未来方向

作者明确提出的未来方向是‘决策级上下文’:不只记录发生了什么,更记录组织为何那样决策,让 agent 能基于机构判断而非仅机构事实来推理。他们坦承硬问题尚多:多数决策是隐式且从未记录的;已记录的理由往往是事后辩护而非真实追踪;把决策与结果关联需要连人类都头疼的因果归因;判断过去决策何时被取代本身也是问题;跨组织系统抽取决策追踪、组织内规范化(同一文档被一个团队叫 PR FAQ、另一个叫 6-pager)、时效接地、安全后果都是开放难题。作者还预告一篇后续论文提出同时度量准确率/延迟/token 效率/context rot 的新基准。基于成果可延伸:(1) 形式化压缩验证分数的真值来源与低成本构造;(2) 把 60%+ 的预取命中率用 RL 在 agent 轨迹上进一步提升;(3) 把作用域层级从三层扩展到嵌套子 agent 的任意深度;(4) 直接打‘推理充分性’基准——当前多数基准只打单文档命中,几乎无人度量整条推理链是否被检索齐。

复现评估

可复现性是混合的。公开侧:评测 harness(maximem-ai/memory_and_context_eval_harness)开源、方法学与分类别计数公开、数据集用官方公开分发(LongMemEval_S 500 题全集、locomo10)、file-vs-vector 研究数据公开(maximem-ai/file-vs-vector-study-results)。封闭侧:系统本体 Maximem Synap 是商业专有的,架构生成/验证/预取机制被刻意不描述,核心主张无法独立复现;per-run 产物(答案、检索上下文、判官裁决)仅按需提供而非公开发布。算力未明确披露,但答案与判官都用 gpt-5-mini,API 成本中等。难度评估:完整系统复现难度高(黑箱机制 + 多库存储栈 + 多 agent 校验),仅用公开 harness 复跑评测难度中等。整体更像可验证的‘产品对标’而非可复现的‘学术系统’。