← 返回 2026-07-30

大语言模型的记忆 Memory for Large Language Models

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang 📅 2026-07-28 👍 13 2026-08-04 18:30
LLM记忆机制 架构综述 测试时训练 混合专家 状态空间模型

以表示、更新动态、持久性三轴统一梳理大语言模型的记忆架构设计空间

前置知识

KV Cache(键值缓存)

Transformer 自回归生成时缓存历史 token 的 Key/Value 张量,使新 token 无需重算历史表示即可通过注意力检索。它随序列长度线性增长,是长上下文推理的主要显存瓶颈,本质上是与前向计算耦合的隐式工作记忆。

本文把 KV cache 定为「隐式、在线、短时」记忆的典型,是理解整篇分类法以及后续压缩、分页(PagedAttention)、稀疏化工作的基准参照系。

状态空间模型(SSM/Mamba)与线性注意力

把历史压缩进固定大小的隐状态 $S_t$,通过线性递推更新(如 $h_t = A_t h_{t-1} + B_t x_t$)实现线性时间、可处理无限长流式输入,代价是有损压缩。Mamba 引入选择性更新,线性注意力则通过核化把注意力改写成递推状态矩阵。

本文将其归为「隐式、在线、长时」记忆,与注意力的短时记忆对照,是理解 RNN 复兴与混合架构动机的前提。

测试时训练(Test-Time Training, TTT)

在推理阶段对模型的一小部分「快权重」参数做梯度更新,把当前上下文信息写入可持久化的参数子集:Titans 用惊喜(surprise)信号驱动、TTT-E2E 与主干联合优化。它是「显式、在线、长时」参数化记忆的代表。

TTT 是本文「显式记忆」章节的核心案例,理解它才能把握记忆从计算副产品升级为可写参数维度的趋势。

混合专家(Mixture-of-Experts, MoE)

维护多个专家子网络,由路由器依输入稀疏激活少数子集,形式化为 $y = \sum_{i \in S(h)} g_i(h)\cdot \mathrm{Expert}_i(h)$,能在单 token 算力近似恒定下把参数扩展到万亿级(Switch Transformer、GLaM、Mixtral、DeepSeek-MoE)。

本文独到地把 MoE 解读为「离线、长时、条件参数」记忆,置于显式记忆的中间地带,这一视角贯穿第四章。

稳定性-可塑性困境(Stability-Plasticity Dilemma)

持续学习中既要快速吸收新信息(可塑性),又不能覆盖已有知识(稳定性)的经典矛盾。显式在线记忆通过把记忆参数与主干权重解耦、或用多时间尺度(快/慢权重)更新来缓解该矛盾。

这是贯穿第四章与第六章的核心张力,理解它才能判断各类显式记忆更新规则的优劣与风险。

研究动机

随着大模型能力跃升,记忆已从「计算的副产品」演进为一条核心架构维度:从 Transformer 的注意力工作记忆,到状态空间模型(Mamba 等)的递推压缩,再到 Titans、端到端测试时训练(TTT-E2E)、Engram、MEMORYLLM 等在推理时写入持久参数或可寻址存储的新机制,2024–2026 年间涌现了大量异构方案。问题在于这些机制被分散在不同社区里各自研究:长上下文注意力、高效序列建模、测试时学习、检索增强、混合专家彼此割裂,却回答着本质同构的问题——存什么、何时如何更新、如何与前向计算交互、保留多久、存储粒度多大。由于缺乏统一的结构化框架,研究者很难横向比较方法、分析系统级取舍,更难以发现尚未被探索的设计空间。现有综述又多聚焦智能体层级、认知类比或记忆生命周期,而非模型级架构本身,使这一空白更加突出。

本文的目标是本文的目标是为大语言模型的记忆提供一个系统化、以架构为中心的分类体系,把上述分散的进展整合进一个统一的设计空间。具体而言,作者沿三条正交轴刻画记忆:表示形式(隐式 vs 显式)、更新动态(离线 vs 在线)、持久性(短时 vs 长时),并进一步把更新规则细化为五种机制(基于优化的写入、状态转移更新、信号门控写入/路由、准入/驱逐/合并、目标诱导/结构性更新)。在此框架下,对约四十个代表性系统逐一归类,厘清它们的结构依赖与概念边界,最终为可扩展、可自适应的语言建模提供面向未来的设计原则。

与已有工作不同的是,本文的独特切入点在于聚焦模型级架构机制,而非智能体级或提示工程级的记忆系统。与 Zhang 等人(2024,智能体记忆来源/形式/操作)、Wu 等人(2025,人脑记忆类比的三维八问)、Du 等人(2025,六类原子操作的记忆生命周期)、Zhang 等人(2025,参数/上下文/外部/过程记忆的评估与治理)、Luo 等人(2026,存储-反思-经验演化)等综述不同,本文的核心问题是信息如何被架构性地表示、其更新是否绑定前向动态、能维持多长的有效时间窗。这一机制中心视角把注意力缓存、递推状态压缩、推理时可写模块、架构内嵌查找存储放进同一个设计空间,是对既有综述的互补而非替代。

核心方法

整体思路是先用一个三轴分类法搭建概念坐标系,再沿坐标系系统梳理文献。第一条轴是表示形式:隐式记忆指作为前向计算副产物、与计算图紧耦合的信息(如 KV cache、递推隐状态),即便被物化为张量也缺乏独立寻址/读写语义;显式记忆则是拥有独立存储组件、明确读/写/检索语义、且更新可与标准前向传播分离的机制,包括外部表、关联缓冲、专用参数模块等。第二条轴是更新动态:离线记忆只在训练阶段更新、推理时固定(如预训练权重、MoE 专家);在线记忆支持推理时更新,频率可逐 token、逐段或逐批。第三条轴是持久性:短时记忆粒度细、受限于上下文窗口;长时记忆通过压缩、选择性保留或持久存储延长有效视野,且与物理大小无必然关系。三条轴基本正交,例如显式记忆既可离线也可在线,在线记忆既可短时也可长时。

核心创新不在提出单一新模型,而在用「自主性」这一判据把记忆机制一分为二,并补一条更新规则的二级透镜。关键判据是:某机制是否拥有独立于前向计算的可控读写接口——若有则属显式,否则属隐式。这使得 Titans 的测试时参数、Engram 的稀疏哈希槽、LM2 的专用记忆槽、MoE 的条件参数都被纳入「显式」大家族,而 TTT 类方法中那些可被改写为线性注意力、缺乏独立可写基底的变体则被排除在主分类之外(参见引用 [72] 的分析)。第二条创新是表 II 的五种更新规则——优化写入、状态转移、信号门控、准入/驱逐/合并、目标/结构诱导——它们可与三轴任意组合,揭示出两条同为「在线」的记忆机制可能基于截然不同的更新规则(闭式递推 vs 梯度优化 vs 不确定性门控),从而把「何时更新」与「如何更新」解耦。

方法步骤详情

作者按四步推进。第一步定义三轴与术语,给出表 I 把约四十个系统(从 2017 年 Transformer 到 2026 年 Mamba-3、Engram、GDWM、MemoryLLM(FFN))按主机制归类。第二步梳理隐式记忆:把注意力解释为内容寻址的短时工作记忆,分析容量与上下文长度的关系(含 DeepSeek-V2 MLA 潜在压缩、StreamingLLM 注意力锚点、MoBA/NSA 等稀疏/选择性注意力,以及 RWKV-7、Gated DeltaNet-2、Kimi Linear、Log-Linear Attention 等递推记忆),并归纳其四大结构性局限。第三步梳理显式记忆:参数化模块(Titans、TTT-E2E、MEMORYLLM、Nested Learning、In-Place TTT、GDWM、LM2)、基于查找的机制(kNN-LM、PlugLM、ExplicitLM、Engram)、条件参数记忆 MoE、多时间尺度/嵌套更新,并分析容量增长、干扰漂移、优化收敛、跨片段一致性等风险。第四步分析混合架构、记忆管理与效率、评估方法,并给出六大开放挑战。

技术新颖性

新颖性体现在三方面。首先,这是首篇严格聚焦模型级架构、以机制为中心的记忆综述,明确排除智能体编排与提示级记忆工程,并给出表 III 把自己与五篇近期综述清晰区隔。其次,三轴框架配合二级更新规则透镜,把过去被「离线/在线」「参数/非参数」粗暴二分的方法细化到一个可比较的网格上——例如点出 Memorizing Transformers、LongMem 这类激活级检索其实是隐式激活记忆与显式数据存储之间的「边界类」,而不强行塞进某一格。再者,作者把 MoE 重新诠释为「离线、长时、条件参数」记忆,把 Engram 的稀疏寻址与 MoE 的稀疏计算明确区分(前者稀疏寻址存储项、后者稀疏激活参数化变换),这种「记忆视角」的重新编码本身就是一种贡献,能帮助研究者发现空白(如可逆写入、可诊断更新规则)。

Main content and taxonomy of memory for LLMs.
Fig. 2: Main content and taxonomy of memory for LLMs.
Overview of implicit memory via computation dynamics.
Fig. 3: Overview of implicit memory via computation dynamics.
Overview of explicit memory via addressable and adaptive storage.
Fig. 4: Overview of explicit memory via addressable and adaptive storage.

实验结果

需要先说明:这是一篇综述,没有原创实验,所有「发现」都来自把分类法套用到文献后得到的结构性洞察与所引文献的定量证据。第一,隐式记忆有四条固有局限:容量受架构资源束缚且常与名义上下文长度脱节(引用 [59][60] 指出长上下文模型往往用不满标称容量)、缺乏可适配的读写语义、难以跨上下文/会话持久化。第二,显式记忆虽突破容量与持久性限制,却引入新的结构性风险:容量随槽位/参数无界增长需剪枝压缩、在线写入导致干扰与漂移、辅助目标不保证标准预训练的优化收敛、跨片段生命周期管理困难、架构异质性削弱可解释性。第三,混合架构正在成为主流,用注意力保证高分辨率召回、用状态空间做压缩长程传播、用显式模块做持久化,典型如 Samba(在困惑度与记忆召回上同时超越纯 Transformer 与纯 SSM)、Jamba/Kimi Linear/OLMo Hybrid 的层间或头间混合。第四,趋势上记忆正从「规模副产品」转向显式、持久、自适应的一等设计维度。

任务指标本文基线提升
大规模参数扩展 可激活参数规模 vs 单 token 算力(FLOPs) MoE 范式(Switch Transformer / GLaM / Mixtral / DeepSeek-MoE) 稠密 Transformer 综述转述 Switch/GLaM 可把参数扩至万亿级而单 token FLOPs 近似恒定;Mixtral 采用每层 top-2 路由共 8 专家取得强性价比,印证「条件参数记忆」视角。
长上下文建模与记忆召回 困惑度(perplexity)与记忆召回准确率,及随上下文长度增长的退化曲线 注意力-SSM 混合架构(Samba 等层间交错) 纯 Transformer 与纯 SSM/Mamba 综述转述 Samba 在困惑度与记忆召回任务上同时超越两类纯基线,并展现更好的长上下文外推;同时强调 RULER/L-Eval 应报告随长度增长的退化曲线而非单点指标。
稀有 token 预测与困惑度改进 困惑度下降 数据存储增强(kNN-LM 外挂上下文-目标对数据存储) 预训练语言模型 综述转述 kNN-LM 显著降低困惑度并提升稀有 token 预测,作为「离线、长时、显式查找记忆」的最早范例。

局限与改进

作者明确承认的局限有两条:其一,本文只覆盖模型级记忆机制,刻意排除依赖外部数据库或编排流水线的智能体级、提示级记忆,以及对话历史、用户画像、反思轨迹等系统层存储;其二,认知/语义分类(事实记忆、情景记忆等)只作辅助视角,不是主线。作者还点出若干未决难题:缺乏统一的记忆容量理论、在线更新规则的稳定性与可逆性不足、评估体系碎片化且常把容量与推理能力混为一谈。作为综述读者,我额外观察到:三轴声称「基本正交」但实践中并不严格(在线参数记忆的持久性取决于更新与驱逐策略);隐式/显式的二分对 Memorizing Transformers、LongMem 这类激活级检索偏粗(作者自己也归为「边界类」);MoE 算作「记忆」虽有洞察但存在争议;文中定量数据多转述自各原始工作,缺乏统一的横向 meta 分析。

独立分析的弱点

第一,分类的「正交性」是声明而非证明:在线记忆的持久性高度依赖更新与驱逐策略,两轴在实际耦合,未来可形式化刻画耦合度。第二,隐式/显式二分对边界类(激活级检索、可改写为线性注意力的 TTT)过粗,建议引入「自主度」连续轴。第三,缺乏横向定量 meta 分析——表 I 列了四十个系统却无统一基准下的对比表,读者难以判断哪种范式在同等算力下更优,可补充一张按 RULER/LongBench 等基准归一化的对照。第四,MoE 归为记忆虽新颖但论证偏概念化,缺乏「专家即记忆」的可证伪预测。第五,对评估方法只做综述而未提出新的多维诊断协议(第六章列为未来方向却未落地)。每个弱点对应的改进方向分别是:形式化耦合度量、引入自主度轴、做归一化横向评测、为「专家即记忆」设计可证伪实验、在本文框架上直接实现一套标准化压力测试(受控干扰注入、记忆衰减测量、更新一致性分析)。

未来方向

作者在第六章提出六大方向:一、建立统一的记忆理论,用状态转移视角刻画容量、保真度、干扰鲁棒性、信息压缩效率等形式化属性;二、持续/终身参数化记忆,发展稳定更新协议、模块隔离与元学习合并机制,实现无需重训的增量知识积累;三、鲁棒且可解释的更新规则,让优化写入、状态转移、信号门控、准入/驱逐变得可诊断、必要时可逆;四、自适应记忆分配,用学习型控制器在注意力、状态、检索、专家间动态调度 token;五、硬件-算法协同设计,把记忆操作对齐到 GPU/加速器的显存层级,实现多级缓存与选择性重算;六、原则化、多维度的记忆评估协议。基于成果可延伸的方向包括:把「自主度」做成可计算的连续指标、为混合架构设计端到端可微的记忆路由、把记忆视角推广到多模态与世界模型。

复现评估

作为综述,本文的可复现性主要体现在框架本身而非实验。作者引用了约八十篇参考文献,并在表 I、表 II 给出可直接复用的分类网格;唯一的显式公式是 MoE 的稀疏门控 $y = \sum_{i\in S(h)} g_i(h)\cdot\mathrm{Expert}_i(h)$ 与递推形式 $h_t=A_t h_{t-1}+B_t x_t$,足以让读者按图索骥去复现各原始工作。没有提供代码、数据集或算力需求,也不存在需要重跑的实验。若目标是「按本文分类法重新归类一个新模型」,复现难度低、不需要额外算力;若目标是「验证某一架构的记忆能力」,则需要回到对应原始论文(多数已开源,如 Mamba、Jamba、Mixtral、DeepSeek 系列)。总体而言,这是一篇概念性贡献,复现门槛在文献检索与概念理解,而非工程实现。