Metis:记忆基础模型 Metis: Memory Foundation Model
首个把记忆能力内化进基础模型参数与前向计算的模型原型
前置知识
Fast Weight Programming (FWP, 快权重编程)
FWP 范式除训练时学到的慢权重外,还在推理时维护一组随输入动态变化的快权重,用来捕获序列相关信息。线性注意力、RetNet、RWKV、Mamba 等都可视为快权重程序员,TTT 也把循环状态当作由自监督梯度下降在线优化的快权重。Metis 正是受 FWP 启发,用动态参数承载跨步记忆状态。
Metis 的记忆状态本质是一组动态快权重,理解 FWP 才能理解 Metis 为何能把记忆做成'参数化、可前向计算、无梯度在线维护',以及它与线性注意力/SSM/TTT 的技术血缘。
Retrieval-Augmented Generation (RAG, 检索增强生成)
RAG 把历史信息存成外部文本库,推理时按查询与文档的稠密相似度检索 top-k 片段拼进 prompt,再由骨干做条件语言建模。本文用 top-5 余弦相似度 RAG 作为 Partial Context 基线。
RAG 是外置记忆的代表,论文的三大动机(与骨干解耦、梯度被离散操作阻断、串行开销)全部针对它。看懂 RAG 的瓶颈才能理解 Metis 想替代什么。
Test-Time Training (TTT, 测试时训练)
TTT 在单个序列内用自监督损失在线更新一组动态参数(如 Temp-LoRA 临时训一个 LoRA 模块),让模型更好地吸收当前输入。它通常以循环层替换全注意力以高效建模长上下文。
TTT 是与 Metis 最易混淆的近邻方法。论文专门用三方面区分:TTT 只做单序列适应、不提供语义记忆过程、且常替换全注意力;Metis 做多步持久状态、有记忆操作目标、只在原注意力上加记忆残差。Temp-LoRA 也是主要基线。
Gated Delta Network (GDN) 与 GDU 更新
GDN 是一类带门控的线性注意力/快权重更新规则,相较朴素线性更新能更稳定地维护循环状态。Metis 实际采用 GDN 风格的更新(GDU)来更新稠密记忆矩阵 $M^{(l)}_t$,消融显示它在长程场景比线性更新更稳。
GDU 是 Metis 存储过程的最终实现选择,读懂它才能理解记忆矩阵如何随折扣因子 $\lambda$ 与门控演化,以及消融中 w/o GDU 的含义。
Memory-Augmented Neural Networks (MANN, 记忆增强神经网络)
MANN(如 Memory Networks、Neural Turing Machines)给神经控制器外挂可微分的记忆槽,并学习读写操作。其记忆是独立于骨干主参数的存储组件,操作由独立控制器实现。
论文把 Metis 定位为'从外挂记忆走向骨干内部原生记忆'的一步,理解 MANN 才能看清 Metis 把记忆状态变成骨干动态参数、把记忆过程放进同一连续函数空间的本质差异。
研究动机
现有 AI 智能体的记忆几乎都由外置于基础模型的模块实现(典型如 RAG),论文 Figure 1 系统总结了三大缺陷。第一,外置记忆与骨干解耦:存储/检索的目标(构造信息丰富的上下文)与骨干的条件语言建模目标分离,外部记忆未必给骨干最有用的信息,骨干也未必最优地利用记忆。第二,端到端优化困难:记忆操作(检索、重排、拼接)是离散的,梯度无法有效反传,领域 post-training 极难;尽管 RL 策略可部分缓解,但效率低下。第三,串行开销:外置记忆需在存储外部执行抽取、匹配、重排、总结等显式操作,叠加在推理之外,增加在线延迟。Table 5 与 Table 6 的实验直接佐证了问题严重性:在 No Context 设定下,Qwen3.5-4B/9B/27B 在 MemOps (Gold) 平均仅 1.65/1.88/1.69,在 LoCoMo (Gold) 平均仅 0.18/0.07/0.07,几乎为零;即便用 top-5 RAG 的 Partial Context,在 MemOps (Gold) 平均也只有 22–30,说明残缺的历史无法可靠支撑记忆操作,而 full-context 又带来巨大上下文成本。
本文的目标是本文要把记忆从外置模块转化为基础模型骨干内部的机制,让记忆状态直接参与前向计算,从而形式化并实现'记忆基础模型'。具体目标有四:(1) 引入原生记忆状态——跨多个推理步持久、动态、随输入演化的骨干参数 $\theta_t$(其动态部分记为 $M_t$),且其语义空间与静态参数 $\Phi$ 在预训练/中期训练阶段对齐;(2) 引入原生记忆过程——把记住、遗忘、更新、反思等语义记忆操作与骨干前向计算耦合,由输入指令驱动、自主执行,而非依赖外部规则化的离散流程;(3) 使整个记忆系统像普通基础模型一样可被数据驱动地端到端优化,支持领域 post-training;(4) 实现首个原型 Metis,验证该范式在记忆操作和记忆问答任务上无需回放原始上下文即可超越 TTT、δ-Mem 等基线,并在效率上避免检索/拼接/prefill 的开销。
与已有工作不同的是,本文的独特切入角度在于把记忆同时建模为'存储实体(状态)'和'过程(操作)',并让二者落在与骨干相同的连续函数空间里,通过中期训练一次性获得。这与三类已有工作形成本质区别:与 RAG/latent memory(NextMem、MemGen、δ-Mem)不同,Metis 完全去掉上下文中的文本记忆,把信息压缩进固定大小的参数化记忆矩阵 $M^{(l)}_t$;与 Test-Time Training 不同,TTT 只在单序列内做自监督适应、不提供显式语义记忆过程、且常以循环层替换全注意力,而 Metis 在多步交互下保持持久状态、不替换全注意力、只在原注意力上叠加记忆残差,并通过记忆重建/操作目标让模型在隐空间自主执行语义记忆操作;与 Memory3、MANN 等不同,记忆不再外挂于显式可检索槽位,而是直接作为骨干动态参数参与计算。作者还从预测任务视角给出更高层的论证:记忆本质是'预测当前信息未来如何被利用',因此像其他机器学习预测任务一样可在预训练/中期训练阶段习得并泛化。
核心方法
Metis 的整体思路是:在标准因果语言模型的每个 Transformer block 之后插入一个 Metis block,由'局部记忆块(Local Memory Block)'和'超记忆块(Hyper Memory Block)'两部分组成(见 Figure 2)。局部记忆块维护稠密记忆网络 $M^{(l)}_t \in \mathbb{R}^{d_k \times d_v}$ 和 query-key 归一化向量 $S^{(l)}_t \in \mathbb{R}^{d_k}$,它们是随交互步演化的动态参数(初始 $M^{(l)}_1=0, S^{(l)}_1=0$);超记忆块由中期训练得到的静态参数(重要性向量 $\tilde w^{(l)}_{\text{agg}}$、记忆 K/V 投影 $\tilde W^{(l)}_K, \tilde W^{(l)}_V$、记忆查询投影 $\tilde W^{(l)}_Q$)构成,作为原生记忆存储过程的参数化函数空间。技术路线分两条:存储过程在每步结束后对中间激活做自适应聚合(top-$\rho$ 选取重要位置)、投影成 $\tilde K^{(l)}_t, \tilde V^{(l)}_t$,再用折扣因子 $\lambda$ 更新 $M^{(l)}_{t+1}, S^{(l)}_{t+1}$(实践采用 Gated Delta Network 风格的 GDU 更新);利用过程则在每个步的前向中通过记忆注意力 $\tilde A^{(l)}_t = \text{diag}(\tilde Q^{(l)}_t S^{(l)}_t)^{-1} \tilde Q^{(l)}_t M^{(l)}_t$ 读出记忆,并以权重 $\gamma \in [0,1]$ 与原注意力融合为 $A^{(l)}_t = \gamma \cdot \text{Softmax}(\cdot)V^{(l)}_t + (1-\gamma)\cdot \text{Norm}(\tilde A^{(l)}_t)$。直觉上,记忆像一层'会自己更新的低秩 KV 缓存'贴在每个注意力层旁边。
核心创新在于'把记忆状态表示为骨干动态参数、把记忆过程实现为骨干前向计算的一部分',并通过中期训练用一个统一的负对数似然目标 $\ell(s,t) = -\frac{1}{|Y_t|}\sum_k \log P(y_{t,k}|X_t,Y_{t,<k};\theta_t)$ 同时监督记忆状态和过程。这与已有方法的本质区别有三:(1) 存储不是规则化的插入/删除/修改,而是'预测信息未来如何被利用'的连续函数,由 $\tilde w_{\text{agg}}, \tilde W_K, \tilde W_V$ 参数化;(2) 利用不是离散的检索/重排,而是记忆注意力直接参与前向,与原注意力并行融合;(3) 在线维护完全无梯度——记忆更新只需一次前向,所有学到的权重在推理时冻结,只有原生记忆状态通过标准前向计算自主变换。理论分析(3.4–3.5 节)进一步表明:通过引入独立可训练的记忆查询 $\tilde Q^{(l)}_t = \tilde H^{(l)}_t \tilde W^{(l)}_Q$,可重塑跨步相似度 $\tilde Q^{(l)}_t \tilde K^{(l)\top}_j$,强调相关步、抑制无关步,从而把非参考步泄漏带来的误差 $\epsilon_1, \epsilon_2, \epsilon_3$ 控制在低相似度区间内。
方法步骤详情
完整步骤如下。给定第 $t$ 步指令 $X_t$,骨干逐层前向到第 $l$ 个 Transformer block 得到 $H^{(l-1)}_t$。**存储阶段**:(1) 预归一化 $\tilde H^{(l)}_t = \text{PreNorm}(H^{(l-1)}_t)$;(2) 用 $\tilde w^{(l)}_{\text{agg}}$ 对 $L$ 个 token 打分 $p^{(l)}_t = \text{Softmax}(\tilde H^{(l)}_t \tilde w^{(l)}_{\text{agg}}/\tau)$;(3) 取累计概率达阈值 $\rho$ 的 top 位置(至少 $K_{\min}$ 个),用直通估计器(straight-through estimator)反传梯度,得到选中位置集与聚合表示 $\bar H^{(l)}_t = \Pi^{(l)}_t \tilde H^{(l)}_t \in \mathbb{R}^{L'_t \times d}$;(4) 投影 $\tilde K^{(l)}_t = \bar H^{(l)}_t \tilde W^{(l)}_K, \tilde V^{(l)}_t = \bar H^{(l)}_t \tilde W^{(l)}_V$;(5) 用 GDU/线性更新 $M^{(l)}_{t+1} = \lambda M^{(l)}_t + \frac{1-\lambda}{L'_t\sqrt{d_k}}\tilde K^{(l)\top}_t \tilde V^{(l)}_t$,同步更新 $S^{(l)}_{t+1}$。**利用阶段**:当前步前向中计算 $\tilde Q^{(l)}_t = \tilde H^{(l)}_t \tilde W^{(l)}_Q$ 与记忆注意力 $\tilde A^{(l)}_t = \text{diag}(\tilde Q^{(l)}_t S^{(l)}_t)^{-1}\tilde Q^{(l)}_t M^{(l)}_t$,再与原注意力按 $\gamma$ 融合。**训练阶段**:冻结骨干,仅训练记忆参数;用任务加权采样器 $\pi_\tau(e) = w_\tau(e)/\sum_{\tau'} w_{\tau'}(e)$(线性退火 $w_\tau(e) = w^s_\tau + (w^e_\tau - w^s_\tau)\min(e/(E-1),1)$)做课程式退火,对重建 $D_{\text{rec}}$、操作 $D^{e/i}_{op}, D^d_{op}$、正则 $D_{mf}, D_{mp}$ 五个子集施加单步负对数似然监督。层级延迟满足 $T^{(l)}_{\text{parallel}} = \max(T^{(l)}_{\text{orig}}, T^{(l)}_{\text{util}}, T^{(l)}_{\text{store}}) + T^{(l)}_{\text{fuse}}$,三支可并行。
技术新颖性
技术新颖性体现在四个层面。**架构上**,首次把 FWP 思想与全注意力骨干结合用于多步交互记忆,提出 Metis block 这种'局部记忆块存状态、超记忆块造过程'的双块结构,记忆注意力作为残差叠加而非替换全注意力,与 TTT 用循环层替换注意力的路线根本不同。**目标上**,设计记忆重建(无损压缩上界)、记忆操作(有损压缩按指令)、正则(抗干扰、抗污染)三类目标,对应五个数据子集,且只用单一似然形式而非多损失加权,靠采样概率 $\pi_\tau(e)$ 实现课程退火,从存储导向数据逐步迁移到长程与正则数据。**数据上**,从 27 个公开基准合成 357,137 条主数据(约 4.06 亿 token,覆盖 remember/forget/update/reflect 四类操作 × 显式/隐式/干扰三风格)和 609,443 条辅数据(多实体绑定、选择性遗忘、记忆后对话、记忆无关对话),全部锚定可验证源事实,经一致性/正交性/捷径三重校验。**理论上**,给出虚拟前缀视角的等价推导和一阶泰勒展开的误差分解,证明记忆查询投影能把无关步误差压在低相似度区间,为 $\tilde W^{(l)}_Q$ 的设计提供了理论依据。
实验结果
**记忆操作任务(Table 5)**:No Context 下,Metis-27B 在 MemOps (Gold) 平均 24.76,远超 Temp-LoRA-27B(9.70)和 δ-Mem(4.38);在 Metis Test Set 平均 73.77,而 Temp-LoRA-27B 仅 23.86、δ-Mem 仅 15.03,提升超过 40 个点。reflect 在 Metis Test Set 上达 93.44,forget 在该测试集达 77.50,但 forget 在 MemOps (Gold) 仍最难(27B 仅 10.91),说明在共享隐状态中抹除信息比存/改更难泛化。**记忆问答任务(Table 6)**:No Context 下 Metis-27B 在 LoCoMo (Gold) 平均 26.74,是 δ-Mem(10.79)的约 2.5 倍;在 NextMem 各子集大幅领先,如 LongMemEval 39.71 vs δ-Mem 9.79、HotpotQA 66.54 vs Temp-LoRA-27B 51.46,多跳和时序问答提升尤其明显(27B 时序 13.83 vs δ-Mem 3.28)。4B→9B 提升温和,9B→27B 才出现大幅跃升,提示骨干扩容越过容量门槛后原生记忆能力才显著增强。**OOD(Table 8)**:ATM-Bench 上 Metis-27B 平均 18.56,显著高于 Temp-LoRA-27B(2.57)和 δ-Mem(2.27),连确定性评分的 number 题也领先,说明提升不是 LLM-judge 的伪象;MemDaily 上 Metis-27B 平均 59.04,与 Temp-LoRA-27B(59.45)持平,结果较混合。**消融(Table 7)**:去掉自适应聚合(w/o SA)整体掉 60.98%,去掉 query-key 归一化掉 28.44%,去掉整个辅数据掉 19.31%,去掉可优化查询掉 12.23%。**容量(Figure 3)**:步级输入超几百词后各位置准确率都变低;轨迹级首条事实准确率随步数近连续下降。**低秩(Figure 4/Table 10)**:rank=64 整体恢复 99.9%,rank=1 仅 43.5%。**通用能力(Table 9)**:初始阶段 Gap 仅 −0.8~+0.55,激活阶段 IFEval 掉 22.18 个点。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MemOps (Gold) 记忆操作平均 | LLM-judge 准确率(%) | Metis-27B: 24.76 | δ-Mem: 4.38 / Temp-LoRA-27B: 9.70 | 较 δ-Mem +20.38,较 Temp-LoRA-27B +15.06 |
| Metis Test Set 记忆操作平均 | LLM-judge 准确率(%) | Metis-27B: 73.77 | Temp-LoRA-27B: 23.86 / δ-Mem: 15.03 | 较 Temp-LoRA-27B +49.91,较 δ-Mem +58.74 |
| LoCoMo (Gold) 记忆问答平均 | LLM-judge 准确率(%) | Metis-27B: 26.74 | δ-Mem: 10.79 / Temp-LoRA-27B: 4.24 | 较 δ-Mem +15.95 |
| NextMem 上下文生成平均(SQuAD/HotpotQA/LongMemEval/LoCoMo) | LLM-judge 准确率(%) | Metis-27B: 50.82 | Temp-LoRA-27B: 30.97 / δ-Mem: 20.42 | 较 Temp-LoRA-27B +19.85 |
| ATM-Bench (Gold) OOD 平均 | Jaccard/EM/LLM-judge 综合准确率(%) | Metis-27B: 18.56 | Temp-LoRA-27B: 2.57 / δ-Mem: 2.27 | 较 Temp-LoRA-27B +15.99 |
| 低秩分解记忆状态(rank=64 vs Full=1024) | 四基准整体恢复率(%) | rank=64 恢复 99.9% | rank=1 仅 43.5% | 用 1/16 秩即可无损,存储大幅压缩 |
局限与改进
作者承认两类核心局限:(1) 长程退化——固定大小参数压缩信息必然有损,Figure 3 显示步级输入变长、轨迹级步数增多时准确率持续下降,首条事实几乎单调衰减,新更新会'干扰整个记忆状态而非只覆盖最旧信息';(2) 信息混淆——隐空间语义混合导致相似事实易混,forget 在 MemOps (Gold) 即便 27B 也只有 10.91,Case Study(Figure 5)中遗忘指令的当步回复仍重复旧事实('Alice likes beef burger')而非确认删除,说明操作步响应与最终记忆状态未完全对齐。我自己另观察到四点:Table 6 中 Metis 在 open-domain LoCoMo 提升有限(27B 仅 28.93),说明对依赖世界知识而非交互记忆的任务帮助不大;Table 9 激活阶段 IFEval 掉 22.18 个点,说明无关记忆会污染严格指令遵循;Partial Context RAG 在 Metis Test Set 上 27B 达 65.40,仍优于 No Context 的部分操作,原生记忆尚未稳定超越检索增强;LoCoMo (Gold) full-context 上限约 63–65,而 Metis-27B 仅 26.74,差距仍大。论文结论也明确:原生记忆目前是外置记忆的互补方向,而非替代。
独立分析的弱点
弱点一:记忆容量受限。固定 $d_k \times d_v$ 矩阵难以承载长交互,Figure 3 轨迹级首条事实持续衰减即证据。改进方向是分层/层级化记忆、或引入可动态扩缩的记忆槽与外置记忆混合(作者结论也提到 hybrid 系统)。弱点二:相似事实混淆与遗忘不彻底,可借鉴知识编辑的 rank-one update(如 ROME)思路做更精确定位擦除,或在记忆注意力中加入显式实体绑定/寻址机制。弱点三:激活态下通用能力受损(IFEval 掉 22.18),应在正则目标中强化'记忆无关对话'权重,或引入门控决定何时读记忆、读哪一层记忆。弱点四:低秩虽能压到 rank=64,但 rank=1 掉到 43.5%,说明存在少数关键奇异方向,可研究按层/按任务自适应秩分配而非全局定秩。弱点五:评估以短程为主,缺真实长会话(数千轮)和与生产级 RAG+重排系统的端到端 latency/显存对比;建议补充多轮对话基准与系统级效率实测。弱点六:记忆状态语义不可解释、难调试,可探索记忆注意力可视化与探针分析。
未来方向
作者明确提出三个方向:(1) 提升记忆容量、可控性与可解释性;(2) 探索原生记忆与外置记忆的混合系统;(3) 把原生记忆训练扩展到更广领域和更长交互。基于本成果还可延伸:把 $\theta_1$ 作为可初始化的'领域基线记忆'(论文 2.5 节已暗示 $\theta_1$ 可捕获可迁移领域知识),实现开箱即用的领域记忆基座;将原生记忆与 Chain-of-Thought、工具调用结合,做原生记忆智能体;把记忆操作目标从 remember/forget/update/reflect 扩展到归纳、抽象、反思等更高阶操作;研究跨模态(图像、视频)的原生记忆;探索原生记忆与持续学习/lifelong learning 的统一框架,把 $\theta_1$ 视为静态知识到动态记忆的过渡点;利用低秩分解(rank=64 即恢复 99.9%)做在线存储压缩以降低部署成本;以及把记忆注意力做成稀疏/分层以突破容量瓶颈。
复现评估
复现性较好。作者已开源代码(https://github.com/MemTensor/Metis)和模型权重(HuggingFace collection IAAR-Shanghai/Metis)。数据构造流程完整披露:以 27 个公开基准为源,三步流水线(种子抽取→静态合成→质量校验),主数据 357,137 条 / 4.06 亿 token,辅数据 609,443 条,并给出各操作 × 各风格的样本数(Table 2、Table 4)。训练配置详细:基于 Qwen3.5 4B/9B/27B,8×H100,AdamW(lr $2\times10^{-4}$,200 warmup,weight decay 0.01,$\beta=(0.9,0.999)$,grad clip 1.0),BF16,seed 42,每 2000 步存 ckpt;4B 训 14000 步(1 epoch),27B 同样 14000 步(约 0.4 epoch),9B 用 8000 步早停。评估用 gpt-4.1-mini 三次取中位的 LLM-as-judge,提示见附录 F。复现难点:(1) 合成 4.06 亿 token + 60 万条辅数据需大量强模型 API 调用与三重校验,成本与时间不低;(2) 8×H100 训 27B 仍属中重算力;(3) GDU、低秩分解、直通估计器等工程细节需仔细对照附录 C;(4) LLM-judge 的随机性可能影响精确数字复现。整体属'可复现但需显著投入'级别。
论文图表
三栏对比图:Architecture(外置=解耦 vs 原生=耦合)、Optimization(外置=梯度被阻断 vs 原生=端到端梯度)、Efficiency(外置=串行额外时间 vs 原生=并行)。外置一行画出 Input→Reasoning→External Memory 与 Embedding/Matching/Reranking/Summarizing 等阶段;原生一行画出 Transformer 块内同时存在 Original Attention 与 Memory Attention,记忆作为骨干的一部分。
这张图是全文的动机总纲,一眼讲清外置记忆三大缺陷与原生记忆三大优势,是理解后续全部设计的出发点。
左图步级容量:单次更新输入变长时,对首/中/末条事实的查询准确率随输入长度下降,Metis 在几百词后各位置都变低,full-context 基线(尤其首条)仍强。右图轨迹级容量:固定每更新 5 条、步数增多时,首条事实准确率近连续下降,中/末条也波动,说明新更新干扰整个状态。
这张图直观揭示了 Metis 最主要的局限——固定大小参数化记忆的容量上限,是理解 limitations 与未来容量改进方向的关键证据。