基于目标侧读取器适配的跨模型记忆迁移 Cross-Model Memory Transfer via Target-Side Reader Adaptation
冻结的外部哈希记忆可跨模型复用,成败关键在目标侧读取器的提取与对齐能力
前置知识
Engram 式哈希外部记忆
Engram 在 Transformer-MoE 骨干外挂一张可寻址的静态 n-gram 嵌入表:对输入文本的 n-gram 做确定性哈希 $\phi_{n,k}$ 直接定位表项,检索向量经键值投影和上下文感知门控注入主干隐藏态。它把寻址(读哪些条目)、存储(存什么向量)、读取(如何映射进模型)三个角色显式分离,且查找只依赖文本本身而非模型隐藏状态。
本文全部问题——冻结记忆能否跨模型复用——正建立在这个三分离之上,需要明确哪部分可搬、哪部分必须重训。
参数化与非参数化知识注入
RAG、kNN-LM 等非参数方法把知识放在外部文本或向量库,推理时检索并拼进上下文,更新灵活但付出检索延迟和上下文开销,与生成过程的整合也浅;继续预训练、微调等参数化方法把知识写入权重,推理高效,但知识难以更新、审计和跨模型搬移。
论文动机就是这对取舍,Engram 是介于二者之间的第三条路,理解它才能明白迁移实验到底在检验什么。
困惑度(PPL)
语言建模的标准内在指标,$\mathrm{PPL}=\exp\big(-\frac{1}{T}\sum_{t=1}^{T}\log p(x_t\mid x_{<t})\big)$,衡量模型对测试文本的平均惊讶程度,越低越好。本文用迁移记忆相对无记忆基线的相对 PPL 降幅来量化迁移收益,部分实验给出 95% 置信区间与多种子平均。
RQ1 的九宫格矩阵(1.6%–15.7% 降幅)与 RQ5 的数据效率对比都以 PPL 为主指标,不懂它就读不懂主结果。
残差流注入
Transformer 各层输出沿残差流累加。本文的读取器把检索向量变换为 $o_t$ 后按 $h_t\leftarrow h_t+o_t$ 加进目标某几层的残差流,从而在不改动骨干权重的情况下改变信息流,实现上只需注册前向 hook。注入在哪几层、门控 $\alpha_t$ 如何随上下文取值,是读取器设计的核心自由度。
理解「只训一个小读取器、经 hook 注入残差流」的实现方式,以及为什么双层注入(第 2、10 层)能带来最大单项提升。
分词器差异与文本规范化
不同模型用不同 tokenizer,同一字符串会被切成不同的 token ID;Engram 原版直接哈希 token ID,导致跨模型地址空间不一致。规范化函数 $P$(NFKC 归一化、小写化、去重音、空白清理)把解码后的文本统一为规范词单元再哈希,使不同分词器的模型命中同一表项。
这是迁移可行的第一步——键空间对齐;不理解它就无法理解跨 tokenizer 迁移为何不会把文本路由到无关槽位。
研究动机
大语言模型使用知识有两条主流路线,各有硬伤。非参数化检索(RAG、kNN-LM)把知识放在模型外部、更新方便,但推理时要付出检索延迟,上下文被检索文档撑长,而且检索到的证据与生成过程只是浅层拼接,整合松散。参数化方法(继续预训练、微调、或与单一模型绑定的学习型记忆层)推理时高效,但知识与权重深度纠缠:想更新一条知识要重训模型,想审计模型到底「知道什么」极其困难,更没法把学到的知识搬给另一个骨干。Engram 式哈希记忆看似兼得两者优点——把学习到的信息存进显式、可寻址的外部表,再通过一个小型神经读取器消费,而非把原始文档塞进上下文——但它立刻暴露一个尖锐问题:这张表到底是可复用的知识基底,还是仅仅是与源模型共适应(co-adapted)的专属扩展?如果记忆离开训练它的骨干就失效,那它不过是另一种模型私有参数化,谈不上可复用的知识载体。
本文的目标是本文的目标是给「外部记忆可移植性」一个可操作、可测量的检验,并回答记忆内容与读取接口哪个更关键。具体做法是跨模型冻结记忆抽取:把在源模型 A 上训练好的 Engram 记忆表导出并冻结,挂到架构、分词器、规模都不同的目标模型 B 上,只训练一个轻量的目标侧读取器;若冻结记忆仍能改善目标模型,说明表中包含超越源特定共适应的可用信息,反之则收益只是源骨干的副产物。论文将此拆成六个研究问题(RQ1–RQ6):迁移能否跨骨干、分词器、规模成立;读取器设计有多重要;收益何时兑现到下游 QA;收益是否真的来自答案支持;迁移比从头训练省多少数据;收益由什么机制驱动。量化目标包括在受控协议下让跨模型迁移逼近同模型复用的 QA 水平(最终平均 38.8),并在参数量与数据量上显著优于从头训练。
与已有工作不同的是,已有工作从未把「抽取」当成独立问题。MoE 的有用信号嵌在宿主骨干内部,不构成可外置工件;kNN-LM 的表示困在模型专属隐空间;记忆增强模型要么在推理时检索大型动态库,要么把信息存在模型特定表示里;RAG/RETRO 可搬运的对象是文本数据存储,而非训练好的记忆表示;Lample 式大型记忆层的存储与消费都在同一模型内完成。跨模型对齐研究(Cross-LoRA、LoRA-X、Trans-LoRA 等)迁移的是适配器或低秩更新,没有独立的记忆表可供寻址、冻结与抽取。本文的独特切入是把对齐拆成两段:先用分词器无关的规范化对齐键空间(保证不同模型查到同一表项),再用轻量读取器把检索到的值空间对齐到目标残差流——从而把「记忆是否可移植」改写成「目标模型能否学会读一张固定的表」这一可测量的抽取问题。
核心方法
先给直觉:把记忆表当成一个写好的「知识 U 盘」——盘上内容一字不改,换一台电脑(不同骨干)只需要配一个能读它的「驱动程序」(读取器)。技术路线是在原生 Engram 上做三处改动:(1) 冻结从源模型导出的记忆表 $\{E_{n,j}\}$ 与哈希规范,使其成为不可重写的工件;(2) 用分词器无关的文本规范化取代模型专属的 token-ID 查找,保证跨模型地址一致;(3) 在目标残差流上挂一个轻量读取器负责读取与对齐。整体是两阶段协议:Phase 1 在源语料上用标准 next-token 损失训练源模型 A 的 Engram;Phase 2 同时冻结记忆表和目标骨干,只在目标语料上训练读取器。论文还区分两种部署模式:当提供方的读取器残差接口与消费方兼容时,可零训练「直接工件复用」;否则做轻量的「读取器适配复用」——两种模式下记忆表本身都从不被改写。
核心创新是把记忆可移植性形式化为「冻结工件上的抽取问题」,并发现读取器而非存储内容是一阶决定因素。与已有方法的本质区别有三。其一,寻址、存储、读取三个角色被显式分离:查找只依赖规范化文本 $e_t=\sum_{n=2}^{N}\sum_{j=1}^{K}E_{n,j}[\phi_{n,j}(w_{m(t)-n+1},\ldots,w_{m(t)})]$,与模型隐藏状态无关,因此表可作为外部工件整体搬运;而 token-ID 级寻址的方案一旦换分词器,同样的文本会被路由到无关槽位,后续任何隐空间映射都失去意义。其二,共享值多分支读取器:$R$ 个分支共享同一个值投影 $v_t=W_V^{(B)}e_t$,只在键与门控上分化($\alpha_t^{(r)}=\sigma(\mathrm{RMSNorm}(h_t)^\top\mathrm{RMSNorm}(k_t^{(r)})/\sqrt{d_B}+\beta_{\ell,r})$),新增参数全部用于「怎么读」而非「存什么」。其三,两段式对齐(规范化对齐键空间 + 读取器对齐值空间)不同于把跨模型迁移当作参数或表示插值的 LoRA 系方法。
方法步骤详情
完整流程对应 Algorithm 1。第一步,源侧训练(Phase 1):在语料 $C$ 上以 next-token 损失无监督训练源模型 A 的 Engram,得到表 $\{E_{n,j}\}$,导出并冻结。第二步,寻址标准化:目标输入 $x_{1:T}$ 解码为前缀后,经规范化 $P$(NFKC、小写化、去重音、空白清理)抽取规范词单元,对词级 n-gram 确定性哈希查表得到检索向量 $e_{1:T}$;词内子词复用右边界词上下文,中文、日文等无空格文字改用字符事件哈希。第三步,读取器注入:在选定层 $\ell\in L$ 注册前向 hook,计算 $k_t^{(r)}=W_{K,\ell}^{(r)}e_t$、$v_t=W_{V,\ell}e_t$ 与门控 $\alpha_t^{(r)}$,输出 $o_t=\frac{1}{R}\sum_{r=1}^{R}\alpha_t^{(r)}\cdot v_t$,残差注入 $h_t\leftarrow h_t+o_t$。第四步,Phase 2 训练:冻结骨干与记忆,仅更新读取器参数,目标为 next-token LM 损失。主 3×3 矩阵用单层 $R=1$;最强 QA 配置为第 2、10 层双层注入、$R=4$。
技术新颖性
单项技术都不新——确定性哈希寻址、残差注入、小型门控投影均承自 Engram;新颖性在于把它们组合成一个评测框架并得出反直觉结论。第一,这是首次把「外部学习型记忆的跨模型可移植性」当作可操作评测问题:先移除源骨干,再测目标能否从冻结表中提取信号,从而把「可复用知识基底」与「模型专属共适应」区分开——这在 MoE、kNN-LM、RETRO、记忆层等已有机制中都无法定义。第二,规范化寻址解决了跨分词器地址漂移这一此前方案无法跨模型的根源,使键空间对齐不依赖任何模型内部表示。第三,共享值多分支读取器把参数增量严格限制在提取通路上,配合「随机记忆、置换键、参数匹配 FFN」的消融设计,得以干净地分离存储、寻址与读取三者的贡献,直接支撑「读取器设计是一阶因素」的核心论断:QA 从 34.2 提升到 38.5 的过程完全不动记忆表本身。
实验结果
六个研究问题构成完整证据链。RQ1(3×3 迁移矩阵,源 Pythia-160M/Qwen3.5-0.8B/Qwen3.5-9B,目标 Pythia-410M/Qwen3.5-4B/TinyLlama-1.1B):九格全正,相对 PPL 降幅 1.6%–15.7%,最大在 Qwen3.5-0.8B→TinyLlama-1.1B,且同一份 0.8B 记忆对 2B–9B 目标持续有效。RQ2(Table 1,Mistral-7B-v0.3 五项 QA):基线 32.1,单层冻结读取器仅 33.5、训练后 34.2;双层注入跳至 37.5(NQ 22.2→30.3、TriviaQA 61.2→70.1),四分支 R4 达 38.5,全面超过 RAG、kNN、LoRA 与 MLP Memory。RQ3(Table 2):同模型与跨模型迁移同为 38.5,差距几乎闭合;免训练冻结复用 38.3;预算 10/10→30/30 得分 37.9→38.8(SoTA);Mem-only 崩至 7.0、置换键 33.6、FFN 仅 30.9。下游收益有选择性:RTE +0.7~+3.7、SciQ 最高 +3.7、RACE 近零、TruthfulQA −0.2~−0.8。RQ4(Table 3):4/5 任务金答案对数概率提升(WebQA $\Delta\log p$ 对禁用记忆 +0.197),但答案位置消融近零,收益来自整体事实支持而非答案 token 直接注入。RQ5(Table 4):迁移方仅 1.05M 可训练参数(约从头方的 3%),20M token 饱和于 PPL 21.5。RQ6(Table 5):迁移 38.5 vs 参数匹配 FFN 34.5,且 FFN 的 PPL(7.4)反而最低;随机记忆 PPL 同为 8.7 但 QA 仅 34.6;从头训练最终 38.4,迁移优势是初始化效率而非渐近上限。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨模型语言建模(Wikitext-103,3×3 源-目标迁移矩阵) | 相对困惑度降幅(vs 无记忆基线) | 9/9 全部为正,1.6%–15.7%(最佳:Qwen3.5-0.8B→TinyLlama-1.1B +15.7%) | 无记忆基线;随机初始化同构记忆对照 | 最高 15.7%;随机记忆对照明显更差 |
| 五项 QA 平均(NQ/WebQA/TriviaQA/TruthQA/HotpotQA,Mistral-7B-v0.3) | 平均准确率(%) | 38.8(30/30 token 预算,SoTA);38.5(10/20 预算) | Base 32.1;MLP Memory 36.1;RAG 33.4;kNN 32.6;LoRA 32.3 | 较 Base +20.7%;较最强基线 MLP Memory 高 2.7 点 |
| Pythia-160M→410M 迁移语言建模 | 测试 PPL / 可训练参数 | 21.5(20M token,1.05M 可训练参数,3 种子平均) | 从头训练 21.6(50M token,34.6M 可训练参数) | 约 3% 的可训练参数、约一半数据达到同等水平 |
| 金答案支持度(LLaMA-2-7B→Mistral-7B,WebQA) | Δlogp(长度归一化金答案对数概率差) | 迁移 vs 禁用记忆 +0.197;迁移 vs 随机记忆 +0.147 | 随机记忆推理 / 记忆禁用推理 | 除 TruthfulQA 外 4/5 任务一致为正(TriviaQA 修正别名打分后 +0.072) |
| 下游知识密集任务(Qwen3.5 系列,FineWeb-Edu 适配,5 种子平均) | 准确率变化 Δ(vs 无记忆基线) | RTE +0.7~+3.7(各规模全正);SciQ 最高 +3.7;BoolQ ≥2B 转正 | 无记忆基线 | 事实/证据型任务一致为正;RACE≈0;TruthfulQA −0.2~−0.8(负迁移) |
局限与改进
作者承认的边界很清楚:收益是任务选择性的——TruthfulQA 在所有目标规模上下降 0.2~0.8 点,说明注入额外事实关联会损害对常见误导信息的校准抵抗;RACE 等广义阅读理解几乎无收益;跨模型迁移并不抬高渐近上限,从头训练最终 38.4 与迁移 38.5 基本持平,迁移优势只在数据效率;Pythia 50M 预算下验证 PPL 在约 12M token 后发散,只能早停在 21.5。我的补充观察:其一,主 QA 结果全部在 7B 级目标与英文维基语料上取得,「SoTA(38.8)」是论文自设受控协议内的比较,与社区开放榜单不可直接对齐;其二,词边界寻址依赖空格分词,中文、日文只在附录用字符事件变体验证,覆盖深度有限,且规范化的小写化与去重音会不可逆丢失大小写、重音信息;其三,「直接工件复用」要求读取器残差接口(如隐藏维 $d_B$)兼容,异构模型间并非常态,最亮眼的免训练结论适用面可能窄于行文给人的印象;其四,50M token 后验证 PPL 发散提示 Phase 2 存在过拟合,但论文未深入分析原因。
独立分析的弱点
第一,Phase 2 读取器拟合语料决定收益分布(附录 D 的诊断证实源语料特化与拟合分布都会影响增益大小),实际部署中消费者未必有合适的适配数据流——改进方向是研究跨域鲁棒的读取器初始化,或用元学习让读取器在极少量数据内完成适配。第二,TruthfulQA 一致为负暴露记忆注入会放大高频(常含错误)关联、损害校准——可在门控中加入检索置信度,把读取器训练与事实校准目标(如 DPO)联合,或对记忆表做定向编辑修复误导性槽位。第三,寻址对小写化、去重音的依赖丢弃形态信息,词边界方案对无空格文字支持薄弱——可探索基于统计分词或多语言子词规范化的地址空间,并对大小写敏感任务保留大小写特征通道。第四,多分支读取器需要逐目标训练,「直接复用」又受接口维度限制($d_B$ 不匹配即失效)——可设计接口无关的投影适配层或读取器形状缓存,扩大免训练复用的适用集。第五,随机记忆与迁移记忆 PPL 相同(8.7)但 QA 差 3.9 点,说明困惑度与下游效用严重脱节,以 PPL 为内在主指标的评测容易误导——应把答案支持度($\Delta\log p$)等语义级指标提升为标准内在评测。
未来方向
作者提出的方向:把冻结记忆当作可审计、可版本化的知识资产,研究其更新、组合与分发;界定「直接工件复用」的适用边界,即何种接口兼容即可零训练复用;从附录 C 的表示相似性分析出发,建立迁移成功率的预测理论。基于本文成果可延伸:一是与 RAG 混合,让哈希记忆承担高频事实的低延迟层、文本检索负责长尾知识,兼取两种范式的长处;二是多语言寻址与跨语言记忆共享,检验同一张表能否服务多语种目标模型;三是把多分支读取器纳入 PEFT 工具箱,与 LoRA 等统一成「目标侧适配」框架;四是在 9B 以上规模与指令微调模型上复验结论,并拟合读取器设计(注入层数、分支数 $R$、512 维接口宽度)随规模的最优缩放律;五是研究记忆的选择性遗忘与编辑,对 TruthfulQA 类负迁移做定向修复;六是探索多张异源记忆表的组合读取,让目标同时消费多个提供方的知识资产。
复现评估
复现条件良好。代码开源于 GitHub(OLAResearch/XMemTransfer),模型集合发布在 HuggingFace(hf.co/collections/OLAResearchX/xmemtransfer);数据集全部公开:WikiText-103、Wikipedia-2021、FineWeb-Edu(FW-9B),以及 BoolQ、RTE、SciQ、NQ、WebQA、TriviaQA、TruthfulQA、HotpotQA 等。算力门槛不高:涉及模型最大 9B,主 QA 实验在 Mistral-7B-v0.3 与 LLaMA-2-7B 上进行;Phase 2 只训练约 1.05M 至数百万读取器参数,语料预算 10–50M token,属单机多卡可完成的量级;PPL 实验 3 种子、下游 5 种子平均,统计上较扎实。难点在工程还原:Engram 基座、前向 hook 注入、规范化寻址流水线需精确对齐,附录 C/D 的对照矩阵若全套复现工作量不小。总体评估:中等难度,核心结论(3×3 矩阵、Table 5 消融、Table 4 缩放)可在小算力下先行验证。
论文图表