← 返回 2026-08-07

持续学习的范式转变:大模型与智能体时代的三维分类综述 Continual Learning in Transition

Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua 📅 2026-08-06 👍 21 2026-08-11 18:30
大语言模型 持续学习 智能体 测试时训练 灾难性遗忘 综述

用When/Where/How三轴框架重定义大模型时代的持续学习

前置知识

灾难性遗忘(Catastrophic Forgetting)

神经网络在新任务上更新参数时,会破坏此前任务学到的表征与决策边界,导致旧任务性能急剧下降。它源于参数共享导致新旧任务梯度相互干扰,是持续学习要解决的核心障碍,通常与稳定性-可塑性权衡一起讨论。

整篇综述围绕如何对抗遗忘展开,读懂这一点才能理解经典四类方法(回放、梯度约束、架构隔离、正则化)以及作者为何把遗忘重新表述为多载体问题。

在策略学习 vs 离策略学习(On-policy / Off-policy)

离策略学习用与当前策略解耦的外部数据(历史回放、静态语料、蒸馏目标)训练;在策略学习则用当前被更新的策略自己生成、在奖励信号条件下的rollout来训练,如RLHF与RLVR。两者关键差异在于训练分布与当前策略的KL散度大小。

本文核心洞察之一是on-policy与持续学习结构性对齐——它隐式偏好KL最小的新任务解,因而天然抗遗忘,这是How轴扩展的关键论据。

测试时训练/适应(TTT/TTA)

在推理阶段通过可写状态或参数更新,把推理过程中获得的信息(新样本、反馈、自生成监督)持久化回系统,使早期输入能影响后续行为。区别于自一致性、搜索等推理后即丢弃的计算。

它是When轴从训练阶段延伸到推理阶段的代表,TTT-LM、TTRL等方法把持续学习推到部署之后,是理解三轴扩展必不可少的概念。

智能体外挂层(Harness)

智能体系统中位于核心模型之外、由系统设计者显式构造与编辑的对象集合,分三类:记忆(跨推理调用可读写的存储)、技能(模型主动调用的可执行单元如工具/子智能体)、协议(控制模型与环境交互的规则与格式如系统提示/规则文件)。三者都可不改骨干权重地扩展。

Where轴的核心就是把能力载体从参数迁移到外挂层,理解记忆/技能/协议三类载体是读懂整篇分类框架的基础。

模型合并与零阶优化(Model Merging / Zeroth-order)

模型合并在已训练权重空间直接组合能力(如Task Arithmetic把任务向量定义为微调权重与基线权重之差再算术组合);零阶优化仅用前向传递估计下降方向而不反向传播(如MeZO、ZeroFlow),属于How轴上'超越梯度'的机制。

它们是How轴免梯度端的代表,ZeroFlow的隐式平滑抗遗忘特性是本文支撑'免梯度也可持续学习'论断的关键证据。

研究动机

经典持续学习(CL)长期以灾难性遗忘和稳定性-可塑性权衡为核心,方法被归为四类:回放法(保留样本缓冲或特征回放)、梯度法(如GEM、OGD、C-Flat系列,将更新投影到不干扰旧任务的方向)、架构法(如PackNet、HAT,通过剪枝或硬注意力掩码分配任务专属子空间)、正则化法(如EWC用Fisher信息、SI、MAS,或LwF用功能蒸馏)。这些方法共享三个隐含假设:能力在部署前的专门训练阶段获取、能力由模型参数承载、更新通过离策略梯度优化实现。然而LLM与智能体AI兴起后三大假设同时被动摇:在策略学习(RLHF/RLVR)显示更小遗忘,测试时训练把学习推到推理阶段,而记忆库、技能库、交互协议等外挂组件把能力扩展到参数空间之外。经典参数中心分类法已无法容纳这些新方向,需要重新审视CL的范畴。

本文的目标是本文旨在为LLM与智能体时代的持续学习建立统一描述框架,具体目标有三:第一,将持续学习从'序列参数学习'重新表述为'能力持续演化',并通过When(学习时机)、Where(能力载体)、How(更新机制)三个互补问题刻画这一过程;第二,系统梳理通常不被放在一起讨论的代表性方法——持续预训练、多阶段后训练、测试时训练、在策略对齐、模型合并、记忆系统、技能库、提示演化——并把每个方法定位到统一的(When,Where,How)联合空间,让原本隐含的关系显性化;第三,把该空间作为整体阅读,识别方法密集区与稀疏/空白区,把空白区转化为持续学习在自演化智能体系统中的具体挑战与机遇。

与已有工作不同的是,现有LLM持续学习综述大多沿袭经典参数中心分类,把新方法塞进回放/正则化等旧框架。本文独特之处是把智能体外挂层(记忆、技能、协议)与推理时机制、免梯度机制纳入同一分析框架,而非仅扩展参数层分类。关键洞察是:经典CL其实是三维空间中的一个特定点(后训练时机+参数载体+离策略梯度更新),而LLM时代方法沿各轴独立扩展。这种重新定位让方法间的隐含关系显性化,例如Reflexion同时涉及推理时演化、外挂记忆载体与免梯度学习,而SKILL0展现了'技能→参数'的载体迁移轨迹——这些都是单一维度分类无法揭示的,也是本文相较已有综述的根本差异。

核心方法

方法思路分两步。直觉上:与其问'如何防止参数遗忘',不如问'能力在何时演化、由什么承载、以何种机制更新'。技术路线上,作者先'重访'经典CL,显式提取其三个隐含假设(训练阶段获取、参数承载、梯度更新),再把每个假设翻转成一个问题——何时、何地、如何。经典设定对应这三个问题的一组固定答案(后训练+参数+离策略梯度),即为三维坐标系中的参考原点。随后逐一展开三轴:When横跨预训练/后训练/推理时三个生命周期阶段;Where从参数延伸到记忆、技能、协议等外挂层;How从离策略梯度扩展到在策略学习,再到超越梯度的模型合并、零阶优化与启发式学习。三轴是互补分析视角而非互斥类别,一个方法可同时拥有多个标签形成When-Where-How画像,且画像可随时间变化。最终把方法放回联合空间,读出密集与稀疏区域并据此诊断未来挑战。

核心创新是When-Where-How三轴分类法及其'参考点'设定。本质区别在于:经典分类按技术族(回放/正则化等)划分且彼此互斥,而本文按三个互补分析视角刻画,一个方法可同时拥有多标签,表征还可随时间变化。最具洞察力的论断是'在策略学习与持续学习的结构性对齐':Shenfeld等证明遗忘程度取决于新旧策略间的KL散度 $D_{KL}(\pi_{\text{new}} \| \pi_{\text{ref}})$,在策略RL隐式偏好KL最小的新任务解,因而天然抗遗忘;而离策略SFT可收敛到任意远离参考模型的分布。这让on-policy不只是'又一种机制',而是与CL核心关切结构对齐的机制。此外把SKILL0刻画为Where轴上'Harness(Skills)→Parameters'的轨迹而非固定点,也突破了静态笛卡尔网格的限制。

方法步骤详情

步骤为:第一步,重访经典CL形式化——任务流 $T_1, \ldots, T_K$,每任务分布 $D_k := p(X_k, Y_k)$,理想目标是拟合当前任务同时使历史任务的聚合期望损失 $\sum_i \mathbb{E}[\mathcal{L}_i]$ 较低,并梳理回放/梯度/架构/正则化四类方法。第二步,把三个隐含假设翻转为When/Where/How三问题。第三步沿When轴展开:持续预训练(Ibrahim等的学习率重热+小回放缓冲在405M和10B模型上接近零退化)、多阶段后训练(Luo等量化1B–7B持续微调遗忘随规模加剧;TRACE揭示顺序训练侵蚀通用能力与安全对齐;Zheng等指出部分为可恢复'伪遗忘',冻结底层可基本防止)、推理时适应。第四步沿Where轴:参数载体(O-LoRA等)与外挂层记忆/技能/协议(MemoryLLM、MemoryBank、Voyager、Promptbreeder)。第五步沿How轴:离策略SDFT、在策略RL、超越梯度(Task Arithmetic、ZeroFlow零阶优化)。第六步把方法放回联合空间,给出跨维度画像与稠密-稀疏诊断。

技术新颖性

技术新颖性体现在三方面。其一,统一性:首次把外挂层、推理时、免梯度三类原本分属不同社区的机制纳入同一(When,Where,How)坐标,让Reflexion(推理时+记忆+免梯度)、TTRL(推理时+在策略+参数)、AgentEvolver(参数+经验记忆+在策略RL)这类跨轴方法的隐含关系显性化。其二,动态画像:方法表征可随时间迁移,SKILL0先在外挂技能库上累积能力再通过课程内化到参数,被刻画为Where轴上'Harness(Skills)→Parameters'的轨迹而非固定点,超越了静态笛卡尔网格。其三,稠密-稀疏诊断:把联合空间作为整体阅读,识别出后训练+参数+离策略的经典设定是稠密区,而协议载体、参数与外挂的协调演化、多载体遗忘定位是稀疏/空白区,直接转化为未来挑战。作者明确声明图中方法分布不作统计密度估计,空白区也不代表相关工作不存在,体现了方法论上的审慎。

Overview of the three-dimensional view of continual learning developed in this survey.
Figure 1: Overview of the three-dimensional view of continual learning developed in this survey.
Representative LLM-era and agentic-AI-era continual-learning methods organized along the three dimensions.
Figure 3: Representative LLM-era and agentic-AI-era continual-learning methods organized along the three dimensions.
The When dimension.
Figure 4: The When dimension.
The Where dimension.
Figure 5: The Where dimension.
The How dimension.
Figure 6: The How dimension.

实验结果

作为综述,核心发现是组织性的。第一,经典CL可被严格定位为三维空间单点(后训练+参数+离策略梯度),LLM时代方法沿各轴独立扩展,越来越多地在多轴同时偏离原点、向空间内部迁移。第二,能力载体呈三层层级:最内层参数(更新成本最高需反向传播与对齐数据,但召回最稳定、真正内化)、中层外部记忆(写入成本低、可解释性高,但须经检索且受检索带宽约束)、最外层上下文窗口(单次推理最快但最易失,有硬长度上限与软注意力稀释两个天花板);随能力向外迁移,写入成本与可解释性上升,召回稳定性与容量天花板同步下降,三者是按时间尺度分工的层级而非可互相替代。第三,遗忘呈多面性:参数层灾难性遗忘、记忆层检索衰减与条目老化、上下文层窗口溢出与注意力稀释、技能/协议层因上下文漂移的能力错配,四者时间尺度、可观测性、可逆性各异,难用单一度量描述。第四,on-policy与CL结构性对齐,ZeroFlow零阶优化的隐式平滑抗遗忘可匹敌甚至超过一阶微调。第五,前沿模型的持续学习是通往AGI的第一优先,领域专用CL则非优先。

The three dimensions of continual learning with representative methods.
Figure 2: The three dimensions of continual learning with representative methods.
查看结构化数据
任务指标本文基线提升
对齐LLM的持续后训练遗忘 通用能力/推理/阅读理解/指令遵循/安全对齐的退化程度 综述引用证据:Luo等量化1B–7B范围持续指令微调使领域知识、推理、阅读理解退化且随规模加剧;TRACE基准显示顺序训练侵蚀通用能力与安全对齐;Zheng等指出部分为可恢复的'伪遗忘',冻结底层可基本防止 微调前的基线能力 冻结底层基本消除伪遗忘(综述综合引用证据,非本文新实验)
LLM持续预训练抗退化 吸收新语料后原始分布的性能退化 综述引用证据:Ibrahim等提出学习率重热+小回放缓冲的可扩展方案,在405M与10B模型上吸收新语料同时原始分布退化接近可忽略 无回放缓冲/常规重热方案 退化接近0(综述综合引用证据,非本文新实验)
免梯度持续学习抗遗忘 遗忘基准上的保持性能 综述引用证据:ZeroFlow表明仅用前向传递的零阶优化在遗忘基准上匹配或超过一阶微调,其隐式平滑提供与on-policy小KL行为类似的内在稳定性 一阶梯度微调 零阶优化 ≥ 一阶微调(综述综合引用证据,非本文新实验)
在策略 vs 离策略的遗忘 相对参考模型的KL散度与遗忘程度 综述引用证据:Shenfeld等证明遗忘取决于新旧策略KL散度,on-policy RL隐式偏好KL最小的新任务解,离策略SFT可收敛到任意远离参考模型的分布 离策略监督微调(SFT) on-policy结构性抗遗忘(综述综合引用证据,非本文新实验)

局限与改进

作者明确承认三点局限:其一,三轴分类在边界处存在交叉,跨轴方法按3.1节的主轴约定归类,其他分类同样合理;其二,LLM持续学习迭代极快,覆盖仅限投稿截止前公开工作,可能滞后于最新arXiv预印本;其三,外挂层与跨轴方法的评测本身也在快速变化,4.4节对评测缺口的总结较粗略,具体协议留待未来。笔者补充观察:本文是立场/综述性工作,未提出新方法也未做新实验,分类带有一定主观性;稠密-稀疏分析明确声明不作统计显著性,难以量化;未深入讨论各方法的计算成本与部署可行性的工程权衡;对'协调演化'等核心未来方向停留在概念层面而缺乏可操作的形式化框架;三轴并非严格正交(如推理时TTT-LM同时在参数载体与梯度/零阶机制上有动作),强制主轴归属会损失信息。

独立分析的弱点

独立分析的弱点与改进方向:其一,三轴并非严格正交——推理时(When)的TTT-LM同时在参数载体(Where)与梯度/零阶(How)上有所动作,强制的'主轴'归属会损失信息,改进方向是用软标签或多标签向量表示方法画像并给出定量相似度。其二,稠密/稀疏区域的识别是定性的、基于作者选择的方法清单(作者也声明不作统计估计),改进方向是建立系统的文献枚举协议或基于引用网络的定量密度分析。其三,对外挂层方法缺乏成本-收益的量化讨论(记忆写入/检索延迟、技能库规模膨胀),易让读者高估工程可行性,改进方向是补充计算复杂度与部署成本维度。其四,多载体遗忘的'四面'刻画很吸引人但停留在比喻,缺少统一度量,改进方向是为每层定义可测遗忘指标并建立跨层诊断协议。其五,作为综述未提供可检索的方法数据库或代码工具,限制了分类框架的可复用与可扩展。

未来方向

作者提出五条方向:4.1从更长上下文到持久能力,研究参数/记忆/上下文三层载体的容量、压缩与衰减,以及必要的主动遗忘机制(呼应MemoryBank的艾宾浩斯曲线);4.2论证手工外挂工程在功能上替代、但机制上不构成持续学习,需把工程实践逐步转为系统自身机制,并公平呈现三种立场(CL仍是基础模型时代的必需/CL是通往AGI的主要瓶颈/CL是系统问题而非学习问题);4.3协调记忆、技能、协议与参数的演化,包括双向迁移(SKILL0式技能→参数内化及反向显式化)、跨载体调度(类比计算机缓存-存储层次管理)、多面遗忘定位;4.4以长程智能体为真正测试床,研究误差在数十至数百步中的累积放大及抗漂移机制;4.5在AGI路径上,认为前沿模型的持续学习是第一优先,领域专用CL则非优先。基于成果可延伸:建立载体调度的形式化框架、面向不可验证任务的半可验证/复合奖励机制、以及多载体遗忘的统一评测基准。

复现评估

作为综述/立场论文,本文无可复现的实验,也没有发布代码或数据集。其方法清单(Figure 2/3中的代表性方法及附录Table C.1的跨维度画像)可通过阅读所列参考文献完整重现,工作量主要是文献梳理而非算力。分类框架本身可由其他研究者直接套用到新方法上,可复用性较好。但要严格复现其稠密/稀疏诊断需要一套公开、可枚举的方法数据库,而本文未提供。若读者想验证'on-policy抗遗忘'或'零阶优化抗遗忘'等关键论断,需追踪Shenfeld等的KL散度实验、ZeroFlow的遗忘基准等原始论文,复现需相应规模的LLM微调算力。整体而言,综述本身复现难度低、关键论断的原始实验复现难度中等。