把循环状态视为读后写语义下的在线学习器,导出归一化 Falcon 更新族,提升长度外推
Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang,...
2026-08-31
序列建模
快速权重
持续学习
状态空间模型
线性注意力
RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang
2026-08-17
RLVR
大语言模型
强化学习
持续学习
指令跟随
冻结底座叠加LoRA专家、递归自我改进闭环,让智能体部署后持续学习
Mind Lab, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen,...
2026-08-11
Mixture-of-LoRA
持续学习
智能体后训练
模型系统
生成式UI
用源自土壤微生物网络的图韧性指数作正则项,显著缓解 LLM 微调的灾难性遗忘
Alberto Acedo
2026-08-11
LoRA微调
图正则化
持续学习
灾难性遗忘
生态学启发
用When/Where/How三轴框架重定义大模型时代的持续学习
Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan...
2026-08-07
大语言模型
持续学习
智能体
测试时训练
灾难性遗忘
提出评估智能体在长任务流中持续学习与技能演化的动态基准
Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi...
2026-08-05
LLM Agent
上下文学习
基准评测
持续学习
智能体技能学习
统一流式评估框架揭示自演化智能体收益受场景、模型与方法的共同制约。
Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan
2026-08-04
Agent
LLM智能体
基准评测
持续学习
流式评估
首次将多教师在线策略蒸馏用于跨平台GUI智能体持续学习,解决行为模式混合和灾难性遗忘问题
Niu Lian, Alan Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu,...
2026-07-07
GUI智能体
在线策略蒸馏
多平台学习
持续学习
跨平台交互
SDPO在专业化任务上表现强劲但持续学习中易遗忘
Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen...
2026-07-03
LLM后训练
强化学习
持续学习
知识保持
自蒸馏
持续学习系统,自动编写机器人程序并积累可重用技能库
Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen...
2026-07-02
代码即策略
技能库
持续学习
机器人学习
进化搜索
提出AGENTODYSSEY评估框架,通过程序化生成文本游戏测试代理五大关键能力
Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel...
2026-06-29
代理评估
持续学习
文本游戏
程序化生成
长程规划
用数据集蒸馏创建紧凑源锚点,提升持续测试时适应的稳定性
Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon, Kuk-Jin Yoon
2026-06-25
域适应
持续学习
数据集蒸馏
测试时适应
灾难性遗忘
揭示多迭代经验学习中能力崩溃问题,提出原理级经验、逐步注入和off-policy蒸馏的稳定内化方案
Jingwen Chen, Wenkai Yang, Shengda Fan, Wenbo Nie, Chenxing Sun, Shaodong...
2026-06-05
上下文蒸馏
持续学习
智能体进化
经验内化
提出受人类睡眠启发的范式,让LLM通过知识蒸馏与做梦实现持续学习与自我改进。
Ali Behrouz, Farnoosh Hashemi, Vahab Mirrokni
2026-06-03
大语言模型
持续学习
知识蒸馏
自我改进
记忆巩固
用进化损失+适配损失的分解框架,结合多智能体进化、分支树路由与人机介入,实现开放式任务流上的持续自改进线束部署。
Zewen Liu, Zhan Shi, Yisi Sang, Bing He, Minhua Lin, Tianxin Wei, Dakuo...
2026-06-03
LLM智能体
人机协作
持续学习
测试时适配
自动线束进化
提出受控任务流与可塑性/稳定性/泛化三类增益指标,严格评估智能体的持续学习。
Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang...
2026-06-03
可塑性-稳定性权衡
基准评测
持续学习
语言智能体
非参数记忆
将外部记忆转化为参数化技能的具身智能体记忆框架
Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su
2026-05-28
LoRA
Minecraft
具身智能体
持续学习
记忆巩固
按时间顺序预训练的LLM比打乱训练更具时效性知识
Pilchen Hippolyte, Fabre Romain, Signe Talla Franck, Perez Patrick, Grave Edouard
2026-05-27
持续学习
数据课程
时序学习
知识时效性
预训练
180任务×10模型基准,揭示智能体难以把单次经验沉淀为可复用过程技能。
Yingtie Lei, Zhongwei Wan, Jiankun Zhang, Samiul Alam, Zixuan Zhong, Peizhou...
2026-05-26
Agent Skills
LLM智能体
基准评测
技能学习
持续学习
用正交梯度投影剔除安全更新中干扰通用能力的分量,缓解对齐税。
Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong
2026-05-21
DPO
LLM后训练
安全对齐
对齐税
持续学习