找到 55 条结果

把循环状态视为读后写语义下的在线学习器,导出归一化 Falcon 更新族,提升长度外推

Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang,... 2026-08-31
序列建模 快速权重 持续学习 状态空间模型 线性注意力

RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang 2026-08-17
RLVR 大语言模型 强化学习 持续学习 指令跟随

揭示多迭代经验学习中能力崩溃问题,提出原理级经验、逐步注入和off-policy蒸馏的稳定内化方案

Jingwen Chen, Wenkai Yang, Shengda Fan, Wenbo Nie, Chenxing Sun, Shaodong... 2026-06-05
上下文蒸馏 持续学习 智能体进化 经验内化

提出受控任务流与可塑性/稳定性/泛化三类增益指标,严格评估智能体的持续学习。

Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang... 2026-06-03
可塑性-稳定性权衡 基准评测 持续学习 语言智能体 非参数记忆