通过轨迹级奖励塑形和跨任务优势归一化,有效缓解RFT方法在视觉持续学习中的灾难性遗忘问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
学习,快与慢:迈向持续自适应的语言模型
👍 18提出Fast-Slow Training框架,将慢权重RL与快权重提示词优化协同演化
用 Wasserstein 距离衡量任务几何冲突,既解释又控制 LLM 持续后训练遗忘
提出BR-MoE双层路由MoE机制,把PTM-based类增量学习首次扩展到300+非重叠任务。
提出存储-反思-经验三阶段演化框架,统一LLM智能体记忆机制的研究视角。
用上三角几何约束让多个领域适配器可堆叠成准阿贝尔群,O(1)推理并缓解灾难性遗忘。
让步数蒸馏扩散模型持续学习新概念而保持少步推理能力
为什么微调会诱发幻觉以及如何修复
👍 25把 SFT 幻觉重新解读为事实遗忘,并给出参数冻结与自蒸馏两类缓解方案。
语义聚类指导的分布感知采样,DoRA+持续学习缓解跨语言负迁移
首个评估智能体技能持续学习的基准,含20个真实任务和三级评估框架
用LLM自身调用日志训练轻量替代模型,按一致性门槛自动路由降本。
用OT理论在线学多中心GMM,缓解OCIL中数据多模态与灾难遗忘问题
冻结 MoE-LoRA 栈 + 零空间投影 + 经验路由,发现适配器实际编码可迁移的认知原语。
通过token级路由漂移分析与漂移感知的动态MoE扩展,解决VLM持续学习中的灾难性遗忘
通过对比反思历史提交积累仓库特定技能,生成符合项目风格的代码
通过联合优化实例和结构抽象来减少灾难性遗忘,提高关系泛化能力
通过全局训练上下文和代码式精准编辑,让LLM代理在研究编程任务中持续自适应学习
通过读写反思学习,让LLM智能体自主构建、优化和复用技能库,实现无需参数更新的持续学习
持续元学习框架,让LLM智能体通过技能注入和空闲期RL实现零停机进化
语言模型的在线经验学习
👍 60提出OEL框架,让语言模型从部署经验中持续自我改进