FiRe-OPD 用轨迹级硬过滤加 token 级软加权协同优化在线蒸馏粒度。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
语言模型需要睡眠:学习自我修改与巩固记忆
👍 29提出受人类睡眠启发的范式,让LLM通过知识蒸馏与做梦实现持续学习与自我改进。
AbaqusAgent用六个智能体+RAG把自然语言转成端到端有限元仿真。
提出Draft-OPD,通过错误位置重放机制在验证时错误上训练draft模型,实现5倍以上无损加速
ESPO: 提前停止近端策略优化
👍 20ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能
基于信任区域的行为融合用于策略蒸馏
👍 69通过KL信任区域引导早期rollout行为,提升策略蒸馏效果
首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进
提出token可教性概念,在线策略蒸馏中仅用5%监督token即可超越全量监督
构建首个AI科学家提案方法论合理性评估基准,揭示LLM存在系统乐观偏差
将dLLMs的RL转化为去噪器自蒸馏,避免ELBO似然度替代的TIM偏差
首个能同时有效遗忘和保留因果知识的三阶段 LoRA 遗忘框架
揭示了LoRA参数化记忆遵循幂律容量定律,p>0.5为确定性回忆阈值,提出MemFT优化方法提升记忆效率
研究云端大模型与边缘小模型协作的混合架构,揭示任务依赖的优化策略
通过学习探测KV协方差的探针向量,将局部线性注意力可扩展地应用于大模型预训练
用于多模态智能体推理的智能体探索策略优化
👍 93通过工具调用重采样解决思考-行动差距,提升智能体推理能力
基于双向进化搜索的自改进语言模型
👍 61提出双向进化搜索框架,通过进化算子和目标分解突破现有搜索方法的限制,在自改进和推理中显著提升性能。
使用弱模型的错误轨迹作为训练信号,让强模型学会自我纠错
长存平衡:信息瓶颈驱动的基于树策略优化
👍 23用信息瓶颈理论量化探索-利用平衡,通过IBTree提升在线强化学习效率和稳定性。
揭示搜索代理依赖内在知识的IKD问题,提出LiveBrowseComp基准测试真实搜索能力
少即是多:在线策略蒸馏的早停展开
👍 15限制蒸馏 rollout 到前 N 个 token,解决 OPD 的离策略教师衰减问题