提出直接优化接受率的LK损失函数,在6个目标模型上提升8-10%的平均接受长度
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿
混合Top-k/Top-p掩码+速度蒸馏,实现95%稀疏率且不损质量
通过结合模型蒸馏和任务特定对比损失训练紧凑高性能嵌入模型
利用VLM视觉接口实现异构多智能体间无文本潜空间通信
通过训练时区域蒸馏取代推理时工具缩放,实现单次前向传播的细粒度视觉感知。
超越教师:基于奖励外推的泛化在线策略蒸馏
👍 68通过奖励外推实现超越教师的在线策略蒸馏框架
通过自我蒸馏的元经验增强LLM强化学习的元学习框架
弱驱动学习:如何让弱智能体使强智能体更强
👍 290复用训练中弱模型作为纠正信号,通过混合logit训练持续增强强模型
将多教师LLM的知识通过五种净化方法整合为单一推理链,缓解冲突并提升蒸馏效果
用长上下文教师指导长上下文学生,解决视频生成遗忘-漂移困境
将注意力分布视为策略,用RL优化注意力分配以提升多模态LLM视觉推理能力
面向语言模型的特权信息蒸馏
👍 28利用训练时特权信息蒸馏前沿模型,无需Chain-of-Thought
基于信息量与效用增强的数据集蒸馏方法
👍 21用Shapley值和梯度范数理论指导数据集蒸馏,在ImageNet-1K上提升6.1%
利用小型预训练模型的晚期表示来引导大型模型的早期训练,实现1.6倍加速并提升5%性能
将多智能体辩论的推理能力蒸馏到单个LLM,提升推理效率
提出学生熵引导的多轴选择性知识蒸馏方法SE-KD3X,在保持性能的同时大幅降低计算开销
OVD:在策略语言蒸馏
👍 6用离散语言分数替代token级概率匹配,实现内存高效的推理能力蒸馏
语言模型知识蒸馏中的记忆动态研究
👍 4知识蒸馏可将训练数据记忆减少50%以上,同时提升模型泛化能力
用轻量级神经网络探索环境,再蒸馏到LLM并用RL激活,大幅提升非语言任务性能