提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。
Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang,...
2026-08-03
GRPO
RLVR
强化学习
熵坍塌
知识蒸馏
通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。
Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang,...
2026-07-31
上下文蒸馏
医学问答
反向KL分解
在线策略蒸馏
大语言模型
把在线自蒸馏视为β=1的KL正则化策略优化特例,借logit插值与回报到当前信贷分配改进推理
Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang
2026-07-31
RLHF
强化学习
推理大模型
知识蒸馏
策略优化
自适应多教师蒸馏框架,用单类SVM加权与关系相似矩阵损失压缩语音情感模型到边缘设备
Yuqi Li, Yi-Cheng Lin, Xianglong Wang, Kuo Yang, Xiaoqin Feng, Yixuan Wang,...
2026-07-31
多教师学习
情感计算
知识蒸馏
自监督学习
语音情感识别
把游戏求解器的状态价值变化转成逐回合信用信号,注入 RLVR 实现无需 logits 的策略蒸馏
Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi...
2026-07-30
GRPO
LLM 智能体
RLVR
信用分配
强化学习
用无源程序合成轨迹蒸馏27B模型,逼近前沿大模型的编程能力
Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang,...
2026-07-30
代码合成
小语言模型
无源逆向工程
知识蒸馏
训练数据生成
统一在线蒸馏框架修复三大失效模式,0.5B学生达GSM8K 69.8%
Satyam Kumar, Saurabh Jha
2026-07-30
在线策略蒸馏
大模型推理
小模型高效训练
强化学习
知识蒸馏
在学生推理出错处让老师短暂接管再交还,修复在线策略蒸馏的前缀失败
Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu,...
2026-07-29
在线策略蒸馏
大模型训练
推测解码
推理
知识蒸馏
用结构化JSON协议蒸馏专有模型推理能力,提升开源模型智能体搜索
Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu,...
2026-07-28
多智能体系统
强化学习
智能体搜索
检索增强生成
知识蒸馏
面向端侧部署的低延迟异构视觉编码器,配合两阶段生成式预训练实现SOTA。
Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis,...
2026-07-28
大视觉语言模型
异构ViT架构
生成式预训练
知识蒸馏
移动NPU
多语言RAG中兼顾语义相关性与语言一致性的重排序器
Seongtae Hong, Youngjoon Jang, Jungseob Lee, Seungyoon Lee, Heuiseok Lim
2026-07-27
多语言检索
检索增强生成
知识蒸馏
语言一致性
跨语言对齐
用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu
2026-07-24
多模态后训练
对比学习
知识蒸馏
自蒸馏
视觉语言模型
把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。
Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi
2026-07-24
上下文学习
强化学习
智能体学习
样本效率
知识蒸馏
复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。
Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei
2026-07-24
多轮交互
强化学习
智能体
模型压缩
知识蒸馏
用锚定与对齐两个损失,让VLA微调在零额外数据下同时保住语义理解与动作精度
Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex...
2026-07-23
机器人操作
灾难性遗忘
知识蒸馏
行为克隆微调
视觉-语言-动作模型
仅凭API规格,用LLM模拟环境生成训练API调用智能体的轨迹数据
Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu,...
2026-07-21
API调用智能体
LLM世界模型
合成数据生成
监督微调
知识蒸馏
把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。
Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei
2026-07-21
后训练
大语言模型
强化学习
指令遵循
知识蒸馏
将教师监督直接融入强化学习目标,通过反向重要性采样实现选择性知识迁移
Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
2026-07-21
GRPO
大语言模型后训练
强化学习
知识蒸馏
策略优化
发现多教师蒸馏会把工具调用边界推向过度调用,提出 Soft Clamp 局部校准方案
Jiabin Shen, Guang Chen, Chengjun Mao
2026-07-21
在线策略蒸馏
大模型智能体
工具调用
知识蒸馏
行为校准
用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。
Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
2026-07-20
后训练
在线策略蒸馏
大语言模型推理
奖励设计
强化学习替代