找到 191 条结果

提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang,... 2026-08-03
GRPO RLVR 强化学习 熵坍塌 知识蒸馏

通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang,... 2026-07-31
上下文蒸馏 医学问答 反向KL分解 在线策略蒸馏 大语言模型

在学生推理出错处让老师短暂接管再交还,修复在线策略蒸馏的前缀失败

Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu,... 2026-07-29
在线策略蒸馏 大模型训练 推测解码 推理 知识蒸馏

用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。

Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu 2026-07-24
多模态后训练 对比学习 知识蒸馏 自蒸馏 视觉语言模型

把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。

Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi 2026-07-24
上下文学习 强化学习 智能体学习 样本效率 知识蒸馏

复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei 2026-07-24
多轮交互 强化学习 智能体 模型压缩 知识蒸馏

用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han 2026-07-20
后训练 在线策略蒸馏 大语言模型推理 奖励设计 强化学习替代