找到 59 条结果

研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解

Semih Kara, Oğuzhan Ersoy 2026-06-10
反馈设计 强化学习 数学推理 自蒸馏 过程监督

把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu 2026-06-04
RLVR 大语言模型推理 强化学习 知识蒸馏 策略优化

提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题

Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty 2026-05-21
代码生成 变分推断 大语言模型 强化学习 科学推理

通过零专家注入与两阶段自蒸馏把 post-trained MoE 转成 dynamic MoE

Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo,... 2026-05-19
LLM 效率 MoE 动态专家激活 推理加速 自蒸馏

通过混合模型自身的专家和朴素条件分布,实现无灾难性遗忘的知识注入方法

Jiarui Liu, Lechen Zhang, Yongjin Yang, Yinghui He, Yingheng Wang, Weihao... 2026-05-19
分布对齐 灾难性遗忘 知识注入 自蒸馏 语言模型微调

ATESD:用 Beta 策略控制器把教师暴露比例变成可学习变量,动态调节特权 CoT 的可见量。

Zihao Han, Tiangang Zhang, Huaibin Wang, Yilun Sun 2026-05-15
OPSD 强化学习控制器 推理后训练 教师暴露 自蒸馏