找到 191 条结果

用语义化评分标准替代教师 logits 的黑箱在线蒸馏框架。

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng... 2026-05-11
GRPO LLM对齐 强化学习 知识蒸馏 评分标准奖励

将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu 2026-04-24
代码生成 大语言模型 强化学习 推理 知识蒸馏

用熵与分歧两轴解释 OPD 中 token 重要性,并提出无参数 Soft-OR 选择规则。

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard 2026-04-16
LLM 训练 Token 选择 推理模型 知识蒸馏 课程学习

通过直接条件蒸馏(DCD)把多步块扩散蒸馏为单步解码,同时用响应非对称扩散(RAD)削减72.3%训练FLOPs,在胸部X光报告生成上实现8倍理论加速和5.1倍实测加速。

Lifeng Chen, Tianqi You, Hao Liu, Zhimin Bao, Jile Jiao, Xiao Han, Zhicai... 2026-04-13
一步式推理 医学影像 扩散语言模型 知识蒸馏 胸部X光报告生成