找到 191 条结果

提出直接优化接受率的LK损失函数,在6个目标模型上提升8-10%的平均接受长度

Alexander Samarin, Sergei Krutikov, Anton Shevtsov, Sergei Skvortsov, Filipp... 2026-03-02
大语言模型推理加速 序列生成 投机解码 损失函数设计 知识蒸馏

提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo... 2026-03-02
GRPO 大语言模型 强化学习 推理增强 知识蒸馏

通过结合模型蒸馏和任务特定对比损失训练紧凑高性能嵌入模型

Mohammad Kalim Akram, Saba Sturua, Nastia Havriushenko, Quentin Herreros,... 2026-02-18
信息检索 多语言 对比学习 嵌入模型 知识蒸馏

利用训练时特权信息蒸馏前沿模型,无需Chain-of-Thought

Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste,... 2026-02-06
强化学习 智能体 特权信息 知识蒸馏 语言模型

用离散语言分数替代token级概率匹配,实现内存高效的推理能力蒸馏

Jing Xiong, Hui Shen, Shansan Gong, Yuxin Cheng, Jianghan Shen, Chaofan Tao,... 2026-02-03
Web问答 强化学习 推理 数学推理 知识蒸馏

知识蒸馏可将训练数据记忆减少50%以上,同时提升模型泛化能力

Jaydeep Borkar, Karan Chadha, Niloofar Mireshghallah, Yuchen Zhang,... 2026-02-02
大语言模型 数据记忆 模型压缩 知识蒸馏 隐私保护