找到 56 条结果

限制蒸馏 rollout 到前 N 个 token,解决 OPD 的离策略教师衰减问题

Zhou Ziheng, Jiaqi Li, Huacong Tang, Ying Nian Wu, Demetri Terzopoulos 2026-05-28
在线策略蒸馏 大语言模型 模型压缩 知识蒸馏

用 RL options 框架训练 MoE 控制器,把切换率从 50%+ 压到 5% 以下。

Zeyu Shen, Peter Henderson 2026-04-24
LLM推理优化 Mixture-of-Experts Options Framework 强化学习 模型压缩

剪枝在非生成任务有效但生成任务失效,softmax非线性放大是关键

Shwai He, Guoheng Sun, Haichao Zhang, Yun Fu, Ang Li 2026-04-08
模型压缩 生成任务 网络剪枝 表示学习 语言模型

用 mLSTM-SWA 混合架构蒸馏 Transformer,通过专家合并实现近乎无损的性能迁移

Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied, Anamaria-Roberta... 2026-03-17
xLSTM 模型压缩 知识蒸馏 线性注意力 高效推理

针对扩散语言模型中注意力汇聚不稳定的特点,提出感知汇聚的剪枝方法

Aidar Myrzakhan, Tianyi Li, Bowei Guo, Shengkun Tang, Zhiqiang Shen 2026-02-23
后训练剪枝 扩散语言模型 推理加速 模型压缩 注意力汇聚