找到 60 条结果

在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu 2026-04-28
DeepScaleR GRPO 强化学习 推理压缩 步级信用分配

任务专属草稿模型+推理时组合显著提升推测解码接受长度

Mohamad Zbib, Mohamad Bazzi, Ammar Mohanna, Hasan Abed Al Kader Hammoud,... 2026-03-31
大语言模型推理加速 推测解码 模型组合 草稿模型训练 高效推理

通过置信度动态调控推理轨迹,在抑制冗余思考的同时防止推理不足

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong... 2026-03-19
大型推理模型 思维链 推理优化 过度思考 高效推理

用 mLSTM-SWA 混合架构蒸馏 Transformer,通过专家合并实现近乎无损的性能迁移

Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied, Anamaria-Roberta... 2026-03-17
xLSTM 模型压缩 知识蒸馏 线性注意力 高效推理

统一扩散语言模型训练、推理与评估的开源框架,并提供从BERT/AR模型转换为DLM的实用配方

Zhanhui Zhou, Lingjie Chen, Hanghang Tong, Dawn Song 2026-03-02
块扩散 开源框架 扩散语言模型 掩码扩散 模型转换