找到 448 条结果

通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang,... 2026-07-31
上下文蒸馏 医学问答 反向KL分解 在线策略蒸馏 大语言模型

首个开源3T级原生多模态MoE,配1M上下文与多档强化学习

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan... 2026-07-28
Mixture-of-Experts 原生多模态 大语言模型 智能体强化学习 长上下文

用散度方向导数重定义信任域方向判据,改进LLM强化学习稳定性。

Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang,... 2026-07-24
PPO 信任域 大语言模型 强化学习 策略优化

通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升

Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang 2026-07-13
信任区域方法 大语言模型 强化学习 数学推理 知识蒸馏