找到 93 条结果

让模型自演“粗心推理者”生成负向教师,推开缺陷token的概率分布,无标签提升数学推理

Rongcan Pei, Zhepei Wei, Shuyao Xu, Xinyu Zhu, Wei-Lin Chen, Yu Meng 2026-09-11
LLM自改进 token级门控 数学推理 无标签训练 蒸馏与强化学习

用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,... 2026-08-26
RLVR 大模型后训练 强化学习 数学推理 知识蒸馏

通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升

Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang 2026-07-13
信任区域方法 大语言模型 强化学习 数学推理 知识蒸馏

TREK扩展GRPO探索支持,提升数学和Agent性能

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian... 2026-07-08
Agent 大语言模型 强化学习 数学推理 知识蒸馏