找到 93 条结果

研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解

Semih Kara, Oğuzhan Ersoy 2026-06-10
反馈设计 强化学习 数学推理 自蒸馏 过程监督

ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu,... 2026-06-02
大语言模型 强化学习 数学推理 策略优化 训练效率

用信息瓶颈理论量化探索-利用平衡,通过IBTree提升在线强化学习效率和稳定性。

Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao... 2026-05-28
信息瓶颈 在线强化学习 大语言模型 数学推理 树搜索