找到 93 条结果

通过两阶段迭代自我反馈机制提升LLM数学推理能力的强化学习算法

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han,... 2026-02-11
GRPO扩展 强化学习 推理优化 数学推理 策略优化

通过回收被丢弃的中间计算信号,显著提升扩散语言模型的推理准确率

Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman... 2026-02-05
并行解码 扩散语言模型 数学推理 残差学习 高效推理

通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian 2026-02-05
GRPO 大语言模型对齐 强化学习 数学推理 策略优化

用离散语言分数替代token级概率匹配,实现内存高效的推理能力蒸馏

Jing Xiong, Hui Shen, Shansan Gong, Yuxin Cheng, Jianghan Shen, Chaofan Tao,... 2026-02-03
Web问答 强化学习 推理 数学推理 知识蒸馏