找到 83 条结果

用弱教师策略偏移方向放大强学生自身梯度,加速训练并突破教师上限

Youngrok Park, Sangmin Bae, Hojung Jung, Jongwoo Ko, Yunseon Choi, Young Jin... 2026-09-09
RLVR 在线策略蒸馏 多教师蒸馏 弱到强泛化 策略梯度缩放

用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,... 2026-08-26
RLVR 大模型后训练 强化学习 数学推理 知识蒸馏

RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang 2026-08-17
RLVR 大语言模型 强化学习 持续学习 指令跟随

用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych 2026-08-13
LLM后训练 RLVR 参数空间探索 变分推断 强化学习

提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang,... 2026-08-03
GRPO RLVR 强化学习 熵坍塌 知识蒸馏

让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。

Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve 2026-07-29
GRPO RLVR 代码优化 强化学习 竞赛编程

复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David... 2026-07-22
RLVR 优化器 奇异值分解 强化学习 推理能力