找到 76 条结果

用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen,... 2026-05-20
GRPO RLVR 后训练 多任务学习 强化学习

解耦评分标准 RL 中验证器错误与评分标准设计缺陷两类奖励黑客,给出无需外部评审的自内化差距早停信号。

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu,... 2026-05-13
LLM 评审 医疗 AI 后训练 奖励黑客 强化学习

四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,... 2026-04-29
GRPO RLHF 后训练 扩散模型 自回归蒸馏

通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam... 2026-03-24
GRPO 后训练 大语言模型 工具调用 强化学习