找到 232 条结果

通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin... 2026-03-24
GRPO 强化学习对齐 扩散模型 流匹配 视频生成

通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam... 2026-03-24
GRPO 后训练 大语言模型 工具调用 强化学习

用大规模社区反馈强化学习训练AI判断和提出高影响力研究想法

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma,... 2026-03-17
GRPO 偏好学习 奖励模型 强化学习 科学智能体

提出StableDRL,通过无条件裁剪和自归一化解决dLLM强化学习中的奖励崩溃问题

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang,... 2026-03-09
GRPO 后训练优化 强化学习 扩散语言模型 训练稳定性