找到 232 条结果

四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,... 2026-04-29
GRPO RLHF 后训练 扩散模型 自回归蒸馏

在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu 2026-04-28
DeepScaleR GRPO 强化学习 推理压缩 步级信用分配

用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,... 2026-04-23
GRPO 多模态大模型 工具调用 强化学习 视觉推理