找到 999 条结果

提出专用空间奖励模型与数据集,显著提升图像生成的多对象空间关系理解能力

Zhenyu Tang, Chaoran Feng, Yufan Deng, Jie Wu, Xiaojie Li, Rui Wang, Yunpeng... 2026-03-02
奖励模型 强化学习 扩散模型 文本到图像生成 空间关系理解

提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo... 2026-03-02
GRPO 大语言模型 强化学习 推理增强 知识蒸馏

通过四维策略梯度分析揭示ARL训练不稳定根源,提出SAMPO统一算法实现稳定训练

Xiaoxuan Wang, Han Zhang, Haixin Wang, Yidan Shi, Ruoyan Li, Kaiqiao Han,... 2026-02-26
LLM智能体 多轮交互 强化学习 策略优化 训练稳定性

系统研究高效推理训练机制,通过数据、奖励和优化策略实现更短、更准确的推理链生成

Taiqiang Wu, Zenan Zu, Bo Zhou, Ngai Wong 2026-02-25
大语言模型 奖励塑形 强化学习 推理链优化 高效推理