找到 498 条结果

提出分布级奖励框架解决样本级RL的reward hacking问题,显著提升生成质量

Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang 2026-07-03
Flow Matching 分布匹配 强化学习 扩散模型 模型合并

结合扩散模型与价值函数的在线模型预测控制方法

Christopher Lindenberg, Kashyap Chitta 2026-07-02
世界模型 强化学习 扩散模型 模型预测控制