找到 998 条结果

DR.Q 通过最大化表示互信息和衰减式优先回放,给基于模型的Q学习表示去偏,单套超参横扫73个连续控制任务。

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong... 2026-05-13
互信息最大化 基于模型的表示学习 强化学习 经验回放 连续控制

解耦评分标准 RL 中验证器错误与评分标准设计缺陷两类奖励黑客,给出无需外部评审的自内化差距早停信号。

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu,... 2026-05-13
LLM 评审 医疗 AI 后训练 奖励黑客 强化学习