找到 232 条结果

用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath,... 2026-02-06
GRPO LLM智能体 世界模型 强化学习 自监督学习

用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra... 2026-02-06
GRPO 信赖域方法 大语言模型 强化学习 策略优化

通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian 2026-02-05
GRPO 大语言模型对齐 强化学习 数学推理 策略优化

揭示GRPO等群组相对RL算法中优势估计的固有偏差,并提出HA-DW自适应修正方案

Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun... 2026-01-19
GRPO LLM推理 优势估计 后训练 强化学习