找到 979 条结果

用散度方向导数重定义信任域方向判据,改进LLM强化学习稳定性。

Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang,... 2026-07-24
PPO 信任域 大语言模型 强化学习 策略优化

用代理似然把结果奖励RL引入潜在推理,实现潜在测试时扩展

Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li 2026-07-23
强化学习 思维链 测试时扩展 潜在推理 策略优化

复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David... 2026-07-22
RLVR 优化器 奇异值分解 强化学习 推理能力

按轨迹正确性分流的混合自蒸馏框架,统一RLSD稳定优化与OPSD方向纠正。

Qiye Cai, Yichuan Ma, Linyang Li, Peiji Li, Yongkang Chen, Qipeng Guo,... 2026-07-22
信用分配 可验证奖励RLVR 大语言模型推理 强化学习 自蒸馏

用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen 2026-07-21
GRPO 多任务强化学习 大语言模型对齐 强化学习 策略熵控制