找到 232 条结果

让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。

Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve 2026-07-29
GRPO RLVR 代码优化 强化学习 竞赛编程

用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen 2026-07-21
GRPO 多任务强化学习 大语言模型对齐 强化学习 策略熵控制

用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi,... 2026-07-17
Agentic RAG GRPO 上下文粒度 多跳问答 强化学习

通过差分答案探针奖励和结果门控优势路由,精确评估视觉工具调用的贡献并智能控制工具使用

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang,... 2026-06-30
GRPO 信用分配 多模态智能体 强化学习 视觉工具使用