找到 979 条结果

通过差分答案探针奖励和结果门控优势路由,精确评估视觉工具调用的贡献并智能控制工具使用

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang,... 2026-06-30
GRPO 信用分配 多模态智能体 强化学习 视觉工具使用

研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen,... 2026-06-26
Agent 评估 代码生成 大语言模型 奖励设计 强化学习

通过离散化奖励模型解决过度敏感问题,提升强化学习效果

Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika, Chirag Nagpal, Tongshuang... 2026-06-26
RLHF 奖励模型 奖励黑客 强化学习 离散化