找到 999 条结果

一个完全自动化的端到端框架,通过可扩展的数据合成和可验证的强化学习来训练工具增强的语言智能体。

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian... 2026-02-02
多轮交互 工具增强语言模型 强化学习 数据合成 智能体训练

利用策略模型隐藏状态实时更新奖励模型,解决RLHF中的奖励过度优化问题

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie,... 2026-02-02
RLHF 奖励模型 奖励过度优化 对齐 强化学习

通过分层奖励将策略引导至解空间最优区域,实现样本效率提升2.5倍

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao,... 2026-02-02
GUI智能体 可验证奖励RL 奖励塑造 强化学习 智能体训练

轻量奖励模型预测单元测试质量,无需编译运行即可评估覆盖率和变异得分

Elena Bruches, Daniil Grebenkin, Mikhail Klementev, Vadim Alperovich, Roman... 2026-02-02
LLM4SE 代码质量评估 单元测试生成 奖励模型 强化学习

通过AI反馈的逐动作过程奖励训练多智能体,解决信用分配和样本效率问题

Ed Li, Junyu Ren, Cat Yan 2026-02-02
AI反馈 多智能体系统 大语言模型 强化学习 过程奖励

提出多维度推理奖励模型Agent-RRM,通过文本批评和标量奖励的统一集成提升智能体性能

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei... 2026-01-30
奖励模型 工具使用 强化学习 推理优化 智能体

FlowBoost:用流匹配+强化学习自动发现极值几何配置

Gergely Bérczi, Baran Hashemi, Jonas Klüver 2026-01-30
强化学习 数学发现 流匹配 生成模型 组合优化