找到 73 条结果

提出多维度推理奖励模型Agent-RRM,通过文本批评和标量奖励的统一集成提升智能体性能

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei... 2026-01-30
奖励模型 工具使用 强化学习 推理优化 智能体

提出AT2PO框架,通过熵引导树扩展、轮次级信用分配和轮次策略优化解决多轮智能体强化学习三大核心挑战

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian,... 2026-01-09
多轮推理 工具使用 智能体强化学习 树搜索 策略优化