找到 979 条结果

用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei,... 2026-07-31
GRPO LLM智能体 POMDP 强化学习 经验重构

让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。

Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve 2026-07-29
GRPO RLVR 代码优化 强化学习 竞赛编程

AREX用内外双循环递归地自我改进,靠验证驱动的研究状态刷新深度搜索水平。

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng... 2026-07-24
MoE 上下文管理 强化学习 智能体训练 深度研究智能体

把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。

Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi 2026-07-24
上下文学习 强化学习 智能体学习 样本效率 知识蒸馏

复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei 2026-07-24
多轮交互 强化学习 智能体 模型压缩 知识蒸馏