找到 232 条结果

用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen,... 2026-05-20
GRPO RLVR 后训练 多任务学习 强化学习

提出可量化指标 ECC 与交错训练策略,系统性解决 LLM 智能体在新环境中的过早利用失败。

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu,... 2026-05-18
GRPO LLM智能体 强化学习 环境理解 自主探索