SkillRise:面向跨任务技能演化的智能体强化学习 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。
前置知识
智能体强化学习(Agentic RL)
把大语言模型当作交互式智能体,在与环境的多步交互中通过试错学习策略 $\pi_\theta(a_t | x, h_t)$,最大化可验证的任务结果奖励 $R(\tau)$。相比单轮生成的偏好对齐,它面对长视野、延迟奖励和更难的探索与信用分配问题。
本文的全部方法建立在对标准智能体 RL 目标 $J(\theta)=\mathbb{E}[R(\tau)]$ 的扩展之上,不懂它就无法理解为什么要引入序列和解耦信用分配。
组相对策略优化(GRPO/GiGPO)
一类用同一问题的多个采样结果的相对优势 $A=G-\bar{G}$ 作为监督、并用 PPO 风格裁剪目标 $\min(\rho A, \mathrm{clip}(\rho,1\!-\!\epsilon,1\!+\!\epsilon)A)$ 稳定更新的策略优化方法。GiGPO 进一步在分组内分组,为长视野智能体任务设计。
SkillRise 的角色感知组相对优化正是 GRPO/GiGPO 思想的延伸,按'任务位置+阶段'分组计算优势,是论文优化部分的核心。
信用分配(Credit Assignment)
指把一个回合或序列的最终奖励,如何归因到具体的动作或阶段上。本文区分'解题'与'技能整理'两个时间角色,分别用当前任务奖励和后续任务的折扣收益进行监督,避免把任务完成质量与技能可迁移性混为一谈。
解耦信用分配是 SkillRise 区别于以往多阶段流水线和同任务重复尝试方法的关键创新,读懂它才能理解训练信号为什么'干净'。
智能体技能学习(Skill Learning)
让智能体把交互历史转化为可复用的程序性知识(如文本技能、工作流、经验库),并在后续任务中检索、复用与精炼。代表方法包括 Reflexion(文本反思)、RetroAgent(记忆库)、SkillRL(教师蒸馏的分层技能库)。
本文要解决的正是跨任务技能学习,了解这些既有范式及其局限(实例化、多阶段耦合、难归因),才能理解 SkillRise 的端到端定位。
研究动机
大语言模型智能体在实际部署中常遇到一系列相关却不同的任务,它们共享可复用的解决模式。然而标准智能体强化学习把每个任务当作独立回合,交互中积累的经验被直接丢弃,迫使智能体每次都从零开始探索。现有技能学习分两类都有缺陷:一类(如 LaMer)反复尝试同一任务并用文本反思改进后续尝试,但所得知识常局限于具体实例、需要额外交互、且未针对跨任务迁移优化;另一类(如 RetroAgent、SkillRL)维护外部技能库,用多阶段流水线完成抽取、存储、检索、执行,但下游性能由这些环节共同决定,很难把成败归因到技能本身质量上,还带来巨大计算开销(运行时间达端到端方法的 4-6 倍)。
本文的目标是本文目标是提出一个简洁的端到端框架,让 LLM 智能体能从一系列相关但不同的任务中提取、精炼并复用可迁移技能。具体地,作者希望用单一策略同时完成两件事:在当前任务上解题,并把交互轨迹整理成一份不断演化的技能文档供后续任务使用。同时希望为'解题'和'技能整理'两个时间角色提供各自对齐的学习信号——解题只用当前任务奖励监督,技能整理只用后续任务的折扣收益评估——避免把任务完成质量与技能可迁移性混为一谈。最终要在 ALFWorld、WebShop、ScienceWorld 三个交互式文本基准上验证更强性能并大幅降低训练开销。
与已有工作不同的是,本文的独特切入角度是把跨任务技能学习形式化为对'有序任务序列'的优化:从同一任务族选取若干相关但不同的实例,按难度从简到难排序,让技能从前面的任务传递到后面的任务,并用后面任务的表现直接衡量技能是否可迁移。这与以往方法本质不同——不再依赖外部技能库或多阶段流水线,而用一份'序列局部'技能文档作为跨任务的唯一信息通道;不再把整个序列收益平均分给所有阶段,而采用解耦的信用分配让监督信号与各阶段的时间角色对齐。这种建模既简化了系统,又提供了更清晰、可归因的学习信号。
核心方法
SkillRise 的整体思路可概括为'边解题边记笔记,用后面的考试来检验笔记写得好不好'。直觉上,作者把若干相关任务排成由易到难的学习路径,让同一策略在路径上依次推进;每完成一个任务,策略就从'解题'切换到'整理',把刚才轨迹抽象成可迁移经验并更新一份技能文档,这份文档作为跨任务的唯一信息载体直接喂给下一个任务。技术路线上包含三组件:(a) 跨任务序列构造,按任务族分组并把实例按难度排序;(b) 带技能演化的跨任务 rollout,单一策略在解题与整理之间切换;(c) 解耦信用分配与角色感知的组相对优化。训练时对每个序列采样 $N=8$ 个独立试验,每个试验从空文档出发独立演化,每批 16 个序列共处理 384 次任务交互。
核心创新是'单一策略 + 解耦信用分配 + 技能文档作为唯一信息通道'的组合。与已有方法的本质区别在于:第一,不把技能抽取、检索、执行拆成多个模块或多次交互,而用同一策略在序列内交替完成解题与整理,技能文档 $S_i$ 是任务间唯一传递媒介,早期任务的轨迹不会被带入后续解题上下文。第二,解耦信用分配严格区分两个时间角色——解题(solve)只看当前任务奖励 $r_i^{(n)}$,技能整理(curate)只看后续任务的折扣收益 $G_{i,z}^{(n)}=\sum_{j=i+1}^{K}\gamma^{j-i}r_j^{(n)}$,避免把'题做得好不好'和'笔记有没有用'混为一谈。第三,角色感知组相对优化按'任务位置+阶段'分组算优势 $A$,确保解题与整理互不作为彼此基线。
方法步骤详情
训练流程分四步。(1) 跨任务序列构造:用环境提供的任务族元数据把任务分族,在每个族内贪心挑选多样实例,并按任务属性从简到难排序(如 WebShop 按产品类别分组、按所需属性和选项数排序),得到长度 $K=3$ 的序列。(2) 带技能演化的 rollout:从空文档 $S_0=\emptyset$ 出发,对第 $i$ 个任务先用当前文档生成解题轨迹并得奖励 $r_i=R(\tau_i)$;除最后一个任务外,同一策略切换到整理角色,重写整份文档 $S_i\sim\pi_\theta(\cdot|S_{i-1},\tau_i,r_i)$,保留有用技能、整合成功流程或失败模式、去除实例细节。每个序列采样 $N=8$ 个独立试验。(3) 解耦信用分配:解题得当前奖励,整理得后续折扣收益,折扣因子 $\gamma=0.6$。(4) 角色感知组相对优化:对固定序列、任务位置、阶段比较 $N$ 个试验的收益算优势,用裁剪目标联合优化所有解题与整理响应;actor 学习率 $1\times10^{-6}$,mini-batch 128,最多 150 个更新步。
技术新颖性
技术新颖性体现在三点。其一,建模新颖:首次把'跨任务技能学习'明确形式化为对有序任务序列的端到端优化,用后续任务表现直接评估技能可迁移性,而非依赖外部评估或多阶段中间指标。其二,机制新颖:用单一策略承担解题与整理两个角色,技能文档作为唯一跨任务通道,彻底摒弃外部技能库、教师蒸馏、检索模块,使 SkillRise 运行时间仅为 RetroAgent 的 $1/6$、SkillRL 的约 $1/4.3$。其三,优化新颖:解耦信用分配按时间角色对齐监督,并通过角色感知分组避免两类收益互相作为基线,与 GRPO、GiGPO 等'按任务独立分组'形成对照。消融显示这些设计缺一不可——去掉整理阶段约掉 3 个百分点,而对 $\gamma\in\{0.3,0.4,0.6,0.7\}$ 不敏感,说明信用分配对超参鲁棒。
实验结果
核心发现归纳为五组。(1) 主结果(表1):Qwen3-4B 上 SkillRise 在 ALFWorld、WebShop、ScienceWorld 的 Pass@1 为 85.9%、84.4%、54.6%,比最强基线 GiGPO 高 2.3、7.1、8.5 个百分点;ALFWorld 六子任务五项居首或次。(2) 任务内泛化(表2):Pass@3 达 92.2%、96.1%、61.0%,全面最优,超过专为同任务重复训练的 LaMer(高 0.8、1.6、14.2 点)。(3) 跨任务测试时扩展(图2):$K$ 由 2 增到 6,Pass@1 从 83.6% 单调升到 87.5%,领先优势从 3.9 扩到 8.6 个百分点,证明增益来自跨任务技能复用。(4) 模型规模(表3):1.7B 到 4B 提升 7.8 个百分点(78.1→85.9),大于 GRPO +4.7 与 LaMer +3.3。(5) 效率(图4):达 85.9%,匹配 RetroAgent、超 SkillRL 12.5 个百分点,运行时间仅为其 $1/6$ 与约 $1/4.3$。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld(六个任务族平均 Pass@1) | Pass@1 (%) | 85.9 | GiGPO 83.6 | +2.3 个百分点 |
| WebShop(购物任务成功率) | Pass@1 (%) | 84.4 | GiGPO 77.3 | +7.1 个百分点 |
| ScienceWorld(科学推理成功率) | Pass@1 (%) | 54.6 | GiGPO 46.1 | +8.5 个百分点 |
| ALFWorld 跨任务序列扩展(K=2→6) | Pass@1 (%) | 83.6→87.5(单调上升) | 基线无持续提升 | 领先优势 3.9→8.6 个百分点 |
| ALFWorld 模型规模(1.7B→4B) | Pass@1 (%) | 78.1→85.9(+7.8) | GRPO +4.7 / LaMer +3.3 | 增益随规模扩大 |
| ALFWorld 训练效率(相对运行时间) | 相对运行时间 / Pass@1 | 1.0× / 85.9% | RetroAgent 6.0× / SkillRL 4.3×(73.4%) | 快约 4-6 倍且更强 |
局限与改进
作者承认三点局限:第一,当前建模依赖环境提供的任务族元数据来构造相关实例序列,如何在开放任务流中自动发现这种关系仍未解决;第二,受算力限制实验只到 4B 参数模型,更大规模表现待验证;第三,实验集中在三个文本类智能体基准和可验证结果奖励上,对多模态、真实世界、难验证任务的普适性还需确立。我补充观察:技能文档完全由策略重写,缺乏对'幻觉式技能'(整理出环境中并不成立的经验)的显式校验,一旦文档被污染可能持续误导后续任务;序列长度 $K$ 固定为 3,在更复杂任务族里'难度排序'和'实例多样性'的人工定义不易推广;折扣因子虽鲁棒但 $\gamma=0.6$ 缺乏理论依据。
独立分析的弱点
独立分析有以下弱点。(1) 对任务族元数据强依赖:当任务流没有清晰族结构或难度标签(如开放网页操作、软件工程)时,序列构造无法直接套用。改进方向是用嵌入相似度或聚类自动发现任务族、用模型自身探索估计难度,做到无监督序列构造。(2) 技能文档缺校验:策略重写文档时不保证内容与环境一致,可能编造不存在的规律。改进方向是引入'技能验证'步骤——在受控小任务上试用新技能再决定是否保留,或对文档施加一致性约束。(3) 训练序列长度固定 $K=3$:限制技能演化深度,长序列下信用衰减可能让早期整理信号过弱。改进方向是变长序列、课程式延长 $K$ 或分层信用分配。(4) 只在可验证奖励的文本环境验证:对连续奖励或主观任务支持不足,改进方向是结合过程奖励或偏好信号。
未来方向
作者提出的方向包括:自动发现开放任务流中的任务关系(摆脱元数据依赖)、在更大参数规模验证、扩展到多模态与真实世界及不易验证的任务。基于本文成果还可延伸:第一,把'技能文档'从纯文本升级为结构化或可执行的程序化技能,提升表达力与可校验性;第二,研究技能的终身积累与遗忘——当任务族数量巨大时如何组织、检索与淘汰技能;第三,把跨任务技能学习与多智能体协作结合,让团队共享技能文档;第四,探索技能文档的可解释性,分析策略究竟'学到了什么可迁移规律',连接机制可解释性研究;第五,把测试时扩展从序列长度推广到技能组合、自我反思深度等更多维度。
复现评估
复现性较好。作者已公开代码(https://github.com/Within-yao/SkillRise),附录给出 ALFWorld/WebShop/ScienceWorld 三套完整的解题与整理 prompt 模板,以及两个详尽案例研究展示技能文档如何从失败和增量修订中演化。关键超参透明:骨干为 Qwen3-1.7/4B,每批 16 个序列、$K=3$、$N=8$,actor 学习率 $1\times10^{-6}$,mini-batch 128,最大响应 1024 token,最多 150 个更新步,$\gamma=0.6$,评估温度 0.7,128 个留出实例。硬件要求较高——用 FSDP+vLLM 在 8 张 NVIDIA H800 上训练,对中小团队有一定门槛。三个基准均为公开交互环境,任务族元数据由环境提供。总体看方法描述、超参与 prompt 齐全,主要门槛是 8 卡 H800 算力成本与对 vLLM/FSDP 训练框架的工程能力。
论文图表
给出 Qwen3-4B 上三个基准的 Pass@1,并细分 ALFWorld 六个任务族(Pick/Look/Clean/Heat/Cool/Pick2)。SkillRise 平均 85.9%、WebShop 84.4%、ScienceWorld 54.6%,全面最优;对比 Zero-shot、ReAct、Reflexion、PPO、RLOO、GRPO、GiGPO、LaMer 等基线,比最强基线 GiGPO 高 2.3-8.5 个百分点。
这是论文的主结果表,直接量化 SkillRise 的核心性能优势,是判断方法是否有效的最关键证据。
通过对同一留出任务重试并携带技能文档测试 Pass@2/3。SkillRise 在三个基准的 Pass@3 达 92.2%、96.1%、61.0%,全面最优,甚至超过专为'同任务重复尝试'训练的 LaMer。说明跨任务学到的整理策略能泛化到任务内自适应。
这张表验证了一个反直觉但重要的结论:即使训练面向不同任务,学到的技能整理能力也能迁移到对同一任务的重复尝试,证明整理策略本身具有通用性。
比较 Qwen3-1.7B 与 4B 两个规模。SkillRise 从 78.1% 升到 85.9%(+7.8 个百分点),显著大于 GRPO 的 +4.7 与 LaMer 的 +3.3;且在两个规模上均最强(1.7B 超 3.1、4B 超 6.2 个百分点)。说明增益随骨干规模扩大而增强。
这张表回答了'方法是否依赖单一规模'的普适性问题,并暗示'解题+跨任务抽象'的组合特别能利用额外模型容量,对实际部署选型有指导意义。