← 返回 2026-07-30

SkillRise:面向跨任务技能演化的智能体强化学习 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen 📅 2026-07-29 👍 27 2026-08-04 18:30
大语言模型 强化学习 技能学习 智能体 跨任务迁移

单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。

前置知识

智能体强化学习(Agentic RL)

把大语言模型当作交互式智能体,在与环境的多步交互中通过试错学习策略 $\pi_\theta(a_t | x, h_t)$,最大化可验证的任务结果奖励 $R(\tau)$。相比单轮生成的偏好对齐,它面对长视野、延迟奖励和更难的探索与信用分配问题。

本文的全部方法建立在对标准智能体 RL 目标 $J(\theta)=\mathbb{E}[R(\tau)]$ 的扩展之上,不懂它就无法理解为什么要引入序列和解耦信用分配。

组相对策略优化(GRPO/GiGPO)

一类用同一问题的多个采样结果的相对优势 $A=G-\bar{G}$ 作为监督、并用 PPO 风格裁剪目标 $\min(\rho A, \mathrm{clip}(\rho,1\!-\!\epsilon,1\!+\!\epsilon)A)$ 稳定更新的策略优化方法。GiGPO 进一步在分组内分组,为长视野智能体任务设计。

SkillRise 的角色感知组相对优化正是 GRPO/GiGPO 思想的延伸,按'任务位置+阶段'分组计算优势,是论文优化部分的核心。

信用分配(Credit Assignment)

指把一个回合或序列的最终奖励,如何归因到具体的动作或阶段上。本文区分'解题'与'技能整理'两个时间角色,分别用当前任务奖励和后续任务的折扣收益进行监督,避免把任务完成质量与技能可迁移性混为一谈。

解耦信用分配是 SkillRise 区别于以往多阶段流水线和同任务重复尝试方法的关键创新,读懂它才能理解训练信号为什么'干净'。

智能体技能学习(Skill Learning)

让智能体把交互历史转化为可复用的程序性知识(如文本技能、工作流、经验库),并在后续任务中检索、复用与精炼。代表方法包括 Reflexion(文本反思)、RetroAgent(记忆库)、SkillRL(教师蒸馏的分层技能库)。

本文要解决的正是跨任务技能学习,了解这些既有范式及其局限(实例化、多阶段耦合、难归因),才能理解 SkillRise 的端到端定位。

研究动机

大语言模型智能体在实际部署中常遇到一系列相关却不同的任务,它们共享可复用的解决模式。然而标准智能体强化学习把每个任务当作独立回合,交互中积累的经验被直接丢弃,迫使智能体每次都从零开始探索。现有技能学习分两类都有缺陷:一类(如 LaMer)反复尝试同一任务并用文本反思改进后续尝试,但所得知识常局限于具体实例、需要额外交互、且未针对跨任务迁移优化;另一类(如 RetroAgent、SkillRL)维护外部技能库,用多阶段流水线完成抽取、存储、检索、执行,但下游性能由这些环节共同决定,很难把成败归因到技能本身质量上,还带来巨大计算开销(运行时间达端到端方法的 4-6 倍)。

本文的目标是本文目标是提出一个简洁的端到端框架,让 LLM 智能体能从一系列相关但不同的任务中提取、精炼并复用可迁移技能。具体地,作者希望用单一策略同时完成两件事:在当前任务上解题,并把交互轨迹整理成一份不断演化的技能文档供后续任务使用。同时希望为'解题'和'技能整理'两个时间角色提供各自对齐的学习信号——解题只用当前任务奖励监督,技能整理只用后续任务的折扣收益评估——避免把任务完成质量与技能可迁移性混为一谈。最终要在 ALFWorld、WebShop、ScienceWorld 三个交互式文本基准上验证更强性能并大幅降低训练开销。

与已有工作不同的是,本文的独特切入角度是把跨任务技能学习形式化为对'有序任务序列'的优化:从同一任务族选取若干相关但不同的实例,按难度从简到难排序,让技能从前面的任务传递到后面的任务,并用后面任务的表现直接衡量技能是否可迁移。这与以往方法本质不同——不再依赖外部技能库或多阶段流水线,而用一份'序列局部'技能文档作为跨任务的唯一信息通道;不再把整个序列收益平均分给所有阶段,而采用解耦的信用分配让监督信号与各阶段的时间角色对齐。这种建模既简化了系统,又提供了更清晰、可归因的学习信号。

核心方法

SkillRise 的整体思路可概括为'边解题边记笔记,用后面的考试来检验笔记写得好不好'。直觉上,作者把若干相关任务排成由易到难的学习路径,让同一策略在路径上依次推进;每完成一个任务,策略就从'解题'切换到'整理',把刚才轨迹抽象成可迁移经验并更新一份技能文档,这份文档作为跨任务的唯一信息载体直接喂给下一个任务。技术路线上包含三组件:(a) 跨任务序列构造,按任务族分组并把实例按难度排序;(b) 带技能演化的跨任务 rollout,单一策略在解题与整理之间切换;(c) 解耦信用分配与角色感知的组相对优化。训练时对每个序列采样 $N=8$ 个独立试验,每个试验从空文档出发独立演化,每批 16 个序列共处理 384 次任务交互。

核心创新是'单一策略 + 解耦信用分配 + 技能文档作为唯一信息通道'的组合。与已有方法的本质区别在于:第一,不把技能抽取、检索、执行拆成多个模块或多次交互,而用同一策略在序列内交替完成解题与整理,技能文档 $S_i$ 是任务间唯一传递媒介,早期任务的轨迹不会被带入后续解题上下文。第二,解耦信用分配严格区分两个时间角色——解题(solve)只看当前任务奖励 $r_i^{(n)}$,技能整理(curate)只看后续任务的折扣收益 $G_{i,z}^{(n)}=\sum_{j=i+1}^{K}\gamma^{j-i}r_j^{(n)}$,避免把'题做得好不好'和'笔记有没有用'混为一谈。第三,角色感知组相对优化按'任务位置+阶段'分组算优势 $A$,确保解题与整理互不作为彼此基线。

方法步骤详情

训练流程分四步。(1) 跨任务序列构造:用环境提供的任务族元数据把任务分族,在每个族内贪心挑选多样实例,并按任务属性从简到难排序(如 WebShop 按产品类别分组、按所需属性和选项数排序),得到长度 $K=3$ 的序列。(2) 带技能演化的 rollout:从空文档 $S_0=\emptyset$ 出发,对第 $i$ 个任务先用当前文档生成解题轨迹并得奖励 $r_i=R(\tau_i)$;除最后一个任务外,同一策略切换到整理角色,重写整份文档 $S_i\sim\pi_\theta(\cdot|S_{i-1},\tau_i,r_i)$,保留有用技能、整合成功流程或失败模式、去除实例细节。每个序列采样 $N=8$ 个独立试验。(3) 解耦信用分配:解题得当前奖励,整理得后续折扣收益,折扣因子 $\gamma=0.6$。(4) 角色感知组相对优化:对固定序列、任务位置、阶段比较 $N$ 个试验的收益算优势,用裁剪目标联合优化所有解题与整理响应;actor 学习率 $1\times10^{-6}$,mini-batch 128,最多 150 个更新步。

技术新颖性

技术新颖性体现在三点。其一,建模新颖:首次把'跨任务技能学习'明确形式化为对有序任务序列的端到端优化,用后续任务表现直接评估技能可迁移性,而非依赖外部评估或多阶段中间指标。其二,机制新颖:用单一策略承担解题与整理两个角色,技能文档作为唯一跨任务通道,彻底摒弃外部技能库、教师蒸馏、检索模块,使 SkillRise 运行时间仅为 RetroAgent 的 $1/6$、SkillRL 的约 $1/4.3$。其三,优化新颖:解耦信用分配按时间角色对齐监督,并通过角色感知分组避免两类收益互相作为基线,与 GRPO、GiGPO 等'按任务独立分组'形成对照。消融显示这些设计缺一不可——去掉整理阶段约掉 3 个百分点,而对 $\gamma\in\{0.3,0.4,0.6,0.7\}$ 不敏感,说明信用分配对超参鲁棒。

Overview of SkillRise.
Figure 1: Overview of SkillRise.
Training dynamics on ALFWorld in terms of training reward (%).
Figure 3: Training dynamics on ALFWorld in terms of training reward (%).
Case 1: a rule recorded after failure.
Figure 11: Case 1: a rule recorded after failure.
Case 2: an incremental skill revision.
Figure 12: Case 2: an incremental skill revision.

实验结果

核心发现归纳为五组。(1) 主结果(表1):Qwen3-4B 上 SkillRise 在 ALFWorld、WebShop、ScienceWorld 的 Pass@1 为 85.9%、84.4%、54.6%,比最强基线 GiGPO 高 2.3、7.1、8.5 个百分点;ALFWorld 六子任务五项居首或次。(2) 任务内泛化(表2):Pass@3 达 92.2%、96.1%、61.0%,全面最优,超过专为同任务重复训练的 LaMer(高 0.8、1.6、14.2 点)。(3) 跨任务测试时扩展(图2):$K$ 由 2 增到 6,Pass@1 从 83.6% 单调升到 87.5%,领先优势从 3.9 扩到 8.6 个百分点,证明增益来自跨任务技能复用。(4) 模型规模(表3):1.7B 到 4B 提升 7.8 个百分点(78.1→85.9),大于 GRPO +4.7 与 LaMer +3.3。(5) 效率(图4):达 85.9%,匹配 RetroAgent、超 SkillRL 12.5 个百分点,运行时间仅为其 $1/6$ 与约 $1/4.3$。

Cross-task test-time scaling on ALFWorld.
Figure 2: Cross-task test-time scaling on ALFWorld.
Comparison of skill-learning pipelines on ALFWorld.
Figure 4: Comparison of skill-learning pipelines on ALFWorld.
查看结构化数据
任务指标本文基线提升
ALFWorld(六个任务族平均 Pass@1) Pass@1 (%) 85.9 GiGPO 83.6 +2.3 个百分点
WebShop(购物任务成功率) Pass@1 (%) 84.4 GiGPO 77.3 +7.1 个百分点
ScienceWorld(科学推理成功率) Pass@1 (%) 54.6 GiGPO 46.1 +8.5 个百分点
ALFWorld 跨任务序列扩展(K=2→6) Pass@1 (%) 83.6→87.5(单调上升) 基线无持续提升 领先优势 3.9→8.6 个百分点
ALFWorld 模型规模(1.7B→4B) Pass@1 (%) 78.1→85.9(+7.8) GRPO +4.7 / LaMer +3.3 增益随规模扩大
ALFWorld 训练效率(相对运行时间) 相对运行时间 / Pass@1 1.0× / 85.9% RetroAgent 6.0× / SkillRL 4.3×(73.4%) 快约 4-6 倍且更强

局限与改进

作者承认三点局限:第一,当前建模依赖环境提供的任务族元数据来构造相关实例序列,如何在开放任务流中自动发现这种关系仍未解决;第二,受算力限制实验只到 4B 参数模型,更大规模表现待验证;第三,实验集中在三个文本类智能体基准和可验证结果奖励上,对多模态、真实世界、难验证任务的普适性还需确立。我补充观察:技能文档完全由策略重写,缺乏对'幻觉式技能'(整理出环境中并不成立的经验)的显式校验,一旦文档被污染可能持续误导后续任务;序列长度 $K$ 固定为 3,在更复杂任务族里'难度排序'和'实例多样性'的人工定义不易推广;折扣因子虽鲁棒但 $\gamma=0.6$ 缺乏理论依据。

独立分析的弱点

独立分析有以下弱点。(1) 对任务族元数据强依赖:当任务流没有清晰族结构或难度标签(如开放网页操作、软件工程)时,序列构造无法直接套用。改进方向是用嵌入相似度或聚类自动发现任务族、用模型自身探索估计难度,做到无监督序列构造。(2) 技能文档缺校验:策略重写文档时不保证内容与环境一致,可能编造不存在的规律。改进方向是引入'技能验证'步骤——在受控小任务上试用新技能再决定是否保留,或对文档施加一致性约束。(3) 训练序列长度固定 $K=3$:限制技能演化深度,长序列下信用衰减可能让早期整理信号过弱。改进方向是变长序列、课程式延长 $K$ 或分层信用分配。(4) 只在可验证奖励的文本环境验证:对连续奖励或主观任务支持不足,改进方向是结合过程奖励或偏好信号。

未来方向

作者提出的方向包括:自动发现开放任务流中的任务关系(摆脱元数据依赖)、在更大参数规模验证、扩展到多模态与真实世界及不易验证的任务。基于本文成果还可延伸:第一,把'技能文档'从纯文本升级为结构化或可执行的程序化技能,提升表达力与可校验性;第二,研究技能的终身积累与遗忘——当任务族数量巨大时如何组织、检索与淘汰技能;第三,把跨任务技能学习与多智能体协作结合,让团队共享技能文档;第四,探索技能文档的可解释性,分析策略究竟'学到了什么可迁移规律',连接机制可解释性研究;第五,把测试时扩展从序列长度推广到技能组合、自我反思深度等更多维度。

复现评估

复现性较好。作者已公开代码(https://github.com/Within-yao/SkillRise),附录给出 ALFWorld/WebShop/ScienceWorld 三套完整的解题与整理 prompt 模板,以及两个详尽案例研究展示技能文档如何从失败和增量修订中演化。关键超参透明:骨干为 Qwen3-1.7/4B,每批 16 个序列、$K=3$、$N=8$,actor 学习率 $1\times10^{-6}$,mini-batch 128,最大响应 1024 token,最多 150 个更新步,$\gamma=0.6$,评估温度 0.7,128 个留出实例。硬件要求较高——用 FSDP+vLLM 在 8 张 NVIDIA H800 上训练,对中小团队有一定门槛。三个基准均为公开交互环境,任务族元数据由环境提供。总体看方法描述、超参与 prompt 齐全,主要门槛是 8 卡 H800 算力成本与对 vLLM/FSDP 训练框架的工程能力。