← 返回 2026-08-04

Skill-α:基于强化学习的渐进式智能体技能生成 Progressive Agent Skill Generation via Reinforcement Learning

Junhao Shen, Zhanqiu Zhang, Yiwen Guo, Hong Cheng 📅 2026-08-03 👍 58 2026-08-09 18:30
Agent技能生成 GRPO LLM Agent 强化学习 技能编辑

把技能生成建模为顺序编辑过程,用回滚奖励训练技能编辑策略

前置知识

Agent Skill(智能体技能)

Agent skill 是一种可复用的外部程序性模块(通常写成 SKILL.md 这样的文本指令),插入到 worker agent 的上下文中,用来约束其推理过程、指导它如何分解任务、调用工具、检查中间结果。它的作用类似给模型外挂一份「操作手册」,不需要重新训练模型权重就能改变 agent 在下游任务上的行为。

本文整个工作就是在解决「如何自动生成高质量技能」这个问题,理解技能是什么、怎么影响 worker 行为,是理解论文奖励设计的钥匙。

Document-to-Skill 与 Experience-to-Skill

技能的「证据来源」分两类:document-to-skill 把规则、文档、任务描述压缩成程序化指令(如 CL-Bench 的规则系统、领域知识);experience-to-skill 把成功或失败的执行轨迹蒸馏成可复用经验(如 SpreadsheetBench 的表格操作轨迹、tau2-bench 的客服工作流)。以往方法通常只针对其中一类设计 pipeline。

本文最大的卖点之一就是用同一个学习框架统一这两类异构来源,所有实验都围绕这条主线展开。

GRPO(Group Relative Policy Optimization)

DeepSeek-R1 推广的强化学习算法。对每个输入 $X$,从旧策略采样一组 $G$ 个动作 $\{A_i\}$,给每个动作打分 $r_i$,用组内归一化得到相对优势 $\hat{A}_i=(r_i-\text{mean})/\text{std}$,再用带 clip 和 KL 正则的目标 $\mathcal{J}(\phi)=\mathbb{E}\left[\frac{1}{G}\sum_i\min(\rho_i\hat{A}_i,\text{clip}(\rho_i,1-\epsilon,1+\epsilon)\hat{A}_i)-\beta\,D_{KL}\right]$ 更新策略,其中 $\rho_i=\pi_\phi(A_i|X)/\pi_{\phi_{old}}(A_i|X)$。它无需 critic,适合只有稀疏二元奖励的场景。

Skill-α 的训练循环完全建立在 GRPO 之上,理解它才能看懂 rollback reward 怎么变成梯度。

Credit Assignment(信用分配)

在强化学习中,agent 采取一连串动作后只拿到一个最终奖励,如何把这个延迟奖励分配回每一步局部动作,就是 credit assignment。本文里一条技能是被多次编辑逐步搭出来的,最终下游成绩好,到底是哪一次编辑贡献了提升?这是论文要解决的核心难题。

rollback reward 本质就是一种编辑级别的 credit assignment 机制,论文的全部新颖性都围绕这个痛点。

Anchored Query 与 Verifier(锚定查询与验证器)

为某次编辑挑一条与该证据来源相关的「锚定查询」$q_{anc}^t$,再用一个 benchmark 特定的 verifier $V_t$ 对 worker 在这条查询上的答案打分。CL-Bench 用 GPT-5.5 按官方 rubric 当判官;SpreadsheetBench、tau2-bench 直接用 benchmark 环境返回的执行反馈。

rollback reward 就是靠「同一锚定查询 + 同一 verifier」对照新旧技能得分才成立的,理解这一步才能理解奖励为什么公平。

研究动机

现代 LLM agent 越来越依赖外部技能(SKILL.md 这类程序性模块)来约束推理、引导工具调用与长程规划,于是「自动从文档或执行经验里生成高质量技能」成了一个关键问题。但现有方法几乎都是基于启发式或 pipeline 式的整合:document-to-skill 一路(如 Ctx2Skill、AutoSkill)专门压缩长文档为指令,experience-to-skill 一路(如 Trace2Skill、SkillX、SkillPro、ExpeL、AWM)专门从轨迹蒸馏经验,两套设计彼此不通用,需要为不同证据源单独手工搭管道。更麻烦的是,这些 pipeline 往往没有明确指引「每一条证据到底该怎样改写当前技能」,导致它们在某些列上甚至比 NO SKILL 还差——例如 Progressive Prompt Skill 在 SpreadsheetBench 上只有 13.50(低于无技能基线 26.00),Anthropic Skill-Creator 在 tau2 Telecom 上只有 7.50(低于无技能基线 12.50)。直接套用 RL 也不行:技能没有像数学题答案那样的「正确性」监督信号,它的价值只能靠下游任务表现间接体现。

本文的目标是作者希望把技能生成从一个手工搭管道的工程问题,变成一个可学习的统一过程:训出一个技能编辑策略 $\pi_\phi$,让它无论面对文档证据还是经验证据,都能读一段证据、决定对当前技能做一次恰当的局部编辑(新增/修改/合并/删除/不动),最终渐进地搭出一条高质量技能,使固定的 worker agent 在同任务家族的留出查询上行为更接近理想教师分布。这个目标有两个可量化的硬指标:在 GPT-4o worker 下,CL-Bench 平均通过率要超过最强的文档类基线,tau2-bench 平均通过率要超过最强的经验类基线,并且生成的技能还要能跨 worker 迁移到 Claude-Sonnet-4.5 上。

与已有工作不同的是,本文的独特切入角度是「不要一次性生成完整技能,而是把生成拆成一连串可单独评估的局部编辑」。已有工作要么一次性 prompt 出技能(难以分配信用),要么用 pipeline 做整合(证据源特化、缺乏统一的『证据→编辑』决策)。作者抓住了两个被忽视的点:第一,技能的价值只能通过『它如何改变 worker 行为』来衡量,所以奖励必须基于执行而非文本流畅度;第二,单次编辑的因果效应可以通过『回滚比较』来局部隔离——把改前/改后的技能喂给同一个 worker 回答同一条锚定查询,再比对 verifier 分数。这就把一个看似只能端到端评估的难题,变成了每一步都能拿到局部信号的 RL 问题。

核心方法

整体思路可以打一个比方:盖房子。传统 pipeline 像一次性把所有图纸倒给包工头,让他一气呵成交出成品,但图纸太多容易看漏、且盖歪了也不知道是哪一页的错;Skill-α 则是把盖房拆成『读一页图纸 → 改一处房子 → 立刻验房』的循环。技术路线上,worker agent $\pi_\psi$ 是固定不训的(实验里是 GPT-4o 或 Claude-Sonnet-4.5),真正训练的是一个『技能编辑策略』$\pi_\phi$,初始化自 Qwen3-8B。它从初始技能 $z_0$ 出发,顺序读证据 $x_1,\dots,x_T$,每步采样一个局部编辑动作 $A_t\sim\pi_\phi(\cdot|z_{t-1},x_t)$ 并应用得到 $z_t=\text{Edit}(z_{t-1},A_t)$,走完 $T$ 步得到最终技能 $z_T$。这个渐进式框架同时覆盖文档和经验两类证据,把技能生成统一成『每段证据该怎样编辑当前技能』这一局部决策问题,再用 rollback reward 提供监督。

全文最核心的创新是 rollback reward:与其直接拿『编辑后技能跑下游任务的总分』当奖励(因为答对可能是 worker 自己强、或者题目简单,与编辑无关),不如做一次公平对照——给这次编辑配一条与之证据相关的锚定查询 $q_{anc}^t$ 和 verifier $V_t$,先让 worker 用旧技能 $z_{t-1}$ 答一遍拿到 $a^{ctrl}$ 和控制分 $r^{ctrl}=V(a^{ctrl})$,再让 worker 用编辑后的技能 $z_t$ 答同一题拿到 $a^{edit}$ 和 $r^{edit}=V(a^{edit})$,由两者的相对优劣判定该编辑的好坏。形式化上奖励定义为:若该候选动作不是 NOOP 且 $r^{edit}_i>r^{ctrl}$ 给 1;若该候选是 NOOP 且没有任何其他有效编辑能超过 $r^{ctrl}$ 也给 1(即『不动才是对的时候奖励不动』);否则给 0。这个设计把『技能价值只能靠下游行为体现』这一根本困难,转成了『同一锚定查询上的可对照局部信号』,让 GRPO 能在编辑级别做信用分配,是与一切基于文本合理性或一次性执行打分的方法的本质区别。

方法步骤详情

完整流程分训练和推理两条线。训练时,先由 DeepSeek-V4-Pro 在 CL-Bench、SpreadsheetBench、tau2-bench 训练集上合成符合 `+` 格式的编辑轨迹,过滤后做 SFT 暖启动(8 GPU、batch 32、micro-batch 1、seq 32768、lr $5\times10^{-6}$、warmup 0.05、cosine、3 epochs)。随后进入 GRPO(group size $G=8$、batch 8、actor lr $5\times10^{-7}$、rollout 温度 1.0、熵系数 0.001、最大 prompt 8192、最大响应 32768、KL 关闭)。每个训练单元是一个局部编辑态 $(z_{t-1}, x_t, q_{anc}^t, V_t)$:先用旧技能答锚定查询得 $r^{ctrl}$;从旧策略采 $G$ 个候选动作 $A_t^{(1)},\dots,A_t^{(G)}$;逐个应用到当前技能得到 $z_t^{(i)}$,再用同一 worker、同一 verifier 跑同一查询得 $r^{edit}_{t,i}$;按公式换算成 rollback reward;最后用 GRPO 更新 $\pi_\phi$。动作空间 $\mathcal{A}=\{\text{CREATE, UPDATE, MERGE, PRUNE, NOOP}\}$:CREATE 补缺失规则、UPDATE 修不准的规则、MERGE 合并重叠、PRUNE 删误导或过度具体内容、NOOP 保持不动。证据预处理统一:document 类长文按自然段切成有序片段,experience 类把每条轨迹序列化为含任务身份、关键步骤、环境反馈的紧凑视图(每批最多 4 条轨迹、每条最多 8 步、3000 字、prompt 上限 8192 token)。推理时则没有奖励,就是顺序读证据、逐步编辑、最后输出 $z_T$ 注入 worker。

技术新颖性

和已有技术的本质区别有四点。第一,相对 document-to-skill 的 Ctx2Skill/AutoSkill(专为压缩长文设计)和 experience-to-skill 的 Trace2Skill/SkillX/SkillPro(专为蒸馏轨迹设计),Skill-α 用同一套渐进编辑框架吃两种异构证据,是方法层面的统一。第二,相对 Anthropic Skill-Creator、Progressive Prompt Skill 这类『反复用固定 prompt 改写技能』的做法,Skill-α 训练的是一个可学习的编辑策略,消融证明反复套固定 prompt 收益不稳定、甚至低于无技能基线。第三,相对把 RL 用于工具调用、网页搜索(ToolRL、Search-R1)或记忆管理(Memory-R1、Mem-α)的工作,技能生成的难点在于没有事实正确性可判,必须靠行为变化衡量;rollback reward 正是针对这个差异设计的局部对照信号。第四,理论上附录 A 证明了在 verifier 校准的前提下,期望 rollback reward 保持理想偏序,对二元 verifier 还给出精确的成功概率排序,为这种局部奖励提供了理论支撑。

An overview of Skill-α.
Figure 1: An overview of Skill-α.

实验结果

实验分三条线逐一验证。Document-to-skill 上(Table 2,CL-Bench),在 GPT-4o worker 下 Skill-α 把最难的 Procedural Task Execution 从无技能的 4.30 拉到 9.68,远超 Anthropic Skill-Creator 的 5.38、AutoSkill 的 3.23、Ctx2Skill 的 4.30,说明它不是简单截短上下文而是把程序性约束转成了可执行技能;四个类别平均达到 10.38,比最强基线高 3.3 个点。Domain Knowledge Reasoning(5.88)与 Empirical Discovery & Simulation(5.03)也居首或并列居首,Rule System Application 维持在 20.91 接近 NO SKILL,说明生成的技能既适合程序类也适合推理类。跨 worker 上,用 Claude-Sonnet-4.5(只吃 GPT-4o 生成的技能)Skill-α 在四个类别全部最佳或并列最佳,平均 9.55,证明学到的是可迁移的结构化知识而非 GPT-4o 专属 shortcut。Experience-to-skill 上(Table 3)优势更大:GPT-4o 下 SpreadsheetBench 从 18.00 提到 27.50,tau2-bench 的 Airline 从 40.00 提到 65.00、Telecom 从 12.50 提到 22.50、Retail 与 SkillX 并列 80.00,tau2 平均 55.83(比最强基线 SkillPro 的 49.17 高 6.7 个点);Claude worker 下 tau2 平均再涨到 70.33。消融(Table 4)显示完整模型在三个基准上比 SFT only 分别高 +6.92/+12.00/+11.66;去掉 rollback reward 后性能塌到 3.68/17.00/46.67,几乎与 SFT only 持平,证明 rollback 是把局部编辑绑到下游提升的关键信号;去掉 MERGE/PRUNE 后 tau2 平均暴跌到 39.17,说明技能需要显式合并与删除而非只增不减;去掉 NOOP 仍有 9.55/22.00/53.33(避免『全靠不动偷懒』的质疑),但完整模型始终更好。证据分析(Table 5)表明方法对证据顺序相当鲁棒(source/shuffled/reverse 在 tau2 上分别为 55.83/51.67/57.50),却对批量大小敏感:每批 4 个证据单元最优,1/2 或 8 个都退化(tau2 分别为 47.50/53.33/48.33),说明渐进生成依赖合适的证据粒度而非越多越好。

Document-to-skill results on CL-Bench.
Table 2: Document-to-skill results on CL-Bench.
Experience-to-skill results on SpreadsheetBench and tau2-bench.
Table 3: Experience-to-skill results on SpreadsheetBench and tau2-bench.
Ablation study.
Table 4: Ablation study.
Analysis of evidence order and batch size.
Table 5: Analysis of evidence order and batch size.
Training dynamics and rollout action distribution under the main ablations.
Figure 2: Training dynamics and rollout action distribution under the main ablations.
查看结构化数据
任务指标本文基线提升
CL-Bench document-to-skill (GPT-4o worker, 4类平均) Pass rate (%) 10.38 最强基线 Progressive Prompt Skill 7.11 / Ctx2Skill 7.07 +3.3 个百分点(相对 NO SKILL 8.57 提升 1.81;相对最强生成基线提升 3.3)
CL-Bench Procedural Task Execution (GPT-4o) Pass rate (%) 9.68 NO SKILL 4.30 / Anthropic Skill-Creator 5.38 相对 NO SKILL +5.38,是所有方法中增益最大的一列
tau2-bench experience-to-skill (GPT-4o, Airline/Retail/Telecom 平均) Pass rate (%) 55.83 最强基线 SkillPro 49.17 +6.7 个百分点;相对 NO SKILL 33.33 提升 22.5
tau2-bench Telecom (GPT-4o) Pass rate (%) 22.50 SkillPro 20.00 / NO SKILL 12.50 从最难提升的子任务上拿到最大相对增益(+10)
SpreadsheetBench (GPT-4o) Pass rate (%) 27.50 Anthropic Skill-Creator 26.00 / NO SKILL 18.00 +9.5 相对 NO SKILL
CL-Bench 跨 worker 迁移 (Claude-Sonnet-4.5, 4类平均) Pass rate (%) 9.55 最强迁移基线 AutoSkill 8.40 +1.15,证明技能可跨 worker 复用

局限与改进

作者在正文与附录 E 明确列出三点局限。第一,理论结果只是局部排序保证:单次 rollback 比较是对单条锚定查询的嘈杂二元信号,既不估计期望分差,也不保证反复局部更新能让最终技能在其任务家族整体变好。第二,奖励与 verifier 接口仍然强依赖 benchmark:CL-Bench 用 GPT-5.5 按 rubric 判分,SpreadsheetBench/tau2-bench 用环境执行反馈,迁移到新环境还得额外设计评估协议和比较准则,工程成本不低。第三,动作空间和技能表示刻意保持简单、纯文本(SKILL.md 风格),尚不支持结构化、多模态或可执行的技能产物。我自己还观察到两点:证据批量大小这一超参对 tau2 影响显著(最佳 55.83,过大 8 单元只有 48.33,过小 1-2 单元 47.50-53.33),说明方法对『证据粒度调参』有隐藏依赖;同时 Rule System Application 在 GPT-4o 下并未明显超过 NO SKILL(20.91 vs 21.82),暗示当 worker 本身就擅长、规则又偏事实匹配时,技能带来的增益可能被噪声抵消。

独立分析的弱点

第一,奖励信号过于局部且嘈杂。单条锚定查询只能给出二元对比,遇到 worker 本身就答对/答错的题目时信号会被掩盖。改进方向是引入多条锚定查询做蒙特卡洛估计、或用 verifier 分数差(而非是否超过)作为更细粒度的奖励,把『过/不过』升级为『提升了多少分』。第二,对 verifier 的强依赖让方法难以泛化到没有现成评判器的真实业务场景。改进方向是训一个通用的『技能价值评估器』或用 self-consistency、LLM-as-judge 的可迁移打分替代 benchmark 端反馈,降低换环境的工程负担。第三,动作空间和技能形态过于受限(纯文本、5 个离散动作),无法表达多模态步骤、条件分支或可执行代码这类技能。改进方向是把动作空间扩展为结构化编辑(如 AST 级操作)或多模态 patch,让技能从『说明书』进化为『可执行模块』。第四,证据批量大小的强敏感性(Table 5 中 4 最优、2 和 8 都退化)是隐性脆弱点,实际部署时不同任务的证据密度差异很大。改进方向是让模型自己学会『何时该攒多少证据再编辑』,把 batch size 也纳入 RL 决策而非人工设死。第五,worker 固定为强模型(GPT-4o/Claude-4.5),当 worker 较弱或风格不同时技能是否仍有效未做系统检验。

未来方向

作者明示的延伸包括:更强的通用 verifier、更丰富的多模态技能格式、以及超越局部 rollback 比较的更长程训练信号。基于这些成果还可顺势延伸出几条更具应用价值的路线:一是把 rollback 思想从『单步编辑对照』扩展为『整条编辑序列的回报估计』,结合 Monte Carlo tree search 风格的规划让技能生成具备前瞻性;二是把技能编辑策略与 worker 联合优化,研究『技能→worker』的协同训练而非永远冻结 worker;三是引入技能库管理(检索、版本化、冲突消解),让渐进生成从单条技能扩展到技能生态系统;四是在自我改进(self-improving agent)框架下,把 experience-to-skill 的在线学习闭环跑起来,让 agent 在部署中持续编辑自己的技能库。

复现评估

复现门槛中等偏高、可操作性较好。利好方面:作者公开了代码仓库(https://github.com/ejhshen/skill-alpha);关键超参写得非常细——SFT 用 8 GPU、batch 32、seq 32768、lr $5\times10^{-6}$、3 epochs;GRPO 用 group size $G=8$、actor lr $5\times10^{-7}$、rollout 温度 1.0、熵系数 0.001、KL 关闭、prompt 8192/响应 32768;基础模型明确是 Qwen3-8B;warm-start 数据用 DeepSeek-V4-Pro 合成、verifier 在 CL-Bench 用 GPT-5.5。但成本壁垒不容小觑:训练需要 8 张 GPU、最长 32768 token 序列,且 SFT 阶段需要先用 DeepSeek-V4-Pro 合成过滤数据,RL 阶段每次 rollback 都要调用固定 worker(GPT-4o)跑锚定查询,API 费用会随 group size 和训练步数线性堆高;附录还提到经验类每条轨迹需采样多条 GPT-4o 执行,整个数据准备与训练链路对算力和 API 预算都有相当要求,个人/小团队复现需要先准备充足的预算。