ContinualSkillBench:评估 LLM 智能体能否持续演化自身技能的动态基准 ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
提出评估智能体在长任务流中持续学习与技能演化的动态基准
前置知识
Agent Skills(智能体技能)
指以结构化文档(通常是带 YAML front matter 的 SKILL.md)形式存在的可复用知识包,记录某种可执行的方法、流程或领域规则,供智能体在后续任务中加载和调用。已被 Claude Code、Codex 等主流平台广泛采纳。
理解本文必须先知道「技能」是一种独立于参数权重的显式外部知识载体,论文核心就是考察智能体能否自主从经验中合成、修订并复用这种技能。
In-Context Continual Learning(上下文持续学习)
在不进行参数微调的前提下,利用长上下文窗口,让智能体在序列任务中动态更新和检索不断增长的技能库或记忆,从而实现「终身学习」。它绕开了传统参数更新导致的灾难性遗忘问题。
本文正是基于这一范式设计的,基准要测量的就是该范式在真实复杂任务流中的能力上限,是理解实验设置的前提。
Catastrophic Forgetting(灾难性遗忘)
神经网络通过梯度下降在新任务上微调时,会大幅覆盖掉旧任务上学到的权重,导致旧能力急剧退化。这是传统参数式持续学习的主要障碍。
论文选择上下文式而非参数式持续学习,正是为了规避该问题,理解它有助于理解方法路线的动机。
Skill Dependency Graph(技能依赖图)
通过对任务两两配对让 LLM 判断「先做 A 是否能为 B 提供可迁移技能」,构建有向图 $G=(V,E)$,边 $A \to B$ 表示 A 可为 B 提供技能支撑。再结合难度约束做拓扑排序,得到由易到难、便于技能复用的任务序列。
这是基准构建的核心算法,理解它才能理解为何任务序列能提供技能复用机会,以及为何要做结构验证实验。
研究动机
主流智能体框架(如 Claude Code、Codex)依赖外部技能库来弥补预训练权重在领域专业任务上的不足。已有工作(SkillsBench)证明,给定人类专家手写的优质技能,智能体在对应任务上表现显著提升。但问题是:完全靠人工为每个领域构建全面技能库既昂贵又不现实。在更现实的部署场景中,用户只提供任务描述和反馈序列,而现有评测(多数在孤立任务上、用固定技能文档评测)无法回答一个关键问题——智能体能否自主地从这些交互反馈中合成、演化出可复用的技能,并真正提升下游能力。少数探索性工作(SkillLearnBench、CL-Bench、SkillCraft)虽触及该方向,但要么只研究单一任务的种子实例扩展,要么只考察固定工具组合,缺乏对长期、异构、跨任务流中技能演化能力的系统评测。
本文的目标是构建一个专门评测智能体「持续技能演化」能力的动态基准 ContinualSkillBench。它要在五个具有真实价值的领域(Healthcare、Law、Math、Finance、Office)中,每个领域构造 100 个相互关联、按难度递增、且存在跨任务技能复用机会的子任务序列;通过对比「顺序执行(保留并更新技能库)」与「独立执行(每个任务从零开始)」的性能差异,量化智能体从经验中学习和迁移技能的能力,并进一步剖析显式技能维护相对于纯上下文适应的边际贡献。
与已有工作不同的是,本文的独特切入点是「长程、异构、跨任务流的技能演化」。区别于以往要么孤立评测、要么只研究单一重复任务的基准,ContinualSkillBench 的每个任务流都由多个来源、多种评测格式的任务组成,且由递归出现的核心技能而非单一执行流程串联。这使得基准能检验一个更具实用价值的问题:从任务 A 获得的经验能否被抽象为结构化技能,并在不同来源的下游任务 B 上复用。同时,作者还设计了结构验证实验,用语义匹配(余弦相似度 $\geq 0.85$)证明 69.5% 的任务都能复用先前遇到过的核心技能,从结构上确认了任务流确实蕴含复用机会。
核心方法
整体思路分三阶段。直觉是:复杂领域任务往往依赖一组共享基础技能,若把任务按「先易后难、先基础后高级、技能可传递」的顺序排好,智能体就有机会在前期把基础技能固化下来,后期复用。技术路线上,Phase 1 从约 3 万个跨五领域任务中采集;Phase 2 用 LLM 做技能标注与过滤、两两依赖判断构建有向图、再在难度约束下做拓扑排序、最后人工复核;Phase 3 让智能体在 Harbor 基础设施上,通过 Codex CLI / Claude Code 框架,以「任务介绍—执行—反思与技能更新」三回合协议完成 100 个任务,对比顺序执行与独立执行的性能差 $\Delta$。
核心创新是把「技能演化」当作一个可被结构化度量的对象,而非黑盒。已有方法假设技能库是静态且由人手写,本文反过来要求智能体在长任务流中自己生成和维护技能,并通过「技能依赖图 + 拓扑排序」人为制造复用机会,再用「语义级核心技能覆盖率」做后验结构验证。本质区别在于:它不评测单点技能好不好用,而是评测智能体能否把零散经验「压缩」成可检索、可迁移的抽象,并用「顺序 vs 独立」「显式技能 vs 纯上下文」两组对照实验把增益来源拆解清楚。
方法步骤详情
具体步骤:(1) 选定 Healthcare/Law/Math/Finance/Office 五域;(2) 按三层难度(基础经典集如 OlympiadBench/LawBench/TAT-QA、中级开放智能体集如 GAIA/ClawBench/MedAgentsBench、高级人类评测如 OMBench)混合约 3 万任务;(3) LLM 为每任务标注 1-8 个核心技能(知识/推理/工具/工作流/输出五类),剔除纯评测格式标签;(4) 每域采样 200 对任务双向判断(YES/PARTIAL/NO 共 400 条),用 GPT-5.4 裁判;(5) 以 YES 构依赖图,按难度分层、层内 Kahn 拓扑排序优先选出度大任务、遇环破环;(6) 人工复核;(7) 结构验证——用 Qwen3-32B 独立标核心技能、all-mpnet-base-v2 编码、阈值 $\tau=0.85$ 判语义对应;(8) 三回合评测:回合 3 收评测反馈后用 Create/Modify Skill 元技能更新库,更新自下一任务生效。
技术新颖性
技术新颖性体现在三方面。第一,评测协议本身:用「顺序减独立」的差值 $\Delta_{raw}=R^{seq}_{raw}-R^{ind}_{raw}$、$\Delta_{norm}=\tilde{R}^{seq}_{norm}-\tilde{R}^{ind}_{norm}$ 直接量化持续学习增益,并引入归一化奖励(只在两种设置都产出有效输出的交集任务上计算)规避格式解析偏差。第二,引入纯 ICL 对照(保留上下文与反馈但不允许创建/修改技能)和 RAG 对照(检索历史轨迹片段而非显式技能库),从而把增益拆解为「上下文适应」与「显式技能抽象」两部分。第三,技能质量评估用 GPT-4.1-mini 按 $\text{score}=\text{format}\times\text{content}$ 复合打分(格式不对直接归零),把「技能数量、复用频率、内容质量」三个维度同时纳入诊断,揭示弱模型的技能碎片化问题。
实验结果
核心发现:(1) 顺序执行普遍有益:15 个组合中 13 个原始奖励、14 个归一化奖励上升,绝对增益原始 +0.071、归一化 +0.078,相对基线提升 16.2%/16.9%。(2) 增益强依赖领域:Healthcare 归一化平均增益最大 +0.149,Finance+0.076、Law +0.058、Office +0.054、Math +0.052,唯一负增益 Opus 4.7 在 Math 上 −0.008;模型层面 GPT-5.3-Codex +0.098 最大、GPT-4o +0.077、Opus 4.7 仅 +0.058,基线最强的 Opus 增益反而最小,「会做题」≠「会从经验学习」。(3) 结构化任务更受益,如 GPT-5.3-Codex 在 Finance Numeric 上 +0.416,Rubric 仅 +0.038。(4) GPT-5.3-Codex 三域消融中独立/纯ICL/显式技能归一化为 0.466/0.605/0.602,显式技能整体未优于纯上下文,主要在 EM 与程序化输出上占优,纯 ICL 在开放题更强,证明增益多来自上下文适应而非技能抽象。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Healthcare 顺序执行(GPT-5.3-Codex) | Normalized Reward | 0.620 | 0.380(独立执行) | +0.240(绝对)/ +63.2%(相对),为所有组合中最大 |
| Finance 顺序执行(GPT-5.3-Codex) | Normalized Reward | 0.556 | 0.432 | +0.124,Numeric 子项从 0.417 提升至 0.833 |
| Law 顺序执行(GPT-5.3-Codex) | Normalized Reward | 0.629 | 0.585 | +0.044,EM 从 0.875 升至 0.975 |
| 显式技能 vs 纯 ICL(Healthcare,GPT-5.3-Codex) | Normalized Reward | 0.620(Sequential 显式技能) | 0.655(纯 ICL) | −0.035,显式技能反而落后,但程序化子项 0.500 vs 0.250 仍占优 |
| 技能质量评分(Overall) | Avg. Quality Score(GPT-4.1-mini 打分,满分约9) | GPT-5.3-Codex 7.94(共 205 条技能) | GPT-4o 5.68(共 384 条技能) | 强模型技能更少但质量更高,验证碎片化假设 |
局限与改进
作者承认三方面局限。其一,虽然覆盖五个核心领域,但每个领域的任务仍来自固定的源数据集,真实部署中智能体会遇到稀有边缘案例、分布漂移、与基准格式差异很大的指令,这些长尾场景未被充分覆盖。其二,受限于顺序智能体评测的高时间与 API 成本,只评测了 GPT-4o、GPT-5.3-Codex、Claude 4.7 Opus 三个代表性模型和 Codex CLI / Claude Code 两套框架,未穷尽其他 Claude/GPT/Gemini 变体,也未适配 Cursor、Google CLI 等其他智能体环境;不同模型和框架对记忆、技能检索、执行控制的处理差异很大,结论的普适性有待扩展。其三(个人观察),「核心技能」和「语义对应」都依赖 LLM(GPT-5.4、Qwen3-32B、GPT-4.1-mini)的判断,存在裁判模型自身偏差风险;且 $\tau=0.85$ 阈值虽有敏感性分析但仍是经验选取,可能高估或低估真实复用率。
独立分析的弱点
独立分析有四个弱点。第一,技能抽象质量不稳定:弱模型(GPT-4o)倾向生成大量任务特定的碎片技能(384 条 vs 强模型 205 条),平均质量分仅 5.68,复用率低,改进方向是引入「技能去重/合并」机制或显式的「抽象层级」约束提示。第二,开放任务上显式技能可能过拟合早期评测标准(如 Opus 4.7 在 Math Rubric 上 −0.192),可设计「技能版本化+定期回顾」或「技能适用边界标注」缓解。第三,评测只覆盖三个模型,对不同框架(记忆机制、检索策略)的差异未充分展开,建议扩展到更多模型和 Cursor/Claude Code 之外的环境。第四,技能生成完全依赖智能体自发反思,缺少主动探索或课程监督,可考虑引入「技能覆盖率监控器」——当某类核心技能长期缺失时主动触发练习任务,提升复用机会的捕获率。
未来方向
作者提出的方向包括扩大模型与基础设施覆盖(更多 Claude/GPT/Gemini 变体、Cursor/Google CLI 等),以及纳入更真实的长尾分布、分布漂移和异构指令格式。基于本文成果可延伸的方向有:(1) 把「技能依赖图排序」升级为在线自适应课程,让任务顺序随智能体当前技能缺口动态调整;(2) 研究跨领域技能迁移——能否把 Finance 的表格抽取技能迁移到 Law 的条款抽取;(3) 探索显式技能与参数微调的结合,例如用蒸馏把高频复用技能固化进权重,缓解上下文长度压力;(4) 把技能质量评分(format×content)做成训练信号,通过强化学习或对比学习直接优化技能生成;(5) 引入多智能体协作的技能共享与冲突消解机制。
复现评估
复现门槛中等偏高。有利因素:作者公开了源码(https://github.com/gtynnn060110-hash/continual-skill-bench-final),数据源全部来自公开数据集(OlympiadBench、GAIA、ClawBench、TAT-QA、LegalBench 等),评测协议、三回合 prompt、技能质量评估 prompt 都在附录完整给出,依赖图排序算法(Kahn 拓扑+破环)也有明确数学描述。不利因素:(1) 评测三个模型中 GPT-5.3-Codex 和 Claude 4.7 Opus 为闭源商用 API,GPT-4o 也需付费调用,单次完整跑五域×百任务×三模型×两设置的顺序评测 API 成本和时间都很高;(2) 基准构建阶段用了 GPT-5.4 做依赖判断、Qwen3-32B 做技能标注、GPT-4.1-mini 做质量评估,裁判模型需另行部署;(3) 依赖 Harbor 基础设施以及 Codex CLI / Claude Code 框架扩展,环境搭建需一定工程投入。整体上具备论文级可复现性,但完整复现全部实验对个人研究者成本较高。
论文图表