MUSE-Autoskill:通过技能创建、记忆、管理与评估实现自演化智能体 MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
以技能全生命周期管理为核心,让LLM智能体自主创建、评估、精炼并跨智能体迁移可复用技能
前置知识
ReAct 智能体循环
ReAct 让LLM在推理-行动-观察循环中迭代求解任务:每轮生成计划 (Plan)、调用工具 (Action)、读取结果 (Observation),三段拼成上下文再决策下一步。是当前工具调用型智能体的基础范式。
MUSE-Autoskill 的整个智能体循环建立在 ReAct 之上,技能创建、检索、评估都是在该循环的工具调用节点上触发。理解 ReAct 的状态推进机制是看懂图 2/图 3 架构的前提。
技能 (Skill) 与 SKILL.md
本文沿用 Anthropic Agent Skills 的格式:技能是结构化目录,包含 SKILL.md (接口说明) 及可选的 scripts/、resources/、tests/ 子目录。智能体通过渐进式披露加载目录选择技能,然后按 SKILL.md 调用脚本或读取资源。
技能是 MUSE-Autoskill 的一等公民,所有非内置能力都必须以技能包形式存在。这一标准化格式是 MUSE 能实现跨智能体迁移的基础——其他智能体只要遵循同样的目录约定就能复用生成的技能。
单元测试驱动的评估
单元测试指在 tests/ 目录预设输入-输出对,运行脚本验证实际输出是否匹配预期。测试失败时回传错误栈,触发自动精炼 (refinement)。MUSE 把这一传统软件工程实践迁移到 LLM 技能的质量门控上。
测试是 MUSE-Autoskill 与既有自动技能方法最关键的差异点。AutoSkill/EvoSkill 等用执行反馈或对比归纳,但只有 MUSE 把单元测试作为技能注册到技能库的硬性门控,这直接决定了生成技能的可靠性。
上下文压缩与KV缓存
上下文压缩指在长对话中用摘要替代原文以降低 token 消耗;KV缓存是推理引擎对已计算的注意力键值对的重用,可显著降低重复 prompt 的成本。MUSE 设计了两级自适应压缩 (L1 单节点摘要、L2 段落合并) 来应对长视野任务。
长视野任务是 MUSE 要解决的核心痛点之一 (论文明确指出四个 gap 中的 poor context handling)。理解压缩与缓存对于读懂图 4 的 DAG 设计和表 6 的成本对比至关重要。
SkillsBench 基准
SkillsBench 是专门评估技能使用对智能体影响的基准:94 个真实任务在隔离 Docker 容器中由自动验证器打分,覆盖科学工程、数据分析、文档处理、运维规划等领域。本文评测了其中 51 个所有参与智能体都能跑通的任务。
SkillsBench 是 MUSE 全部实验的载体。理解其任务结构 (Docker 验证器、二元/连续奖励) 与评估协议 (5 次独立运行的宏平均) 才能看懂表 2 到表 5 的对比设计与 +15.2 pp 这种提升幅度的实际含义。
研究动机
现有自动技能系统普遍把技能当作一次性生成的孤立产物,存在四个具体缺口。其一是创建-使用脱节:AutoSkill、EvoSkill、SkillGen 等方法在离线阶段合成技能后再注入智能体运行循环,技能创作时看不到智能体真实运行时的上下文,导致生成的技能与实际调用场景不匹配。其二是缺乏结构化的技能级记忆:Reflexion、ExpeL 等把反思存到全局记忆流,但没有任何方法把经验绑定到具体技能上,跨任务复用时只能凭描述匹配,无法携带该技能上次在哪些场景失败的元信息。其三是技能未经单元测试验证:Voyager 用环境自反馈、Anthropic Agent Skills 留给人类作者,既无法保证可靠性,也难以自动触发精炼。其四是长上下文处理薄弱:扁平对话历史在长视野任务中容易截断或溢出。MUSE 论文在 SkillsBench 上量化了这一痛点——三个 GPT-5.5 智能体无技能基线仅 47.89% 到 53.19%,说明即便最先进模型也需要结构化、可复用的能力单元才能突破性能上限。
本文的目标是本文的具体目标是设计一个以技能全生命周期为中心的智能体框架 MUSE-Autoskill (Memory-Utilizing Skill Evolution),让智能体通过统一的创建-记忆-管理-评估-精炼五阶段管线持续提升任务求解能力。具体包括四个可度量目标:(1) 把技能创作嵌入运行时 ReAct 循环,通过内置 skill_create 工具在调用现场合成技能,消除创建-使用脱节;(2) 引入新颖的技能级记忆,每个技能附带 .memory.md 累积跨任务经验;(3) 用单元测试加执行反馈作为技能注册到 Skill Bank 的硬门控,测试失败自动触发精炼;(4) 设计 DAG 结构的两级自适应上下文压缩与跨会话状态持久化,支撑长视野任务。最终在 SkillsBench 的 51 个任务上同时验证:人类技能能否提升性能、智能体能否从自身成功轨迹自动蒸馏技能、生成的技能能否跨智能体无损迁移。
与已有工作不同的是,本文的独特切入角度是首次把完整生命周期整合到单一 training-free 框架中,并强调技能作为外部化、可测试、可迁移的知识资产。既有工作要么只覆盖生命周期的一段:Voyager 覆盖创建加部分评估但无记忆,Anthropic Skills 标准化格式但评估/精炼交给人类,Skill1/SkillOS 用 RL 联合训练但技能与策略耦合难以迁移。MUSE 论文在表 1 中明确比较:所有 training-free 方法都部分覆盖,而 MUSE 是唯一同时具备完整生命周期、跨智能体迁移、training-free 三个属性的工作。更关键的是,本文是首个通过显式跨智能体实验 (把 MUSE 生成的技能原封不动注入 Hermes) 验证技能可作为通用知识单元迁移的工作——其他工作的可迁移性仅限于同一智能体家族的不同 LLM backbone,不构成真正的跨智能体证据。
核心方法
MUSE-Autoskill 的整体思路是把技能从一次性生成产物重定义为长期演化的能力资产,通过统一生命周期 (Creation-Memory-Management-Evaluation-Refinement) 闭环管理。直觉上,就像一个工程师团队把重复出现的解决方案沉淀为可复用的代码库、配套单元测试、维护更新日志,MUSE 把这一软件工程实践完整地搬到 LLM 智能体上。技术上由四块组成:(a) 主智能体在 ReAct 循环中通过内置 skill_create 工具按需合成技能包 (SKILL.md 加可选 scripts/ 加 tests/);(b) 多级记忆系统 (短期对话、长期笔记、新颖的技能级 .memory.md) 累积跨任务经验;(c) 技能库管理包含检索 (启动时注入目录) 加三种维护操作 (精炼/合并/剪枝);(d) 沙箱加单元测试驱动的评估子系统作为质量门控,测试失败自动 patch。整个系统 training-free,所有技能都来自运行时合成或人类注入,使能力具备可外部化、可测试、可跨智能体迁移的特性。
核心创新点是把技能创作嵌入运行时 ReAct 循环,并配套技能级记忆加单元测试门控形成自演化闭环。和 AutoSkill/EvoSkill/SkillGen 等离线合成方法相比,本质区别在于:MUSE 的技能创作发生在智能体意识到现有能力不足的瞬间,技能接口、脚本、测试都由同一个 ReAct 上下文直接生成,避免了创作-使用脱节;和 Voyager 的环境自反馈相比,MUSE 引入结构化 .memory.md 把经验按技能维度组织而非按时间顺序堆叠;和 Anthropic Skills 相比,MUSE 把单元测试作为技能注册的硬门控而非可选规范。最关键的差异化证据是表 1 中 MUSE 是唯一同时勾选创建-记忆-管理-评估-精炼-跨智能体-training-free 七项的工作——其他方法最多覆盖 4 项。
方法步骤详情
方法分四步运行。第一步任务初始化:主智能体读取系统 prompt 中注入的技能目录,结合多级记忆在 ReAct Planning 阶段决定复用、合成新技能还是直接推理。第二步技能按需创建:当现有技能不足时智能体在 Action 阶段调用内置 skill_create,给出意图规约,由 Skill Creator 生成完整技能包 (SKILL.md + scripts/ + tests/ + resources/),各组件在同一 ReAct 上下文合成。第三步评估-注册门控:新技能必须通过 tests/ 单元测试才能注册 Skill Bank;失败时 Refiner 根据错误栈 patch 后重测,循环至通过或永久失败;通过后观察追加到 .memory.md 形成技能级记忆。第四步稳态运行:智能体通过目录检索定位技能,沙箱隔离执行 scripts/,结果回灌 ReAct;失败触发精炼、重叠触发合并、长期未用触发剪枝;上下文层面 L1 单节点压缩改写超阈值轮次 (若仍超预算则 L2 多轮合并),原始节点保留在 history_prev/history_next 链以便恢复。
技术新颖性
新颖性体现在四个层面。第一,把技能创建下沉到运行时——skill_create 作为内置工具暴露给 ReAct 循环,使技能生成可访问完整上下文 (含失败观察、当前任务状态),论文用 creation-usage mismatch 命名这一缺口,prior work 中无人显式做到。第二,技能级记忆作为新层级被形式化引入:每个技能配 .memory.md 累积跨任务失败模式、输入格式怪癖;hvac-control 回归案例展示细粒度记忆如何揭示分布外脆弱性。第三,DAG 两级压缩 (图 4) 用 history_prev/history_next 与 mutable parent_id 双指针解耦完整历史与活跃链,KEEP_FIRST/KEEP_LAST 避免重要提示被压到中段——这是智能体层而非 token 层的方案。第四,跨智能体迁移实验把 35 个技能文件原样注入 Hermes,把可迁移性从换 backbone 上升到换智能体架构。从信息论视角可形式化为将技能库 $|\mathcal{S}|$ 与经验量解耦,使 $|\mathcal{S}|$ 受合并/剪枝保持紧致。
实验结果
SkillsBench 51 任务 5 次宏平均得三组结果。技能使用价值 (表 2):三个 GPT-5.5 智能体有/无人类技能下达 Codex 52.11%→67.28% (+15.17 pp)、Hermes 47.89%→61.21% (+13.33 pp)、MUSE 53.19%→68.40% (+15.21 pp),MUSE 三条件领先。自动生成 (表 4):MUSE 在 35/51 = 68.6% 任务合成成功,整体 53.19%→60.35%;35 任务子集 Phase 2 精度 87.94% 超人类技能参考 68.40%,瓶颈在 Phase 1 覆盖率。跨智能体迁移 (表 5):Hermes 用 MUSE 生成技能从 47.89% 升到 58.40% (+10.51 pp),弥合 79% 人类技能差距,与 MUSE 自用仅差 1.95 pp。效率 (表 6):生成一次性 383K/164 s;MUSE 用生成技能 493K/411 s 比人类技能省 20% tokens、37% 时延。评分 $\text{Acc}=\frac{1}{N}\sum r_i$。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SkillsBench (51 任务宏平均, 全部 4 域) | Accuracy (%) | MUSE-Autoskill = 68.40% (含人类技能) / 60.35% (含自创技能) / 53.19% (无技能) | Codex = 67.28% / 52.11%; Hermes = 61.21% / 47.89% | MUSE 在三种条件下均最优,比 Codex/Hermes 同条件高 +1.12 到 +7.19 pp;含人类技能相对无技能提升 +15.21 pp |
| SkillsBench 数据分析域 (15 任务) | Accuracy (%) | MUSE w/ hum = 61.78% (最佳) | Codex w/ hum = 60.22%; Hermes w/ hum = 47.39% | 相对 Codex 同条件 +1.56 pp,相对 Hermes 同条件 +14.39 pp |
| SkillsBench 文档处理域 (9 任务) | Accuracy (%) | MUSE w/ hum = 88.89% (最佳) | Codex w/ hum = 84.44%; Hermes w/ hum = 82.22% | 相对 Codex 同条件 +4.45 pp,相对 Hermes 同条件 +6.67 pp |
| SkillsBench 运维规划域 (13 任务) | Accuracy (%) | MUSE w/ hum = 57.08% (最佳) | Codex w/ hum = 51.38%; Hermes w/ hum = 50.08% | 相对 Codex 同条件 +5.70 pp,相对 Hermes 同条件 +7.00 pp |
| SkillsBench 科学工程域 (14 任务) | Accuracy (%) | MUSE w/ hum = 72.86% | Codex w/ hum = 78.57% (最佳); Hermes w/ hum = 72.86% | MUSE 比 Codex 落后 5.71 pp,归因于 3 个边界任务验证器对方法选择敏感 |
| MUSE 自创技能子集 (35 任务, 生成成功) | Accuracy (%) | MUSE w/ generated = 87.94% (Phase 2) | MUSE w/ hum = 68.40% (全 51 任务人类技能基线) | +19.54 pp,超过人类技能参考,证明从成功轨迹蒸馏的技能编码了高度任务相关的知识 |
| 跨智能体迁移 (Hermes + MUSE 生成技能) | Accuracy (%) | Hermes w/ MUSE-generated = 58.40% | Hermes w/o skills = 47.89%; Hermes w/ hum = 61.21% | +10.51 pp 弥合 79% 人类技能差距,与 MUSE 自用同组技能仅差 1.95 pp |
局限与改进
作者在 Limitations 一节坦诚承认四点。其一,覆盖面不全:评估仅覆盖 51/94 个 SkillsBench 任务,被排除的任务 Docker 环境更复杂,报告数字可能高估系统整体性能。其二,技能生成覆盖率仅 68.6% (35/51),且每个技能都从单一成功轨迹蒸馏,可能不代表最一般化解法。其三,跨智能体迁移只验证了 MUSE 到 Hermes 单向,更多智能体间的迁移尚未证实。其四,5 次运行的置信区间较宽,二元奖励任务尤其明显。我自己的额外观察:(a) Phase 1 全失败的 16 个任务被记 0 分拉低均值,可能掩盖真实生成质量;(b) 案例 (iv) hvac-control 的 80% 到 20% 回归显示技能可能编码源轨迹特定的假设,分布外稳定性不足;(c) 单元测试在二元奖励任务中容易过拟合验证器——技能可能被训练成通过 tests/ 但任务实际失败,论文未给出这种风险的量化分析;(d) 跨会话状态持久化虽提及但缺独立实验支撑;(e) SkillsBench 任务粒度较粗 (一个技能覆盖一类任务),但论文未测试技能在相似但未见过任务上的零样本泛化能力。
独立分析的弱点
独立分析三个关键弱点。第一,技能测试可能与任务验证器脱节:tests/ 由 skill_create 在生成时同步写出,并非独立设计,存在测试通过但任务失败的循环风险;hvac-control 案例 (回归 80% 到 20%) 即源于这种弱耦合——标定窗口特定、增益分布外不稳定。建议引入对抗测试或独立验证集作为二次门控,并在技能注册时强制包含跨任务稳定性指标。第二,技能生成的覆盖率受 Phase 1 基线能力天花板限制:16 个无技能任务全部来自 Phase 1 完全失败的场景,等于把所有失败任务的风险转嫁给智能体自身。建议从部分成功或失败轨迹中提取诊断型技能 (例如如何正确设置 Apache Flink 环境变量),而非要求完整成功。第三,跨智能体迁移只验证了嵌入 Hermes 后精度提升这单一指标,没量化迁移过程中的知识损失或误解风险——技能 SKILL.md 长度是人类的 2.2 倍 (图 6),Hermes 在调用时实际读了哪些部分、是否因冗长描述而过早放弃,都缺乏细粒度追踪。建议增加技能调用 trace 可视化与 token 级别归因分析。
未来方向
作者在 Limitations 末段与 Section 5 部署展望中给出三个明确方向:(1) 把评估扩展到全部 94 个 SkillsBench 任务而非当前 51 个;(2) 在 GPT-5.5 之外验证其他 backbone (例如开源 LLM、不同规模模型);(3) 在 SkillsBench 之外的独立基准上测试技能生成与跨智能体迁移。基于成果可延伸的方向包括:(a) 把技能生命周期扩展到多智能体协作场景 (Section 5 提到的 ArkClaw 计划把整个智能体封装为可调用子智能体);(b) 在 .memory.md 中引入结构化字段 (失败模式分类、输入分布元数据) 而非自由文本,便于检索与去重;(c) 探索技能市场的激励机制——SkillMarket 部署提示可以引入用户评分、技能版本化、A/B 测试框架;(d) 把单元测试思想推广到非代码技能 (例如纯指令型技能),需要新的评估契约;(e) 与持续学习结合——研究技能库在任务分布漂移下的演化动力学,避免技能过时与负迁移。
复现评估
复现整体可行但门槛较高。代码层面,作者隶属 ByteDance ByteBrain,提及 SkillMarket/ArkClaw/SkillHub 已部署,但正文未给官方开源仓库链接,需联系作者或自行实现。数据层面,SkillsBench 公开,51 任务筛选规则在 4.1 节明确 (排除 Docker 故障任务),附录 A 列完整清单。算力层面,3 智能体×51 任务×2 条件×5 runs = 1530 次单任务运行,加技能生成实验共 2000+ 次;按表 6 中位 411–684 秒/任务,单卡串行约 12–19 天,并发可压到 1–2 天。模型层面全部用 GPT-5.5 backbone,需相应 API 配额 (按 493–615K tokens/任务×5 runs×51 任务 ≈ 130–160M tokens 仅生成实验)。配置层面,技能生成 164 s 加测试执行需 Docker 镜像与沙箱基础设施。总体难度中高——架构与协议清晰,但缺开源代码与官方训练细节 (prompt 模板、KEEP_FIRST/KEEP_LAST 具体取值),独立复现仍需较多工程投入。
论文图表