SkillEvo:多轮交互反馈驱动的技能自演化框架 SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
多轮用户模拟持续再生演化梯度,治理层主动修复结构退化,生产技能 TSR 提升 51.8 分
前置知识
Agent Skills(智能体技能)
一种可移植的知识模块,把某领域的知识与服务处理流程封装为文件集合:路由入口文件 SKILL.md(含 frontmatter 描述与主题路由表)加若干 reference 引用文件,智能体被问到位时按需加载并据此直接作答、无需转人工。本文场景中 9 个生产技能共含 98 个引用文件,构成路由节点指向知识节点、知识节点互相引用的有向图。
本文演化与治理的对象正是这套文本知识库,理解其文件结构才能看懂知识膨胀、引用断裂、事实过度泛化这些退化的定义。
多轮用户模拟
用 LLM 扮演真实用户与被测智能体进行多轮对话,逐步追问、澄清、必要时拒绝复杂操作,以暴露仅凭单轮问答无法发现的缺陷。τ-bench、SAGE 等工作用它评估任务型对话的可靠性,但都把轨迹当作一次性评判材料,判定成败后即丢弃。
SkillEvo 的核心动作就是把这个模拟器从评估终点改造成反馈生成器,这是理解全文设计的出发点。
演化梯度(evolution gradient)
借自梯度下降的隐喻,指驱动技能文本修订的反馈信号:每轮暴露的、可归因于知识缺口的失败及其证据。若评估方式只能暴露第一轮可见的缺陷,可见缺口修补完后梯度即衰减,演化曲线随之饱和、停滞。
论文的中心论点是演化的上限由反馈能否持续供给可信梯度决定,而非编辑能力或迭代次数,全文论证都围绕梯度的再生与方向控制展开。
双锚点事实一致性
治理层的硬约束:修订后的技能必须保有生产基线中的稳定事实,即 $ ext{Facts}(S_t) \supseteq \text{Facts}(S_0) \cap S_{\text{stable}}$。检查用两个锚点——以 $S_0$ 为锚检测跨轮累积的知识丢失,以上一轮 $S_{t-1}$ 为锚检测当轮新引入的事实错误,再全局查自相矛盾;单一锚点无法区分这两种退化来源,修复方向会变得含糊。
它是本文治理区别于标量门控的关键机制,也是读懂回退率 RegR 与膨胀率 Bloat 两个指标的前提。
渐进披露(progressive disclosure)
技能的知识组织方式:路由文件只含主题级索引,细节分散在按主题拆分的引用文件中,智能体按需加载,避免一次性注入超长上下文。治理检查器明确禁止跨文件去重,以维持这一性质和模型上下文的累积方式。
结构一致性的三类退化(膨胀、断裂、过度泛化)都是针对这种图状知识组织提出的,不理解它就无法理解治理诊断的对象。
研究动机
云服务客服场景中,技能(Skill)的维护仍依赖人工编写:真实工单里暴露的失败交互无法自动沉淀为可复用知识,人工维护的规模与延迟成为客服体系长期瓶颈。已有自我演化工作在两个层面存在结构性缺陷。反馈信号层面:Self-Refine 类方法无评估、无法区分真实知识缺口与模型自身盲区;SkillForge 一类单轮 QA 评估驱动的演化只能捕获用户开场陈述中可见的缺口——首轮修补完后梯度即衰减,实验中其 TSR 从 58.9 爬到 66.4 后边际收益锐减,且反馈驱动修订前不做归因筛选,不可修复的信号被错误编码为知识,造成文档膨胀与事实冲突。治理层面:现有治理依赖端到端验证分数做标量门控,只能拒绝退化的候选,既不能定位也不能修复其结构成因;SkillForge 的 append-only 策略更让技能无限膨胀。当技能已是路由表加引用文件构成的多文件有向图时,悬空引用、孤儿文件、事实过度泛化这类退化在标量分数空间里根本无法表达,因此既无法诊断也无法定向修复。
本文的目标是本文目标是构建闭环的技能自演化框架 SkillEvo,让生产系统中已升级到人工的失败工单自动转化为驱动技能持续改进的反馈,同时保证多轮修订序列收敛而非累积退化。具体有三点:其一,反馈必须同时满足可信性三条件——覆盖(所有关键意图都被提出且模拟忠实,$c_U=1$)、准确(对已暴露意图逐一对照人工参考解判定)、可归因(失败根因确为技能可修复的知识缺口);其二,修订必须有界且有向:只修证据支持的缺口、锚定生产基线 $S_0$,以事实一致性为硬约束、结构一致性为软约束,防止退化跨轮累积、梯度方向漂移;其三,可在生产环境部署:在腾讯云 6 大类服务、9 个生产技能、98 个引用文件、2000 张人工工单上验证有效性,且最终版本必须经人工确认后才上线。
与已有工作不同的是,本文的独特切入点是把多轮用户模拟从评估终点重造为反馈生成器。此前 τ-bench、SAGE 等已证明多轮模拟能暴露单轮测不到的错误,但轨迹一旦用于判定成败即被丢弃,失败案例既不区分可修复缺口与技能本身局限、也不回流给技能,评估与演化彼此割裂;SkillEvo 据作者所述是首个把多轮模拟对话回馈给技能演化的框架:意图状态机门控覆盖,双侧正交评估分离模拟失真,集体归因筛选可修复缺口并返回技能。第二个切入是把技能当作结构化知识系统来治理:与所有用标量分数或通过/失败门控候选的既有工作不同,SkillEvo 用 $S_0$、$S_{t-1}$ 双锚点把事实一致性变成可执行的 diff 检查,用图结构诊断把知识膨胀、引用断裂、事实过度泛化逐轮主动修复,治理从被动的标量门控转向诊断驱动的主动修复。与同期基于强化学习优化模型参数的 SEAD 不同,SkillEvo 演化的是文本知识库本身,无需训练、可审计。
核心方法
SkillEvo 的整体思路一句话可概括:让每一轮修订既消耗反馈、又生产新反馈,同时由独立治理层守住知识载体不退化。直觉上,多轮对话中的追问与澄清会逐层揭开缺陷——本轮修好的知识让对话得以推进到更深处,先前被浅层失败掩盖的下一层缺陷随即显形,梯度因此自我更新。技术路线是一个六阶段闭环:场景合成器从真实人工工单抽取意图议程、行为事实、情绪轨迹与人工参考解,构造受约束的模拟用户;用户代理 $U$ 与加载技能的服务代理 $\pi(S_t)$ 多轮交互产生轨迹 $\tau_t=\text{Interact}(U,\pi(S_t))$;验证器对照人工参考解判定成败并输出 $(r_t,f_t)$;归因器把失败按可修复性三分类,只把知识缺口投影为反馈 $L_t$;技能优化器执行有界修订 $S_{t+1}=\text{Update}(S_t,L_t,S_0)$;技能治理器检测结构退化并发出建议、并入下一轮。工程上组织为双层循环:内层每轮最多 3 次编辑—检查—修复迭代,外层最多 4 轮演化,每个检查点必须通过检查或完整评估才可持久化;编辑器与评估端分属不同模型家族(deepseek-v4-pro 与 minimax-m3),满足 Generator≠Evaluator 约束以杜绝自我审阅的循环依赖。
核心创新是演化梯度的自我更新机制。已有单轮 QA 驱动方法的失败面在第一轮即被完整观测:可见缺口修补完,梯度随之消失,TSR 在 66.4 附近饱和;Self-Reflection 更是既无梯度也无门控,四轮在 58.8 附近震荡。SkillEvo 利用多轮交互的分层暴露性质让每轮修订自然生成新梯度。与之配套的两个本质设计:一是双侧正交评估——模拟器侧只考核意图覆盖率 $c_U=|K_{\text{asked}}|/|K|$(覆盖率不足的样本被归为评估噪声、剔除出代理侧分母),代理侧只考核已暴露意图的加权命中率 $s_C=h\cdot\frac{\sum_i w_i a_i}{\sum_i w_i}$($w_i=\alpha=0.7$ 为关键意图权重,$h$ 为技能命中门控),两侧职责分离后,意图未提出或被失真提出的情况不会被误读为技能失败;二是归因器把失败按谁可修复分为知识缺口、能力上限、评估噪声三类,只有知识缺口进入反馈,并按语义相似度合并为 $L_t=\text{Merge}(\{f\in F_t\mid a_t(f)=\text{Knowledge Gap}\})$,聚焦跨样本共性而非逐实例噪声。治理侧的本质区别是把事实一致性做成可执行的双锚点硬约束而非标量门控,结构退化作为软约束逐轮消化。
方法步骤详情
完整流程分六步。① 场景合成:输入人工处理过的工单全量对话,输出开场白、行为事实、情绪轨迹与意图议程(关键/次要意图,须全部提出才允许正常终止);人工参考解单独交给验证器,绝不注入用户代理以防答案泄漏。② 多轮交互:受约束用户按渐进披露、碎片化发言、情绪随进展演化等规则与加载 $S_t$ 的服务代理对话,每张工单最多 10 轮;意图状态机记录每个意图是否已提出并被实质回应,杜绝提前终止与冗余轮次。③ 验证:对照人工参考按知识内容一致性打 0–100 分,达到 60 且不缺任务关键条件才算解决;规则写反、结论相反等事实性错误封顶 59。④ 集体归因:对照人工处理、模拟对话与验证证据,把失败分为知识缺口、能力上限、评估噪声三类,仅知识缺口经语义合并为 $L_t=\text{Merge}(\{f\in F_t\mid a_t(f)=\text{Knowledge Gap}\})$。⑤ 有界编辑:证据边界要求只修 $L_t$ 中验证过的缺口、数值/版本/链接逐字保留、禁止泛化为参见官方文档;引用边界锚定 $S_0$,新知识不覆写既有稳定事实;编辑器分 evolve(首轮驱动)、fix(检查失败后修复,接收双 diff)、refine(报告驱动,归纳 2–4 个共性问题)三种模式。⑥ 治理:独立检查器以 $S_0$ 查知识丢失、以 $S_{t-1}$ 查当轮新引入错误、全局查自相矛盾,违反即拒绝候选并当轮修复($S_0\to S_t$ 被删行定位需恢复的事实,$S_{t-1}\to S_t$ 变更行禁止回退);段落合并、尾部归并、超 700 行拆分等结构建议作为软约束并入下一轮。跨轮在开发集上选版 $S^*=\arg\max(\text{TSR}_{dev},\text{AvgScore}_{dev})$,评估集仅用于报告。
技术新颖性
技术新颖性可从三个对比看清。对单轮 QA 演化(SkillForge 及 SkillOpt、GEPA、TextGrad 等单轮范式):它们失败面在首轮完整观测、梯度单调衰减且不做归因筛选,SkillEvo 则以意图状态机保证覆盖、双侧正交评估隔离模拟失真、集体归因按根因三分并合并跨样本共性,是首个把多轮模拟对话回馈技能演化的框架。对既有治理(协同演化验证、RL 技能策展、审计式技能图自改进):此前一切治理都以通过/失败或标量奖励门控候选,退化只能从总分下滑间接推断、无法定位成因;本文指出当技能成为多文件有向图后,悬空引用、孤儿文件、事实过度泛化在标量分数空间中不可表达,因而把治理拆成两层——双锚点硬约束(可执行 diff 检查:$S_0$ 查丢失、$S_{t-1}$ 查新错)拒绝违规候选并触发当轮定向修复,图结构软约束(合并/归并/拆分建议)逐轮消化退化,从被动拒绝转向诊断驱动的主动修复。对 SEAD 等参数演化路线:SkillEvo 的演化对象是文本知识库,无需训练、人类专家可逐行复核,且能明确区分不可由知识修复的能力上限类失败。
实验结果
主实验(Table 2,评估集 TSR,初始均为 30.0):Self-Reflection 无反馈无门控,四轮在 58.8 附近震荡(59.2/58.7/57.4/58.8);单轮 QA 首轮梯度后衰减,58.9→64.5→65.7→66.4;SkillEvo 逐层暴露缺陷,59.4→71.3→77.9→81.8,较原始技能 +51.8、较自反思 +23.0、较单轮 QA +15.4,且已部署于腾讯云生产环境。消融(Table 3):把多轮交互换成单轮 QA 而保持归因/修订/治理不变,R4 恰为 66.4、与单轮 QA 基线完全一致,证明 15.4 分领先完全来自反馈源本身;去掉治理层 TSR 降 3.2 分至 78.6,说明治理价值在防退化而非提分。可信反馈(Table 4):意图覆盖率 $c_U$ 达 98.9%(低覆盖样本被隔离出修订回路);200 段模拟对话与真实工单的双专家盲评一致性 95.3%(意图表达、信息披露节奏、情绪轨迹三维);代理对已暴露意图的准确率 $s_C$=71.1%,正是演化梯度的直接来源。治理(Table 5、6):跨轮回退率 RegR 从 28.2 降至 21.1(首末变化 −7.1);有治理的累计膨胀仅 +2.8%(集中在首轮后趋稳),无治理达 +16.2%、近 6 倍;TSR 提升 51.8 分而篇幅几乎不变,说明能力提升来自正确修订既有知识而非堆文本。验证器与领域专家判定一致性超 90%。案例研究(附录 D):代理把 COS 流量包续费规则说反(声称立即生效,实际为延长有效期、重置日发放新额度),验证器打 10 分,归因为知识缺口并定向修订 references/resource-pack-deduction.md 后,同场景对话得 92 分。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 云服务技能多轮咨询(评估集,第 4 轮) | Overall TSR(%) | 81.8(SkillEvo) | 原始技能 30.0;Self-Reflection 58.8;单轮 QA 66.4 | +51.8 / +23.0 / +15.4 |
| 反馈源消融(多轮交互→单轮 QA,其余不变) | Overall TSR(%) | 66.4 | SkillEvo 完整版 81.8 | −15.4,证明领先完全归因于多轮反馈源 |
| 治理层消融(去掉 Governance) | Overall TSR(%) | 78.6 | SkillEvo 完整版 81.8 | 治理贡献 +3.2,价值在防退化而非提分 |
| 模拟器侧可信性(覆盖/保真/代理准确) | $c_U$ / 人类盲评一致性 / $s_C$(%) | 98.9 / 95.3 / 71.1 | 无(既有方法不检验模拟器自身可靠性) | 首次量化并门控模拟失真 |
| 跨轮稳定性 | 回退率 RegR(%):R1→2 / R2→3 / R3→4 | 28.2 / 24.4 / 21.1(首末 −7.1) | Self-Reflection 无门控、逐轮震荡下行 | 回退率逐轮下降,退化受控 |
| 知识膨胀(相对 $S_0$ 累计行数增长) | Bloat(%) | +2.8(有治理,首轮后趋稳) | +16.2(无治理,逐轮累积) | 膨胀减少约 6 倍 |
局限与改进
作者承认的局限:其一,数据集源自生产客服系统,受用户隐私与商业机密约束无法公开,外部只能在其他分布的数据上复现;其二,阈值参数(意图权重 $\alpha=0.7$、通过阈值 60、早停标准等)沿用已上线评估管线的设置,未做敏感性扫描;其三,演化必须以人工确认作为上线前检查点,并非全自动闭环。我自己的观察:其一,数据全部是升级到人工的失败工单(约 40% 开局即转人工、60% 多轮未解决后转人工),其中混有权限、后台操作等不可由知识修复的案例,人工参考解的质量直接决定评估与归因的上限——冷启动新产品若无足够人工工单历史,框架难以直接运转;其二,模拟保真度 95.3%、验证器与人类一致性 90%+ 意味着仍有约 5%–10% 的噪声会流入反馈回路,而归因器三分类的准确率文中未做单独人工评估;其三,演化仅 4 轮、限于云客服单一领域,梯度能否在更长序列或跨领域持续再生未经验证;其四,未与 SEAD 类多轮强化学习方法或人工维护加专家修订的强基线做成本效益对比。
独立分析的弱点
独立分析可见四点弱点。① 反馈源单点依赖:整个闭环建立在存在高质量人工参考解的前提上,验证与归因都以它为金标准;若人工坐席本身答错,错误会被当作正确知识写入技能,且双锚点检查只防丢失、不防源头错误。改进方向:引入多坐席交叉验证,或对参考解本身做置信度打分与抽样人工复核。② 归因器是单次 LLM 判断:知识缺口/能力上限/评估噪声三分没有量化的分类准确率,把能力上限误判为知识缺口会导致无效知识写入并加剧膨胀,判反则漏掉真缺口。改进方向:用消融式探针实证验证归因——注入候选知识后重放同一场景,观察 TSR 是否真提升。③ 软约束修复偏被动:结构治理只发建议并入下一轮,单文件建议上限 3 条、拆分阈值 700 行均为手工设定,面对快速膨胀场景可能滞后于退化速度。改进方向:把膨胀/断裂指标纳入跨轮版本选择的多目标函数,或按文件规模自适应调整阈值。④ 成本与用户多样性未报告:2000 张工单 × 最多 10 轮 × 4 轮演化加内层最多 3 次迭代的 API 成本未披露;每张工单只重构单一用户画像,缺少人群多样性压力测试,模拟暴露的缺陷覆盖面可能被高估。改进方向:为同一工单生成多个用户变体做集成评估,并公开单位工单的演化成本。
未来方向
作者提出的延伸:框架与方法无关于具体工单来源,适用于任何具备多轮咨询日志与人工参考解的场景;模型层面唯一要求是 Generator≠Evaluator,可替换为任意两个不同家族的模型。基于其成果可继续推进的方向:其一,把归因筛选与 SEAD 式强化学习结合——文本技能演化负责知识面、RL 负责策略面,二者共享同一套多轮模拟器与失败信号;其二,跨技能知识迁移:同一云服务族内多个技能的缺口往往同源(计费规则、账号体系),集体归因可在技能间共享信号,形成技能图谱级的联合演化;其三,从升级工单扩展到全量在线会话,用真人对话做增量评估,并把模拟器与真人的对齐度作为持续监控指标;其四,治理自动化:结构阈值自适应、把膨胀与断裂指标纳入跨轮选择的多目标优化,减少对手工阈值(700 行、每文件 3 条建议)的依赖;其五,从理论上刻画梯度再生条件——什么样的意图分布与修订策略能保证失败面逐层展开而非重复暴露,为演化轮数的收益提供可预测模型;其六,加入对抗性用户(误导、纠缠、提供错误信息)测试技能鲁棒性,现有合作型模拟用户可能系统性低估真实故障面。
复现评估
复现资料相当完整但有一个硬缺口。完整部分:附录 B 给出用户模拟、场景合成、信号抽取与合并、归因、三种编辑模式、质量检查器与治理检查器的全部核心 prompt 约束及两套评分细则;附录 C 给出演化循环伪代码;附录 E 说明模型分工(编辑器 deepseek-v4-pro,验证/模拟/归因/治理为 minimax-m3)与评估环境工具白名单(只读检索、写工具注销);附录 F 列出全部超参(最多 4 轮、每轮最多 3 次编辑迭代、每工单最多 10 轮对话、早停均分 70.0、早停解决率 0.7、通过阈值 60.0、$\alpha=0.7$、关键词 Jaccard 阈值 0.3);附录 G 描述端到端流水线与内外两级循环;附录 D 端到端追踪一张工单的场景、失败轨迹、判定、归因、diff 与更新后交互。硬缺口:2000 张工单数据集因隐私与商业机密不可发布,9 个生产技能库亦不公开,无法直接对齐数字。算力需求为纯 API 调用、无任何训练,主要开销在多轮模拟;总体复现难度中等——任何拥有含人工参考解的多轮客服日志的团队都可按附录重新实现,但需自行调校模拟保真度与归因质量。
论文图表
对比单轮 QA 与多轮交互两种反馈模态下的演化曲线:左侧单轮 QA 中完整查询在开场一次性给出、只产生一次响应,可见缺口首轮即被修补,TSR 曲线在第 2 轮左右饱和;右侧多轮交互中受约束用户通过追问、澄清、拒绝持续暴露潜在缺陷,每轮修订让对话推进到更深一层、触及此前被掩盖的缺陷,TSR 持续攀升。
这是全文中心论点的可视化:评估反馈的模态决定技能演化的上限,即演化梯度能否自我再生。读懂这张图就读懂了论文的动机与核心主张。