← 返回 2026-07-27

技能自博弈:用协同进化的技能库推动大模型能力前沿 Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang 📅 2026-07-24 👍 47 2026-08-01 18:30
大语言模型自进化 工具调用 强化学习 智能体技能库 自博弈 课程学习 逻辑推理

用协同进化的技能库协调出题与解题双方自博弈,破解LLM自进化的多样性与验证困境。

前置知识

Self-Play 自博弈

让同一个LLM扮演多个角色(如出题的Proposer与解题的Solver)相互博弈、相互强化的一种训练范式。出题方努力构造能逼到对方能力边界的任务,解题方努力攻克这些任务,多智能体强化学习(MARL)将双方策略联合优化,从而在没有人工标注的情况下实现自我提升。

本文的整个框架都建立在自博弈之上,理解Proposer-Solver的对抗结构及其奖励信号如何定义,是读懂后续课程学习与技能协同进化机制的前提。

GRPO(Group Relative Policy Optimization)

一种组相对策略优化算法:对同一个提示采样多个回答,用组内奖励的相对优势作为基线来估计优势函数,避免了对额外价值网络(critic)的依赖。本文用它分别更新Proposer和Solver两条策略:$J_{propose}(\pi)=\mathbb{E}_{s\sim S,(x,c)\sim\pi(\cdot|s)}[R_{propose}]$,$J_{solve}(\pi)=\mathbb{E}[R_{solve}(x,y,c)]$。

GRPO是Skill-SP两条策略的实际优化器,决定了奖励函数如何被转化为参数更新;若不理解GRPO的组内归一化机制,就难以理解奖励hacking为何需要gated curriculum来抑制。

Agent Skill 智能体技能

Anthropic提出的一种可复用的模块化过程知识单元,把特定场景下的任务指令、规则、提示示例、可执行验证器打包成自包含块,供智能体按需动态加载。本文把它形式化为技能元组$s=\langle m,r,h,e,\nu,\sigma\rangle$,分别表示路由元数据、过程规则、生成提示、few-shot示例、可执行验证器与历史使用统计。

技能是本文的核心抽象——它既不是死板的环境也不是混乱的自由生成,而是连接结构化验证与开放式探索的中间介质,技能库的协同进化是全部创新的载体。

Reward Hacking 奖励欺骗

在面向'中等难度'的目标奖励下,Proposer可能通过合成病态、不可解或解析失败的合约来人为制造低成功率,从而骗取高分。本文引入二值任务质量过滤器,构造gated curriculum奖励$R_{propose}=\mathbb{1}\{(x,c)\text{ valid}\}\cdot(1-2|v_{solve}-0.5|)$,从源头阻断这种欺骗。

如果没有gated reward,纯medium-difficulty奖励会让课程退化成无意义的噪声数据;理解这个风险点才能理解为什么需要schema compliant ∩ contract valid ∩ probe consistent三重校验。

Synthetic Data Collapse 合成数据坍塌

在连续多轮自训练迭代中,未受结构化引导的生成器会反复产出病态任务或过度拟合同一批简单模板,误差与偏差不断累积,最终使合成数据集的整体质量坍塌(Shumailov et al. 2024)。这是开放式自进化方法难以长期可持续的根本原因。

本文正是要解决合成数据坍塌问题:技能库的精炼、剪枝、归纳三类操作,本质上就是为了在多轮迭代中持续注入高质量、多样性可控的新数据,对抗坍塌趋势。

研究动机

LLM训练正从人工标注转向交互驱动的自进化,自博弈被视为后训练阶段的关键技术。然而现有方法陷入'任务多样性 vs 验证可靠性'的根本困境。环境绑定型方法(如Absolute Zero依赖代码执行器、SPIRAL/MARSHAL依赖博弈模拟器、Search Self-play依赖检索引擎)能给出精确反馈,但将学习严格限制在狭窄、预定义的操作域里;开放式任务生成加事后过滤(格式检查、多数投票)虽能拓宽任务空间,却缺乏可靠验证。没有结构化引导时,生成器频繁合成病态任务或过度拟合同一批简单模板,多轮训练后误差与偏差累积,导致合成数据坍塌。事后过滤只是一个被动的筛子:它能挡住显眼的格式错误,却无法主动引导生成器产出可复用、逻辑有效且多样的任务模式。具体到实验数据,在Ministral-3-8B上Unguided SP仅带来+0.1点的平均提升,在ZebraLogic推理任务上更是无法合成任何有效谜题、完全无法启动训练循环。

本文的目标是本文要构建一个可持续的、真正开放的自博弈框架:既能自主生成多样化的智能体任务,又能对每条任务做可靠的机器可验证,避免落入狭窄域或混乱噪声这两个极端。具体目标是同时实现broad coverage(广覆盖)与high fidelity(高保真),并且让生成难度持续逼近Solver的learning frontier(学习前沿),即让每轮迭代的任务都处于'稍微难一点'的黄金区间。在工程上,这要求一个既能主动注入结构化先验、又能持续扩展任务边界的进化引擎,使弱模型(如Ministral-3-8B/14B)也能从零开始搭建有效的训练循环,使强模型(如Qwen3-4B/8B)能持续抬升性能上限。

与已有工作不同的是,本文的独特切入角度是把'技能'作为连接结构化验证与开放式探索的中间介质。以往要么把验证完全外包给死板的执行环境,要么完全依赖被动的事后过滤;而技能是一种主动的任务模式接口:它在合成前为Proposer注入结构化先验,在回答生成后提供显式可执行验证机制,并在迭代间跟踪历史难度以驱动课程推进。不同于把历史轨迹全部塞进生成器prompt导致context bloat(上下文膨胀)的做法,技能接口把零散的经验蒸馏成紧凑、可复用、可协同进化的单元。这种'主动orchestrator+双流生成(技能流+开放式探索流)+可进化库'的组合,在已有自博弈工作中尚属空白。

核心方法

Skill-SP把通用自博弈改造为一个主动的课程构造过程。框架由三个核心组件构成:Proposer(出题方)、Solver(解题方)和Skill Controller(技能控制器)。整体被形式化为一个双层优化问题:外层联合优化技能库$S$与Proposer策略$\pi_{propose}$,使其合成有效且瞄准前沿的任务;内层让Solver在被路由技能条件化的任务上最大化执行成功率$\pi^*_{solve}=\arg\max_\pi\mathbb{E}_{s\sim S,(x,c)\sim\pi_{propose}(\cdot|s),y\sim\pi(\cdot|x)}[R_{solve}(x,y,c)]$。一个可验证任务形式化为元组$(x,c)$:$x$是Solver可见的标准提示,$c$是隐藏的、机器可读的验证合约(如单元测试、参考答案)。Solver的预期成功率$v_{solve}(x,c;\pi_{solve})=\mathbb{E}_{y\sim\pi_{solve}(\cdot|x)}[R_{solve}(x,y,c)]\in[0,1]$,$R_{solve}\in[0,1]$由环境判定。每一轮迭代$T$里,技能路由器按统计量$\sigma$采样技能,两条策略分别用GRPO更新,技能库同步执行精炼、剪枝、归纳三类操作。

核心创新在于把技能抽象为可进化的接口$s=\langle m,r,h,e,\nu,\sigma\rangle$,并用gated curriculum reward抑制奖励欺骗:$R_{propose}(x,c;\pi_{solve})=\mathbb{1}\{(x,c)\text{ valid}\}\cdot(1-2|v_{solve}-0.5|)$。其中二值过滤器$\mathbb{1}\{(x,c)\text{ valid}\}$对技能流任务要求schema compliant ∩ contract valid ∩ probe consistent三重校验——其中probe consistency要求从当前Solver$\pi_{solve}(\cdot|x)$采样的$K$条rollout产生与Proposer参考答案一致的唯一多数答案。与传统自博弈的本质区别是:(1)技能本身在训练时被持续进化,而不是只在推理时被检索调用;(2)双流架构——技能流注入结构先验、开放探索流防止模式坍塌;(3)技能库的精炼-剪枝-归纳三操作把零散轨迹蒸馏为紧凑可复用单元,避免把全部历史塞进prompt的上下文膨胀。这种'主动orchestrator'与被动事后过滤形成鲜明对比。

方法步骤详情

每轮迭代(共5轮)严格按Algorithm 1执行。第一步,Skill Router按$\sigma$平衡exploitation(高产技能)与exploration(探索奖励),采样技能$s\sim S^{(t)}$,Proposer用技能流$\pi_{propose}^{(t)}(\cdot|s)$和开放探索流$\pi_{propose}^{(t)}(\cdot|\emptyset)$各生成一批候选$(x,c)$;工具调用场景$K=10$条probe。第二步,对每条候选做有效性验证:技能流需通过schema合规、技能验证器$\nu$、probe一致三重检查,探索流省略技能验证。第三步,对通过校验的候选用$K$条rollout估计$v_{solve}$,结合有效性mask算gated reward $R_{propose}$。第四步,构造训练池$\mathcal{D}^{(t)}=Top_{\alpha M}\{T_{skill}^{(t)},R_{propose}\}\cup Top_{(1-\alpha)M}\{T_{explore}^{(t)},R_{propose}\}$,其中工具调用$M=8000$、推理$M=1920$、$\alpha=0.5$;Solver按$R_{propose}$排序选top-M难度任务用GRPO更新5/15步(工具调用)/3/10步(推理)。第五步,更新技能统计$\sigma$并执行进化:剪枝$S_{prune}^{(t)}=\{s:\mathbb{E}[R_{propose}]<\gamma_{prune}\}$、归纳$T_{induce}^{(t)}=\{(x,c)\in T_{explore}:R_{propose}\geq\gamma_{induce}\}$再用控制器$\pi_{control}$抽象出新技能并通过Integrity(完整性)与Novelty(新颖度)过滤,最终$S^{(t+1)}=(S^{(t)}\setminus S_{prune}^{(t)})\cup S_{new}^{(t)}$。

技术新颖性

技术新颖性体现在四个方面。第一,把技能从'推理时执行接口'升级为'训练时任务合成接口',让结构化引导与可执行验证随自博弈课程共同进化,这是与Lu et al. 2026等仅在推理时用技能的工作的关键差异。第二,gated curriculum reward $\mathbb{1}\{\cdot\}\cdot(1-2|v_{solve}-0.5|)$从数学上把'质量门'与'难度目标'解耦,从源头阻断reward hacking,避免了纯medium-difficulty奖励下生成病态不可解合约的退化。第三,双流混合策略(技能流提供高质量但可能过专、探索流提供多样性但噪声大)配合混合比$\alpha$,既保真又保广,消融实验显示纯技能流会在API-Bank上掉点(Figure 4b)。第四,技能库的连续生命周期管理——平均每轮归纳约20个新包、不断更新并退役旧包(Figure 5c),active skills增长到86、effective skills增长到46(Figure 6),这是把开放式探索持续蒸馏为可复用先验的工程闭环,使得在5轮迭代内整个系统不坍塌。

Overview of Skill Self-Play.
Figure 3: Overview of Skill Self-Play.
Skill Self-Play (Skill-SP)
Algorithm 1: Skill Self-Play (Skill-SP)

实验结果

实验覆盖两大任务族、5个3B-14B骨干模型。工具调用(Table 1):Qwen3-4B-Instruct的Overall从60.2提升到66.7(+6.5),Unguided SP仅64.1(+3.9);Qwen3-8B为+2.8,Granite-4.1-3B为+5.3。最惊艳的是对齐失败的模型:Ministral-3-8B从20.7飙升至63.6(+42.9绝对点),其中bfcl_simple_python从16.4到90.8(+74.4),Unguided SP几乎原地不动(+0.1);Ministral-3-14B为+42.3。这印证了Unguided SP因无法独立合成有效任务而饿死学习信号。逻辑推理(Table 2,ZebraLogic):Qwen3-4B-Instruct网格精度72.1→73.5,单元精度70.3→74.2;Ministral-3-14B从5.4跃升至17.4(+12.0整体),小规模谜题+35.3;Qwen3-8B为+8.8整体。但Large和X-Large尺度上弱模型几乎无收益,说明纯自博弈存在最低能力门槛。消融(Tables 3-4,Figure 4):Unguided SP掉-2.6、Uniform路由掉-1.9、Frozen skills掉-2.3、Frozen proposer掉-2.1、Frozen feedback solver掉-3.0、Frozen both掉-3.2,证实动态路由、库进化与双策略协同更新缺一不可。诊断(Figure 5):技能流$v_{solve}$稳定在约0.57,明显比Unguided SP的0.70和探索流的0.75更贴近学习前沿;PCA可视化显示技能池在嵌入空间覆盖更广。

Main tool-call prediction results (avg@8).
Table 1: Main tool-call prediction results (avg@8).
Main logical reasoning results (avg@8).
Table 2: Main logical reasoning results (avg@8).
Quantitative ablations on the self-play data loop.
Table 3: Quantitative ablations on the self-play data loop.
Quantitative ablations on the co-evolutionary update loop.
Table 4: Quantitative ablations on the co-evolutionary update loop.
Performance footprint.
Figure 2: Performance footprint.
Tool-call ablations.
Figure 4: Tool-call ablations.
Data-loop diagnostics for Qwen3-4B-Instruct tool-call self-play.
Figure 5: Data-loop diagnostics for Qwen3-4B-Instruct tool-call self-play.
Skill utilization.
Figure 6: Skill utilization.
查看结构化数据
任务指标本文基线提升
API-Bank 工具调用(L1-L3均值) avg@8 准确率 Qwen3-4B-Ins 58.9 / Ministral-3-8B 61.5 Base 51.4 / 33.7 +7.5 / +27.8
BFCL 工具调用(JS/Py/Java/Live均值) avg@8 准确率 Qwen3-4B-Ins 75.9 / Ministral-3-8B 69.3 Base 71.2 / 12.8 +4.7 / +56.5
ZebraLogic 逻辑推理(网格精度) avg@8 整体网格精度 Ministral-3-14B 17.4 / Qwen3-8B 32.4 Base 5.4 / 23.6 +12.0 / +8.8

局限与改进

作者承认的局限:第一,纯自博弈存在最低能力门槛——Ministral-3-8B/14B在Large和X-Large尺度(搜索空间$>10^9$)的ZebraLogic谜题上几乎无收益,因为弱模型无法独立bootstrap有效学习信号,说明该框架难以从极弱起点修复高复杂度推理。第二,技能精炼与归纳依赖骨干模型自身(除非另注),若模型本身能力不足则技能质量受限。第三,作者仅在工具调用与约束满足推理两类可验证任务上验证,未触及多模态、长程规划等更开放场景。我的观察:框架需要$K=10$条probe与$M=8000$的大训练池,算力开销可观;技能抽象对验证器$\nu$的依赖较强,在缺乏确定性检查器的领域(如开放式对话、创意写作)可能难以直接迁移;实验仅跑5轮,长期可持续性(数十轮后是否仍能持续进化或饱和)未被充分检验。

独立分析的弱点

其一,对可执行验证器的强依赖:技能元组中的$\nu$和ZebraLogic的确定性检查器是整套质量门的核心,但在缺乏客观ground truth的开放域(如创意写作、对齐性评估、长程软件工程)很难构造等价的确定验证,改进方向是引入LLM-as-judge或辩论式弱验证并设计与之配套的置信度门控。其二,弱模型在大尺度任务上失效:Large/X-Large谜题零增益暴露了冷启动问题,改进方向是引入课程热身(warm-up)或外部强教师仅用于诱导第一轮高质量技能,再切换到纯自博弈。其三,技能归纳的语义新颖度仅用词法相似度Novelty过滤,可能漏掉语义重复或误杀表面不同实质相同的技能,改进方向是改用嵌入相似度+功能性等价测试。其四,5轮迭代、$\alpha=0.5$、$\gamma_{prune}/\gamma_{induce}$等超参敏感性未被系统分析,改进方向是引入自适应混合比与基于技能使用熵的动态阈值。

未来方向

作者明确提及的方向包括:把Skill-SP作为通用evolution engine扩展到更多可验证智能体任务族,并探索其在视觉问答、深度搜索、软件工程等已被自博弈验证过的领域的迁移潜力(参见他们引用的Wang 2025、Lu 2025、Wei 2025、Zhao 2026)。基于本文成果可延伸的方向:第一,把技能库与外部检索系统结合,使跨任务、跨模态的技能可共享复用;第二,研究技能库在数十乃至上百轮迭代后的长期动力学——是趋于饱和还是持续扩展,以及如何在饱和时主动'遗忘'低价值技能;第三,把技能控制器$\pi_{control}$从基模型升级为专门的元学习模型,提升归纳质量;第四,探索多模型联邦自博弈,让不同骨干贡献不同技能子库,进一步扩大多样性。

复现评估

复现友好度较高:作者已开源代码于https://github.com/Qwen-Applications/skill-self-play,并承诺在附录C/D/E中给出完整超参数、初始技能库$S^{(0)}$与正式算法。关键设置明确:GRPO、5轮迭代、$M=8000$(工具调用)/$M=1920$(推理)、$\alpha=0.5$、$K=10$、Proposer/Solver分别5/15步(工具调用)或3/10步(推理)、avg@8评测。骨干模型(Qwen3-4B/8B、Ministral-3-8B/14B、Granite-4.1-3B)均为公开权重。主要挑战在于算力:每轮需要生成大规模候选并跑$K=10$条probe、训练两条策略,5轮迭代的GPU总开销显著;此外消融变体(Unguided SP、Uniform、Frozen系列)需要分别重训,复现全表成本不低。技能库的初始内容$S^{(0)}$与各类阈值$\gamma$的具体取值若未在附录中给出,可能成为复现细节盲点。