← 返回 2026-08-06

面向技能原生大模型:用于长程推理评测与训练的技能熵 Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora 📅 2026-08-05 👍 26 2026-08-11 18:30
GRPO 基准测试 大语言模型 强化学习 技能切换 长程推理

用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练

前置知识

跨技能长程任务 (Cross-Skill Long-Horizon Task)

指一个长度为 $L\in[2,10]$ 的多步问答序列 $\tau=((q_1,a_1),\dots,(q_L,a_L))$,每一步调用一种不同的推理技能(如先做方程推导,再据结果规划日程,最后做信息抽取),且每一步都依赖前一步的答案。连续两步来自不同领域 $d_{s_i}\neq d_{s_{i+1}}$。本文将这类任务形式化为研究对象,难点不在单步技能本身,而在于模型能否在一条推理链里干净地切换技能。

整篇论文的目标概念。只有先理解跨技能任务的依赖链结构与多技能性,才能理解为什么单技能基准无法暴露问题,以及为什么需要一个有向的技能间难度度量。

技能熵 (Skill Entropy, SkE)

作者定义的一个有向成对量 $SkE(s_a,s_b)$,衡量在固定参考模型下从技能 $s_a$ 切换到 $s_b$ 的难度。它本质是“单技能平均准确率”与“两步跨技能准确率”的平滑比值:$$SkE(s_a,s_b)=\frac{\frac{1}{2}(Accuracy(s_a)+Accuracy(s_b))+\alpha}{Accuracy(s_a,s_b)+\alpha}$$,其中 $\alpha=0.1$ 为拉普拉斯平滑。值大于1表示链起来比单独做更难。任务级技能熵是沿技能序列的平均:$SkE(\tau)=\frac{1}{L-1}\sum_{i=1}^{L-1}SkE(s_i,s_{i+1})$。

技能熵是全文的核心对象:它既是基准难度的刻度(把任务分成低/中/高三级),也是强化学习的奖励信号。理解其有向性与比值定义才能看懂后续的所有实验设计与训练目标。

GRPO (Group Relative Policy Optimization)

一种常用的近端策略优化变体,常用于带可验证奖励的强化学习(RLVR)。它对同一个 prompt 采样一组(group)回复,用组内奖励做归一化作为优势估计,再以裁剪目标更新策略。本文用组大小 8、prompt 批大小 256、学习率 $10^{-6}$、KL 系数 $10^{-3}$、裁剪比例 0.2,在 8×H100 上训练。

Skill-Entropy RL 的训练骨架就是 GRPO,奖励由答案奖励 $r_{ans}$ 与技能熵奖励 $r_{ent}$ 加权组合。不熟悉 GRPO 就无法理解奖励如何回传、为什么 GRPO 行是技能熵奖励的天然消融。

可验证奖励强化学习 (RLVR) 与 LLM 评判

可验证奖励指对每一步答案有确定性打分器:如数学用符号等价、编码用沙箱单元测试、信息抽取用表格匹配。开放域(创意写作、上下文检索等)没有确定答案,改用 LLM judge(本文为 Claude-opus-4.7)按评分细则给 $[0,1]$ 分。任务分是各步分的平均。

论文的训练数据与基准都依赖这套分领域打分机制。训练只用 6 个可验证领域、评测覆盖 9 个领域(含开放域),这套打分体系决定了为何能做 RL、以及开放域增益如何评估。

技能标注回复格式 (Skill-Annotated Response)

为了让技能熵成为可训练信号,作者强制模型在每步答案前显式输出技能标签:先 `...`,然后逐对输出 `领域,技能答案`。这样可正则解析出预测技能序列 $\hat\mu(\tau)$ 与答案序列,进而对技能序列评分。

这是把“技能熵”从评测刻度变成训练信号的关键接口。理解这一格式才能看懂技能熵奖励 $r_{ent}$ 如何基于预测技能序列与金标序列的熵秩比较来计算。

研究动机

现代 LLM 在单技能基准上表现优异:Claude-opus-4.7 在逻辑、Gemini-3.1-pro 在数学/规划上的单技能准确率都接近饱和。然而现实中的长程任务(规划行程、写研究报告、机器人救援)要求模型在一条推理链里反复切换技能——先做方程推导、再用结果排程、再做信息抽取。论文实测发现,把同一个技能放进跨技能任务后,前沿模型准确率会下降 $-4\%\sim-10\%$,Qwen3-4B 甚至下降 $-12.6\%$,且降幅在规划技能上最大。更关键的是,现有基准(MMLU-Pro、LiveCodeBench、NaturalPlan 等)只在单一领域内评估,缺乏一种有原则的方法来度量“技能切换本身有多难”——两个长度和技能完全相同的任务,其切换难度可能天差地别,但表面形式看不出来。

本文的目标是作者希望从评测与训练两侧同时填补这一空白。在评测侧,引入一个标量化、有向的“技能切换难度”度量,并据此构建覆盖 9 个领域、558 个技能、低/中/高三档难度的跨技能长程基准 Skill2-Bench,用以系统暴露“单技能强、跨技能弱”的隐藏缺口。在训练侧,把同一个技能熵信号从基准刻度翻转为强化学习奖励,设计 Skill-Entropy RL 框架,让小模型(Qwen3-4B-Instruct、Qwen3-1.7B)在跨技能任务上逼近甚至超越更大模型,并验证该信号能即插即用地接入 OpenR1-Math 等现成训练数据。

与已有工作不同的是,本文的独特切入角度是把“技能切换难度”提升为一个可量化的一阶对象,并用同一个量贯穿评测与训练。与既有技能感知工作(在数据/路由层注入技能)不同,作者把技能信号直接写进 RL 奖励;与既有长程/智能体基准(把多技能混在环境里测整体)不同,作者用有向成对熵隔离出“切换这一步”到底有多难。此外,技能熵是有向、跨步的(between-step)信号,区别于 RLVR 里常见的步内(within-step)奖励稠密化,因此能正交地补足传统奖励。

核心方法

整体思路是“先度量、再评测、后训练”,三步共用同一对象——技能熵。直觉上:技能切换越难,固定参考模型在“先做 $s_a$ 再做 $s_b$”时相比单独做的准确率掉得越多,这个相对衰减就量化了切换难度。技术路线上,作者(1)用 Claude-opus-4.7 作参考模型,分别在单技能题和两步跨技能题上跑出 $Accuracy(s)$ 与 $Accuracy(s_a,s_b)$,代入平滑比值公式得到成对熵,再沿任务技能序列平均得到任务级熵;(2)据此采样难度可控的跨技能任务构建 Skill2-Bench;(3)把熵信号翻转成 RL 奖励,配合技能标注回复格式训练模型。整个流程使一个量在“标定基准—暴露缺口—训练修复”之间闭环复用。

核心创新是用“技能熵”这一有向成对量同时充当基准刻度与训练信号,并强迫模型在每步答案前显式提交技能标签。这与已有方法有本质区别:技能感知蒸馏/数据增强(Skill-Distill、STAT)只在数据或路由层注入技能,而本文把技能序列对齐写进 GRPO 奖励;SkillRL 是步内递归技能信号,而本文的 $r_{ent}$ 是步间熵秩对齐。技能熵奖励定义为 $r_{ent}=1-|\hat\rho-\rho^\star|$,其中 $\hat\rho,\rho^\star\in[0,1]$ 是预测技能序列与金标序列在训练分布上的熵秩,允许通过嵌入相似度做语义替换,因此模型可“换一种近义技能”而不被惩罚,这比硬匹配更鲁棒。

方法步骤详情

完整流程分三阶段。(1)构建技能库:对每个可验证领域的种子题(如 OpenR1-Math、MMLU-Pro、LiveCodeBench、NaturalPlan 等)用 LLM 标注 3–5 个细粒度技能,再用嵌入聚类并人工审核,统一粒度;开放域直接让 LLM 生成技能列表,最终得到 9 领域 558 技能。(2)推导技能熵:以 Claude-opus-4.7 为参考,跑单技能题得基线、跑两步跨技能题得链式准确率,按公式算成对熵并聚合。(3)采样与命题:按目标熵档(低/中/高)采样长度 2–10 的技能序列,对可验证技能各取一题用 LLM 提议器融合成一个连贯情境(后续步依赖前序答案),用独立验证器筛除不合格任务。训练侧则采用技能标注格式,先用 3K 条 Qwen3-8B 教师生成的轨迹做 4 轮 SFT 预热(lr $10^{-5}$),再在 6K 任务上做 GRPO,奖励 $r=0.7r_{ans}+0.3r_{ent}$,组大小 8、批大小 256、lr $10^{-6}$、KL $10^{-3}$、clip 0.2,8×H100。

技术新颖性

新颖性体现在三点。其一,技能熵是“单一对象、双向用途”:既是基准标尺又是 RL 奖励,跨基准与训练闭环复用,而以往工作要么只做评测、要么只在数据层用技能。其二,信号是步间(between-skill)而非步内(within-step):在长程任务中显式建模 $s_i\to s_{i+1}$ 的切换难度,正交于传统的步级稠密奖励。其三,奖励用熵秩比较并允许嵌入相似度的语义替换,使模型能用近义技能而不被错罚,比硬字符串匹配更贴近真实“技能理解”。此外,作者还证明该信号可即插即用地接到并非为技能结构构建的 OpenR1-Math 上:先用 Qwen3-8B 把金标轨迹切成步并标注技能,再算熵、再训练,零数据管线改动即得增益。

Skill Entropy for Benchmarking and Training Skill-Native LLMs.
Figure 1: Skill Entropy for Benchmarking and Training Skill-Native LLMs.

实验结果

核心发现分四组。(1)技能熵确实追踪难度:表 2 显示几乎所有模型 Skill2-Bench 分随熵档低→高单调下降,Qwen3-4B 在低/中/高为 39.1/33.2/31.5;单技能→跨技能准确率掉幅 $-4\%\sim-10\%$,规划技能掉幅最重。(2)主实验(表 3):Skill-Entropy RL 把 Qwen3-4B-Instruct 从 34.4% 拉到 68.4%(+34.0),Qwen3-1.7B 从 14.6% 到 40.1%(+25.5);相对 GRPO(去掉 $r_{ent}$ 的消融)+9.6%、+7.9%,相对最强基线 STAT +7.0%、+7.1%。(3)泛化:9 域拿下 7 个最佳,创意写作增益最大(4B 12.9→47.1),即便 RL 只用 6 个可验证域,还迁移到 MuSR、GPQA-Diamond、MMLU。(4)OpenR1-Math 上(图 4)普通 GRPO 很快饱和,加技能熵奖励后曲线持续上升,6 个数学基准全优,平均比 GRPO +1.9%、比基座 +7.7%。深层步骤模型倾向沿用上一步技能,挑错技能时准确率近乎腰斩。

Skill2-Bench includes 9 Domains with 558 labeled skills in total.
Table 1: Skill2-Bench includes 9 Domains with 558 labeled skills in total.
Evaluation results on Skill2-Bench.
Table 2: Evaluation results on Skill2-Bench.
Performance comparison of Skill-Entropy RL against baseline post-training methods.
Table 3: Performance comparison of Skill-Entropy RL against baseline post-training methods.
Case study: Skill-Entropy RL enables cleaner skill and answer-modality switching across steps.
Figure 3: Case study: Skill-Entropy RL enables cleaner skill and answer-modality switching across steps.
Comparison of training curve on OpenR1-Math.
Figure 4: Comparison of training curve on OpenR1-Math.
查看结构化数据
任务指标本文基线提升
Skill2-Bench 总分(Qwen3-4B-Instruct) Skill2-Bench 分(各步准确率平均,%) 68.4(Skill-Entropy RL) 34.4(基座)/ 58.8(GRPO)/ 61.4(STAT) 相对基座 +34.0,相对 GRPO +9.6,相对 STAT +7.0
Skill2-Bench 总分(Qwen3-1.7B) Skill2-Bench 分(%) 40.1(Skill-Entropy RL) 14.6(基座)/ 32.2(GRPO)/ 33.0(STAT) 相对基座 +25.5,相对 GRPO +7.9,相对 STAT +7.1
OpenR1-Math 上 6 个数学基准平均 平均准确率(%) Skill-Entropy RL 全部 6 项最优 GRPO(仅答案奖励) 平均 +1.9%,相对基座 +7.7%

局限与改进

作者承认的局限包括:训练只在 Qwen3 两个尺寸上验证(附录补了 Llama-3.2-3B 与 Olmo3-7B 跟随同趋势,但未覆盖更大模型);技能熵依赖固定的闭源参考模型 Claude-opus-4.7,换参考模型会改变绝对熵值;技能库构建含人工审核,粒度主观、扩展成本高;评测仅 300 个测试任务。我额外观察到的局限:(1)技能熵奖励用熵秩而非绝对熵,对不同任务可区分但物理含义偏弱;(2)创意写作等开放域增益部分可能来自“结构化输出 + 更长答案模态”而非真正的技能切换能力;(3)开放域打分全靠 LLM judge,存在评判偏差与自评膨胀风险;(4)成对熵只在两步上估计后外推到长序列,对 $L=10$ 任务的可信度未充分论证。

独立分析的弱点

第一,参考模型依赖:技能熵的绝对数值随参考模型变化,跨研究可比性弱。改进方向是引入“参考模型无关”的自归一化熵或用多参考模型集成。(2)技能库与熵估计成本高:558 技能需人工审核,成对熵需对参考模型跑大量两步评测。改进方向是自动化技能发现(如用层级聚类+LLM 提议)与基于历史评测结果的熵估计缓存。(3)语义替换奖励的可博弈性:$r_{ent}$ 允许嵌入相似度匹配,模型可能学会“贴标签”而非真做技能切换,应加入任务答案模态一致性或反事实校验。(4)开放域增益归因不清:创意写作大增可能混入格式/长度效应,建议加入“去除技能标签但保留格式”的对照,把“技能对齐”与“结构化输出”解耦。每个弱点都给出可操作的下一步。

未来方向

作者明确指向:把 Skill-Entropy RL 推广到更大开源基座、把技能熵接入智能体(agentic)/深度研究等多轮环境、以及让技能熵成为可复用的通用训练信号(已在 OpenR1-Math 上验证)。基于成果可延伸的方向包括:(1)在线/自适应技能熵——在训练过程中动态更新熵估计,使难度随模型能力演化;(2)层级技能树——把 558 个扁平技能组织成层级并用层级熵度量“跨子树切换”,更贴近真实任务结构;(3)跨模态技能(视觉、工具调用)与多智能体协作中的技能分工;(4)把“挑错技能近乎腰斩”这一失败模式做成可解释的诊断工具,反向指导基座预训练的数据配比。

复现评估

可复现性较好:作者公开了代码库(https://github.com/Gen-Verse/Skill-Entropy-RL)与 Skill2-Bench,论文附录 B/D 给出了技能库、提议器/验证器提示、采样计数、SFT 模板、GRPO 超参与奖励权重的消融($\lambda_{ans}=0.7,\lambda_{ent}=0.3$)。训练规模为 9K 任务、8×H100,对学术组可承受。主要风险点:技能熵估计需固定闭源参考模型 Claude-opus-4.7,复现者若无同等访问需替换并重新标定阈值 $\theta_\ell,\theta_h$;开放域评分也依赖同一 judge,存在环路上的自评偏差;300 任务测试集较小,方差(表 2 中 ±1–±3)提示结论需更大评测验证。总体上方法描述充分,工程门槛中等偏高。