← 返回 2026-07-21

LLM 作为教练:面向不可验证任务的体验式学习 LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei 📅 2026-07-20 👍 14 2026-07-25 18:30
后训练 大语言模型 强化学习 指令遵循 知识蒸馏

把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。

前置知识

不可验证任务(Non-Verifiable Task)

不可验证任务是那些没有唯一正确答案的开放式生成任务,例如写游记、写推荐、创意写作、解释问题等。它们的回答质量取决于多个维度,如事实性、相关性、完整性、组织结构和风格,无法像数学题那样对答案、像代码那样执行验证。因此训练这类任务通常依赖另一个 LLM 作为裁判(LLM-as-a-Judge),依据自然语言评分细则(rubrics)逐条评估回答质量,这与可验证任务(RLVR,如数学答案可核对、程序可执行)形成鲜明对比。

本文专门针对不可验证任务提出新方法,理解这类任务的独特性(无 ground truth、多维质量、需 LLM 评估)是理解为什么标量奖励会造成信息瓶颈的前提。

LLM-as-a-Judge 与 Rubric-as-Reward

LLM-as-a-Judge 是用一个 LLM 依据评分细则(rubrics,把回答质量分解成可独立检查的若干条标准)对候选回答打分的方法。Rubric-as-Reward 则把这种打分当作强化学习的标量奖励信号,通常配合 GRPO 算法优化策略。标准做法是 1–10 分制,打分时裁判虽会输出详细的逐条分析文字,但 RL 最终只保留那个标量分数,丢弃所有文字反馈。这造成了严重的信息瓶颈:得到相同分数的回答在优化器眼里完全不可区分。

这是本文的直接对比基线(baseline),也是其要改进的对象。理解 Judge 如何把丰富评估压扁成标量分数,才能理解 EL 为什么要把同一个反馈模型改造成教练。

策略上下文蒸馏(On-Policy Context Distillation, OPCD)

上下文蒸馏(Context Distillation)旨在把模型在推理时需要的外部提示/上下文知识压缩进模型参数,从而推理时不再依赖该上下文。策略上下文蒸馏进一步要求用学生模型自己生成的轨迹(on-policy)来训练,以消除训练用真实上下文、推理用自生成上下文之间的暴露偏差(exposure bias)。本文中,教练产出的经验知识 $e$ 作为上下文喂给教师模型,得到条件教师分布 $\pi_{teacher}(\cdot|e,x)$,策略 $\pi_\theta$ 通过最小化与该教师分布的反向 KL 散度,把经验知识内化进权重,推理时既不需要教练也不需要经验上下文。

OPCD 是本文方法的技术底座,理解它才能明白 EL 如何把自然语言反馈转化为密集的逐 token 分布监督,并最终巩固进策略参数。

反向 KL 散度(Reverse KL Divergence)

KL 散度衡量两个概率分布的差异。反向 KL 指 $D_{KL}(P \| Q)$,即以 P(这里是学生/策略分布 $\pi_\theta$)为基准,惩罚 P 在 Q 概率低处仍高的区域,倾向于让 P 是 Q 的众数-seeking、模式覆盖较窄的分布。本文在 token 级别计算 $D_{KL}(\pi_\theta(\cdot|x,y_{<t}) \| \pi_{teacher}(\cdot|e,x,y_{<t}))$,即让学生分布向条件教师分布靠拢。为节省计算,反向 KL 只在学生模型预测概率排名前 256 的词表 token 上计算,且不重新归一化到 1。

反向 KL 是 EL 的核心损失函数,它把教师的知识转化为逐 token 的密集监督。理解其方向(mean-seeking)和计算细节(top-256 token)是理解方法实现的关键。

奖励黑客(Reward Hacking)

奖励黑客指策略学到能虚增奖励分数却并非真正提升回答质量的特征或模式。在标量奖励设置中,由于奖励携带的信息有限,策略会漂移向那些能抬高分数但不迁移的 pattern,表现为训练集奖励持续上升而真实泛化能力下降,是训练集奖励过度优化的一种形式。本文认为这类黑客行为部分源于反馈模型与策略之间的信息瓶颈:当评估被压扁成标量,策略就能钻空子。

缓解奖励黑客是本文 EL 的重要动机和卖点之一。理解标量奖励为何容易被钻空子,才能理解更宽带的经验知识通道如何降低这种失败模式。

研究动机

在开放式、不可验证任务(如写游记、创意写作、给推荐)上做后训练,标准做法是用一个 LLM 作为裁判,依据自然语言评分细则(rubrics)给策略生成的回答打分,再用强化学习(如 GRPO + Rubric-as-Reward)最大化这个标量奖励。问题在于,RL 会把裁判丰富的逐条文字分析压缩成一个标量(通常 1–10 分),丢弃了大量可用的文本反馈。这造成严重的信息瓶颈:裁判可能对两个回答表达了明确的细微偏好,但只要最终分数相同,优化器就把它们视为完全一样、无法区分。这个问题在奖励量表顶端尤其突出——许多本可满意、却在风格细节上有差异的回答都拿到同一个最高分,RL 无法进一步对齐这些细微偏好。此外,标量奖励很容易被策略钻空子(reward hacking),导致训练集分数虚高却不迁移到真实泛化。

本文的目标是本文的目标是直接利用评估过程中产生的丰富文字反馈,而不是把它浪费掉。具体地,作者希望保留并利用 LLM 裁判对每个回答的细致分析,把它转化成可迁移、可泛化的学习信号,从而提供比标量奖励更密集的监督、保留那些被标量分数抹掉的细微偏好,并最终减轻奖励黑客、提升向训练分布之外的泛化能力。为此作者提出体验式学习(EL),把同一个反馈模型从裁判(Judge)改造成教练(Coach),让它把对每个 on-policy 回答的评估蒸馏成可迁移的“经验知识”,再通过策略上下文蒸馏内化进策略权重,使推理时既不需要教练也不需要经验上下文。

与已有工作不同的是,本文的独特切入角度是“反馈带宽”这一统一视角。此前工作要么停留在标量奖励的 RL 框架内,要么尝试用原始批评(critique)或细则直接做上下文条件化,但它们要么仍受标量奖励瓶颈、要么把上下文弄成了“批评分布”反而损害能力。本文的关键洞察是:并非反馈模型 M 本身能力不足,而是优化器消费反馈的方式太低带宽——同一个 M 和同一套 rubrics,只要把“消费接口”从 Judge(输出标量分数,约 $\log_2(10)\approx 3.3$ 比特)换成 Coach(输出可迁移经验知识上下文,1024 token × 词表 150000 理论上可达约 17600 比特,是离散 1–10 奖励的 5000 倍以上),就能打开一个高带宽反馈通道。这把“为什么”问题从模型能力层面提升到了信息论层面,使方法的普适性可解释。

核心方法

EL 要在不可验证的开放式任务上训练策略 $\pi_\theta$:给定提示 $x$,策略生成回答 $y$,反馈 LLM $M$ 依据评分细则 $R_x$ 评估回答。直觉上,裁判只告诉模型“你做得有多好”(打分),而教练告诉模型“怎样才能做得更好”(给可迁移指导),教练传递的信息远比一个分数丰富。技术路线是:$M$ 作为教练把对 $y$ 的评估蒸馏成可迁移的经验知识 $e$(不是针对该实例的具体修改,而是可复用的通用写作策略);然后把 $e$ 作为上下文喂给教师模型,诱导出一个反映教练指导的条件分布;策略在自己采样的轨迹上,通过最小化与该条件教师分布的逐 token 反向 KL 散度,把高带宽反馈转化为密集的分布监督并巩固进权重。教师可以是初始冻结的策略检查点,也可以每轮迭代更新。整个系统 $\pi_\theta$ 与 $\pi_{teacher}$ 构成闭环,唯一的外部学习信号就是教练产出的经验知识 $e$。

核心创新点在于改变反馈的“消费接口”,而非改变反馈模型本身。作者强调,Judge 与 Coach 的区别不在 $M$ 的内在能力——一个 Judge 也可能输出详尽的文字分析——而在于优化器最终消费了什么:Judge 只保留标量分数(低带宽),Coach 蒸馏出可迁移经验知识(高带宽),再由条件教师翻译成密集的逐 token 监督。这把方法的本质区别落在“标量奖励最大化 vs 分布匹配”上:RL 是 reward-seeking,会利用一切与更高奖励相关的特征(易被钻空子);EL 是 distribution-matching,最小化与条件教师分布的散度、保持贴近教师的分布形状,因而更不易 reward hacking 且更易迁移。配合带宽直觉(标量仅 $O(1)$,经验上下文 $O(L)$),这一框架把方法优势解释得既清晰又普适。

方法步骤详情

EL 的训练循环如 Algorithm 1 所示,每个 batch 执行四步。第 1 步策略上下文采样:对每个 $x\sim D$ 从策略采样 on-policy 回答 $y\sim\pi_\theta(\cdot|x)$。第 2 步抽取经验知识:$e \leftarrow \text{Extract\_Knowledge}(M(x,y,R_x))$,即让 $M$ 依据 rubrics 和回答产出可迁移写作指导(如“避免重复使用‘amazing’这类泛化最高级,用具体感官细节支撑抽象论断”)。第 3 步计算逐 token 反向 KL 损失:$\mathcal{L}(\theta) = \mathbb{E}\big[\frac{1}{|y|}\sum_{t=1}^{|y|} D_{KL}(\pi_\theta(\cdot|x,y_{<t}) \| \pi_{teacher}(\cdot|e,x,y_{<t}))\big]$,教师以 $e$ 为前缀上下文。第 4 步最小化 $\mathcal{L}(\theta)$ 更新策略。训练细节:batch 256 提示、每提示 8 回答,学习率 $1\text{e-}6$,最大提示 8192 token、最大回答 4096 token,rollout 温度 1,训练 3 轮、每 10 步存检查点;反向 KL 只在学生预测概率排名前 256 的词表 token 上计算、不归一化。对比基线 RL 用同样 $M$、同样 rubrics,仅以 1–10 分作标量奖励、用 GRPO 实现。

技术新颖性

技术新颖性体现在四个层面。其一,提出 Judge/Coach 接口区分并用“反馈带宽”框架统一定义:用信息论直觉把离散 1–10 奖励($\approx 3.3$ 比特)、bf16 奖励(16 比特)与 1024 token 经验上下文(约 17600 比特)放在同一把尺子上对比,指出后者理论带宽是前者的 1000–5000 倍。其二,把策略上下文蒸馏作为“自然语言反馈→密集分布监督”的转换机制,使教练文本在不进入推理流程的情况下被内化。其三,闭环视角:$\pi_\theta$ 与 $\pi_{teacher}$ 构成闭环,唯一外部信号是 $e$,从而把 EL 与从更强教师蒸馏(OPD,源自教师更大参数空间 $O(N)$)和带特权信息自蒸馏(OPSD,$O(L)$)区分开来——EL 的信息源是教练的 rubric 评估外部化为文本。其四,迭代教师 + 通用提示 OPD 的稳定器设计:迭代教师虽提升任务分但导致 IFEval 遗忘(74.9),混入 Tulu3 通用提示并以冻结策略为 OPD 教师可恢复到 79.9 而不牺牲任务分,是与已有多轮 RL/批评条件化工作(仍 off-policy 且被标量瓶颈)的本质区别。

Comparison of RL and EL
Figure 2: Comparison of RL and EL
Controlled distribution-matching analysis
Figure 4: Controlled distribution-matching analysis

实验结果

核心发现四点。其一,EL 在大多数基准上稳定超越 rubric-based RL,跨两个策略族(Qwen3-8B、OLMo-3-7B)和两种反馈模型(冻结策略、GPT-4o)均成立。以 OLMo-3-7B+自身反馈为例,AlpacaEval v2.0 胜率 45.9%→50.8%,WildBench 偏好分 42.1→47.5,ArenaHard v2.0 23.3→26.2;Qwen3-8B+自身反馈 WildBench 18.4→21.8,说明收益来自更丰富的信息通道而非特定反馈模型。其二,EL 泛化更好(Figure 3):在 1000 条训练子集上 EL 提升 +1.1 反低于 RL 的 +1.7,但在测试集(+2.0 vs +1.3)、AlpacaEval(+4.2 vs +0.8)、WildBench(+5.5 vs +2.8)全面领先,是 reward hacking 的典型反证。其三,消融显示默认 EL(抽取可迁移知识)最优(Table 4:WildChat 68.6/IFEval 68.8),Full Critique、Rubrics Only、Multiple-Choice(带宽被压回 $\log_2 10$)都更差。其四,迭代教师把任务分从 80.0 提到 80.7,但 IFEval 从 83.1 掉到 74.9,加入通用提示 OPD 后恢复到 79.9 而分数不降。Figure 4 受控实验显示,对二值目标 RL 与分布匹配相近,但对双峰目标量化奖励产生阶梯分布、丢失细粒度,分布指导能恢复平滑目标形状。

Comparison of an LLM-as-a-Judge and an LLM-as-a-Coach
Table 1: Comparison of an LLM-as-a-Judge and an LLM-as-a-Coach
Evaluation scores of RL and EL
Table 2: Evaluation scores of RL and EL
Ablation on iterative teacher updates
Table 3: Ablation on iterative teacher updates
Ablation of teacher context on Qwen3-1.7B
Table 4: Ablation of teacher context on Qwen3-1.7B
Qualitative comparison of feedback bandwidth across learning methods
Table 5: Qualitative comparison of feedback bandwidth across learning methods
Score improvement over the base model
Figure 3: Score improvement over the base model
查看结构化数据
任务指标本文基线提升
WildChat 测试集(指令遵循,GPT-4o rubric 评分) 平均分(越高越好) EL 80.0(Qwen3-8B+自身)/ 77.1(OLMo-3-7B+自身) RL 79.2 / 76.0 +0.8 / +1.1
AlpacaEval v2.0(未见基准,对 GPT-4-Turbo 胜率) 胜率(%) EL 50.8(OLMo-3-7B+自身) RL 45.9 +4.9 个百分点
WildBench(未见基准,偏好分 [−100,100]) 偏好分 EL 47.5(OLMo-3-7B+自身) RL 42.1 +5.4
ArenaHard v2.0(未见基准,对参考胜率) 胜率(%) EL 26.2(OLMo-3-7B+自身) RL 23.3 +2.9 个百分点
IFEval(OOD 指令遵循,消融稳健性) 准确率(%) 迭代+通用 OPD 79.9 纯迭代教师 74.9 +5.0(恢复遗忘)

局限与改进

作者明确承认三点局限。其一,带宽是“理论最大编码容量”而非可用监督量:1024 token 的经验上下文虽理论上可达 17600 比特,但自然语言冗余和不完美的知识抽取会使实际可用信息小得多,作者用脚注特别强调这不衡量经验知识与期望策略改进之间的互信息。其二,EL 只解决反馈模型与策略之间的带宽瓶颈,不解决反馈模型本身的偏差或校准问题——若教练本身有偏,EL 无法纠正,改进反馈模型的校准仍是互补的独立方向。其三,Figure 4 的分布匹配分析是一个受控的玩具构造,并非对完整 RL/EL 流程的忠实仿真,也不证明所有标量奖励方法的根本局限,只为直观展示把细粒度目标量化为少量奖励等级时丢弃的信息。我额外观察到:实验仅在 7B–8B 两个模型族上做,规模有限;评估几乎全靠 GPT-4o(虽交叉验证过更强私有评估者趋势一致),存在评估器自身偏好风险;多轮迭代与更大策略的扩展性未被充分验证;计算开销(每 batch 都要对 8×256 个回答做教练调用 + 教师前向)未量化报告。

独立分析的弱点

第一个弱点是评估对单一裁判的依赖。所有主实验都用 GPT-4o 评分,虽附录交叉验证了更强私有评估者趋势一致,但 GPT-4o 对写作风格的偏好可能系统性偏向 EL 产出;改进方向是引入多裁判集成或人类偏好评估做交叉验证。第二个弱点是规模与覆盖有限:只在 Qwen3-8B、OLMo-3-7B 两个 7B 级模型上验证,未触及 30B/70B 或 reasoning 模型,EL 优势能否随规模保持存疑;改进方向是扩展到更大模型与 thinking 模式策略。第三个弱点是带宽论证停留在理论上:17600 比特是编码上界,论文未测量经验知识的“有效信息量”或与策略改进的互信息;改进方向是设计探针实验量化实际有效带宽、并把带宽与性能增益联系起来。第四个弱点是知识抽取的质量与一致性难以保证且成本高——每条 on-policy 回答都要教练调用并蒸馏,作者承认 rollout 与反馈生成是两端共享的大头开销但未给具体成本;改进方向是批量/缓存式知识抽取、把教练蒸馏成轻量模型,或用更便宜的蒸馏教师。第五个弱点是迭代教师引入遗忘需通用提示 OPD 补救,说明方法对超参(混合比例、教师更新节奏)敏感;改进方向是更鲁棒的教师调度或正则化。

未来方向

作者在结论中明确提出三个方向:可扩展的迭代学习(迭代式体验学习的规模化)、改进的知识抽取(让经验知识抽取更高质量、更低成本)、以及更广泛的复杂开放式任务后训练。基于本成果可延伸的方向包括:把 EL 与可验证任务的 RLVR 结合,形成混合目标(既保留标量奖励在可验证任务上的高效,又用经验知识处理开放式部分);将框架从单轮写作扩展到多轮、Agent 与工具调用任务;研究自我改进闭环(策略自身充当教练并迭代内化);探索更强的知识抽取模型以逼近带宽上界;把“反馈带宽”框架推广到奖励塑形、奖励模型校准等其他后训练问题,作为统一分析工具;研究经验知识能否显式存储进外部记忆以支持跨任务复用与持续学习。

复现评估

复现性总体良好。作者开源了代码(aka.ms/el-code),训练数据 WildChat-IF(7500 条真实指令提示,附带 GPT-4o 生成的 rubrics)与 Tulu3 通用提示都是公开的,策略模型 Qwen3-8B、OLMo-3-7B-Instruct 也是开源权重,关键的 prompt 模板与示例放在附录 A.1–A.5。超参交代清楚:batch 256 提示、每提示 8 回答、学习率 $1\text{e-}6$、最大提示 8192 token、最大回答 4096 token、rollout 温度 1、3 轮训练、反向 KL 取 top-256 token 不归一化。主要障碍有二:一是反馈模型 GPT-4o 是私有 API,需付费且结果不可完全复现(切换其他强模型应能得到一致相对趋势但绝对数字会变);二是计算开销高——每个 batch 要对 256×8=2048 条回答做教练调用、再做条件教师前向与逐 token KL,作者承认 rollout + 反馈生成是大头但未给出 GPU 数量与训练时长,复现完整主表需相当算力。总体属于“中等偏上”难度:方法与数据齐备,主要卡在私有评估 API 与未公布的算力规模。