面向智能体强化学习自蒸馏的持久一致性方法 PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
按教师信号的局部持久性,为每个 token 分配自适应蒸馏权重。
前置知识
GRPO(Group Relative Policy Optimization,组相对策略优化)
DeepSeek 提出的免 critic 强化学习算法:对每个输入采样一组 G 条完整轨迹,把组内奖励归一化得到优势 $A_g=(R_g-\mu_R)/(\sigma_R+\epsilon_{num})$,再用类似 PPO 的裁剪比率目标 $\min(\rho_{g,i}A_g,\bar\rho_{g,i}A_g)$ 与对参考策略的 KL 正则联合优化。它省去了价值函数、降低算力,但监督仍停留在轨迹级——同一条轨迹的所有 token 共享同一个 $A_g$。
本文以 GRPO 作为基础 RL 目标,PCSD 的蒸馏损失 $\mathcal{L}_{PCSD}$ 与之联合优化;理解 GRPO 轨迹级粗粒度监督,才能理解为什么需要补一层 token 级蒸馏。
OPSD(On-Policy Self-Distillation,在线自蒸馏)
OPSD 不单独训练更强的教师,而是把学生的同一份基础权重冻结一份、额外注入检索到的「特权技能/上下文」作为教师 $\pi_T$。教师对学生在线采样出的轨迹做 teacher forcing,给出每个 token 的条件概率,从而把稀疏的轨迹级环境奖励补充为密集的 token 级监督。教师全程冻结、不接收梯度。
PCSD 正是在 OPSD 框架上改进「教师信号该按什么权重传给学生」;理解「特权教师 + 学生采样 token」的机制是读懂全文所有公式的前提。
Teacher–student 对数概率差(log-probability gap)
定义为 $\delta_{k,i}=\log\pi_T(y_{k,i}\mid h^T_{k,i})-\log\pi_\theta(y_{k,i}\mid h^S_{k,i})$,衡量教师在学生采样的同一个 token 上给出的相对支持力度:$\delta$ 越大说明教师越认可该 token。它是 PCSD 一切权重计算的原始信号。
$\delta$ 是 PCSD 唯一的可信度信号源,论文中窗口聚合、方差自适应、趋势调制、sigmoid 门控全部围绕 $\delta_{k,i}$ 展开。
长程信用分配(credit assignment)
在多轮、上百 token 的智能体任务里,环境通常只在最后给一个成功/失败的标量奖励。如何把这个迟到的奖励「分摊」到中间每一个动作或 token 上,就是信用分配难题。奖励越稀疏、越延迟,策略越难学到「究竟是哪一步做对了」。
本文的核心动机就是缓解信用分配难题——用密集的教师 token 级监督补足稀疏的环境奖励,让长程任务里中间决策也能获得有效梯度。
特权上下文与技能检索(privileged context / skill retrieval)
教师额外拿到一类「技能」——通用交互规则 + 按任务类型关键词匹配出的过程性知识(如「先取物、再加热、再放置」),但不含具体实例的答案、目标物体位置或未来观测。学生永远看不到这些技能,因此评测分数反映的是学生内化的能力,而非对检索的依赖。
理解「特权」的边界(只给过程性先验、不给实例答案),才能正确解读实验中「PCSD 无需推理时技能仍最优」这一关键结论。
研究动机
LLM 智能体在多轮交互中要连续决策,一条轨迹往往横跨几十轮、几百个生成 token,而环境通常只在末尾给一个标量奖励。这种稀疏且延迟的反馈让信用分配变得极其困难——GRPO 这类免 critic 方法虽然把价值函数换成了组内相对奖励,但监督仍停留在轨迹级,整条轨迹共享同一个优势。为补足稀疏信号,OPSD 引入特权教师给出密集 token 级监督;但教师并非每个位置都可靠:检索不完美、上下文有噪声、任务存在歧义,教师可能在某些 token 上偏好次优选择,盲目蒸馏会传播错误偏好。现有「可信度感知」方法分两类:token 级方法(如 SDAR)用单个位置的师生差异或概率比估计可靠性,对采样噪声敏感——单个 token 的大差异既可能是真正的教师优势,也可能是瞬时波动;step 级方法(如 SOD)把整步的差异聚合成一个共享权重,稳健却抹平了位置间的可信度差异。这本质上是一个 token 级精度与聚合稳健性之间的权衡,而现有方法各执一端。
本文的目标是本文要设计一个 token 级蒸馏权重机制,同时兼顾位置级精度和聚合稳健性。核心判据是:真正有信息量的教师优势应当在局部邻域内「持续」存在,孤立的尖峰更可能反映采样噪声或偶然波动。在可量化的目标上,作者希望在 ALFWorld、WebShop 两个标准智能体基准上,稳定超过纯轨迹级 GRPO 和现有 GRPO+蒸馏基线(SDAR、RLSD、GRPO+OPSD),并在未见过的环境配置上保持泛化,同时评测时不依赖任何推理时技能检索。
与已有工作不同的是,已有方法要么「只看一个点」(token 级)要么「看一整步」(step 级),却没有人去检验教师支持信号是否在局部窗口内持续。本文抓住「持久性(persistence)」这个被忽视的维度:用局部窗口内多时间尺度的证据、再叠加趋势方向,来判断教师信号是否可信。它不是简单地加窗平滑,而是「自适应窗口 + 指数衰减 + 单侧趋势调制 + 连续 sigmoid 门控」的组合,把 token 级分辨率与局部聚合的稳健性统一起来。
核心方法
直觉上,PCSD 像在判断一位同事的建议可不可信:不只听他这一句话,还要看他最近几句话是不是一致地支持你,以及他的支持力度是不是在走下坡路——只有「持续且不衰退」的支持才值得认真采纳。技术路线上,PCSD 把师生对数概率差 $\delta_{k,i}$ 作为原始信号,先在局部前向窗口做指数加权聚合得到「持久一致性估计」;再按局部方差在短窗($N_{min}=1$)与长窗($N_{max}=8$)之间软插值;接着用单侧趋势因子衰减「正在走下坡」的位置;最后用 sigmoid 门控把结果映射成连续权重 $w_{k,i}$。该权重参与加权蒸馏损失,与 GRPO 的轨迹级目标联合优化,让密集的教师监督补足稀疏的环境反馈。
核心创新是把「教师可信度」从「单个点的差异」重新定义为「局部邻域内教师支持信号的持久性」:持久意味着多个相邻位置都一致地偏向教师,孤立尖峰则被视为噪声。三件套互补且各有分工:自适应窗口按局部方差在精度与平滑间权衡(低方差用短窗保细节,高方差用长窗保稳健);指数衰减保留位置局部性(远处证据权重小);单侧趋势调制只衰减下降的支持趋势、不奖励上升趋势,避免对已经反映在 gap 里的正向支持重复计分。与已有 token 级方法的本质区别是不孤立看一个点,与 step 级方法的区别是不粗暴共享权重;而用 sigmoid 产生独立连续权重(而非归一化权重)能避免 token 间的零和竞争——这一点还被 Figure 5 的扰动实验间接验证。
方法步骤详情
流程分七步。(1) 学生在线采样轨迹,冻结的技能增强教师对同样的学生 token 做 teacher forcing,得到去梯度的师生对数概率差 $\delta_{k,i}=\log\pi_T(y_{k,i}\mid h^T_{k,i})-\log\pi_\theta(y_{k,i}\mid h^S_{k,i})$。(2) 持久一致性评估:在前向窗口 $N$ 上做指数加权聚合 $\bar\delta^{(N)}_{k,i}=\frac{\sum_{j=0}^{N-1}\alpha^j m_{k,i+j}\delta_{k,i+j}}{\sum_{j=0}^{N-1}\alpha^j m_{k,i+j}}$,近处 token 权重更大(衰减系数 $\alpha=0.8$)。(3) 自适应聚合:在长窗 $N_{max}=8$ 上算局部方差 $\sigma^2$,映射为插值系数 $r_{k,i}=\mathrm{clip}((\sigma^2_{k,i}-\tau_{low})/(\tau_{high}-\tau_{low}),0,1)$,得 $\bar\delta^{adaptive}_{k,i}=(1-r)\bar\delta^{(N_{min})}+r\bar\delta^{(N_{max})}$,低方差用短窗保细节、高方差用长窗保稳健。(4) 趋势调制:在 $N_{max}$ 窗口用 mask 感知 OLS 拟合斜率,单侧因子 $\eta_{k,i}=\mathrm{clip}(1-\gamma\,\mathrm{ReLU}(-slope/\delta_{scale}),0,1)$ 只惩罚下降趋势。(5) 连续门控:$w_{k,i}=\sigma(\beta_{gate}\,\bar\delta^{adaptive}_{k,i})\,\eta_{k,i}$,sigmoid 把持久支持映射成连续权重。(6) 蒸馏损失 $\mathcal{L}_{PCSD}=\frac{1}{M}\sum m_{k,i}w_{k,i}\delta_{k,i}$,教师 log-prob 与 $w$ 都 detach,仅对学生产生加权 NLL 梯度。(7) 总损失 $\mathcal{L}=\mathcal{L}_{GRPO}+\lambda_{PCSD}\mathcal{L}_{PCSD}$($\lambda_{PCSD}=0.01$),每步只更新学生参数。
技术新颖性
新颖性体现在三处与已有技术的本质区别。其一,自适应窗口是「软插值」而非离散切换——$r_{k,i}$ 连续地在短窗与长窗估计间过渡,可微且不会在阈值处突变。其二,单侧趋势调制是非对称设计,只衰减不放大:因为上升的教师支持已由 gap 与 sigmoid 门控体现,再用趋势奖励会造成冗余放大。其三,用 sigmoid 产生独立连续权重而非归一化权重,避免 token 间的零和竞争——论文在 Figure 5 用「移除技能/打乱技能」扰动显示,PCSD 的权重变化与教师质量变化呈弱正相关($\rho=0.174/0.052$),而采用归一化权重的 SDAR 却出现逆向关联($\rho=-0.489/-0.208$)。理论上还给出偏差-方差分析:$N_{max}=8,\alpha=0.8$ 时有效样本量 $\approx 6.41$、时间位移仅 $\approx 2.39$ token,兼顾平均性与局部性。
实验结果
主结果(Table 1)显示,在 ALFWorld 上 PCSD 取得最高 Overall 成功率:Qwen2.5-3B-Instruct 上为 90.6%,比纯 GRPO(75.0%)高 15.6 个点、比最强蒸馏基线 SDAR(84.4%)高 6.2 个点;Qwen3-1.7B-Instruct 上为 59.4%,比 GRPO(46.1%)高 13.3 点、比 SDAR(53.9%)高 5.5 点。子任务上 Heat、Cool、Pick2 提升尤其明显,例如 Qwen2.5-3B 的 Pick2 达 100.0%(SDAR 仅 84.2)。在 WebShop 上,Qwen2.5-3B 的归一化 Score 为 85.0(全场最高),Acc 67.2 与 SDAR 并列最高;Qwen3-1.7B 的 Score 78.9 排第二,仅次于使用推理时技能的 Skill-GRPO*。泛化方面(Figure 4),在 ALFWorld 未见环境划分上 PCSD 的 Overall 达 86.7%,远超 GRPO 的 70.9%(+15.8)和 SDAR 的 72.7%,且评测时不使用任何推理技能,说明收益来自学生内化策略。训练动态(Figure 3)显示师生 gap 均值为负但随训练上升,同时只有 20%–28% 的有效 token 满足 $w_{k,i}>0.5$,表明权重是集中式而非均匀硬选择。消融(Table 2)确认三组件互补,$\lambda_{PCSD}$ 敏感性呈非单调($0\to75.0$、$0.01\to90.6$、$0.05\to83.6$),需与 RL 平衡蒸馏强度。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld Overall 成功率(Qwen2.5-3B-Instruct) | 成功率 % | 90.6 | GRPO 75.0 / SDAR 84.4 | +15.6 over GRPO,+6.2 over SDAR |
| ALFWorld Overall 成功率(Qwen3-1.7B-Instruct) | 成功率 % | 59.4 | GRPO 46.1 / SDAR 53.9 | +13.3 over GRPO,+5.5 over SDAR |
| ALFWorld 未见环境泛化(valid_unseen) | Overall 成功率 % | 86.7 | GRPO 70.9 / SDAR 72.7 | +15.8 over GRPO |
| WebShop 归一化分数(Qwen2.5-3B-Instruct) | Score | 85.0 | SDAR 83.4 / RLSD 84.4 | 全场最高 |
| WebShop 任务成功率 | Acc % | 67.2(两骨干均并列最高) | SDAR 67.2 / 58.6 | 与 SDAR 并列最高 |
局限与改进
作者坦承的局限包括:PCSD 用固定超参做局部聚合与门控、并冻结特权教师,这种设计虽然隔离了持久一致性加权的作用,却降低了对演化中的轨迹统计与教师可靠性的适应能力;其次,高方差并不总是意味着「该做更多平滑」,窗口内的突变可能被部分平滑掉;此外 Figure 5/6 的鲁棒性与对齐实验只是对「加权行为」的分析,并不直接构成下游任务性能或单组件因果关系的证据。我额外观察到:评测范围偏窄,只覆盖 ALFWorld 与 WebShop 两个文本基准、且只用了 1.7B/3B 两个小骨干;技能检索采用较粗糙的关键词匹配,技能库(「通用交互规则」)的构造细节描述模糊,可能影响他人复现;$\lambda_{PCSD}=0.01$ 处于较窄的最优区,从 0.005 到 0.05 性能在 87.5–83.6 间波动,提示对调参有一定敏感性。
独立分析的弱点
其一,泛化验证范围窄:仅有 ALFWorld+WebShop 两个文本任务、两个 7B 以下模型,未触及工具调用、GUI 操作、代码生成等更复杂的真实智能体场景(尽管 related work 大量引用)。改进方向:扩展到 τ-bench、AndroidWorld、SWE-bench,并在 7B/14B/32B 模型上验证持久一致性加权是否随规模保持有效。其二,超参固定且敏感:窗口、方差阈值、$\gamma$、$\beta_{gate}$、$\lambda_{PCSD}$ 全靠手调,$\lambda$ 在 0.005–0.05 间性能波动达约 7 个点。改进方向:把窗口/阈值/衰减系数做成可学习或随训练阶段调度。其三,教师一次性冻结:若基础 checkpoint 偏弱,特权技能带来的增益有限,可周期性更新教师或走向「自演化蒸馏」。其四,技能检索太粗:关键词匹配易召回噪声技能,而这正是 PCSD 需要事后「补救」的噪声来源,可用语义检索联合教师不确定性来选技能。其五,前向窗口只往后看、且需完整响应采样后才能算权重,无法用于流式/在线 token 生成场景。
未来方向
作者提出的方向有两条:一是让聚合与门控参数变得「上下文相关」,从轨迹统计、教师不确定性、环境反馈中在线学习窗口大小、衰减系数与方差阈值;二是走向「自演化蒸馏」,让学生、教师、可信度估计器与技能库在在线交互中共同进化。基于本文成果还可延伸:把「持久一致性」思想迁移到 step 级奖励塑形、多教师投票的一致性检测、以及思维链(CoT)中可信 token 的识别;也可与过程奖励模型(PRM)结合,用更丰富的信号替代单一的对数概率差作为 credibility 来源。
复现评估
复现资料较为充足:论文给出了完整的 Algorithm 1 伪代码、超参表(Table 4 共享设置、Table 5 PCSD 专属设置)、两个基准的 prompt 模板,以及详细的评测协议(ALFWorld 成功奖励为 10、seen/unseen 划分;WebShop 1000 训练/128 验证、归一化 Score 与严格 Acc 公式)。骨干用开源的 Qwen2.5-3B-Instruct / Qwen3-1.7B-Instruct,基准 ALFWorld/WebShop 均开放,算力需求适中(8×A100、150 步、batch 128、最大 prompt 2048/4096 token)。但作者未明确承诺代码或权重发布;特权技能库(「通用交互规则和任务类型过程知识」)的构造细节较模糊;SDAR、RLSD 等基线是作者自行重实现的。综合判断复现难度为中等:加权机制描述清晰可自行实现,但技能库构建与基线对齐需要额外工程量。
论文图表
在随机选中的师生 gap 上注入幅度 3.0 的尖峰,扰动比例为 1%/5%/10%,计算扰动前后 token 权重排名的 Spearman 相关。PCSD 在 5% 与 10% 扰动下平均相关性(0.934/0.887)略高于 SDAR(0.929/0.864),1% 下两者接近。
它从「加权行为」角度提供了 PCSD 比归一化加权更稳健的诊断证据,是对主结果的补充佐证,也是 limitations 部分讨论方法鲁棒性的依据。