AgentOPSD:面向智能体强化学习的递归式自蒸馏信用分配 AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
用递归贝叶斯信念更新为长程智能体RL做回合级信用分配
前置知识
GRPO(Group Relative Policy Optimization,组相对策略优化)
DeepSeekMath 提出的免价值网络(critic-free)策略优化方法。对每个任务采样一组 G 条轨迹,用组内奖励的均值 R̄ 和标准差 σR 把每条轨迹的终局奖励 R^(i) 标准化为相对优势 A_seq^(i)=(R^(i)−R̄)/(σR+ε0),然后把这个标量优势无差别地广播(broadcast)到轨迹里的每一个 token 上,配合 PPO 式的 clip 比率 r_t 与 KL 正则项做梯度更新。它绕开了庞大的 critic 网络,代价是同一个优势被施加给整条轨迹的所有 token。
本文所有改进都建立在 GRPO 的序列级优势之上;不理解 GRPO 把同一个 A_seq 广播给所有 token 这一机制,就无法理解 AgentOPSD 想要按回合重新分配优势的核心动机。
OPSD(On-Policy Self-Distillation,在线自蒸馏)
一种不需要额外教师网络的自蒸馏。学生与教师共享同一套参数 θ,唯一区别是教师在训练时被额外喂入特权上下文(如技能描述 c+),形成一个 teacher 分支。对同一个学生采样出的 token,计算教师与学生条件下的对数概率差 δ_t=log πθ(y_t|h+_t)−log πθ(y_t|h_t),δ_t>0 表示特权信息让这个 token 更可能出现,提供了比稀疏终局奖励稠密得多的 token 级监督信号。推理时不使用特权信息。
AgentOPSD 的回合级证据 e_k 正是 OPSD 的 token 级 gap δ_t 在回合内求和得到;不懂 OPSD 如何产生 δ_t,就理解不了 e_k 的物理意义,也就理解不了 AgentOPSD 的证据来源。
信用分配(Credit Assignment)
强化学习的经典难题:当一条轨迹只在结束时拿到一个奖励,如何把这个奖励分摊到中间每一步/每个决策上?长程交互中,成功轨迹里可能掺着冗余甚至误导的动作,失败轨迹里也可能藏着有用的推理。传统做法是学习一个价值函数 V(s) 配合 GAE 来估计逐步 TD 信号,但这需要训练一个额外的 critic 网络,且对延迟稀疏奖励效果有限。
整篇论文的核心问题就是如何在免 critic 的 GRPO 框架内恢复回合级(turn-level)信用,这是读懂论文的出发点。
贝叶斯信念更新与对数几率(Bayesian Belief Update / Log-odds)
在部分可观测环境里维护一个状态信念。把轨迹最终成功的事件记为 C,信念 B_k=p(C|s_k,a_k) 是看到前 k 步交互后认为最终会成功的概率。贝叶斯更新在对数几率空间 logit(p)=log(p/(1−p)) 有个漂亮性质:新证据以对数似然比(log-likelihood ratio,即 Bayes 因子)的形式线性累加到 logit 上,即 logit p(C|s,a)−logit p(C|s)=log[p(a|s,C)/p(a|s,¬C)]。这就是顺序概率比检验(SPRT)的数学基础。
AgentOPSD 的数学骨架就是把 OPSD gap 当作新证据、在对数几率空间里递归累加;不理解 log-odds 的线性累加性质,就看不懂 c_k=γ c_{k−1}+e_k 这个递推为什么有原则性意义。
PPO Clipping / 信任域(Trust Region)
PPO 用重要性采样比率 r_t=πθ(y_t|h_t)/πθ_old(y_t|h_t) 把旧策略采样的数据复用给新策略,但用 clip(r_t,1−ε,1+ε) 把单步更新限制在信任域内,防止策略崩溃。GRPO 继承了这一机制,论文里还用了 clip-higher(εlow=0.2、εhigh=0.24 不对称)。
AgentOPSD 强调自己的重塑是有界(Prop 1)且保号(Prop 2)的,这个有界+保号的安全性论证正是建立在 PPO clip 之上,是理解方法不会破坏训练稳定性的关键。
研究动机
现有的智能体后训练主要依赖 GRPO 这类组相对策略优化方法:对每个任务采样一组 G 条轨迹,把终局奖励标准化成唯一的序列级优势 A_seq,再把这个标量无差别地广播到轨迹里每一个 token 上。问题在于,长程多轮交互里不同回合扮演的角色天差地别——一条成功轨迹里可能掺着冗余甚至误导的动作,一条失败轨迹里也可能藏着有用的推理步骤,而统一的 A_seq 完全无法区分决定成败的关键回合和例行操作。这个缺陷随交互长度增长而恶化,在 ALFWorld 这种平均几十个回合的家务任务上尤为突出。另一方面,最近兴起的 OPSD(在线自蒸馏)能提供比终局奖励稠密得多的 token 级教师-学生概率差信号,但直接搬到智能体场景有两个不匹配:一是 token 级信号与环境只在回合边界回应的多轮结构不天然对齐(一个动作由多个 token 组成);二是即便有 step-aware 的方法(如 StepOPSD),也只是孤立地看每个回合的局部 gap,没考虑前序交互已经积累了多少证据。论文 §1 与 §4.2 都指出,中心难题是如何把局部 OPSD 信号转成依赖历史的回合级信用。
本文的目标是设计一个免价值网络(critic-free)、不需要额外 rollout、与标准 GRPO 完全兼容的回合级信用分配机制。具体目标包括:(1) 把 token 级的 OPSD 教师-学生概率差在回合边界聚合,与环境交互天然对齐;(2) 让每个回合的信用不仅取决于它自己的局部信号,还取决于它在多大程度上改写了最终会成功这一信念;(3) 重塑后的优势必须保持 GRPO 的方向(不反转优化方向)且保持有界(不破坏信任域);(4) 在多个交互环境(ALFWorld/WebShop/Search-QA)、多个模型规模(Qwen2.5-3B/7B)上一致地超过 GRPO 和强自蒸馏基线;(5) 整个机制只需要在 GRPO 基础上每回合多一次教师前向,不引入额外可学习参数或额外采样。
与已有工作不同的是,独特的切入角度是把信用分配重新表述为贝叶斯信念的边际改写。作者的关键洞察是:一个回合的信用不在于它自身的局部信号有多大,而在于这个信号让最终成功概率改变多少。形式化上,把每回合的 OPSD gap 解读为触发贝叶斯更新的新证据(Bayes 因子的可计算代理),在对数几率空间里从组成功率 R̄ 作为先验 B0 出发递归累加证据 c_k=γ c_{k−1}+e_k,信念 B_k=σ(logit(B0)+c_k),回合 k 的信用等于边际改写 ΔB_k=B_k−B_{k−1}。这种递归信念改写视角天然带历史依赖性:同一个局部 gap 在结果尚悬而未决时是决定性的,一旦积累状态已倒向某结果就变成冗余——这正是孤立 step-level 方法缺失的维度。相比 VinePPO/PRM 这类需要额外 rollout 或学习 reward model 的方案,AgentOPSD 是零额外采样、零 critic 的轻量路径。
核心方法
直觉上,AgentOPSD 把 GRPO 的单一标量优势升级成按回合分配的优势。整体路线分三步:(1) 聚合——把每回合内 token 级教师-学生 log-prob gap δ_{k,t} 求和成回合级证据 e_k=Σ δ_{k,t}=log[πθ(a_k|s_k,c+)/πθ(a_k|s_k)],与环境在回合边界回应的交互结构对齐;(2) 递归信念更新——从先验 B0=clip(R̄,ε0,1−ε0) 出发(R̄ 是组内成功率即 GRPO 组均值),用衰减累加器 c_k=γ c_{k−1}+e_k 在对数几率空间推信念 B_k=σ(logit(B0)+c_k),读出边际改写 ΔB_k;(3) 有界重塑——把 ΔB_k 与结局信号对齐 q_k=sign(A_seq)·ΔB_k,轨迹内标准化得 z_k,再做有界乘子 w_k=clip(1+b·z_k,1−b,1+b),回合优势 Ã_k=A_seq·(1−λ)+λ·w_k。框架完全套用标准 GRPO 的 PPO clip 目标,不引入额外蒸馏损失、不训练 critic、每回合只多一次教师前向。
核心创新点是把局部自蒸馏 gap 重新诠释为贝叶斯信念更新,从而用信念的边际改写而不是局部分数本身作为信用。这与已有方法的本质区别在于:RLSD/Skill-SD/SDAR 都是把 teacher-student gap 直接当作 token 级或步级的幅度门控/辅助损失,每个局部信号是孤立的;StepOPSD 虽在步级聚合,但仍用每步的局部 log-ratio 评分。AgentOPSD 第一次让同一个 gap 在不同历史时刻产生不同信用(边际改写依赖前序积累),并用组成功率作为对数几率先验把任务难度锚定进去。理论支撑在 §A.1:在成功率 ρ→0 极限下 e_k 收敛到理想 Bayes 因子;在更一般条件下 e_k 是点互信息,保号且保持排序。此外 §A.2 的 Prop 1-3 证明重塑有界(|Ã_k−A_seq|≤λb|A_seq|)、保号(sign(Ã_k)=sign(A_seq))、λ=0 时退化为 GRPO,保证了安全性。
方法步骤详情
一次迭代(Algorithm 1):输入 πθ、验证器 R、G=8、技能检索器,λ=0.5、b=0.2、γ=0.95。(1) 采样一批任务,关键词匹配从 SkillBank 检索技能 c+。(2) 策略上采样 G=8 条轨迹,每条 i 有 K_i 回合,验证器给二元奖励 R^(i)∈{0,1}。(3) 算组相对优势 A_seq^(i)=(R^(i)−R̄)/(σR+ε0),R̄=S/G。(4) 每条轨迹 i:初始化 B0、ℓ0=logit(B0)、c0=0;遍历回合 k:用教师分支(含 c+)与学生分支对同一组采样 token 各做一次前向,求 stop-grad gap δ_{k,t}=log πθ(y_{k,t}|h+_t)−log πθ(y_{k,t}|h_t),回合内求和得 e_k;更新 c_k=γ c_{k−1}+e_k、B_k=σ(ℓ0+c_k)、ΔB_k=B_k−B_{k−1}。(5) 对齐 q_k=sign(A_seq^(i))·ΔB_k,标准化 z_k=(q_k−mean(q))/(std(q)+ε)。(6) 有界乘子 w_k=clip(1+b·z_k,1−b,1+b),回合优势 Ã_k=A_seq^(i)·(1−λ)+λ·w_k。(7) 用带 clip 比率 r_t 与 KL 正则的标准 GRPO 目标做一次 PPO epoch 更新。
技术新颖性
技术新颖性体现在三处。第一,把 OPSD gap 与贝叶斯信念更新严格联系起来:§A.1 证明 e_k 是理想 Bayes 因子的可计算代理(在 ρ→0 极限下精确相等,一般条件下为点互信息并保号保序),使自蒸馏信号获得了贝叶斯语义。第二,首次提出信用=信念边际改写——ΔB_k≈B_{k−1}(1−B_{k−1})·(e_k−(1−γ)c_{k−1})(Prop 4),它带 B(1−B) 门控,在信念不确定(≈0.5)时证据影响最大、饱和时被抑制,这是孤立 step-level 方法无法表达的历史依赖性;Prop 5 证明理想递归可望远镜求和到端点 BK−B0。第三,有界重塑设计(Prop 1-3)保证 |Ã_k−A_seq|≤λb|A_seq| 且 sign(Ã_k)=sign(A_seq),既能让关键回合被放大,又不会反转 GRPO 方向或破坏信任域。相比 VinePPO/GiGPO/PRM 这类要额外 rollout、学 reward model 或 critic 的方法,AgentOPSD 仅多一次教师前向,是真正零额外采样、零 critic 的方案。
实验结果
在三个环境 × 两个规模(Qwen2.5-3B/7B,8×H800)上评测。ALFWorld 上 7B 达 89.1% 成功率,超过 GRPO 81.2%、Skill-SD 85.1%、RLSD 82.0%、SDAR 85.9%、StepOPSD 88.4%;3B 达 84.4%(GRPO 75.0%)。Search-QA 上 7B 平均准确率 49.2%(GRPO 42.0%、SDAR 49.0%、RLSD 49.0%),3B 46.7%(GRPO 36.4%);多跳 Bamboogle 在 7B 从 GRPO 37.6 升到 70.2。WebShop 上 3B 得 90.4 Score/69.5 Acc(GRPO 79.8/63.3)。最关键发现是收益随交互长度增长:图1(b) 对每子任务成功率与成功 episode 平均回合数做 OLS 回归,统一信用方法衰减最快(RLSD −3.59、GRPO −2.91 点/回合),AgentOPSD 最平缓仅 −0.54。机制消融(表2,89.1 基准):去符号方向降到 80.5、去先验降到 78.9、原始局部 gap 替递归降到 82.8、token 级聚合降到 85.9,四大设计皆必要。超参敏感性(图3)显示只有 λ 有系统性影响(0.5 最优),γ、εhigh 大范围内鲁棒,短程 Search-QA(4 回合)几乎无影响,印证方法只在需要长程信用时发力。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld 整体成功率(Qwen2.5-7B-Instruct) | Success Rate (%) | 89.1 | GRPO 81.2 / SDAR 85.9 / StepOPSD 88.4 | +7.9 vs GRPO,+0.7 vs 次优 StepOPSD |
| ALFWorld 整体成功率(Qwen2.5-3B-Instruct) | Success Rate (%) | 84.4 | GRPO 75.0 / StepOPSD 73.4 | +9.4 vs GRPO |
| Search-QA 平均准确率(7 个 QA 数据集,Qwen2.5-7B) | Accuracy (%) | 49.2 | GRPO 42.0 / SDAR 49.0 / RLSD 49.0 | +7.2 vs GRPO,+0.2 vs 次优 |
| WebShop 任务得分(Qwen2.5-3B) | Score (%) | 90.4 | GRPO 79.8 / SDAR 85.0 | +10.6 vs GRPO,+5.4 vs SDAR |
| 长程鲁棒性(每多一个回合损失的成功率百分点,ALFWorld 7B) | success points lost / extra turn (OLS 斜率) | −0.54 | GRPO −2.91 / RLSD −3.59 | 比 GRPO 鲁棒约 5.4 倍,比 RLSD 鲁棒约 6.7 倍 |
局限与改进
作者承认的局限:(1) B_k 被当作相对支持度而非校准的成功概率(§2.3 明确指出),因为 e_k 是用自教师估计的;(2) §A.1 的 Bayes 因子近似依赖两个假设 A1(技能条件分支≈成功条件行为)和 A2(成功率低时边际≈失败分布),在成功率很高的任务上 A2 失效;(3) 仅在二元奖励、终局验证的环境上验证,未扩展到密集奖励或连续奖励场景;(4) 论文未报告相对 GRPO 的 wall-clock 与显存开销百分比。我自己观察到的局限:(a) 三个环境的最大交互回合数(ALFWorld 50、WebShop 15、Search-QA 4)虽涵盖短-中-长,但相对真实生产级 agent(如 SWE-bench 几十至上百步)仍偏小,超长程行为未测;(b) 技能 c+ 来自外部 SkillBank(SkillRL),方法对特权信息质量有隐性依赖,换领域需重建技能库;(c) 每回合多一次教师前向,对上下文极长的 agent 仍会增加显存/算力;(d) λ=0.5 是统一用的,但消融显示它影响最大,跨更多任务是否要重调未知。
独立分析的弱点
弱点一:方法对特权技能有较强依赖。整个证据 e_k 来自技能条件分支,若检索到的技能质量差或不相关,e_k 会退化成噪声;改进方向是引入技能相关性自检/置信度门控,或用 verifier-free 的特权信号(如反思链、自一致性)替代 SkillBank。弱点二:信念先验 B0 用组内成功率 R̄,对于全对/全错的组(R̄=1 或 0)clip 到边界后梯度为零(Prop 7 提到这些组本就不贡献更新),这意味着在最难(全失败)或最易(全成功)的任务上 AgentOPSD 失效,相当于只在中等难度任务上发力;可改进为自适应先验(如跨 batch 的 EMA 任务难度估计或元学习先验)。弱点三:B(1−B) 门控在信念饱和时压制证据,但极端饱和下也可能漏掉真正的关键改写;可结合探勘式重置或对抗性扰动。弱点四:仅在二元终局奖励下验证,未处理部分奖励、过程奖励或稀疏但非二元的场景;可扩展到加权/连续奖励。弱点五:长程任务回合数上限(≤50)相对真实生产环境仍偏短,且 wall-clock/显存开销未报告;应在百步级 agent(SWE-bench、复杂网页自动化)上验证可扩展性。
未来方向
作者提出的方向相对隐含:(1) 把 AgentOPSD 与环境奖励侧的信用分配(如 GiGPO)结合,作者明确指出两者信号来源互补(§4.1),可做自蒸馏证据+环境奖励的联合分配;(2) 扩展到非二元、连续或部分奖励的环境。基于本文成果可延伸的方向:A. 把信念边际改写框架推广到任意可计算的对数似然比证据(不限于技能自蒸馏),例如用过程奖励模型、人类偏好或反思信号作为证据源,只要保号即可套用同一递归骨架。B. 在超长程 agent(SWE-bench、复杂 GUI 自动化)上验证 −0.54 点/回合的鲁棒性是否在 100+ 回合仍成立。C. 研究先验 B0 的自适应——用跨任务的难度记忆(meta-learned prior)替代单组成功率,缓解全成功/全失败组的失效。D. 把 B(1−B) 门控与探索策略结合,在信念饱和处主动注入探索。E. 对技能检索做端到端联合训练,让证据质量也成为可优化目标,摆脱对外部 SkillBank 的依赖。
复现评估
复现友好度较高。代码开源在 https://github.com/ZethWang/AgentOPSD。三个环境都是公开基准:Search-QA 复用 Search-R1 的 7 个 QA 数据集,ALFWorld 评测六类家务任务,WebShop 用 Feng et al. 2025 的 128 个固定验证任务。超参在表3、表4 完整给出,作者强调跨所有环境和模型规模用同一套设置(λ=0.5、b=0.2、γ=0.95、εlow/εhigh=0.2/0.24、αKL=0.01、lr=1e-6、G=8、150 步),无需逐任务调参。基础模型用公开 Qwen2.5-3B/7B-Instruct,技能库来自公开 SkillRL,按关键词匹配检索。算力门槛:8×H800、150 步,相比需要训练 critic 或做大量额外 rollout 的方法开销可控。难度中等偏上:需熟悉 GRPO/自蒸馏训练栈、能跑通多轮 agent rollout、实现教师多一次前向的工程改造;理论部分需一定概率论基础,但实现层面照 Algorithm 1 编码即可。
论文图表