← 返回 2026-07-17

SEED:面向智能体强化学习的自进化同策略蒸馏 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao 📅 2026-07-16 👍 95 2026-07-22 18:54
事后学习 强化学习 智能体 知识蒸馏 自进化 长视野任务

把完成轨迹的事后技能蒸馏回策略,实现自进化密集监督。

前置知识

POMDP(部分可观测马尔可夫决策过程)

论文把长视野智能体任务形式化为 $(S,A,O,T,\Omega,R,\gamma)$:智能体只见观测 $o_t$,维护交互历史 $h_t$,按 $a_t\sim\pi_\theta(\cdot|h_t)$ 生成动作,轨迹结束才得稀疏奖励 $R(\tau)$。

这是讨论'稀疏轨迹级奖励'与'token 级决策学习'之间监督鸿沟的形式化基础。

GRPO(Group Relative Policy Optimization)

DeepSeekMath 的无 critic RL:每任务采 $N$ 条轨迹,用组内均值 $\mu_q$、标准差 $\sigma_q$ 归一化得优势 $A^{rl}=(R{-}\mu_q)/(\sigma_q{+}\epsilon)$,广播到该轨迹所有有效 token,配 PPO clip 与 KL 正则优化。

GRPO 是论文最主要的 outcome-only 基线,也是 SEED 联合损失 $\mathcal{L}_{SEED}=\mathcal{L}_{rl}+\lambda_{opd}\mathcal{L}_{opd}$ 中的 RL 主干。

知识蒸馏与同策略蒸馏(On-Policy Distillation)

经典知识蒸馏让 student 模仿 teacher 的 token/序列分布;同策略变体让 student 在自己采样的输出上接受监督以减少分布失配;自蒸馏进一步让 teacher 与 student 共享参数但看不同上下文(如特权推理轨迹)。

SEED 的 OPD 损失就是同策略自蒸馏——teacher 与 student 同为 $\pi_\theta$,仅 teacher 上下文插入 hindsight skill,梯度只从 student 流出。

Hindsight 学习(事后学习)

源于 Hindsight Experience Replay:一条已完成轨迹揭示在线决策时看不到的信息——哪些子目标达成、在哪偏离有效策略、哪些观测决定性。Reflexion、ExpeL 等把这种事后知识当静态经验、推理时上下文或检索记忆使用。

SEED 的核心动机是把 hindsight 转化为策略参数内监督,并强调必须随策略演化,这是与已有 hindsight 方法的本质区别。

研究动机

现有 outcome-based agentic RL(以 GRPO 为代表)只在轨迹结束时给出稀疏、延迟、轨迹级的奖励(如 ALFWorld 二值成功标志或 WebShop 最终购买评分),无法指出哪一步观测、动作或工具调用该被加强或纠正。在长视野交互里这造成严重的'监督鸿沟':一条失败轨迹可能含有用局部行为只是因少数局部错误失败;一条成功轨迹可能蕴含可复用策略但标量奖励从不标识。论文实证了代价——Qwen2.5-3B 上 Vanilla 在 ALFWorld 平均仅 21.9%、WebShop 仅 0.8%、Search-QA 平均 31.7%;GRPO 也只把 ALFWorld 拉到 75.0、WebShop Succ. 到 63.3。问题本质是 trajectory-level outcome 与 token-level policy learning 之间存在粒度断层,导致细粒度决策级信用分配能力严重受限。

本文的目标是把已完成轨迹里才看得见的 hindsight 知识(可复用工作流、决定性观测、避错规则)转化为策略参数内的监督,让策略推理时不需要任何外部记忆、技能库、检索模块或额外提示就能内化可复用行为指导。同时明确提出有效 hindsight 监督必须满足三个硬要求:on-policy(来自当前策略自己访问的状态与失败模式)、dense(能引导每个决策 token 而非只看最终结果)、self-evolving(决策能力与轨迹分析能力共同进步,事后监督持续适应新行为分布)。

与已有工作不同的是,已有 hindsight 学习要么把事后知识当静态经验存储、要么作为推理时上下文或检索记忆(Reflexion、ExpeL),无法随策略更新;已有 on-policy 自蒸馏(OPSD)和技能蒸馏(Skill-SD、RLSD、SDAR)虽能给出 token 级信号,但其特权监督源往往是静态的、外部生成或独立于策略更新——策略进步与新失败模式出现后这些监督会过时、与当前行为分布失配。SEED 的独特切入角度是:让同一个策略 checkpoint 同时担任 actor 和 analyzer,每次更新后同步刷新两者,使'经验分布'与'事后监督'绑定共同演化,从根源上消除监督失配。

核心方法

直觉:已完成轨迹里包含在线决策时看不到的事后信息——哪个子目标达成、在哪偏离有效策略、哪些观测决定性、哪些行为模式可迁移。SEED 把这种事后信息抽取成自然语言'技能'(hindsight skill),再以参数化方式蒸馏回普通策略。技术分两阶段。Stage 1 是 Hindsight Skill SFT:用外部 analyzer(GLM-5.2)给离线轨迹生成自然语言技能,再 SFT 一个模型使其具备'分析完整轨迹并产出可复用技能'的能力。Stage 2 是 Self-Evolving OPD:每次更新时冻结当前 checkpoint 为 $\pi_{\theta_{old}}$,它既采轨迹也作为 analyzer 总结技能;可训练的 $\pi_\theta$ 在保持采样动作不变前提下,分别在原始上下文与技能增强上下文下重打分同一 token,把技能诱导的概率偏移转化为密集 token 级蒸馏信号,与 GRPO 联合优化。推理时彻底移除 analyzer,部署只需学到的策略。

核心创新是'policy-synchronized self-evolving'——同一模型同时扮演 actor(与环境交互)和 analyzer(事后分析),且每次外层迭代都用最新 checkpoint 同步刷新两角色。区别于以往所有方法:经典蒸馏需外部 teacher;现有自蒸馏虽用同一模型但 teacher 信号来自静态上下文或一次性数据;技能蒸馏用静态技能库或外部 analyzer。SEED 的 teacher 与 student 共享参数但输入上下文不同——teacher 在交互历史里插入 hindsight skill,student 只看普通历史;梯度只从 student 流出。这种共享参数化让经验分布与事后监督绑定共同演化,避免静态监督在策略进步后失配的根本问题。

方法步骤详情

SEED 分两阶段。**阶段一 Hindsight Skill SFT**:base policy 对 180 任务各采 8 次得 1440 条轨迹;GLM-5.2(temp=0)对成功轨迹生成工作流、对失败生成避错规则,留格式正确样本;以负对数似然 SFT 3 epoch 使模型学会分析轨迹并产出技能,checkpoint 同时初始化 RL 策略与 analyzer。**阶段二 Self-Evolving OPD**:每轮冻结当前 checkpoint,对每任务采 8 条轨迹并算组相对优势 $A^{rl}=(R{-}\mu_q)/(\sigma_q{+}\epsilon)$,同模型作 analyzer 把每条轨迹总结成技能;把技能插入原始历史得增强上下文,策略在同一 token 上分别算 teacher(看增强上下文)与 student(看普通历史)的对数概率,差值经 stop-gradient 与 sigmoid 得置信门;OPD 损失为门加权的概率差(梯度只从 student 流出),与 clip GRPO、KL 联合优化,更新后策略成下轮冻结模型形成闭环。

技术新颖性

三点与附录 A 三条 Proposition 严格对应。第一,把 skill 诱导的 log-prob shift 转为 gate-weighted NLL,证明 $\nabla_\theta\mathcal{L}_{opd}=-\mathbb{E}[m{\cdot}g{\cdot}\nabla_\theta\ell^\theta]$,等价于在当前策略占据分布上向'技能重加权目标' $r_k=\pi_k w_k/Z_k$ 做 KL 蒸馏(Prop1)。第二,一组 rollout 结果相同($A{=}0$)时 GRPO 奖励梯度为零,但 OPD 梯度在 gate 非常数时仍非零,加权模长恰等于 gate 方差(Prop2),证明 softmax 能把非负 gate 转为带符号相对信用。第三,synchronized analyzer 把跨迭代 analyzer 失配设为零,并以 $\beta_{opd}/4$ Lipschitz 系数揭示'gate 越锐利越敏感'的 trade-off(Prop3)。

Overview of SEED
Figure 2: Overview of SEED

实验结果

Table 1 三 backbone × 三 benchmark 全面对比。Qwen2.5-3B 上 SEED 的 ALFWorld 平均 91.8% 比 GRPO 75.0 高 16.8 个点、比 SDAR 84.4 高 7.4(Pick/Clean/Heat 全到 100);Search-QA 平均 45.7 比 GRPO 36.4 高 9.3;WebShop Score 88.5、Succ. 78.9% 分别高 8.7、15.6 个点。Qwen3-1.7B 上 ALFWorld 从 46.1 拉到 92.0,提升 45.9 个点。SEED 不用技能推理就超 Skill-GRPO* 12 项聚合中的 11 项。动态:step 40 时 SEED 达约 57%、GRPO 仅 35%;回合长度从约 28 步降到 13 步。样本效率:60% 数据得 80.7 超 GRPO 全量 75.0。跨域 unseen 86.2 比 70.9 高 15.3。多模态 Sokoban 82.0%、EZPoints 100%。消融:去 SFT -5.8、去自进化 OPD -4.8、换静态库 -7.4。

Performance Comparison on ALFWorld, Search-based QA, and WebShop
Table 1: Performance Comparison on ALFWorld, Search-based QA, and WebShop
Ablation Results on ALFWorld
Table 2: Ablation Results on ALFWorld
Episode-level skills extracted by the trajectory analyzer
Table 4: Episode-level skills extracted by the trajectory analyzer
Training hyperparameters for SEED
Table 5: Training hyperparameters for SEED
Results on vision-based agentic benchmarks
Table 8: Results on vision-based agentic benchmarks
Overall performance overview
Figure 1: Overall performance overview
Training dynamics on ALFWorld (Qwen2.5-3B)
Figure 3: Training dynamics on ALFWorld (Qwen2.5-3B)
Sample efficiency analysis
Figure 4: Sample efficiency analysis
Cross-domain generalizability on ALFWorld Unseen
Figure 5: Cross-domain generalizability on ALFWorld Unseen
Qualitative comparison on ALFWorld
Figure 6: Qualitative comparison on ALFWorld
A representative trajectory on Sokoban
Figure 7: A representative trajectory on Sokoban
查看结构化数据
任务指标本文基线提升
ALFWorld(家庭机器人文本交互,6 类任务宏平均成功率) Success Rate (%) 91.8(3B)/ 96.1(7B)/ 92.0(1.7B) GRPO 75.0 / 81.2 / 46.1;SDAR 84.4 / 85.9 / 53.9 比 GRPO 提升 16.8 / 14.9 / 45.9 个点;比最强静态基线 SDAR 提升 7.4 / 10.2 / 38.1 个点
Search-based QA(7 个数据集平均准确率,3B) Accuracy (%) 45.7 GRPO 36.4;GRPO+OPSD 44.6;SDAR 43.4 比 GRPO 提升 9.3 个点;PopQA 子项从 31.0 提到 47.2
WebShop(128 测试任务,3B) Task-completion Score / Success Rate (%) 88.5 / 78.9 GRPO 79.8 / 63.3;SDAR 85.0 / 68.0 Score +8.7,Succ. +15.6 个点
Sokoban 6×6(视觉空间规划,Qwen2.5-VL-3B) Success Rate (%) 82.0 GRPO 67.1;ReAct 11.7 +14.9 个点
ALFWorld Unseen(跨域泛化,3B) Success Rate (%) 86.2 GRPO 70.9;ReAct 8.2 +15.3 个点;Heat 子项 +35.0
样本效率(ALFWorld,60% 训练数据) Success Rate (%) 80.7 GRPO 全量数据 75.0 用 60% 数据反超 GRPO 全量数据

局限与改进

作者在附录 E 承认:长任务里自监督会继承模型错误并可能 plateau 在 oracle 之下——actor 与 analyzer 共享参数,盲点也共享,错误分析可能把反复出现的策略错误转成'看似可复用规则'被后续更新强化;且存在自偏好,模型系统偏爱形似自己输出的内容;confidence gating 与 on-policy 对齐能降噪声但不能保证语义正确。训练成本随交互长度与多模态上下文线性增长。我自己观察:在 MuSiQue、2Wiki 等需深度多跳推理的数据集上 SEED 提升明显小于 ALFWorld/WebShop(MuSiQue 仅 16.9%),暗示任务本身需更强推理而非'行为复用'时边际收益下降;7B 上 WebShop Succ. SEED 78.1 反低于 SDAR 82.8,大模型上增益不稳定;所有实验仅 150 训练步,缺长期收敛性与超参 $\beta_{opd},\lambda_{opd}$ 敏感性分析;OPSD 在 QA 上崩到 0.0%,提示此类自蒸馏对初始化高度敏感,SEED 未系统分析这种脆弱性来源。

独立分析的弱点

弱点1:共享参数放大偏差——actor 与 analyzer 同一模型,盲点同时污染轨迹采集与事后分析,可能形成自我确认循环。改进:引入外部 verifier 或可验证状态变化锚定技能真值、对比多 policy snapshot、保留技能不确定性。弱点2:技能语义正确性无保证——confidence gate 只过滤分布噪声不保证语义正确。改进:技能锚定到环境状态变化的客观信号或用工具结果交叉验证。弱点3:训练成本随交互长度增长——每轨迹需 analyzer 跑一次、每 token 需 paired scoring 两次前向。改进:speculative decoding(DOUBLE、DSPARK)、缓存表征、批量 paired scoring、selective analysis 只分析高不确定/分歧大的轨迹。弱点4:长任务上 hindsight 可能失效(成功率极低时技能稀疏噪声大)。改进:分层 hindsight 先总结局部转移再归纳规则。弱点5:只在中等规模 benchmark 验证,缺更难基准。

未来方向

作者明确方向:(1)在 DeepPlanning、Long-Horizon-Terminal-Bench、OdysseyArena、RobotEQ 等更长更复杂环境上测试;(2)研究外部中间/部分奖励如何与 token 级 hindsight 监督交互;(3)用 speculative decoding 降 rollout 与 skill 生成成本;(4)selective analysis 只分析不确定/新状态/分歧大的轨迹;(5)分层 hindsight 组织技能——先总结局部转移再归纳轨迹级规则;(6)policy-aware exploration 收集能区分竞争规则的高信息轨迹。基于成果可延伸:把 SEED 与 process reward model 结合获取更可靠过程监督;扩展到 tool-use 丰富的 agentic 系统;引入多 agent 间技能共享避免单模型盲点;用课程学习按难度组织技能库;迁移到代码生成、数学推理等可验证任务,那里 hindsight 可与单元测试/答案验证天然锚定。

复现评估

开源情况:代码、模型权重、project page 均开源(jinyangwu/SEED),analyzer/actor prompt 与算法伪代码完全公开,超参表逐项列出。数据:全部用公开 benchmark(ALFWorld 140+134、WebShop 128、Search-QA 7 数据集合计 51,713 题);SFT 用 GLM-5.2 对 1440 条轨迹标注。算力:8× Nvidia A800 80G。实现细节:150 训练步、batch 16/128、$N{=}8$、lr $1{\times}10^{-6}$、$\beta_{opd}{=}5.0$、$\lambda_{opd}{=}0.01$、$\beta_{KL}{=}0.01$、prompt 2048/4096、交互步数 30/15/4 全列出,附录 Proposition 证明给出。复现难度中等偏上:需同时搭三个异构环境、调 GLM-5.2 标注、配 8 卡训练;多模态扩展还需 Qwen2.5-VL。最大障碍是训练时间与算力。