从智能体经验中样本高效地学习 Sample-Efficient Learning from Agent Experience
把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。
前置知识
上下文蒸馏 (Context Distillation)
知识蒸馏的一种变体。教师模型 $\theta_0$ 在输入 $x$ 之外还接收一个辅助上下文 $c$(演示、文档、记忆等特权信息),输出 $p_{\theta_0}(y|x,c)$;学生 $\theta$ 只看 $x$。训练目标是最小化两者的 KL 散度 $D_{KL}(p_{\theta_0}(\cdot|x,c) \| p_\theta(\cdot|x))$,让学生把“教师在有上下文时的行为”内化进参数,部署时无需再喂上下文。
本文整个方法就是一次 context distillation,只是把上下文 $c$ 具体化为 agent 在环境里收集的交互历史 $\tau_{exp}$,把教师目标具体化为“看过这段历史后下一步该怎么做”。
上下文学习 (In-Context Learning, ICL)
大模型不更新参数,仅靠在 prompt 里放几个示例或反馈就能适应当前任务。Brown et al. 2020 发现 LLM 具备此能力,后续研究表明其机制可能是隐式贝叶斯推断、归纳头 (induction heads)、或激活里实现的梯度下降。
本文要“固化”的正是 ICL 带来的增益——agent 把过去试错经验放进 context 后能力变强,但一旦撤掉 context 增益就消失,Experience Distillation 就是要保住这部分增益。
环境样本效率与强化学习
强化学习里“一次环境样本”通常指一次完整的 rollout 或交互。交互便宜时(围棋 self-play、轻量代码任务)可大规模采样,昂贵时(电池合成、律师审核)样本需求会让训练不可行。MBPO、off-policy、experience replay、offline RL 都是提升样本效率的经典途径。
环境样本效率是论文的核心衡量指标。ICL+EPD 相比 PPO/GRPO 用少一个数量级的样本达到相当或更好性能,是全文最关键的卖点。
POMDP (部分可观马尔可夫决策过程)
真实状态不可直接观测,agent 只能拿到观测 $o_t$,依据可观历史 $h_t=(o_0,a_0,\ldots,o_t)$ 选动作。论文把奖励等环境反馈都并入观测 $o_t$,轨迹分布写作 $p_\theta^M(\tau)=p_M(o_0)\prod_t \pi_\theta(a_t|h_t)p_M(o_{t+1}|h_t,a_t)$。
论文用 POMDP 形式化 agent task,借助轨迹的因子分解推导出蒸馏目标从 Eq1(轨迹级 KL)退化为 Eq2(局部策略匹配),是整个方法推导的起点。
世界模型与 Branched Rollout (MBPO)
model-based RL 用学到的世界模型 $\tilde{M}$ 替代真实环境生成合成轨迹,但长 rollout 里模型误差会累积(Talvitie 2017)。Branched rollout (Janner et al. 2019, MBPO) 从真实轨迹上的采样点出发,只在 world model 里展开几步,缩短合成段以限制误差累积。
本文的 one-step 实现正是把 branched rollout 的 $k$ 取到极限 $k=1$ 并停在 teacher 动作处,从而完全消除 world model——这是 Experience Distillation “无需额外环境交互也无需 world model”的技术根基。
Forward KL vs Reverse KL
Forward KL $D_{KL}(p_T\|p_S)$ 以 teacher 分布 $p_T$ 为基准采样,是 mean-seeking 的、倾向于覆盖 teacher 所有高概率模式;reverse KL $D_{KL}(p_S\|p_T)$ 以 student 采样,容易 mode-seeking、漏掉 student 当前低概率的模式。on-policy distillation (OPD) 用 reverse KL 在 student 生成的轨迹上做监督。
论文 Table 5 显示 teacher-sampled forward KL 的 GICL 达 96.7%/98.4%,而 student-sampled reverse KL 只有 9.1%/0.4%。因为没经验时 student 几乎采不到经验诱导的高质量决策,reverse KL 根本碰不到这些“该学的动作”。
研究动机
真实世界的 agent 任务里,环境交互往往极其昂贵——测一个候选电池材料要做实验室合成和测量,评估一份法律分析要请合格律师审核。随着 agent 能处理越来越长、越来越真实的任务(METR 2026;Kwa et al. 2025),从环境收集 rollout 的成本持续上升。标准 RL 框架虽然能通过交互学习,但环境样本效率很差,往往要海量交互才能训出强策略(Haarnoja 2018;Kaiser 2020;Narvekar 2020)。当交互便宜(围棋 self-play、轻量代码任务)时还能承受,一旦昂贵就变得不现实。In-context learning 提供了一条样本高效的捷径:让 LLM 在 context 里放几个示例或试错反馈,无需大训练集就能改善行为(Brown 2020;Laskin 2023)。可 ICL 不更新参数,context 一撤增益就消失。Context distillation 本可以把这部分增益固化进权重,但在 agent 交互历史上怎么做、同时又不牺牲环境样本效率,一直是被忽视的问题。
本文的目标是本文的目标是定义并实现“经验蒸馏 (Experience Distillation)”:把 agent 在与环境交互中收集到的经验(一段真实轨迹前缀 $\tau_{exp}$)蒸馏进模型权重,使得模型在不带这段经验 context 的情况下也能复现“看过经验后的改进行为”。关键约束是——除了已经收集到的经验之外,蒸馏过程不得再产生任何额外的环境交互,从而完整保留环境样本效率。论文要在两个领域验证:749 个精选软件工程 (SWE) 任务和六个文字冒险游戏 (TaleSuite),衡量指标是领域特定性能,以及把 zeroshot 归一为 0%、ICL 归一为 100% 的 $G_{ICL}$ 增益保留率 $G_{ICL}(m)=\frac{S_m-S_{ZS}}{S_{ICL}-S_{ZS}}\times 100\%$。
与已有工作不同的是,现有最接近的工作仍要额外环境交互:把 experience-conditioned teacher 再次放进真实环境 rollout 来产生蒸馏目标(Ye et al. 2026b;Penaloza et al. 2026),这本身就消耗昂贵样本。受 model-based RL 启发的朴素解法是用学到的 world model 替代真实环境,但长 rollout 里世界模型误差会累积 (Talvitie 2017)、超出真实数据支持处预测不可靠 (Yu et al. 2020),合成轨迹质量差。本文的独特切入点是:把 MBPO 式 branched rollout 的分支长度推到极限 $k=1$、并恰好停在 teacher 的下一个动作处——这样分支里只剩一个 teacher 决策 $a'_t$,根本不需要任何未来观测,从而既不需要 world model 也不需要额外环境交互。这个 one-step branch rollout 把问题从“如何生成可信的长合成轨迹”转化为“如何在已收集的真实历史点重新采样 teacher 下一步决策”,是从根本上的简化。
核心方法
整体思路是 trajectory-level context distillation。先把 agent task 建模为 POMDP $M$:agent 每步拿观测 $o_t$、基于可观历史 $h_t$ 选动作 $a_t$,收集得到有限轨迹前缀 $\tau_{exp}$。理想目标是让 student(不带经验)的轨迹分布逼近 teacher(带 $\tau_{exp}$)的轨迹分布,即最小化两者的 KL。利用轨迹因子分解(两者共享初始观测与环境响应因子,仅 policy 因子不同),目标退化为局部策略匹配 $\sum_t D_{KL}(\pi_{\theta_0}(\cdot|h_t,\tau_{exp})\|\pi_\theta(\cdot|h_t))$,但估计它仍要 teacher 在 $M$ 里 rollout。因此技术路线分三步:用 world model 做 branched rollout→把分支压到 $k=1$ 消除 world model→用 branch packing 把整条轨迹所有 branch 压进单个训练序列。
核心创新是 model-free one-step branched rollout。朴素蒸馏要 teacher 在环境里 rollout 产生完整新轨迹;model-based 做法用 world model 但误差累积;本文把每个 branch 砍到只剩 teacher 的一个决策 $a'_t\sim\pi_{\theta_0}(\cdot|h_{exp_t}, \tau_{exp})$,分支终止、不产生任何未来观测,世界模型被彻底移除。由于 teacher 熵对 $\theta$ 是常数,最小化 forward KL 化为 teacher-sampled 交叉熵 $L_{EPD}=-\sum_t \mathbb{E}_{a'_t}[\log\pi_\theta(a'_t|h_{exp_t})]$。本质区别:相对 OPD 等 reverse-KL 蒸馏,forward KL 直接把经验诱导的高质量决策当监督(哪怕 student 当前几乎不会采到这些动作);相对 model-based RL,它从不预测未来观测,避开误差累积。
方法步骤详情
流程分三步。(1) 经验预处理:原始经验又长又噪、会撑爆 context 窗口,先用函数 $g(\cdot)$ 对 $\tau_{exp}$ 重写/摘要得到 $g(\tau_{exp})$,保留关键结果与反馈。(2) 增强 teacher 推理:固定 prompt $I$ 让 teacher 先审视 $g(\tau_{exp})$ 再产出下一个决策,作者发现这能把 Detective 上 $G_{ICL}$ 从 34.9% 拉到 72.5% (Table 7)。(3) Branch Packing:直接实现会给每个 branch 点建独立样本,监督密度极低;改为把同一条轨迹的连续 branch 压进单序列 $c_T=(o_0, a'_0, a_0, o_1, \ldots, a'_{T-1}, a_{T-1}, o_T)$。teacher 在每个 branch 点采样 $a'_t$,再 append 从 $\tau_{exp}$ 复制的真实 $(a_t, o_{t+1})$ 作 context。最终损失只有 teacher 决策 $a'_t$ 贡献 loss,其余作 context。
技术新颖性
新颖性四点。其一,问题定义新颖:把“从 agent 交互经验蒸馏进权重且不损失环境样本效率”独立命名为 Experience Distillation,区别于 prompt/instruction distillation (Snell 2022) 和 privileged-information distillation (Penaloza 2026),因为这里 context 是真实 agent-环境轨迹、目标是改进的未来轨迹分布。其二,model-free one-step 实现:将 branched rollout 推到 $k=1$ 极限并停在 teacher 动作处,同时消除 world model 和额外环境交互。其三,branch packing 工程创新:把监督密度提升一个数量级(4096 样本→128 序列),使长 history agent 蒸馏算力可行。其四,正向选择 teacher-sampled forward KL 而非 reverse KL——Table 5 证明这是性能关键 (96.7% vs 9.1%),因为没经验时 student 采不到该学的动作。
实验结果
Table 1 主结果:749 个 SWE 任务上 EPD 平均 pass@1 达 51.4%、$G_{ICL}=64.8\%$,而直接 SFT 仅 8.0% ($G_{ICL}=3.8\%$),ICL 上界 76.4%;TaleSuite 六任务上 EPD 43.8 分 ($G_{ICL}=93.4\%$),SFT 反退到 17.8 ($G_{ICL}=-2.6\%$)。这证明 EPD 能把大量 ICL 增益固化进权重,而 SFT 几乎无效甚至退步。Figure 1 样本效率:ICL+EPD 在 SWE 上用 9.6× 更少样本超过 PPO(51.4% vs 17.7%),TaleSuite 上用 57.2× 更少样本超过 GRPO(43.8 vs 29.9),约一个数量级节省。其余消融(model-free 优于 model-based、branch packing 提速一个数量级、forward KL 碾压 reverse KL、continual EPD 可累积、OOD 可迁移)的逐项数字见 benchmarks 与对应图表描述。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 749 个精选 SWE 任务(pass@1) | Avg. pass@1 / $G_{ICL}$ | 51.4% / 64.8%(EPD) | Zeroshot 5.3%;SFT 8.0% / 3.8%;ICL 上界 76.4% / 100% | 相对 SFT,$G_{ICL}$ 提升 60.9 个百分点;保留 ICL 增益近 2/3 |
| TaleSuite 六任务(归一化得分) | Avg. normalized score / $G_{ICL}$ | 43.8 / 93.4%(EPD) | Zeroshot 18.5;SFT 17.8 / −2.6%;ICL 上界 45.6 / 100% | 几乎完全保留 ICL 增益,而 SFT 反而轻微退步 |
| SWE 环境样本效率 | Avg. pass@1 vs 每任务环境样本数 | 51.4%(ICL+EPD) | PPO 17.7%(504.9 样本/任务) | 用 9.6× 更少环境样本达到 2.9× 更高的 pass@1 |
| TaleSuite 环境样本效率 | Avg. normalized score vs 每任务环境样本数 | 43.8(ICL+EPD) | GRPO 29.9 | 用 57.2× 更少环境样本达到更高得分 |
| OOD 泛化(494 个未见 SWE 任务) | pass@1 / pass@5 | 8.84% / 26.13%(EPD) | Zeroshot 4.62% / 20.39% | pass@1 几乎翻倍(+4.22pp),pass@5 +5.74pp |
| 前向 KL vs 反向 KL 蒸馏(TaleSuite) | $G_{ICL}$ | Forward KL: Balances 96.7% / Detective 98.4% | Reverse KL (OPD): 9.1% / 0.4% | forward KL 在两任务上分别领先约 87.6 / 98.0 个百分点 |
局限与改进
作者承认的主要局限是 teacher generation 成本——Figure 3 要达到 64.8% $G_{ICL}$ 需生成约 2.79 倍经验 token(相对 61.7M 经验语料即约 1.72 亿 teacher token),作者坦言其效率仍可改进。OOD 泛化虽统计显著(pass@1 几乎翻倍)但绝对值仍偏低 (8.84%),通用性有限。TaleSuite 仅 6 个固定任务,Reverb 等任务 zeroshot 接近 0、EPD 后也仅 3.6 分,对极端稀疏奖励任务吃力。我的观察:所有结果基于团队自研 base 模型、749 个 curated SWE 任务未公开,难独立验证;branch packing 是 Eq2 近似(teacher 决策进入后续 context),论文只在经验上证明不伤性能、缺理论保证;PPO/GRPO 未充分调参,9.6×/57.2× 的结论对 RL 方略显苛刻;forward KL 碾压 reverse KL 的结论只在两个 TaleSuite 任务上得出,样本偏小。
独立分析的弱点
弱点一:OOD 绝对提升有限,8.84% 依然很低,蒸馏出的更多是“会修这种风格 bug 的直觉”而非通用能力,改进方向是混入更异质的多任务经验、引入显式泛化目标或课程学习。弱点二:TaleSuite 任务池太小(6 个),Reverb、Inhumane 等波动大甚至接近失效,改进方向是扩到全 TALES 套件并报告置信区间。弱点三:依赖 task-specific 经验收集——每个 SWE 任务要 8–12 个并行 rollout、每 rollout 最多 10 次 trial 才筛出一条 accepted 轨迹,前期收集本身就贵,改进方向是跨任务经验复用或主动选高信息量 trial。弱点四:branch packing 作为 Eq2 近似缺理论分析,teacher 早期决策污染后续 context 的偏差未被量化。弱点五:teacher generation 成本高(2.79× 经验 token 才换 64.8% $G_{ICL}$)。弱点六:仅与 PPO/GRPO 对比,未覆盖 DPO/offline RL/ArCHer。
未来方向
作者明确点出的方向是把 continual Experience Distillation 做成长期范式:agent 先用少量 trial-and-error 经验在 context 里快速学习,再周期性固化进权重(Figure 2 已验证可累积),并希望激发更多 sample-efficient learning from agent experience 的研究。基于成果可延伸的方向:把经验源从单一 agent 自交互扩展到多 agent 协作经验、外部 memory、人类反馈;把 Experience Distillation 与在线 RL 结合,让固化权重反过来提升下一轮经验收集质量,形成正循环;理论上解释 forward KL 为何在此 setting 远胜 reverse KL(可能与“经验诱导决策落在 student 支持集外”有关);把 branch packing 推广到非单步、可变 $k$ 的自适应方案;探索不同预处理函数 $g$ 的影响。我还想看到这套方法在 SWE-bench、TALES 全集及真正昂贵环境(科学实验、机器人)上的验证。
复现评估
复现难度中等偏高。负面因素:论文未提供代码或 checkpoint;两个 domain 都用团队自研 (in-house) base 模型,未公开;749 个 curated SWE 任务自建未发布,TaleSuite 子集与收集协议虽有描述(Appendix A.7 含交互轮数与 token 统计)但具体轨迹未公开;固定 prompt $I$ 与预处理函数 $g$ 仅文字描述无实现细节;算力和 base 模型规模未披露,但 61.7M token 多任务蒸馏暗示中等偏大规模 GPU。正面因素:TaleSuite 本身公开 (Cui et al. 2025, arXiv:2504.14128);评测协议详细(pass@1/pass@10、$G_{ICL}$ 归一化、SWE 平均 10 次、TaleSuite 平均 16 次以上);ColorButton 诊断 (Figure 7) 设计简单可复现,可验证“GRPO 探索瓶颈”这一论点;总体方法步骤清晰、公式完整,理论上可在任意 LLM agent 框架上重实现。
论文图表
左图:三步选择(2×3×3=18 种完整序列),仅第三步后给二元终末奖励。右图:两次 GRPO 实验对照——passcode 为 green-blue-red 且 G=16 时初始 60% 成功率 8 步内升到 100%;passcode 改为 red-red-green 且 G=256 时全程 0%。证明当奖励序列不在 on-policy 采样支持内时,GRPO 的任务奖励梯度恒为零、无法学习。
这是一个精心设计的受控诊断,把“为什么经典 RL 在经验敏感任务上样本效率差”讲得极其清楚——大 group size 不等于行为覆盖,从机理上支撑了 ICL+EPD 的样本效率优势。