← 返回 2026-08-18

ClawGym II:在智能体执行框架上探索黑盒强化学习 ClawGym II: Exploring Black-Box RL on Agent Harness

Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange Zhang, Daixuan Cheng, Yan Xing, Qi Yun, Xuxing Chen, Danyang Li, Feng Chang, Chuan Hao, Ran Tao, Jian Yang, Bryan Dai, Wayne Xin Zhao, Mingjie Tang, Ji-Rong Wen 📅 2026-08-17 👍 39 2026-08-23 18:30
Agent Harness LLM智能体 后训练 强化学习 黑盒优化

把黑盒智能体框架当作不透明环境,用沙箱、服务代理与前缀树实现稳定的智能体RL

前置知识

Agent Harness(智能体执行框架)

协调大模型与外部环境交互的运行时层,把系统提示词、工具接口、上下文管理、子代理调度与故障恢复整合为统一系统,如 Claude Code、Codex、OpenClaw。模型不再直接操作工作区,而是由框架执行工具并返回处理后的观测。

本文的全部核心问题是:如何穿过这样一个内部逻辑不可见的复杂框架做 RL 训练,理解框架的执行抽象是理解论文动机的前提。

PPO(近端策略优化)

基于 critic 的策略梯度算法,用裁剪的重要性比率目标 $L^{PPO}$ 限制策略更新步长,配合价值模型 $V_\phi(s)$ 和广义优势估计(GAE)做时间差分信用分配,是 RL 中最稳定的基线之一。

论文把 PPO 改造成在前缀树恢复出的多条轨迹上优化($\gamma=\lambda=1$ 的简化变体),并报告其训练动态,需要懂 PPO 才能理解改动点。

GRPO(组相对策略优化)

免 critic 的 RL 算法:对同一任务采样一组 rollout,用组内奖励的均值 $\mu_q$ 和标准差 $\sigma_q$ 归一化得到优势 $\hat{A}_i=(R_i-\mu_q)/(\sigma_q+\varepsilon)$,无需训练额外的价值模型,节省显存与训练复杂度。

GRPO 天然适配黑盒框架的 rollout 级奖励结构,是本文主推算法;mix-harness 训练中按任务-框架对分组的优势归一化也建立在 GRPO 之上。

前缀树(Trie)

一种树形数据结构,公共前缀只存储一次,不同延续作为独立分支。论文用它组织一个 rollout 内被捕获的碎片化模型调用:每个调用挂到其输入的最长已累积前缀节点,根到叶的路径即候选多轮训练轨迹。

前缀树是连接黑盒调用记录与可训练轨迹的桥梁,论文的轨迹过滤、共享前缀去重、树上策略优化都定义在这个结构上。

训练-推理一致性与重要性采样

RL 要求训练的 token 序列与策略实际采样的序列一致,且概率 $\pi_{\mathrm{rollout}}$ 与训练引擎重算的 $\pi_{\mathrm{old}}$ 可能因数值精度和内核不同而有偏差。重要性采样用权重 $w_t$ 校正这一 off-policy 偏差,并截断以防方差爆炸。

黑盒框架会重排消息格式、归一化工具调用,一致性问题是黑盒 RL 特有的核心障碍,论文的 token-in-token-out 纪律和截断校正是关键创新。

Pass@1

智能体基准的常用指标:对每个任务只采样一次执行,统计最终产出(工作区产物、通过的测试等)被判为成功的任务比例。本文采用代码校验与 LLM-as-a-Judge(GPT-5.4)按 0.7/0.3 加权的混合判分协议。

论文所有结论都用 Pass@1 的点数提升表述(如 +9.98、+14.81),理解其判分方式才能正确评估这些数字的含义。

研究动机

现代智能体执行框架(Claude Code、Codex、OpenClaw 等)把系统提示词、工具接口、上下文管理、子代理调度与故障恢复整合为统一运行时,在长程任务上收益显著,但穿过这些复杂框架做强化学习训练却几乎无人系统研究。难点有三:其一,通用智能体任务需要专用的有状态环境,大规模并发 rollout 给执行基础设施带来巨大压力,长程任务的延迟与故障会在多步交互中累积并使整条轨迹作废,数据生成难以规模化;其二,黑盒框架暴露的是碎片化、分叉且常冗余的模型调用(上下文压缩、子代理会开新分支,重试会产生死叶),而非完整交互轨迹,无法直接用于 RL,且不透明的内部操作(工具调用归一化、消息重序列化)会放大训练-推理不一致,导致训练不稳定;其三,不同框架在交互协议、工具接口、上下文管理与执行流程上差异巨大,实用框架必须以最小适配支持多样化框架,而非只为单一执行系统优化策略。

本文的目标是本文目标是建立统一的黑盒强化学习框架,让通用智能体穿过任意复杂且不加修改的执行框架实现稳定、可扩展的策略优化。具体包括:构建基于沙箱的执行基础设施,把每个任务环境与其框架封装进按需创建、用后销毁的临时沙箱,支撑大规模并发 rollout 并提供隔离工作区;在模型服务边界放置 serving proxy,捕获所有模型调用的输入输出 token、rollout 对数概率与任务元数据,把策略优化与框架执行解耦;把捕获的调用组织成前缀树以重建分叉的多轮轨迹,并适配基于 critic 的 PPO 与免 critic 的 GRPO 在树结构上优化;全程以 token-in-token-out 纪律和重要性采样保持训练-推理一致性;最终引入 mix-harness 训练,让单个模型可被异构框架联合优化。验证目标是 Qwen3-30A3B 在 OpenClaw 与 Claude Code 下分别取得 9.98 和 14.81 点的 Pass@1 提升,并在 200-400 步内保持稳定。

与已有工作不同的是,此前智能体 RL 的做法要么在完全文本或轻量单轮环境中训练(交互过程显式可观测),要么采用白盒 AgentLoop:显式构造系统提示、工具接口、观测表示与上下文管理,完整记录交互轨迹后直接优化。而生产级框架的内部控制流是 opaque 的,拿不到完整轨迹。本文的独特切入是:完全不修改、不重实现框架逻辑,把它当作黑盒 rollout 引擎,只在模型服务边界观测;用前缀树从碎片化、分叉的调用记录中重建可训练的多轮轨迹;用 token-in-token-out 双视图保证训练序列与采样序列逐 token 一致;再用按任务-框架对分组的 mix-harness 训练打通异构框架。这使在真实部署框架内直接训练模型第一次成为稳定可扩展的工程现实,而不是停留在与部署形态脱节的白盒模拟器中。

核心方法

直觉上,这就像不改装汽车、只记录司机操作来培训司机:框架照常运行,模型在服务边界的每次请求-响应被完整记录,任务结束后按最终工作区状态打分,再从记录反推可训练轨迹。技术路线分四步:第一步,每个 rollout 从初始工作区 $W_0$ 初始化任务环境,把框架连同经 MCP 服务器暴露的工具封装进按需创建、用后销毁的临时沙箱,保证并发隔离;第二步,serving proxy 作为框架的模型端点,记录每次调用的输入输出 token、rollout 对数概率和任务元数据,输出先缓冲再一次性解析以消除增量解析错误;第三步,验证器以规则校验或规则加 LLM 裁判(权重 0.7/0.3)评估最终工作区 $W_T$ 得到 rollout 级奖励;第四步,训练侧把调用重建成前缀树、过滤死叶与辅助轨迹,用适配后的 PPO/GRPO 在树上更新策略并同步参数给推理引擎。上下文窗口设为 64K;GRPO 每批 32 任务×8 rollout,PPO 每批 256 任务×1 rollout,两者每步 rollout 预算相同。

核心创新是把策略优化与框架执行彻底解耦,并用前缀树从黑盒记录恢复训练结构。黑盒框架吐出的模型调用 $C=\{(x_i,y_i)\}$ 是碎片化、分叉且冗余的:直接逐调用优化会破坏长程交互结构并对共享历史重复计梯度。本文把每个 rollout 的调用组织成以初始任务提示为根的前缀树,每个调用挂到其输入的最长已累积前缀节点上,通过比对父子输入与父响应还能恢复框架插入的工具输出等非模型内容;共享前缀只存一次,既保住交互结构又避免重复优化。第二个关键点是 token-in-token-out 纪律:推理引擎生成的 token 直接嫁接到前缀树作为唯一训练数据源,框架收到的解码文本只供其驱动交互、绝不回编码进训练轨迹,因此无论框架如何重新格式化消息,训练序列与模型实际采样序列在构造上完全一致。这是黑盒设置下保持 on-policy 性质、消除 off-policy 偏差的根本机制。

方法步骤详情

流程如下。(1)环境准备:任务 $q=(u,W_0)$ 从工作区初始化环境,框架与 MCP 工具服务封装进临时沙箱;(2)rollout 采集:serving proxy 拦截全部模型调用,记录 $\{x_i,y_i\}$ 与对数概率,伪流式解析、超时终止与故障丢弃做保险;(3)奖励评估:验证器按规则校验或规则加 rubric(0.7/0.3,裁判 GPT-5.4)给最终工作区打分;(4)前缀树构建:每个调用挂到最长前缀节点,恢复框架插入的工具输出等非模型内容;(5)轨迹过滤:去除重试死叶,丢弃叶数超阈值的 rollout,排除子代理与压缩等辅助轨迹;(6)树上优化:GRPO 按组归一化优势 $\hat{A}_i=(R_i-\mu_q)/(\sigma_q+\varepsilon)$,共享前缀 token 只计一次;PPO 用 $\gamma=\lambda=1$ 的简化变体 $\hat{A}_t=R_i-V_\phi(s_t)$,价值模型先经预训练;(7)一致性校正:token 级重要性采样 $w_t=\min(\exp(\log\pi_{\mathrm{old}}-\log\pi_{\mathrm{rollout}}),\,\bar{c})$;(8)mix-harness:任务-框架对为训练实例,同批随机混合,按实例归一化优势后联合更新共享策略。

技术新颖性

技术新颖性有四点。第一,前缀树作为黑盒轨迹的训练表示:此前 RL 系统要么拿到完整轨迹(白盒 AgentLoop),要么只能优化单轮调用,本文首次在保留分叉结构的同时对共享前缀去重,并让同一 rollout 的多条根-叶轨迹在策略损失中联合贡献,防止高度分支的 rollout 获得不成比例的优化权重。第二,PPO 与 GRPO 的树结构适配:GRPO 把优化组定义为同一任务的 $n$ 个 rollout 并按 rollout 分配组优势;PPO 采用无跨分支信用传播的简化 GAE($\gamma=\lambda=1$),并坦承对分叉轨迹更原则性的处理留待未来。第三,双重训练-推理一致性保障:token-in-token-out 双视图解耦加截断的 token 级重要性采样校正,把理论上无偏但长轨迹上方差爆炸的序列级比值换成截断低方差版本。第四,mix-harness 分组归一化:按任务-框架对而非任务本身归一化优势,防止不同框架的交互模式与奖励分布污染相对优势估计。配合伪流式解析、settling 等待等工程保险,真实框架训练首次变得可靠。

Overview of our black-box RL framework for optimizing general agents through harnesses.
Figure 1: Overview of our black-box RL framework for optimizing general agents through harnesses.

实验结果

以 Qwen3-30A3B 为骨干:OpenClaw 下 ClawII-OC-30A3B 在 ClawGym-Bench 平均 Pass@1 达 62.62(较冷启动初始化 52.64 提升 9.98),PinchBench 达 87.32(提升 11.71);Claude Code 下 ClawII-CC-30A3B 直接从基座训练,ClawGym-Bench 从 37.06 升至 51.87(提升 14.81),PinchBench 从 54.14 升至 71.42(提升 17.28),分别超过 Qwen3-235A23B 8.14 和 6.28 点;ClawII-OC-30A3B 还超 SFT 基线 ClawGym-30A3B(56.82)5.80 点。训练在 200-400 步内稳定,PPO 与 GRPO 最终成绩相当,但 PPO 熵动态更平滑;mix-harness 训练在两框架下均匹配或略超单框架模型。迁移到更难任务:JobBench-Easy 从 20.46 升至 27.20,OfficeQA-Full 从 8.53 升至 21.54。冷启动带来更高奖励起点与更稳熵。白盒对比:WhiteBox-30A3B 在自身 AgentLoop 内达 59.90(基座 41.69,提升 18.21),零迁移到 OpenClaw 得 50.33(提升 5.22),仍低于黑盒的 62.62,说明只有黑盒内训练才能捕获框架特有交互模式。

Performance comparison of different models on ClawGym-Bench and PinchBench.
Table 1: Performance comparison of different models on ClawGym-Bench and PinchBench.
Cross-harness Pass@1 performance on ClawGym-Bench under the white-box AgentLoop and OpenClaw harnesses.
Table 2: Cross-harness Pass@1 performance on ClawGym-Bench under the white-box AgentLoop and OpenClaw harnesses.
Training dynamics of PPO and GRPO with OpenClaw as the rollout harness.
Figure 2: Training dynamics of PPO and GRPO with OpenClaw as the rollout harness.
Training dynamics of PPO and GRPO with Claude Code as the rollout harness.
Figure 3: Training dynamics of PPO and GRPO with Claude Code as the rollout harness.
Comparison between single-harness and mix-harness RL training.
Figure 4: Comparison between single-harness and mix-harness RL training.
Training dynamics with Claude Code on JobBench-style tasks.
Figure 5: Training dynamics with Claude Code on JobBench-style tasks.
Training dynamics with Claude Code on OfficeQA-style tasks.
Figure 6: Training dynamics with Claude Code on OfficeQA-style tasks.
Effect of cold-start initialization on OpenClaw black-box RL.
Figure 7: Effect of cold-start initialization on OpenClaw black-box RL.
Training dynamics of white-box AgentLoop RL with GRPO and PPO. The curves report training reward, policy entropy, and evaluation score over the course of training.
Figure 8: Training dynamics of white-box AgentLoop RL with GRPO and PPO. The curves report training reward, policy entropy, and evaluation score over the course of training.
查看结构化数据
任务指标本文基线提升
ClawGym-Bench(OpenClaw 框架) Pass@1 ClawII-OC-30A3B 62.62 ClawII-Cold-30A3B 52.64(Qwen3-30A3B 冷启动初始化) +9.98 分
ClawGym-Bench(Claude Code 框架) Pass@1 ClawII-CC-30A3B 51.87 Qwen3-30A3B 37.06 +14.81 分
PinchBench(OpenClaw 框架) Pass@1 ClawII-OC-30A3B 87.32 ClawII-Cold-30A3B 75.61 +11.71 分
PinchBench(Claude Code 框架) Pass@1 ClawII-CC-30A3B 71.42 Qwen3-30A3B 54.14 +17.28 分
JobBench-Easy(Claude Code 框架) Pass@1 27.20 20.46(训练前) +6.74 分
OfficeQA-Full(Claude Code 框架) Pass@1 21.54 8.53(训练前) +13.01 分
ClawGym-Bench(白盒 AgentLoop 内评估) Pass@1 WhiteBox-30A3B 59.90 Qwen3-30A3B 41.69 +18.21 分
ClawGym-Bench(白盒训练后零迁移到 OpenClaw) Pass@1 WhiteBox-30A3B 50.33 Qwen3-30A3B 45.11 +5.22 分(但仍低于黑盒训练的 62.62)

局限与改进

作者承认的局限:子代理与上下文压缩等辅助轨迹被完全排除在训练之外,其与 rollout 级奖励的信用分配尚无原则性方案;PPO 对分叉轨迹采用独立备份($\gamma=\lambda=1$),无跨分支优势传播,价值模型需直接估计长程回报,可能放大优势方差;叶数超阈值的 rollout 被整体丢弃,牺牲部分数据。我的补充观察:奖励只有 rollout 级终局信号,没有过程监督,对超长程稀疏奖励任务可能学习低效(OfficeQA 起点 8.53 说明早期信号很弱);混合判分依赖 GPT-5.4 作裁判,评分本身有偏差与成本,且 prompt 只在附录给出;上下文窗口固定 64K,超长依赖完全托付框架的压缩机制;实验最大只到 30A3B 规模,结论对更大模型的适用性未验证;mix-harness 只验证了两个框架;沙箱编排、双引擎同步等基础设施工程成本高,中小团队难以复制。

独立分析的弱点

第一,辅助轨迹的浪费:压缩与子代理交互承载大量真实工具使用行为,简单排除丢弃了免费学习信号,可为它们设计独立的优势归一化组或引入代理奖励后再纳入训练。第二,树上信用分配过于简化:共享前缀 token 只计一次虽防止权重偏斜,但 sibling 分支的相对优劣信息被 rollout 级共享奖励抹平,可在分支点引入树形 GAE 或分支间对比学习。第三,终局奖励稀疏:长程任务只有最终工作区评分,训练前期信号弱,可加入中间检查点验证或基于 rubric 的分步打分加速早期学习。第四,稳定性依赖经验常数:叶数上限、重要性采样截断 $\bar{c}$、settling 超时等都是预设值,跨任务分布的鲁棒性存疑,应自适应化并做敏感性分析。第五,评估与训练耦合:rubric 裁判固定为 GPT-5.4,换更强裁判可能改变任务排名,应报告多裁判一致性;另外两框架提升幅度差异较大(OpenClaw +9.98 vs Claude Code +14.81),但论文对框架属性如何影响训练效率的分析较少。

未来方向

作者明确提出两条:把压缩与子代理等辅助交互纳入策略优化而非排除;把框架扩展到更广泛的通用智能体任务与更多样执行设置,进一步检验可扩展性与通用性。基于本文成果还可延伸:其一,树结构信用分配的原则化,在分支点做树形 GAE 或引入过程奖励模型,解决简化 PPO 的高方差问题;其二,过程奖励与稀疏终局奖励结合,用 LLM 裁判给中间工作区状态打分,缓解早期学习信号弱的问题;其三,把 mix-harness 推广为框架课程,按任务难度与框架特性调度训练实例,甚至利用框架差异作为隐式正则化提升跨框架泛化;其四,白盒与黑盒互补组合——白盒 AgentLoop 学通用智能技能(迁移实验显示可白转黑 +5.22 点)、黑盒学框架特有模式,两阶段训练值得探索;其五,自动合成验证器以扩大可训练任务覆盖面,降低对人工设计 verifier 的依赖。

复现评估

复现门槛较高。数据上,训练任务来自 ClawGym-SynData 与 JobBench/OfficeQA 风格合成任务,rubric 判分 prompt 在附录 A 给出但依赖 GPT-5.4 作裁判,评分成本不低;PinchBench 用 2026 年 4 月 10 日发布版本去掉多模态任务后的 30 题。算力上,需同时维护推理引擎(服务框架)、训练引擎与 PPO 价值模型预训练,GRPO 每步 32 任务×8 rollout、PPO 每批 256 任务×1 rollout,长程任务在沙箱中运行很久,总计算量远超常规后训练;还需自建沙箱编排、serving proxy、前缀树重建与 MCP 工具服务等基础设施。论文未明确承诺开源代码或模型权重;OpenClaw 开源,但 Claude Code 是闭源商业产品,后者训练路径无法完全复现。综合看,熟悉 RL 系统的团队复现 OpenClaw 路径预计需数周工程量,完整复现难度大,建议先以 ClawGym-Bench 评测协议与冷启动基线为切入点。