← 返回 2026-09-10

T1:面向长程任务的终端智能体强化学习 T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi, Leowei Liang 📅 2026-09-10 👍 52 2026-09-12 18:30
MoE训练稳定性 PPO 可验证奖励 强化学习 终端智能体 长程任务

密集执行奖励+TITO/R3稳定化,将122B MoE模型RL训练为64.0%解题率的终端智能体

前置知识

MoE(混合专家模型)

把 Transformer 的前馈层替换为大量'专家'子网络,由路由器按 token 离散选择 top-k 个专家参与计算。T1 底座 Qwen3.5-122B-A10B 有 48 个 MoE 层、每层 256 个专家、每 token 每层选 8 个,121.4B 参数中 116.0B 在专家里,每 token 仅激活约 10B 参数。

专家选择的离散性(top-k 不连续)是本文训练-推理不一致问题的根源,R3 整节都在解决它;不理解 MoE 就无法理解为什么梯度会落到'没产生行为的子网络'上。

PPO 与 actor-critic

策略梯度强化学习方法:用重要性比率 $r_j(\theta)=\pi_t/\pi_{t-1}$ 复用旧数据,clip 操作限制策略单步更新幅度;同时训练一个价值网络(critic)作为基线,用 GAE 计算优势 $\hat{A}_j$。T1 使用与 actor 同尺寸的 122B 全量 critic,先更 critic 再更 actor。

T1 的整个训练框架、critic 热启动调度、以及'为什么不用 GRPO'的论证都建立在这些概念上; critic 校准被论文放在学习的关键路径上。

训练-推理不一致(train-inference mismatch)

RL 中采样用推理引擎(SGLang)、求梯度用训练引擎(Megatron),两者内核、归约顺序、张量布局都不同;对 MoE 而言,路由 top-k 是不连续操作,极小的数值差即可把选中专家换成 runner-up,使重要性比率实际比较的是两个不同子网络而非同一策略的两个版本。

这是 TITO 与 R3 要解决的核心问题,也是论文稳定性度量 $|\Delta \log p|$ 的定义对象,是理解本文贡献的主线。

Agent harness 与可执行验证器

harness 把模型的多轮工具调用接入真实环境:本文用 Harbor 驱动的 Terminus-2 循环,每轮助手消息发出 shell 命令、工具轮返回终端输出,配云沙箱执行。验证器是任务自带的测试脚本,在沙箱内逐条断言打分,奖励由真实执行结果而非学习到的偏好模型给出。

密集奖励 $r=P/S$ 完全依赖验证器能输出 per-assertion 报告;'奖励是执行的而非建模的'是全文可信度主张的基石。

Critic explained variance(解释方差 EV)

衡量价值函数质量的指标:$EV=1-\mathrm{Var}_j(\hat{R}_j-V_\phi(s_j))/\mathrm{Var}_j(\hat{R}_j)$。EV 接近 1 表示 critic 解释了几乎全部回报方差,为 0 表示 critic 无用,为负表示减去 $V_\phi$ 反而放大了优势估计的方差。该指标无下界。

论文用 EV 曲线定量证明 Critic Warm-Up 的必要性(热启动 0.71–0.86 vs 冷启动 −33.6),并据此确定 critic 30 倍于 actor 的学习率。

研究动机

在终端这类长程任务上做强化学习,此前几乎无法稳定取得收益,本文自己的实验就是证据:在 TMax-15k 上用传统二值'任务是否完成'奖励从 base 43.8% 起步训练,30 步只升到 47.2%,始终未超过 SFT 检查点的 49.4%——每个 rollout 批要消耗数百沙箱小时,换来的却是每条轨迹仅 1 bit 的信号,难任务上几乎全是零奖励,部分进展对奖励完全不可见。同时,底座是 MoE(121.4B 参数中 116.0B 为专家权重,每 token 每层从 256 个专家离散选 8 个),推理引擎与训练引擎的微小数值差就能翻转专家选择,使梯度落到根本没产生该行为的子网络上;多轮 agent harness 每轮用 chat template 重新渲染历史,编码-解码往返并非恒等映射,token 序列在轮边界被扰动。一条 300+ 轮的轨迹约有 $10^4$ 个带损失位置,逐位置误差沿轨迹累积而非抵消。此外,常用的 GRPO 组相对基线在'组内全员失败'的难题上优势恒为零,无法提供梯度。

本文的目标是本文的目标是:把 Qwen3.5-122B-A10B 通过纯强化学习后训练成一个能在云端沙箱的真实 shell 中持续操作、单任务最多 300+ 轮工具调用的终端智能体,并由任务自带的可执行验证器判分。具体验收标准是在三个与训练集完全不相交的 held-out 基准上取得大幅提升:Terminal-Bench 2.1(89 题、执行判分的 resolved 率)、Long-Horizon Terminal-Bench(46 题连续部分分)与 Terminal-Bench Hard(100 题),要求从 SFT 的 49.4% 提升到与 Claude Opus 4.6(63.8%)同级或更高。同时交付一整套可复用配方:稳定大规模稀疏 MoE agentic RL 的机制栈(TITO+R3+critic 调度)、可执行的密集奖励设计、与评测严格 OOD 的合成数据池,以及支撑 122B actor-critic 共驻、连续运行数天的基础设施方法。

与已有工作不同的是,本文切入角度的独特性有三点。其一,把训练-推理一致性拆解为两个正交的可检验条件——token 保真 $T^t_j=T^r_j$ 与路由保真 $I^{t,\ell}_j=I^{r,\ell}_j$,并用 TITO 与 R3 分别从源头消除,而不是像 TIS、IcePop、KPop、SAT、GSPO 等既有工作那样在目标函数上重加权、掩码或改造比率——那类方法治标,本文让失配根本无法发生。其二,奖励设计用固定全局刻度下的绝对通过断言数 $r=P/S$($S=20$),既非二值也非通过率,使更难的任务天然携带更多信号、critic 的回归目标跨步保持一致。其三,训练语料全部为合成任务且与 Terminal-Bench 2.1 严格不相交,把提升归因于能力迁移而非刷榜;论文还罕见地完整公开了失败记录(两种长度塑形变体、GRPO 战役、上下文压缩事故),认为失败与成功同样有指导意义。

核心方法

直觉上,这套方法就是让模型在真实 shell 里反复'做题—被验证器判分—从分数学习',同时确保训练时看见的 token 与专家路由和生成时逐位一致,使 PPO 的重要性比率比较的是同一个策略的两个版本而非两个不同网络。技术路线:先用 RST 递归任务合成批量生产'指令+环境+held-out 验证器+参考解'的自包含任务,经八维 LLM 审计选出 T1-15k;训练基于 slime 框架,推理副本与训练端在不相交加速器上做一步异步流水(staleness 恒为 1);每个 trial 驱动 Daytona 沙箱逐轮收发命令直到完成或触限;轨迹组装器按 TITO 规则把多轮流拼接成带损失掩码的训练样本,并搭载路由记录;验证器输出 per-assertion 的 CTRF 报告,换算成密集奖励 $r=P/S$ 放在轨迹最后一个 token 上,由全尺寸 critic 经 GAE($\gamma=\lambda=1$)向整个视野回传信用;每步先更新 critic 再更新 actor,最后经发布屏障把权重同步到推理副本。

核心创新是把'训练能复现推理'形式化为两条保真条件:token 保真(trainer 条件于采样器真正输出的 token id)与路由保真(trainer 重放采样器在每个 MoE 层选中的专家集合)。只有两者同时成立,$r_j(\theta)=\pi^t_j/\pi^t_{j-1}$ 才是在比较同一策略的两个版本。TITO 为此让 harness 直接传递 token id 而非文本,把每轮边界归入 strict/normalized/retokenized/split 四种可审计情形做修复;R3 则在推理时记录路由张量 $R[j,\ell,:]$(每位置仅 1.5 KiB,rollout 开销低于 3%),训练时冻结专家选择、只在记录的 8 个专家上重归一化门控,从而保留路由器的梯度路径。奖励侧的本质区别是:用绝对断言数配固定刻度 $S=20$ 而非通过率,使'难题通过 10 条断言'(0.5)与'易题通过 2 条'(0.1)得到应有的区分;critic 以 30 倍于 actor 的学习率并经一个 epoch 热启动,每步先更新并用更新前的 $V^{\text{old}}$ 锚定 GAE 与 value clip。

方法步骤详情

流程五步。1) 数据构建:RST 以已验证任务为种子递归改写,先延长可执行路径再改写指令,每个候选在全新沙箱中验证参考解真实通过;五阶段 15 轮语义审计(接受 5,902/边界 3,251/拒绝 5,847,另修复 6,875 条指令),对隐藏需求、测试泄漏、解法捷径、弱验证器硬拒,产出按质量序排列的 T1-15k。2) 采样:SGLang 副本对每任务生成 1 条轨迹,启动 560 条、取最先完成的 512 条以截断重尾;每轮发送 token id、收回终端输出,同时记录 log-prob 与路由掩码。3) TITO 拼接:按四情形层级修复轮边界,把采样 token 标为 $m_j=1$、工具输出与胶水标为 $m_j=0$;1,402 样本的生产审计显示损失区域 token 漂移恰为 0.0000%。4) 奖励:读取 per-assertion 报告计算 $r=P/S$($S=20$,取自 T1-15k 断言数分布约 90 分位,中位数 4、最大约 35),报告缺失则回退二值结果;奖励置于末 token。5) 更新:critic 先以 $1.5\times10^{-5}$ 更新并用更新前的 $V^{\text{old}}$ 计算 GAE 与 value clip($\epsilon_v=0.2$);actor 以 $1.0\times10^{-6}$ 做 PPO($\epsilon=0.2$,KL 项与负载均衡项均关闭),权重经发布屏障推回推理端。

技术新颖性

技术新颖性体现在四层。稳定化:与在目标函数层面补救失配的 TIS/IcePop/KPop/SAT/GSPO/DPPO 不同,TITO+R3 让失配在构造上不可能发生——R3 复用上游原语但补齐了捕获路径、多轮对齐与硬失败策略(缺记录即中止而非静默丢样本,记录替换只允许在 $m_{j+1}=0$ 的无梯度位置);TITO 的四情形层级修复可审计,把重编码漂移压到损失区域恰好为零。奖励:绝对断言数+固定全局刻度+按质量序逐 epoch 洗牌三者共同构成奖励设计,并明确把'防止批内尺度漂移'作为 critic 可学习性的前提。优化调度:全尺寸同构 critic 的先-critic-后-actor 顺序、30× 学习率与 Critic Warm-Up,用 EV 曲线定量支撑(热启动 0.71–0.86 vs 冷启动 −33.6)。基础设施:把显存写成闭式容量模型 $b(\Pi,T)\le M$,证明专家优化器状态对切分方案不变(Proposition 7.1),使分片计划可在初始化前解析判定而非事后试错;并为循环算子做原生上下文并行(前向逐位一致、梯度误差 $1.2\times10^{-7}$,激活峰值在 $\kappa=2,4,8$ 时降至 1/2、1/4、1/8)。

The T1 training pipeline
Figure 2: The T1 training pipeline
Category composition of T1-15k
Figure 3: Category composition of T1-15k
TITO stitching, drawn for the retokenized case (Equation 8)
Figure 5: TITO stitching, drawn for the retokenized case (Equation 8)
Train–inference log-probability gap |Δlog p|
Figure 6: Train–inference log-probability gap |Δlog p|
Critic explained variance with and without Critic Warm-Up
Figure 7: Critic explained variance with and without Critic Warm-Up
Mean rollout reward under the test-count reward over the production dense-reward run
Figure 8: Mean rollout reward under the test-count reward over the production dense-reward run

实验结果

主结果链非常清晰。Terminal-Bench 2.1(89 题):base 43.8% → SFT 49.4% → RL 后 T1 64.0%,RL 独立贡献 14.6 个百分点、占总提升 20.2 的 72.3%;同 harness 下超过 GPT-5.4(54.8)、DeepSeek-V4-Flash(56.9)、Claude Opus 4.6(63.8),仅次于 Opus 4.7(66.1),且是头部模型中唯一从 50% 以下起点达成者(10B 激活参数)。LHTB 平均奖励 27.9,追平 Gemini-3.1-Pro,超 GPT-5.4(27.2)与 GLM-5.1(26.7)。TBH 达 38.0%,比 SFT 高 9.7 分、超 DeepSeek-V4-Pro(36.0)。消融链:二值奖励 TMax-15k 仅 47.2%(未过 SFT)→ RST-38k 密集奖励 59.9% → T1-15k 64.0%;GRPO 同设定停在 51.7%(step 10 与 20 解出完全相同的 46/89 题)。稳定性:TITO+R3 把训练-推理 $|\Delta\log p|$ 从 0.021 降至 0.013,损失区域漂移 0.0000%;critic EV 热启动后稳定在 0.71–0.86。训练动态:step 10 首评即 56.2%,奖励 0.250→0.345 后平台于 0.34–0.36;平均轮数 10.4→约 20.7 后趋平。域分解:debugging 100.0%(GPT-5.6 Sol 80.0)、system administration 88.9%(55.6);Medium 难度 78%(SFT 58、base 56),Hard 仅 33%;评测平均 94.4 轮(SFT 31.5、base 41.1)。

Performance Comparison
Table 1: Performance Comparison
Terminal-Bench 2.1 standing of T1 against contemporary frontier and open-weight models
Figure 9: Terminal-Bench 2.1 standing of T1 against contemporary frontier and open-weight models
Performance on Long-Horizon Terminal Bench
Figure 10: Performance on Long-Horizon Terminal Bench
Terminal-Bench Hard resolved rate
Figure 11: Terminal-Bench Hard resolved rate
Held-out Terminal-Bench 2.1 resolved rate over the production dense-reward run
Figure 12: Held-out Terminal-Bench 2.1 resolved rate over the production dense-reward run
Behavioral dynamics of the dense-reward run
Figure 13: Behavioral dynamics of the dense-reward run
Terminal-Bench 2.1 progression across the three checkpoints and per-domain comparison against GPT-5.6 Sol
Figure 14: Terminal-Bench 2.1 progression across the three checkpoints and per-domain comparison against GPT-5.6 Sol
Terminal-Bench 2.1 performance by domain, interaction length, and difficulty
Figure 15: Terminal-Bench 2.1 performance by domain, interaction length, and difficulty
Rollout reward of the GRPO campaign on T1-15k under the same harness and reward as the production run
Figure 16: Rollout reward of the GRPO campaign on T1-15k under the same harness and reward as the production run
查看结构化数据
任务指标本文基线提升
Terminal-Bench 2.1(终端任务求解) resolved rate (%) 64.0 SFT 起点 49.4;GPT-5.4 54.8;Claude Opus 4.6 63.8 较 SFT +14.6 分(相对约 +29.6%),超 Opus 4.6,仅次于 Opus 4.7 的 66.1
Long-Horizon Terminal-Bench(长程终端任务,46 题) average reward 27.9 SFT 23.6;base 18.9;GPT-5.4 27.2;GLM-5.1 26.7 较 SFT +4.3(相对 +18.2%),追平 Gemini-3.1-Pro
Terminal-Bench Hard(高难度终端任务,100 题) resolved rate (%) 38.0 SFT 28.3;base 20.0;DeepSeek-V4-Pro 36.0 较 SFT +9.7 分(相对 +34.3%),超 V4-Pro 2.0 分
训练-推理一致性(122B 生产栈) |Δlog p|(损失区掩码加权平均) 0.013 无 TITO/R3 时 0.021 降低约 38%;损失区域 token 漂移 0.0000%,占位路由记录仅 0.003%
TB-2.1 debugging 子集(5 题) resolved rate (%) 100.0 GPT-5.6 Sol 80.0 +20.0 分
TB-2.1 system administration 子集(9 题) resolved rate (%) 88.9 GPT-5.6 Sol 55.6 +33.3 分
GRPO 对照(同 harness/奖励/算力) resolved rate (%) 64.0(PPO+全尺寸 critic) GRPO 51.7(step 10 与 20 完全相同,均为 46/89 题) +12.3 分;GRPO 的 rollout 奖励全程无趋势
Critic 校准(生产运行) explained variance(EV) 0.71–0.86(Critic Warm-Up 后) 冷启动从 −33.6 起步、58 个记录步中 30 步为负 热启动使 EV 从首个更新起即为正并保持稳定

局限与改进

作者承认的局限:TITO 只保证损失区域精确,retokenized 情形下 2.6% 的 token 是'按采样 id 训练、按重编码历史推理',彻底消除需 harness 以 token id 为历史真源;二值 vs 密集奖励的证据是 campaign 级的,两次运行同时改了数据池、初始化与路由重放,缺单变量消融;验证器在 agent 可控沙箱内执行,无运行时防篡改,只靠事前审计;oversampling 砍掉的恰是最难任务的轨迹,而评测失败又集中在这些任务上——'长尾被付了两次';数据偏科(debugging 仅 1.26%、数据科学 3.73%),失败集中于欠覆盖类目;只验证了 staleness=1,引用的研究显示基线在 staleness=8 时崩溃;结论限于一个模型族、一个 harness、一组基准。我的补充观察:评测代价高且策略没学会'何时停'——平均 94.4 轮/任务,六个未解题耗 164–473 轮直到超时(对手 GPT-5.6 Sol 仅 6–40 轮);Hard 组 33% 说明长程能力仍薄弱;与 GPT-5.6 Sol 的对比在资源上不对等(输入 56k vs 120k、输出 8,192 vs 32,768、关闭显式思考),失败归因不完全干净。

独立分析的弱点

独立分析的弱点及改进方向。1) 停止与预算管理缺失:失败案例显示模型会做数百轮无效搜索直至超时,说明 RL 只奖励'多通过断言'而未惩罚无进展的消耗,可引入预算感知奖励,或把'提交/放弃/请求帮助'显式建模为动作。2) 奖励仍是轨迹级标量,时序信用全靠 critic 经 GAE 回传,在 300+ 轮视野上让 $V$ 从前缀预测最终分数非常困难,可探索把断言级信号放到中途检查点、或使用 potential-based shaping。3) $r=P/S$ 隐含'每条断言≈等量工作'的近似设计原则,跨任务噪声大,可为断言标注难度权重或改用校准后的工作量单位。4) 验证器可被沙箱内篡改,事前审计是唯一防线,应加只读挂载与校验和。5) oversampling 按完成时间选择会系统性丢弃慢的难任务(一次测量中 561 条取消 48 条),可做 partial-rollout continuation 或难度感知调度。6) 模型为 Terminus-2 这一个 harness 专门 RL,跨 harness 泛化未验证,存在'为评测器优化'的风险,应在至少第二个 harness 上复评。

未来方向

作者规划的方向:让 harness 携带 token id 作为历史真源,消除残余 2.6% 的条件化错位;做与数据池、初始化、路由重放严格匹配的二值奖励消融,单变量隔离奖励贡献;沙箱内完整性检查(只读测试挂载、校验和验证器);partial-rollout continuation、按任务预算、更大评测预算与难度感知调度,缓解长尾双重代价;扩充 ML/数据科学/科学计算等欠覆盖类目的数据分布;把 staleness 研究中存活的组合(GSPO+SAT+R3、soft masking、TIS)移植到终端场景;在离线轨迹上预训练 critic、用 HL-Gauss 分类式 value loss 改善步 0 的 EV。基于成果可延伸的方向:把 TITO+R3+密集验证奖励作为通用配方迁移到 GUI、浏览器等其他长程可验证环境;设计能在线区分'有效工作'与'length hacking'的诊断量(如断言通过增速、重复命令率、上下文压缩后的记忆保持率);研究断言级奖励与自动课程结合,主攻 Hard 任务仅 33% 的瓶颈。

复现评估

复现条件评估:模型权重与项目页公开(HuggingFace/Project Page),底座 Qwen3.5-122B-A10B 为公开模型;软件栈全部为开源组件且版本齐全(slime v0.3.0、Megatron-Core v0.16.0rc0、Transformer Engine v2.10.0、SGLang v0.5.12.post1、DeepEP v1.2.1、Harbor v0.7.0、Daytona v0.168.0、PyTorch 2.11.0/CUDA 12.9/NCCL 2.28.9、Ray 2.55.1);数据合成(RST)流程与八维审计权重描述详尽,T1-15k/RST-38k/TMax-15k 的规模(15,000/37,484/14,601)与类目构成均有统计,评测协议(Terminus-2,60 轮/3600s agent/900s verifier,温度 0.1、top-p 0.95、3 次尝试)完整给出。但复现门槛很高:需容纳 122B actor-critic 共驻(每网络须独立满足约 95 GiB/设备的显存约束)的多机加速器集群,单步约 57 分钟、连续运行数天,还需大规模云沙箱配额(约 600 实例/分钟);论文自述部分 bookkeeping(优化器放置、权重同步计时等)未公开。对中小团队,务实路径是用较小 MoE 复现 TITO/R3/密集奖励配方,并直接采用其评测协议做横向比较。