← 返回 2026-08-27

JIT-Agent:以即时(Just-in-Time)脚手架进化扩展智能体运行框架智能 JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan 📅 2026-08-26 👍 114 2026-09-01 18:30
DPO 元智能体 强化学习 智能体脚手架 智能体评测 测试时优化

训练一个元智能体,为每个任务即时生成、修复并进化专属 Agent 脚手架,显著放大固定底座模型能力

前置知识

Agent Harness(智能体脚手架/运行框架)

Harness 是把基础模型变成闭环智能体的运行层代码,决定保留哪些交互历史(记忆管理)、如何形成局部意图(规划策略)、暴露哪些工具/技能(能力编排)、动作如何执行与何时触发验证恢复(动作协议)。同一模型在不同 harness 下表现可能天差地别,因此智能体能力是「模型×脚手架」对的属性,而非模型权重单独决定。

本文的全部出发点就是:harness 不是实现细节,而是智能体性能的一阶决定因素;读懂全文需要先理解 harness 涵盖哪些组件、为何能主导模型贡献。

AOT vs JIT 脚手架构造范式

AOT(Ahead-of-Time,预先优化)是现有主流:在经验流上搜索或编辑一个持久的 harness 工件,指望它泛化到未来任务,代表方法包括搜索式的 AutoHarness/Meta-Harness/AHE 和测试时编辑式的 TTHE/RHI。JIT(Just-in-Time,即时)则是本文提出的新范式:由训练好的生成器看到具体任务后才合成实例专属 harness,把搜索摊销进模型权重。

全文的核心对比就是 JIT 对 AOT;Table 4 按实例合成、生成器训练、学习修复、在线进化四个维度区分两类方法,理解这一区分才能把握本文的定位与贡献。

四模块协议 h=(M, P, A, F)

本文把任意 harness 形式化为四个可组合模块:记忆 M 把不可变事件历史 $\xi_{<t}$ 压缩成视图 $v_t$,规划 P 把视图转成局部指令 $d_t$,能力编排 F 按指令激活工具/技能子集 $C_t$,动作 A 更新控制器状态 $s_{t+1}$ 并发出动作 $e_t$,运行时依赖顺序为 M→P→F→A。固定协议 Π 规定模块接口、生命周期与校验规则,把无约束生成空间 G 逐级收窄到协议合规且可执行的 $\mathcal{H}_\Pi^{exec}$。

这是 JIT-Agent 的生成目标空间:没有这个协议,让模型生成 harness 就等于生成任意程序,既难训练也难保证可执行;协议是「代码承载 harness」这一假设的形式化落地。

DPO 与组相对策略优化(GRPO 类方法)

DPO(直接偏好优化)用偏好对 $(h^+, h^-)$ 代替奖励模型做监督训练,本文 Stage I 用带质量验证的偏好规则构造数据。组相对优化则对同一任务采样一组候选,用组内均值/方差归一化各候选的优势,省去价值网络;本文 Stage III 的 Evo-GDPO 在此基础上把 reward、latency、cost 三通道分别归一化再加权聚合。

Stage I 的 DPO 与 Stage III 的 Evo-GDPO 是训练 JIT-Agent 的两大支柱,不熟悉这两类目标函数就无法理解损失设计与「奖励超越档案前沿」的机制。

测试时扩展与经验流式迁移

测试时扩展指推理期投入更多计算换性能,本文的静态模式是轻量版:并行生成 N 个 harness 只执行选中的一个,不增加环境 rollout。流式(streaming)模式则把已完成任务的 harness 连同其 reward/latency/cost 存入档案 $B_n$,后续任务检索先验设计,使生成器参数冻结也能随任务流持续变强。

这两种推理模式是「可进化性」在部署期的体现,Figure 6 的 streaming 实验直接验证了档案进化能否带来累积收益。

研究动机

智能体能力并非只由模型决定:一个强模型放在错误的记忆、规划器或动作协议之后就会失败,而 harness 决定了保留什么历史、如何形成局部意图、暴露哪些工具与技能、动作如何执行、何时触发验证与恢复。问题在于 harness 设计至今仍是人工的、任务特定的、根本不可扩展的——广域搜索任务需要并行证据探索,终端任务偏好精简的串行 ReAct 循环,深度研究任务需要工作记忆管理检索证据,NL2Repo 式编码任务又天然依赖文件系统存储补丁、测试与仓库状态。更关键的是,合适的 harness 不仅随领域变化,还随任务实例变化。现有的测试时 harness 优化(搜索 harness 代码、提示、工具、记忆或控制策略)虽然有效,但共享一个 Ahead-of-Time 假设:把 harness 当作要在经验流上长期优化的持久工件,指望它泛化到未来任务。当部署分布不稳定或任务高度异质时,这条路要求搜索巨大的设计空间、积累足够轨迹,然后祈祷得到的脚手架恰好匹配下一个任务。

本文的目标是本文提出并验证另一种可能性:Model-as-a-Harness——训练一个紧凑的元智能体 JIT-Agent,在推理时接收任务规范、固定协议、可执行的工具/技能注册表以及少量检索到的先验 harness,即时合成一个任务自适应的可执行 harness,用它包裹任意的现成智能体 LLM 执行。随着反馈和轨迹积累,JIT-Agent 还能修订 harness 并更新 harness 档案,实现测试时 harness 进化,而生成器本身保持冻结。为此作者定义了 harness intelligence(脚手架智能),包含三个必须同时满足的属性:适应性(harness 匹配任务与底座)、可靠性(生成物可执行且失败时可恢复)、可进化性(把执行反馈转化为更强的未来 harness),并把训练这样一个系统定位为建立一条与模型扩展正交、可训练、可迁移、可复利的智能体能力维度。

与已有工作不同的是,独特切入角度在于时间维度上的范式转换:已有工作无论搜索式还是编辑式,都是相对新任务实例「预先」优化一个工件;本文则把构造时机推迟到看到任务结构之后,并把搜索过程摊销进一个训练好的生成器中。同时,与生成任意 agent 程序的自动化设计方法不同,本文先把 harness 因式分解为记忆、规划、动作、能力编排的四元组,用固定协议约束生成空间($\mathcal{G} \supseteq \mathcal{H}_{syn} \supseteq \mathcal{H}_\Pi \supseteq \mathcal{H}_\Pi^{exec}$),使「生成 harness」变成生成结构化可执行模块;再用 HARNESSFACTORY 在统一接口下重实现 13 个代表性脚手架,既检验协议的表达力,又为训练提供多样素材。这一「协议诱导的空间 + 三阶段定制—修复—进化训练」组合是本文独有的。

核心方法

直觉上,不同任务实例需要不同的 harness 先验,与其预先编译一个通用脚手架,不如训练一个模型「看任务下菜碟」。技术路线分四步。第一步,形式化:设任务为 $\tau$、冻结底座执行器为 $\pi_\psi$、能力注册表为 $C_\tau$,运行 harness $h$ 诱导闭环轨迹 $\xi \sim \mathrm{Rollout}(\tau, \pi_\psi, h, C_\tau; \Pi) = \langle s_1, e_1, o_1, \ldots, s_T, e_T, o_T \rangle$,并假设每个协议合规的 harness 可分解为 $h = \langle M, P, A, F \rangle$,运行时依赖顺序为 M→P→F→A:记忆把历史压成视图 $v_t = M(\xi_{<t}, s_t)$,规划形成指令 $d_t = P(\tau, s_t, v_t)$,编排激活能力 $C_t = F(C_\tau, s_t, v_t, d_t)$,动作更新状态并发动作 $(s_{t+1}, e_t) = A(s_t, \tau, v_t, d_t, C_t)$。第二步,HARNESSFACTORY 在共享协议与执行内核下重实现 13 个代表性脚手架(ReAct、Plan-and-Execute、ReSum、Flash-Searcher、GAM、MemoBrain、AggAgent、OAgent、AgentFold、HiAgent、DeepAgent、ROMA、AOrchestra)作为种子库 $B_0$。第三步,三阶段训练定制、修复、进化三种能力。第四步,推理时支持静态(并行 N 个 harness 选一执行)与流式(档案跨任务更新)两种模式。

核心创新有三点。其一,Model-as-a-Harness 范式:据作者所知 JIT-Agent 是首个专门为即时 harness 生成而训练的模型,把 harness 工程从「人工维护的 AOT 工件」变为「原生 JIT 合成的学得能力」;与自动化 harness 搜索的本质区别是搜索被摊销进生成器权重,新任务无需再跑优化循环。其二,协议诱导的生成空间:固定四模块协议剥掉了语言与运行时的偶然差异、保留真正区分现有 harness 的操作性选择(如何压缩历史、如何形成意图、如何编排工具、控制如何推进),使 ReAct、Codex、ROMA 等异构程序映射到 $\mathcal{M} \times \mathcal{P} \times \mathcal{A} \times \mathcal{F}$ 中可比的坐标,生成物天然可执行。其三,Evo-GDPO:与标准组相对优化只做组内比较不同,它以档案中最优先验设计的统计量 $(b_r, b_\ell, b_\kappa)$ 为基线,奖励「超越当前档案前沿」的候选,并在保持奖励的前提下额外奖励更低的延迟与成本,把测试时进化内化为训练出的能力而非外部搜索启发式。

方法步骤详情

Stage I(定制):更强教师 $q_\phi$ 为每个任务生成协议合规 harness,上下文 $c_\tau = (\tau, \Pi, C_\tau, E_\tau)$ 中 $E_\tau$ 取自任务类型匹配的 3 个种子脚手架;生成物经协议校验与执行检查通过后才保留,先做标准 SFT。再做 DPO:同一底座、同一评估种子下比较候选,仅当 $r^+ > r^- \wedge \ell^+ \le \ell^- \wedge \kappa^+ \le \kappa^- \wedge (\ell^+ < \ell^- \vee \kappa^+ < \kappa^-)$ 才保留偏好,并以 $\Delta_{val}(\tau; h^+, h^-) = \alpha_r (r^+ - r^-) + \alpha_\ell [\ell^- - \ell^+]_+ + \alpha_\kappa [\kappa^- - \kappa^+]_+$ 加权、锚定冻结的 SFT 检查点。Stage II(修复):把失败 harness $\hat{h}^{(0)}$ 与结构化诊断 $g^{(0)}$(编译错误、接口不匹配、工具调用失败、运行时异常)配对,教师在补丁空间提出修订 $\Delta^{(k+1)}$,Apply 确定性更新后再校验,只保留 $K^\star = \min\{k \in \{1,2\}: \mathrm{Valid}_\Pi(\hat{h}^{(k)}) = 1\}$ 存在的轨迹,做教师强制的短视野模仿学习。Stage III(进化):每轮采样任务并检索先验设计,组采样 $G>1$ 个候选,与最优检索 harness 的 $(b_r, b_\ell, b_\kappa)$ 比较,计算 $R^{rew}_i = r_i + \lambda_{evo}[r_i - b_r]_+$、$R^{lat}_i = \mathbb{I}[r_i \ge b_r][b_\ell - \bar{\ell}_i]_+$、$R^{cost}_i = \mathbb{I}[r_i \ge b_r][b_\kappa - \bar{\kappa}_i]_+$,三通道组内独立归一化后按 $A^\Sigma_i = w_{rew} A^{rew}_i + w_{lat} A^{lat}_i + w_{cost} A^{cost}_i$($w_{rew} > w_{lat} + w_{cost}$)聚合,批归一化后进裁剪 PPO,加对 Stage-II 检查点的 token 级 KL;通过校验的候选只有匹配或超过当前奖励前沿、并严格改进至少一个维度才写入档案 $B_n$。

技术新颖性

技术新颖性可从三个层面评估。范式层面,Table 4 显示 JIT-Agent 是唯一同时具备实例合成、生成器训练、学习修复、在线进化四项能力的方法:搜索式 AOT(AutoHarness、Meta-Harness、AHE)四项皆无;测试时编辑式(Adaptive AH、TTHE、RHI)只有在线进化;即便训练生成器的 Harness-R1 也不具备实例合成。目标函数层面,Evo-GDPO 把「进化」写进优化目标——候选的奖励优势不是组内相对,而是相对档案 incumbent 的超越量,且效率通道受 $\mathbb{I}[r_i \ge b_r]$ 门控,保证不会用牺牲任务表现换速度或省钱;这与 GRPO 类组相对方法及常规多目标 RL 都不同。数据层面,Stage II 把失败转化为监督的做法很务实:只保留两轮内可修复的轨迹,聚焦「局部可恢复」的现实失败而非需要推倒重来的设计错误。案例层面(Figure 5 与附录 C 的十个生成 harness),生成物不是提示词变体而是执行语义级的任务定制——如把覆盖检查做成可执行的证据契约(Turnstile)、把数值聚合移出语言模型推理(Abacus)——证明模型学到的是设计空间上的真选择。

Overview of JIT-Agent. Given a task, JIT-Agent composes a problem-specific agent harness by instantiating (rather than simply combining) four modules: memory, planning, action, and capability.
Figure 1: Overview of JIT-Agent. Given a task, JIT-Agent composes a problem-specific agent harness by instantiating (rather than simply combining) four modules: memory, planning, action, and capability.
Training pipeline of JIT-Agent.
Figure 2: Training pipeline of JIT-Agent.

实验结果

主实验(Table 2)覆盖九个基准、四类任务。替换默认脚手架后,全部 18 个匹配的「底座×基准」组合全部提升:GLM-5.2 平均分从 74.1 升至 81.8(+7.7),DeepSeek-V4-Flash 从 66.7 升至 75.5(+8.8)。最大增益出现在长程规划:DeepSeek-V4-Flash 在 DeepPlanning-Shopping 上 +24.8(59.1→83.9),GLM-5.2 在 DeepPlanning-Travel 上 +20.2(62.8→83.0)。尽管只用开源底座,JIT 系统在九列中拿下八列第一:JIT+GLM-5.2 在七项基准登顶,含 DeepSearchQA 93.9、AgentIF 69.9、PinchBench 93.3;摘要中的标志性结论是 DeepSeek-V4-Flash 借 JIT harness 在 DeepSearchQA 上超 GPT-5.6 达 +9.1(85.1 vs 76.0)、在 OdysseyBench 上 +4.3(73.0 vs 68.7)。受控对比(Table 3,固定底座比较六个 harness)中,JIT-Agent 在六个设置里四个性能最佳:对 DeepSeek-V4-Flash 在 DeepSearchQA 超最强固定 harness 4.7 分、xBench-DS 超 4.0 分;对 Qwen3.6-Flash 在 xBench-DS 超 7.0 分、AgentIF 超 2.9 分;剩下两个设置仅落后 3.1 与 3.9 分。更关键的是六个设置的 token 消耗与 API 成本全部最低:比最便宜的固定替代低 14.9–54.1%,平均省 36.0%——例如 DeepSeek-V4-Flash 的 xBench-DS 从 527K token/$0.075 降到 212K token/$0.039 的同时性能反升 78.0→82.0,说明增益来自任务条件化脚手架而非更长的轨迹。跨模型泛化(Figure 4):六个底座 × 四个基准共 24 组配对比较,JIT 全胜、平均 +7.6,三个模型家族分别 +10.2/+4.0/+8.6,DeepSearchQA 平均 +15.2(Mimo-V2.5-Pro +22.2)。流式进化(Figure 6)在三个任务流上累积准确率均超过静态模式,且成本与工具调用未系统性膨胀,验证档案进化有效。

Seed bank B0: 13 hand-written harnesses instantiating the four-module protocol Π.
Table 1: Seed bank B0: 13 hand-written harnesses instantiating the four-module protocol Π.
Main results across nine agentic benchmarks.
Table 2: Main results across nine agentic benchmarks.
Controlled comparison with advanced agent harnesses.
Table 3: Controlled comparison with advanced agent harnesses.
Harness optimization paradigms.
Table 4: Harness optimization paradigms.
Cost–performance trade-offs on DeepSearchQA and AgentIF.
Figure 3: Cost–performance trade-offs on DeepSearchQA and AgentIF.
JIT-generated harnesses consistently improve paired backbones over ReAct.
Figure 4: JIT-generated harnesses consistently improve paired backbones over ReAct.
Palimpsest: graph-planned artifact execution.
Figure 5: Palimpsest: graph-planned artifact execution.
Streaming test-time harness evolution across task streams.
Figure 6: Streaming test-time harness evolution across task streams.
查看结构化数据
任务指标本文基线提升
九基准平均(Deep Research/Daily Work/Planning/Workspace) 平均分(0–100) GLM-5.2:74.1→81.8;DeepSeek-V4-Flash:66.7→75.5 相同底座的默认脚手架 +7.7 / +8.8,18 个匹配组合全部提升
DeepSearchQA(深度研究) 答案 F1 JIT + DeepSeek-V4-Flash:85.1(成本 $0.066/例) GPT-5.6:76.0;最强固定 harness NanoBot:80.4($0.131) 超 GPT-5.6 +9.1;超 NanoBot +4.7 且成本降 49.6%
OdysseyBench(工作区执行) 任务成功率 JIT + DeepSeek-V4-Flash:73.0 GPT-5.6:68.7 +4.3
DeepPlanning-Shopping(约束规划) 购物车匹配率 JIT + DeepSeek-V4-Flash:83.9 vanilla DeepSeek-V4-Flash:59.1 +24.8(全部实验中最大单项增益)
DeepPlanning-Travel(约束规划) 复合约束满足分 JIT + GLM-5.2:83.0 vanilla GLM-5.2:62.8;GPT-5.6:84.9 +20.2,但仍是唯一未登顶基准(落后 GPT-5.6 1.9 分)
xBench-DS(深度搜索) 准确率 / token / 成本 82.0,212K token,$0.039(DeepSeek-V4-Flash);Qwen3.6-Flash 上 70.0 NanoBot:78.0,527K token,$0.075;Qwen3.6-Flash 上 63.0 +4.0 且 token 降 59.8%、成本降 48%;Qwen3.6-Flash 上 +7.0
六底座×四基准跨家族泛化 配对胜率与平均提升 24/24 全胜,平均 +7.6 同一底座的固定 ReAct harness 家族级 +10.2(DeepSeek V4)/+4.0(Qwen3.6)/+8.6(Mimo-V2.5),DeepSearchQA 平均 +15.2

局限与改进

作者承认的局限相对隐含但可读出:其一,DeepPlanning-Travel 是九个基准中唯一未登顶的,JIT+GLM-5.2 以 83.0 落后 GPT-5.6 的 84.9 达 1.9 分;其二,受控对比中两个设置(DeepSeek-V4-Flash 的 AgentIF 63.8 vs Claude Code 66.9、Qwen3.6-Flash 的 DeepSearchQA 70.3 vs NanoBot 74.2)分别落后 3.1 和 3.9 分,说明任务与底座组合失配时任务自适应并不保证全面占优;其三,Stage II 只保留两轮内可修复的轨迹,意味着需要整体重设计的失败被排除在监督之外;其四,训练依赖一个更强的冻结教师来合成数据。我自己的观察:第一,评估规模可疑——Figure 4 明确标注 DeepSearchQA 用 100 例子集、其余三个基准用 50 例子集,如此小的样本下单点得分波动可能不小;第二,整条管线以「任务有可验证奖励」为前提,reward/latency/cost 三通道都依赖可重复 rollout 的标量信号,难以直接迁移到无清晰指标的开放任务;第三,生成并执行任意 harness 代码带来安全与沙箱问题,文中未讨论;第四,档案保留规则是贪心的帕累托前沿更新,可能牺牲种群多样性、导致进化早熟;第五,静态推理中「生成 N 选 1」的选择标准与元生成自身的延迟开销未被充分量化。

独立分析的弱点

弱点一:对可验证奖励的硬依赖。Evo-GDPO 与 DPO 偏好构造都需要重复 rollout 得到的标量 reward,AgentIF 这类用加权 rubric 的基准尚可,但真实开放任务(写作、咨询)缺乏可比信号;改进方向是引入 LLM-as-judge 或过程级奖励模型,并对奖励噪声做不确定性加权。弱点二:修复视野固定为两轮($K^\star \le 2$),虽然换来聚焦「局部可恢复失败」的干净监督,但也让模型没机会学习深层调试;改进方向是按失败类型分层放宽视野,或课程式地从浅修复过渡到深修复。弱点三:评估子集过小(50/100 例)且部分结论依赖与商用闭源模型的点估计比较;改进方向是报告置信区间并扩大多种子。弱点四:生成代码的执行安全:harness 包含任意 Python/bash 与工具调用,面对恶意任务描述可能被注入;改进方向是协议级沙箱、静态分析白名单与能力最小化(Turnstile 式的工具门控其实是现成素材)。弱点五:贪心帕累托保留可能让档案塌缩到少数高效设计上,削弱 Stage III 检索上下文的多样性;改进方向是加入质量-多样性(如 MAP-Elites 式网格)保留。弱点六:协议本身(四模块接口与 13 个种子)仍是人工设计的,$\mathcal{H}_\Pi$ 的表达力上界受种子库制约;改进方向是让协议本身也随经验扩展,例如允许模型提议新模块类型并通过校验后并入。

未来方向

作者明确指出方向:harness intelligence 是与模型 scaling 正交且可复合的能力维度,值得作为独立于权重的训练目标持续投入;流式推理展示的档案进化可推广为终身/在线的 harness 学习。基于本文成果可自然延伸的研究包括:其一,harness 与模型的联合训练——目前执行器 $\pi_\psi$ 完全冻结,让底座对「被换装」具有感知与适配能力(harness-aware RL)可能进一步放大增益;其二,跨任务家族的迁移结构分析——streaming 模式目前只在同类任务流内验证,研究档案在异质任务间的负迁移与遗忘机制很有价值;其三,把 JIT-Agent 接入生产级运行时(Claude Code、OpenCode)作为「换装层」,评估真实工程环境中的稳健性;其四,档案的压缩与课程化——随 $B_n$ 增长,检索上下文 $E_\tau$ 的构建策略(相似度、任务类型、前沿距离)值得系统消融;其五,安全性——为生成的 harness 建立形式化校验与运行时隔离标准;其六,把同样的 JIT 思想搬到多智能体组织结构与具身控制等更广的「操作性脚手架」上。

复现评估

复现条件中等偏上。有利因素:代码已在 GitHub 开源(github.com/bingreeky/JIT);HARNESSFACTORY 提供统一四模块协议下的 13 个脚手架实现,种子库与生成空间有明确定义;训练配方(SFT→DPO→修复模仿→Evo-GDPO)在文中写得相当具体,偏好规则、优势归一化、保留规则均有公式。不利因素:其一,JIT-Agent-27B 基于 Qwen3.6-27B 训练,Stage I 需要一个更强的冻结教师反复生成并通过执行校验,Stage III 需要对每个任务组采样多个候选、每个候选重复 rollout 并评估 reward/latency/cost,这是标准的 RL 级算力开销(27B 模型 + 大量 API 环境交互),非个人实验室可轻松负担;其二,评估横跨九个基准与多个商用模型 API(GPT-5.6、Gemini 3.1/3.5、Kimi K2.7 等),完整复现主表需要可观的 API 预算;其三,部分基准得分基于 50–100 例子集,复现者需自行确认切分方式。若只想验证核心主张——用发布的 JIT-Agent 为自己的底座模型即时生成 harness 并对比 ReAct——则门槛低得多:只需推理算力(27B 生成器一次前向)加所选基准的执行环境即可。