← 返回 2026-08-07

CalibForge:面向可学习终端任务规模扩展的对抗式求解器校准 CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia 📅 2026-08-06 👍 22 2026-08-11 18:30
SFT蒸馏 可验证任务构造 智能体训练 求解器校准 终端任务合成

用对抗式求解器校准自动合成处于可学习区间的终端任务,大幅提升智能体训练效果。

前置知识

终端任务(Terminal Tasks)

指大模型智能体通过终端/命令行界面在交互式软件环境(如 Docker 容器)中执行、并配有自动验证器可客观判定对错的任务。每个任务通常由指令文本、初始文件、依赖环境和一组验证测试共同定义。

本文构造与评估的全部对象都是终端任务,理解其'指令-环境-验证'三位一体结构,是理解校准为什么针对这些组件逐项修订的关键。

求解器相对可学习区间(Solver-Relative Learnable Zone)

本文核心概念:一个任务处于可学习区间,当且仅当它被证明可解(至少一个求解器成功),但又未被给定求解器配置统一解出。这样既不太简单也不太难,能提供有效的学习信号。

这是论文一切设计的靶心,两种校准策略都是为了让任务落进这个区间;不理解它就读不懂保留准则 $C_\gamma$ 的真正含义。

监督微调轨迹蒸馏(SFT Distillation)

用一个强教师模型(本文为 DeepSeek-V4-Pro)在固定脚手架下尝试每个任务,保留通过验证的交互轨迹,过滤后作为监督数据,对目标学生模型做全参数监督微调。

所有任务集(含基线)都用同一教师协议蒸馏,使训练数据来源成为唯一变量,才能把性能差异干净地归因于任务构造质量而非教师或预算。

对抗式求解器校准(Adversarial Solver Calibration)

把求解器对候选任务的真实通过/失败结果及完整轨迹当作构造期反馈,让作者智能体反复修订任务,直到满足某个保留准则(跨模型分歧或强通过/弱失败),而非仅在事后过滤任务。

这是相对已有合成方法的根本差异点,理解其'修订而非过滤'的性质,是看懂消融结论(增益来自校准本身而非数据量)的前提。

研究动机

现有终端任务合成方法(TermiGen、TerminalTraj、CLI-Gym、SETA-Env、Endless Terminals 等)主要依赖可执行性校验来保证任务'可行'——环境能构建、验证测试在初始状态全部失败、作者能给出解法。但这种校验只回答了'任务能不能解',却无法回答'任务对给定求解器(solver)来说难度是否合适'。一个对所有求解器都轻易通过的任务太简单,无法提供有效学习信号;一个所有求解器都失败的任务又可能太难或本身有缺陷。论文还指出已有数据集存在严重领域集中:SETA-Env 中系统管理占 74.6%、TerminalTraj 占 49.9%、CLI-Gym 中调试占 67.0%、Endless Terminals 中文件操作占 40.6%。这些被可执行性把关的数据,并未保证任务落在对学习真正有效的难度区间内。

本文的目标是本文的目标是把'任务难度是否合适'变成一个可观测、可操作的构造目标。具体而言,作者希望让求解器的真实行为——通过/失败的结果以及完整交互轨迹——在任务构造阶段就参与反馈,从而把任务反复修订,使其落在相对于特定求解器配置的'可学习区间'内:既被证明可解,又不被该求解器配置统一解出。最终目标是产出更高质量、更具迁移性的智能体训练数据,让微调后的模型在 Terminal-Bench 2.0 以及跨域的 SWE-bench Pro、Doc2Repo 上获得显著提升。

与已有工作不同的是,本文的独特切入角度在于:以往工作要么只用可执行性校验过滤已构造好的任务,要么(如 Reflexion)用轨迹反馈改进'求解器自身'的后续尝试;而 CalibForge 把求解器反馈用在'被构造的任务'上——把任务构造变成一个受限的'作者-求解器'对抗循环。求解器试图完成当前候选任务,作者智能体则根据求解器行为证据(哪些模型通过、哪些失败、轨迹揭示的失败原因)主动修订任务的指令、环境或验证测试,再重新校验、重新探测。整个过程被'必须存在至少一次成功求解'这一可解性约束所限制,从而把任务难度对齐到求解器相对的能力区间。

核心方法

直觉上 CalibForge 像一个'出题-让学生做-根据表现改题'的老师。从一个线索出发,作者智能体先用工具做网络调研,找具体的工程问题(版本特定 bug、依赖冲突、配置陷阱、可复现边界情况),据此联合构造任务指令文本、Docker 执行环境(Dockerfile + 初始文件)和验证测试。候选任务先过两阶段校验:结构校验(构建环境、运行验证器、确认初始状态测试全失败)和自求解(作者自己在沙箱解一遍,确认解法可执行且指令/环境/测试一致)。只有都通过的候选才进入'作者-求解器'对抗循环,由校准规范 $\gamma$ 定义求解器配置与保留准则 $C_\gamma$。每轮用求解器通过/失败结果判断是否满足 $C_\gamma$,不满足就用反馈摘要和完整轨迹修订任务,再重新校验、重新探测,直到满足或达最大轮数 $R_{max}$。整个循环被'必须存在至少一次成功求解'这一可解性约束所限制。

核心创新是把'任务难度的合适性'形式化为'求解器相对的可学习区间',并用两种对抗式保留准则落地。多求解器校准 $\gamma_{multi}$ 派遣 $K$ 个不同模型的求解器独立尝试同一任务,保留准则要求结果出现分歧:$C_{multi}(\mathbf{y}) = \mathbf{1}[0 < \sum_{i=1}^{K} y_i < K]$,即至少一个通过、至少一个失败。对比式校准 $\gamma_{con}$ 跑一个指定强求解器和一个弱求解器,保留准则 $C_{con}(y_s, y_w) = \mathbf{1}[y_s = 1 \wedge y_w = 0]$,要求强通过而弱失败。与已有方法的本质区别在于:校验不再只判定'任务是否有效',而是判定'任务相对求解器是否处在可学习区间',并且当不满足时不是丢弃而是主动修订、重新探测。

方法步骤详情

流程如下:①作者智能体围绕线索做广搜生成任务规格,记录所需工具/依赖、输入与边界情况、预期行为和目标失败模式,并在草稿沙箱验证依赖可装、资源可访问。②据此联合构造任务指令、Docker 环境、验证测试。③两阶段校验:结构校验构建环境、运行验证器、确认初始状态测试全失败;自求解让作者在隔离沙箱解任务并跑验证器,确认解法可执行且指令/环境/测试一致;任一失败就修复重试直到 $V(\tau)=1$。④对抗校准循环(最多 $R_{max}=50$ 轮):每轮为每个求解器子智能体从 Dockerfile 实例化隔离沙箱、按 $\gamma$ 分配求解器并给同样指令,尝试后用验证器对最终状态打分得 $y_i\in\{0,1\}$,连同步骤数、完成状态、自评、失败诊断和完整轨迹作为反馈;若 $C_\gamma=1$ 则保留,否则用反馈修订并重新校验再探测。⑤保留任务存为 Harbor 实例,用 DeepSeek-V4-Pro 在 CALIBFORGE-EVAL 脚手架下蒸馏 SFT 轨迹(每任务两次、200 步、1 小时),过滤后全参数 SFT 训 10 个 epoch。

技术新颖性

技术新颖性有三点。第一,提出'环境级行为校准'这一构造原则,把任务可学习性视为'求解器相对'的量,并用经过验证的求解器行为决定保留与指导多轮修订——区别于以往只过滤任务或只改进求解器的工作。第二,两种校准策略共享同一个作者-求解器循环却用不同信号:多求解器用跨模型分歧降低对单一求解器的依赖、捕获更广的解法路径和失败模式;对比式用强通过/弱失败把任务锁定在两个求解器设置定义的能力区间内。第三,把不满足准则的求解器结果当成'可纠正的失配'而非'任务固有缺陷'——数据显示进入对比校准的候选只有 19% 初始满足目标关系,但经修订与重新探测后 96% 最终被保留,说明校准在主动重塑任务而非简单过滤。

Overview of CalibForge
Figure 1: Overview of CalibForge
Overview of CalibForge(完整流水线)
Figure 2: Overview of CalibForge(完整流水线)

实验结果

核心发现分四块。主结果(Table 1):Terminal-Bench 2.0 上 CalibForge-30B-A3B 达 32.58%(±1.12),比最强基线 TerminalTraj 的 26.22% 高 6.36 点;35B-A3B 达 47.57%,比 TerminalTraj 高 6.75 点,相对基座(7.87%/39.10%)提升 24.71/8.47 点。跨域迁移:30B 在 SWE-bench Pro 从 3.26% 升到 30.94%(+27.68)、Doc2Repo 从 5.94% 升到 35.98%(+30.04);35B 分别到 44.32%、48.77%。消融(Table 3,各 1300 任务):无求解器 22.47%、单求解器 24.34%(+1.87)、多求解器 29.21%(+6.74)、对比式 31.09%(+8.62),多求解器轨迹更少却增益更大,证明增益来自校准而非数据量。多样性上 5431 任务覆盖 16 类、最大类软件工程仅 25.5%;校准有效性上对比校准首轮仅 19% 满足目标关系、最终 96% 保留。

Main results on Terminal-Bench 2.0 and OOD benchmarks
Table 1: Main results on Terminal-Bench 2.0 and OOD benchmarks
Collection-level and per-task statistics
Table 2: Collection-level and per-task statistics
Effect of solver feedback and behavioral calibration
Table 3: Effect of solver feedback and behavioral calibration
Per-category Terminal-Bench 2.0 tasks solved (pass@3)
Figure 3: Per-category Terminal-Bench 2.0 tasks solved (pass@3)
Domain composition of CalibForge tasks and prior datasets
Figure 4: Domain composition of CalibForge tasks and prior datasets
Rank–frequency distribution of capability tags
Figure 5: Rank–frequency distribution of capability tags
Per-task distributions of environment and verification statistics
Figure 6: Per-task distributions of environment and verification statistics
Trajectory characteristics across task sets
Figure 7: Trajectory characteristics across task sets
First-probe outcomes and final retention under contrastive calibration
Figure 8: First-probe outcomes and final retention under contrastive calibration
查看结构化数据
任务指标本文基线提升
Terminal-Bench 2.0(Qwen3-30B-A3B-Instruct) 任务准确率 Acc. 32.58% ± 1.12 TerminalTraj 26.22%(基座 7.87%) 比最强基线 +6.36 点,比基座 +24.71 点
Terminal-Bench 2.0(Qwen3.5-35B-A3B) 任务准确率 Acc. 47.57% ± 0.99 TerminalTraj 40.82%(基座 39.10%) 比最强基线 +6.75 点,比基座 +8.47 点
SWE-bench Pro(OOD) Resolved Rate 30.94%(30B)/ 44.32%(35B) 基座 3.26% / 41.29% 30B +27.68 点,35B +3.03 点
Doc2Repo(OOD) Pass Rate 35.98%(30B)/ 48.77%(35B) 基座 5.94% / 44.92% 30B +30.04 点,35B +3.85 点

局限与改进

作者承认的局限:可学习区间是'求解器相对'的,依赖所选招建模与求解器配置(作者用 DeepSeek-V4-Pro、GLM-5、Kimi K2.5 等),换成不同求解器池时任务难度位置可能偏移;构造开销大,每个候选最多跑 50 轮校准、每轮多个求解器各 100 步/30 分钟,成本可观,且校准预算会影响哪些候选能进入训练集(短预算会漏掉需持续修订的'硬候选')。我观察到的额外局限:DeepSeek-V4-Pro 既做作者智能体又做对比式校准的强求解器,存在角色耦合;蒸馏与训练全部围绕同一教师,增益中可能混入教师偏置;OOD 基准上 35B 基座本身已很强(SWE-Pro 41.29%、Doc2Repo 44.92%),CalibForge 相对增益(+3.03/+3.85)远小于 30B 上从近乎为零的跃升,说明对已很强基座的边际收益有限。

独立分析的弱点

弱点一:求解器池选择会系统性决定'可学习区间',论文只展示了一种池配置,缺乏对池多样性/规模的敏感性分析——改进方向是引入池配置的自动搜索或多池投票。弱点二:校准以通过/失败为硬指标,忽略了解法质量、效率、鲁棒性等更细粒度信号,可能保留'靠取巧通过'的任务——改进方向是把验证器扩展为多维评分。弱点三:成本高昂,最多 50 轮、多求解器并行,难以低成本扩展——可引入早停预测器或用轻量代理求解器先粗筛。弱点四:领域分布靠线索采样驱动,最终最大类仍占 25.5%,未必与下游需求对齐——可引入目标分布的主动线索采样。弱点五:校准只修订到满足二元准则,没有显式保证任务'可教性'的上限,可能保留位于区间边缘、对学习增益边际的任务。

未来方向

作者方向:把环境级行为校准推广到更广的智能体任务(非终端),并探索更强的保留准则。基于成果可延伸的方向:把校准思想用于强化学习课程生成,按模型当前能力动态调整任务难度;把多维验证(效率、鲁棒性)纳入校准目标,构造多目标可学习区间;研究求解器池的自动配置与不确定性建模,使可学习区间随训练进度自适应漂移;探索校准信号与拒绝采样、DPO 等偏好学习方法结合,把'强通过/弱失败'直接转化为偏好对,从纯 SFT 扩展到对齐训练。

复现评估

复现评估:论文标注了 Dataset 和 GitHub 图标,声称会发布 5431 个任务,方法描述(Algorithm 1、两种保留准则公式、两阶段校验流程)足够具体;但作者智能体和求解器用的是 DeepSeek-V4-Pro/Flash、GLM-5、Kimi K2.5 等闭源或受限模型,普通研究者难以完全复刻相同的构造过程;评估用的 Terminal-Bench 2.0、SWE-bench Pro、Doc2Repo 虽公开但其官方脚手架和 CALIBFORGE-EVAL 需自建;算力上,蒸馏每任务两次 200 步/1 小时、全参数 SFT 训 30B/35B 共 10 epoch,对算力要求很高;去污染规则(14-gram 重叠 + 5-shingle Jaccard 等)有补充材料。整体可复现性中等:数据与代码声称可获取,但关键模型依赖与算力门槛是主要障碍。