NexForge:通过需求驱动任务合成扩展 LLM 智能体能力 NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
需求驱动的智能体训练数据合成框架,跨领域规模化生成可执行任务与专家轨迹。
前置知识
智能体后训练(Agent Post-training / SFT)
在基础大模型之上,用监督微调(SFT)注入工具调用、长程交互、错误恢复等智能体行为模式的过程。训练数据通常是"任务描述+可执行环境+多步交互轨迹"的三元组,而非简单的指令-回答对。NexForge 输出的正是可直接用于 SFT 的轨迹数据。
整篇论文的目标就是为 SFT 合成高质量轨迹,理解 SFT 的工作方式(5 个 epoch、学习率 $10^{-5}$、cosine decay)才能理解为什么数据质量决定模型能力。
基板绑定(Substrate-bound)方法
指 SkillSynth、Terminal-World、SWE-smith、R2E-Gym 这类从"预定基板"(工具、代码仓库、技能图、执行轨迹)出发反向生成任务的方法。任务规模、分布都被输入基板决定:SWE-smith 的 50K 任务受限于可用 GitHub 仓库,SkillSynth 的 3.6K 受限于技能图。
这是论文要解决的核心对立面。只有理解基板绑定的三个缺陷(规模受限、迁移成本高、分布偏置),才能理解 NexForge"需求驱动"范式的价值。
Teacher-Student 轨迹蒸馏
用一个强 teacher 模型(本文是 DeepSeek V4 Pro)在可执行工作区里与环境交互、产生多步轨迹(含工具调用、失败、恢复),再清洗成训练格式喂给 student 模型(Qwen3.5-35B-A3B)。每个任务通常采 3 个 rollout,本文 Terminal-3.6K 最终得到 8,521 条有效轨迹(平均 2.37/任务)。
NexForge 的第三阶段就是轨迹生成,理解 teacher-student 范式才能明白为什么"不需要人工标注答案或任务专用验证器"是一个重要卖点。
任务需求画像 Φ(I) 与场景库 G(I)
需求画像 $\Phi(I)=\{\Phi_t, \Phi_d, \Phi_\sigma, \Phi_e, \Phi_\ell, \Phi_\ell, \Phi_h\}$ 是对任务表单各维度(任务类型、交付物、来源策略、运行时、语言、难度)的加权类别分布;场景库 $G(I)$ 是描述真实工作背景(组织、角色、工作流)的具体场景集合。两者分离后才能独立控制语料级分布。
这是 NexForge 方法论的核心数据结构。后续的 DATC 编译、分布分析(有效类型数 $\exp(H)$)都建立在这两个概念上。
Terminal-Bench 2.0 与 GDPval 评测
Terminal-Bench 2.0 是终端命令行任务基准(89 道题,pass@1 准确率),衡量软件构建、配置编辑、数据处理等能力;GDPval 衡量"经济价值型"办公任务,用 LLM 判官两两对决后拟合 Elo 分(GPT-5.1 锚定为 1000 分)。两者都只用于评测,不参与数据构造。
所有提升数字都建立在两个基准上。理解它们的度量方式才能正确解读"22.5%→52.0%""813→1338 Elo"这类结果。
Shannon 熵与有效类型数 exp(H)
用 $H=-\sum_i p_i \ln p_i$ 衡量任务类型分布的多样性,$\exp(H)$ 表示"同等熵下等频分布需要多少个类型"。本文用它量化 w/o profile 塌缩到单一主导类型($\exp(H)\approx 3$)、w/o scenario 过于平坦($\exp(H)\approx 16$)、完整流水线折中($\exp(H)\approx 6$)。
消融实验的核心度量。看懂 $\exp(H)$ 才能理解为什么"任务表单控制防塌缩、场景接地塑真实分布"是论文的关键论断。
研究动机
当前智能体后训练数据合成几乎全部是"基板绑定"的:AgentSynth(>6K)、TaskCraft(~36K)、DIVE(48K SFT+3.2K RL)从执行轨迹或原子任务出发,SWE-smith(50K)和 R2E-Gym(>8.7K)从代码仓库与提交出发,SkillSynth(3.6K)、Terminal-World(5,723 环境)、CLI-Universe(6K 轨迹)从预定义技能图或能力分类出发。这些方法共享三个缺陷:(1)规模被输入基板上限卡死——SWE-smith 的 50K 取决于可用仓库数量;(2)迁移成本高——终端域、办公域、科学域各自需要一套定制流水线;(3)分布偏置——任务分布反映基板"方便生成什么"而非真实世界"需要什么"。例如,给定 pMARS 仓库,基板绑定方法最自然会产出"实现"类任务,即使"交叉编译"类任务可能更有价值。这种基板驱动导致合成数据与真实需求脱节,且难以规模化扩展到新域。
本文的目标是本文目标是构建一个"需求驱动"的统一框架:以一段高层能力需求 $I$(如"设计覆盖真实命令行环境多领域技术任务的终端智能体任务")作为唯一输入,请求任务数 $N$ 和批级约束 $B$(语言、难度预算),无需任何域专用基础设施,就能合成大量多样、可执行的智能体任务包与专家轨迹,用于 SFT。具体地,要(1)显式控制语料级任务分布而不绑定到具体仓库或文档;(2)让同一套流水线跨终端、办公、科学等不同能力域自由规模化;(3)生成可直接落地的训练数据,把 Qwen3.5-35B-A3B 在 Terminal-Bench 2.0 从 22.5% 提升到与 Claude Opus 4.6 + Claude Code(58.0%)相当的 58.4%,并最终训练出开源 SOTA 的 Nex-N2 模型族(Terminal-Bench 2.1 达 75.3%,GDPval 达 1585 Elo)。
与已有工作不同的是,本文的独特切入角度是把"任务生成"与"基板"彻底解耦,并倒置生成顺序:先确定"智能体应该练习什么"(任务表单 + 场景 → 指令 $\delta_j$),再去"寻找或构造能让这个练习落地"的材料。这一倒置通过两个数据结构实现——任务需求画像 $\Phi(I)$ 显式建模语料级分布,场景库 $G(I)$ 提供接地的工作背景;再由 DATC 兼容性过滤器 $F_\theta$ 保证指令内部自洽(平均仅保留 2.0% 的组合兼容)。这种"工作契约先于材料固定"的范式,是本文区别于所有基板绑定方法的本质——材料服务于任务,而非任务被材料所推断。
核心方法
NexForge 是一个三阶段流水线。直觉上:先"调研真实世界要做什么",再"按真实分布把任务表单与场景拼装成具体指令",最后"把每个指令落地成可执行工作区并跑出专家轨迹"。技术路线:阶段一(需求发现)用 web-enabled 研究代理收集证据,构建加权任务需求画像 $\Phi(I)=\{\Phi_t,\Phi_d,\Phi_\sigma,\Phi_e,\Phi_\ell,\Phi_h\}$ 和场景库 $G(I)$(通过关键词条件自指令、关键词条件研究、自指令、知识图谱扩展四种机制填充)。阶段二(分布感知任务编译 DATC)对每个场景 $g_j$,按兼容性顺序过滤表单维度 $K=\{t,d,\sigma,e\}$,得到兼容候选集 $C_{j,k}=F_\theta(I,g_j,k,\Phi_k,S_{j,<k})$,再按权重采样 $f_{j,k}\sim\text{Normalize}(\Phi_k|C_{j,k})$,拼成指令 $\delta_j=\langle g_j,f_j,A_j,\ell_j,h_j,R_j\rangle$。阶段三(轨迹生成)把指令实例化为工作区、跑 teacher 模型、清洗轨迹。
核心创新是"倒置生成顺序"——把工作契约在采集任何材料之前就固定下来。现有方法是"仓库→任务"(材料决定任务),NexForge 是"任务表单+场景→指令→材料"(材料服务任务)。这个倒置由两个机制落地:第一,把任务分解为表单 $f_i=(t_i,d_i,\sigma_i,e_i,\ell_i,h_i)$ 和场景 $s_i$ 两个正交维度,让语料级分布可控而与具体仓库解耦;第二,DATC 的场景条件兼容过滤器 $F_\theta$ 在采样前剔除与场景不兼容的组合(如某运行时不允许某交付物),既保证指令内部自洽(平均保留 2.0% 组合,81.0% 指令与场景匹配),又让画像权重继续主导语料级分布。这与 SkillSynth 用技能图、CLI-Universe 用预定义能力分类的方式有本质区别。
方法步骤详情
步骤一需求发现:研究代理从专业工作流、技术文档、角色描述等收集证据,由 LLM 审查合并近义项、消除歧义,输出需求画像(终端域含 24 任务类型、20 运行时、8 交付物、4 来源策略、3,678 关键词;办公域 15/12/23/4、773 关键词),同时用四种机制填充场景库,并做精确去重与基于嵌入(cosine 阈值 0.85)的语义新颖性过滤,最终终端+办公共 5,600 个场景。步骤二 DATC 编译:对每个场景展开描述,按 $\{t,d,\sigma,e\}$ 顺序过滤兼容项再按权重采样,记录候选集 $A$ 和组合理由 $R$,输出指令 $\delta_j$。步骤三环境实例化:研究代理挖掘真实材料(仓库、数据集、配置文件),规划代理产出蓝图(目标、输入、交付物、依赖、运行时约束),实现代理构建工作区(适配仓库、检索文件、生成产物、装依赖、配置非特权 CPU-only Docker),自动校验材料完整性、来源一致性、依赖可用性、无答案泄漏。步骤四轨迹收集:teacher 模型(DeepSeek V4 Pro)在固定交互预算下与工作区交互,记录响应、工具调用、观察、失败与恢复,再做任务无关的轨迹清洗(剔除畸形会话、无效消息、错误-only 输出、过短交互),保留不完整但有用的长程推理与恢复信号。
技术新颖性
新颖性体现在三点。其一,问题形式化新:把环境规模化重构为"需求驱动的规模化问题",并明确指出基板绑定三瓶颈(输入受限规模、高迁移成本、基板偏置分布),此前工作未做这种抽象。其二,数据结构新:任务表单画像 $\Phi(I)$ 与场景库 $G(I)$ 的正交分解,使语料级分布控制与接地材料彻底分离——画像定义"做什么"、场景提供"在哪做",二者不耦合(场景故意只描述工作背景,不携带任务类型/交付物/来源/运行时,避免场景独立决定分布)。其三,编译机制新:DATC 的场景条件兼容过滤 $F_\theta$ 配合画像权重限制采样 $\text{Normalize}(\Phi_k|C_{j,k})$,在保证指令自洽的同时维持语料级分布,这种"先过滤后加权采样"的顺序约束此前未见。此外,"不需要人工答案或任务专用验证器"、保留不完整但有用的轨迹,也是一种对传统数据合成范式的务实突破。
实验结果
核心发现分四块。(1)主结果(表3):Terminal-3.6K 让 Qwen3-32B 在 Terminal-Bench 2.0 从 5.6% 涨到 32.3%(+26.7 点),让 Qwen3.5-35B-A3B Base 从 22.5% 涨到 52.0%(+29.5 点);NexForge 训练的 Qwen3-32B 在全部 Qwen3-32B 终端专用模型中均值最高(超 Terminal-World-32B 31.5、SkillSynth 29.6)。(2)域迁移(表4):仅换办公规格、不动流水线,Office-2K 把 GDPval 从 813 提到 1338 Elo,逼近 Gemini 3.1 Pro 的 1316。(3)规模缩放(图4):Terminal-43.2K 达 58.4%,与 Claude Opus 4.6+Claude Code 的 58.0% 持平;Office-22K 达 1384 Elo。(4)Nex-N2-Pro 在 Terminal-Bench 2.1 达 75.3%、GDPval 达 1585 Elo,开源 SOTA。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Terminal-Bench 2.0 终端命令行任务(pass@1) | 准确率(%) | Qwen3.5-35B-A3B + Terminal-3.6K = 52.0±3.6;+ Terminal-43.2K = 58.4 | Qwen3.5-35B-A3B Base = 22.5±0.9;Claude Opus 4.6 + Claude Code = 58.0±2.9 | +29.5 点(3.6K),+35.9 点(43.2K)追平 Claude Opus 4.6 |
| Terminal-Bench 2.0(Qwen3-32B 对比,pass@1) | 准确率(%) | Qwen3-32B + Terminal-3.6K = 32.3±2.4(NexAU,所有 Qwen3-32B 专用模型最高) | Qwen3-32B Base = 5.6±0.9;Terminal-World-32B = 31.5;CLI-Universe-32B = 31.2;SkillSynth = 29.6 | +26.7 点,且以通用框架超越全部终端专用 32B 基线 |
| GDPval 经济价值型办公任务 | Elo(GPT-5.1 锚定 1000) | Qwen3.5-35B-A3B + Office-2K = 1338(95% CI [1312,1364]);+ Office-22K = 1384 | Qwen3.5-35B-A3B Base = 813;Gemini 3.1 Pro = 1316;GPT-5.1 = 1000 | +525 Elo(2K),接近 Gemini 3.1 Pro,超越锚点 GPT-5.1 |
| Terminal-Bench 2.1 与 GDPval(生产规模 Nex-N2-Pro) | 准确率 / Elo | Nex-N2-Pro:Terminal-Bench 2.1 = 75.3%;GDPval = 1585 Elo | 多个前沿闭源系统 | 开源 SOTA,超越数个前沿闭源系统 |
局限与改进
作者承认的局限:阶段三不产出参考答案或任务专用验证器,因此只能用于 SFT,尚不能直接支持强化学习或基准构造(论文明确列为未来工作)。GDPval Elo 依赖比较池,所以与公开模型的对比只是"上下文参考",主要证据来自受控的 base-vs-scaled 对比。我额外观察到的局限:(1)所有合成阶段与 composer 都用 GPT-5.5、teacher 用 DeepSeek V4 Pro,数据质量上限被这两个强前沿模型封顶,普通实验室难以复现数据;(2)"science"在图2中被列为可扩展域但论文从未实际做实验验证,跨域能力的证据只来自终端和办公两个域;(3)Nex-N2"contributes to the training"措辞模糊,未说明 NexForge 数据在最终模型训练数据中占比多少,归因不够干净;(4)办公域从 Office-2K(1338)到 Office-22K(1384)仅 +46 Elo,规模收益远不如终端域明显,提示办公任务可能更快饱和;(5)DATC 兼容性判定与分布分析中的 LLM-judge 用 Qwen3.7-Max,存在评判者自身偏置风险。
独立分析的弱点
弱点一:对强前沿模型的过度依赖。所有合成代理、composer、轨迹 teacher 都是 GPT-5.5 或 DeepSeek V4 Pro,整套流水线本质上把"前置智能"外包给闭源模型;若用更弱的开放模型替代,画像质量、场景多样性、材料挖掘准确性都可能下滑——论文未给消融。改进方向:测试开源 teacher(如 Qwen3 系列)下的退化曲线,并设计对 teacher 质量更鲁棒的提示。弱点二:场景库新颖性过滤仅用 cosine 阈值 0.85,可能漏掉"措辞不同但语义重复"的场景,或误杀真实相近但需保留的场景;改进方向:引入层次化去重或基于任务表单联合嵌入的过滤。弱点三:DATC 兼容性只由单一 LLM 判官决定,且 Qwen3.7-Max 判"指令是否匹配场景",存在评判者偏置;改进方向:多判官集成或基于实际可执行性的硬校验。弱点四:办公域缩放收益微弱(1338→1384),暗示分布建模在办公任务上可能过早饱和;改进方向:诊断办公任务的长尾结构,调整画像权重。弱点五:仅做 SFT,未做 RL,无法体现"可验证信号"带来的增益;改进方向:尽快补上自动验证器。
未来方向
作者明确提出的:为 NexForge 自动生成参考答案与机器可校验的验证器,使其可用于基准构造、强化学习以及其他需要可靠 outcome-based 反馈的场景——这是把"需求驱动合成"从 SFT 数据扩展到 RL 数据的关键一步。基于成果可延伸的方向:(1)把流水线扩展到科学计算、网页浏览、多模态等更多域,论文图2画了 science 但未实测,需补齐以验证"跨能力可迁移"的强主张;(2)结合 RLAIF/RLHF,用自动验证器驱动 RL 阶段,进一步榨取 NexForge 数据的价值;(3)研究"画像权重 $\Phi$ 与下游收益"的缩放律,给出最优分布配比而非靠经验平衡;(4)开源合成流水线代码(已释放提示档案 analysis/prompts/)后,社区可贡献更多域规格,形成像 GLAN 那样的需求画像生态;(5)探索多 teacher 蒸馏,降低对单一前沿模型的依赖。
复现评估
复现评估分两层。模型层较好:Nex-N2 模型族在 https://nex.sii.edu.cn/ 公开,四阶段提示的英文忠实渲染与原始中文模板都放在 analysis/prompts/ 归档,SFT 配置(5 epoch、最大上下文 262K、packed bf16、global batch 64、lr $10^{-5}$、cosine decay、5% warmup、128 块 H100)与训练日志 provenance(表9,如 Terminal-2K 训练 12.2h)都记录详尽,加载已发布权重即可复现评测。数据合成层困难:所有合成阶段与 composer 用 GPT-5.5(闭源、付费),teacher 轨迹用 DeepSeek V4 Pro,要复现 Terminal-3.6K 的 3,600 任务×3 rollout 需大量 API 调用与算力(仅 SFT 就需 128 块 H100),普通实验室几乎无法完整复现数据合成;不过由于 pipeline 是配置驱动的,用开放模型替换后可部分复现流程。综合难度:模型评测中等(有公开权重),完整数据合成高(依赖闭源强模型与大规模算力)。
论文图表
左右对照图:左侧基板绑定方法把任务生成绑死在工具/仓库/技能图上,每域一套定制 Pipeline(Pipeline 1/2/3),覆盖与规模受基板上限(标 ×);右侧 NexForge 用统一核心由能力需求描述驱动,同一套 Pipeline 跨终端、办公、科学等域自由扩展(标 ✓)。
用一张图讲清本文与全部已有方法(SkillSynth、Terminal-World、SWE-smith 等)的本质对立,是 motivation 的视觉化纲领。