← 返回 2026-07-21

面向 API 调用智能体的免环境合成数据生成 Environment-free Synthetic Data Generation for API-Calling Agents

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli 📅 2026-07-18 👍 20 2026-07-25 18:30
API调用智能体 LLM世界模型 合成数据生成 监督微调 知识蒸馏

仅凭API规格,用LLM模拟环境生成训练API调用智能体的轨迹数据

前置知识

API 调用型智能体(API-calling Agent)

一类大语言模型智能体,通过执行 API 调用并推理环境反馈来完成复杂用户请求。完整交互包含用户指令、交替的读/写 API 调用序列、执行结果和最终回复。与被动文本生成不同,它需要准确的状态追踪和错误恢复能力,因此训练数据是难以规模化采集的多步交互轨迹。

本文的核心对象就是这类智能体,理解其数据需求和交互结构,才能明白为什么免环境合成轨迹是个有价值且困难的问题。

有状态环境与读写 API(Stateful Environment)

环境维护可被 API 调用改变的持久状态。读 API(查询)不改变状态,写 API(创建/更新/删除)会改变状态。复杂的智能体任务需要在状态随交互演化的环境中协调多次读写调用。例如 AppWorld 平均每个任务需 10 个不同 API、约 45 次调用。

ESAT 的关键创新在于支持会改变状态的写 API,并在长轨迹中保持状态一致性,这区别于大多数只处理读 API 的模拟器。

监督微调(Supervised Fine-Tuning, SFT)

用带标签的示范数据训练模型拟合目标输出。本文把每条轨迹格式化为多轮对话(任务指令、agent 推理与 API 调用、模拟响应),训练模型在每轮中基于任务指令和此前所有调用预测 agent 的输出。

SFT 是本文验证合成数据有效性的主要范式,所有增益(最高 50.5%)都来自 SFT,理解它才能看懂实验设计。

LLM 作为世界模型/模拟器(LLM as World Model)

核心猜想:在海量语料上预训练的 LLM 可充当动态数字世界模型,给定 API 规格、参数、任务和历史,就能合成出逼真且反映状态变化的执行结果,模拟真实环境反馈。这是免环境范式的理论基础。

整篇论文建立在这个前提之上——用 LLM 即时模拟所有环境反馈,绕开构建可执行环境的瓶颈。

AppWorld 与 OfficeBench 基准

两个挑战性多应用基准。AppWorld 含 9 个应用共 457 个 API,评测跨应用读写协调,有 Test-Normal(168 任务)与 Test-Challenge(417 任务)两个划分;OfficeBench 面向办公自动化,含 8 个应用 20 个 API,任务需长程跨应用工作流。指标分别是任务/场景目标完成率(TGC/SGC)与 pass rate。

这两个基准是论文全部实验的评测载体,理解其难度和指标才能正确解读各项增益数字。

研究动机

训练 API 调用型大模型智能体需要海量高质量的交互轨迹数据,这些轨迹要完整捕捉多步交互过程——包括用户指令、交替的读写 API 调用、执行结果和最终回复,比普通指令微调数据难收集得多。现有合成数据方法(如 Qin、Zeng、Liu、Xu、Lu 等的工作)都默认可以访问具备可执行 API 和已填充真实后端数据库的完整环境。这种“环境构建”与“数据合成”的强耦合造成了严重的可扩展性瓶颈:要为一组新 API 生成训练数据,必须先搭建对应的基础设施,更难的是要采集填充环境所需的多样化状态配置。以 AppWorld 为例,它包含 9 个应用共 457 个 API,平均每个任务需要调用 10 个不同 API、总计约 45 次调用。

本文的目标是本文要回答一个根本性问题:能否在完全不构建底层环境的情况下,生成高质量的智能体轨迹数据?具体目标是设计一个仅需 API 规格说明作为输入的环境无关合成数据流水线,使其能跨多种 API 生态系统无缝扩展,把智能体轨迹合成从沉重的工程问题简化为轻量的“规格说明”问题。进一步要通过严格实验验证:这种免环境数据能否驱动显著的监督微调增益,能否让 1.7B–27B 参数规模的模型在 AppWorld 和 OfficeBench 上取得大幅提升,甚至超越从真实环境采集的数据。

与已有工作不同的是,作者的核心猜想是:在海量语料上预训练的现代大模型能够充当动态的“数字世界模型”——给定 API 规格、调用参数、任务指令和交互历史,LLM 就能合成出逼真的、能准确反映状态变化的执行结果,模拟真实环境反馈。ESAT 与已有模拟器(ToolAlpaca、ToolACE、Nemotron、Simia)有四点本质区别:第一,支持会改变状态的写操作 API,而不仅限于读操作;第二,仅凭 API 规格就从零生成任务和轨迹,无需预编译 API 池、现有基准或种子轨迹;第三,采用 agent 与 simulator 两个独立 LLM 的显式逐步交互,而非单次 LLM 生成完整轨迹;第四,模拟器会针对完整交互历史验证每个响应,从而作为持久的世界模型。

核心方法

ESAT(Environment-Free Synthetic Agentic Trajectory)是一条三阶段、完全免环境的合成数据流水线。直觉上,它把“轨迹合成”转化为一个轻量的“规格说明”问题,让 LLM 即时充当数字世界模型,无需任何真实 API 执行或后端基础设施。第一阶段任务合成:LLM 基于 API 规格生成多样化、可解的任务;第二阶段轨迹合成:教师智能体与 LLM 模拟器配对,教师逐步发起 API 调用,模拟器即时生成连贯的环境反馈,产出完整的多步轨迹;第三阶段轨迹过滤:LLM 评判器评估轨迹的正确性、完整性和冗余度,丢弃低质量样本。得益于现代 LLM 的长上下文能力,模拟器能在连续的 API 调用间保持状态一致性,生成远超孤立 API 调用例子的丰富多轮训练轨迹。最终用 9K–15K 条轨迹即可带来显著增益。

核心创新是一个上下文感知的、基于 LLM 的 API 模拟器,它充当动态数字世界模型。模拟器把丰富的上下文作为条件输入:完整的 API 规格、调用参数、当前任务、同一 app 内此前所有 API 调用及其模拟响应的历史、虚拟用户的姓名/邮箱/电话,以及当前日期时间。系统提示中编码了四条核心规则:(1) 数据一致性——跨轮次保持状态(如先前分配给某艺术家的歌曲必须始终归属该艺术家);(2) 数据多样性——列表结果混合任务相关与无关项以模拟真实噪声;(3) 数据真实性——生成值须满足数值范围、唯一标识符等字段约束;(4) schema 合规——响应严格符合规格定义。这与以往依赖隐式对话连贯性、易在长复杂轨迹中出现状态漂移和标识符幻觉的单次生成模拟器有本质区别。

方法步骤详情

完整流程分三阶段。阶段一任务合成:采用“分桶生成”,按难度(易/中/难)、动作类型(读/写/混合)、任务焦点、应用数(1/2/3)和每应用 API 数构成组合网格,桶随机顺序处理、每桶多次调用任务生成 LLM;配合“逆频率采样”优先覆盖使用不足的应用和 API;LLM 评判器过滤无效任务;随后任务重写把过程性冗长指令压缩为意图级请求并再核验。阶段二轨迹合成:教师 LLM(GLM-5.1-FP8)迭代发起 API 调用,模拟器动态生成响应。调用前先程序化校验参数缺失与类型不匹配;通过后做 schema 校验(不符则带错误重提示)、再用同款 LLM 裁决语义正确性与历史一致性(有错则精炼);全部通过才返回,耗尽重试即判模拟失败。轨迹在 agent 调用任务完成 API、超步数上限或调用任务外 app 时终止。阶段三轨迹过滤:轨迹级 LLM 评判器(Gemini-3.1-Pro)多次裁决,仅保留多数判为正确的轨迹。任务合成用 GLM-4.7-FP8。

技术新颖性

技术新颖性可归结为四点本质区别。其一,ESAT 是少数支持会改变状态的写操作 API 的模拟器,能在动态有状态环境中交互,而 ToolAlpaca、StableToolBench 等多聚焦读 API。其二,与依赖预编译 API 池(ToolACE)、现有基准(Nemotron)或种子轨迹(Simia)不同,ESAT 仅凭 API 规格就从零生成任务与轨迹,对新域无缝适配。其三,Simia 用单次 LLM 调用生成完整轨迹,而 ESAT 用 agent 与 simulator 两个独立 LLM 的显式逐步交互来生成多步轨迹。其四,为保证长轨迹状态一致,模拟器把每个响应对照完整交互历史做校验,充当持久数字世界模型。此外,分桶生成与逆频率采样保证了任务对应用和 API 的均衡覆盖,任务重写显著提升了任务自然度。

ESAT pipeline that generates agentic trajectories using only API specifications as input.
Figure 1: ESAT pipeline that generates agentic trajectories using only API specifications as input.

实验结果

AppWorld 上,仅用 52 个独立合成 app 生成的 ESAT-S52 数据就让所有模型获得 8.4–47.0% 的增益;合并 ESAT-S52-AW7 后进一步提升(最高达 50.5%,见 Qwen3.5-9B 在 Test-N)。所有模型在 ESAT-S52-AW7 上的表现都比真实环境数据 AWT 高出 0.7–15.3%,证明绕过目标环境也能生成高效领域监督。微调后的 Qwen3(8B/14B)与 Qwen3.5(4B/9B/27B)甚至超过 GPT-4o 与 Nemotron-3-120B,Qwen3.5-27B 与教师模型差距小于 3%。OfficeBench 上 ESAT-OB 带来 5.2–60.5% 增益(Qwen3.5-2B 两应用达 60.5%),比 Simia 高出 20% 以上。评判器方面,Gemini-3.1-Pro 取得 95.2% 精度,人工一致率 95%、Cohen's $\kappa=0.90$;模拟器 93.7% 的调用被 GPT-5.1 判为有效。与 ToolAlpaca/ToolACE/Nemotron 对比,ESAT 大幅领先。

Performance on AppWorld test splits.
Table 1: Performance on AppWorld test splits.
Performance on OfficeBench dataset.
Table 2: Performance on OfficeBench dataset.
AppWorld performance of Qwen3-8B trained on ESAT-S52-AW7 data filtered with different judge models.
Table 3: AppWorld performance of Qwen3-8B trained on ESAT-S52-AW7 data filtered with different judge models.
Comparison of ESAT-S52-AW7 data with existing synthetic API-calling datasets in terms of effectiveness on AppWorld.
Table 4: Comparison of ESAT-S52-AW7 data with existing synthetic API-calling datasets in terms of effectiveness on AppWorld.
Comparison of ESAT-OB data with existing synthetic API-calling datasets in terms of effectiveness on OfficeBench.
Table 5: Comparison of ESAT-OB data with existing synthetic API-calling datasets in terms of effectiveness on OfficeBench.
查看结构化数据
任务指标本文基线提升
AppWorld Test-Normal 任务完成 TGC 任务目标完成率 ESAT-S52-AW7 微调 Qwen3.5-9B 达 75.7% 零样本 25.2% 绝对提升 50.5%
AppWorld Test-Challenge 任务完成 TGC Qwen3.5-9B ESAT-S52-AW7 达 65.7% 零样本 15.4% 提升 50.3%
OfficeBench 两应用任务 pass rate Qwen3.5-2B ESAT-OB 达 69.6% 零样本 9.1% 提升 60.5%
AppWorld 免环境数据 vs 真实环境数据 TGC Test-N (Qwen3-8B) ESAT-S52-AW7 64.9% 真实环境数据 AWT 55.7% 提升 9.2%
OfficeBench 与同类合成数据对比 pass rate (Qwen3-8B 两应用) ESAT-OB 73.8% Simia 53.2% 提升 20.6%

局限与改进

作者承认,模拟器失败率随响应长度增长:500 token 以内仅 2–3%,500–1K 为 8%,1K–2K 升至 18%,2K token 以上高达 23%,这可能是所用 GLM-5.1-FP8 模型本身的局限,或可借助更强的前沿模型改善;输入上下文长度与失败率则无明显相关性。此外,Qwen3.5 系列在 ESAT 数据上叠加 AWT 数据已无额外增益,提示合成数据已接近饱和;评判器质量至关重要——用 GLM 做过滤反而会降低性能。OfficeBench 仅有评测集而无训练集,限制了在该基准上的直接比较。整体实验聚焦于 AppWorld 与 OfficeBench 两类办公/生活类应用,泛化到更开放域有待验证。

独立分析的弱点

第一,依赖多个前沿闭源/受限模型(GLM-4.7-FP8、GLM-5.1-FP8、Gemini-3.1-Pro)作为生成器与评判器,普通研究者难以复现或低成本套用,且数据质量高度依赖这些模型的能力上限。第二,长响应场景模拟器失败率显著上升(2K+ token 达 23%),削弱了在需要长列表返回的任务上的可靠性,改进方向是引入更强的长上下文模型或分段合成。第三,模拟历史被限制在同一 app 内,可能丢失跨应用的状态依赖。第四,每个任务只构造单一虚拟用户的状态,多样性有限。第五,目前仅验证 SFT,未探索 RL 等更强范式;改进方向是结合 Simia 式的 RL 训练,并用更前沿模型替换模拟器。

未来方向

作者提出可用更强的前沿模型替代 GLM-5.1-FP8 作为模拟器,以缓解长响应下的状态漂移。基于本成果可延伸的方向包括:将 ESAT 流水线推广到 AppWorld/OfficeBench 之外更开放的 API 生态系统与真实生产服务;探索把免环境合成数据与强化学习结合,模拟环境既可用于 SFT 也可在 RL 期间提供反馈(类似 Simia);研究自动生成多样化虚拟用户状态以进一步提升数据分布的覆盖;以及把“LLM 作为世界模型”的范式迁移到非 API 类智能体任务(如浏览器操作、工具组合调用)。

复现评估

论文未提供代码或数据集的开源链接,复现难度较高。生成端依赖 GLM-4.7-FP8、GLM-5.1-FP8,评判端依赖 Gemini-3.1-Pro,这些模型多为受限或闭源,普通研究者难以获取同等算力与模型权限。合成 app 由 Gemini 直接生成规格,这一过程也难以精确重现。所评测基准(AppWorld、OfficeBench)本身公开,评测协议(TGC/SGC、pass rate)描述清晰,且每项结果取 8 次推理的平均。prompt(附录 H.7)、训练超参(附录 D)等细节虽在附录给出,但缺乏中间产物与模型权重,独立完全复现仍具挑战,整体可复现性中等偏低。