何为优质智能体数据:ACE 视角下的 LLM 智能体数据生成 What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
用统一数据对象 (E,q,τ,v) 与 ACE 框架把智能体数据生成重构为受限分布设计
前置知识
LLM 智能体与多轮交互
大模型智能体不再是一次性问答,而是循环执行「观察-决策-行动」:调用工具、操作网页 GUI、修改代码仓库、与模拟或物理世界交互,并把环境返回的观测纳入下一轮决策。一次完整的交互被记录为轨迹 $\tau=(o_0,a_1,o_1,\ldots,a_T,o_T)$,学习目标正是把决策与观测、状态变化关联起来。
本文讨论的「智能体数据」就是这类多轮交互记录,理解交互结构才能明白为什么智能体数据生成远比传统的指令-回答合成复杂。
POMDP(部分可观测马尔可夫决策过程)
序贯决策的标准形式化:$M=(U,S,A,O,P,R)$,其中潜在状态 $S$ 不可直接观察,智能体只能基于可观测历史 $h_t$ 选择动作 $a_t\sim\pi_\theta(\cdot|h_t)$,环境按转移函数演化 $(s_{t+1},o_{t+1})\sim P(\cdot|s_t,a_t)$ 并返回观测。它刻画了「在信息不完全的环境下序贯做决策」。
论文用它形式化智能体交互(公式1-2),并由此推出「轨迹记录可观测行为、环境额外维护潜在状态」的关键区分,是 $(E,q,\tau,v)$ 表示的数学基础。
SFT 与 RL 后训练
监督微调(SFT)让模型直接模仿示范轨迹;强化学习(RL)则让模型在可执行环境中在线采样(rollout),依据成功信号更新策略。两者对数据的依赖不同:SFT 需要固定的示范轨迹 $\tau$,RL 需要支持新交互的环境 $E$ 与可靠的验证器 $v$ 来定义奖励。
论文用同一个数据对象 $(E,q,\tau,v)$ 解释两种范式各自需要什么数据,理解这一区别才能读懂验证器 $v$ 为何被单独列为一个因子。
指令合成与 Self-Instruct
用 LLM 自动生成训练指令与回答来扩充数据的方法族,代表如 Self-Instruct、Evol-Instruct、ToolLLM 式的工具描述驱动生成。传统指令合成只需语言上合理,产出的是孤立的问答对,不涉及可执行环境或状态一致性。
本文的核心论点之一是「智能体数据生成 ≠ 指令生成加回答采样」:还必须保证环境、任务、轨迹、验证器四者相互一致,这是与传统数据合成的本质分界。
可验证奖励与执行落地验证
用可执行检查(单元测试、schema 校验、数据库状态比对、编译、证明助手)而非模型主观评审来判定任务是否成功。这类信号可复现、可大规模应用,是 RLVR(可验证奖励强化学习)训练的基础,但其覆盖面受限于检查规则所能表达的性质。
论文准确性章节的核心趋势就是「从看似合理到执行落地」,理解可验证性与验证器偏差,才能理解 accuracy gate(准确性准入门)的含义与局限。
归一化熵与分布设计
熵衡量经验分布的均匀程度,归一化熵 $\tilde{H}=-\frac{1}{\log|S|}\sum_b \tilde{p}_b\log\tilde{p}_b$ 把它缩放到 $[0,1]$,1 表示在所有类别上均匀覆盖。「分布设计」指控制生成数据的概率质量落在哪里,而不是单纯增加样本量。
论文把 ACE 形式化为受限分布设计目标(公式8、12),多样性用因子级熵度量、复杂度用概率质量塑造,需要这一统计直觉才能读懂公式。
研究动机
大模型智能体要学习调用工具、操作 GUI、修改代码仓库等行为,依赖大量连接「决策-观测-状态变化」的交互式经验数据;这类数据人工采集昂贵、难以验证和扩展,因此数据生成成为扩展智能体训练与评估的核心手段。但智能体数据生成远比传统指令合成困难:一条有用的样本必须把可操作的环境、有根据的任务、动作产生有效观测与状态变化的交互、以及可信的成功信号耦合在一起,任何一处不一致——任务不可行、工具实现前后矛盾、观测与动作因果断裂、验证器奖励错误结果——都会让整条数据失效,而且表面流畅的数据完全可能掩盖这些问题。与此同时,现有文献以领域为中心组织:API 调用、仓库任务、GUI 演示、模拟器 rollout、科学发现经验各自表述,造成两个结构性困难:一是机制与应用混谈,相关机制在不同场景下被割裂讨论;二是管线描述常把「候选如何构造」与「如何验证、筛选、分配给学习者」混在一起,同类机制在不同术语下出现,评估口径互不兼容,难以横向比较。
本文的目标是本文的目标是为智能体数据生成建立一个跨领域的统一分析框架,系统回答「什么样的智能体数据是好的数据」。具体分三层:其一,定义一个紧凑而有表达力的公共数据对象 $d=(E,q,\tau,v)$——环境规范、任务信号、交互实现、可选验证器——使工具使用、软件工程、Web 与 GUI、具身、社会多智能体、科学形式化六大领域的数据可以在同一语言下比较;其二,按「主锚点+依赖结构」对生成范式做机制层面分类(正向生成与任务优先/轨迹优先/结构优先的反向生成),把「数据如何被构造」与「候选如何被评估和接纳」清晰分离;其三,提出 ACE(Accuracy–Complexity–divErsity)目标,将生成形式化为受限分布设计问题,并以此为透镜系统梳理现有工作在验证准确性、构造与校准难度、扩展行为覆盖三个方向上的机制、证据、成本与局限,进而讨论扩展律、真实/合成数据配比、预训练与自演化等前沿议题。
与已有工作不同的是,与既有综述按应用领域、训练阶段或环境类型组织不同,本文的独特切入是把智能体数据的「因子化分解」与「分布设计」分开处理:先用公共数据对象 $(E,q,\tau,v)$ 统一异构数据形式,再用 ACE 目标刻画「被接纳数据的分布应如何塑形」。关键的洞察是不对称性:准确性定义可行支撑集,是准入门槛而非可以被难度或新颖性补偿的收益——不可行但「有挑战」的数据不是难例而是坏数据;复杂度是相对特定学习者与执行配置的量(验证失败概率),应当被校准到能力边界附近的可学带而非盲目最大化;多样性是批次级、以行为冗余折减的覆盖属性,衡量的是有效行为支撑而非表面变化或样本量。这一视角使相似机制得以跨领域对齐比较,也把领域核心挑战从「生成更多数据」重新表述为「随智能体与环境演化,持续分配有效、有信息量、非冗余的经验」。
核心方法
论文先搭形式化地基:把智能体交互建模为 POMDP $M=(U,S,A,O,P,R)$,智能体基于可观测历史 $h_t$ 选择动作 $a_t\sim\pi_\theta(\cdot|h_t)$,环境按 $(s_{t+1},o_{t+1})\sim P(\cdot|s_t,a_t)$ 演化;一次交互实现是轨迹 $\tau=(o_0,a_1,\ldots,a_T,o_T)$;具体环境参数化为 $e=(D,F,P_{rule},\Omega,v)$,即状态载体、工具集、规则策略、观测接口与成功接口。由此提出贯穿全文的公共数据对象 $d=(E,q,\tau,v)$。生成被看作设计联合分布:主分解 $p(E,q,\tau)=p(E)p(q|E)p(\tau|E,q)$ 对应正向生成(先环境、再任务、后轨迹);改变锚点则得到任务优先、轨迹优先、结构优先三类反向生成。最后把 ACE 写成受限分布设计目标(公式8):在准确性准入约束 $\Pr[A(d)=1]\ge\alpha$ 下,最大化通过门的数据上复杂度效用与批次多样性的加权和。后续四章依次细化 ACE 三个维度的机制、测量与代价。
核心创新是 ACE 目标的不对称形式化。公式8:$\max\ \mathbb{E}_{B}[\lambda_C\tfrac{1}{|B_A|}\sum_{d\in B_A}g_z(C_z(d))+\lambda_D D(B_A)]\ \text{s.t.}\ \Pr[A(d)=1]\ge\alpha$。准确性 $A(d)=V_E\wedge V_q\wedge V_\tau\wedge V_v$ 是合取式准入门槛——看似正确的轨迹不能补偿不可行的任务,终点正确也不能补偿验证器放过违规捷径。复杂度定义为相对执行配置 $z$ 的验证失败概率 $C_z(d)=1-\Pr[v(d,\tau)=1|d,z]$,有用数据位于学习者能力边界附近的可学带;基座配置 $z_0$ 与智能体辅助配置 $z_A$ 的成对判据 $p_{z_0}(d)<\rho\le p_{z_A}(d)$ 专挑「必须借助智能体才能解决」的任务。多样性是批次级属性 $D(B)=\sum_k w_k H(Z_k|\cdot)-\lambda\,Red(B_A)$,只在过准确门且落入复杂度带的样本上度量环境/任务/交互因子熵并折减行为冗余。与已有方法的本质区别:难度与变化不能弥补无效性。
方法步骤详情
框架应用分四步。第一步形式化:用公式1-6把任意场景统一为 $(E,q,\tau,v)$——工具使用中 $E$ 是工具 schema 与规则,软件工程中 $E$ 是仓库、构建系统与测试,$v$ 可以是 schema 检查器、可执行测试、终态谓词或 LLM 评审;SFT 场景存 $E$ 和固定 $\tau$,RL 场景要求 $E$ 支持新交互。第二步分类生成范式:正向生成按 $E$ 来源分三路——真实/策展环境(ToolLLM、APIGen、TOUCAN)、LLM 合成环境(ToolAlpaca、ToolACE、SynthTools)、程序化可执行环境(EnvScaler、Agent-World、EnvFactory、ScaleEnv);反向生成包括任务优先(AgentInstruct、ToRA)、轨迹优先(OS-Genesis、Learn-by-interact)、结构优先(APIGen-MT 验证蓝图、ToolACE-MT 粗到细精修),另有 AgentEvolver、WebEvolver 等自演化系统。第三步机制化梳理 ACE 三维:准确性拆成环境/任务/交互/验证器四因子与四类保障手段(分层检查、约束落地构造、执行验证、反馈修复与选择性准入);复杂度给出结构组合、信息控制、完成设计、渐进演化、失败驱动校准、双向脚手架等操纵手段;多样性给出来源扩展、组合重组、探索发现、扰动反事实、覆盖引导平衡五类机制及覆盖/熵测量协议。第四步在讨论章延伸到扩展律、真实/合成配比、预训练与自演化。
技术新颖性
技术新颖性体现在三处。其一,数据对象的因子化抽象 $d=(E,q,\tau,v)$ 首次让工具调用、软件工程、GUI、具身、社会、科学六大领域的数据在同一语言下可比,明确各领域中「什么在变、什么必须一致」;把 $v$ 定义为接口而非某个训练范式的附属物,避免了把被生成对象与训练方式混淆。其二,把「生成范式」(如何构造候选)与「数据目标」(哪些候选被接纳或强调)正式分离——现有管线描述常把构造与验证/筛选/分配混写,本文证明这种分离能解释同一机制(如先验证蓝图)如何同时改善准确性、增加依赖深度并支持受控重组。其三,ACE 给出可操作的形式化协议:公式9的合取有效性与批次通过率、公式10的模型相对复杂度、公式11的基座-智能体成对难度判据、公式12-13的因子覆盖与归一化熵度量,把「好数据」从直觉变成可报告、可审计的标准(验证覆盖、模型依赖、生成成本显式化),而非笼统的通过率或数据集规模。
实验结果
作为综述,其「结果」是对文献的机制级综合。准确性方面:领域正从「看似合理」的评审转向执行落地验证——APIGen 依次做格式校验、函数执行与语义评审,软件工程管线用仓库配置、编译与测试验证,形式化领域用证明助手判定;分层验证栈(廉价规则→执行与状态信号→步骤/轨迹级评审→选择性人工升级)成为共识,ToolMind、WebSTAR 做轮级过滤以捕捉会向后传播的局部错误,APIGen-MT 用评审委员会先验证蓝图再展开对话;EnvFactory 表明较小规模的稳健验证环境集合可与单纯扩大环境数量竞争。复杂度方面:结构属性(深度、分支、部分可观测)只是解释变量与控制手段而非普适难度分——显式链条可能反而揭示解法、附加条件可能剪枝搜索;行为校准(验证失败概率、可学带)才是有效信号,且控制是双向的:太易加负担、太难简化或脚手架化;递归合成的求解器通过率随结构增长逐轮下降,说明结构控制可被行为难度交叉验证。多样性方面:改名工具或改写请求若诱导相同行为则不构成新覆盖,工具身份大幅低估行为支撑,改变权限或隐藏状态可能比新增名义 API 更有区分度;测量应分因子覆盖与归一化熵、警惕「模板锁定」,在准确门与复杂度带内报告,并以留出因子迁移差距与边际学习收益为最强证据。总体结论:有效支撑而非原始规模才是正确的扩展变量。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 环境规模 vs 数据有效性(环境扩展实验) | 下游智能体任务表现 | 综述引 EnvFactory:较小规模、经过严格验证的环境集合 | 简单扩大环境数量(更大但冗余/弱验证) | 环境更少但验证更严格即可与大得多的环境集合竞争甚至更优 |
| 工具使用分布外(OOD)泛化 | OOD 任务表现 | 综述引 DIVE:扩展工具池与每任务工具集覆盖 | 在同一支持域内重复采样 | 相同或更小数据预算下 OOD 泛化更高效 |
| 代码智能体固定预算轨迹分配 | 下游编码任务表现 | 综述引 Beyond Quantity:把固定预算分配给不同的轨迹结构 | 对已覆盖模式重复采样(数量扩展) | 结构多样性带来更高的边际学习收益 |
| 递归合成任务的难度演化 | 各轮求解器通过率 | 综述引递归合成研究:结构逐轮增长、通过率逐轮可测下降 | 无行为校准的静态难度代理(长度、工具数) | 结构描述与实测行为难度对齐,可验证难度增长 |
| 长多轮任务的准确性保障 | 任务/轨迹有效率 | 综述引 APIGen-MT:先用评审委员会验证任务蓝图再展开对话 | 直接生成完整多轮对话后事后过滤 | 无效计划不再污染后续轮次,长轨迹有效性与可审计性提升 |
局限与改进
作者明确承认:ACE 不是数据治理的完备清单,成本、效率、安全等约束仍然重要;公式8、12 是设计原则而非可直接优化的可微损失,因子表示、熵估计器、冗余度量、权重与目标复杂度带都需要按领域具体化。执行验证并不完备:轨迹可以钻验证器漏洞、产生非预期状态变化或违反隐式约束;LLM 模拟器生成的观测可能局部连贯却编码错误的状态动力学;混合检查能减少但不能消除语义上的不确定性。我的补充观察有四点:其一,综述没有给出跨研究的定量元分析,A/C/E 三个维度对下游性能的相对贡献仍停留在定性证据;其二,复杂度的行为校准需要反复 rollout,成本高昂且对模型、脚手架、推理预算和随机性敏感,实际管线难以负担,结构代理与行为校准之间的选择缺乏量化指引;其三,闭环自适应生成带来非平稳分布与「生成器-学习者-验证器共同适应同一反馈回路」的循环偏差风险,文中提出的固定锚点、留出域、周期重校准只是原则性建议,没有可操作协议;其四,引用了大量 2026 年预印本,部分支撑结论的可靠性与可复现性有待时间检验。
独立分析的弱点
独立分析三点弱点。第一,ACE 度量落地难:公式12要求显式划分因子类别并估计条件熵,类别设计本身就决定了多样性得分,行为冗余 $Red(B_A)$ 的图指纹/核有效数方法在各领域没有统一实现,不同论文的多样性数字不可互比——可行的改进是发布各领域的标准度量工具包与参考实现,让覆盖/熵/冗余的估算可复现。第二,准确性门是合取式,任何单因子验证失败即整条丢弃,在长轨迹上会大幅压低产率,而且狭窄的验证器可能误杀合法的替代解法(论文自己也承认这一「验证器覆盖 vs 验证器偏差」矛盾)——改进方向是发展部分可信验证(软门槛、按失败类别定向重生而非丢弃),并把「验证器覆盖度」作为与数据集一同报告的一等指标。第三,综述覆盖面广但每条线深度有限:对 RL 场景中验证器偏差被策略优化放大的动态过程(reward hacking 闭环)只有定性讨论,缺乏把 ACE 与过程奖励模型、验证器独立审计形式化结合的分析,更实际的改进是给出迭代生成-筛选回路的收敛或发散条件,指导何时该更换或扩充验证器。
未来方向
论文提出四个方向且均有延伸空间。一是智能体预训练与中训练:完整专家 rollout 太贵,无法支撑预训练级语料,训练单元不必是完整的 $(E,q,\tau,v)$ 记录——局部状态转移、逆动力学示例、依赖补全、可达性目标都可教组件能力;开放问题包括用后训练反馈为早期数据加权筛选、「强验证锚点+大规模弱监督语料」的组合、以及哪些交互知识应内化而非保持显式可更新。二是自演化智能体的数据生成:数据生成从离线准备变为持续学习回路的一部分,核心是避免生成器、学习者、验证器共同确认同一错误假设,需要固定或独立更新的锚点(留出任务、外部执行、真实环境周期评估)。三是 ACE 条件下的扩展律:从「性能如何随轨迹数增长」转向「额外生成如何高效扩展准确、适度挑战、行为独特的经验」,可能催生基于成功率带与覆盖缺口的动态分配算法。四是真实/合成混合配比:按 ACE 缺口动态分配——保真度不确定时增加真实证据做锚定与审计,验证覆盖或难度校准缺失时用受控合成补足,并以来源追溯、漂移检测与周期性支撑修复支撑开放世界下的可持续多样性。
复现评估
本文是综述/立场论文,本身没有实验代码与数据集,「复现」意味着在自己的管线上应用其框架:数据对象四因子分解、准确性四层检查清单、复杂度成对判据、多样性覆盖-熵报告协议。全文给出13个编号公式,但每个都需要领域内的落地选择,属于概念易学、实施偏难的一类。论文最实用的入口是三张表:表1列出16个正向生成代表工作(真实/策展环境6个、LLM 合成环境5个、程序化可执行环境5个),表2列出29个反向与自适应/自演化工作(任务优先12个、轨迹优先6个、结构优先5个、自适应6个),表3列出约37个跨领域多样性代表工作,绝大多数附 GitHub 或 Hugging Face 链接,环境和数据可直接取用。需要注意的是 EnvFactory、Agent-World、SciDisco 等被引系统为 2026 年工作,开源成熟度参差。整体算力需求取决于所选验证方式:规则检查廉价,执行验证需要环境搭建与维护成本,行为难度校准需要多次 rollout 与多模型评审。对工程团队而言,最有价值的可复现产物是验证分层清单与 ACE 报告协议本身。
论文图表