GDPevo:面向真实业务任务的智能体自我进化基准 GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
首个面向GDP业务工作流的智能体自我进化基准,用规则混合使测试增益可归因
前置知识
智能体自我进化 (Agent Self-Evolution)
智能体在与环境交互后更新自身的持久状态(参数或非参数:记忆、技能、提示、harness 代码),并在后续相关任务中复用以持续提升表现。形式上其行为可看作从 $P(y \mid C, \theta)$ 采样:微调/RL 更新参数 $\theta$,而 prompt/技能/memory/harness 工程修改条件 $C$。本文聚焦非参数的「技能」形态进化。
这是论文的核心评估对象。必须先区分「参数级进化」与本文采用的「技能级进化」,才能理解实验设置、局限与作者为何强调基准对进化形态是中立的。
进化原生 vs 进化适应基准 (evolution-native vs evolution-adaptive)
进化原生基准刻意设计训练-测试切分,确保训练习得的能力在测试任务上确实被需要并被运用(如 EvoAgentBench 的 528/267 切分、SkillFlow 的 166 任务/20 族、SEA-Eval);进化适应基准复用原本为单次能力测量设计的任务套件(如 SWE-bench 的 2294 条仓库 issue、ALFWorld、Terminal-Bench),直接切分训练/测试而不刻意对齐迁移能力。
论文的动机正是这两类基准的三大不足(覆盖窄、不可归因、易污染)。理解二者区别是读懂 GDPevo 的 contribution 与它「自底向上构造训练-测试关系」这一独特切入的前提。
规则混合 (Rule Hybridization)
把每个企业工作流分解为原子化的、可独立核验的业务规则,把规则子集散布到 5 个训练任务、在 5 个测试任务中重新组合。规则刻意不在模型世界知识内(如某公司的赞助商优先级、黑名单排除、发票有效期),迫使智能体必须从训练推断规则、在测试时组合应用。
这是 GDPevo 的核心创新,是「测试增益可归因」与「泛化可测」的根本机制。不理解规则混合就读不懂整个方法、校准阈值与评测设计。
监督类型与进化方法 (Supervision Types)
进化有两个维度:监督类型决定训练时可用的信号,进化方法决定信号如何变成持久状态。四种监督:base(无训练)、fewshot(训练题+金答案,类比 SFT)、reflect(训练题+自答评分反馈,迭代 3 轮即 reflect-3,类比 RL)、self(仅有训练题,类比无监督)。本文进化方法统一为基于技能(SKILL.md)的非参数方法。
RQ1 的全部对比都围绕这四种监督展开,准确率与成本差异、RQ2 的跨域迁移行为都取决于监督类型,必须先理解才能看懂所有实验结论。
全知 Oracle 上限 (Fully-Informed Oracle Ceiling)
用「全信息模型」近似理想上限:把某任务组的全部隐藏规则连同训练题和金答案都喂给模型,使其无需学习/推断、只需应用规则解测试题,此时准确率为 91.6%。理想做法应是人类领域专家实测,但作者缺乏横跨法律/医疗/财务的专家故以此近似。
论文用 91.6% 的 oracle 上限来论证「最强进化配置(约 67%)仍远未达天花板」,这是判断当前自我进化能力成熟度、识别剩余 headroom 的关键参照。
确定性规则评分器 (Rule-based Grader)
每个任务配一组带权重的评分点,但不让 LLM 直接判定是否满足,而是让 LLM 把每个评分点翻译成代码测试用例。每个评分点得满分或零分,任务分数为通过评分点权重的归一化和,每任务跑 3 次取均值。因此跨运行可复现,每个失败可追溯到具体违反的规则。
这是 GDPevo 保证可复现性与可解释性的关键,也把它与依赖 LLM-as-judge 的同类基准区分开,是评估结果可信度的基础。
研究动机
现有针对智能体自我进化的评测基准存在三大局限。第一,进化原生类基准对经济价值高、难度大的任务覆盖不足——像财务、法律、医疗这类领域(如发票审计、合规检查、记录对账)由企业专属规则支配、其正确性可用确定性标准核验,本应是研究进化的理想土壤却被忽视。第二,进化适应类基准(如 Reflexion/ExpeL 借用 ALFWorld、HotpotQA,或 SWE-bench 的 2294 条仓库 issue、Terminal-Bench)虽任务广难度高,但其训练-测试切分从未与任何「可迁移能力」对齐,进化后的精度提升无法归因;即便是 EvoAgentBench(528/267 切分)、SkillFlow(166 任务/20 族)等原生基准,也是事后从已有基准中搜索可迁移关系,数量与多样性天然受限。第三,两类基准都发布静态公开任务集,在 AI 快速迭代的时代极易遭遇数据污染,一旦暴露便迅速失效。
本文的目标是本文目标是构建一个既能可靠评估智能体自我进化、又能长期保持有效性的基准。具体而言作者希望做到四点:首先,首次覆盖与 GDP 直接相关的真实企业工作流,横跨 CRM、ERP、财务、医疗、法律、数据中心六大领域;其次,让测试阶段的提升能被明确归因于训练经验——通过「规则混合」机制,训练任务只暴露规则子集、测试任务重新组合规则,使泛化变得可测;再次,提供一条全自动数据构造流水线,使基准能在两天内从 V1 的 120 任务/12 组扩展到 V2 的 240 任务/24 组,从而在公开任务被污染时快速再生;最后,配套确定性规则评分器、把成本(token、轮数、金钱)作为一等指标,并提供雷达图、迁移热力图等诊断视图,让用户能把总体增益追溯到具体领域与具体规则。
与已有工作不同的是,本文的独特切入角度是「自底向上」地构造训练-测试关系,而非从已有基准中事后挖掘。其核心创新「规则混合」把每个企业工作流分解为原子化、可独立核验的业务规则(这些规则刻意不在模型世界知识中,如某公司的赞助商优先级、黑名单排除、发票有效期),再把规则子集散布到训练任务、在测试任务中重新组合。这样只有真正「学会」规则的智能体才能组合应用它们,测试增益因此可归因。此外作者把成本、可复现性、抗污染同时纳入一等设计目标,并用确定性代码评分器替代 LLM-as-judge,这些都是同类工作(EvoAgentBench、SkillFlow、SEA-Eval)未同时满足的。
核心方法
GDPevo 的整体思路是:把「评估自我进化」转化为「在共享同一企业环境的任务组上,看智能体从 5 个训练任务进化后能否解好 5 个留出测试任务」。技术路线上整个基准由智能体全自动构造(三阶段):种子场景发现→任务组生成→校准与评审。任务组最小单元是「一个共享业务环境 + 10 个任务(5 训练 + 5 测试)」。智能体先在训练任务上吸收监督信号、把可迁移的业务规则、环境使用流程、输出约定、常见失败模式蒸馏成一份 SKILL.md 技能,再用新智能体加载该技能解测试任务。评分采用确定性规则评分器——每个评分点由 LLM 转写成代码测试用例,得满分或零分;每个测试任务跑 3 次取均值。整个评测把智能体定义为 $\text{Agent} = \text{Harness} + \text{Model}$(两个 harness:Codex、Claude Code;四个模型:GPT-5.5、Opus-4.8、GLM-5.2、DeepSeek-V4-Pro-Preview),并在 Docker 容器中隔离执行。
核心创新是「规则混合」,与已有方法的本质区别在于:它从设计源头就把训练-测试关系锁定到「可迁移规则」上,而非事后从既有基准中寻找关联。具体地,流水线先把场景业务逻辑分解为原子规则(最小且可独立核验的决策规则),这些规则刻意排除模型世界知识、专属于某家企业;再把规则散布到 5 个训练任务,每个训练任务只暴露一个子集;最后把规则在 5 个测试任务中重新组合(例如测试任务可能同时调用「优先级」和「黑名单」规则,而任何单个训练任务都不含该组合)。智能体首次遇到隐藏规则几乎必然失败,必须借助监督信号推断规则、记入技能,并在测试时组合应用。配合三阶段自动化流水线与校准阈值(无训练基线 0.4–0.6、fewshot 提升 0.1–0.3、进化后仍 $<0.8$)以及 6 个评审智能体中 $\geq 5$ 通过的门槛,确保每组任务「既可学又有余量」。
方法步骤详情
方法分三阶段。阶段一·种子场景发现:以 GDPval、SOP-Bench、JobBench 等真实工作基准为输入,智能体按三条标准(内嵌领域隐藏规则、规则可测可完整可确定、支撑长程 SOP 且场景多样)提出候选场景并经智能体过滤,得到如「客服工单解决」这类种子场景。阶段二·任务组生成:编排智能体把场景与示例转成蓝图(环境规格、10 条任务陈述、原子规则、任务-规则矩阵),派生 1 个环境构建器实现共享环境(如医疗记录系统、员工数据库,以 SQLite/Web Apps/HTTP API 形态)、10 个任务构建器各自从分配的规则子集构造单任务,训练 5 + 测试 5,并产出任务陈述、参考答案、评分脚本。阶段三·校准与评审:校准智能体在无训练下解测试应得 0.4–0.6 分,fewshot 进化后应提升 0.1–0.3 且最终仍 $<0.8$;6 个独立评审智能体检查输出完整性、评分格式与评分点多样性、答案不泄露,$\geq 5$ 通过才接收。每个尝试在独立 Docker 容器、独立工作目录与 harness 主目录下隔离执行。
技术新颖性
新颖性体现在四点。第一,「规则混合」是把泛化「具体化」的首次机制——训练与测试共享同一组原子规则但组合不同,使测试增益可归因,这是 EvoAgentBench/SkillFlow/SEA-Eval 等事后挖掘关系的方法做不到的。第二,首个面向 GDP 相关业务工作流的自我进化基准,覆盖六大领域,且 V1→V2(120→240 任务)两天内自动扩展,提供对抗数据污染的实用手段。第三,全部用确定性代码评分器(LLM 仅把评分点翻译成代码测试用例)替代 LLM-as-judge,分数可复现、每个错误可追溯到具体规则违反。第四,把 token、轮数、金钱成本作为一等指标,并提供分组明细、雷达图、跨域迁移热力图等诊断视图,能定位增益来源与「进化反而有害」的领域。
实验结果
围绕三个研究问题得到结论。RQ1:fewshot 对全部 4 个智能体都取得最高准确率,任意监督下每个都超过 base,提升 2.59–16.44 pp;进化可替代训练——DeepSeek-V4-Pro fewshot 以约 1/28 摊销成本达到与 GPT-5.5 base 相当的精度(48.79% vs 49.37%),GLM-5.2 fewshot 以约一半成本超 GPT-5.5/Opus-4.8 base 达 10.72/9.46 pp;GPT-5.5 fewshot 提升 15.14 pp 同时测试成本降 20.88%。但全部配置远低于全知 oracle 上限 91.6%。RQ2:fewshot 像 SFT 易过拟合源域,6 个非对角单元 5 个为负(最差 −5.0 pp);reflect 像 RL 过拟合更轻,半数非对角为正(最高 +6.5 pp)。RQ3:固定智能体与 fewshot 只换技能创建器,最朴素的 Naive 创建器竟与各类成品创建器持平甚至更优(GPT-5.5 上 +15.46 pp),说明进化幅度主要由模型智力决定。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 全 GDPevo 基准(240 任务/24 组)测试集,fewshot 监督 | 测试集准确率(每任务 3 次取均值) | GPT-5.5/Codex ≈ 64.5%,Opus-4.8/Claude Code ≈ 67%,GLM-5.2/Claude Code ≈ 60%,DS-V4-Pro-Preview/Claude Code ≈ 48.8% | 各配置 base 准确率 43.6%–50.6% | +2.59 至 +16.44 pp(Opus-4.8 提升最大 +16.44 pp) |
| 成本效率:进化替代模型训练 | 摊销端到端成本 vs 准确率 | DeepSeek-V4-Pro-Preview fewshot 达 48.79% 准确率 | GPT-5.5 base 达 49.37% | 约 1/28 的成本即可达到相当精度;GLM-5.2 fewshot 约一半成本超 GPT-5.5/Opus-4.8 base 达 9.46–10.72 pp |
| GPT-5.5/Codex fewshot 测试时效率 | 测试时金钱成本变化 | fewshot 监督 | base 监督 | 准确率 +15.14 pp,同时测试时成本 −20.88% |
| 进化方法消融(固定 GPT-5.5/Codex + fewshot,仅换技能创建器) | 相对 base 的准确率提升 ∆ | Naive 创建器 +15.46 pp(DS-V4-Pro 上 +5.54 pp) | CC/Codex/DeepAgents/OpenCode 创建器 +11.13 至 +13.03 pp | 最朴素的 Naive 创建器与成品创建器持平甚至更优,过工程化反而有害 |
| 自我进化能力成熟度(对照全知上限) | 最强进化配置准确率 vs oracle 上限 | 最强进化配置 Opus-4.8/Claude Code fewshot ≈ 67.07% | — | 距 91.6% 全知 oracle 上限仍有约 24.5 pp 空间 |
局限与改进
作者承认的局限包括:第一,最强的进化智能体(如 GPT-5.5 fewshot 约 64.5%、Opus-4.8 fewshot 约 67%)仍远低于全知 oracle 上限 91.6%,说明当前自我进化能力远未成熟。第二,跨域迁移实验只局限于 V1 的三个域(CRM、ERP、Finance),且每组各抽 1 个任务组(tg02/tg06/tg10),并丢弃了 self 监督,覆盖面有限。第三,所有实验统一采用基于技能(SKILL.md)的非参数进化方法,未验证参数级持续学习、记忆、提示或 harness 代码改写等其他进化形态。第四,oracle 上限并非人类领域专家实测,而是「把全部隐藏规则连同答案喂给模型」的全信息近似,可能高估或低估真实上限。我的观察:规则刻意排除世界知识使任务偏向人工化,与真实企业里规则可能半公开、需常识推理混合的情形存在分布差异。
独立分析的弱点
独立分析弱点:第一,技能进化形态单一——只评估了 SKILL.md 这一种非参数状态,但自我进化还包括参数持续学习、记忆、提示、harness 代码改写(如 Darwin Gödel Machine),基准对这些形态的覆盖度未实证,建议补充对参数级与代码级进化的实验。第二,跨域迁移范围窄——仅 CRM/ERP/Finance 各 1 组,统计稳健性弱,建议在全部 24 组上系统化做 source×target 矩阵并报告置信区间。第三,oracle 上限用全信息模型近似而非人类专家,难以判断真正天花板,建议补充领域专家实测。第四,规则被刻意设为「世界知识外」,可能让任务偏向人工构造、与企业中「部分公开规则+常识推理」的真实分布脱节,可设计混合难度梯度。第五,校准依赖「fewshot 当前最优」这一前提,但 RQ3 显示创建器差异很小,校准阈值(0.1–0.3 提升)的敏感性值得消融。
未来方向
作者明确指出两个方向:一是当前最强的进化组合仍远低于 91.6% 的 oracle 上限,「如何让智能体更有效地进化」仍是开放问题,需研究更强的进化策略与更好的技能蒸馏;二是基准对进化形态是中立的,未来可评估参数级持续学习、记忆、提示工程、harness 代码改写等多种持久化形态。基于本文成果可延伸的方向包括:把规则混合推广到多智能体协作场景;把自动化流水线扩展到更多真实工作基准;利用迁移热力图诊断「进化有害」现象并设计抗过拟合的技能蒸馏目标;探索 reflect 这类 on-policy 监督为何能产生更通用技能;并把成本/效率纳入进化策略的优化目标,而非仅作报告指标。
复现评估
复现性是该工作的强项。作者公开了流水线、基准(V1+V2 共 240 任务/24 组)与全部评测结果(https://github.com/Prism-Shadow/GDPevo)。评测在 Docker 容器中隔离执行,每个训练/测试尝试有独立工作目录与 harness 主目录,挂载仅限白名单文件,容器间互不可读、不能访问源答案/评分器文件/历史轨迹,保证训练与测试、不同智能体之间严格隔离。评分采用确定性规则评分器,每任务跑 3 次取均值,分数可复现且可追溯到具体规则。不过整个构造流水线依赖 Codex + GPT-5.5 等商用智能体驱动,复现完整构造过程需要相当的 API 成本与算力;具体技能生成开销、各模型版本与 thinking 等级见附录 C,需读者自行查阅。
论文图表