← 返回 2026-08-25

LongWoF-Bench:面向可验证长工作流任务的 EvoMap 基因评测基准 LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang 📅 2026-08-24 👍 6 2026-08-30 18:30
LLM智能体 基准评测 经验复用 长工作流

778个机器可验证长工作流任务证明验证器确认的执行经验Gene显著优于Skill

前置知识

机器可验证长工作流任务

论文将其形式化为四元组 $T=(S, E, Y, V)$:$S$ 为公开任务说明,$E$ 为模型可访问的环境与资源,$Y$ 为可接受交付物空间,$V$ 为任务专属机器验证器,仅当 $V(S, E, y)=1$ 才判定成功。难点不在上下文更长或步数更多,而在后续决策依赖先前建立的约束、状态与中间产物,局部合理的失误会累积成端到端失败。

它是全文的评测对象与判定标准:所有实验的严格通过率都由这个验证器给出,理解任务抽象才能明白三条件对比为何公平可控。

Skill(可复用程序性知识)

当前智能体生态中常见的知识抽象,把任务应该怎么做封装为指令、流程、接口约定与推荐实践,执行时挂载给模型。它回答的是如何做,属于静态程序性知识,并不保证这些流程在实际执行中被验证器确认过有效。

Skill 是本文的主对照基线;理解它与 Gene 的本质差异在于经验来源而非表示形式,是读懂核心结论的前提。

EvoMap Gene(执行经验基因)

EvoMap 框架中的结构化经验单元:生产者模型在验证器反馈驱动下迭代执行直到轨迹被确认,再把其中起决定作用的策略、前置检查、边界条件与纠错信息蒸馏成 Gene 存入经验库,供同一或不同消费模型直接复用,无需重放原始轨迹。

Gene 是论文主角,全部实验都在检验验证器确认过的执行经验相比 Skill 的增量价值,以及经验来源对效用的决定作用。

配对显著性检验(bootstrap 与 McNemar)

在同一批任务上比较两种条件时,配对设计可消除任务难度差异:论文用确定性的任务级配对 bootstrap 计算差值置信区间,并用精确 McNemar 检验判断通过/失败翻转是否显著,避免把任务抽样波动误读为方法差异。

核心结论 Gene 提升 8.7-15.5 个百分点都附有置信区间与 p 值,理解这两件统计工具才能正确评估证据强度。

研究动机

大语言模型正被期待完成软件实现、数据处理、环境构建、规则决策与精确计算等端到端工作流。这类任务的成功不取决于单步是否看起来合理,而取决于整条执行链是否同时满足相互依赖的约束——一次接口违约、边界错误或优先级失误,就可能让看似可行的方案在严格端到端验证下作废。更关键的是,成功执行的经验通常在一次运行后就被丢弃,后续模型只能从头重新发现策略与失败模式,反复支付探索成本。现有智能体基准虽已扩展到软件、Web、企业、操作系统与工具使用等端到端环境,近期工作也开始评估可复用 Skill 与程序记忆,但指导来源(guidance provenance)的作用仍不清楚:在公开说明、运行时与验证器完全受控的条件下,经过验证器确认的执行经验是否比静态程序性指导更有价值,缺乏直接证据。

本文的目标是论文的具体目标是构建并利用 LongWoF-Bench——一个含 778 个机器可验证任务的长工作流基准,覆盖代码生成 341、智能体-环境综合 127、数学推理 151、规则遵循 159 四个互补家族——在公开任务说明、运行时、解码配置与私有验证器全部固定的前提下,系统对比 No Context、Skill 与 EvoMap Gene 三种条件对严格通过率的影响。并进一步量化:经验来源的作用(252 个 Opus 验证器演化 Gene 对比 526 个参考蒸馏 Gene)、经验生产者的作用(Opus 与 Gemini 双双通过的 180 个共同任务)、以及成本效率(调用数、solve-time token、每通过任务 token),从而回答验证过的执行经验能否作为可复用的外部资源。

与已有工作不同的是,论文的独特切入是把指导来源本身当作受控实验变量,而不是又提出一个更强的智能体方法。通过同一基准内的双来源设计(Opus-evolved 与 reference-distilled 两类 Gene)与双生产者设计(180 个 Opus/Gemini 双双确认的固定任务集),把紧凑表示与验证过的经验解耦:如果 Gene 的优势仅来自紧凑表示,参考蒸馏 Gene 应当同样有效,实验显示恰恰相反。同时论文强制可见性边界——隐藏测试、金标输出、参考解、验证器逻辑对模型不可见且不引入隐藏需求,确保端到端判定客观可复现;对结论也诚实标注为来源关联证据而非同任务因果消融,这种克制让对照实验更具说服力。

核心方法

直觉是把一次成功的任务执行当作可外部化、可复用的资产,而不是单次运行的副产品。技术路线分两段:经验生产端,用 Evolver 框架(GDIv2)组织生产者模型 Claude Opus 4.8 在拿不到私有验证器信息的前提下尝试任务,失败则把上一版解法连同脱敏后的验证器反馈交给下一轮修订,在有界 rollout 预算内循环,直到获得通过轨迹,再把轨迹中起决定作用的知识蒸馏成结构化 Gene 存入 EvoMap。消费端,模型只拿到公开任务信息加对应 Gene,原始轨迹与验证器反馈均不可见。评测时每个任务在 No Context、Skill、Gene 三条件下各记录一次试验,公开说明、运行时、解码配置与私有验证器完全固定,只有辅助指导不同,指标为所有强制检查都通过的严格通过率。

核心创新是把 Skill 与 Gene 的本质区别从表示形式重构为经验来源:Skill 外部化程序性知识(任务应该如何做),而验证器演化的 Gene 外部化被端到端验证确认过的执行经验(实际怎样做才能通过、哪些边界与优先级容易出错、出错后如何修正)。由此提出 provenance 假设并设计对照:252 个演化任务上 Gene 对七个消费模型全面领先 Skill 8.7-15.5 个百分点,而 526 个参考蒸馏任务上 Gene 反而落后 Skill 3.3-11.3 个百分点,说明紧凑表示本身不足以带来收益,效用与经验是否在验证中存活紧密相关。把静态知识与验证经验区分开并给出受控证据,是本文区别于既有 Skill 与程序记忆评测工作的关键。

方法步骤详情

第一步任务构建:把候选任务打包成标准化任务包(模型可见说明、公共资产、任务专属私有评测器),剔除交付物模糊、接口欠定、执行不稳定或验证不可靠的实例,得到 778 个任务并分入四个家族。第二步经验生产:Opus 按执行-验证-修订循环在有界预算内工作,140 个任务(55.6%)首轮通过,72 个需第二轮、40 个需第三轮,共耗 404 次调用与 1,333,968 个 token,产出 252 个 evolved Gene;未通过的 526 个任务改用参考侧教师信号蒸馏 fallback Gene,另有 1 个 skill-distilled Gene 仅计入全基准报告。第三步评测协议:三条件下各跑一次,输出物化为可执行工件或结构化答案,经程序执行、隐藏检查或归一化精确匹配判定,可见性边界与验证器跨条件不变。第四步分析:主对比、来源反转、生产者对比、分族分析与成本核算。

技术新颖性

技术新颖性有四点:其一,把 778 个异质任务统一到 $T=(S,E,Y,V)$ 抽象与严格端到端验证下,是首个显式区分程序性知识与验证执行经验的长工作流基准;其二,三条件受控设计使指导来源成为唯一变量,并给出明确统计协议(任务级配对 bootstrap 置信区间加精确 McNemar 检验);其三,首次在同一基准内做双来源与双生产者的任务匹配对照,给出来源关联证据并诚实说明解释边界——两个子集任务不同,只能算 provenance-associated 证据而非因果消融;其四,成本核算框架清晰区分多轮发现与一次复用,把失败尝试计入、把一次性蒸馏与审计成本排除,量化了经验摊销收益(token 减少 45.8%),为经验即资产的主张提供了可核对的经济账。

实验结果

主对比(252 个演化任务,Figure 3/Table 4-5):七模型平均严格通过率从 No Context 41.0%、Skill 51.2% 升至 Gene 62.9%;Gene 对全部七个模型占优 8.7-15.5 个百分点,其中 Opus 63.9% 到 79.4%(+15.5,p<0.001),所有配对 bootstrap 置信区间不含零且 McNemar 显著,收益跨模型家族迁移。来源反转(Table 2/6):526 个参考蒸馏任务上 Gene 全面落后 Skill 3.3-11.3 个百分点(如 Opus 19.8% 对 28.2%)。生产者效应(Table 7):180 个共同演化任务上 Opus Gene 对每个消费模型优于 Gemini Gene 4.4-11.7 个百分点。效率(Table 9):同 252 任务 Gene 过 200 题、耗 723,480 token,Skill 过 161 题、耗 803,099 token,多解 39 题且省 9.9%;相对多轮发现(404 次调用、1,333,968 token)一次复用省 45.8%。分族(Figure 6):智能体环境与规则遵循全模型为正,代码生成现 -1.7~-4.9 小回退,数学推理两极:Opus +40.0 而 MiniMax -16.7,弱模型恒 0%。

Evaluation sets and their roles
Table 1: Evaluation sets and their roles
Gene utility under verifier-evolved and reference-distilled provenance
Table 2: Gene utility under verifier-evolved and reference-distilled provenance
Discovery and one-shot Opus-Gene reuse cost by workflow family
Table 3: Discovery and one-shot Opus-Gene reuse cost by workflow family
Strict pass rate on the 252 tasks with an Opus-evolved Gene
Table 4: Strict pass rate on the 252 tasks with an Opus-evolved Gene
Paired Opus-Gene minus Skill effects on the 252-task evolved subset
Table 5: Paired Opus-Gene minus Skill effects on the 252-task evolved subset
Strict pass rate on the 526 tasks with a reference-distilled Opus Gene
Table 6: Strict pass rate on the 526 tasks with a reference-distilled Opus Gene
Complete results on the 180 tasks for which both Opus and Gemini produced verifier-confirmed Gene
Table 7: Complete results on the 180 tasks for which both Opus and Gemini produced verifier-confirmed Gene
Exploration rounds required to discover the 252 verifier-confirmed Opus trajectories
Table 8: Exploration rounds required to discover the 252 verifier-confirmed Opus trajectories
Solve-time cost on the same 252 evolved tasks
Table 9: Solve-time cost on the same 252 evolved tasks
Complete workflow-family breakdown on the 252 tasks with an Opus-evolved Gene
Table 10: Complete workflow-family breakdown on the 252 tasks with an Opus-evolved Gene
Strict task pass rate on the 252 tasks with verifier-evolved Opus Genes
Figure 3: Strict task pass rate on the 252 tasks with verifier-evolved Opus Genes
Gene producer comparison on the common evolved set (n = 180)
Figure 4: Gene producer comparison on the common evolved set (n = 180)
Solve-time token cost of multi-round experience discovery and one-shot Gene reuse on the same 252 tasks
Figure 5: Solve-time token cost of multi-round experience discovery and one-shot Gene reuse on the same 252 tasks
Skill and Gene pass rates by workflow family on the 252-task evolved subset
Figure 6: Skill and Gene pass rates by workflow family on the 252-task evolved subset
查看结构化数据
任务指标本文基线提升
252 个 Opus 演化任务上的严格通过率(七模型平均) strict pass rate EvoMap Gene 62.9% Skill 51.2%(No Context 41.0%) 平均 +11.7 pp;逐模型 +8.7~+15.5 pp,全部 McNemar 显著
526 个参考蒸馏任务上的严格通过率 strict pass rate Gene 全模型落后 Skill 3.3~11.3 pp(如 Opus 19.8% vs 28.2%) Skill(如 Opus 28.2%) 负向结果,证明经验来源决定 Gene 效用
180 个 Opus/Gemini 共同演化任务上的 Gene 生产者对比 strict pass rate Opus Gene(如 Opus 消费 86.1%) Gemini Gene(如 Opus 消费 75.6%) 全消费模型 +4.4~+11.7 pp
Opus 在 252 任务上的单次求解效率 solve-time tokens 与通过数 Gene:723,480 tokens,通过 200/252 Skill:803,099 tokens,通过 161/252 多解 39 题,tokens -9.9%
经验多轮发现与一次复用的成本对比(252 任务) 模型调用数与总 tokens 一次 Gene 复用:252 calls / 723,480 tokens(过 200) 多轮发现:404 calls / 1,333,968 tokens(过 252) 总 tokens -45.8%,分族省 32.3%~55.8%

局限与改进

作者承认的局限:两个来源子集是不同任务——参考蒸馏集恰为 Opus 在演化预算内解不出的更难任务,因此来源结论只是关联性证据而非同任务因果消融;数学推理的瓶颈常在消费模型自身精确多步推理能力,Gene 能传公式与约定却无法代偿(多个模型该族为 0%);效率核算排除了一次性 Gene 蒸馏与审计成本,且一次复用 200/252 的通过率低于发现的 100%,两者并非等成功替换;每条件仅记录一次试验,不确定性只反映任务抽样而非托管 API 的运行方差。我的补充观察:Gene 由验证器反馈循环打磨,存在过拟合验证器特定怪癖、把应试技巧当通用经验编码的风险;778 个任务经机器可验证性筛选,天然偏向可执行与可精确匹配的领域,对开放性长任务覆盖不足;Skill 的构造来源与质量审计细节披露有限,基线公平性难以完全核查。

独立分析的弱点

弱点一:来源结论受任务难度混杂——演化集是 Opus 能解的相对容易任务,蒸馏集是解不出的困难任务,Gene 的反转可能部分由任务难度而非经验质量驱动,Skill 在两集上 51.2% 对约 20% 的落差即是佐证;改进方向是按 No Context 通过率分层匹配两子集,或让同一批任务都经历失败后蒸馏做同任务对照。弱点二:单次试验设计虽有 McNemar 显著性,却无法排除托管模型非确定性与提示敏感性的影响,应每条件多次采样并报告方差。弱点三:Gene 的生命周期成本与时效未量化,任务或验证器更新后经验可能失效,应报告蒸馏审计成本并做验证器扰动下的鲁棒性实验。弱点四:案例研究只呈现两个成功样本,缺少 Gene 误导导致失败时的机制分析,应补充失败归因与 Gene 质量的自动化审计方法。

未来方向

作者提出的方向:解析 Opus 与 Gemini Gene 的质量差异究竟来自探索质量、蒸馏时选择的经验,还是最终的表达方式;把验证执行经验作为可共享外部资源推广到更多工作流类型与生产者模型。基于成果可延伸的研究:把经验库扩展为可检索、可组合的多任务 Gene 集合,研究语义检索与经验冲突消解;考察 Gene 的跨任务泛化——迁移到结构相似但未见过的任务而非同题复用;开展验证器鲁棒性审计,防止经验编码验证器怪癖而非任务本质;把 Gene 与自我改进、强化学习管线结合,作为可跨模型继承的经验回放资产;以及探索团队间经验共享机制,让不同模型互相继承彼此验证过的执行经验,摊薄探索成本。

复现评估

数据集已在 HuggingFace 公开(EvoMapAI/LongWoF-Bench2026),含任务说明与公共资产,但按设计私有验证器、隐藏测试与金标输出不公开,第三方无法原样复现严格判定,需要自建等效验证器子集。跑全量实验需访问七个托管模型的 API(Claude Opus 4.8/Sonnet 4.6、Gemini 3.1 Pro/Flash-Lite、MiniMax M3、Qwen3-Coder-30B、Qwen3.5-397B),其中 397B 级开源模型也需可观算力,成本不低;论文未提及开源评测框架代码与 Gene 实例样例。有利因素是附录数字完整(Table 4-10 全量给出)、成本核算口径明确(计入失败尝试、排除一次性蒸馏审计成本),统计协议可复现。总体评估:获取任务容易,完整复现主表属中高难度,务实路径是先小规模复刻 252 任务子集并自建验证器,再按其配对 bootstrap 加 McNemar 协议核对统计结论。