Apodex 1.1:面向复杂工作的智能体智能扩展 Apodex 1.1: Scaling Agentic Intelligence for Complex Work
用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。
前置知识
ReAct 循环
ReAct(Reasoning + Acting)让模型在“思考→调用工具→观察结果→再思考”的循环中与环境交互,把推理显式锚定在外部观察上,而不是一次性生成完整答案。它是现代智能体系统的最小骨架,论文将其作为评测的“低脚手架”模式:只用最简循环,让分数尽量反映模型本身的推理与工具使用策略。
论文的核心评测设计就是 ReAct 与 Agent Team 两种模式的对比:前者测裸模型的工作策略,后者测训练出的协调行为带来的系统级增益。不理解这一消融逻辑,就看不懂主表中每行两个数字的含义。
任务契约与形式化环境
本文把每个任务形式化为 $E=(W, W_0, q, A, T, \Omega, B, D, V_D)$:工作区状态空间、初始工作区、目标、动作集、状态转移算子、观察接口、资源预算向量、交付契约及其验证器。每步动作按 $W_{t+1}=T(W_t,a_t)$ 更新世界并返回观察 $o_{t+1}=\Omega(W_t,a_t,W_{t+1})$,最终由 $S_D=V_D(W_0,W_H,\tau_H)$ 判定交付是否合格。
这个契约贯穿环境构造、轨迹重放、训练与运行时执行,是读懂第 2、3 节所有机制的骨架;环境扩展被明确定义为“扩展这个契约上的分布”,而非生成更多 prompt。
智能体强化学习与信用分配
强化学习用任务最终成败的奖励更新策略,但长时程智能体轨迹的终局结果几乎不透露中间哪一步该改——有用的中间工作可能先于晚期失败出现,成功的轨迹也可能包含低效决策。这就是信用分配问题,是 agentic RL 区别于普通 RL 的核心难点。
本文提出的 PIVOT-RL 正是针对该问题:回溯定位关键决策点(pivot),只在那里做局部化优化。不理解信用分配的困难,就无法理解其“保留前缀+短提示局部续写”设计的动机。
奖励破解与验证器设计
当任务、测试和参考解可能共享同一错误时,策略会学会“拿到奖励但不真正完成任务”。防御手段包括沙箱内执行测试、fail-to-pass 测试(基态必须失败、参考改动后必须通过)、独立于生成路径的重推导、把打分器与求解器隔离,以及用“盲探针”主动攻击验证器。
论文反复强调“验证边界”:合成任务先做验证器硬化再扰动、失败攻击才算验证器缺陷、评分与求解器隔离。这是环境扩展可信的前提,也是理解 Table 1 各环境族保障边界的关键。
测试时扩展
在推理阶段投入更多计算(并行采样、更长思考、更多智能体)以换取更好结果,如自一致性投票、多智能体辩论。已知结论是“更多算力”并不均匀有益:对已解决的子问题堆算力是浪费,只有组织得当的额外计算才转化为质量。
Agent Team 的自适应 Max Team Effort 与“协调即扩展面”的主张都建立在此概念上:扩展变量不是智能体数量或采样数,而是随目标演化可被协调的有用工作量。
多智能体编排
把任务分解给多个各有分工的代理并管理其通信与生命周期,代表工作有 AutoGen(可编程对话)、MetaGPT/ChatDev(角色化软件开发组织)、多智能体辩论等。已知风险是智能体数量增加并不必然带来收益,协作只在任务可分解、信息可可靠整合时有用。
Agent Team 与这些框架的本质区别——显式任务板、分阶段结果返回、异步用户干预、不对称验证——需要在与传统编排方式的对照中才能理解。
研究动机
通用大模型在知识、推理、数学和编程上进步很快,但把“能说出正确答案”转化为“可靠完成工作”仍是明显瓶颈:真实任务要求在长时程内查找并解读证据、操作异构文件、执行并调试代码、在观察改变问题设定时修订计划、在不丢弃有效进展的前提下从失败动作中恢复,最终交付他人可检验的工件。此前的 ReAct、Toolformer 与交互式智能体评测(WebArena、OSWorld 等)已经暴露了答案质量与可靠行动之间的鸿沟;传统评测把 prompt 映射到 answer,只观察工作能力向量(正确性、工件完整性、溯源保真、恢复、干预响应、时间与算力)的一个投影。多智能体框架(AutoGen、MetaGPT、辩论)虽展示了角色分工的收益,但协作通常是推理时的包装器而非可训练的策略行为,且“更多智能体”并不总是有益。
本文的目标是本文把目标操作化为“工作能力”:理解目标、通过工具与有状态环境行动、在观察改变问题时修订计划、从失败中恢复、并满足可检验的交付契约,其单位是“完成的工作”而非孤立回答。具体包括:(1) 定义统一任务契约 $E=(W, W_0, q, A, T, \Omega, B, D, V_D)$,使环境交互、干预与交付判定在同一形式化下可构造、可重放、可验证;(2) 沿两个互补维度扩展该能力——环境扩展(提升文件/搜索/代码世界的多样性、保真度与可验证性)与智能体协作扩展(训练分解、委派、异步整合与重规划);(3) 用统一 SFT 与智能体 RL 把两类轨迹转化为单一策略;(4) 构建公共执行契约与 AgentOS 持久运行时支撑训练和长时程执行,向长期目标 Heavy-Duty Solver 迈进,并在专业工作、金融、科研、数学、编程、搜索上给出系统验证与 35B 小模型的效率结果。
与已有工作不同的是,独特切入角度有三。其一,把“可执行环境”本身当作与参数、数据、推理算力并列的扩展面:不是生成更多 prompt 或挂更多工具,而是扩展任务契约 $(W_0,q)$、$A$、$(T,\Omega)$、$B$、$(D,V_D)$ 上可执行轨迹的分布,使动作、观察、文件变更、恢复决策与工件都成为训练分布的一部分。其二,把“协作”也当作扩展面:Agentic Coordination Scaling 关注的不是智能体数量或并行采样数,而是随目标演化可协调的有用工作量——分解、委派、分阶段回收、共享状态修订与显式终止都被训练进模型策略,再由 Agent Team 在运行时实现。其三,用同一个执行契约(harness + AgentOS)同时服务轨迹采集、重放、训练与运行时执行,避免两个维度各自演化在不兼容接口之后,让环境交互与多智能体协调处于同一模型-系统栈内。
核心方法
直觉:智能体智能的单位应是“完成的工作”,而长时程工作的瓶颈一半在“世界不够多”(环境覆盖与验证不足),一半在“组织不够好”(不会分解、委派、整合与重规划)。技术路线分四层。(1) 环境扩展:构造文件、搜索、代码三类可执行世界,统一定义为任务契约 $E=(W, W_0, q, A, T, \Omega, B, D, V_D)$,配独立验证器、不可变 world manifest 与可重放沙箱。(2) 协作扩展:Agent Team 由主代理将分解写入显式任务板,按需生成子代理,支持异步用户干预、不对称验证、自适应 Max Team Effort 与证据接地的两阶段合成。(3) AgentOS 运行时:把工作区实例化为 $W_t=(F_t,Q_t,C_t,I_t,G_t,K_t)$(文件、检索证据、可执行状态、工件索引、依赖图、控制状态),用 /inputs、/workspace、/outputs 三命名空间与单发布者租约控制交付。(4) 训练:统一 SFT(领域变体 model soup 合并)冷启动,PIVOT-RL 在回溯定位的关键决策点做局部化优化并以异步方式吞吐;观察到的失败经 Task Pipeline 反哺下一轮环境构造,形成受控能力开发闭环。
核心创新是把两个此前被视为“系统包装”的东西提升为可训练、可扩展的一等公民。第一,环境扩展:可执行环境决定模型能观察什么状态、能采取什么动作、会遇到哪些失败、完成如何被验证;文件世界采用职业条件化注册表(33 个领域、318 个职业、1208 个交付簇),代码世界结合真实 PR 收割与合成扩展,并坚持“验证器硬化先于任务扰动”以防奖励破解。第二,协作扩展:与 AutoGen/MetaGPT 的固定对话图或多数投票不同,Agent Team 的本质是结果、决策与用户反馈在活跃任务中的持续流动——子代理结果一可用即分阶段返回,主代理整合进共享任务板、修订优先级、通知或终止其他分支。第三,不对称验证:验证代理收到的不是完整问题而是“具体主张+支持证据+适用约束”,验证任务天然比生成窄,反馈直接指明争议主张、反证与所需修复,避免验证器变成第二个上下文污染源。第四,显式任务板既是外部记忆也是运行时最终交付的门:正常答案要求所有活跃项 resolved/cancelled,规划模式还要求至少一条委派分支与独立验证器确实运行过。
方法步骤详情
步骤一,环境构造。文件世界从底层业务状态、权威关系、推导逻辑与交付要求出发,反向投影成工作区(“正向构造便宜、逆向求解昂贵”:生成器用隐状态或参考程序廉价构造并求解世界,智能体只见渲染后的工作区并须在约束下恢复路径);搜索世界把金标准定义为相关源集合、主张-证据对齐与显式不确定性;代码世界用共享基础镜像加任务级仓库状态组装,收割世界的 fail-to-pass 测试必须在基态失败、参考改动后通过,pass-to-pass 测试须两态皆过。步骤二,验证与重放:每次 rollout 获得不可变 world manifest 与新鲜可变沙箱,sticky routing 保持会话在单一 worker;重放记录含种子、生成器版本、工具版本、动作-观察序列、文件增量、验证器版本与终止原因,只有初始状态可重建、执行隔离、验证器可重放的轨迹才保留为训练信号。步骤三,Agent Team 运行时:主代理先写任务板(每项含有界目标、依赖、所有者、分辨率状态),派发子代理,接收分阶段返回;用户干预经消息队列准入——保持 $(q,D)$ 不变的更新走看板失效传播,实质改变目标则开新任务契约并携带仍有效的状态;对承重结论派发窄化验证;最后经证据图构建与写作代理两阶段合成产出交付物。步骤四,AgentOS 保障:按推理端报告的 token 用量触发分层压缩(先逐出旧工具观察体,不足再 LLM 摘要),软/硬双预算加截止前钳制与有界的无工具报告恢复,单发布者租约、精确 manifest 与基线对账控制 /outputs 交付。步骤五,训练:SFT 混合覆盖推理、工具、搜索、文件、代码、数学、专业交付与协调并做 model soup;PIVOT-RL 用回溯分析定位 pivot,保留有用前缀并构造带短提示的局部续写任务(提示只给方向、永非预测目标、推理时移除;有状态任务同时恢复环境状态),与无提示全任务混合,异步进入优化。
技术新颖性
技术新颖性分析:(1) PIVOT-RL 把长轨迹的片段级信用分配转化为“保留有用前缀 + 只在关键决策点局部续写”的定向优化,区别于 Search-R1/RAGEN 等对整条轨迹统一计算回报的做法;短提示永不作为预测目标且推理时不可见,兼得样本效率与端到端自主求解,配异步优化适配长任务的不规则 rollout 流。(2) 不对称验证把 Chain-of-Verification 的思想搬进活体智能体团队:不对称在任务而非模型规模,产出可执行的修复信号而非第二链错误。(3) 任务板从可视化升级为持久控制面与最终化门:规划模式下 finish_planning 前禁写文件与派发,协调器拥有语义字段而运行时拥有执行状态,二者分离防止看板更新覆盖在跑任务。(4) 交付控制用单发布者租约、精确 manifest、终局基线对账与 /outputs/scratch 共享配额区,把“生产工件”与“声明交付”分离,空文件或旧轮次同名文件无法满足交付契约。(5) 难度定标用获取压力坐标 $\rho_{acq}(E)=\frac{N_{cand}(E)+N_{hop}(E)}{B_{tool}(E)}$(候选数+关键证据跳数除以工具预算)而非文件数量,避免“更多 token 但权威路径显然”的伪难度。
实验结果
结果分三层。其一,专业工作与金融:GDPVal 胜率 Agent Team 78.8、ReAct 69.5(对比表中 Claude Opus 5 内部复现为 89.4);APEX-Agents 上 Agent Team 38.5、ReAct 34.4,较 Apodex 1.0 的 16.5 翻倍以上;FrontierFinance 上 Agent Team 54.3、ReAct 48.7(1.0 为 40.3),为对比表中最高,5.6 分的协调增益说明金融研究受益于证据收集、定量分析与验证的跨工作流协调;YC-Bench 平均最终净值 ReAct 达约 $1,038,255(1.0 仅 $47,966)。其二,科研与通用推理:FrontierScience-Research 63.3%(Agent Team)/ 55.0%(ReAct),远超 1.0 的 28.3%,为其对比表最高;BioMysteryBench Human-difficult 17 题上 ReAct 4/17=23.5%、Agent Team 6/17=35.3%(Claude Opus 5 报 49.4%);HLE 56.1 / 53.2(Opus 5 64.7);DeepSearchQA F1 92.4 / 88.2。数学出现代际跃升:IMO 2025 从 1.0 Agent Team 的 12.5 升至 36.5(超过 35 分金牌参考线),IMO 2026 达 30.5、USAMO 2026 达 26.5(分别超 29 与 25 的参考线);IMO-ProofBench Basic 96.7%、Advanced 63.3%。编程仍落后头部:Terminal-Bench 2.1 得 70.8(Gemini 3.6 Flash 91.9)、SWE-bench Verified 77.7(Claude Opus 5 92.2)。内部基准上 FrontierSearchBench 平均 69.1(AT)对 57.0(ReAct),87.8% 任务正分、零分率仅 9.8%,为对比最佳;FrontierResearchBench 端到端科研交付通过率仅 12.4%,落后 GPT-5.6-Sol+Codex 的 20.6%。其三,35B mini 证明两条扩展轴在小模型同样生效:FrontierFinance 从 1.0 的 33.2 → ReAct 40.0 → Agent Team 50.2(+10.2),FrontierScience 25.0 → 45.0 → 51.7(+6.7),APEX-Agents 15.4 → 24.2 → 27.7(+3.5)。HDS6 过程评估显示最大单项增量为 Initial Decomposition +1.3 与 Final Verification +0.8,分别对应 harness 支持的工作组织与更强的验证行为。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| GDPVal(专业工作交付,44 职业 9 行业) | win rate | 78.8(Agent Team)/ 69.5(ReAct) | Claude Opus 5 内部复现 89.4;次优 Kimi K3 (max) 80.0 | 较 Apodex 1.0 的 59.3 提升 19.5 分,仍落后 Claude Opus 5 |
| APEX-Agents(480 个长时程跨应用专业任务) | 任务通过率 | 38.5(Agent Team)/ 34.4(ReAct) | Claude Opus 5 42.3;Kimi K3 (max) 41.0 | 较 Apodex 1.0 的 16.5 提升逾一倍,Agent Team 再加 4.1 分 |
| FrontierFinance(220 查询 / 11543 条专家 rubric) | rubric qualification rate(宏平均) | 54.3(Agent Team)/ 48.7(ReAct) | 次优 Claude Fable 5 49.2;Kimi K3 (max) 48.8 | 为对比表最高,领先次优 5.1 分;较 Apodex 1.0 的 40.3 提升 14 分 |
| FrontierScience-Research(60 道研究级任务) | rubric ≥7/10 通过率 | 63.3%(Agent Team)/ 55.0%(ReAct) | 次优 DeepSeek V4 Flash 0731 55.0% | 为对比表最高;较 Apodex 1.0 的 28.3% 提升 35 分 |
| BioMysteryBench(Human-difficult 17 题) | 任务通过率 | 35.3%(6/17,Agent Team) | Claude Opus 5 49.4%(23.5% 为 ReAct) | Agent Team 较 ReAct 提升 11.8 个百分点,但仍落后 Opus 5 |
| IMO 2025(MathArena 协议) | 分数(参考线 35 = 金牌线) | 36.5(Agent Team) | Apodex 1.0 Agent Team 12.5 | +24.0,代际跃升并超过金牌参考线 |
| SWE-bench Verified | 解决率 % | 77.7 | Claude Opus 5 92.2;Kimi K3 80.8 | 落后最强闭源 14.5 分 |
| Terminal-Bench 2.1 | 分数 | 70.8 | Gemini 3.6 Flash 91.9;Kimi K3 88.3 | 落后最强系统 21.1 分 |
| FrontierSearchBench(41 个可验证深度搜索任务,内部) | 归一化平均分(100 分制,可为负) | 69.1(Agent Team;正分 87.8%、零分 9.8%、负分 2.4%) | GPT-5.6-Sol 67.4;Claude Opus 5 64.4 | 为对比最佳;零分率约为 ReAct(19.5%)的一半 |
| FrontierResearchBench(97 个端到端科研工作流,内部) | Pass Rate % | 12.4(Agent Team,FrontierAgent harness);10.3(Claude Code) | 最佳 GPT-5.6-Sol + Codex 20.6;Grok-4.6 + Claude Code 20.6 | 仍落后最强系统 8.2 分,端到端科研交付对所有系统都困难 |
| FrontierFinance(35B mini 模型规模效率) | rubric qualification rate | 50.2(Agent Team) | Apodex 1.0 mini ReAct 33.2;Kimi K2.6 32.3 | ReAct 先升至 40.0,协调再加 10.2 分,领先所选开放权重对比 |
| HLE / DeepSearchQA(通用推理与深度搜索) | 准确率 / F1 | 56.1 / 92.4(Agent Team) | Claude Opus 5 64.7 / 95.0;Kimi K3 (max) 56.0 / 95.0 | 处于第一梯队性能带但未登顶 |
局限与改进
作者承认的局限:FrontierResearchBench 端到端科研交付通过率仅 12.4%,明显落后最强前沿的 20.6%,可靠完成完整科学工作流并交付全部工件对所有被测系统都困难;BioMysteryBench(35.3%)仍低于 Claude Opus 5 的 49.4%;Terminal-Bench 2.1 与 SWE-bench Verified 分别落后头部 21.1 和 14.5 分;HDS6 只能定位模型、环境、协调与 harness 合并变化在过程中的可见位置,无法隔离单一组件的因果贡献;Deep Discover 面板中 v1.0 为 8 次运行聚合而 v1.1 为单次运行,不构成严格匹配的消融;因多数闭源系统参数量不公开,mini 对比只能以“性能带”表述;YC-Bench 未报告单独的 Agent Team 结果;AgentOS 协调平面是 run-scoped 的,任务板与 Agent Bus 存于 worker 进程,不做协调状态与文件系统的联合原子检查点,进程重启恢复与历史回滚超出当前契约;发布护栏是工具层强制而非系统调用级监控。我自己的观察:GDPVal、APEX-Agents 与部分 FrontierFinance 外部基线为作者内部复现,可能存在 harness 差异导致的偏差;三个内部基准(FrontierSearchBench、FrontierResearchBench、HDS6)由同一团队构造、定标与评分,任务分布天然贴近自家系统的设计选择;HDS6 评审链依赖 GPT-5.5、GPT-5.6-Sol、Claude Sonnet 5、Claude Opus 5 等外部商业模型,引入成本与评审偏差;训练侧的数据配比、算力规模、模型架构细节披露极少。
独立分析的弱点
(1) 自建基准闭环的自我强化风险:FrontierSearchBench、FrontierResearchBench 与 HDS6 由同一团队构造、定标、评分并用于驱动 Task Pipeline,“失败归因→构造新任务→训练”的循环容易过拟合内部分布。改进方向:基准交第三方托管与盲评,或开放任务提交接口引入外部任务分布。(2) 端到端交付能力短板明显:FrontierResearchBench 12.4% 的通过率意味着近九成任务无法完整交付,瓶颈可能不在单点能力而在跨工件一致性与长时程规划;改进方向是把跨工件一致性检查从终局 Grader 前移为运行中的不变量约束。(3) 评审链依赖外部商业模型(GPT-5.5、GPT-5.6-Sol、Claude 系列),成本高且评分标准不可控;可训练专用的过程评审模型并与人类评审校准。(4) 协调平面持久性不足:任务板与 Agent Bus 不做与工作区文件系统的联合检查点,异常终止后只能保留工作区现状,恢复语义弱;可实现协调状态的 WAL 日志与联合版本化。(5) 难度定标不完备:$\rho_{acq}(E)$ 只覆盖信息获取型任务,代码世界的定标坐标(依赖深度、测试可观察性、失败到验证信号的距离)仍是定性描述,缺乏统一可计算的难度度量。(6) 干预语义依赖训练分布:论文列举了约 12 类干预消息(澄清、改优先级、撤稿、暂停等),分布外的干预类型行为没有定义,可能出现误失效传播。
未来方向
作者提出的方向:向 Heavy-Duty Solver 演进,承接更具雄心、长运行、可验证的工作;继续扩展可执行环境的覆盖与保真度;加强更长时程上的学习协调;改进层级轨迹上的训练与信用分配;打通真实失败、任务构造、训练与评测的闭环;协调状态、消息历史与工作区的联合版本化被明确点名为 AgentOS 机制的“自然延伸”。基于成果可延伸的方向:(1) 把不对称验证推广为可学习的验证策略——动态决定哪些主张值得窄化攻击、用哪类独立证据源三角验证,形成生成与验证的博弈式共同训练;(2) PIVOT-RL 的 pivot 定位目前靠回溯分析,可与过程奖励模型结合实现训练中自动定位,去掉人工回溯环节;(3) 环境扩展的“职业条件化注册表”(33 领域/318 职业/1208 交付簇)可开放为社区共建生态,类似 SWE-bench 的社区任务贡献路线;(4) mini 在 35B 上的成功提示可继续下探模型规模,系统研究智能体工作能力的最低可行参数规模及其随协调算力的换算关系;(5) FrontierResearchBench 的跨工件一致性 Grader 思想可反哺为训练奖励,专门奖励可执行代码、结构化数据、图表与报告之间的相互一致性。
复现评估
开源情况较好但训练细节缺失。模型权重已在 HuggingFace 公开(apodex/apodex-11 集合,含 35B mini),代码库在 GitHub(ApodexAI/FrontierAgent),并提供 API 平台。评测侧可复现性中上:主表基本使用公开基准(GDPVal、APEX-Agents、FrontierFinance、FrontierScience、BioMysteryBench、HLE、DeepSearchQA、MathArena、SWE-bench Verified、Terminal-Bench 2.1),并逐一注明外部基线哪些是官方报告值、哪些是作者内部复现。不可复现的部分:三个内部基准(FrontierSearchBench 41 任务、FrontierResearchBench 97 任务、HDS6)的完整任务集与 Grader 未随论文发布;训练侧的 SFT 数据配比、RL 算力规模、PIVOT-RL 回溯分析所用的模型、397B/35B 的架构与训练基础设施细节均未披露。复现训练需要大规模可执行环境集群、沙箱农场与异步 RL 基础设施,只有头部实验室可负担;复现评测则相对容易——权重加公开 harness 即可运行 ReAct 模式,Agent Team 模式依赖其运行时实现。总体判断:推理与权重层面可复现性中上,训练与内部评测层面可复现性低。
论文图表