AREX:面向深度研究的递归自我改进智能体 AREX: Towards a Recursively Self-Improving Agent for Deep Research
AREX用内外双循环递归地自我改进,靠验证驱动的研究状态刷新深度搜索水平。
前置知识
深度研究智能体 (Deep Research Agent)
一类需要联合满足多个耦合约束、跨多源整合证据并给出可验证答案的搜索增强推理智能体。它不只是检索,而是要发现满足全部约束的候选、整合分布且可能冲突的证据、并验证每个必要条件都有足够支撑。典型任务如BrowseComp、GAIA、HLE等都要求多跳检索、查询改写与证据聚合。AREX在此场景下提出递归自我改进的范式。
理解AREX必须先明确它针对的是"多约束联合满足"而非单纯检索,否则无法理解为什么"验证驱动的研究状态"会成为核心创新。
发现-验证不对称性 (Discovery-Verification Asymmetry)
本文提出的核心洞察:发现一个联合满足所有约束的答案代价高昂,因为要在稀疏且信息稀薄的搜索空间里导航;而评估一个候选答案则常可分解为一组可计算的约束级检查 $C(y)=\{c_1,\dots,c_n\}$。这种不对称意味着验证不仅能判断对错,还能暴露哪些主张有支撑、哪些未解决、证据在哪里冲突。
这是AREX整个框架的动机基石。已有工作只把验证用于排序轨迹或在轨迹内做精修,而AREX的关键洞见是把验证定义为研究轮次之间的"转移",这是读懂后续内外双循环设计的前提。
GRPO 与 PPO 类策略优化
GRPO(Group Relative Policy Optimization)是一种组相对的强化学习方法:对每个prompt采样 $G$ 条轨迹,用组内奖励均值 $\mu_R$ 与标准差 $\sigma_R$ 归一化得到优势 $A^{out}_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,再通过裁剪比率 $\min(\rho\hat A,\text{clip}(\rho,1-\epsilon,1+\epsilon)\hat A)$ 更新策略,并加KL惩罚 $\beta\,\mathbb{E}[D_{KL}]$ 防止偏离参考策略。AREX在其基础上引入turn级/step级的分层归一化与关键步塑形。
AREX的step-aware RL完全建立在GRPO之上。如果不理解token级概率比 $r_{i,j,k}(\theta)=\pi_\theta/\pi_{\theta_{old}}$ 与优势归一化,就无法看懂step级策略比 $\rho_{i,j}$ 与关键步奖励塑形 $A_{i,j}=A^{out}_i+\lambda_{key}\tilde B_{i,j}$ 的设计。
智能体中训练 (Agentic Mid-training)
介于预训练与强化学习之间的多阶段监督训练范式,目标是让模型按顺序习得调用工具、网页导航、证据获取、长链推理、上下文维护与答案综合等异构能力,避免在单一混合分布上直接训练导致能力间相互干扰。AREX采用渐进式多轮能力训练加混合能力巩固两段式配方。
AREX把方法贡献拆成"训练数据构造+多阶段中训练+step-aware RL"三块,理解中训练的渐进顺序(先浏览密集、后推理密集)才能读懂消融中为何"直接混合训练"会让BrowseComp从82.5降到77.5。
MoE (Mixture-of-Experts) 混合专家模型
MoE通过稀疏激活,在总参数量很大时每token只激活一小部分专家,从而以较低激活参数获得强能力。AREX-Base采用Qwen3.5-122B-A10B,即总参122B、激活约10B,AREX-Turbo则是Qwen3.5-4B的dense稠密模型。
读懂Table 1的能力-参数权衡必须先理解"总参122B但只激活10B"的含义——这解释了为何AREX-Base能以10B激活参数在多个基准上超越激活参数大得多的Qwen3.5-397B与Kimi-K2.6等。
研究动机
深度研究之所以困难,不仅因为相关证据难以定位,更因为一个有效答案往往需要同时满足多个耦合约束。现有系统(如OpenAI 2025、Jin et al. 2025、Wu et al. 2025、Gao et al. 2026)普遍采用"把单条搜索轨迹延长"的策略——增加更多推理、更多工具交互或更长的上下文。但这种做法不能保证系统性进展:早期错误会持续存在、已被穷尽的搜索方向会被反复访问、部分有效的候选会被过早接受。具体在BrowseComp这类需要多跳证据聚合的任务上,简单地"搜得更久"并不能识别出哪些约束仍未被解决。另一个被忽视的痛点是长程研究中的上下文管理:交互历史不断累积已验证证据、失败查询、投机假设、重复观察与过时计划,保留全部历史会分散后续推理,而粗暴截断又可能丢掉后续验证所需的证据,固定启发式(按token阈值触发摘要、按规则丢弃工具响应)把上下文管理当成"预算控制"而非"研究状态维护",会移除来源、负证据、未决约束等决策相关信息。
本文的目标是本文的具体目标是构建一族"递归自我改进"(Recursively Self-Improving, RSI)的深度研究智能体AREX,让它在长程任务中不只是搜得更久,而是能(1)递归地把当前答案验证成"部分验证的研究状态",保留已验证证据、隔离未决主张,并据此把剩余不确定性转化为更有针对性的下一轮研究问题;(2)学习一个自主的上下文更新工具 $z^{(k)}_t=f_\theta(h^{(k)}_t)$,把不断增长的交互历史压缩为紧凑且面向当前研究目标的改进状态,而不依赖外部模型做通用摘要;(3)通过多阶段中训练与step-aware强化学习,让模型学会搜索、用工具、构造候选答案、逐约束验证、更新上下文并决定何时继续或终止。最终在4B dense与122B-A10B MoE两个尺度上,在BrowseComp、WideSearch、DeepSearchQA、HLE、GAIA、xbench-2510等基准上达到或超越同量级甚至更大激活参数的模型。
与已有工作不同的是,已有工作对"验证"的利用有两种:要么用于对已完成的多条候选轨迹做排序,要么用于在单条轨迹内部做决策精修(Zeng et al. 2025b、Team et al. 2026)。AREX的独特切入角度是把验证提升为"研究轮次之间的转移算子":用置信度 $s^{(k)}\in[0,100]$ 把临时答案转成部分验证状态,进而判定Accept/Refine/Restart,使验证成为主动控制信号而非搜索后的事后过滤。此外,传统上下文压缩由外部模型做通用摘要,而AREX让模型自己(同一个 $\pi_\theta$)在研究过程中按需调用update_context,按已验证发现、当前候选、未决约束、被拒候选、下一步计划的结构组织状态,使压缩状态与模型自身演化的信念和未来动作对齐。这种"双循环+自主上下文更新"的组合是它与既有深度搜索Agent的本质区别。
核心方法
AREX采用层级式、双层的递归自我改进过程,由内层研究循环(inner research loop)与外层自我改进循环(outer self-improvement loop)组成,骨干分别是AREX-Turbo的Qwen3.5-4B与AREX-Base的Qwen3.5-122B-A10B。给定输入查询 $x$,系统先推导出一个研究目标 $q^{(1)}$。内层循环执行研究动作 $a^{(k)}_{t+1}$(search/visit/update_context/finish等工具),调用外部环境 $T$ 得到观察 $o^{(k)}_{t+1}=T(a^{(k)}_{t+1})$,并把分析 $m$、动作 $a$、观察 $o$ 按时间拼接到轨迹 $h^{(k)}_t$ 上;研究策略 $\pi_\theta$ 根据原始问题、当前目标与有效上下文生成下一步。当内层目标被充分调查后,模型调用finish外化出结构化结果 $r^{(k)}=\langle y^{(k)},\mathcal{E}^{(k)},s^{(k)}\rangle$(临时答案、支撑证据与文档ID、$[0,100]$置信度)。外层循环则依据置信度阈值 $\tau$ 决策:若 $s^{(k)}\ge\tau$ 则Accept;否则评估轨迹是否可恢复 $v^{(k)}\in\{0,1\}$,可恢复则Refine(保留可靠发现 $\mathcal{P}^{(k)}$、识别待查问题 $\mathcal{I}^{(k)}$、生成针对性目标 $q^{(k+1)}$),否则Restart(丢弃整条轨迹从 $x$ 重新初始化)。整个递归受最大轮数上界约束,若无答案达到阈值则返回置信度最高的完成答案。直觉上,这是"先搜证据再由验证引导下一步"而非"一味延长搜索"。
核心创新有三点。第一,把"验证"重新定义为研究轮次之间的转移:置信度 $s^{(k)}$ 是内层循环构建的证据接地信念状态的紧凑摘要,外层用它决定接受、精修还是重启,而非把验证当搜索后的最终过滤器。第二,自主上下文更新(Autonomous Context Updating, ACU):AREX提供显式的update_context工具,模型自己把累积轨迹 $h^{(k)}_t$ 压缩为 $z^{(k)}_t=f_\theta(h^{(k)}_t)$,保留已验证发现与来源、当前候选、未决约束、有效性顾虑、被拒候选与下一步计划,剔除冗余观察、被取代的结论与过时计划;这与通用摘要的本质区别在于它由同一个 $\pi_\theta$ 产生、围绕当前研究目标组织。第三,step-aware训练:识别长程轨迹中少数"决定性关键步"(证据发现、路径否决与重定向、关键上下文更新),用关键步聚焦监督与step-aware GRPO集中优化这些高价值决策点。这三点共同把"搜得更久"升级为"系统性地、被验证驱动地推进"。
方法步骤详情
完整流程可拆为研究、训练两大块。研究侧:在第 $k$ 个递归轮,内层循环把有效上下文 $\bar h^{(k)}_t$ 定义为最近一次update_context的输出 $z^{(k)}_\tau$ 拼上其后步骤(若无更新则等于全轨迹),策略据此生成 $m^{(k)}_{t+1},a^{(k)}_{t+1}=\pi_\theta(x,q^{(k)},\bar h^{(k)}_t)$;模型在解决子问题、淘汰候选、调和冲突证据或改变计划后自主调用update_context,最终调用finish得到 $r^{(k)}$。外层循环按决策规则 $d^{(k)}$ 处理:Refine时用 $h^{(k+1)}_0=\text{Refresh}(\bar h^{(k)}_{T_k},\mathcal{P}^{(k)},\mathcal{I}^{(k)})$ 初始化下一轮,Restart时 $h^{(k+1)}_0=\text{Init}(x)$。训练侧:先做训练数据构造——递归研究任务合成(从网页/文献/知识库抽取潜在答案 $y$ 与约束集 $C(y)=\{c_1,\dots,c_n\}$,经多跳抽象与自动验证保证答案唯一、证据可查、难度足够),再做强教师模型在同环境下的轨迹采集 $\tau_i\sim\pi_{\text{teacher}}(\tau|x)$ 并经有效性、工具可靠性、证据接地、置信度 $s_{\text{conf}}<\tau_{\text{conf}}$ 过滤得到 $\mathcal{D}_{\text{traj}}=\{(x,\tau)|V(x,\tau)=1\}$。然后是渐进式中训练(先浏览密集多轮轨迹,再推理密集数据,再做关键步聚焦的混合能力巩固)与step-aware强化学习(分层步级策略比 $\rho_{i,j}$、步级塑形优势 $A_{i,j}=A^{out}_i+\lambda_{key}\tilde B_{i,j}$)。关键步监督的目标为 $\mathcal{L}_{\text{key}}=-\mathbb{E}_{s_j\sim\mathcal{K}}\frac{1}{|s_j|}\sum\log\pi_\theta(a_{j,k}|c_{j,k})$,只对关键步施损失、前缀上下文被mask但保留以维持正确状态。推理时每个episode最多300个内层轮次、5次外层循环操作。
技术新颖性
技术新颖性体现在四方面。第一,双循环把验证作为转移算子,使"部分验证的研究状态"在轮次间显式保留与重用,区别于把验证仅用于排序或单轨迹内精修的既有工作。第二,update_context是模型自主调用的工具而非外部摘要,按研究目标组织状态——Table 2显示80.3%的BrowseComp案例会调用,且仅在平均25,721/中位25,386 token处触发(远低于128K上限),仅0.01%触顶,说明它是"主动研究操作"而非"被动预算控制"。第三,关键步标注基于高精度规则检测器、锚定在可验证任务结构上(首次引入答案相关证据的工具调用、首次否定错误假设并重定向、关键上下文更新步),且仅在最终答案通过验证的轨迹上保留,避免了自我报告式伪标注。第四,step-aware RL用几何均值做长度归一化的步级策略比 $\rho_{i,j}=\exp(\frac{1}{L_{i,j}}\sum\log r_{i,j,k})$ 与轨迹内-组内分层平均,防止长轨迹因步数多而主导目标,更贴合长程研究的异构结构;关键步塑形 $\tilde B_{i,j}=\mathbb{I}[R_i>0]\cdot B_{i,j}$ 仅在轨迹成功时给奖励,避免奖励伪相关中间行为。
实验结果
核心发现可分四层。第一层是整体性能(Table 1):AREX-Base以10B激活参数在六个基准上表现强劲——BrowseComp 82.5、GAIA 85.4、xbench-2510 71.0、DeepSearchQA 89.9、WideSearch-en 82.0、HLE(tool) 52.4;其中WideSearch-en取得全部模型(含GPT-5.4 77.5、Kimi-K2.6 80.8)中最佳。它在DeepSearchQA、WideSearch-en、文本HLE上均超过DeepSeek-V4-Pro(88.7/78.0/48.2),在GAIA与WideSearch-en上超过Kimi-K2.6(80.6/80.8),并以10B激活超过同族更大的Qwen3.5-397B(BrowseComp 78.6、GAIA 83.5、DeepSearchQA 82.1、WideSearch 74.0)。4B的AREX-Turbo则在六个基准中的五个上超过Qwen3.5-35B。第二层是推理框架分析(Table 2/3):在固定单轮设置下,ACU把BrowseComp从59.6提升到71.4(+11.8);外层循环单独启用使无ACU配置从59.6→69.8(+10.2)、有ACU配置从71.4→82.5(+11.1),完整系统比两者皆无高22.9分;Figure 3显示正确输出89.3%(无ACU)/95.9%(有ACU)集中在90-100置信度区间,错误输出61.0%/55.2%低于60,验证了基于置信度的决策程序。第三层是训练消融(Table 4/Figure 4):把渐进多轮能力训练换成直接混合训练降到77.5;把关键步聚焦监督换成等预算随机步回放降到74.1(降幅最大);把step-aware RL换成标准GRPO降到79.4。Figure 4的关键步损失分析显示普通步损失0.232,而证据发现0.277、路径否决重定向0.298、关键上下文更新0.300(相对增约19%/28%/29%),证明全轨迹监督后模型仍欠拟合决定性步骤。第四层是上下文更新内容(Table 2):保留未决约束95.5%、下一步计划96.4%、被拒候选81.5%、已验证发现72.1%,触发以搜索策略修订为主(66.9%)、其次是否决候选(13.6%),印证ACU优先保留"还要查什么"。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| BrowseComp 深度研究 | Accuracy | AREX-Base 82.5 / AREX-Turbo 70.7 | Kimi-K2.6 83.2, GPT-5.4 82.7, Qwen3.5-397B 78.6, Gemini-3.1-Pro 85.9 | AREX-Base以10B激活超越Qwen3.5-397B(+3.9),逼近Kimi-K2.6与GPT-5.4等更大模型 |
| WideSearch-en 广度搜索 | Item-F1 | AREX-Base 82.0 (全场最佳) | Kimi-K2.6 80.8, GPT-5.4 77.5, Gemini-3.1-Pro 66.4 | AREX-Base取得全部参评模型最高分,比Kimi-K2.6高+1.2、比GPT-5.4高+4.5 |
| DeepSearchQA 深度搜索 | F1 | AREX-Base 89.9 | Gemini-3.1-Pro 93.3, GPT-5.4 88.5, DeepSeek-V4-Pro 88.7, Kimi-K2.6 92.5 | AREX-Base超过DeepSeek-V4-Pro(+1.2)与Qwen3.5-397B(+7.8),仅次于Gemini-3.1-Pro与Kimi-K2.6 |
| GAIA 智能体任务 | Accuracy | AREX-Base 85.4 | MiroThinker-H1 88.5, Qwen3.5-397B 83.5, Kimi-K2.6 80.6, Qwen3.5-122B 81.6 | AREX-Base超过Qwen3.5-397B(+1.9)与Kimi-K2.6(+4.8) |
| xbench-DeepSearch-2510 | Accuracy | AREX-Base 71.0 / AREX-Turbo 57.0 | MiroThinker-H1 72.0, MiroThinker-1.7 62.0, DeepSeek-V4-Pro 80.0 | AREX-Base超过Qwen3.5-35B(50.3)与MiroThinker-1.7,与MiroThinker-H1仅差1分 |
| HLE (with tools) | Accuracy | AREX-Base 52.4 (文本子集) | GLM-5 50.4, Qwen3.5-397B 48.3, DeepSeek-V4-Pro 48.2, Tongyi-DR 32.9 | AREX-Base超过GLM-5(+2.0)与Qwen3.5-397B(+4.1) |
局限与改进
作者自己承认若干局限:其一,训练分析是"初步的"(preliminary),关键步塑形"并非旨在解决所有可能中间动作的通用信用分配",只对可识别且经验上重要的子集提供高精度监督。其二,关键步标注是离线构造的、依赖可验证参考答案,且不在评估或推理阶段使用——这意味着方法对"没有标准答案"的开放式研究任务难以直接迁移。其三,推理预算受固定上限约束(每episode最多300内层轮次、5次外层操作),置信度阈值 $\tau$ 是预设的。我自己的观察还有:评测基准集中在事实性检索/合成类任务,未触及需要创造性综合或长文写作的开放式研究;update_context与外层Restart/Refine的决策本质仍依赖模型自身判断,若模型置信度校准偏移(Figure 3显示即便有ACU仍有11.8%错误落在90-100区间),会直接影响接受/重启决策;此外递归双循环+多次update_context会显著增加单题token消耗,论文未报告平均成本/延迟。
独立分析的弱点
第一,关键步检测器是基于规则的、任务相关的,依赖可验证结构(如"首次引入答案相关实体的工具调用"),难以推广到无明确参考答案的开放式或主观任务,改进方向是学习一个端到端的"步效用估计器"在线标注。第二,外层Restart/Refine的决策高度依赖模型自评置信度 $s^{(k)}$,而Figure 3显示即便有ACU仍有约33.0%的错误分布在90-100区间(误判为高置信),且阈值 $\tau$ 是手工预设,改进方向是用校准损失或多评审投票替代单一自评。第三,训练数据全部来自合成的可验证任务,存在"合成分布与真实研究分布偏移"风险,且教师轨迹采集与122B-A10B MoE训练的算力门槛极高,改进方向是用真实查询+在线RL闭环减少对合成数据与教师模型的依赖。第四,成本-性能权衡未被量化:递归多轮+自主ACU虽提升精度,但单题消耗的轮次与token大幅增加,论文未给出与同精度单轮基线的成本对比,改进方向是引入预算感知的提前终止或自适应轮数。第五,外层循环上限固定为5、内层为300,对极难任务可能不足,对简单任务又浪费,可改为动态预算。
未来方向
作者明确提出的方向是"研究更通用、更自主的机制来估计步效用并分配细粒度训练信号",即把离线、基于规则的关键步标注升级为在线、可学习的步级信用分配。基于本文成果可延伸的方向包括:(1)将ACU的双循环框架迁移到多模态(图像/视频/代码)深度研究,让update_context管理跨模态证据与来源;(2)用真实查询驱动在线RL闭环(self-play或对抗验证器)替代教师轨迹采集,缓解对合成可验证任务的依赖并扩展到开放式研究;(3)把置信度校准与Restart/Refine决策联合优化,甚至引入多个独立验证视角做投票式置信度;(4)探索预算感知的递归——让外层循环根据剩余预算与边际置信增益动态决定何时停止,以改善成本-精度权衡;(5)把关键步损失分析与step-aware RL推广到通用长程Agent(编码、数学证明、科学发现),验证其普适性。
复现评估
复现难度总体偏高但部分资源开放。模型方面作者提供了HuggingFace模型集合(BAAI/arex)、项目主页与在线App,AREX-Turbo(4B dense)相对可在单卡/少量卡上跑推理,但AREX-Base为122B-A10B MoE,训练与部署都需大量GPU。骨干依赖Qwen3.5-4B与Qwen3.5-122B-A10B(论文称已发布)。训练数据构造的关键细节——合成任务模板、约束变换 $x=f(y,C')$、教师模型选择、质量过滤阈值 $\tau_{\text{conf}}$——虽给了流程框架但具体超参与模板不全,复现难度大;关键步检测器的规则虽描述了三类(证据发现、路径否决重定向、关键上下文更新),但实现代码与检测精度未完全公开。step-aware RL的损失形式 $\mathcal{L}_{\text{step}}$、分层归一化、$\lambda_{\text{key}}$、KL系数 $\beta$ 等都以公式给出但数值超参未列全。评测协议较清晰(统一search/visit/update_context/finish/python工具、最多300内层轮+5外层操作),便于复现推理部分。综合看,推理与消融结论较易复现,训练侧(尤其122B MoE的完整训练)复现门槛很高。
论文图表
在BrowseComp上对正确/错误最终输出按置信度分箱(<60、60-90、90-100)的归一化分布柱状图。无ACU时正确输出89.3%落在90-100、错误输出61.0%低于60;有ACU时正确输出95.9%落在90-100、错误输出55.2%低于60,但仍有33.0%错误落在90-100(被误判为高置信)。
这张图直接支撑了"基于置信度的决策程序"的有效性,同时也暴露了置信度校准的残余问题(高置信错误),是评估外层循环决策可靠性的核心证据。