← 返回 2026-07-24

AREX:面向深度研究的递归自我改进智能体 AREX: Towards a Recursively Self-Improving Agent for Deep Research

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang 📅 2026-07-23 👍 147 2026-07-29 18:30
MoE 上下文管理 强化学习 智能体训练 深度研究智能体 递归自我改进

AREX用内外双循环递归地自我改进,靠验证驱动的研究状态刷新深度搜索水平。

前置知识

深度研究智能体 (Deep Research Agent)

一类需要联合满足多个耦合约束、跨多源整合证据并给出可验证答案的搜索增强推理智能体。它不只是检索,而是要发现满足全部约束的候选、整合分布且可能冲突的证据、并验证每个必要条件都有足够支撑。典型任务如BrowseComp、GAIA、HLE等都要求多跳检索、查询改写与证据聚合。AREX在此场景下提出递归自我改进的范式。

理解AREX必须先明确它针对的是"多约束联合满足"而非单纯检索,否则无法理解为什么"验证驱动的研究状态"会成为核心创新。

发现-验证不对称性 (Discovery-Verification Asymmetry)

本文提出的核心洞察:发现一个联合满足所有约束的答案代价高昂,因为要在稀疏且信息稀薄的搜索空间里导航;而评估一个候选答案则常可分解为一组可计算的约束级检查 $C(y)=\{c_1,\dots,c_n\}$。这种不对称意味着验证不仅能判断对错,还能暴露哪些主张有支撑、哪些未解决、证据在哪里冲突。

这是AREX整个框架的动机基石。已有工作只把验证用于排序轨迹或在轨迹内做精修,而AREX的关键洞见是把验证定义为研究轮次之间的"转移",这是读懂后续内外双循环设计的前提。

GRPO 与 PPO 类策略优化

GRPO(Group Relative Policy Optimization)是一种组相对的强化学习方法:对每个prompt采样 $G$ 条轨迹,用组内奖励均值 $\mu_R$ 与标准差 $\sigma_R$ 归一化得到优势 $A^{out}_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,再通过裁剪比率 $\min(\rho\hat A,\text{clip}(\rho,1-\epsilon,1+\epsilon)\hat A)$ 更新策略,并加KL惩罚 $\beta\,\mathbb{E}[D_{KL}]$ 防止偏离参考策略。AREX在其基础上引入turn级/step级的分层归一化与关键步塑形。

AREX的step-aware RL完全建立在GRPO之上。如果不理解token级概率比 $r_{i,j,k}(\theta)=\pi_\theta/\pi_{\theta_{old}}$ 与优势归一化,就无法看懂step级策略比 $\rho_{i,j}$ 与关键步奖励塑形 $A_{i,j}=A^{out}_i+\lambda_{key}\tilde B_{i,j}$ 的设计。

智能体中训练 (Agentic Mid-training)

介于预训练与强化学习之间的多阶段监督训练范式,目标是让模型按顺序习得调用工具、网页导航、证据获取、长链推理、上下文维护与答案综合等异构能力,避免在单一混合分布上直接训练导致能力间相互干扰。AREX采用渐进式多轮能力训练加混合能力巩固两段式配方。

AREX把方法贡献拆成"训练数据构造+多阶段中训练+step-aware RL"三块,理解中训练的渐进顺序(先浏览密集、后推理密集)才能读懂消融中为何"直接混合训练"会让BrowseComp从82.5降到77.5。

MoE (Mixture-of-Experts) 混合专家模型

MoE通过稀疏激活,在总参数量很大时每token只激活一小部分专家,从而以较低激活参数获得强能力。AREX-Base采用Qwen3.5-122B-A10B,即总参122B、激活约10B,AREX-Turbo则是Qwen3.5-4B的dense稠密模型。

读懂Table 1的能力-参数权衡必须先理解"总参122B但只激活10B"的含义——这解释了为何AREX-Base能以10B激活参数在多个基准上超越激活参数大得多的Qwen3.5-397B与Kimi-K2.6等。

研究动机

深度研究之所以困难,不仅因为相关证据难以定位,更因为一个有效答案往往需要同时满足多个耦合约束。现有系统(如OpenAI 2025、Jin et al. 2025、Wu et al. 2025、Gao et al. 2026)普遍采用"把单条搜索轨迹延长"的策略——增加更多推理、更多工具交互或更长的上下文。但这种做法不能保证系统性进展:早期错误会持续存在、已被穷尽的搜索方向会被反复访问、部分有效的候选会被过早接受。具体在BrowseComp这类需要多跳证据聚合的任务上,简单地"搜得更久"并不能识别出哪些约束仍未被解决。另一个被忽视的痛点是长程研究中的上下文管理:交互历史不断累积已验证证据、失败查询、投机假设、重复观察与过时计划,保留全部历史会分散后续推理,而粗暴截断又可能丢掉后续验证所需的证据,固定启发式(按token阈值触发摘要、按规则丢弃工具响应)把上下文管理当成"预算控制"而非"研究状态维护",会移除来源、负证据、未决约束等决策相关信息。

本文的目标是本文的具体目标是构建一族"递归自我改进"(Recursively Self-Improving, RSI)的深度研究智能体AREX,让它在长程任务中不只是搜得更久,而是能(1)递归地把当前答案验证成"部分验证的研究状态",保留已验证证据、隔离未决主张,并据此把剩余不确定性转化为更有针对性的下一轮研究问题;(2)学习一个自主的上下文更新工具 $z^{(k)}_t=f_\theta(h^{(k)}_t)$,把不断增长的交互历史压缩为紧凑且面向当前研究目标的改进状态,而不依赖外部模型做通用摘要;(3)通过多阶段中训练与step-aware强化学习,让模型学会搜索、用工具、构造候选答案、逐约束验证、更新上下文并决定何时继续或终止。最终在4B dense与122B-A10B MoE两个尺度上,在BrowseComp、WideSearch、DeepSearchQA、HLE、GAIA、xbench-2510等基准上达到或超越同量级甚至更大激活参数的模型。

与已有工作不同的是,已有工作对"验证"的利用有两种:要么用于对已完成的多条候选轨迹做排序,要么用于在单条轨迹内部做决策精修(Zeng et al. 2025b、Team et al. 2026)。AREX的独特切入角度是把验证提升为"研究轮次之间的转移算子":用置信度 $s^{(k)}\in[0,100]$ 把临时答案转成部分验证状态,进而判定Accept/Refine/Restart,使验证成为主动控制信号而非搜索后的事后过滤。此外,传统上下文压缩由外部模型做通用摘要,而AREX让模型自己(同一个 $\pi_\theta$)在研究过程中按需调用update_context,按已验证发现、当前候选、未决约束、被拒候选、下一步计划的结构组织状态,使压缩状态与模型自身演化的信念和未来动作对齐。这种"双循环+自主上下文更新"的组合是它与既有深度搜索Agent的本质区别。

核心方法

AREX采用层级式、双层的递归自我改进过程,由内层研究循环(inner research loop)与外层自我改进循环(outer self-improvement loop)组成,骨干分别是AREX-Turbo的Qwen3.5-4B与AREX-Base的Qwen3.5-122B-A10B。给定输入查询 $x$,系统先推导出一个研究目标 $q^{(1)}$。内层循环执行研究动作 $a^{(k)}_{t+1}$(search/visit/update_context/finish等工具),调用外部环境 $T$ 得到观察 $o^{(k)}_{t+1}=T(a^{(k)}_{t+1})$,并把分析 $m$、动作 $a$、观察 $o$ 按时间拼接到轨迹 $h^{(k)}_t$ 上;研究策略 $\pi_\theta$ 根据原始问题、当前目标与有效上下文生成下一步。当内层目标被充分调查后,模型调用finish外化出结构化结果 $r^{(k)}=\langle y^{(k)},\mathcal{E}^{(k)},s^{(k)}\rangle$(临时答案、支撑证据与文档ID、$[0,100]$置信度)。外层循环则依据置信度阈值 $\tau$ 决策:若 $s^{(k)}\ge\tau$ 则Accept;否则评估轨迹是否可恢复 $v^{(k)}\in\{0,1\}$,可恢复则Refine(保留可靠发现 $\mathcal{P}^{(k)}$、识别待查问题 $\mathcal{I}^{(k)}$、生成针对性目标 $q^{(k+1)}$),否则Restart(丢弃整条轨迹从 $x$ 重新初始化)。整个递归受最大轮数上界约束,若无答案达到阈值则返回置信度最高的完成答案。直觉上,这是"先搜证据再由验证引导下一步"而非"一味延长搜索"。

核心创新有三点。第一,把"验证"重新定义为研究轮次之间的转移:置信度 $s^{(k)}$ 是内层循环构建的证据接地信念状态的紧凑摘要,外层用它决定接受、精修还是重启,而非把验证当搜索后的最终过滤器。第二,自主上下文更新(Autonomous Context Updating, ACU):AREX提供显式的update_context工具,模型自己把累积轨迹 $h^{(k)}_t$ 压缩为 $z^{(k)}_t=f_\theta(h^{(k)}_t)$,保留已验证发现与来源、当前候选、未决约束、有效性顾虑、被拒候选与下一步计划,剔除冗余观察、被取代的结论与过时计划;这与通用摘要的本质区别在于它由同一个 $\pi_\theta$ 产生、围绕当前研究目标组织。第三,step-aware训练:识别长程轨迹中少数"决定性关键步"(证据发现、路径否决与重定向、关键上下文更新),用关键步聚焦监督与step-aware GRPO集中优化这些高价值决策点。这三点共同把"搜得更久"升级为"系统性地、被验证驱动地推进"。

方法步骤详情

完整流程可拆为研究、训练两大块。研究侧:在第 $k$ 个递归轮,内层循环把有效上下文 $\bar h^{(k)}_t$ 定义为最近一次update_context的输出 $z^{(k)}_\tau$ 拼上其后步骤(若无更新则等于全轨迹),策略据此生成 $m^{(k)}_{t+1},a^{(k)}_{t+1}=\pi_\theta(x,q^{(k)},\bar h^{(k)}_t)$;模型在解决子问题、淘汰候选、调和冲突证据或改变计划后自主调用update_context,最终调用finish得到 $r^{(k)}$。外层循环按决策规则 $d^{(k)}$ 处理:Refine时用 $h^{(k+1)}_0=\text{Refresh}(\bar h^{(k)}_{T_k},\mathcal{P}^{(k)},\mathcal{I}^{(k)})$ 初始化下一轮,Restart时 $h^{(k+1)}_0=\text{Init}(x)$。训练侧:先做训练数据构造——递归研究任务合成(从网页/文献/知识库抽取潜在答案 $y$ 与约束集 $C(y)=\{c_1,\dots,c_n\}$,经多跳抽象与自动验证保证答案唯一、证据可查、难度足够),再做强教师模型在同环境下的轨迹采集 $\tau_i\sim\pi_{\text{teacher}}(\tau|x)$ 并经有效性、工具可靠性、证据接地、置信度 $s_{\text{conf}}<\tau_{\text{conf}}$ 过滤得到 $\mathcal{D}_{\text{traj}}=\{(x,\tau)|V(x,\tau)=1\}$。然后是渐进式中训练(先浏览密集多轮轨迹,再推理密集数据,再做关键步聚焦的混合能力巩固)与step-aware强化学习(分层步级策略比 $\rho_{i,j}$、步级塑形优势 $A_{i,j}=A^{out}_i+\lambda_{key}\tilde B_{i,j}$)。关键步监督的目标为 $\mathcal{L}_{\text{key}}=-\mathbb{E}_{s_j\sim\mathcal{K}}\frac{1}{|s_j|}\sum\log\pi_\theta(a_{j,k}|c_{j,k})$,只对关键步施损失、前缀上下文被mask但保留以维持正确状态。推理时每个episode最多300个内层轮次、5次外层循环操作。

技术新颖性

技术新颖性体现在四方面。第一,双循环把验证作为转移算子,使"部分验证的研究状态"在轮次间显式保留与重用,区别于把验证仅用于排序或单轨迹内精修的既有工作。第二,update_context是模型自主调用的工具而非外部摘要,按研究目标组织状态——Table 2显示80.3%的BrowseComp案例会调用,且仅在平均25,721/中位25,386 token处触发(远低于128K上限),仅0.01%触顶,说明它是"主动研究操作"而非"被动预算控制"。第三,关键步标注基于高精度规则检测器、锚定在可验证任务结构上(首次引入答案相关证据的工具调用、首次否定错误假设并重定向、关键上下文更新步),且仅在最终答案通过验证的轨迹上保留,避免了自我报告式伪标注。第四,step-aware RL用几何均值做长度归一化的步级策略比 $\rho_{i,j}=\exp(\frac{1}{L_{i,j}}\sum\log r_{i,j,k})$ 与轨迹内-组内分层平均,防止长轨迹因步数多而主导目标,更贴合长程研究的异构结构;关键步塑形 $\tilde B_{i,j}=\mathbb{I}[R_i>0]\cdot B_{i,j}$ 仅在轨迹成功时给奖励,避免奖励伪相关中间行为。

AREX's recursive self-improvement framework
Figure 2: AREX's recursive self-improvement framework
Average step loss after full-trajectory mid-training
Figure 4: Average step loss after full-trajectory mid-training

实验结果

核心发现可分四层。第一层是整体性能(Table 1):AREX-Base以10B激活参数在六个基准上表现强劲——BrowseComp 82.5、GAIA 85.4、xbench-2510 71.0、DeepSearchQA 89.9、WideSearch-en 82.0、HLE(tool) 52.4;其中WideSearch-en取得全部模型(含GPT-5.4 77.5、Kimi-K2.6 80.8)中最佳。它在DeepSearchQA、WideSearch-en、文本HLE上均超过DeepSeek-V4-Pro(88.7/78.0/48.2),在GAIA与WideSearch-en上超过Kimi-K2.6(80.6/80.8),并以10B激活超过同族更大的Qwen3.5-397B(BrowseComp 78.6、GAIA 83.5、DeepSearchQA 82.1、WideSearch 74.0)。4B的AREX-Turbo则在六个基准中的五个上超过Qwen3.5-35B。第二层是推理框架分析(Table 2/3):在固定单轮设置下,ACU把BrowseComp从59.6提升到71.4(+11.8);外层循环单独启用使无ACU配置从59.6→69.8(+10.2)、有ACU配置从71.4→82.5(+11.1),完整系统比两者皆无高22.9分;Figure 3显示正确输出89.3%(无ACU)/95.9%(有ACU)集中在90-100置信度区间,错误输出61.0%/55.2%低于60,验证了基于置信度的决策程序。第三层是训练消融(Table 4/Figure 4):把渐进多轮能力训练换成直接混合训练降到77.5;把关键步聚焦监督换成等预算随机步回放降到74.1(降幅最大);把step-aware RL换成标准GRPO降到79.4。Figure 4的关键步损失分析显示普通步损失0.232,而证据发现0.277、路径否决重定向0.298、关键上下文更新0.300(相对增约19%/28%/29%),证明全轨迹监督后模型仍欠拟合决定性步骤。第四层是上下文更新内容(Table 2):保留未决约束95.5%、下一步计划96.4%、被拒候选81.5%、已验证发现72.1%,触发以搜索策略修订为主(66.9%)、其次是否决候选(13.6%),印证ACU优先保留"还要查什么"。

Comparison results on deep search and agentic reasoning tasks
Table 1: Comparison results on deep search and agentic reasoning tasks
Context-update behavior on BrowseComp
Table 2: Context-update behavior on BrowseComp
Effect of ACU in the inner research loop and the outer self-improvement loop
Table 3: Effect of ACU in the inner research loop and the outer self-improvement loop
Ablation of the AREX training recipe
Table 4: Ablation of the AREX training recipe
Benchmark performance of AREX
Figure 1: Benchmark performance of AREX
查看结构化数据
任务指标本文基线提升
BrowseComp 深度研究 Accuracy AREX-Base 82.5 / AREX-Turbo 70.7 Kimi-K2.6 83.2, GPT-5.4 82.7, Qwen3.5-397B 78.6, Gemini-3.1-Pro 85.9 AREX-Base以10B激活超越Qwen3.5-397B(+3.9),逼近Kimi-K2.6与GPT-5.4等更大模型
WideSearch-en 广度搜索 Item-F1 AREX-Base 82.0 (全场最佳) Kimi-K2.6 80.8, GPT-5.4 77.5, Gemini-3.1-Pro 66.4 AREX-Base取得全部参评模型最高分,比Kimi-K2.6高+1.2、比GPT-5.4高+4.5
DeepSearchQA 深度搜索 F1 AREX-Base 89.9 Gemini-3.1-Pro 93.3, GPT-5.4 88.5, DeepSeek-V4-Pro 88.7, Kimi-K2.6 92.5 AREX-Base超过DeepSeek-V4-Pro(+1.2)与Qwen3.5-397B(+7.8),仅次于Gemini-3.1-Pro与Kimi-K2.6
GAIA 智能体任务 Accuracy AREX-Base 85.4 MiroThinker-H1 88.5, Qwen3.5-397B 83.5, Kimi-K2.6 80.6, Qwen3.5-122B 81.6 AREX-Base超过Qwen3.5-397B(+1.9)与Kimi-K2.6(+4.8)
xbench-DeepSearch-2510 Accuracy AREX-Base 71.0 / AREX-Turbo 57.0 MiroThinker-H1 72.0, MiroThinker-1.7 62.0, DeepSeek-V4-Pro 80.0 AREX-Base超过Qwen3.5-35B(50.3)与MiroThinker-1.7,与MiroThinker-H1仅差1分
HLE (with tools) Accuracy AREX-Base 52.4 (文本子集) GLM-5 50.4, Qwen3.5-397B 48.3, DeepSeek-V4-Pro 48.2, Tongyi-DR 32.9 AREX-Base超过GLM-5(+2.0)与Qwen3.5-397B(+4.1)

局限与改进

作者自己承认若干局限:其一,训练分析是"初步的"(preliminary),关键步塑形"并非旨在解决所有可能中间动作的通用信用分配",只对可识别且经验上重要的子集提供高精度监督。其二,关键步标注是离线构造的、依赖可验证参考答案,且不在评估或推理阶段使用——这意味着方法对"没有标准答案"的开放式研究任务难以直接迁移。其三,推理预算受固定上限约束(每episode最多300内层轮次、5次外层操作),置信度阈值 $\tau$ 是预设的。我自己的观察还有:评测基准集中在事实性检索/合成类任务,未触及需要创造性综合或长文写作的开放式研究;update_context与外层Restart/Refine的决策本质仍依赖模型自身判断,若模型置信度校准偏移(Figure 3显示即便有ACU仍有11.8%错误落在90-100区间),会直接影响接受/重启决策;此外递归双循环+多次update_context会显著增加单题token消耗,论文未报告平均成本/延迟。

独立分析的弱点

第一,关键步检测器是基于规则的、任务相关的,依赖可验证结构(如"首次引入答案相关实体的工具调用"),难以推广到无明确参考答案的开放式或主观任务,改进方向是学习一个端到端的"步效用估计器"在线标注。第二,外层Restart/Refine的决策高度依赖模型自评置信度 $s^{(k)}$,而Figure 3显示即便有ACU仍有约33.0%的错误分布在90-100区间(误判为高置信),且阈值 $\tau$ 是手工预设,改进方向是用校准损失或多评审投票替代单一自评。第三,训练数据全部来自合成的可验证任务,存在"合成分布与真实研究分布偏移"风险,且教师轨迹采集与122B-A10B MoE训练的算力门槛极高,改进方向是用真实查询+在线RL闭环减少对合成数据与教师模型的依赖。第四,成本-性能权衡未被量化:递归多轮+自主ACU虽提升精度,但单题消耗的轮次与token大幅增加,论文未给出与同精度单轮基线的成本对比,改进方向是引入预算感知的提前终止或自适应轮数。第五,外层循环上限固定为5、内层为300,对极难任务可能不足,对简单任务又浪费,可改为动态预算。

未来方向

作者明确提出的方向是"研究更通用、更自主的机制来估计步效用并分配细粒度训练信号",即把离线、基于规则的关键步标注升级为在线、可学习的步级信用分配。基于本文成果可延伸的方向包括:(1)将ACU的双循环框架迁移到多模态(图像/视频/代码)深度研究,让update_context管理跨模态证据与来源;(2)用真实查询驱动在线RL闭环(self-play或对抗验证器)替代教师轨迹采集,缓解对合成可验证任务的依赖并扩展到开放式研究;(3)把置信度校准与Restart/Refine决策联合优化,甚至引入多个独立验证视角做投票式置信度;(4)探索预算感知的递归——让外层循环根据剩余预算与边际置信增益动态决定何时停止,以改善成本-精度权衡;(5)把关键步损失分析与step-aware RL推广到通用长程Agent(编码、数学证明、科学发现),验证其普适性。

复现评估

复现难度总体偏高但部分资源开放。模型方面作者提供了HuggingFace模型集合(BAAI/arex)、项目主页与在线App,AREX-Turbo(4B dense)相对可在单卡/少量卡上跑推理,但AREX-Base为122B-A10B MoE,训练与部署都需大量GPU。骨干依赖Qwen3.5-4B与Qwen3.5-122B-A10B(论文称已发布)。训练数据构造的关键细节——合成任务模板、约束变换 $x=f(y,C')$、教师模型选择、质量过滤阈值 $\tau_{\text{conf}}$——虽给了流程框架但具体超参与模板不全,复现难度大;关键步检测器的规则虽描述了三类(证据发现、路径否决重定向、关键上下文更新),但实现代码与检测精度未完全公开。step-aware RL的损失形式 $\mathcal{L}_{\text{step}}$、分层归一化、$\lambda_{\text{key}}$、KL系数 $\beta$ 等都以公式给出但数值超参未列全。评测协议较清晰(统一search/visit/update_context/finish/python工具、最多300内层轮+5外层操作),便于复现推理部分。综合看,推理与消融结论较易复现,训练侧(尤其122B MoE的完整训练)复现门槛很高。