ABSeeker:基于答案回溯信用分配训练长程搜索智能体 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
用答案反推出的线索给轨迹每一步打分,实现细粒度的SFT与RL训练。
前置知识
ReAct 搜索智能体 (Search Agent)
ReAct 范式让大模型在「思考—工具调用—观察」之间交替循环,通过动态发起检索、浏览网页、整合证据来回答知识密集型问题。长程搜索智能体(如 OpenAI Deep Research、Tongyi DeepResearch)把这个循环扩展到几十甚至上百步的「检索—浏览—整合」流程,以定位分散在多源中的细粒度信息。
本文的全部目标都是训练更好的长程搜索智能体,理解「一条轨迹由 $T$ 个连续 step 组成、每个 step 含推理+工具调用+环境响应」这一结构,才能看懂为什么要给每个 step 单独打分。
信用分配问题 (Credit Assignment)
在多步决策任务中,最终成功或失败是由一长串动作共同导致的,但监督信号通常只在轨迹末端给出。信用分配研究「如何把这个稀疏的终局信号归因到具体的中间动作」,判断哪一步真正推动了进展、哪一步拖了后腿。强化学习中的稀疏奖励、折扣回报、优势函数估计都属于这一范畴。
信用分配是本文的核心痛点:现有方法把成功轨迹的所有 step 都当正样本、失败轨迹的全部 step 都当负样本,这正是 ABC 要解决的「细粒度信用分配」难题。
GRPO (Group Relative Policy Optimization)
GRPO 是 DeepSeek 提出的强化学习算法,它对同一个 prompt 采样一组(group)rollout,用组内回报的归一化值作为优势(advantage),省去了单独的 critic 网络,再配合带裁剪的 PPO 式目标更新策略。标准 GRPO 把整条轨迹的二元对错作为奖励,得到的是轨迹级优势。
本文的 ABC-GRPO 直接建立在 GRPO 之上,唯一的改动是把轨迹级优势替换成基于线索的步级优势 $A_{i,t}=\sum_{k=t}^{T_i}\gamma^{k-t}\bar{R}_{i,k}$,理解 GRPO 的组采样与裁剪目标才能看懂这个改动的精妙之处。
轨迹级 vs 步级监督 (Trajectory/Step-level Supervision)
轨迹级监督用一个标量奖励 $r_{ans}(\tau)=\mathbb{1}[a=a^*]$ 衡量整条轨迹,正确给 1、错误给 0。这种信号稀疏且粗糙:一条失败的轨迹可能含若干发现关键证据的好步骤,而一条成功的轨迹也可能混入丢弃证据的错误步骤,但轨迹级信号无法区分它们。步级监督则为每个 step 单独给出奖励 $r_t$。
本文的关键数据(成功轨迹含约 4% 低质量步骤、失败轨迹含约 10% 高质量步骤)正是用来论证「轨迹级监督会同时强化错误动作、惩罚有用动作」,从而引出步级监督的必要性。
BrowseComp 基准与上下文管理
BrowseComp 是 OpenAI 推出的英文长程浏览基准,用多约束、唯一可验证答案的难题来考验深度检索能力;BrowseComp-ZH 是其中文版。由于这类任务 step 多达 200 步,常配合「上下文管理」——把最大上下文设为 256K token,用 discard-all 策略丢弃旧上下文最多 5 轮,以缓解上下文爆炸。
ABSeeker 的核心成绩(BrowseComp 37.3%→55.3%、BrowseComp-ZH 39.1%→52.9%)正是在这两个基准上汇报的,加 * 与不加 * 的差异就来自是否开启上下文管理。
研究动机
长程搜索智能体需要在一条轨迹中执行几十到上百个连续 step 来完成「检索—验证—整合」,但现有的训练方法在 SFT 和 RL 两个阶段都对一条轨迹内的所有 step 一视同仁。论文指出这种一刀切的处理存在两类典型的信用分配失败:其一,一条最终答错的轨迹里,可能藏着若干正确发现证据、合理验证候选的有用 step,但轨迹级奖励 $r_{ans}(\tau)=0$ 对这些好动作毫无正反馈;其二,一条最终答对的轨迹里,也可能混入错误结论或丢弃关键证据的劣质 step,但奖励 $=1$ 并没有区分它们与真正有效的 step。作者用 8.5K 轨迹的统计佐证了这一点——成功轨迹里仍有约 4% 的步骤奖励低于 1.0,而失败轨迹里竟有近 10% 的步骤奖励高于 1.0。也就是说,统一对待会同时强化成功轨迹中的错误行为、惩罚失败轨迹中的有用探索,限制了智能体对关键搜索/推理行为的针对性优化。
本文的目标是本文的目标是为长程搜索智能体设计一套细粒度、稳定、可靠的步级信用分配框架,把稀疏的轨迹级二元结局(对/错)转化为稠密的步级监督信号 $r_t$。具体而言,作者希望这个信号能独立于轨迹最终成败地评价每一个 step:既奖励失败轨迹中发现或验证了有用线索的好动作,又惩罚成功轨迹中错误丢弃线索或提交错误结论的坏动作。基于这种步级信号,作者要把它无缝接入两类主流训练范式——用于 SFT 的损失重加权(ABC-SFT)与用于 GRPO 的步级奖励(ABC-GRPO),从而训练出一个 4B 规模却能在 BrowseComp、xbench、GAIA 上匹敌 30B 量级智能体的搜索体 ABSeeker。
与已有工作不同的是,已有的细粒度信用方法各有短板,本文的独特切入点在于利用搜索任务「一旦拿到标准答案就可回溯」这一结构性优势。IGPO 依据模型自身对答案的似然估计给步级奖励,会随策略更新而漂移;CSO 靠试错验证识别关键步骤,但只给被验证的少数决策赋信用,对其余 step 没有直接监督;SAPO、MindDR 用实体与答案的图距离或覆盖率打分,但实体级信号无法直接判断某次搜索/推理决策是否有效。本文本质上的不同是:先从已验证答案反推出一条「证据链」(一组 clue),再让每一步对照这条固定证据链来评分,从而把依赖模型自身估计、覆盖不全、或停留在实体粒级的信号,升级为独立于模型、稠密且直接评价每步决策正确性的可靠监督。
核心方法
ABC 框架的直觉是:在搜索任务里,一旦拿到已验证答案 $a^*$,整个任务就「天然可回溯」——从答案出发可以反推出应当被发现的实体、事实、关系与约束。于是整套训练流水线分两个核心阶段展开。第一阶段「答案回溯线索恢复」让一个 LLM 以活跃 ReAct 循环的方式,从答案反向追溯证据链,必要时主动发起网页搜索、访问页面,把每条 clue 锚定在真实网页内容上,最终得到线索集合 $C=\{c_1,\dots,c_K\}$。第二阶段「线索锚定的步级评分」把采集到的每条轨迹(含成功与失败)逐步喂给评分模型,连同原始 query 与线索集 $C$,对每个 step 输出奖励 $r_t$ 与简短理由。最后这些稠密的步级奖励分别驱动 ABC-SFT(按 $w(r_t)=\sigma(\alpha(r_t-\beta))$ 重加权 SFT 损失)与 ABC-GRPO(用步级优势 $A_{i,t}=\sum_{k=t}^{T_i}\gamma^{k-t}\bar{R}_{i,k}$ 替换轨迹级优势)。整个流程从 8.5K 条轨迹开始,最终训练出 ABSeeker-4B。
核心创新点在于「用答案反推的固定证据链作为锚点来独立评判每一步」,这与既有方法存在本质区别。第一,锚点固定不漂移:与 IGPO 依赖模型自身似然、随策略更新而波动不同,clue 是从 $a^*$ 一次性离线恢复出的常量,评分标准稳定。第二,覆盖全部步骤:与 CSO 只给被验证的关键决策赋信用不同,clue 集对轨迹中每一步都给出奖励,实现稠密监督。第三,决策级而非实体级:与 SAPO/MindDR 用实体图距离打分不同,ABC 评估的是「这一步是否发现、验证、修正或错误推理了某个 clue」,直接对应一次搜索/推理决策的有效性。第四,与成败解耦:一条失败轨迹里发现正确 clue 的好步骤依然获得正奖励,一条成功轨迹里错误丢弃 clue 的坏步骤依然受罚,从而精确地把稠密过程监督注入到训练中。
方法步骤详情
完整流程分四步。步骤一线索恢复:给定 query $q$ 与已验证答案 $a^*$,用 DeepSeek-V4-Flash 以 ReAct 循环发起网页搜索、访问页面反推证据链,例如对「CeraVe」一题恢复出 6 条 clue(Ceramides、L'Oréal、E. Schueller 1904 年毕业、T. Allison、SJU/USciences 2022 年合并、2023 年覆盖 30+ 国家),存为 $C$。步骤二轨迹采集:用 OpenSeeker 数据,每题上限 200 步,同时保留对与错的轨迹。步骤三步级评分:评分模型输入为当前 step(推理+工具调用+响应)、原 query、线索集 $C$,按 Table 1 rubric 打分——基础分 1.0,发现/验证正确 clue +0.8、排除错误候选 +0.4、错误丢弃正确 clue −0.8、提交已验证答案 +1.0、提交错误答案 −1.0,累加并 clip 到 $[0,2.0]$,即 $r_t=\text{clip}(1.0+\sum_{j\in A_t}\Delta_j,0,2.0)$。步骤四训练:ABC-SFT 用 $w(r_t)=\sigma(\alpha(r_t-\beta))$ 重加权 $\mathcal{L}_{SFT}=\sum_t w(r_t)\sum_j\log p_\theta(x_{t,j}|x_{t,<j})$,在 8.5K 轨迹训 3 epoch;ABC-GRPO 在 SFT 检查点上对 1000 题各采 8 条 rollout,用步级优势 $A_{i,t}=\sum_{k=t}^{T_i}\gamma^{k-t}\bar{R}_{i,k}$ 替换轨迹级优势,环境工具响应在优化中被 mask。
技术新颖性
技术新颖性体现在三方面。其一,线索恢复被设计成一个与正向智能体同协议的活跃 ReAct 回溯循环,而非静态生成——评分所依赖的锚点是「在真实网页上被验证过的」证据,可靠性远高于纯文本提示出的 clue。其二,评分 rubric 把抽象的「过程质量」拆解为 5 类可叠加、可裁剪的原子行为(发现 clue、排除候选、丢弃 clue、提交对/错答案),并以 $r_t=\text{clip}(1.0+\sum\Delta,0,2.0)$ 与 $w(r_t)=\sigma(\alpha(r_t-\beta))$ 同时接通 SFT 与 RL 两套目标,让同一套稠密信号在两个训练范式间复用。其三,ABC-GRPO 用步级优势 $A_{i,t}=\sum_{k=t}^{T_i}\gamma^{k-t}\bar{R}_{i,k}$ 替换 GRPO 的轨迹级优势,把未来步的回报折扣地传播到早期决策,实现了「以答案为终点的反向信用」与「以当前步为起点的正向折扣」的结合,这是把过程奖励注入 GRPO 的简洁且工程友好的方式。
实验结果
主表(Table 2)显示 ABSeeker 在 4B 搜索智能体中全面领先:BrowseComp 37.3%(开上下文管理 55.3%)、BrowseComp-ZH 39.1%(开后 52.9%)、xbench-2505 77.0%、xbench-2510 46.0%、GAIA-text 81.6%。在 4B 类内它全面超过 DR-Venus(BrowseComp 29.1%、GAIA 64.4%)、AgentCPM-Explore(24.1%/63.9%)。更值得注意的是,尽管只训练 BrowseComp 风格问题,ABSeeker 在 xbench-2505(77.0%)与 GAIA-text(81.6%)上甚至超过全部 30B 对手(MiroThinker 80.3%、RedSearcher 80.1%)。消融(Table 3)进一步证明:BrowseComp 从标准 SFT 28.5%→ABC-SFT 30.8%→ABC-GRPO 37.3%;GAIA-text 从 66.0%→72.8%→81.6%。奖励分布(Figure 4)揭示成功轨迹仍有约 4% 低质步骤、失败轨迹有约 10% 高质步骤,正是 ABC 要挽救的「被埋没的好动作」。训练动态(Figure 5)显示 ABC-GRPO 在 BrowseComp 上持续更强且生成更长轨迹;上下文管理(Figure 6)让 BrowseComp 从 37.3% 跃升至 55.3%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| BrowseComp(英文长程浏览,无上下文管理) | 准确率 % | ABSeeker-4B(ABC-SFT+ABC-GRPO):37.3% | QUEST-4B 40.0%;DR-Venus 29.1%*;AgentCPM-Explore 24.1%*;30B 的 DeepMiner 33.5%、Tongyi-DeepResearch 43.4%*、OpenSeeker 29.5%* | 在 4B 智能体中仅次于未报告 ZH/xbench 的 QUEST-4B,且大幅领先 DR-Venus(+8.2pp)、AgentCPM-Explore(+13.2pp),并超过 DeepMiner、OpenSeeker 等 30B 智能体;开启上下文管理后进一步达到 55.3%。 |
| BrowseComp-ZH(中文长程浏览,无上下文管理) | 准确率 % | ABSeeker-4B:39.1%(开上下文管理 52.9%) | DR-Venus 37.7%*;AgentCPM-Explore 29.1%*;QUEST-4B 未报告;30B 的 DeepMiner 40.1%、OpenSeeker 48.4%* | 相对消融里的 Qwen3.5-4B+标准 GRPO 36.3% 提升 2.8pp;开上下文管理后 52.9% 在 4B 中遥遥领先。 |
| xbench-2505(深度研究综合能力) | 准确率 % | ABSeeker-4B:77.0% | DR-Venus 74.7%;AgentCPM-Explore 70.0%;30B 的 Tongyi-DeepResearch 75.0%、OpenSeeker 74.0%、GPT-5 High 77.9% | 在 4B 智能体中最优,且超过全部 30B 量级智能体(含 Tongyi-DeepResearch、OpenSeeker),仅略低于 GPT-5 High。 |
| xbench-2510(深度研究综合能力,更新版) | 准确率 % | ABSeeker-4B:46.0% | DR-Venus 40.7%;AgentCPM-Explore 34.0%;30B 的 MiroThinker 57.2%、DeepSeek-V4-Pro-Max 80.0% | 相对消融里的 Qwen3.5-4B+标准 SFT 27.0% 大幅提升 19.0pp,在 4B 智能体中领先 DR-Venus 5.3pp、AgentCPM-Explore 12.0pp。 |
| GAIA-text(通用智能体,纯文本) | 准确率 % | ABSeeker-4B:81.6% | QUEST-4B 77.7%;DR-Venus 64.4%;AgentCPM-Explore 63.9%;30B 的 MiroThinker 80.3%、RedSearcher 80.1%、Seed-2.0-Pro 78.6%、GPT-5 High 76.4% | 在所有 4B 智能体中最优,且超过全部 30B 智能体与 GPT-5 High、Seed-2.0-Pro 等前沿模型,是跨基准泛化的最强证据。 |
局限与改进
作者明确承认算力约束:实验只聚焦 Qwen3.5-4B 这一紧凑模型,未验证答案回溯信用分配在更大骨干上能否带来更强增益。此外框架关键依赖训练题须具备「唯一且可验证的标准答案」——论文正是借 BrowseComp 天然提供 $a^*$ 才能做回溯线索恢复;对开放式、答案不唯一或不可验证的任务,clue 恢复与评分都会失效。我的额外观察:一是线索恢复与评分都重度依赖 DeepSeek-V4-Flash,相当于把过程监督质量外包给更强模型,若其恢复的 clue 有误或漏掉关键证据,步级奖励就被污染,而论文未对「clue 恢复错误率」做系统敏感性分析;二是评分 rubric 的 5 类原子行为与各 $\Delta$(±0.8、+0.4、±1.0)、clip 上限 2.0、sigmoid 的 $\alpha/\beta$ 均为人工超参且未充分消融;三是每基准仅跑 3 次取平均、无方差,部分 4B 间差距较小(如与 QUEST-4B 在 BrowseComp 上)统计稳健性有待加强。
独立分析的弱点
第一,强依赖可验证标准答案,泛化受限:线索恢复 $C=\{c_1,\dots,c_K\}$ 以 $a^*$ 为起点,一旦任务没有唯一答案,整套 pipeline 就失去锚点。改进方向是推广为「可验证子目标回溯」——只要能定义若干可检验中间检查点即可。第二,监督质量被评分模型锁死:ABC 把过程监督负担转嫁给 DeepSeek-V4-Flash,clue 恢复与打分都引入外部模型偏差与噪声;可引入自一致性(多次恢复取交集)、用真实环境反馈校验 clue、或训练轻量专用评分器。第三,rubric 与超参为人工设定:评分 $\Delta$、clip 上界 2.0、$w(r_t)=\sigma(\alpha(r_t-\beta))$ 的 $\alpha/\beta$、折扣 $\gamma$ 均缺系统搜索,建议用元学习或贝叶斯优化搜索并报鲁棒性曲线。第四,评测统计量不足(仅 3 次平均、无方差),建议报告置信区间,尤其 BrowseComp 上 4B 间差距小时。第五,未做跨评分模型的稳健性消融,应补充换 LLM 做 clue 恢复/打分时的性能波动。
未来方向
作者明确提出的两条方向:一是算力允许时把 ABSeeker 扩展到更大骨干,检验答案回溯信用分配在更高模型容量下是否带来更强增益;二是把框架推广到其他长程智能体任务——只要最终结局能被回溯成中间证据、子目标或决策点,就能提供细粒度过程监督。基于本文成果,我认为还有几条值得延伸的路线。其一,把「活跃 ReAct 回溯」升级为多智能体协作恢复线索,并引入线索置信度,让评分对不确定 clue 自动降权,提升噪声鲁棒性。其二,把 clue 集从静态离线恢复改为「与策略共同进化」的课程,在训练中动态更新证据链以缓解分布漂移。其三,探索把步级优势 $A_{i,t}=\sum_{k=t}^{T_i}\gamma^{k-t}\bar{R}_{i,k}$ 与离线 Q 值学习、过程奖励模型(PRM)结合,进一步压缩对昂贵评分模型的依赖。其四,迁移到多模态搜索(图像/视频检索)与代码/工具调用密集的智能体场景,验证 ABC 在非纯文本长程任务上的迁移性。
复现评估
复现难度中等偏上,基础条件较好。论文公开了代码(github.com/PolarSeeker/ABSeeker)与 RL 模型权重(huggingface.co/PolarSeeker/ABSeeker-4B-RL),骨干用 Qwen3.5-4B、训练数据用 OpenSeeker 也可获取。关键细节交代较清:ABC-SFT 在 8.5K 轨迹训 3 epoch,ABC-GRPO 对 1000 题各采 8 条 rollout、每轨迹上限 200 步,线索恢复与打分统一用 DeepSeek-V4-Flash,五基准各跑 3 次取均值。但完整复现仍面临三方面挑战:一是线索恢复与步级打分需大量调用 DeepSeek-V4-Flash API,对 8.5K 轨迹逐 step 评分的 token 与时间成本可观;二是 4B 的 RL 阶段仍需可观 GPU 资源(论文未披露卡数与时长);三是 rubric 超参(各 $\Delta$、clip 上界、$\alpha/\beta$、$\gamma$、256K 上下文+discard-all 5 轮)部分散落正文与附录,复现者需仔细对齐才能复刻 55.3%/52.9% 等顶配数字。
论文图表
把每条轨迹按时间顺序切成十等份,左半为成功轨迹、右半为失败轨迹,红/灰/绿分别代表 $r_t<1.0$、$=1.0$、$>1.0$ 的步骤。关键观察:成功轨迹仍有约 4% 低质步骤,失败轨迹却有近 10% 高质步骤。
这张图是论文动机的硬证据——它直接证明「轨迹级一刀切会埋没好动作、强化坏动作」,是 ABC 步级监督必要性的核心论据。
柱状图展示 ABSeeker 在不同上下文管理设置下的 BrowseComp/BrowseComp-ZH 分数:关闭时 37.3%/39.1%,开启(256K token、discard-all 最多 5 轮)后跃升至 55.3%/52.9%。
它量化了上下文管理对长程搜索的巨大增益(+18.0pp/+13.8pp),解释了论文顶配数字的由来,对复现者至关重要。