← 返回 2026-07-21

DeepSearch-World:可验证环境下的深度搜索智能体自蒸馏 DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang, Haitao Mi, Zhenwen Liang, Tianqing Fang, Yi R. Fung 📅 2026-07-08 👍 89 2026-07-25 18:30
工具使用 强化学习 智能体 深度搜索 自蒸馏 自进化

构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。

前置知识

Self-Evololving(自进化智能体)

自进化智能体指能通过自身与环境交互产生的经验(轨迹、试错记录)来迭代改进的智能体,不依赖外部更强模型蒸馏出的数据。典型做法如 STaR、Self-Rewarding,是迈向可扩展智能的关键路径,核心难点在于如何从自身经验中提取可靠、稳定的监督信号。

本文的核心目标就是构建一个能稳定自进化的搜索智能体,理解这个范式才能明白作者为何要费力构造一个可验证的确定性环境。

ReAct 框架

ReAct(Reasoning + Acting)让大模型在 中推理、在 中调用工具、观察返回结果,循环往复直到给出最终答案。它把推理与行动交织在一起,是目前工具使用智能体最主流的范式,本文最终训练的就是标准 ReAct 智能体。

本文方法的关键一步 scaffold-to-ReAct 转换,就是把训练时的额外结构(计划、记忆、反思)压缩进 ,理解 ReAct 才能看懂这个压缩过程。

GRPO(Group Relative Policy Optimization)

GRPO 是 DeepSeek-R1 推广的强化学习目标:对一个 prompt 采样一组(group)回答,用组内相对优势作为奖励信号更新策略,省去了价值网络。它已成为工具使用智能体后训练的主流范式,但奖励稀疏、难以提供过程级监督。

本文把它作为对比基线(稀疏奖励 RL),并指出其无法判断失败出在哪一步的根本缺陷,这正是作者另辟蹊径的动机所在。

On-Policy Self-Distillation(OPSD,在线策略自蒸馏)

OPSD 让学生在自己采样的前缀上匹配细粒度(token 级)的教师分布,从而把稀疏奖励转化为密集监督,形式化为 $\mathcal{L}_{OPSD}(\theta)=\sum_t \mathbb{E}_{x,\hat{y}_{<t}\sim\pi_\theta} KL(q_t \| \pi^t_\theta)$。它要求教师分布可靠、稳定。

OPSD 是作者重点讨论和对比的密集监督方案,作者论证它在长链工具使用中因教师分布不可靠而失效,是理解为什么必须引入可验证环境的关键对照。

BM25 检索与确定性环境

BM25 是经典的基于词频和文档长度的概率检索算法。本文用 Pyserini 在维基百科语料上构建 Lucene BM25 索引,作为 web_search_wiki 工具的后端,返回标题、摘要、URL 的排序结果来模拟搜索引擎;配合 SQLite 偏移索引实现 visit_wiki,所有工具完全确定性。

确定性是 DeepSearch-World 的灵魂——同样的查询永远返回同样的结果,这是实现可验证环境、可复现轨迹、稳定自蒸馏的物理基础。

研究动机

训练能从自身经验改进的工具使用智能体是迈向可扩展自进化的关键挑战,但现有两条主流路径都有硬伤。第一条是模仿式 SFT:从骨干模型自身蒸馏正向轨迹来微调,性能在几步优化后迅速饱和,受限于骨干模型自身能力和自采集轨迹的多样性。第二条是基于奖励的 RL(如 GRPO):在智能体自己的 rollout 上用可验证奖励优化,但奖励是稀疏的、轨迹级的,无法判断一次失败到底出在查询构造、工具选择、证据抽取还是答案合成上——对长链交互几乎不提供过程级指导。最近兴起的 OPSD 虽然用 token 级教师分布提供密集监督,但在工具使用场景下,教师的细粒度分布(工具选择、证据验证、查询改写、进度跟踪)必须依赖一个确定性、可验证的交互环境,否则每一步的教师分布都充满噪声,难以直接用到长链智能体上,这是已有方法普遍面临的根本困境。

本文的目标是本文要构建一个能稳定自进化的长链深度搜索智能体,且不依赖任何更强的专有模型蒸馏。具体目标有三个层面:第一,打造一个确定性、可验证的离线环境,让搜索和阅读工具的观察可复现,并对中间工具使用步骤提供实体级进度验证;第二,设计一种能在长链工具使用中提供过程级监督的训练方法,把规划、记忆、错误恢复、查询改写等认知行为注入学生模型;第三,在不蒸馏任何前沿专有模型轨迹的前提下,让开源 9B 模型在 BrowseComp、GAIA、HotpotQA 等基准上达到与主流开源深度搜索智能体相当的竞争力,并用消融实验证明自进化循环、scaffold-to-ReAct 转换各组件的独立贡献。

与已有工作不同的是,作者抓住的核心切入点是:长链工具使用智能体真正需要的不是更强的教师,而是一个可验证的环境。已有方法要么用静态模仿信号(SFT)、要么用稀疏结果奖励(RL)、要么用不可靠的密集分布匹配(OPSD),都忽视了'工具使用的中间步骤是否取得了客观进展'这个可廉价验证的信号。本文用维基百科超链接图的随机游走构造多跳问答,把每个问题的目标实体集 $T_i=\{e_{i,1},\dots,e_{i,H}\}$ 存为 ground truth,环境能在每次工具调用后判定是否命中新的目标实体——这种无序的实体级验证无需昂贵的 LLM 裁判,却能为自蒸馏提供稳定、可复现的过程级监督,这正是被已有工作普遍忽视的关键。

核心方法

可以用'带裁判的沙盒训练'来类比整个方法。作者先建一个完全离线、确定性的维基百科沙盒 DeepSearch-World(约 1000 万词条),里面的搜索引擎(web_search_wiki,基于 Pyserini 的 BM25 索引)和浏览器(visit_wiki,基于 SQLite 偏移索引)永远返回相同结果,同时环境偷偷记录每个问题的目标实体集,每次工具返回只要命中新的目标实体就标记'进展成功'。在这之上,DeepSearch-Evolve 做一个自蒸馏循环:当前模型 $\pi_{\theta_R}$ 作为教师,用 PLAN-ACT-END 三段式 scaffold 在沙盒里生成轨迹(带显式的规划、记忆、反思),过滤出答案正确且质量高的轨迹,把 scaffold 改写成标准 ReAct 格式(把计划/状态/反思压缩进 ),再用 SFT 训练下一代学生 $\pi_{\theta_{R+1}}$,循环 11 轮。这种'部分在线生成 + teacher-forced 优化'的折中,既提供了过程级监督又避免了完全在线分布匹配的不稳定,是技术路线的核心张力。

核心创新是把'过程级监督'从昂贵的 LLM 裁判转化为环境自带的实体匹配信号,并用 scaffold-then-ReAct 两阶段蒸馏注入学生。已有方法要么用最终答案正确性(稀疏)要么用 token 级教师分布(不可靠),而本文利用多跳问答的天然结构:问题由维基百科超链接图随机游走 $\tau=(v_1,\dots,v_H)$ 构造,每跳对应一个目标实体,环境维护已完成集 $S_t\subseteq T_i$,每次工具观察 $o_t$ 命中 $T_i\setminus S_t$ 中任一未解实体即判成功。配合 scaffold 教师显式追踪四字段(completed_list、todo_list、experience、information)和失败时的分级规则化反思,产生'搜索-失败-反思-重试'的恢复轨迹;再经 scaffold-to-ReAct 转换($_t=P_t\oplus R_t\oplus A_t$)把规划、反思、动作理据压缩进学生 ,训练出不依赖外部 scaffold 的可部署 ReAct 智能体。

方法步骤详情

完整流程分五步。①环境与数据:对维基百科超链接图 $G=(V,E)$ 做实体级随机游走,混淆实体指代生成 420K 多跳问答,爬取相关页面构建约 1000 万词条离线语料,Pyserini 建 BM25 索引、SQLite 建标题偏移索引,两工具完全确定性。②scaffold 教师:PLAN 初始化四字段工作记忆,ACT 最多 $T_{max}=30$ 步按 $s_{t+1}=U(s_t,a_t,o_t,r_t)$ 更新($r_t$ 为检索失败的环境反思),END 用已验证证据生成答案。③过滤:拒绝采样(RS)保留答案正确轨迹,再用 Qwen3.5-9B 质量过滤(QF)剔除冗余证据与不一致推理。④scaffold-to-ReAct:去掉阶段专属 prompt,把进度状态、反思改写为自我纠错,组合成 $_t=P_t\oplus R_t\oplus A_t$,工具调用与观察不变。⑤迭代自进化:每轮 1 万实例生成,4K 通过过滤即触发一次 SFT,重要性采样($\gamma=0.5$)跨轮混合缓解遗忘,目标 $\mathcal{L}_{SFT}=\mathbb{E}\sum_t KL(\delta_{y_t}\|\pi_\theta(\cdot|x,y_{<t}))$;最后用 1600 条真实工具实例做 GRPO 缩小离线-真实 gap。

技术新颖性

和已有技术的本质区别有三点。第一,与基于真实/模拟网络的工具环境(API 缓存、程序化模拟器、LLM 建模环境)相比,DeepSearch-World 把环境扎根在维基百科语料上,既有真实可读的内容(避免幻觉观察)又能完全确定性、可复现,I/O 通过 SQLite 偏移索引和共享 BM25 索引高效。第二,与基于答案正确性的拒绝采样/RL 相比,实体级进度验证提供了无需 LLM 裁判的过程级信号,第一次让自蒸馏能廉价获得每步是否进展的判据。第三,与 OPSD 这类完全在线分布匹配相比,作者刻意选择'部分在线生成 + teacher-forced 优化'的折中——学生在线采样教师轨迹,但优化时用已验证的离线前缀加硬标签,避免学生 rollout 漂移到低质量工具状态导致教师分布变噪。scaffold-then-ReAct 的两阶段蒸馏也很有意思:训练时用显式结构获得高质量轨迹,部署时却退化为标准 ReAct,把规划、记忆能力'内化'进了 ,这是区别于普通蒸馏的独到设计。

Overview of the DeepSearch-World and DeepSearch-Evolve
Figure 2: Overview of the DeepSearch-World and DeepSearch-Evolve
Three-phase scaffolded teacher rollout
Figure 3: Three-phase scaffolded teacher rollout

实验结果

主结果(Table 1)亮眼。同一 Qwen3.5-9B 骨干上 DeepSearch-World-9B 全面暴涨:BrowseComp 7.4→31.2(+23.8)、BrowseComp-ZH 13.5→36.4(+22.9)、HLE 16.7→25.7(+9.0)、GAIA 23.9→61.5(+37.6)、xbench 20.0→49.0(+29.0)、HotpotQA 45.3→93.4(+48.1)。不蒸馏任何专有模型轨迹却达到与依赖多智能体蒸馏或前沿模型合成的开源智能体相当水平——BrowseComp 31.2 接近 Marco-DR 31.4、MiroThinker 31.1,GAIA 61.5 超 WebExplorer 50.0、OffSeeker-DPO 51.5;距 OpenAI Deep Research(51.5/67.4)仍有差距。消融(Table 3):DeepSearch-Val 完整 31.9、纯 SFT 25.0、骨干 8.5,去掉反思改写掉到 16.7、去掉状态内化掉到 23.5,证明自进化与转换各组件有效。Table 2 显示拒绝采样是主功臣(SearchQA 上 RS only 54.9 vs w/o both 46.4),加 QF 升到 58.2。Fig 6 揭示行为质变:平均 18 轮交互、5.4 次 visit,骨干仅 4.7 轮、0.9 次;高阶能力评分 70% vs 19%。

Main results on deep search and related reasoning benchmarks
Table 1: Main results on deep search and related reasoning benchmarks
Ablation on trajectory-to-training-data conversion strategies
Table 3: Ablation on trajectory-to-training-data conversion strategies
Tool-use behavior and advanced capability on DeepSearch-Val
Figure 6: Tool-use behavior and advanced capability on DeepSearch-Val
查看结构化数据
任务指标本文基线提升
BrowseComp(英文浏览) 准确率(%) 31.2 Qwen3.5-9B-Instruct 7.4;开源最高 Marco-DR 31.4、MiroThinker 31.1 较骨干 +23.8,持平开源最优,接近 OpenAI Deep Research 51.5
GAIA(多步问答) 准确率(%) 61.5 Qwen3.5-9B-Instruct 23.9;OffSeeker-DPO 51.5、WebExplorer 50.0 较骨干 +37.6,超越多数开源智能体
HotpotQA(多跳问答) 准确率(%) 93.4 Qwen3.5-9B-Instruct 45.3;WebSailor 92.8 较骨干 +48.1,列开源第一
HLE(专家级推理) 准确率(%) 25.7 Qwen3.5-9B-Instruct 16.7;MiroThinker 21.5 较骨干 +9.0,开源最优
DeepSearch-Val(自建验证集) 准确率(%) 31.9(完整流程) 纯 SFT 25.0;骨干 8.5 自进化循环相对纯 SFT +6.9

局限与改进

作者明确承认两点:一是环境只建在维基百科上,覆盖面和领域多样性有限,扩展到更广知识源才能提升泛化;二是更新规则只用了 evolving SFT,RL 或 OPSD 式更新可能进一步提升泛化与灵活性,但如何把规划、错误恢复、工具策略等高阶能力注入 RL 训练仍是开放问题。我自己观察到几点补充局限:BrowseComp-ZH 只有 36.4,远低于中文 SOTA Marco-DR 的 47.1 和 MiroThinker 的 40.2,因为训练轨迹纯英文,跨语言迁移有限;BrowseComp 31.2 与 OpenAI Deep Research 的 51.5 差距明显,说明自蒸馏 9B 还触不到大模型上限;实体级验证虽然廉价,但只对'能否命中目标实体'打分,无法判断证据质量、推理正确性,可能放过答案对但推理错的轨迹;scaffold 教师生成的轨迹质量本质上仍受 Qwen3.5-9B 自身能力约束,这是自蒸馏方法的固有上限,难以凭空超越骨干的认知边界。

独立分析的弱点

第一,强领域偏科。环境扎根维基百科,对需要实时信息、专业数据库、多模态证据的任务(GAIA 非文本部分、BrowseComp 深网内容)覆盖不足,也是 GAIA/HLE 提升幅度不一致的原因。改进方向:把确定性可验证设计推广到 Wikidata、代码沙盒、多语种语料,构造多源可验证环境。第二,实体级验证粒度粗。只判断是否命中目标实体,无法捕获'答对但推理链错''证据冗余但答案对'的退化轨迹,依赖 QF 提示词事后修补。改进方向:引入步骤级奖励(证据充分性、推理一致性判据)或轻量级规则验证器。第三,scaffold 转换有损。结构化计划/反思硬塞进 ,长链下会膨胀超窗,作者虽用 $w=3$ 滑窗缓解但可能丢早期关键证据。改进方向:探索层次化记忆或外部 scratchpad 而非全内化。第四,完全放弃 OPSD 折损分布匹配收益,可设计'高置信区用 OPSD、低置信区退回 SFT'的自适应混合。

未来方向

作者提出的方向:把可验证环境扩展到更广知识源以提升泛化;探索把 evolving SFT 与 RL/OPSD 结合,研究如何把规划、错误恢复、工具策略等高阶能力注入 RL 训练。基于本文成果可延伸的方向:第一,把 entity-level 验证思想推广到其他有可验证中间结构的任务,如数学证明(Lean 定理)、代码生成(测试用例)、数据库查询(查询计划),都可能构造可验证的'过程级裁判环境'。第二,当前 scaffold-to-ReAct 是一次性硬压缩,可研究课程式蒸馏——从带完整 scaffold 到逐步移除 scaffold 的退火训练。第三,异步生成-训练架构(10K 批生成与 4K 训练并行)值得推广到其他长链智能体的自进化,能将 5 轮完整循环压缩到 2-3 天,显著降低门槛。第四,跨语言扩展,构造多语种可验证环境以缓解 BrowseComp-ZH 的短板。第五,研究多教师投票或环境投票来缓解'自蒸馏受骨干上限约束'的固有瓶颈。

复现评估

复现友好度高。作者承诺开源环境、420K 训练池、验证集 DeepSearch-Val、模型权重和代码(CC BY-SA 兼容)。技术栈全开源:检索用 Pyserini + Lucene BM25 索引,访问用 SQLite 偏移索引加 JSONL 语料,约 1000 万维基词条;训练用 Llama Factory,超参完整(1 epoch/轮、学习率 $5\times10^{-6}$、cosine、10% warmup、DeepSpeed ZeRO-2、BF16、最大序列 32768)。算力可控:单 8 卡 H20 节点加 2 节点集群,5-11 轮完整自进化约 2-3 天,远低于动辄几百卡的大模型 RL。难点在于:构造 420K 多跳问答依赖 Gemini-3-Pro 做问题生成与 BFS 知识树探索,复现数据构造需商业 API;缩小离线-真实 gap 需用 Google SerpAPI 加 Jina 做额外 GRPO,涉及付费 API;scaffold 教师 prompt 体系较复杂,调通需工程量。整体属于'有 1-2 节点集群加一定 API 预算即可复现'的级别。