← 返回 2026-07-17

GRASP:面向智能体 RAG 的粒度感知搜索策略 GRASP: GRanularity-Aware Search Policy for Agentic RAG

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan 📅 2026-07-11 👍 8 2026-07-22 18:54
Agentic RAG GRPO 上下文粒度 多跳问答 强化学习 检索策略 混合检索

用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。

前置知识

Agentic RAG(智能体检索增强生成)

在传统静态 RAG(一次性检索 + 生成)基础上,让 LLM 作为智能体在多步中迭代地推理、生成查询、检索证据、再推理,最终合成答案。每一步的检索决策都依赖前面累积的证据和中间结论,状态空间随步数增长。

GRASP 整篇工作就是在这个多步交互框架下研究策略学习,理解智能体 RAG 的循环结构是读懂论文中 trajectory、turn、observation、history 等概念的前提。

多跳问答(Multi-hop QA)

答案需要跨多个文档、经过多次推理跳跃才能得到的问题,例如『某 Eminem 专辑的主唱有一张名为 Unapologetic 的专辑,问该 Eminem 专辑名』。需要先找出 Unapologetic 的主唱 Rihanna,再找出 Rihanna 合作过的 Eminem 专辑。论文用的 HotpotQA、2WikiMultiHopQA、MuSiQue 都是典型多跳 benchmark。

多跳任务对『何时检索、检索什么、用多细的粒度』最敏感,是 GRASP 设计动作空间和奖励的motivating场景。理解 2-hop 结构才能读懂论文中『recall=0.5 表示只检索到一篇不够』的论述。

GRPO(Group-Relative Policy Optimization)

由 DeepSeekMath 提出的 RL 算法。对每个 query 采样一组 G 条 trajectory,用组内相对优势 $A_i = (R_i - \mathrm{mean}(R))/\mathrm{std}(R)$ 更新策略,省去了传统 PPO 中需要单独训练 value model 的开销。损失形式为 $\mathcal{L} = -\mathbb{E}[\min(r_i A_i, \mathrm{clip}(r_i, 1\pm\epsilon)A_i)] - ?eta \mathrm{KL}$。

GRASP 的整个训练基于 GRPO,理解 G=4 rollout、group-relative advantage、KL 正则、entropy bonus 这些组件才能读懂 Table 4 的训练配置和图 3 的收敛曲线。

Lexical vs Semantic 检索(BM25 与 Dense Retrieval)

Lexical 检索(如 BM25)基于词频统计和精确/近似的词项重叠打分;Semantic 检索(如 DPR、Qwen3-Embedding)把 query 和文档编码成稠密向量,用余弦相似度衡量语义接近度。两者互补:lexical 擅长实体精确匹配,semantic 擅长概念近义但用词不同的场景。

GRASP 的核心创新之一就是把这两种信号同时暴露给 policy 让其动态选择,理解两者的互补性是读懂 $R_S$ 互补搜索奖励和 ablation 中去掉 τs/τk 不同效果的关键。

上下文粒度(Context Granularity)

指检索单元的粗细:可以是 token、sentence、paragraph、document 等。粒度越细,检索越精确、context window 浪费越少;粒度越粗,单次能拿到的关联信息越多但噪声也越大。GRASP 采用『先 sentence 级检索 + 按需 read_paragraph 扩展』的两阶段粒度机制。

粒度控制是 GRASP 名字中的 G(Granularity),是区别于 Search-R1 等只做 chunk 级检索方法的核心维度。Ablation 显示去掉 τr 后 EM 暴跌 0.122 是最大降幅,证明粒度机制的关键性。

研究动机

现有的 RAG 系统在多跳推理任务上面临三类问题。首先是『检索到了但答不对』:静态 RAG 即使用 hybrid retriever(BM25 + dense)检索到正确的两个文档,模型仍可能因 context 过于粗粒度、噪声过大而幻觉,论文 Figure 1 的例子中 single-step hybrid 检索到了 Unapologetic 和 The Monster 两个正确段落,但因为段落里充满了 Encore 等无关信息,模型最终错误地回答『Encore』。其次是错误累积:在智能体 RAG 中,推理增量推进,任何一步的错误检索或幻觉中间结论都会传播到后续步骤并放大,例如 Search-R1 在第二步把 Unapologetic 错误归给 Kelly Clarkson(此人根本未在检索文档中出现),后续查询随之完全偏离。第三是互补检索信号难以静态固定:不同推理步需要不同信号,有些步需要 lexical matching 检索实体特定证据(如人名、专辑名),有些步需要 semantic search 连接概念相关信息,简单地应用固定 hybrid retriever 无法满足。现有方法(Jin et al. 2025 的 Search-R1、Luo et al. 2025 的 MaRAg-R1)通常只用单一检索器或固定粗粒度 chunk,难以适配多步推理不同阶段的需求。

本文的目标是本文目标是训练一个能在多步推理过程中动态协调多种互补检索工具、自适应控制上下文粒度的智能体策略。具体包括:(1) 用强化学习框架让 3B 规模的开源 LLM(Qwen2.5-3B-Instruct)学会何时检索、用哪种检索信号、以什么粒度返回证据,不依赖 gpt5-mini 等闭源模型的蒸馏;(2) 设计一种奖励函数同时兼顾答案准确性(answer accuracy)、grounded reading(在 gold 段落上做扩展阅读)、互补搜索(complementary search,两种检索信号都成功 surface gold 证据)和 turn efficiency(用更少的步数完成推理),引导智能体检索到足够证据同时控制工具使用次数和上下文窗口膨胀;(3) 在 HotpotQA、2WikiMultiHopQA、MuSiQue 三个标准多跳推理 benchmark 上同时提升 retrieval recall 和下游 QA 准确率,相比 single-step retrieval、prompting-based agentic RAG(IRCoT)和 RL-based agentic RAG(Search-R1)三类基线都取得更好结果。

与已有工作不同的是,本文的独特切入角度是把以往分别研究的三个维度联合优化:(1) 检索信号选择(lexical vs semantic);(2) 上下文粒度(sentence vs paragraph);(3) 何时检索与终止。不同于 Search-R1 只暴露单一 semantic retriever 且用段落级粒度、仅用 outcome 级 answer reward;也不同于 MaRAg-R1 需要 SFT 预训练 + 多工具但检索结果仍停留在 chunk 级。GRASP 第一次在没有 SFT 监督的情况下,把『句子级检索 + 可调用 read_paragraph 扩展』的两阶段粒度机制和多检索信号一起交给 RL policy 学习。关键创新是把 read_paragraph(τr)作为独立动作引入 MDP,使智能体先从精确命中句子开始,仅在需要更多上下文时才扩展到完整段落,既避免了 noise 污染又保留了扩展能力。这种『按需扩展粒度』的设计是论文区别于以往 chunk-level agentic RAG 的核心差异。

核心方法

整体思路是把 agentic RAG 建模为有限 horizon 的马尔可夫决策过程 $\mathcal{M} = (\mathcal{X}, \mathcal{A}, P, R, T)$。State $x_t \in \mathcal{X}$ 由 query $q$、交互历史 $h_{t-1}$、已检索证据、已调用工具和剩余 turn 预算 $T-t+1$ 组成。每一步 policy LLM $\pi_ heta$ 先生成 reasoning segment $g_t \sim \pi_ heta(\cdot|x_t)$,再选择 tool action $a_t \in \{ au_s, au_k, au_r, au_a\}$,环境返回 observation $o_t$,交互历史更新为 $h_t = h_{t-1} \oplus g_t \oplus a_t \oplus o_t$。动作空间包含三个证据获取工具:semantic search($\tau_s$,基于 dense retrieval 捕获语义相似)、keyword search($\tau_k$,基于 BM25 做词项匹配)、read paragraph($\tau_r$,把检索到的句子扩展为父段落),以及终止动作 $\tau_a$ 产生最终答案。$\tau_s$ 和 $\tau_k$ 都返回 top-$K=5$ 的句子级证据连同父段落 ID 和 score:$o_t = \tau(q_t) = \{(s_i, f(s_i), \mathrm{score}_i)\}_{i=1}^K$,差别仅在 score 计算方式。$\tau_r(s) = f(s) = d$ 把句子 $s$ 映射到其父段落 $d$。整个系统用 GRPO 训练,policy 是 Qwen2.5-3B-Instruct 全参数微调(FSDP),rollout 时只对 policy-generated tokens 算 loss,mask 掉 retriever 返回的 observation tokens 防止模型记忆检索输出。Figure 2 给出了这一流程的概览。

核心创新点是设计一种四元奖励 $R = R_A + \alpha R_R + \beta R_S + \gamma R_E$($\alpha=0.7, \beta=0.15, \gamma=0.15$),让答案准确性 $R_A$(token-level F1,权重 1.0)保持主导驱动,同时用三个辅助奖励塑造中间行为:(1) Grounded reading $R_R = F1(D_r, D_g)$ 衡量智能体在 gold 段落而非 distractor 上调用 read 工具的程度,鼓励读对的、惩罚读错的;(2) Complementary search $R_S = \mathbb{1}[D_s \cap D_g \neq \emptyset \wedge D_k \cap D_g \neq \emptyset]$ 要求 semantic 和 keyword 两种搜索都至少 surface 一个 gold doc,避免策略 collapse 到单一工具;(3) Turn efficiency $R_E = (T - T_{cur})/T \cdot \mathbb{1}[R_A > 0.5]$ 鼓励短 trajectory 但仅在答案正确时给分防止 early guessing。三个辅助奖励总和上限 1.0,加上 1.0 的答案奖励,总 reward 最大 2.0。这种『答案主导 + 辅助塑形』的设计 explicit 地 guard against reward hacking——即策略学习最大化容易的中间信号而牺牲最终任务表现。与已有方法的本质区别:把检索信号选择、上下文粒度、检索时机三者联合建模为可学习 policy,而非预定义的固定 pipeline。

方法步骤详情

完整训练流程:(1) 数据准备。HotpotQA distractor split 每个例子有 question + answer + supporting facts(title-sentence 对)+ 2 个 gold 段落 + 8 个 distractor 段落。每个段落切为句子,建立 sentence-level corpus $S$,保留 parent paragraph 和 document-title metadata,并维护映射 $f: S \to D$ 指示每句的父段落。(2) Rollout 采样。对每个 query,policy LLM 收到 system prompt(描述三个工具调用语法 `query` 等)和 user prompt(含 question)。LLM 在 `...` 里推理后调用 tool。每个 prompt 采样 $G=4$ 条 trajectories,每条最多 $T=10$ turns,最大 response 长度 6144 tokens,generation temperature 1.0。(3) 奖励计算。每条 trajectory 基于最后 `` 内的 $\hat{y}$ 计算 $R_A = \max_j F1(\hat{y}, y^{(j)})$;基于 read 段落标题集 $D_r$ 和 gold 标题集 $D_g$ 计算 $R_R$;基于 semantic 和 keyword 工具 surface 的标题集 $D_s, D_k$ 计算 $R_S$;基于实际使用 turn 数 $T_{cur}$ 计算 $R_E$。还设有 spam guard 防止策略在一个 trajectory 内塞超过 10 个 `` 标签以暴力提升 token-F1。(4) GRPO 更新。对同一 query 的 $G$ 条 trajectories 计算 group-relative advantage $A_i = (R_i - \bar{R})/\sigma_R$,用 clip range $\epsilon_c = 0.2$、KL 系数 $1\times 10^{-4}$、entropy 系数 0.0021 更新策略。Optimizer 用 AdamW constant LR $1\times 10^{-6}$。每 step 64 prompts × 4 rollouts = 256 trajectories。(5) 训练 270 steps(约 17,280 prompts ≈ 19% epoch)即停,因为 validation reward 已 plateau,把这个 checkpoint 作为论文报告的主模型。(6) 推理时同样 prompt,独立 retrieval servers(FastAPI + BM25 + Qwen3-0.6B dense)跑在单独 GPU node 上。

技术新颖性

技术新颖性体现在五个方面:(1) **三 tool action space**——没有以往工作同时把 semantic search、keyword search 和 read paragraph 三个互补动作暴露给同一个 RL policy,让模型自己学何时用哪种信号、何时扩展粒度。(2) **互补搜索奖励 $R_S$**——第一次 explicitly reward 两种 retrieval signal 都成功 surface gold evidence,避免策略 collapse 到单一工具或重复调用同一工具。(3) **句子级检索 + 按需段落扩展的两阶段粒度机制**,相比 fixed chunk granularity 更细(precision 高、context 省),相比 retrieval 直接返回 paragraph 更灵活(需要时才扩展)。(4) **奖励权重设计**——保持 answer accuracy 主导(权重 1.0)、辅助奖励上限 1.0,从理论上确保 reward hacking 难以发生。(5) **Loss masking** 只对 policy-generated tokens 算 gradient,避免模型学习模仿或记忆检索输出。与 Search-R1(单 retriever + outcome reward)相比增加了 multi-tool 和 process supervision;与 MaRAg-R1(SFT + RL + 多 tool 但仍 chunk 级)相比省去了 SFT 预训练并解决了粒度问题。作者在 Related Work 中明确写道『这是 first work to study these three aspects (retrieval-signal selection, context granularity, learning retrieval policy) jointly in training based agentic RAG』。

Overview of the GRASP framework.
Figure 2: Overview of the GRASP framework.

实验结果

核心发现可以从六个方面分析。(1) **Retrieval recall(Table 1)**:GRASP 在 HotpotQA(0.90)、2Wiki(0.90)、MuSiQue(0.70) 三 benchmark 上 recall 最高或并列最高,相比 single-step hybrid(HotpotQA 0.86, 2Wiki 0.60, MuSiQue 0.59)提升明显,证明 multi-step + complementary retrieval 能 surface 更全证据。IRCoT 凭借 gpt5-mini 生成 CoT 在 HotpotQA 上达到 0.91 略胜,但用了大得多且闭源的模型。Search-R1(3B + GRPO)只有 0.74/0.77/0.62。(2) **QA 指标(Table 2)**:GRASP 全面领先,HotpotQA EM/F1/JD=0.53/0.66/0.71,2Wiki 0.52/0.60/0.63,MuSiQue 0.23/0.33/0.34,比次优 Search-R1 GRPO(HotpotQA 0.45/0.56/0.58, 2Wiki 0.45/0.53/0.54, MuSiQue 0.22/0.30/0.29)高出 8 个 EM 点(HotpotQA)和 7 个 EM 点(2Wiki)。(3) **Base setting**(同样 prompt + 3 tools 但 no policy learning)recall 只有 0.36/0.27/0.24,远低于 single-step hybrid(0.86/0.60/0.59),证明 RL 训练本身(而非 prompt 设计)是性能提升的关键。(4) **Ablation(Table 3)**:去掉 τr(改 paragraph 粒度)EM 掉 0.122 最大,去掉 τs 掉 0.072,去掉 τk 只掉 0.012,说明 read paragraph 工具和 sentence-level 粒度最关键,且语义搜索贡献大于关键词搜索,符合 skim-then-scan 的 emergent behavior。(5) **训练曲线(Figure 3)**:总 reward 从 ~0.26 单调上升到 ~1.22 收敛,四目标同时改善,无 collapse。(6) **Qualitative(Figure 4)**:学到的 policy 呈现 skim-scan 行为——τs 最常转移到 τr(0.53)或 τk(0.48),先粗探索再 verify 再 lexical refine,类似人类信息觅食;tool-call usage 训练后稳定在 ~8 calls/trajectory。论文还给出 Figure 1 例子的完整 GRASP trajectory(Table 13):先 semantic search 粗探 Eminem/Unapologetic 关系,再 keyword search 拿到 The Monster 段落并定位 Rihanna,再 read_chunk 验证 Unapologetic 属于 Rihanna,最后跨第二跳确认 The Marshall Mathers LP 2,全程无幻觉。

Recall metrics for retrieved passages across multi-hop benchmarks.
Table 1: Recall metrics for retrieved passages across multi-hop benchmarks.
QA Metrics across multi-hop benchmarks.
Table 2: QA Metrics across multi-hop benchmarks.
Ablation of search tools and context granularity.
Table 3: Ablation of search tools and context granularity.
Training configuration for our main GRPO model.
Table 4: Training configuration for our main GRPO model.
Hugging Face dataset identifiers, validation-split sizes, and retrieval-corpus sizes.
Table 5: Hugging Face dataset identifiers, validation-split sizes, and retrieval-corpus sizes.
Retrieval process that first searches broadly for the connection between Eminem, vocals, and Unapologetic, then identifies Rihanna as the artist of Unapologetic, and finally confirms that Rihanna's guest vocals appear on Eminem's The Monster, which is from The Marshall Mathers LP 2.
Table 13: Retrieval process that first searches broadly for the connection between Eminem, vocals, and Unapologetic, then identifies Rihanna as the artist of Unapologetic, and finally confirms that Rihanna's guest vocals appear on Eminem's The Monster, which is from The Marshall Mathers LP 2.
Total trajectory-level reward R over GRPO training.
Figure 3: Total trajectory-level reward R over GRPO training.
Observed first-order Markov transition graph over agent actions.
Figure 4: Observed first-order Markov transition graph over agent actions.
查看结构化数据
任务指标本文基线提升
HotpotQA 多跳问答 - 段落检索 Recall 0.90 0.86(single-step hybrid)/ 0.91(IRCoT 用 gpt5-mini) 相比同规模开源 single-step 提升 +0.04;与 IRCoT 几乎持平但所用模型小一个数量级且开源
HotpotQA 多跳问答 - 答案生成 EM / F1 / JD 0.53 / 0.66 / 0.71 0.45 / 0.56 / 0.58(Search-R1 GRPO,次优) EM +0.08,F1 +0.10,JD +0.13
2WikiMultiHopQA - 段落检索 Recall 0.90 0.83(IRCoT,次优) +0.07,跨数据集 generalization 表现稳健
2WikiMultiHopQA - 答案生成 EM / F1 / JD 0.52 / 0.60 / 0.63 0.45 / 0.53 / 0.54(Search-R1 GRPO) EM +0.07,F1 +0.07
MuSiQue - 段落检索 Recall 0.70 0.62(IRCoT/Search-R1) +0.08,在最难的 benchmark 上提升幅度最大
MuSiQue - 答案生成 EM / F1 / JD 0.23 / 0.33 / 0.34 0.22 / 0.30 / 0.29(Search-R1 GRPO) EM +0.01,F1 +0.03,绝对值仍偏低说明 MuSiQue 难度大
组件消融 - 去 read_paragraph EM / F1 0.510 / 0.631(完整 GRASP) 0.388 / 0.484(without τr,改段落级粒度) EM -0.122,F1 -0.147,是最大降幅,证明句子粒度+按需扩展最关键
组件消融 - 去 semantic search EM / F1 0.510 / 0.631 0.438 / 0.567(without τs) EM -0.072,F1 -0.064,证明语义搜索对粗探索不可或缺

局限与改进

作者承认三类局限。(1) **奖励依赖 gold supporting-fact annotations**:$R_R$ 和 $R_S$ 都需要 ground-truth 的 title-sentence 标注来构造 gold 集合 $D_g$,限制框架只能用于提供这种标注的数据集(如 HotpotQA distractor split)。作者提出未来可用 weakly/self-supervised 替代如 answer-conditioned attribution 或 trajectory 间 self-consistency,使多工具 RL 能应用到无 gold-evidence 标签的语料。(2) **Premature commitment 和 incomplete-retrieval failures**:尽管 tool-call usage 训练中增长并稳定在约 8 calls/trajectory,policy 偶尔仍在所需证据 surface 前就 commit 答案。作者建议引入 penalize premature commitment 的 reward shaping 或允许模型 abstain 的 self-assessment signal。(3) **单一 backbone**:实验只在 Qwen2.5-3B-Instruct 上验证,不清楚 keyword search 使用率上升、四步 retrieval 模式稳定等 emergence dynamics 如何随 model scale 变化。Larger backbone 可能学得更快但也可能 collapse 到过于 aggressive 的策略直接跳过 evidence reading。作者建议系统比较 1B/3B/7B/14B。我自己额外观察的局限:(4) **测试样本规模偏小**——每个 benchmark 只随机取 500 questions,方差可能较大;(5) **限定 multi-hop QA(2-3 跳)**——更长 reasoning chain(如 5-10 跳)的 Web of Science、长文档 summarization 等场景是否仍 beneficial 未验证;(6) **Distractor setting 简化**——每例固定 2 gold + 8 distractor 远比真实 open-domain retrieval 简单,缺乏 web-scale 或全 Wikipedia 评估。

独立分析的弱点

独立分析的弱点和改进方向:(1) **强标注依赖**——$R_R/R_S$ 都需要 title-level gold annotations,对现实无标注语料(海量网页、企业文档)不友好。改进方向:用 LLM-generated rationale、retriever agreement、或 self-consistency 作为弱监督替代 gold evidence set,把框架推广到无标注语料。(2) **检索空间限制**——只用 BM25 + Qwen3-0.6B dense retriever、top-k=5。更高性能 retriever(ColBERT、late-interaction model)或更深 top-k 可能改变结论。改进:测试 retriever scaling 对 policy emergence 的影响。(3) **3B 容量瓶颈**——MuSiQue EM 只有 0.23 远低于 HotpotQA 0.53,说明跨 domain 或更长 reasoning chain 时 3B 容量不足。改进:scale up backbone 到 7B/14B,或引入 memory 机制跨 hop 累积 evidence。(4) **奖励超参 hand-tuned**——$\alpha=0.7/\beta=0.15/\gamma=0.15$ 是经验选择,缺乏自动 reward balancing 或 learned reward weights 的对比。改进:用 population-based training 或 multi-objective RL 自动权衡。(5) **Premature termination**——作者已承认,可加 consistency-based abstain 或 post-hoc verification 步骤。(6) **缺少 web-scale 真实评估**——distractor setting 下检索空间小且 gold 比例高(2/10),与真实 open-domain retrieval 差异大。改进:在全 Wikipedia 或 Common Crawl 上 eval,并引入 retrieval 噪声、对抗 distractor 等压力测试。(7) **缺少 long-horizon 评估**——T=10 上限可能不足以处理需要 5+ 跳的复杂问题。

未来方向

作者明确提出的三方向:(1) **更丰富的 tool space**——包含 evidence acquisition 工具和 reasoning 工具(如计算器、SQL 查询、知识图谱遍历),研究哪种工具在不同 reasoning stage 最有用。(2) **奖励设计减少 gold annotation 依赖**——用 weaker 或 model-based signals 替代 gold supporting facts,例如 answer-conditioned attribution 或 trajectory self-consistency。(3) **dynamic retrieval granularity**——允许智能体决定暴露多少 context,从 short spans 到 paragraphs 或更大 document regions,基于当前 reasoning state。基于成果可延伸的研究方向:(4) 跨 model scale 系统性研究——1B/3B/7B/14B 在相同 reward 和 tool config 下 tool-use emergence dynamics 如何变化,是否存在临界 scale;(5) 把 GRASP 扩展到非 QA 任务如 long-doc summarization、information extraction、agentic coding、scientific reasoning;(6) 用 self-consistency 或 LLM-judge 作为 $R_R/R_S$ 的 weak supervision 替代 gold facts,扩大适用范围;(7) 多 agent 协作,每个 agent 专注一种 retrieval signal 再 federate;(8) 把 complementary search 和 tool-use exploration 奖励扩展到更长 horizon(T>10)任务;(9) 与 reasoning model(如 R1-style)结合,研究 GRASP 学到的检索策略是否能迁移到更强的 reasoning backbone。

复现评估

复现评估结论是『中等难度,关键信息齐全但工程量大』。(1) **数据完全开源**:三个 benchmark 都来自 HuggingFace Hub(hotpotqa/hotpot_qa config=distractor, framolfese/2WikiMultihopQA, dgslibisey/MuSiQue),Search-R1 checkpoint 用公开 PeterJinGo collection,Appendix D Table 5 列出每个数据集的 HF identifier、validation-split 大小(7,405/12,576/2,417)和 retrieval corpus 大小(66,635/56,687/21,100 unique paragraphs)。(2) **训练超参完整披露**:Table 4 列出全部配置——Data(HotpotQA distractor 90,447 examples, 270 steps, 256 val prompts)、Backbone(Qwen2.5-3B-Instruct full-param, FSDP)、GRPO config(G=4 rollouts, 64 prompts/step, max T=10 turns, 6144 max response tokens, temperature 1.0, 180s timeout/1 retry)、Optimization(AdamW constant LR 1e-6, clip 0.2, KL 1e-4, entropy 0.0021)、Infrastructure(2× A100 80GB, Verl-Tool + vLLM rollout backend, 独立 FastAPI retrieval server)。(3) **算力需求**:训练只需 2 张 A100 80GB 跑 270 steps(约 2-3 天)加 1 个独立 GPU node 跑 BM25/dense retrieval,整体属于中等算力需求,大学实验室级别可承担。(4) **Prompt 完全公开**:Appendix E 给出 system prompt、user prompt 和 ablation 变体(Table 6-9)。Appendix B 详细描述 reward 计算细节(string normalization、gold evidence set、read evidence set、surfaced evidence sets、complementary search indicator、answer extraction、turn count、spam guard)。(5) **未明确项**:GRASP 自身的训练 code 和 checkpoint 在论文中未明确 release 状态,复现者需自行实现 GRPO multi-turn tool-use training loop(涉及 vLLM rollout、FSDP、独立 retrieval server 的工程协调)。最大不确定性是 LLM-as-judge(gpt5-mini)涉及闭源模型,可能造成 JD 指标 non-deterministic,但 EM/F1 是确定性指标可完全复现。