← 返回 2026-09-10

PARSER:并行阅读、深度推理的长上下文LLM智能体 PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents

Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng 📅 2026-09-06 👍 20 2026-09-12 18:30
多智能体协作 多跳问答 强化学习 推理效率 长上下文

冻结子代理并行读全文,主代理散射-聚合多轮推理,长文多跳问答更准且最高提速11倍。

前置知识

顺序记忆代理(Sequential Memory Agent)

一类处理超长文档的智能体范式:把文档切成块后按顺序逐块阅读,每一步将当前块与上一步的记忆文本一起压缩成新的记忆,最终仅凭记忆生成答案。代表工作 MemAgent 用强化学习端到端训练这个"读块—压缩—更新"的循环,可在小上下文窗口内处理百万 token 文档;ReMemR1 又在其上增加了回调检索早期记忆状态的模块。

ParSer 的全部动机与对比基线都围绕这一范式展开,只有理解其"顺序遍历+递归压缩"的结构,才能明白论文所攻击的位置敏感与线性时延两大结构性缺陷。

多跳问答(Multi-hop QA)

答案无法由单条证据直接得出、而需要串联多条分散证据的问答任务。例如"哪部电影的导演去世更早"需要先分别查出两部电影各自的导演,再检索两位导演的死亡日期并比较。常用指标 Sub_EM:答案归一化(小写、去冠词和标点)后,预测与标准答案互为子串即算正确。

论文实验全部建立在 HotpotQA(分布内)与 2WikiMultiHopQA(分布外)两个多跳基准上;证据分散且后一跳依赖前一跳的特性,正是暴露顺序方法缺陷的关键场景。

ReAct 循环

"思考—行动—观察"交替的智能体工作模式:模型先输出思考内容,再决定调用工具或给出最终答案,工具返回观察后进入下一轮。ParSer 的主代理正是以 ReAct 方式驱动散射-聚合:思考后要么通过 query_agents 工具向所有子代理广播查询,要么输出 标签包裹的最终答案。

主代理的推理接口完全是 ReAct 式工具调用;论文还特意采用骨干模型原生的多轮工具调用格式,从而省去格式奖励,这是其训练设计的一个巧妙之处。

RLVR 与 GRPO

RLVR(可验证奖励强化学习)只用可自动核验的结果(如答案精确匹配 EM)作奖励,无需过程标注。GRPO 对每个问题采样一组 $G$ 个 rollout,用组内相对奖励计算优势 $\hat{A}_{i,t}$,配合 PPO 裁剪 $\min(\rho_{i,t}\hat{A}_{i,t},\ \mathrm{clip}(\rho_{i,t},1-\epsilon,1+\epsilon)\hat{A}_{i,t})$ 与 KL 正则 $\beta D_{\mathrm{KL}}[\pi_\theta\|\pi_{\mathrm{ref}}]$ 更新策略。

ParSer 只对主代理做 RLVR/GRPO 训练,奖励就是二元精确匹配,观察 token 被掩蔽在梯度之外;理解该算法是看懂其训练设置与 RL 消融实验的前提。

Context Rot 与位置偏见

Context Rot 指输入变长时模型精度普遍衰减,即便窗口远未装满;位置偏见(lost in the middle)指位于输入首尾之外中部的证据被系统性忽略。两者共同说明"窗口大"不等于"用得好":真正的瓶颈是如何选择该读什么、按什么顺序推理。

论文用证据位置、逻辑顺序、相互距离三个控制实验证明顺序记忆方法受这些因素剧烈影响,而 ParSer 接近平稳——这是其核心优势的直接实验来源。

KV 缓存与前缀复用

Transformer 推理分 prefill(编码输入,注意力代价 $O(n^2)$)与 decode(逐 token 生成)两阶段;KV 缓存保存已编码 token 的键值避免重复计算。SGLang 的 Radix Cache 可跨请求复用相同前缀的 KV 状态,配合 cache-aware 路由把请求发给已持有该前缀缓存的实例。

ParSer 每个子代理固定绑定同一块、提示词前缀(固定指令+块内容)不变,正是靠前缀 KV 复用把多轮重复读取的 prefill 开销降下来;附录 A 的时延分析也完全围绕这一点展开。

研究动机

长文档推理中,单个问题的证据可能散落在数十万 token 之间。尽管 DeepSeek-V4-Pro 等模型原生支持百万 token 窗口,直接全上下文作答仍随长度急剧退化:论文观测到多跳 QA 上从 7K 到 896K token,全上下文方法掉落数十分——具体在 HotpotQA 上 Qwen3.5-4B 全上下文(think 模式)从 7K 时的 80.47% 跌到 896K 时的 31.25%,非思考模式从 75.78% 跌到 34.38%。既然远未装满窗口精度就已崩塌,瓶颈已不是容量,而是"选什么读、按什么顺序推理"。顺序记忆代理(MemAgent、ReMemR1)用"逐块阅读+递归压缩记忆"绕开窗口限制,却把文档的物理遍历顺序强加给了推理:其一,每块在被压缩时模型尚未看到后文,只能在信息赤字下判断相关性,导致精度依赖证据的绝对位置、逻辑顺序与相互距离——多跳问题中后一跳的关联性往往要等前一跳被发现才浮现,先出现的证据可能在相关性可判定前就被挤出固定容量记忆;其二,$T$ 个块的更新构成不可并行化的依赖链,时延随文档长度线性增长(MemAgent 在 896K、单并发下平均每样本耗时 876 秒)。后续工作(ReMemR1 的回调、GRU-Mem 的门控跳读)只是对这两个症状打补丁,甚至以一方换另一方。

本文的目标是本文的目标是把长文档问答中的"阅读"与"推理"彻底解耦:阅读对文档的覆盖不依赖遍历顺序,也不随文档变长而加深依赖链;推理只按问题本身的逻辑深度进行。具体而言,作者希望构造一个智能体系统,使得:(1) 精度对证据的绝对位置、逻辑顺序、相互距离均不敏感,在 7K–896K 全长度范围保持近乎零波动;(2) 关键路径随推理轮数 $K$ 而非块数 $T$ 扩展($T \gg K$),大幅压缩长文档推理时延;(3) 训练成本与文档长度解耦——只训练一个负责推理的主代理,读文档的子代理用冻结的现成模型即可胜任;(4) 仅用可验证的结果奖励做端到端强化学习,优化主代理的多轮查询策略,不需要任何过程标注或格式奖励。最终目标是让 4B/9B 骨干的小模型系统在分布内 HotpotQA 与分布外 2WikiMultiHopQA 上同时超越顺序记忆基线与原生百万窗口的闭源大模型。

与已有工作不同的是,已有工作在两个极端之间徘徊。单轮 map-reduce 流水线(LLM×MapReduce、ToM)并行读块,但发给各块的查询在阅读开始前就已固定,无法处理"后一跳要靠前一跳才能识别"的多跳问题;LongAgent、XpandA 虽有多轮领导-工人协作,协调协议却靠手工规定而非学习策略;注意力层面的并行编码方案(分块独立编码、注意力层融合)查询无关、单轮且需要架构手术。另一边,MemAgent 系列的顺序记忆虽有 RL 端到端训练的优势,却受制于顺序链这一结构承诺。ParSer 的独特切入是一句观察:"文档的阅读顺序由文档决定,问题的推理顺序由问题决定,顺序记忆方法错在让前者驱动后者"。由此它把文档长度从顺序深度变成并行宽度,把跨块依赖从文档序的记忆传播挪移到问题驱动的查询链上,并把可学习行为收敛到主代理这一最小部件——这个"结构决定训练范围"的推理路径是此前工作未曾给出的。

核心方法

直觉上,ParSer 像一个"散射-聚合"式的研究团队:一位从不接触原文的主管(lead agent)反复向一群图书管理员(subagents)提问,每位管理员只负责文档的一小块且全员并行工作;主管汇总所有回执后,基于已有发现提出更深入的新问题,直到能给出答案。技术路线上,文档 $D$ 被切成 $T$ 个块,每块绑定一个冻结的子代理;主代理以 ReAct 循环运行,第 $k$ 轮散射一个或多个查询给全部子代理并发执行,把返回的证据聚合成观察 $R$,再决定下一轮查询或提交答案,至多 $K$ 轮(训练 $K\le 9$,推理 $K\le 12$)。训练时奖励为二元精确匹配 $r(q,y)=\mathrm{EM}(a_{\mathrm{pred}},a_{\mathrm{gold}})$,用 GRPO 只优化主代理,且观察 token 在策略梯度中被掩蔽;子代理全程冻结(统一用 Qwen3.5-4B 非思考模式)。骨干为 Qwen3.5-4B/9B,全部组件用 SGLang 部署并通过并发请求调度实现真正的并行执行。

核心创新是"并行阅读、顺序推理"的解耦,把文档长度从顺序深度变成并行宽度。与 MemAgent 类方法的本质区别有三。第一,依赖结构反转:顺序记忆需要 $T$ 个相互依赖的压缩步,ParSer 只有 $K$ 轮散射-聚合,每轮内所有块并发读取;由于 $T \gg K$(896K 文档按 4096 token 切成 220 块,而实测平均推理仅约 4 轮),关键路径随推理复杂度而非文档长度扩展。第二,访问对称性:每轮中所有块在同一查询下被对称检查,任何块不因位置被优待、也不在任何单次通过后被永久丢弃;主代理的查询又以历史发现为条件逐轮演化,跨块依赖由"文档顺序的记忆传播"改由"问题驱动的查询链"承载——多跳链条中后一跳的查询是看到前一跳证据之后才构造的。第三,训练范围最小化:子代理的任务(在短块内为明确查询定位证据)简单到现成模型即可完成,因此所有可学习行为集中在主代理,训练代价与文档长度无关,还天然避免了顺序方法学"文档特定摘要生成"所导致的过拟合。

方法步骤详情

全流程四步。第一步,分块绑定:推理时按至多 4,096 token 贪心分块(训练故意用 512 token 以省 prefill 开销 $O(n^2/c)$),每块绑定一个冻结子代理,提示按"固定指令→所辖块→当前查询"排列以启用 KV 前缀复用;子代理只许二元输出——含证据时返回 JSON(逐字引文+简洁答案),否则输出 Unknown,弃权在聚合时被丢弃。第二步,散射:主代理思考后经原生 query_agents 工具把同一或多个查询同时广播给全部子代理,SGLang 并发调度,router 以 cache-aware 策略把请求路由到已缓存该块前缀 KV 的实例,Radix Cache 使后续轮次只需 prefill 新查询后缀。第三步,聚合与迭代:回执聚合成 JSON 观察进入主代理上下文,据此构造更深的后续查询(先查"某电影的导演",再查"该导演死亡日期"),循环至输出 或达轮数上限(训练 $K\le 9$、推理 $K\le 12$);无合法动作时环境回以 InvalidActionHint 继续而非终止。第四步,强化学习:GRPO 组大小 5、学习率 $10^{-6}$、mini-batch 128、预热 70 步、PPO 裁剪 $\epsilon=0.2$、KL 系数 $\beta=10^{-3}$;训练数据为按 MemAgent Stage I 配方从 HotpotQA 合成的 32,768 条样本(每条 200 段落约 28K token,并以 Qwen3.5-9B 无文档作答过滤可凭参数知识解出的题);在 VERL 全异步框架(4 卡 rollout + 2 卡 actor、另 10 卡 H100 跑子代理)上训练 180 步,4B 约 312 小时、9B 约 400 小时。

技术新颖性

技术新颖性有四。(1) 结构层面:此前并行读块工作要么单轮固定查询(map-reduce),要么手工协议(LongAgent/XpandA),ParSer 首次把"查询逐轮演化的多轮散射-聚合"作为可学习策略用 RL 端到端优化,且借助骨干原生多轮工具调用格式免去格式奖励——训练前 10 步格式错误率仅 0.22%/0.66% 并趋近零。(2) 训练层面:"只训编排者、冻结工人"在商业 agent swarm 已有雏形,但落到长上下文并系统论证"读块任务足够简单、冻结可行"是新的:2B 子代理已达 78.26%,4B 即饱和(84.57%),9B 仅再涨 0.2 点;换 thinking 或 DCI 子代理主代理不经重训仍达 85.55%/84.67%。(3) 效率层面:MemAgent 每块要写约 1K token 记忆,ParSer 子代理多数只回 Unknown,作者推导出并行执行下墙钟解码复杂度 $O(nr_S/c^2 + r_S^2/(Kc^2) + r_S r_L + r_L^2)$,显著低于 MemAgent 的 $O((nr_M+r_M^2)/c)$。(4) 分析层面:位置/顺序/距离三控制实验首次把顺序记忆的三种失败模式统一归因于"容量受限、按文档序递归压缩"这一结构根源。

Comparison between ParSer and sequential memory methods. (a) Sequential memory traverses T chunks through a chain of dependent reading steps. (b) ParSer turns the chunks into parallel width: at each round, all chunks are read concurrently under the same question-conditioned query, while reasoning proceeds across rounds.
Figure 1: Comparison between ParSer and sequential memory methods. (a) Sequential memory traverses T chunks through a chain of dependent reading steps. (b) ParSer turns the chunks into parallel width: at each round, all chunks are read concurrently under the same question-conditioned query, while reasoning proceeds across rounds.
Training dynamics of the Qwen3.5-4B and Qwen3.5-9B lead agents over 180 reinforcement-learning steps.
Figure 4: Training dynamics of the Qwen3.5-4B and Qwen3.5-9B lead agents over 180 reinforcement-learning steps.
Success case 1 (ParSer-9B; HotpotQA, 6400-paragraph): the lead agent broadcasts two birth-date queries that execute simultaneously, gathers subagent findings, and synthesizes a comparative answer.
Figure 5: Success case 1 (ParSer-9B; HotpotQA, 6400-paragraph): the lead agent broadcasts two birth-date queries that execute simultaneously, gathers subagent findings, and synthesizes a comparative answer.
Success case 2 (ParSer-9B; 2WikiMultiHopQA, 6400-paragraph): the lead agent first retrieves the film's director, then queries the birth date and synthesizes the answer.
Figure 6: Success case 2 (ParSer-9B; 2WikiMultiHopQA, 6400-paragraph): the lead agent first retrieves the film's director, then queries the birth date and synthesizes the answer.

实验结果

主结果(Table 1,Sub_EM%,8 个长度档平均):分布内 HotpotQA 上 ParSer-4B 平均 84.57、9B 86.79,分别超最强顺序记忆基线 ReMemR1(78.91)与 MemAgent(80.05)5.7 和 6.7 点;最长 896K 档差距拉大到 12.0 与 9.9 点(85.42 vs 73.44;85.94 vs 76.04),顺序方法急剧退化而 ParSer 几乎零波动;9B 版本还超百万窗口、推理强度设为 Max 的 DeepSeek-V4-Pro(80.47)6.3 点。分布外 2WikiMultiHopQA 上 ParSer-4B/9B 达 87.04/88.48,比 ReMemR1(77.41/79.27)高 9.6/9.2 点,而 MemAgent-4B 仅 60.61,说明冻结读端的解耦设计能避免顺序方法对训练文档格式的过拟合。时延(Table 2):896K 档并发 1 时 78.22 秒 vs MemAgent 876.20 秒(11 倍),并发 16 时 58.86 vs 101.94 秒(1.7 倍);Figure 3 显示 ParSer 推理步数几乎恒定(3.9–4.13 步)而 MemAgent 从 4.1 涨到 183.58 步。控制实验(各 512 题、894K 文档):位置控制中 MemAgent 在证据位于 50–70 百分位时明显下跌,ParSer 平稳(约 79–87%);顺序控制中逆序后两顺序方法跌至约 23–67%,ParSer 保持约 82–89%;距离控制中顺序方法单调退化至约 44–50%,ParSer 稳定。消融显示 RL 贡献约 10 点(74.42→84.57;76.24→86.79),去分块掉到 73.76 且块越大越差(131K 块 80.34)。

Long-context QA results on HotpotQA (In-Distribution) and 2WikiMultiHopQA (Out-of-Distribution). Values are accuracy (Sub_EM, %).
Table 1: Long-context QA results on HotpotQA (In-Distribution) and 2WikiMultiHopQA (Out-of-Distribution). Values are accuracy (Sub_EM, %).
Amortized wall-clock inference time per sample (seconds), across document lengths under concurrency of 1, 16, and 32.
Table 2: Amortized wall-clock inference time per sample (seconds), across document lengths under concurrency of 1, 16, and 32.
Effect of subagent size on HotpotQA (Sub_EM, %). The lead agent is fixed as Qwen3.5-4B.
Table 3: Effect of subagent size on HotpotQA (Sub_EM, %). The lead agent is fixed as Qwen3.5-4B.
Effect of chunk size on HotpotQA (Sub_EM, %). All variants are based on Qwen3.5-4B.
Table 4: Effect of chunk size on HotpotQA (Sub_EM, %). All variants are based on Qwen3.5-4B.
Comparison of alternative subagent implementations with their full-context counterparts on HotpotQA (Sub_EM, %). All agents are built on Qwen3.5-4B.
Table 5: Comparison of alternative subagent implementations with their full-context counterparts on HotpotQA (Sub_EM, %). All agents are built on Qwen3.5-4B.
Ratio of ParSer to MemAgent decoding computation under each document length (Appendix A).
Table 6: Ratio of ParSer to MemAgent decoding computation under each document length (Appendix A).
Effect of reinforcement learning on HotpotQA and 2WikiMultiHopQA. Values are accuracy (Sub_EM, %).
Table 7: Effect of reinforcement learning on HotpotQA and 2WikiMultiHopQA. Values are accuracy (Sub_EM, %).
Statistics of training and evaluation data.
Table 8: Statistics of training and evaluation data.
Training hyperparameters for ParSer.
Table 9: Training hyperparameters for ParSer.
Performance under controlled evidence distributions. (a) Evidence position: supporting evidence is placed within different percentile ranges of 894K-token documents. (b) Evidence order: evidence-bearing paragraphs in 894K-token documents either follow or reverse their logical dependency order. (c) Evidence distance: the number of intervening paragraphs between two pieces of supporting evidence is varied.
Figure 2: Performance under controlled evidence distributions. (a) Evidence position: supporting evidence is placed within different percentile ranges of 894K-token documents. (b) Evidence order: evidence-bearing paragraphs in 894K-token documents either follow or reverse their logical dependency order. (c) Evidence distance: the number of intervening paragraphs between two pieces of supporting evidence is varied.
Inference step counts of MemAgent and ParSer across lengths.
Figure 3: Inference step counts of MemAgent and ParSer across lengths.
MemAgent (4B)'s memory updates on the reverse-evidence sample. Death dates in paragraphs 483 and 3911 are skipped because their link to the question is not yet known; later updates keep only the two director names. Intermediate steps are omitted.
Figure 11: MemAgent (4B)'s memory updates on the reverse-evidence sample. Death dates in paragraphs 483 and 3911 are skipped because their link to the question is not yet known; later updates keep only the two director names. Intermediate steps are omitted.
查看结构化数据
任务指标本文基线提升
HotpotQA 长文档多跳QA(分布内,7K–896K 平均,4B 骨干) Sub_EM (%) ParSer-4B:84.57 ReMemR1-4B:78.91(最强顺序记忆基线) +5.7 点
HotpotQA 长文档多跳QA(分布内,7K–896K 平均,9B 骨干) Sub_EM (%) ParSer-9B:86.79 MemAgent-9B:80.05;DeepSeek-V4-Pro(think-max,1M 窗口):80.47 +6.7 点 / +6.3 点
HotpotQA 最长档 896K token(6400 段落) Sub_EM (%) ParSer-4B:85.42;ParSer-9B:85.94 ReMemR1-4B:73.44;MemAgent-9B:76.04 +12.0 点 / +9.9 点
2WikiMultiHopQA 长文档多跳QA(分布外,4B 骨干) Sub_EM (%) ParSer-4B:87.04 ReMemR1-4B:77.41;MemAgent-4B:60.61 +9.6 点 / +26.4 点
2WikiMultiHopQA 长文档多跳QA(分布外,9B 骨干) Sub_EM (%) ParSer-9B:88.48 ReMemR1-9B:79.27 +9.2 点
896K token 单并发推理时延(每样本平均) 秒/样本 ParSer:78.22 s MemAgent:876.20 s 约 11.2 倍加速
896K token 并发 16 推理时延(每样本平均) 秒/样本 ParSer:58.86 s MemAgent:101.94 s 约 1.7 倍加速
推理步数随文档长度(50→6400 段落) 平均步数 ParSer:3.9–4.13 步,几乎不变 MemAgent:4.1→183.58 步,线性增长 步数与文档长度解耦

局限与改进

作者承认的核心局限是"上下文隔离"失败模式(Figure 9):子代理只看到查询和自己的块、看不到主代理的推理轨迹;查询有歧义时("Princess Elene of Georgia 的丈夫是谁"),某子代理把块内同名人物 Elena(俄国大公夫人)误当目标,返回看似直接的错误证据"Her husband was Prince Nicholas of Greece and Denmark",主代理又无法回溯源文本核验相关性,最终压过另一子代理支持的正确答案 Prince Archil of Imereti 而答错。作者还承认高并发下优势收窄:KV 缓存被逐出时子代理每轮需重新 prefill 所辖块,聚合 prefill 从 $O(n^2/c)$ 涨到 $O(Kn^2/c)$($K=4$ 时为 MemAgent 的 4 倍),对应并发 16/32 下加速比从 11 倍缩到 1.7 倍。我的补充观察:评测全部是"干扰段落填充"式合成多跳 QA 且每档仅 128 题,与真实整本长文档(书籍、法律卷宗)的篇章结构差异较大;每轮广播全部块使 prefill 总量可能反超顺序方法(作者承认取决于 KV 复用是否可用),吞吐敏感的小规模部署未必划算;Sub_EM 只适配短可精确匹配的答案,聚合统计类(全文计数、主题归纳)与生成式任务未检验;训练 512 token 块 vs 推理 4096 块、轮数 9 vs 12 的刻意不一致,在更难任务上可能放大不确定性。

独立分析的弱点

独立分析至少四个弱点。(1) 广播式查询的算力浪费:无论问题多简单,每轮都唤醒全部 $T$ 个子代理(896K 文档即 220 个块),虽然多数只回 Unknown,prefill 仍在累积。改进方向:让主代理先用 BM25/嵌入检索粗筛缩小广播范围,或学习"区域先验"只激活可能相关的子代理。(2) 上下文隔离导致的证据误绑是结构性缺陷(Figure 9 的 Elena 案):子代理无全局目标、主代理无源文本可查。改进方向:让子代理返回带块编号的逐字引文,允许主代理发起"验证式复查查询",或在奖励中加入证据一致性校验信号,强制交叉验证后再作答。(3) 任务面窄:Sub_EM 式多跳 QA 答案短且可精确匹配,开放摘要、全文聚合、长文本生成等任务上散射-聚合的汇报格式与奖励设计均未验证。改进方向:扩展到生成式评测(如 QuALITY、长文档写作与 RAG 忠实度)并引入基于模型的评判奖励。(4) 训练-推理不一致(512 vs 4096 块、9 vs 12 轮)是作者为省 prefill 而有意为之,但 Table 4 表明性能对块大小敏感(无分块 73.76、131K 块 80.34),不一致在更难任务上可能被放大。改进方向:训练中做块大小课程学习或多尺度采样,弥合分布差距。

未来方向

作者方向上:训练动态显示主代理每轮并行查询数自发从 1.06 升到 1.62(奖励并未显式鼓励),说明可显式奖励"无依赖查询并行广播"进一步压低轮数与时延;针对 KV 驱逐问题,可引入分层缓存或把块级 KV 常驻专用显存池,保住高并发下的 prefill 优势。基于成果可延伸:(1) 把冻结子代理替换为检索式(论文已验证 DCI 子代理可插拔,84.67%)或领域专用小模型,形成"主代理一次训练、子代理自由升级"的生态;(2) 与稀疏注意力、线性注意力等架构创新正交组合——它们解决"读的代价",ParSer 解决"选什么读、按什么顺序推理";(3) 把散射-聚合推广到多文档、多模态、代码库语料:其"覆盖由构造保证"(每块必被查询)的特性在检索无法保证全覆盖的场景更有价值;(4) 训练数据目前仅 HotpotQA 合成样本,可引入更真实的整本文档 QA 与过程奖励结合,检验推理策略的泛化边界;(5) 附录 A 的时延模型可扩展为考虑排队论的高并发服务模型,指导子代理池弹性伸缩与主/子代理算力配比。

复现评估

复现条件较好但工程门槛不低。数据与配方公开:训练集按 MemAgent Stage I 公开配方构建(41,027 条 HotpotQA 源问题处理出 32,768 条 200 段落、约 28K token 样本),评测复用 MemAgent 发布的 HotpotQA 测试集并用 ReMemR1 公开脚本重建 2WikiMultiHopQA;相关仓库包括 BytedTsinghua-SIA/MemAgent、syr-cn/ReMemR1、DCI-Agent/DCI-Agent-Lite,论文还完整给出主/子代理提示词、全部超参数(Table 9)与训练动态曲线。算力需求:训练需 6 张 H100(4 rollout + 2 actor)加 10 张 H100 部署子代理,180 步耗时 312 小时(4B)/400 小时(9B),合计数千 GPU 时,实验室可负担、个人难复刻;推理部署则很轻(一张 H100 跑子代理 + 一张 RTX3090 跑主代理)。主要障碍:论文未声明自身代码开源(仅项目页 cuhk-parser.github.io),复现需自行拼装 VERL(Megatron 后端、全异步)+ SGLang(Model Gateway、Radix Cache、cache-aware router)工程栈;另注意每档仅 128 题、Sub_EM 实为双向子串匹配(与原论文单向定义有出入,作者已如实注明),数值存在统计噪声。综合评估为中偏上难度:配方齐全,难在工程整合。