← 返回 2026-08-25

同一智能体,不同答案:检索增强问答中语料诱发答案漂移的重复感知审计 Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA

Jingjie Ning, Xueqi Li 📅 2026-08-24 👍 4 2026-08-30 18:30
LLM-as-a-Judge RAG评估 向后兼容 回归测试 检索增强生成 答案漂移

语料扩容能让固定的RAG系统答案系统性漂移,而总准确率几乎纹丝不动。

前置知识

检索增强生成(RAG)

一种让大语言模型在回答之前先从外部语料库检索相关文档、再把检索结果拼进提示词一起生成的架构。系统由检索器(稀疏或稠密检索)和生成器组成,最终答案既依赖模型参数也依赖实际检索到的证据。本文的场景是严格的单轮“检索器+生成器”:查询固定、每次检索top-8文档、一次性生成答案,不涉及多步规划、查询改写或工具调用。

本文研究的核心对象就是这类系统:当唯一变化的是可访问语料规模(索引从1个shard扩到7个)而模型、提示词、检索深度全部锁定时,答案行为是否保持稳定。

答案漂移 / 预测漂移(answer churn / prediction churn)

指系统输入完全不变、但模型版本或服务状态更新后,同一输入得到不同输出的现象。经典机器学习里叫 prediction churn(模型更新导致逐样本预测翻转),在RAG里对应索引重建或语料扩充导致答案改变。漂移本身不必然是坏事,但会破坏缓存一致性、回归测试和下游自动化流程的稳定性。

本文定义的“超额答案漂移”(excess answer churn)是对这一概念的随机化推广:把更新引起的跨快照分歧减去同一快照重复调用的自然分歧,得到净效应。

精确匹配(EM)与归一化

开放域问答最常用的自动指标:把模型答案和标准答案做小写化、去冠词、去标点等归一化后,比较整串是否相等,相等记1否则记0。它对别名(如不同船名指同一物体)、长答案包含正确片段等情况都会判错,且完全忽略语义等价。本文同时报告EM和“盲评语义等价”两种相似度核以互补。

论文的关键发现之一是EM在“匹配↔不匹配”之间的对冲流动会掩盖真实行为变化:NQ上46/800与34/800的双向流动净差只有-1.50pp,但毛流动高达10%。

核两样本检验与MMD

最大均值差异(Maximum Mean Discrepancy)衡量两个分布在某个核函数下的距离。对正定核,$2D_i(k)$ 恰好是两个条件答案分布 $P^L_i$ 与 $P^H_i$ 之间平方MMD的无偏两样本估计,是“两个分布是否相同”的非参数检验统计量。

本文的漂移估计量 $\hat{D}$ 在精确匹配核下正是这个量的一半:即使两个答案分布的平均EM完全相同,只要概率质量重新分配它就为正——这正是“准确率盲区”的数学化,理解这层联系才能明白为什么要减去重复基线。

全问题 Bootstrap 重采样

一种非参数统计推断方法:把每个问题(连同其全部8个答案和28对语义判断)作为独立抽样单元,有放回地重抽5万次,每次重算统计量,从而得到置信区间。以问题为重采样单元可以保留同一问题内部答案之间的相关性,避免伪复制。

论文所有结论(如NQ语义漂移的单侧95%置信下界7.688pp)都由该流程产生,且预注册判定门槛直接依赖这些区间,是读懂结果表的前提。

LLM-as-a-Judge 与盲评

用大模型给开放式文本打分或做两两比较的评估范式,已知缺陷包括位置偏差和自偏好(裁判偏袒自己家族生成的内容)。本文的语义核采用严格盲评:裁判只看到问题和8个匿名答案,不告知答案来自哪个语料规模、是否为重复调用、是否正确,每题判断全部28个无序答案对。

语义漂移10.25pp这个头条数字完全依赖这种判断的可靠性;论文另用OpenAI gpt-5.6-sol做跨家族复核(对标签一致率95.71%、$\kappa=0.855$)以排除同族偏袒解释。

研究动机

RAG系统的索引不是静态的:网页集合持续演化,爬取与刷新策略决定搜索系统能暴露什么内容;生产索引会增长、文档会被刷新、检索基础设施会重建。但这类变化几乎总是只通过聚合效用(平均准确率)来评估,这带来两个被忽视的具体问题。其一,聚合准确率会掩盖行为变化:假设400题中46题从EM匹配变为不匹配、34题反向流动,净差仅-12/800=-1.50pp,仪表盘看起来“几乎没变”,但实际有80/800(10.00%)的正确性翻转,另有155/800(19.38%)的题目在两个语义不同的EM不匹配答案之间切换——这类变化在二值准确率里完全不入账。其二,单次对比会高估更新效应:LLM生成是随机的,同一快照重复调用本身就会产生分歧(NQ同快照语义重复分歧已有10.875%、精确匹配重复分歧高达74.750%),把“答案变了”全部归因于语料更新会严重夸大效应。论文用实例说明后果:问“达斯·维达的歼星舰”,1个shard时系统两次都答The Devastator,7个shard时两次都答The Executor;问“谁扮演Jill Bigelow”,扩容后从两次UNKNOWN变成两次Polly Walker。当答案喂给缓存、回归测试、自动化工作流或人类决策时,这种“平衡中的改变”是真实的运营风险。

本文的目标是本文要回答一个此前几乎无人形式化的问题:当检索增强QA系统的可访问语料扩容、而模型标识符、提示词、检索策略、证据深度、渲染方式和暴露的生成控制全部锁定时,系统的答案级行为是否与旧快照“行为可互换”(behaviorally interchangeable)?作者把评估目标显式拆成两个正交维度:效用(utility,新快照平均是否更好)与兼容性(compatibility,新快照是否保留了用户和下游应用已经观察到的行为)。具体目标包括四个层次:(1) 定义并估计一个扣除同快照重复分歧后的“超额答案漂移” $\hat{D}$,用归一化精确匹配和盲评语义等价两种核函数度量;(2) 在预注册的确认性实验(400题Natural Questions)中检验漂移是否真实存在,门槛是预注册的精确核 $\hat{D}\geq 3$pp 且两个单侧95%置信下界均为正;(3) 用独立预注册的TriviaQA研究、换生成器与服务配置的子集复制、以及跨裁判家族审计检验稳健性;(4) 提炼可操作的四阶段发布审计流程,主张检索增强系统的发布应与模型版本更新一样接受兼容性审计。

与已有工作不同的是,现有工作留下一个明确空档。语料规模扩展研究(如万亿token数据store的缩放实验)只报告聚合效用变化;RAG评估框架(RAGAS、ARES、RAGChecker、RAGTruth)关注相关性、忠实度、组件错误和幻觉;鲁棒性研究(RGB、知识冲突、Stable-RAG等)通过人工构造的上下文扰动测答案一致性,扰动是外部注入的;时间感知QA(StreamingQA、RealTime QA、FreshLLMs)处理事实随时间变化,但那是“世界变了”,不是“可访问语料变了”;行为兼容性与预测churn文献(模型更新回归、向后兼容训练、MUSCLE等)改的都是模型权重而非检索语料。本文的独特切入是:固定查询、生成器与检索深度,让证据随嵌套语料前缀 $n_1\subset n_3\subset n_7$ 内生地变化,在“单次对比”与“构造扰动”之间走出第三条路——用重复调用把同快照生成噪声与跨快照漂移在统计上分离。作者还明确把估计量定位为“路径特定的语料关联对比”而非普遍缩放定律,这种克制的因果表述也区别于常见的过度声明。

核心方法

直觉上,要判断“语料扩容是否真的改变了答案”,必须先知道“什么都不改时答案本身有多不稳定”。本文的整体思路因此是差分式的:对同一批问题,在旧快照(1个shard)和新快照(7个shard)下各独立调用生成器两次,然后比较“跨快照分歧”与“同快照内重复分歧”之差。技术上,设 $k\in[0,1]$ 为答案相似度核。对问题 $i$,记旧/新快照的两次回答为 $L_{i,a},L_{i,b}$ 与 $H_{i,a},H_{i,b}$,定义同快照一致度 $w_i=\frac{1}{2}[k(L_{i,a},L_{i,b})+k(H_{i,a},H_{i,b})]$,跨快照一致度 $c_i=\frac{1}{4}\sum_{r\in\{a,b\}}\sum_{s\in\{a,b\}}k(L_{i,r},H_{i,s})$,则超额答案漂移为 $\hat{D}=\frac{1}{N}\sum_{i=1}^{N}(w_i-c_i)$。它有一个等价写法 $\hat{D}=(1-\bar{c})-(1-\bar{w})$:第一项是观测到的跨状态分歧,第二项是同状态噪声地板。推断以整个问题为重采样单元做5万次bootstrap。证据按“问题-状态”锁定,使重复只度量生成器变异而非检索变异。使用两种共主核:归一化精确匹配核与盲评语义等价核(每题8个匿名答案的全部28个无序对,在金标答案解锁之前判断完毕)。$\hat{D}>0$ 意味着答案在快照之间的移动超出了同一快照重复调用的自然波动。

核心创新是把“预测churn/向后兼容”的噪声校正思想从确定性分类器迁移到随机生成系统,并用数据证明这一步不可或缺:NQ上跨规模语义分歧为21.125%,但同规模重复分歧已达10.875%,差值才是10.25pp的真实效应;精确匹配下原始跨规模分歧81.188%,其中74.750%在语料不变时也会出现,剩下6.438pp。用原始“答案变了”指示器会把效应高估约一倍;反过来,若只看EM,46/800与34/800的对冲流动会把10%的毛流动压缩成-1.50pp的净变化,几乎不可见。$\hat{D}$ 因此同时防两类错误:把生成噪声误当更新效应(假阳性),以及用聚合净分掩盖逐题翻转(假阴性)。在精确等价核下,总体版本 $D_i(k_{exact})=\frac{1}{2}\sum_{y}(p_{i,L}(y)-p_{i,H}(y))^2$ 恰是两个条件答案分布间平方MMD的一半——即使平均EM相同,只要概率质量重新分配它就为正,这正是“准确率盲区”的数学化。另一个关键设计是双重盲评(对裁判隐藏规模/证据/金标)加交集-union判定规则:NQ需同时满足 $\hat{D}\geq 3$pp、精确核单侧95% LCB>0、语义核单侧95% LCB>0 三道门,任何次要结果都不能“救活”未过门槛的主张。

方法步骤详情

实验流程严格分阶段加锁。第一步,冻结比较对象:从3,610题NQ测试工件中排除此前2,400个开发题ID,按预注册SHA-256顺序(种子20260810)哈希选出前400题,不做任何可答性/主题/结果过滤;TriviaQA独立用种子20260813从9,951题RC-Web验证集选200题;问题和选择哈希先冻结、金标别名不发放。第二步,构造处理:语料是DeepResearchGym上的FineWeb索引,预先划分为7个shard,接口只暴露固定嵌套前缀,评估 $n_0$(无检索)、$n_1$、$n_3$、$n_7$ 四个状态,非零规模下固定检索top-8文档(含ID、URL、至多1,200字符压缩文本)。第三步,锁定检索:主检索与审计检索进独立空缓存,NQ全部1,200+1,200个cell、TriviaQA 600+600个cell在有序文档ID和渲染证据字节上100%精确一致。第四步,锁定生成:deepseek-v4-flash经Claude CLI适配器、单例模式、低推理努力、工具禁用、固定JSON schema、答案≤512字节;每题每状态用同一提示+锁定证据调用两次,用Williams顺序做对抗平衡且第二次重复反转顺序,共收4,800个有效答案(NQ 3,200、TriviaQA 1,600),UNKNOWN与EM不匹配输出照单接受、不做选择性重抽。第五步,盲评语义:每题8个答案匿名标注,28个无序对全部判断后才解析金标。第六步,推断与门槛:预注册5万次全问题bootstrap,NQ需过三道门。第七步,事后诊断:锁定主分析后定义严格“重复稳定翻转”(式7:两个状态内部重复语义一致、且全部四个跨状态对不一致)、证据重叠分解、规模阶梯轨迹,以及换用deepseek-v4-pro的100题结果盲子集复制和OpenAI gpt-5.6-sol的50题跨家族裁判审计。

技术新颖性

新颖性可从四个层面看。概念层:首次命名并形式化“准确率盲答案漂移”(accuracy-blind answer churn)——语料扩容可在聚合效用几乎不动时使新快照与旧快照行为不兼容,并把兼容性与效用定义为正交的评估维度。统计层:给出随机生成系统下的超额漂移估计量 $\hat{D}$,证明两次重复是估计同状态基线的最小设计(单次对比只能观测 $(1-\bar{c})$,会把普通解码变异归咎于更新),并建立与核两样本检验/MMD的联系(正定核下 $2D_i(k)$ 是平方MMD;有限样本负值保留不截断)。实验设计层:预注册加分阶段加锁(检索锁、答案锁、盲评锁、金标解锁)、不可变attempt记录、SHA-256哈希选题、Williams顺序对抗平衡,这套“诚实评估流水线”在RAG语料研究里极为罕见;再用独立预注册的第二个基准、换生成器与serving配置的子集复制、跨裁判家族审计形成三角验证。诊断层:严格“重复稳定翻转”诊断与EM迁移分解(图3)揭示了二值EM完全看不见的“不匹配→不同不匹配”流动(NQ占19.38%)。与最近邻工作的本质区别:Stable-RAG等固定检索集做置换,本文让证据随语料内生变化;churn文献改权重,本文改索引;“同智能体”指模型标识、提示、检索策略、深度、渲染与生成控制全部固定,唯一自由度是可访问语料。

Overview of the Snapshot Compatibility Audit for a corpus update to a fixed single-turn retriever-generator.
Figure 1: Overview of the Snapshot Compatibility Audit for a corpus update to a fixed single-turn retriever-generator.

实验结果

确认性结果(NQ,400题,预注册):$n_1\to n_7$ 使归一化精确一致度从同快照25.250%降到跨快照18.813%,$\hat{D}=6.438$pp(单侧95% LCB 4.563,双侧CI [4.188, 8.750]);盲评语义一致度从89.125%降到78.875%,$\hat{D}=10.250$pp(LCB 7.688,CI [7.188, 13.438]);而EM只移动-1.50pp。三条预注册门槛全部通过,且0%的bootstrap抽样出现 $\hat{D}\leq 0$。支持性结果(TriviaQA,200题):精确/语义 $\hat{D}=3.000/2.125$pp(LCB 0.500/0.375),但EM反向移动+1.25pp——漂移的存在与效用变化方向无关。事后V4-Pro复制(100题结果盲子集):精确/语义 $\hat{D}=7.25/8.75$pp(LCB 3.25/4.75),同时EM从38.00%升到41.00%(+3.00pp,CI含0);同题V4-Flash为6.25/9.25pp且EM零变化,配对差区间含0。严格翻转诊断:40/400 NQ题与5/200 TriviaQA题满足式7,NQ的40个翻转贡献了10.25pp语义 $\hat{D}$ 中的10.00pp;翻转题中35/40的四个端点答案全是EM不匹配——对二值EM完全不可见;仅2/40有逐字相同的重复,说明是语义而非字面现象。机制线索:端点top-8检索集平均只共享1.19/8(NQ)和1.09/8(TriviaQA)个文档,27.75%/29.50%的问题零重叠、无一问题检索集全同,但跨规模语义一致度仍有78.88%/94.63%——剧烈证据换血下多数答案稳定,漂移集中于小子集(翻转题平均重叠0.825 vs 非翻转1.231,但分箱效应非单调)。规模阶梯:相邻步翻转33/29/26题(NQ)、3/5/2题(TriviaQA),三个相邻翻转集的并集含59题,其中6题呈 $X\to Y\to X$ 回摆。闭卷EM在每个规模都最高(NQ 17.625% vs 检索后15.125%),说明此设置下通用FineWeb检索无效用收益。跨家族裁判:gpt-5.6-sol与原判在1,340/1,400(95.71%)对标签上一致($\kappa=0.855$,43/50题分区完全一致),同一样本语义 $\hat{D}$ 为9.50pp(原判)vs 11.00pp(跨家族判)。

Locked experimental design.
Table 1: Locked experimental design.
Preregistered n1→n7 excess answer churn.
Table 2: Preregistered n1→n7 excess answer churn.
Illustrative post-hoc NQ answer trajectories from the frozen ledger.
Table 3: Illustrative post-hoc NQ answer trajectories from the frozen ledger.
Post-hoc trajectory decomposition.
Table 4: Post-hoc trajectory decomposition.
Semantic excess churn stays positive as endpoint exact match falls or rises.
Figure 2: Semantic excess churn stays positive as endpoint exact match falls or rises.
Matched-repeat EM transition composition from n1 to n7.
Figure 3: Matched-repeat EM transition composition from n1 to n7.
Post-hoc distribution of exact document-ID overlap between the n1 and n7 top-eight retrieval sets.
Figure 4: Post-hoc distribution of exact document-ID overlap between the n1 and n7 top-eight retrieval sets.
查看结构化数据
任务指标本文基线提升
NQ 确认性实验 n1→n7(归一化精确核) 超额答案漂移 D̂(百分点) 6.438(单侧95% LCB 4.563,CI [4.188, 8.750]) 同快照重复基线:跨快照一致度18.813% vs 同快照25.250%;原始未校正跨规模分歧81.188%会被高估 超过预注册3pp门槛约2.1倍;EM净变化仅-1.50pp,几乎不报警
NQ 确认性实验 n1→n7(盲评语义核) 超额答案漂移 D̂(百分点) 10.250(LCB 7.688,CI [7.188, 13.438]) 跨快照语义一致度78.875% vs 同快照89.125%;未校正原始值21.125%虚高一倍 约为EM净变化(-1.50pp)的6.8倍;0%的bootstrap抽样 D̂≤0
TriviaQA 支持性验证 n1→n7 归一化精确 / 语义 D̂(百分点) 3.000 / 2.125(LCB 0.500 / 0.375) 同快照基线:精确64.500%、语义96.750%内部一致;抽样中2.764%/2.174%出现 D̂≤0 方向一致但幅度更小;同时EM反向移动+1.25pp,证明漂移与效用方向解耦
NQ-100 事后复制(V4-Pro 生成器+独立服务配置) 精确 / 语义 D̂(百分点) 7.25 / 8.75(LCB 3.25 / 4.75;CI [2.50,12.50] / [4.00,14.25]);EM 38.00%→41.00%(+3.00pp) 同题V4-Flash:6.25 / 9.25,EM零变化;配对差区间 [-4.75,6.75] / [-6.75,5.75] 均含0 换生成器与serving配置后漂移复现,且在EM上升3pp时依然存在
跨家族语义裁判审计(OpenAI gpt-5.6-sol,50题/1,400对) 与原判对标签一致率 / Cohen's κ 95.71%(1,340/1,400)/ 0.855;43/50题28对分区完全一致;同样本语义 D̂ 11.00pp vs 原判9.50pp DeepSeek 同族裁判 排除同族自偏好解释,但作者明确不替代人类验证
严格重复稳定语义翻转(式7诊断) 翻转题数及对 D̂ 的贡献 NQ 40/400(贡献10.00pp/共10.25pp);TriviaQA 5/200(贡献2.50pp);V4-Pro 6/100 EM迁移分解:NQ 46升34降净-1.50pp;TriviaQA 30降35升净+1.25pp 35/40个NQ翻转的四个端点答案全是EM不匹配——二值指标完全不可见

局限与改进

作者明确承认的边界:处理被定义为“一条冻结路径上的总行为差异”——shard顺序固定,名义规模与新增文档的身份/排序效应完全混杂,未随机化shard子集也没有足够独立路径,因此不能给出“更多语料→多少漂移”的普适缩放曲线或剂量响应定律;机制只能到达“证据换血”与“翻转题检索重叠更低”这类相关性提示,无法定位是哪个文档改变了哪个答案。外部效度:只有一个生成器家族(两个serving配置)、一个搜索服务、一个FineWeb索引、top-8证据深度、两个英文开放域QA基准;V4-Pro复制同时改了模型与传输层,不是纯模型效应;通用FineWeb检索在本设置下反而降低EM,因此这项工作既未证明检索的效用收益,也不代表优化过的生产RAG栈。构念效度:精确核会把风格差异计为分歧,语义核可能合并真正不同的答案或拆分可接受的别名,所以两者都报;成对判断偶尔非传递,作者保留而非修复;“重复稳定”仅是两次调用意义上的语义一致,不是逐字稳定、校准置信或事实正确;EM不匹配也不等于错误(长答案包含引用会整串判错)。抽样层面:每状态两次回答是估计噪声基线的最小配置,对条件输出分布刻画粗糙;bootstrap只量化冻结队列内的问题抽样不确定性,不覆盖其他语料划分、提示词或部署日期。我的补充观察:语义 $\hat{D}$ 的取值范围本质上由裁判模型对“合理别名下事实等价”的定义决定,50题跨家族审计虽强但无人类金标;每题28对的盲评成本随答案数平方增长,落地到大规模索引更新流水线的经济性未讨论;作者自己也指出单轮估计量既不是轨迹级兼容性的估计量也不是其下界,多步智能体场景完全未覆盖。

独立分析的弱点

弱点一:单路径处理。$n_1\subset n_3\subset n_7$ 是一条固定shard路径,“规模”与“这条路径上恰好新增了哪些文档”完全混杂;换一条路径可能得到不同甚至符号相反的 $\hat{D}$。改进方向:随机抽取多条嵌套路径,把路径当随机因子做混合效应/分层估计,报告路径间方差,才能谈“语料增长的典型漂移水平”。弱点二:两次重复构成的噪声基线很粗糙——它只能给出条件输出分布的粗略视图,若某题的概率质量弥散在三个以上答案之间,$w_i$ 的两样本估计方差会很大。改进方向:对高不确定性问题自适应增加重复次数(序贯设计),或引入moment方法类的不确定性量化以压缩方差。弱点三:语义裁判的构念风险。盲评加跨家族审计缓解了偏差,但“合理别名下事实等价”的定义最终由裁判模型决定,50题审计没有人类金标;非传递标签被原样保留会引入噪声。改进方向:对翻转题的28对标签做人工裁决子样本,报告人类-裁判一致性κ。弱点四:实验设置里闭卷EM反而最高(17.625% vs 15.125%),即检索没有带来效用收益,读者无法判断在“检索真正有用”的生产配置中churn是否同样显著。改进方向:在检索有正收益的配置(更强检索器、长尾知识问题集)上重复实验。弱点五:诊断依赖top-8文档ID重叠,但作者自己列出的目标场景(索引refresh、检索器替换、chunking/去重变更、外部记忆变更)一个都没实测,证据换血与答案漂移之间仍是相关性而非因果。改进方向:设计干预式实验——固定top-8文档集、只改变其排序或渲染顺序,分离“证据集变化”与“证据呈现变化”各自的贡献。

未来方向

作者提出的方向:跨模型家族、检索器、任务类型、随机语料路径与真实时间性索引刷新(而非冻结快照)的复制,以确定现象的普遍流行度和是否存在的缩放曲线;把协议延伸到输出之外的接口审计——索引refresh、检索器替换、chunking或去重变更、外部记忆变更;测量多步/智能体系统中单轮分歧如何沿轨迹传播或被下游纠正(作者声明单轮估计量不是轨迹级兼容性的估计或下界);将会话记忆评估纳入协议适用范围(引LongMemEval,明确标注为拟议扩展而非实证主张);以及人类语义验证。基于本文成果可以自然延伸的:把 $\hat{D}$ 变成CI/CD流水线里的回归门禁——与单元测试并列的“兼容性预算”,语义 $\hat{D}$ 超过应用特定阈值即阻止索引发布,并研究阈值与业务损失的校准方法;在答案分布的核嵌入空间估计连续版漂移,以捕捉作者指出严格翻转诊断可能漏掉的“弥散性概率移动”;研究churn与效用的帕累托前沿——是否存在既提升效用又压低漂移的索引构建与文档去重策略(类比MUSCLE对模型权重做的事);把翻转题的低检索重叠(0.825 vs 1.231)发展为前置风险信号,做发布前的“漂移预警”而非事后审计;在歧义问题(AmbigQA式多合法答案)和跨语言场景下重新定义语义等价核,检验 $X\to Y\to X$ 回摆(59题并集中6题)背后的“不稳定中间规模”假说。

复现评估

复现条件在同类工作中属于相当好的水平。作者提供匿名化工件:仅ID的manifest、脱敏后的答案与判断cell及attempt记录、终态锁与结果、分析代码、摘要和声明矩阵,覆盖5,200个答案、17,400个DeepSeek裁判标签、1,400个OpenAI标签;attempt计数(NQ/TriviaQA/V4-Pro)为3,272/1,641/407,裁判attempt为403/204/101;附带零网络验证器可检验完整性并从ledger独立重算全部报告数字。协议、选题、调度、提示词、源文件、模型控制、分析代码和bootstrap流在相应调用阶段前全部哈希绑定;四道门(检索锁、答案锁、盲评锁、金标解锁)加不可变attempt记录使选择性重抽在机制上不可能发生。复现仍有几个门槛:依赖DeepResearchGym基础设施和特定的FineWeb七shard划分,shard身份直接决定结果,第三方需要完全相同的划分;生成器是deepseek-v4-flash/v4-pro且temperature/top-p未设置也未记录(provider默认值),托管服务的版本漂移可能改变噪声基线——尽管协议的重复设计能吸收部分漂移;语义裁判的具体模型版本也需匹配。算力需求低:本质是API调用(每基准数千次生成,加每题一次28对盲评),无任何训练。总体评估难度为中等:若能获得相同索引划分与相近的模型服务,工件足以精确重算所有数字;若只求定性复制现象,任意可复现检索服务+每状态两次回答的设计即可,400+200题的规模对学术团队非常友好。