← 返回 2026-08-25

上下文分配定律:生成式搜索中的因果测量与闭环编排 The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search

Peiyang Liu, Xi Wang, Di Liang, Wei Ye 📅 2026-08-24 👍 4 2026-08-30 18:30
RAG 上下文归因 因果测量 推理时扩展 搜索多样化 生成式搜索

因果探针证明宽上下文是陷阱,多轮窄窗口生成带来最高约20个百分点的召回跃升

前置知识

留一法消融与反事实归因

把输入中的一个组件(这里是一篇检索文档)临时删除,重新计算模型对固定输出的置信度,用变化量衡量该组件的重要性。本文用它做反事实归因:对已生成的回复 $y_t$,逐个删除上下文中的文档 $d$,用逐 token 平均对数似然下降 $a_t(d)$ 度量模型对该文档的结构性依赖。因为回复已冻结,整个过程只需教师强制前向传播。

这是全文的测量基石:探针验证、证据覆盖率(ECR)、调度器反馈全部由这个消融信号驱动,不懂它就看不懂方法核心。

组合召回 PR@T

给定金标答案单元集合 $A$,系统顺序生成 $T$ 个回复 $y_1,\dots,y_T$,只要任一回复断言了某答案单元即算覆盖:$$PR@T = \frac{|\{a \in A : \exists t,\ a\ \mathrm{asserted\ in}\ y_t\}|}{|A|}$$ 它衡量一组回复作为一个整体覆盖了多少证据支持的真相空间,是与单一回答范式的本质区别。

论文所有端到端主张的最终评估指标,实验表格(Table 4、10、13 等)全部围绕它展开。

教师强制

推断时把已知的真实文本逐 token 喂入模型、读取每步条件概率,而不让模型自己采样解码。本文巧妙利用这一形态:回复 $y_t$ 已生成并冻结,对 $k+1$ 个上下文变体重算 $\log p_\theta(y_t \mid q, C)$ 只需 $k+1$ 次可完全并行的一次前向传播,彻底绕开昂贵的自回归解码瓶颈。

这是因果探针在计算上可行的关键,也是论文声称系统能保持部署时效性的核心论据。

单调次模函数与贪心最大化

次模函数满足边际收益递减:往更大的集合中加入新元素,带来的增量只会更小或不变。对单调次模目标,简单贪心算法有 $(1-1/e)$ 的近似保证。本文调度器 Ascp 用它编码直觉——已被生成器吃透的知识分面应被折减:因果探针报告某分面第 1 轮已被深度利用后,第 2 轮再选同分面文档的边际收益自动变小。

Ascp 调度器的数学骨架,决定了每轮上下文选什么文档,是闭环系统的『大脑』。

搜索结果多样化

经典 IR 认为查询是欠明确的意图表达,返回排序时应显式用新颖性惩罚冗余、覆盖更多子主题,代表算法有 MMR、xQuAD、PM-2 以及行列式点过程(DPP)。这条脉络假设『人』在浏览多样化列表。本文把消费者换成生成模型,并指出这些算法被移植进 RAG 后是开环的——只在文档空间做相似度去冗余,对模型实际消费了什么完全失明。

论文的全部基线(MMR-RAG、xQuAD-RAG、PM-2-RAG、DPP-RAG 等)与核心批判对象都来自这条脉络。

对比解码与自适应可行性约束(APC)

解码时同时计算原始分布与对照分布,按 $\ell' = \ell(\cdot \mid q, C) + \alpha[\ell(\cdot \mid q, C \setminus O) - \ell(\cdot \mid q, O)]$ 调整 logits:把概率质量从被过度使用的证据集合 $O$ 支持的 token 上减掉、转移到新鲜证据支持的 token 上;自适应可行性约束(APC)再把候选 token 钳制在可行集合内,防止把模型推离概率流形导致幻觉。

这是论文的微观干预组件(『认知覆盖』),用于对抗 LLM 的注意力惯性,理解 Table 12 的分解实验必需。

研究动机

RAG 的主流做法是把检索到的段落全部塞进一个提示词,让 LLM 压缩成单一回答,但这对模糊或多面性查询是结构性不足的:单次综合必然丢弃关键信息。论文用数据量化了这个『刚性认知天花板』——同样消费 24 个证据槽,单体宽上下文配置 $(k=24, T=1)$ 的组合召回只有 0.253,而多轮窄窗口配置 $(k=2, T=12)$ 能达到 0.397。更麻烦的是系统层面存在两个瓶颈。其一是测量失真:社区惯用嵌入相似度、BM25、query–document 余弦等代理指标判断『模型实际用了哪些证据』,这些指标把主题相关性与真实证据利用混为一谈,而现有归因研究几乎都在『离查询干扰池』这种平凡负样本上自证有效。其二是预算分配盲目:面对固定推理预算 $k \times T$(上下文宽度 × 生成轮数),架构师不知道该走『宽而浅』还是『窄而深』,NLP 界默认堆宽上下文,但从未有过解耦 $k$ 与 $T$ 的去混杂因果实验。

本文的目标是论文设定了三个递进目标。第一,先解决测量问题:建立能真正隔离『生成模型实际利用了哪些证据』的因果测量工具,而不是继续依赖被相关性污染的相似度代理;这要求在严格的同查询难负样本上验证工具判别力,并系统校准掉测量协议(自由生成导致文本变长变含糊等)引入的伪影。第二,用这套经过验证的工具执行去混杂的 $k \times T$ 因子实验,回答预算分配的架构级问题:同样的检索池应该一次性喂给宽上下文,还是拆成多轮窄窗口顺序生成?并定量刻画上下文宽度对证据利用的稀释规律。第三,把测量能力与经验定律工程化为可部署的闭环系统:前端用因果反馈驱动的次模调度器决定每轮『看什么』,后端用归因引导的对比解码决定『怎么提取』,使组合召回系统性超越 MMR、xQuAD、PM-2、DPP-RAG、Carriage 等七个选择式基线,并把结论验证到 32B 模型规模。

与已有工作不同的是,独特切入角度有三点。其一,评估方法学上的『诊断幻觉』批判:论文发现现有 RAG 归因文献默认用离查询干扰池(为无关主题检索的文档)做评估集,这种构造让平凡负样本把相似度指标的 AUC 推到接近 1.000,制造近乎完美的假象;换上同查询难负样本(主题密集但不含答案)后这些指标塌到随机水平,而因果探针保持稳健。论文由此主张 IR 学界『新度量必须先被元评估』的传统应成为生成式归因的强制标准。其二,把经典 IR 多样化思想真正迁移到生成时代:不是让模型读一个多样化列表产出单一答案,而是把消费者从人换成生成器,反复查询模型、用因果探针追踪『不同文档暴露』如何驱动『组合覆盖』。其三,第一次把推理时扩展范式正式引入生成式搜索:把测试时算力显式投资于迭代式因果编排与多轮生成,而不是无脑加宽上下文——这把『搜索多样化』从静态的列表构造问题变成了动态的算力分配问题。

核心方法

方法分三层:先测量、再定律、后系统。直觉上,要决定『下一轮让模型看什么』,必须先知道『这一轮它实际用了什么』;要判断『该不该加宽上下文』,必须先能无偏测量证据利用随宽度的衰减。技术路线上,第一层构建因果 LOO 探针:对已生成的回复 $y_t$,逐个删除上下文中的文档 $d$,用教师强制前向 pass 计算逐 token 平均对数似然下降 $a_t(d) \propto [\log p_\theta(y_t \mid q, C_t) - \log p_\theta(y_t \mid q, C_t \setminus \{d\})]/|y_t|$,值越大说明 $d$ 越是生成的结构性依赖;因为文本固定,$k+1$ 次消融全部可并行,完全绕开自回归解码瓶颈。第二层在受控构造池(每池恰好 2 篇必要文档 + 可控填充)上验证探针判别力,再部署去混杂的 $k \times T$ 因子网格($k \in \{2,5,12,24\} \times T \in \{1,5,12\}$,400 篇文档池),确立两条经验定律:轮数扩展普遍有效,宽度扩展受检索相关性密度惩罚。第三层把探针嵌入闭环:Ascp 调度器按单调次模目标贪心选择下一轮上下文,用探针反馈折减已被消费的知识分面;归因引导对比解码在 logit 层强制模型转向未被利用的证据,并用自适应可行性约束(APC)防幻觉。

核心创新是把『证据利用』从观察量变成干预量。与 ContextCite 等学习型代理、注意力分数或嵌入相似度不同,本文的测量标准是反事实敏感性:删掉文档 $d$ 后,完全相同的已生成文本 $y_t$ 的对数似然掉多少。因为回复冻结,测量是纯教师强制前向,便宜且可并行,还天然免疫『删除导致位置移动』的机械伪影——与等长中性文本原位替换相比,动态弹性几乎一致($-0.104$ vs $-0.112$)。第二层创新是『闭环』概念:经典多样化算法(MMR/xQuAD/PM-2/DPP)是开环的,只在文档空间做静态去冗余,对生成器实际消费什么失明;Ascp 则在每轮生成后读取因果归因矩阵,用次模函数的边际收益递减特性主动折减已被吃透的知识分面,把下一轮上下文推向未开发证据。第三层创新是微观层面的认知覆盖:即便调度器送来新证据,LLM 仍有注意力惯性——对已提取概念的依赖显著偏离独立性假设($p = 6 \times 10^{-31}$)——对比解码 $\ell' = \ell(\cdot \mid q, C) + \alpha[\ell(\cdot \mid q, C \setminus O) - \ell(\cdot \mid q, O)]$ 在 logit 级减掉过度使用证据 $O$ 支持的概率质量、加成新鲜证据,配合 APC 护栏强制新鲜证据进入最终输出。

方法步骤详情

完整流程如下。步骤一(检索池与语义分面):沿用 ALCE 标准检索池(ASQA/QAMPARI 用 GTR、ELI5 用 BM25,冻结 top-30 或扩展 400 篇),用 all-mpnet-base-v2 把文档聚成语义簇(知识分面)。步骤二(本轮上下文选择):Ascp 以次模目标贪心选 $k$ 篇文档构成 $C_t$,复杂度 $O(|\mathcal{P}| \cdot k \cdot Z)$,微秒级;未见过文档与未被消费的分面获得高边际收益。步骤三(生成):普通采样生成 $y_t$(temperature 0.7、top-$p$=1、禁用 top-$k$、重复惩罚 1)。步骤四(因果归因):对冻结的 $y_t$ 做 $k+1$ 次可并行教师强制前向(参考上下文 + $k$ 个逐一删档的消融上下文),按 $a_t(d) \propto [\log p_\theta(y_t \mid q, C_t) - \log p_\theta(y_t \mid q, C_t \setminus \{d\})]/|y_t|$ 得到利用分数;文档跨消融保持恒定语义标识,避免引文重编号混淆;超阈值 $\tau_{free}(k) = 0.555k^{-0.633}$ 记为『本轮已用』。步骤五(更新反馈并循环):把新消费的分面折扣后回到步骤二,直至 $T$ 轮。步骤六(解码干预):第二轮起令 $O$ 为被重度利用的文档集合,按对比公式调整 logits,APC 把候选 token 钳在可行集内。步骤七(评估):$T$ 个回复构成组合,用 PR@T(金标答案单元覆盖)与 ECR(证据利用率)评估;跨任务等权、交叉 bootstrap、BH-FDR 校正多重检验。

技术新颖性

技术新颖性可从四个对照面看清。对相似度代理:探针在同查询难负样本上保持 AUC 0.824–0.876,而 BM25 与 query–doc 余弦塌到 0.444/0.484($k=3$);在 cover@m 集合覆盖任务(1,200 个条件)上,BM25 甚至比随机排序还差 $-0.014$($p=0.48$),探针增益 $+0.144$($p<0.001$)。对先进归因算法:与 ContextCite(学习型稀疏线性代理)在相同固定协议下正面对比,删除式 LOO 以 0.792 的答案集覆盖胜出(ContextCite $+0.105$、原位 LOO $+0.134$),且增益在所有上下文宽度下全局显著。对开环多样化:DPP-RAG、Carriage 等只在文档空间静态去冗余,Ascp 是唯一读取生成侧因果反馈的调度器,端到端 PR@T 0.309 全面占优,并把 ECR 从深轮转的 0.375 拉到 0.626——用 10.55 篇精编文档达到深轮转盲喂 25 篇的召回。对可替换性检验(最严格的一环):把调度器的反馈信号从因果探针换成嵌入相似度,调度增益立即归零($-0.002$,$p=0.73$,与『假设所有文档都被均匀利用』的天真开环无异),证明因果敏感性是这个系统不可或缺的引擎,而非装饰性组件。

The closed-loop measurement and orchestration pipeline.
Fig. 2: The closed-loop measurement and orchestration pipeline.
Probe validation and controls on constructed pools.
Fig. 3: Probe validation and controls on constructed pools.
Width elasticity of the thresholded utilisation statistic q, with 95% intervals.
Fig. 4: Width elasticity of the thresholded utilisation statistic q, with 95% intervals.
元评估图(原文位于附录,正文 §3.3 引用;提取文本中未含其原始标题)
Figure 7: 元评估图(原文位于附录,正文 §3.3 引用;提取文本中未含其原始标题)

实验结果

实验按五条线展开。其一,诊断幻觉与稀释定律(图3、4):离查询填充下 BM25/余弦 AUC 接近 1.000、探针反而落后(0.829);换成同查询填充后层次完全反转——BM25 0.444、余弦 0.484($k=3$,随机水平),探针 0.876($k=3$)、0.824($k=24$)。固定目标协议下探针假阳性率回到名义 5%,自由生成协议下高达 37%;协议隔离后宽度弹性校准为 $-0.68 \pm 0.02$,跨冗余分层在 $-0.43$ 到 $-0.67$ 间浮动但始终显著为负,证明注意力稀释是模型固有属性。其二,$k \times T$ 因子网格(表4–7):$T$ 从 1 升到 12 在所有配置下普涨约 $+0.17$ 到 $+0.20$;$k$ 从 2 拓到 24 在 $T=1$ 时 $+0.050$、$T=12$ 时收缩到 $+0.024$,$k>12$ 无统计收益;同预算 $(2,12)$ 比 $(24,1)$ 高 $+0.144$(95% CI $[+0.119, +0.170]$)。$(24,12)$ 极限下轮转策略接地 50.9 篇独立文档,固定上下文只有 10.3 篇;新鲜证据解释了窄宽度下 72%、$k=24$ 下 52% 的轮数收益。1M 上下文模型($k=96 \approx$ 11K token)也翻不了盘:ASQA 在 $k=48$ 反而 $-0.033$。相关性密度是分水岭:head-5 占比 0.398 的 QAMPARI 宽度仍有微益,0.713 的 ASQA 与 0.630 的 HotpotQA 宽度有害(HotpotQA 在 $T=1$ 时宽度 $+0.333$、$T=12$ 时 $-0.046$,因为轮转跨轮拼齐了多跳段落对)。其三,端到端(表10、11、15):完整系统 Ascp 0.309,对 Carriage $+0.033$、对 PM-2-RAG $+0.081$(均 BH $q<0.001$);去掉对比解码仍对全部选择式基线 $+0.024$ 到 $+0.072$;因果反馈比均匀利用假设 $+0.014$($p=0.013$),相似度反馈 $-0.002$($p=0.73$)完全失效。其四,解码器(表12):归因引导对比解码带来正交的 $+0.0107$ PR@T(五种子 $q=0.001$)、ECR $+0.0555$、词汇接地 $+0.0275$,且每组合少生成 1.0 个词;纯对比项单独 $+0.0187$,APC 单独 $-0.0009$(无效),融合后以 0.0080 召回换防幻觉护栏。其五,规模验证(表13):预算匹配下 14B 池化 $+0.134$、32B $+0.138$(ASQA 上 14B 达 $+0.168$),摘要口径为 16.8–20.5 个绝对百分点的结构性优势。

Within-query correlations across systems (n=2395 task–model–query groups, 23682 observations), centered within group.
Table 1: Within-query correlations across systems (n=2395 task–model–query groups, 23682 observations), centered within group.
Policy dependence with one ordinary decoder. All arms use the same explicit sampler.
Table 2: Policy dependence with one ordinary decoder. All arms use the same explicit sampler.
Relevance density: gold units per task, rank-level answer-attestation probability, and head-5 answer-mass share.
Table 3: Relevance density: gold units per task, rank-level answer-attestation probability, and head-5 answer-mass share.
Deconfounded width–count grid: rotation cycles disjoint rank windows; fixed repeats top-k for T samples.
Table 4: Deconfounded width–count grid: rotation cycles disjoint rank windows; fixed repeats top-k for T samples.
Decisive deconfounded-grid contrasts by task and generator, as within-query paired portfolio-recall differences.
Table 5: Decisive deconfounded-grid contrasts by task and generator, as within-query paired portfolio-recall differences.
Hierarchical rotation width contrast k=24 minus k=2, paired within query.
Table 6: Hierarchical rotation width contrast k=24 minus k=2, paired within query.
Long-context Qwen2.5-7B-Instruct-1M width–count contrasts at widths beyond the 7–8B grid.
Table 7: Long-context Qwen2.5-7B-Instruct-1M width–count contrasts at widths beyond the 7–8B grid.
Relevance density versus gold-set size over four task profiles.
Table 8: Relevance density versus gold-set size over four task profiles.
ELI5 factorial: small claim gold set but dispersed BM25 profile, separating relevance density from gold-set size.
Table 9: ELI5 factorial: small claim gold set but dispersed BM25 profile, separating relevance density from gold-set size.
Frozen held-out comparison: steering chosen once on development, then tested on disjoint queries.
Table 10: Frozen held-out comparison: steering chosen once on development, then tested on disjoint queries.
Scheduler-only held-out comparison: Ascp without steered decoding.
Table 11: Scheduler-only held-out comparison: Ascp without steered decoding.
Held-out decoder decomposition with identical sampling.
Table 12: Held-out decoder decomposition with identical sampling.
Budget-matched scaling validation on 14B and 32B models.
Table 13: Budget-matched scaling validation on 14B and 32B models.
Deconfounded width–count grid.
Fig. 5: Deconfounded width–count grid.
Cost versus quality across every grid cell (Qwen/ASQA, A100, probe removed).
Fig. 6: Cost versus quality across every grid cell (Qwen/ASQA, A100, probe removed).
查看结构化数据
任务指标本文基线提升
组合召回(4 任务 × 3 生成器 × 2 种子冻结评估帧,2400 配对单元) PR@T(组合召回,配对差 + BH-FDR) Ascp + 对比解码 = 0.309 Carriage 0.276;DPP-RAG 0.274;MMR 0.239;xQuAD 0.238;vanilla RAG 0.237;PM-2-RAG 0.228 对 Carriage +0.033(95% CI [+0.022,+0.044],q<0.001),对最强经典基线 PM-2-RAG +0.081
证据归因(构造池,同查询难负样本填充) AUC(识别含答案的必要文档) 删除式 LOO 探针:0.876(k=3),0.824(k=24) BM25 0.444、query–doc 余弦 0.484(k=3,随机水平以下);离查询填充下两者虚高至 ≈1.000 难负样本下比 BM25 高约 +0.43,层次完全反转
充分集合识别(cover@m,1,200 个构造条件) top-m 文档集合对设计答案集的覆盖增益(相对随机排序) +0.144(绝对覆盖 0.792,p<0.001) ContextCite +0.105;原位 LOO +0.134;BM25 −0.014(p=0.48,劣化随机) 比 ContextCite 高 +0.039,比 BM25 高 +0.158
预算匹配分配((2,12) vs (24,1),同 24 证据槽) PR@T 配对差 7–8B:+0.144(CI [+0.119,+0.170]);14B 池化:+0.134;32B 池化:+0.138(ASQA 14B +0.168) 单体宽上下文 (24,1)(Qwen2.5-14B/32B 上池化 PR@T 仅 0.266/0.291) 约 +13 至 +17 个绝对百分点,所有置信区间不含 0,验证至 32B
归因引导对比解码(5 种子,同采样配置) ΔPR@T(及 ΔECR、Δgroundedness) +0.0107(q=0.001),ECR +0.0555,词汇接地 +0.0275,词数 −1.0 无解码干预(同 temperature 0.7 / top-p 1) 正交增益:在调度器之上再叠加约 1 个召回点且更省更接地

局限与改进

作者承认的局限:序列生成带来 17.5 秒 vs 1.7 秒($(2,12)$ vs $(24,1)$,A100 实测)的顺序墙钟延迟,探针还需 $k+1$ 次前向(可并行但非零开销);$k \times T$ 元分析只有 $K=4$ 个任务-生成器条件,宽度对比的预测区间宽达 $[-0.412, +0.462]$,精度有限;宽度收益在任务间结构性分裂(QAMPARI 受益、ASQA/HotpotQA 受损),不存在单一最优配置,必须按相关性密度选择;纯对比解码无 APC 时有幻觉风险,融合后要牺牲 0.0080 召回。我自己的观察:其一,PR@T 评估依赖数据集的金标答案单元标注与 NLI 蕴含匹配(ELI5 缺乏 rank 级词汇接地、只能算字符串密度),迁移到无标注的新领域时这套评估体系本身需要先重建;其二,深轮转在纯召回上与完整方法统计不可分($+0.006$,$q=0.343$),Ascp 的优势本质是效率(ECR 0.626 vs 0.375、提供 10.55 vs 25.00 篇),若部署方算力极便宜且只在乎召回上限,闭环的价值会被稀释;其三,实验冻结在 ALCE top-30/400 检索池与 7B–32B 开源模型,对前沿闭源模型(其注意力稀释模式可能不同)以及检索器质量本身没有敏感性分析;超参只在 40 条 ASQA 开发集上定过一次,跨领域稳健性存疑。

独立分析的弱点

独立分析的弱点与改进方向。弱点一:延迟结构没有工程优化——12 轮顺序生成实测 17.5 秒,对在线搜索不可接受;可引入投机解码、轮间 KV-cache 复用、或『边生成边归因』的流水线化把墙钟时间压缩数倍。弱点二:探针成本 $O(k)$ 次前向随宽度线性增长,虽可并行,但在高并发服务下是显式税负;可用 LOO 分数蒸馏出的轻量归因头或采样式消融近似,把常数降一个量级。弱点三:组合的金标『答案单元』来自人工标注数据集,开放域无法自动构建;可用 NLI + 实体链接自动生成候选单元配合人机抽检,或改用答案聚类覆盖等无金标代理并报告其与 PR@T 的相关性。弱点四:利用阈值 $\theta$ 与自由生成阈值 $\tau_{free}(k)=0.555k^{-0.633}$ 是全局标度律拟合,未按任务/模型自适应校准,换模型可能漂移;可在线逐模型逐任务校准。弱点五:调度器逐轮贪心、无前瞻,总轮数 $T$ 是静态给定而非动态决策;可训练成本感知的停止/宽度策略,把推理时扩展做成自适应过程而非固定网格。弱点六:反馈矩阵只记录『用/没用』二值,未建模证据间的互补与冲突关系(多跳场景两篇必须同现),调度目标可引入成对项。

未来方向

作者提出或暗示的方向:把闭环编排与 agentic 流水线、流式语料多样化扩展;把推理时扩展正式纳入生成式搜索的部署经济学——图6 的算力-质量前沿显示,目标召回 $\geq 0.40$ 时任何单次生成配置都够不到门槛,只能靠多轮。基于本文成果可自然延伸:其一,跨模型归因蒸馏——用大模型的 LOO 分数监督小模型归因头,让探针成本常数化,反哺延迟问题;其二,把宽度弹性 $-0.68$ 变成长上下文模型的『模型卡』指标,系统评测不同注意力架构(线性注意力、稀疏注意力、检索增强位置编码)能否把弹性推向 0,反过来指导预训练;其三,与对齐训练结合——把『新鲜证据整合率』作为奖励信号,训练天生不懒惰、不固着旧概念的生成器,从源头削弱注意力惯性;其四,检索-调度联合优化,让检索器直接为多轮消费模式优化排序密度分布(head-5 占比),而不是为单轮相关性优化;其五,推广到答案空间结构化的场景:代码检索(多个可复现方案)、多模态证据、对话式搜索的多轮证据累积。

复现评估

复现条件相当好。代码、数据与因果测量工具已开源(github.com/PeiYangLiu/ascp);基准全部公开(ALCE 的 ASQA/QAMPARI/ELI5 检索池、HotpotQA、跨文化食谱任务),检索池冻结 top-30(扩展 400 篇)保证证据公平;生成器是三个开源 7B 模型(Qwen2.5-7B、Llama-3.1-8B、Mistral-7B-v0.3)及 Qwen2.5-14B/32B,半精度下单张 A100 即可运行主网格(图6 明确标注 A100 环境);全部超参($\beta=0.3$、$\beta_{doc}=0.3$、$\lambda=0.25$、$\kappa=0$、$\gamma=0.6$、$m_{max}=3$、$\eta=0.1$ 等)只在 40 条 ASQA 开发集上定一次且文中完整列出;评估协议(100 查询 × 4 任务 × 3 生成器 × 2 种子 = 2400 配对帧、交叉 bootstrap、任务等权、BH-FDR)写得极其细致。难度评估:跑通主实验属于中等偏上——不需要任何训练(全部是推理时干预),但需要多轮编排 + 探针前向的工程实现与可观的前向算力(复刻 32B 尤甚);最大的坑在于 PR@T 金标匹配管线与统计协议的忠实复刻,以及同查询难负样本构造池的搭建。