← 返回 2026-08-10

零间隙不等于复原:基准污染的分层逐题概率评估与逐步抑制 Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

Ruijie Hou, Yueyang Jiao, Zhao Wang, Yingming Li 📅 2026-08-07 👍 4 2026-08-15 18:30
基准污染 大模型评测 污染缓解评估 解码干预 评估度量

提出SA-PPG分层指标与RailCap在线抑制策略,揭示G-AP系统性高估污染缓解效果。

前置知识

基准污染(Benchmark Contamination)

公开评测基准的测试题在模型预训练或微调阶段就被混入训练语料,导致模型对其产生记忆而非真正学会解决。一旦污染,模型在评测集上的得分被人为抬高,使基准失去衡量真实能力的作用。本文的实验场景是:把660道GSM8K测试题混入污染模型的微调数据,污染模型在这些“泄漏题”上得分虚高,研究者需在解码阶段抑制这种记忆以还原模型的真实能力。

理解污染的本质(记忆而非泛化)是理解整篇论文动机的基础——所有评估指标和缓解策略的设计目标,都是把因记忆而虚高的表现压回到模型本应具有的真实水平。

解题概率(Solve Probability)

对一道题从模型中独立采样 $m$ 次回复,统计其中回答正确的比例;当 $m$ 增大时这个比例会稳定到一个固定值,即该模型在这道题上的解题概率 $r_{prob}(q)=P(o\text{ solves }q)=E[r_{0/1}(q)]$,本质是单次0/1对错标记的期望。与离散0/1读出相比它高度可复现:本文实验显示离散读出两批次间平均逐题差距达0.190,而解题概率读出仅0.041。

解题概率是本文新指标SA-PPG的基石——论文第一个核心论点就是用解题概率替代离散0/1读出来表示单题表现,因为后者连同一模型都不可复现。

污染缓解评估(Contamination Mitigation Evaluation)

与重建新数据集回避污染不同,这类方法不构造新数据,而是在解码(推理)阶段对已被污染的模型施加干预,抑制记忆、还原真实能力。已有策略如TED、LNE-blocking、Shortcut neuron patching都遵循“先估计污染位置、再对估计到的部分操作”的两步范式:TED按编辑距离过滤疑似记忆样本,LNE-blocking按长度归一化熵给每题设定阻断强度,Shortcut定位并压制特定“捷径神经元”。

本文提出的RailCap属于这一类方法,但其关键区别在于抛弃了“先估计”这一步,改为生成过程中逐token在线判断污染。理解这一范式才能看清本文方法与传统策略的本质差异。

G-AP(聚合性能差距,Gap of Aggregate Performance)

污染缓解领域的事实标准度量。它先给每题一个性能读出(多数是单次采样的0/1对错标记),在整库上对污染模型(干预后)和干净模型分别取平均,再求绝对差:$G\text{-}AP(s)=\left|\frac{1}{N}\sum r^{M_{co}}_s(q)-\frac{1}{N}\sum r^{M_{cl}}(q)\right|$,差距越小代表复原越好。本文指出它有两个致命缺陷:离散读出无法刻画单题表现,先平均后求差会让过抑制和欠抑制相互抵消。

G-AP是被推翻的“旧标准”,理解它的定义和缺陷是理解SA-PPG为何更可靠的全部前提,也是理解标题“零差距不等于复原”的来源。

贪婪轨迹与回退(Greedy Trajectory and Fall-back)

贪婪解码是每步选概率最高的token,得到确定性轨迹 $g=(g_1,\ldots,g_T)$。在温度采样中,若已生成片段末尾 $n$ 个token恰好匹配贪婪轨迹上某段 $n$-gram窗口,就称采样“回退”到了贪婪轨迹。本文关键观察:对泄漏题,污染模型采样回复会坍缩到自己的贪婪轨迹(ROUGE-L接近1);而对未泄漏题,采样回复分散在多条路径上;且在两模型分歧步,干净模型的token约半数恰好是污染模型的次优token。

回退检测是RailCap的在线污染判据——它把“是否记忆”从训练前的一次性估计变成生成过程中逐步、可重复触发的信号,是RailCap区别于所有先验策略的核心。

研究动机

污染缓解评估领域长期沿用G-AP作为度量,但它在两个层面存在根本缺陷。其一是表示层:G-AP给每题一个离散的0/1对错标记,可单次采样的对错本身是随机的。图2显示,从同一干净模型Llama-2上独立采两批样本,离散读出两批次间平均逐题差距高达0.190,而换成解题概率读出后差距骤降到0.041——离散读出连同一模型都复现不了,自然无法刻画单题表现。其二是聚合层:G-AP先在整库上平均、再对干净模型求差,让过抑制(本该保留的能力被错误压低)和欠抑制(本该压制的记忆仍残留)相互抵消。表2显示LNE-blocking的过抑制分量0.0836是RailCap的0.0420的2.0倍,其G-APP读数0.0207却比RailCap的0.0794还好3.8倍——额外的附带损害恰好抵消了残留污染,把读数推向零。更糟的是等权重聚合还纵容平凡策略:把所有题都答错(All-Zero)在等权重A-PPG下竟读出0.2190,优于不做干预的Identity(0.3793)。

本文的目标是本文有两个并列目标。第一,构建一个可靠的、能判定逐题复原的评估度量,使其读数为零当且仅当每一道题都被完整复原——既不被采样噪声糊弄,也不被过/欠抑制相互抵消所欺骗,还要堵住“把解题概率推向高频值”这类平凡作弊策略。第二,构建一个不依赖任何预估计的污染缓解策略:因为已有策略(TED、LNE-blocking、Shortcut)都是“先估计污染位置、再操作估计到的部分”,其正确性完全取决于估计质量——估计漏掉的污染原封不动,错标的题则遭受不必要附带损害。本文要让污染判断从“一次性预估计”变成“生成过程中逐步在线监督”,让每道题该被干预多少由解码每步的实时响应决定。最终用新度量证明G-AP对先验策略的复原力存在系统性高估,并用新策略在所有设定下取得最优复原。

与已有工作不同的是,本文的独特切入角度在于把“污染判断”从静态预估计彻底转变为动态在线监督。已有方法的全部努力都花在更精准地估计污染上(估计污染响应、污染题目或污染神经元),但本质上仍是训练前的一次性判断,估计误差必然留存。本文换了个思路:直接观察污染模型生成时的行为——采样回复是否坍缩回自己的贪婪轨迹,本身就是在线的记忆信号;而当干净模型与污染模型在某步发散时,干净模型的token约有半数恰好是污染模型的次优token。基于这两条直接观测构造的RailCap,每一步只做“是否回退到贪婪轨迹”这一件事,回退则把该轨迹token的概率上限压到次优。这种“用模型自身生成行为作为监督信号”的范式,与所有先验策略的“估计-操作”两段式根本不同,也使RailCap无需任何污染位置估计即可工作。

核心方法

本文同时提出一个度量(SA-PPG)和一个缓解策略(RailCap),二者共同服务于“逐题复原”这一判据。直觉上,要判断缓解策略是否真的还原了模型能力,必须盯住每一道题:污染模型在这道题上的解题概率,干预后应逼近干净模型的解题概率。SA-PPG围绕这一直觉构建——先用 $m=50$ 次采样估计每题解题概率,逐题与干净模型作差取绝对值得PPG,再按干净模型解题概率把题目分层($B=50$ 个等宽区间),先组内平均再跨组平均。分层是为防平凡策略:多数题解题概率近零,等权重下把它们全答错就能在多数题上拿零差距、淹没少数高概率题上的大差距;分层后零概率多数只占 $1/|\mathcal{B}|$ 权重,作弊路径被堵死。RailCap则提供一种真正做到逐题复原的干预:每解码一步检查末尾 $n$-gram 是否落入贪婪轨迹索引 $H$,若落入则把轨迹后续token的logit限制为 $\min(\ell[x],v^{(2)})$(次优logit),令采样更可能偏离记忆轨迹。两个贡献合起来,第一次让复原的判定与实现都落在每一道题、每一个解码步上。

核心创新有两条,分别对应度量和策略。度量上,关键洞见是“零差距当且仅当每题复原”这一判据必须严格:G-AP的零差距只意味着过抑制和欠抑制的总量相等(可由相互抵消达到),并非每题都好;A-PPG用解题概率+逐题取绝对值+先取绝对值再平均解决了抵消,但等权重仍容许All-Zero这类把多数零概率题答错的平凡策略拿低分;SA-PPG的解法是按干净模型解题概率分层后再聚合,让零差距成为每题复原的充要条件($SA\text{-}PPG=0\Leftrightarrow\forall q,\Delta(q)=0$)。策略上,关键洞见是把污染判断“在线化”:不再训练前一次性估计哪些题/响应/神经元被污染,而是在解码每步用“采样是否回退到贪婪轨迹”作为判据——这是模型自身生成行为提供的免费监督信号。这与所有先验策略的“估计-操作”范式本质不同:估计漏的污染原样保留、错标的题受附带损害,而在线监督让每题干预量由生成响应自适应决定。

方法步骤详情

方法分两块。SA-PPG计算:对评测集每题 $q$,从干净模型 $M_{cl}$ 和干预后污染模型 $M^{s}_{co}$ 各独立采样 $m=50$ 次,以正确次数$/m$估计解题概率;逐题算概率差距 $\Delta_s(q)=|r_{prob}^{M_{cl}}(q)-r_{prob}^{M^{s}_{co}}(q)|$;把 $[0,1]$ 划为 $B=50$ 个等宽区间,按 $r_{prob}^{M_{cl}}(q)$ 把每题分入区间 $D_b$;先组内对 $\Delta_s(q)$ 取平均、再跨组取平均得 $SA\text{-}PPG$。RailCap步骤:预处理对每题做一次贪婪解码得轨迹 $g$,构建 $4$-gram 到后继token的索引 $H$;生成阶段逐步操作——第 $t$ 步若最近4个生成token命中 $H$,则把其后继token的logit压到次优值 $\ell[x]\leftarrow\min(\ell[x],v^{(2)}_t)$($v^{(2)}_t$ 为当前第二大logit),否则不改动;随后按温度 $\tau=0.7$ 从softmax采样下一token。该规则对每题每步相同,干预量由实时响应累积决定。

技术新颖性

新颖性体现在三处。度量层面,本文首次系统拆解G-AP的两个缺陷并提出SA-PPG:它是首个“零差距当且仅当每题复原”的严格度量,且通过分层显式封堵All-Zero这类平凡作弊策略(实验中All-Zero在SA-PPG下读0.4903沦为最差,而在等权重A-PPG下却读0.2190优于多数真实策略)。同时本文首次在同一度量下横向比较离散0/1读出、解题概率读出和pass@1读出,证实离散单样本读出连同一模型都不可复现。策略层面,RailCap是首个完全抛弃“预估计”范式的缓解方法:它把污染判断从一次性静态估计改为解码过程中的逐步在线监督,使每题干预量由生成响应自适应决定,无需任何污染位置估计。形式上,把上限压制(cap到次优)而非硬禁止(ban到零)作为抑制手段——消融显示ban会使SA-PPG从0.1914升到0.2190,说明保留轨迹token的可用性优于彻底禁止。评估层面,本文首次揭示G-AP对先验策略复原力的系统性高估,并给出可复现的横向对比。

The contaminated model's generation behaviour on Llama-2 (GSM8K, 1319 questions, m=50 samples per question, T=0.7)
Figure 1: The contaminated model's generation behaviour on Llama-2 (GSM8K, 1319 questions, m=50 samples per question, T=0.7)

实验结果

核心发现分四组。第一,度量反转排名(表1,Llama-2×GSM8K):G-AP下LNE-blocking以0.0235看似近完美、为最优;换SA-PPG后排名彻底反转,它跌到0.2932,反而劣于Shortcut(0.2476)和RailCap(0.1914),几乎和不干预(0.3261)持平——“近完美复原”在逐题层面并不存在。第二,缺陷归因(表2):LNE-blocking过抑制分量0.0836是RailCap(0.0420)的2.0倍,但G-APP读数0.0207反而比RailCap的0.0794好3.8倍,证实过/欠抑制相互抵消制造虚假完美;All-Zero在等权重A-PPG下读0.2190优于Identity(0.3793),分层后SA-PPG读0.4903沦为最差,证明三层修正缺一不可。第三,跨设定泛化(表3,2领域×3模型共6设定):RailCap在全部6列SA-PPG最低,最大优势在Llama-2×GSM8K(0.1914对次优Shortcut 0.2476);更难的PQ领域(推理题与污染题不同)LNE-blocking甚至劣于Identity,RailCap仍最优。第四,消融(表4):$n$-gram阈值 $n=4$ 最优(0.1914),$n\in[3,7]$ 均在0.008内稳健;cap到次优换成ban到零使SA-PPG升到0.2190。

Readings of the same responses under G-AP and SA-PPG (Model: Llama-2, contamination domain: GSM8K)
Table 1: Readings of the same responses under G-AP and SA-PPG (Model: Llama-2, contamination domain: GSM8K)
The metrics analyzed through the component decomposition of SA-PPG, setting as in Table 1
Table 2: The metrics analyzed through the component decomposition of SA-PPG, setting as in Table 1
SA-PPG of each mitigation strategy across the six settings (two contamination domains × three models)
Table 3: SA-PPG of each mitigation strategy across the six settings (two contamination domains × three models)
Ablation of RailCap on Llama-2 × GSM8K
Table 4: Ablation of RailCap on Llama-2 × GSM8K
查看结构化数据
任务指标本文基线提升
污染缓解评估(Llama-2×GSM8K) SA-PPG(越低越好) RailCap 0.1914 LNE-blocking 0.2932 / Shortcut 0.2476 / TED 0.3250 / Identity 0.3261 相对最强基线Shortcut降低约23%;G-AP下曾被判最优的LNE-blocking在SA-PPG下排名跌至倒数第二
跨设定稳健性(6个设定:2领域×3模型) SA-PPG(越低越好) RailCap在全部6列最优(0.1429–0.2313) Shortcut在5/6设定次优;LNE-blocking在PQ三模型上均劣于Identity 唯一在所有设定下保持第一的策略;PQ领域RailCap优势最明显(如Pythia×PQ为0.1429对Identity 0.1907)
度量读出稳定性(同一干净模型两批采样) 平均逐题读出差距 解题概率读出 0.041(m=50) 离散0/1读出 0.190(m=1) 读出不可复现性降低约4.6倍,支撑用解题概率替代离散读出
RailCap消融(Llama-2×GSM8K) SA-PPG(越低越好) $n=4$ cap到次优:0.1914 $n=4$ ban到零:0.2190;$n=1$:0.2434;All-Zero:0.4903 $n\in[3,7]$ 均在最优值0.008内,cap形式优于ban

局限与改进

局限性分四类。其一(作者承认+观察):评测领域单一,仅限数学推理——GSM8K及其改写版PQ,未涵盖代码生成、知识问答、长文本等污染同样严重的领域;RailCap的 $n$-gram回退检测和“干净模型token常居次优”的假设是否在其他任务形态下仍成立未知。其二:污染是模拟的而非真实预训练污染。作者用LoRA微调把660道测试题混入训练数据来制造 $M_{co}$,这与真实场景下整库测试题被混入超大规模预训练语料的污染形态有差距——真实污染的记忆强度、泛化方式可能不同,结论能否外推待验证。其三:参考模型 $M_{cl}$ 取“同领域干净模型”(在同任务训练集上微调过的版本),不同参考会改变绝对读数;选用更通用或更强的参考模型可能得到不同结论。其四:成本——每题采样 $m=50$ 次、共 $N=1319$ 题,单次完整评估需大量推理,且SA-PPG分层需同时估计 $M_{cl}$ 和 $M^{s}_{co}$ 的解题概率,开销约为G-AP的百倍。

独立分析的弱点

独立分析的弱点及其改进方向。弱点一:领域泛化未验证。RailCap依赖“泄漏题采样坍缩到贪婪轨迹、干净token常居次优”两条经验观察,这在数学题(答案唯一、轨迹强)上成立,但在开放式生成、代码等答案空间大的任务上未必。改进方向是在多任务上重新刻画污染模型的生成行为,必要时为不同任务设计不同的在线判据。弱点二:$n$-gram回退判据较粗。固定 $n=4$ 的字符级 $n$-gram匹配对长记忆和局部重复敏感,可能误触发(如题目本身要求重复某短语)。改进方向是引入语义级或嵌入相似度的回退判据,或让 $n$ 随上下文自适应。弱点三:抑制手段单一。RailCap只把轨迹token压到次优,未利用更多信息(如多步前瞻、置信度)。改进方向是结合置信度加权压制或多候选调度,在抑制记忆与保留能力间更精细权衡。弱点四:评估成本高。$m=50$ 采样+$B=50$ 分层使SA-PPG比G-AP贵百倍,难以大规模扫模型。改进方向是用重要性采样、贝叶斯估计或方差缩减技术降低所需采样数。

未来方向

作者提出的方向集中在扩展性:把SA-PPG和RailCap推广到更多任务领域、更多模型族与真实预训练污染场景,并探索与其他缓解思路(如数据集重建)的组合。基于本文成果可延伸的方向包括:第一,把“在线生成行为作为污染监督”的范式推广到训练阶段——例如在微调时实时检测并惩罚坍缩到训练样本的轨迹,从源头减少记忆。第二,将SA-PPG的分层思想用于其他评估公平性问题,如不同难度子群的性能均衡。第三,研究分层粒度 $B$ 的选择理论——$B$ 过大样本不足、$B$ 过小退化为等权重,当前 $B=50$ 是经验值,可推导自适应 $B$。第四,结合检测方法(min-k%、CDD等)与RailCap,形成“检测定位+在线抑制”的混合管线。第五,把解题概率读出引入常规模型评测,替代不稳定的单样本0/1,提升评测可复现性。第六,研究RailCap与采样温度、解码策略(top-p、beam search)的交互,刻画其行为边界。

复现评估

复现性总体良好但未完全开源。有利因素:使用完全开源的Pythia-12B(权重+语料公开,可验证基座未被污染),另两个模型Llama-2-7B、Gemma-4-E2B亦为开源;污染制造流程详尽——LoRA微调($r=64,\alpha=128$)、学习率 $2e\text{-}4$ 余弦调度、warmup 0.1、全局batch 32、bf16、5 epoch,基于LLaMA-Factory框架;PQ改写的系统提示词原文给出(附录A);评估协议明确(8-shot CoT、$m=50$、$T=0.7$、$B=50$、$n=4$),关键超参数齐全。不利因素:论文未提及代码或数据开源链接;GSM8K的训练/测试划分细节、具体泄漏题列表需自行构造;PQ改写依赖DeepSeek-V4-Flash API,存在随机性需复现。算力方面,三模型各需LoRA微调+每题50次采样的评估,单设定评估即数十万次推理,完整复现六设定需可观GPU资源。整体难度中等偏上:算法实现不难(RailCap解码逻辑仅十余行),但数据构造和大规模采样评估的工程与算力门槛较高。