← 返回 2026-08-17

UNMASK:发现并因果验证文本分类器中的虚假捷径 UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

Chidaksh Ravuru, Shashank Srivastava 📅 2026-08-10 👍 2 2026-08-22 18:30
LLM数据审计 因果验证 模型去偏 自然语言推理 虚假相关性 鲁棒性

全自动四阶段流水线,把虚假捷径写成可执行布尔表达式并经反事实因果验证后用于无标注去偏

前置知识

虚假相关性(捷径学习)

数据中与标签统计相关但无真实因果或语言学关联的表面模式,形式化为存在标签-属性对 $(y,a)$ 使 $P(Y{=}y\mid A{=}a) \neq P(Y{=}y)$。模型学到捷径后基准分数虚高,但在对抗或分布外输入上失效,例如依赖词汇重叠的 NLI 模型在 HANS 对抗集上会崩溃。

全文的研究对象就是这类相关性,核心命题是区分数据集层面的统计相关与模型层面的真实利用——这是理解论文动机和贡献的钥匙。

自然语言推理(NLI)与 HANS

NLI 判断前提(premise)与假设(hypothesis)的蕴含/矛盾/中立三元关系,MNLI 是代表性众包数据集。HANS 是模板构造的对抗评测集,专测词汇重叠、子序列、成分树等启发式;依赖捷径的模型在非蕴含子集上准确率会跌至接近零。

论文主实验在 MNLI 上训练 BERT/RoBERTa,用 HANS 等 6 个基准量化去偏效果,核心数字(如 +12.58 pp)都出自这里。

优势比与 Fisher 精确检验

优势比 $\mathrm{OR}$ 从 $2\times2$ 列联表度量特征与标签的关联强度;Fisher 精确检验在小样本下给出精确 $p$ 值。当同时检验海量特征-标签对时,用 Benjamini–Hochberg(BH)程序控制错误发现率(FDR),避免多重比较假阳性爆炸。

UNMASK 的 SFV 统计验证阶段完全建立在其上:只有 BH 校正后 $p<0.05$、$\mathrm{OR}\ge1.5$、且在保留复制集上复检通过的特征才能进入因果验证。

反事实干预与因果验证

对输入做最小编辑(如删掉否定词)构造仅移除目标特征、语义标签不变的对照样本 $x^{cf}$,比较模型对虚假标签预测概率的变化 $\bar{\Delta}p$;若其显著为负,说明模型确实依赖该特征,而非数据里碰巧相关。

这是 Stage 3 把『数据集层面相关』升级为『模型层面因果利用』的关键手段,也是本文区别于纯相关性发现工作的核心。

DFR 与群组鲁棒去偏

Deep Feature Reweighting(DFR)冻结编码器、仅用『平衡群组』样本重训线性分类头;Group DRO 直接最小化最差群组损失;PoE 训练一个偏置辅助模型并在主模型中降权其高置信预测。标准 DFR 需要人工标注的群组标签(如人口身份属性)。

Stage 4 的卖点是同一个布尔表达式可以自动生成群组标签,实现无标注 DFR 并追平人工标注版本——理解消融、基线对比和 WGA 指标都需要这些方法背景。

研究动机

神经文本分类器普遍靠与任务无关的表面模式换取基准分数:在 MNLI 中,假设含否定词 never 的样本与矛盾标签的优势比高达 2.86,词汇重叠启发式让 BERT 的 ERM 模型在 HANS 非蕴含词汇子集(NE-Lex)上准确率仅 9.53%,而蕴含识别接近天花板,说明高分完全建立在捷径上。已有对策都卡在识别环节需要人工:Wang & Culotta 需要人工标注虚假特征,Wu et al. 要求目标特征预先指明,跨数据集归因分析假设偏置模式至少在一个参考语料中缺席——但共享众包标注协议产生的偏置往往无处不在,这个前提很少成立;基于模型错误或聚类的方法则把群组结构埋进不可解释的数值索引。更根本的是,数据集层面的统计相关不等于模型层面的利用:本文实测 OR=10.01 的特征在 BERT 和 RoBERTa 上都未被因果依赖,纯相关分析会白白去偏。

本文的目标是本文要回答两个递进问题:如何在不知道捷径是什么的情况下自动找出它们?找到之后如何严格证明一个已训练模型 $f_\theta$ 真的在利用它?为此 UNMASK 构建了无需任何额外人工标注的流水线,分三个目标:(1)发现——仅凭无标签训练样本,让 LLM 生成候选表面模式并写成可确定性执行的布尔表达式 $b(x)$;(2)因果验证——先用带独立复制的统计协议(Fisher 精确检验 + BH 错误发现率控制)确认数据集层面的关联,再通过保标签的最小编辑反事实干预,检验模型预测是否随特征移除而显著偏移;(3)缓解——把因果确认的特征直接当作群组定义,实现无标注的 Deep Feature Reweighting 去偏,并要求整个流程不加修改即可迁移到 NLI、毒性检测乃至奖励模型偏好数据。

与已有工作不同的是,独特切入是把『可执行布尔表达式』当作贯穿全部四个阶段的统一中间表示:同一个确定性函数 $b(x)$ 既是发现阶段的假设形式(可在语料上运行而非仅被描述),又是反事实干预的验证把柄(程序判定 $b(x^{cf})=0$),还是去偏群组的标签生成器。相比之下,Menon & Srivastava 生成的自然语言错误描述不可执行;概念激活向量方法需要预定义概念集;程序化弱监督(Snorkel)的标注函数由人手写且面向真实标签信号;SpurLens 只比较线索在场与否的准确率差,量化相关而非因果贡献。另一层新意是把证据显式分成『相关→利用』两级,并用情感分类作阴性对照证明因果闸门会正确返回零特征——这使纯相关分析不可见的跨架构分歧(RoBERTa 对 BERT 依赖的三个矛盾类特征免疫)第一次浮出水面。

核心方法

直觉上,找并除掉捷径要回答两个递进问题:数据里哪些表面模式和标签强相关?模型真的在用它吗?UNMASK 分四阶段作答。Stage 1 候选生成:无标签训练数据切小批次喂给 GPT-4o(SCGenLLM),每批最多 5 个模式,每个模式附自然语言描述、类别标签和一行 Python 布尔表达式 $b(x)$,可对任意输入确定性求 TRUE/FALSE。Stage 2 统计验证:先按描述嵌入聚类去重,再经『执行 trace + 评估 LLM 判错 + 生成 LLM 重写』的布尔逻辑修复循环,按真实覆盖集做第二轮去重,最后用带独立复制的两阶段 SFV 协议(Fisher+BH、覆盖天花板与精度地板)选出 top-10 特征集 $F_{val}$。Stage 3 因果验证:先做依赖筛查,再由 GPT-4o 生成保标签最小编辑、Qwen3-32B 盲评标签保持,对配对概率差 $\bar{\Delta}p$ 做 t 检验,显著下降者进入 $F_{causal}$。Stage 4 去偏:用同一组布尔表达式切出平衡群组,供 DFR、PoE、SCER、LEACE、JTT 等方法消费。

核心创新是与已有工作的三点本质区别。其一,特征表示升级:从人工词表或 PMI 单 token 统计改为 LLM 生成的可执行布尔表达式,既能表达跨字段组合模式(前提-假设词重叠比例、长度比、跨句对比绝对词——这些 n-gram 枚举无法表达,也是附录 L 中超过 PMI 基线的增益来源),又能确定性复用,使统计标注、反事实移除判定、群组切分全部免人工。其二,证据分层:高优势比只是入场券,必须再通过反事实干预证明『移除特征使模型对虚假标签的预测概率显著下降』($\bar{\Delta}p < -\varepsilon$,$\varepsilon=0.03$,配对 t 检验 $p<0.01$)才算被因果利用;这纠正了相关性分析的假阳性——OR=10.01 的特征在两个架构上都未被依赖,而去偏这种非因果特征没有任何收益。其三,验证过的特征免费充当 DFR 的群组标签,去掉了标准 DFR 对人工人口标注的依赖,在 CivilComments 上以程序化群组追平手工标注的 70.1% WGA。

方法步骤详情

Step 1(候选生成):5000 条平衡样本分批输入 GPT-4o,输出描述+布尔表达式,NLI 得 625 个、CivilComments 得 1695 个候选。Step 2a(初始去重):按描述嵌入余弦聚类(阈值 0.85),降到 395/506。Step 2b(布尔逻辑验证):执行表达式生成 trace,Qwen3-32B 判错、GPT-4o 重写(2 轮),compile() 兜底,得 301/418。Step 2c(覆盖去重):表达式+描述联合嵌入聚类且覆盖集 Jaccard 超阈值才合并,得 172/223。Step 2d(SFV):构建 0/1 标注矩阵,7:3 分层切分,Fisher+BH($\alpha{=}0.05$、$\mathrm{OR}_{min}{=}1.5$)、覆盖上限 0.90 剔定义性、精度下限 0.35 剔无预测力,log OR/覆盖/精度等权打分、共现聚类取代表,选 top-10。Step 3a(依赖筛查):在『特征在场但标签相反』组上做单侧双比例 z 检验($\alpha{=}0.01$)。Step 3b(反事实+因果判定):GPT-4o 最小编辑使 $b(x^{cf}){=}0$,Qwen3-32B 盲评保标签(最多 3 轮),配对 t 检验要求 $\bar{\Delta}p<-0.03$ 且 $p{<}0.01$。Step 4:每特征实例化 $\{b_i(x){=}1,0\}\times K$ 群组、等量池化,供各去偏方法使用。

技术新颖性

技术新颖性体现在四点。(1)可执行性是第一公民:假设在语料上『可运行』而非『被描述』,下游所有阶段(统计标注矩阵、$b(x^{cf})=0$ 的程序化移除验证、$2K$ 群组切分)零人工、零额外 API 调用——这是把 Snorkel 式标注函数的抽象倒转过来瞄准伪影:表达式改为 LLM 生成、目标是虚假信号、并补上原范式没有的因果验证。(2)验证协议是三层漏斗(BH 控制的发现-复制统计→行为依赖筛查→反事实配对检验),每层拒绝都有明确理由;论文用应得零结果的情感任务做阴性对照(0/5、0/8),证明因果闸门是决策门而非锦上添花,并据此发现纯相关分析不可见的跨架构分歧:RoBERTa 对 F91/F99/F130 的 $t$ 值仅 −0.11/−1.67/−1.38($p>0.09$),而 BERT 全部 $p<0.01$。(3)跨模型族解耦(GPT-4o 生成、Qwen3-32B 评估)降低确认偏误与偏好泄漏。(4)工程上极度轻量:每 seed 约 9.54 美元 API 费、2×A6000 即可复现,gpt-oss-120b 开源替换已验证可行。

UNMASK makes a classifier's shortcuts nameable, testable, and removable, with no human annotation in the loop.
Figure 1: UNMASK makes a classifier's shortcuts nameable, testable, and removable, with no human annotation in the loop.

实验结果

(1)MNLI 再发现:625 个候选筛出 10 个特征,独立复现已知伪影——3 个词汇重叠变体(OR 3.08–3.49,$\bar{\Delta}p$ −11 至 −15 pp)支撑蕴含,假设否定(OR 2.86)与对比绝对词(OR 5.58)支撑矛盾,假设超长 1.5 倍(OR 3.26)关联中立;因果验证 BERT 确认 9/10、RoBERTa 6/10,三 seed 一致。(2)跨架构分歧:F91/F99/F130 BERT 全部利用而 RoBERTa 免疫($p$=0.911/0.099/0.173);OR 最高的 F150(10.01)两架构都不用。(3)去偏:BERT 上 PoE-IPW-Group 把 HANS 从 52.41 提至 64.99(+12.58 pp),MNLI-m 仅降 1.18 pp;RoBERTa +4.08 pp;LEACE 在 BERT 上损失约 15 pp。(4)CivilComments:程序化群组 DFR 达 71.84/72.12 WGA,追平手工标注的 70.1;领先最强发现基线 PMI+SFV 3.65 pp;PMI 全是侮辱词、0/8 身份轴,UNMASK 无标注恢复 6/8。(5)阴性对照:SST-2/IMDB 统计特征 OR 4.94/5.14,因果验证 0/5、0/8,其上去偏无收益(ERM 92.07 vs DFR 91.85)。(6)Tier A 使 BERT DFR 再 +1.17 pp。(7)RewardBench2:安全拒绝语 OR=161、Focus 格式主导、Ties 长度敏感(OR 2.0)、Math 奖励『step by step』(OR 22.7)、Precise_IF 0/95 显著。(8)反事实人工审计 94/100 标签保持、98/100 移除正确。

NLI benchmark accuracy (%) across all six evaluation sets and HANS.
Table 1: NLI benchmark accuracy (%) across all six evaluation sets and HANS.
CivilComments-WILDS 16-cell worst-group accuracy on the WILDS test split (a: debiasing methods; b: discovery baselines under a fixed BERT DFR recipe).
Table 2: CivilComments-WILDS 16-cell worst-group accuracy on the WILDS test split (a: debiasing methods; b: discovery baselines under a fixed BERT DFR recipe).
Spurious features identified by the pipeline on MNLI.
Table 3: Spurious features identified by the pipeline on MNLI.
Feature counts at each pipeline stage for NLI (MNLI) and CivilComments-WILDS.
Table 4: Feature counts at each pipeline stage for NLI (MNLI) and CivilComments-WILDS.
Executable boolean expressions for all 10 top-k features.
Table 6: Executable boolean expressions for all 10 top-k features.
Spurious features identified by the pipeline on CivilComments-WILDS.
Table 7: Spurious features identified by the pipeline on CivilComments-WILDS.
IMDB debiasing accuracy (%) when applied to 8 features that passed sufficiency screening but have 0 causally verified features.
Table 12: IMDB debiasing accuracy (%) when applied to 8 features that passed sufficiency screening but have 0 causally verified features.
Per-feature counterfactual sample sizes and paired t-test statistics for NLI causal verification.
Table 13: Per-feature counterfactual sample sizes and paired t-test statistics for NLI causal verification.
Representative spurious features per RewardBench2 subset.
Table 21: Representative spurious features per RewardBench2 subset.
HANS non-entailment subcategory breakdown (%).
Table 24: HANS non-entailment subcategory breakdown (%).
CivilComments-WILDS worst-group accuracy (%) by feature tier (Tier C = all 10 SFV features, Tier A = causally verified 9-feature subset).
Table 28: CivilComments-WILDS worst-group accuracy (%) by feature tier (Tier C = all 10 SFV features, Tier A = causally verified 9-feature subset).
查看结构化数据
任务指标本文基线提升
NLI 鲁棒性(BERT,MNLI 训练) HANS 总体准确率 (%) PoE-IPW-Group 64.99±4.44 ERM 52.41±1.65 +12.58 pp
NLI 鲁棒性(RoBERTa) HANS 总体准确率 (%) PoE-IPW-Group 78.56±0.63 ERM 74.48±1.44 +4.08 pp
毒性检测群组鲁棒(BERT) CivilComments-WILDS 16 格最差群组准确率 (%) DFR(Tier A 程序化群组)71.84±1.94 ERM 58.97±1.32;人工标注 DFR 文献值 70.1 +12.87 pp,且无标注即超过人工标注版本
毒性检测群组鲁棒(RoBERTa) CivilComments-WILDS WGA (%) DFR(Tier C)72.12±0.26 ERM 55.66±0.67 +16.46 pp
发现质量对比(固定 BERT DFR 下游配方) WGA (%) UNMASK 71.84±1.94 PMI+SFV 68.19±0.85 / PMI 64.80±6.91 / LLM-only 65.10±4.21 +3.65 pp(对最强基线,均值±std 区间不重叠)
Sagawa 最差群组(MNLI dev-matched,BERT) WGA (%) SCER 73.93±1.74 ERM 62.07±4.14 +11.86 pp
分布内精度保持(BERT,NLI) MNLI-matched (%) PoE-IPW-Group 83.43±0.37 ERM 84.61±0.19 仅 −1.18 pp(鲁棒性收益下的最小代价)

局限与改进

作者承认:布尔表达式约束可发现范围——潜在语义捷径、主题/风格偏置、类不平衡等分布性伪影无法写成确定性谓词;因果阶段受制于生成器,反事实编辑无法固定输入其他属性,共触发特征被联合移除使 $\Delta p$ 只能上界单特征贡献。我的补充:其一,F150 的拒绝可能是功效问题(仅 27 对,post-hoc 功效 0.34),『未测出』与『未利用』有混淆风险,尽管效应小且置信区间过零支持真阴性;其二,Qwen3-32B 在 ChaosNLI 标签一致性仅 80.3%,评估器错误会渗入因果判定,跨模型族解耦与 94% 人工审计只是缓解;其三,去偏方法排序跨任务翻转(PoE-IPW-Group 赢 NLI 却在 CivilComments 落后 DFR 约 6 pp),落地仍需人工选方法;其四,身份轴只恢复 6/8(male/female 缺失);其五,RewardBench2 只有发现无验证,Precise_IF 零显著无法区分无信号与谓词不可表达;其六,多数去偏方法损害零样本迁移(AG-News 上 −1 至 −7 pp),论文未给权衡解法。

独立分析的弱点

独立弱点分析:(1)表达力天花板——语义/语用级捷径(数值细节提升可信度、微妙正式度线索)不可布尔化,方向:引入『软谓词』(阈值+嵌入相似度)但保留确定性接口与程序化验证。(2)反事实保真受 GPT-4o 编辑能力约束——F130 接受率仅 61%、NLI 标签保持 90%,方向:语法树约束替换、多生成器投票。(3)阈值体系($\alpha$、$\varepsilon$、$\mathrm{OR}_{min}$、top-k=10)全为手工设定,跨域稳健性未消融,方向:自适应或 bootstrap 校准。(4)因果检验无先验功效规划,F150 型欠功效(n=27、power=0.34)可能误杀真捷径,方向:按效应量反推样本量。(5)跨架构结论仅基于两个 base 级模型,对 LLM 微调分类器是否成立未知。(6)仅英文短文本验证,跨语言与长文档泛化不明。(7)群组切分假设特征可独立子采样,强相关特征簇合并策略可能丢信息。

未来方向

作者层面:把谓词语言扩展到不可布尔化的分布性伪影(主题、风格、类不平衡);用更强或开源生成器缩小反事实保真差距(附录 K 已示范 gpt-oss-120b 全流程)。基于成果可延伸:(1)对奖励模型做完整的因果验证+去偏闭环——论文只对 RewardBench2 跑了发现与验证,下一步可对 RM 本身施加反事实干预,缓解长度/格式/谄媚偏置,直接服务 RLHF 流水线;(2)把跨架构免疫性分析发展为模型审计与选型工具(RoBERTa 不依赖 BERT 依赖的三个矛盾类捷径,说明架构先验影响捷径吸收);(3)设计局部化特征擦除,避免 LEACE 式全子空间投影在 BERT 上 −15 pp 的分布内崩溃;(4)系统刻画『去偏-迁移』权衡:多数方法零样本转移动 −1 至 −7 pp,JTT 却在 SST-2/AG-News 上 +2 至 +9 pp;(5)建立跨数据集共享的『捷径注册表』:布尔表达式可移植,同一特征可在新语料上零成本复检,形成社区级伪影知识库;(6)将 SFV+因果闸门嵌入训练时监控,实时警报新出现的捷径。

复现评估

复现性良好:代码与逐样本反事实审计表开源于 github.com/chidaksh/spurious_mitigator,覆盖发现、因果验证、去偏全流程;超参、六个 prompt 模板、统计阈值在附录 B 完整给出;固定 3 个 seed(42/123/323),SFV 特征集跨 seed 冻结,特征求值完全程序化、零 API 依赖。算力门槛低:主实验仅需 2×RTX A6000 微调 base 级编码器;LLM 成本每 seed 约 9.54 美元(反事实生成 6.89 美元占大头,且反事实集跨 seed/架构复用,属一次性开销)。开源替代已验证:gpt-oss-120b 替换 GPT-4o 约 3 美元、32 分钟,恢复 3/3 经典捷径类、与 GPT-4o top-10 重叠 8/10,但漏掉 2 个跨字段组合特征(恰是其优于 PMI 的卖点)。数据全部公开。总体难度中低;注意附录 L.1 的 NLI 发现基线仅单 seed(NE-Lex per-seed 波动 37.42–74.74),复现该对比时数字可能偏大。