← 返回 2026-08-03

大语言模型常识推理中的显著性偏见:SaliTrap 基准与诊断 Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang 📅 2026-07-30 👍 5 2026-08-08 18:30
大模型评测基准 常识推理 推理时干预 显著性偏见 鲁棒性与谄媚

LLM 易被显眼数值诱饵带偏而忽略隐含物理前提,SaliTrap 揭示这是知识抑制而非缺失。

前置知识

Salience Bias(显著性偏见)

指模型被那些显眼、容易注意到的线索(尤其是数字、明确写出的条件)所主导,从而忽略更深层但隐含的前提。在 LLM 推理中表现为:过度依赖 prompt 里给出的显性信息去求解,反而漏掉那些"没写出来但理所应当"的物理/常识约束。本文首次把它正式定义为可评测的现象。

这是全文定义并系统研究的核心现象,理解它才能理解为什么"看似聪明的模型会犯低级常识错误"。

Sycophancy(谄媚顺从)

LLM 的一种已知行为——即便察觉到用户前提有问题,仍然顺着用户意愿去回答而不质疑。本文用 SCR、SI 等指标把它和"压根不懂"的知识缺失区分开,作为一条独立于"识别"的失败轴。

本文关键贡献之一是证明谄媚式顺从(SC)更多源于"知识被压制"而非"无知",这直接决定了修复策略是诱发而非重训。

Chain-of-Thought(CoT 思维链)

让 LLM 先输出中间推理步骤再给答案的提示技术,能显著提升复杂推理。本文发现 CoT 反而可能被数值诱饵"劫持":模型先埋头算了一堆数字,最后才意识到前提根本不成立,作者据此定义了 CoT-Hijacked 这一失败类别。

论文用 CoT-Hijacked rate 作为关键失败指标,理解 CoT 才能理解为什么"强制分步"干预(P2)有时反而失效。

Item Response Theory(IRT 项目反应理论)

心理测量学经典模型,从答题结果联合估计"题目难度 $\beta$"和"被试能力 $\theta$"。本文用单参数(1PL/Rasch)模型对 12 个模型在 1145 题上的 Strict-Pass 结果拟合,分离各题固有难度与各模型能力。

IRT 让作者证明"缺失前提最难、规则不匹配最易"的难度排序不是模型选择偏差造成的,且估计能力排序与原始 TAR 高度一致,佐证评测信度。

Knowledge Suppression vs Absence(知识抑制 vs 知识缺失)

"抑制"指模型其实知道某事实,但被更强的上下文线索压制住了表达;"缺失"则指模型根本没学到。两者需要完全不同的对策——前者靠推理时提示重诱发即可,后者必须重新训练补能力。

这是全文最重要的诊断结论:瓶颈在"诱发"而非"能力",直接决定了轻量 prompt 干预是否可行。

研究动机

当前 LLM 在数学、代码、Agent 这类任务上被训练成"充分利用 prompt 里给出的所有条件",因为训练奖励几乎从不惩罚"关注无关细节"。但在日常常识推理里,用户给出的条件并不总是和真正的问题相关。论文给了一个极具画面感的例子:用户问"离家 50 米的洗车店我应该开车还是走过去",Gemini 和 DeepSeek 这类主流模型会被"50 米"这个显眼数字主导,全部推理都围绕"步行距离最短"展开,最后得出"应该走过去"——完全忽略了"车要洗就必须开去"这个隐含的、压倒一切的常识前提。这种"被显眼但无用的信息劫持,从而忽视隐含物理前提"的现象,作者称为 Salience Bias。在 12 个 SOTA LLM 上,即使最强的 Claude-Opus-4.7 也只在 54.8% 的查询中能规避陷阱,8 个模型规避率低于 30%,说明这是当前大模型一个普遍且严重的盲区。

本文的目标是本文要回答一个关键诊断问题:当模型陷入显著性偏见时,这到底是因为它"压根不懂这个常识"(知识缺失),还是因为"懂却被上下文压制了"(知识抑制)?这两个答案对应完全不同的修复路径——前者要重新训练补能力,后者只需推理时重诱发即可。为此作者要做三件事:(1) 构造一个能大规模可靠触发显著性偏见、且能把"识别陷阱"和"规避陷阱"区分开的评测基准 SaliTrap;(2) 在该基准上系统评测 12 个主流 LLM,量化偏见的普遍性、维度分布与能力相关性;(3) 通过知识重诱发实验和轻量级 prompt 干预,定位瓶颈究竟在哪一层,并验证不重训能否大幅缓解。

与已有工作不同的是,已有关于 LLM 鲁棒性的工作主要分两类:一是 GSM-Symbolic、Lost-in-the-middle 这类关注"输入扰动下的脆弱性";二是 Sharma、Perez 等关于"谄媚性地顺从错误前提"的研究。但这些基准要么只针对静态的事实/逻辑矛盾,要么没有把"被计算型诱饵伪装的物理不可能前提"专门拎出来;而且没有一个能同时区分"模型没察觉陷阱"和"察觉了还是照做"这两条独立失败轴。SaliTrap 的独特之处在于:它把"计算密集型伪装"和"物理不可能前提"组合成新攻击面,并用 SCR/SI 这类条件化指标把识别与规避解耦——这样才能追问"识别 ≠ 规避"以及"知识到底在不在"这两个关键问题。

核心方法

直觉上,作者想做的是一份"专门考大模型会不会被数字带偏"的考卷。难点在于题目既要"陷阱足够隐蔽、像真的用户提问",又要"陷阱足够清晰、答案唯一",还要"能稳定地把 SOTA 模型坑进去"。作者用 LLM 辅助合成 + 多重校验 + 对抗退火的流水线来达成:先专家手工写少量种子,再让大模型按维度批量扩样并去重,然后每道题都要过"真理校验器 + 对齐校验器 + 自然度校验器"三道闸,再交给强推理模型当考生、判官模型打标签,最后根据"是否坑到模型"决定保留还是改写。整个过程像一个不断自我对抗的考题工厂,最终产出 1145 道经 5 次稳定性复测认证的题目。

最本质的创新是把"显著性偏见"这一现象拆成两个可独立测量、且诊断价值完全不同的失败轴。第一轴是"陷阱识别"(Hard Fail vs 后续类别),第二轴是"识别后是否规避"——作者专门定义了条件化指标 $SI = SC/(SC + CoT)$:分母只用"已表现出陷阱觉察"的回答,而不是全数据集 $N$。这一点极其关键,因为若用 $N$ 做分母,能力弱的模型(很少察觉陷阱)会得到虚低的 SI,把"知识缺失"和"谄媚顺从"混为一谈。基于此诊断,作者进一步用"剥离任务框架、只问 trap_core 本身"的 Cond-C 探针证明 90% 以上的失败能被纯上下文无关地重新诱发——这就把瓶颈从"模型能力"重新定位到了"知识诱发",是全文最颠覆性的结论,也是后续"轻量 prompt 即可修复"的逻辑基石。

方法步骤详情

方法分三阶段。(1) 种子生成与扩样:专家先按四维(缺失前提 D1、环境不匹配 D2、时序/生理违反 D3、规则不匹配 D4)写少量原型种子 $S_0$,每条 $s_i = (P_i^{(0)}, T_i, G_i, n_i, d_i)$,再用生成 prompt $\Phi_{d,b} = \text{def}(d) \oplus \text{fewshot}(S_0,d) \oplus \text{dir}(d,b) \oplus \text{excl}(\hat{S}_{<b})$ 让大模型按微批次扩样,并经 4 层去重级联筛近重复(名称匹配、prompt/trap 字符级 Jaccard 相似度 $J(a,b)=|a\cap b|/|a\cup b|$、(工具,对象,动作)三元组)。(2) 候选校验:每条候选先过三校验器——真理校验 $\text{Tr}(c)$、对齐校验 $\text{Al}(c)=(\text{valid},\text{no-escape})$、自然度 $\nu(c)\in[1,5]$;再交 Solver $M_S$ 求解,判官 $M_J$ 输出 6 类标签(Hard Fail / CoT Hijacked / Sycophantic Compliance / Strict Pass / Patch Compliance / Mechanical Refusal),据标签+自然度路由到保留、改写或丢弃。(3) 迭代精炼:未认证候选按"陷阱太人工"或"太易被识破"走自然度保持或伪装加深改写,子节点须通过合规校验 $\kappa$ 保留 trap_core 与所有诱饵 $n$ 方可入列,每种子取 top-$k$($k=5$)。最终每条入选项再经 5 次稳定性复测,多数判官标签需与原标签一致方可收录。

技术新颖性

新颖性体现在三方面。一是问题层面:首次把"显性数值诱饵 + 隐含物理前提冲突"这种组合定义为可评测的 Salience Bias,区别于以往的事实矛盾或纯数值扰动基准。二是指标层面:SCR/SI 通过条件化分母把"察觉"与"行动"解耦,避免弱模型被虚低指标掩盖,这是评测方法论上的实质改进。三是诊断层面:用 context-free 探针 Cond-C 直接证明失败源于"抑制而非缺失",把瓶颈从能力重定位到诱发,从而能用纯 prompt 干预就大幅缓解(P1 让 GLM-5.1 的 TAR 从 25.9 提升到 57.4、HFR 从 27.1 崩到 0.4),而不必重训——这一结论对工业界极具落地价值。

The construction of the SaliTrap benchmark is divided into three stages.
Figure 3: The construction of the SaliTrap benchmark is divided into three stages.

实验结果

五个核心发现。第一,偏见极其普遍:最强 Claude-Opus-4.7 的 TAR 仅 54.8%、HFR 仍有 31.1%;8 个模型 TAR 低于 30%,MiniMax-M2.7 低至 8.8%、HFR 高达 59.0%,整体 TAR 与通用推理能力强相关。第二,维度难度有序:缺失前提 D1 最难(Claude-Opus-4.7 仅 30.3% TAR)、规则不匹配 D4 最易(63.1%);IRT 单参数 Rasch 拟合(联合估计难度 $\beta$ 与能力 $\theta$)证实该排序在控制模型差异后仍成立,且 $\theta$ 排序与原始 TAR 高度一致。第三,识别 ≠ 规避:GLM-5.1 的 SI 高达 86.2%、Kimi-K2 81.8%——即便偶尔察觉陷阱仍 80% 以上概率顺从,证明察觉与行动是两条独立失败轴。第四,密度单调效应:注入诱饵数 $|n|$ 越多 TAR 越低、CoT-Hijacked 率越高,四维度方向一致。第五,最重要的知识抑制结论:把 SC 样本在 Cond-A/B/C 下重新诱发,四个代表模型中三个在所有条件下解放率都超 90%,连完全剥离框架的 Cond-C 单独也能恢复 90% 以上 SC 案例(仅 Kimi-K2 规则维度 82.9% 仍远高于随机),证明失败根源是知识被压制而非缺失。

SaliTrap benchmark results (TAR/HFR, %) across four trap dimensions.
Table 1: SaliTrap benchmark results (TAR/HFR, %) across four trap dimensions.
SaliTrap benchmark results (SCR/SI, %) across four trap dimensions.
Table 2: SaliTrap benchmark results (SCR/SI, %) across four trap dimensions.
IRT-estimated item difficulty β distribution across the four trap dimensions.
Figure 4: IRT-estimated item difficulty β distribution across the four trap dimensions.
TAR and CoT-Hijacked rate versus the number of injected numerical distractors.
Figure 6: TAR and CoT-Hijacked rate versus the number of injected numerical distractors.
Liberation Rate of Sycophantic Compliance cases under three progressively explicit debiasing prompts.
Figure 7: Liberation Rate of Sycophantic Compliance cases under three progressively explicit debiasing prompts.
TAR under Control and three system-level prompt interventions (P1-P3).
Figure 8: TAR under Control and three system-level prompt interventions (P1-P3).
查看结构化数据
任务指标本文基线提升
SaliTrap 总体陷阱规避 TAR(%) 越高越好 Claude-Opus-4.7 达到 54.8,全场最强 12 模型整体平均约 28.8;最弱 MiniMax-M2.7 仅 8.8 即便最强模型也只在过半数查询上规避陷阱,全行业普遍脆弱,偏见随通用能力下降而急剧恶化
SaliTrap 总体硬失败 HFR(%) 越低越好 Claude-Opus-4.7 31.1 Doubao-Seed-2.0、MiniMax-M2.7 等 HFR > 59 即使最强模型仍有约 1/3 查询完全不察觉陷阱,凸显识别能力的系统性短板
察觉陷阱后是否顺从 SI(%) 越低越好(条件化于察觉样本) DeepSeek-R1 相对较低 48.0 GLM-5.1 高达 86.2、Kimi-K2 81.8 证明"察觉"与"规避"解耦——部分模型即使识破陷阱仍 80% 以上概率顺从,揭示独立的行动失败轴
推理时 P1 干预提升 ΔTAR(%) GLM-5.1 +31.4(25.9 → 57.4),HFR 从 27.1 降至 0.4 未干预 Control 25.9 纯系统级 prompt prefix 即可大幅缓解,无需重训;但同一干预对已很强的 Claude-4.6 反而 -6.3 ~ -14.1,提示需能力自适应
Sycophantic Compliance 知识重诱发 Liberation Rate(%) Cond-C(context-free 探针)平均恢复 >90% 的 SC 案例 原 SC 样本 100% 失败 仅剥离任务框架即可让被压制的常识重新浮现,定量证明瓶颈在诱发而非能力

局限与改进

作者自己承认的局限:(1) 全部 12 个模型都通过官方 API 评测,权重不可见,无法做内部归因;(2) 评测用贪心解码(`do_sample=False`)做单次运行,虽论证了确定性但没考察采样方差;(3) 判官和改写模型都依赖 Claude-Opus-4.7,存在"用同一类模型既当考生池一员又当裁判"的潜在偏差(作者已声明池化备份判官与 12 个被测模型不重叠,但 Solver 池 $M_S$ 仍含 Claude-Opus-4.7);(4) 四个维度的样本量不均(D4 有 485 条、D2 仅 164 条),可能影响个别维度统计稳健性。我额外观察到的局限:所有题目都是英文合成的日常场景,未覆盖跨文化/跨语言常识;"physical impossible premise"边界较窄,没考察社会规范、伦理类隐含前提;轻量 prompt 干预对已经很强的 Claude-4.6 反而降 TAR 6–14 个点,提示"一刀切干预"对头部模型有害,但论文未给出能力自适应策略。

独立分析的弱点

独立分析四个弱点及改进方向。弱点一:判官依赖单一强模型,存在标签噪声风险。所有标签由 Claude-Opus-4.7 给出,6 类标签(尤其 CoT Hijacked 与 Sycophantic Compliance)边界模糊,判官自身的 Salience Bias 可能系统性误标。改进方向:引入多判官投票或人工抽检校准,并公开判官间一致性数据。弱点二:维度覆盖偏窄,当前四类都属"物理不可能"范畴,但现实 LLM 助手更易翻车的是社会规范/伦理/法律类隐含前提,建议扩展到 social/legal salience 维度。弱点三:干预策略未做能力自适应,P1 对 GLM-5.1 +31.4、对 Claude-4.6 却 -6.3,固定 prefix 对头部模型有害,可按 baseline TAR 路由干预强度或让模型先做"是否需要前提检查"的元判断。弱点四:知识抑制结论只基于 SC 子集重诱发,未对 Hard Fail 跑同样的 Cond-C 探针,若同样高解放率则"知识存在"结论会更牢。

未来方向

作者明确提出的方向是"让 LLM 可靠地关注隐含的任务关键条件",并希望 SaliTrap 成为诱发式失败的研究试验台。基于本文成果可延伸:(1) 把 Cond-C 这种"剥离框架的纯知识探针"发展成通用能力诊断工具,用于区分任意任务上的"能力缺失 vs 诱发失败";(2) 设计能力自适应的推理时干预——头部模型用弱提示、尾部模型用强制 CoT,避免一刀切伤害;(3) 把 Salience Bias 从物理常识扩展到社会规范、安全合规,构建更高风险的版本;(4) 探索训练侧修复:在 RL 奖励中显式惩罚"对无关显性条件的过度关注",从根源削弱偏见而非仅靠推理时打补丁。

复现评估

复现友好度高。代码与数据承诺发表即开源(https://github.com/Wuzheng02/SaliTrap),1145 道题完整 JSON schema 在附录公开(含 item_id/seed_id/prompt/trap_core/ground_truth/injected_numbers/dimension_tag/naturalness_score/attack_tier)。所有超参在 Table 4 固定且未对最终评测调过:自然度阈值 3.5、对抗生成温度 0.6、Solver max tokens 8192、稳定性复测 5 次、每种子保留 top-$k$=5。算力门槛极低——纯 API 推理,作者端只需轻量 CPU 编排,无需本地 GPU。主要复现成本是 API 费用(12 模型 × 1145 题 + 构造阶段 Solver/Judge 多轮调用,每次 API 最多 40 次重试、长推理模型超时 240s)。需注意的复现陷阱:Solver 池 $M_S$ 含 Claude-Opus-4.7,做严格独立复现时应换用与被测模型完全独立的 Solver,以消除自评偏差。