无标签策略下准确率与顺序敏感性的背离 Accuracy and Order Sensitivity Diverge Under Label-Free Strategies
六模型两基准实验证明:即便从构造上消除选项顺序影响,也不必然换来LLM准确率提升
前置知识
选项顺序偏差(Option-Order Bias)
LLM 在多选题中,仅改变选项的排列顺序或字母标签(A/B/C/D)的分配就会改变模型选择的现象。Pezeshkpour & Hruschka (2024) 与 Zheng et al. (2024) 均发现重排选项会显著改变准确率,说明 MCQ 分数把知识与对呈现格式的敏感度混在了一起。
本文全部实验围绕『去偏是否带来准确率提升』展开,先理解这个偏差本身,才能理解为什么要设计两种免标签策略并检验它们的实际效果。
两阶段提示(Two-Stage Prompting)
第一阶段让模型不看选项、只根据问题生成自由文本答案 $E = M_{\text{gen}}(Q)$;第二阶段把 $E$ 与全部带标签选项一起呈现,让模型选出最匹配的选项。直觉是:答案承诺与选项展示分离后,呈现方式 $\phi$ 无法影响第一阶段证据的生成。
它是本文被检验的两大策略之一,论文的 2×2 诊断网格正是围绕其 Stage 1 是否隐藏选项、Stage 2 用 LLM 还是嵌入匹配来展开归因。
RStd 与 Flip Rate
RStd(召回标准差)按标准答案落在 A/B/C/D 四个位置分别计算召回率,再取四个召回的总体标准差(单位百分点),值越低越均匀,但它比较的是不同题目子集;Flip Rate 是逐题指标:对每题做 $k$ 次循环置换,若语义答案出现至少 2 个不同值即记为一次翻转。两者相关但不等价。
论文用这两个指标从聚合与逐题两个角度量化顺序敏感性,并专门论证它们会分道扬镳(Qwen-local 上方向相反),这是『解耦』结论的测量基础。
McNemar 检验与 Clopper–Pearson 区间
McNemar 检验比较同一批题目上两种方法的 broken(基线对/方法错)与 fixed(基线错/方法对)计数是否显著失衡,用于判断准确率变化是否超出机会水平;Clopper–Pearson 区间是二项比例的精确置信区间,为准确率给出 95% CI。
论文所有『提升或下降是否可信』的结论都建立在这两个工具上,例如 Llama-local 两阶段在 ARC 上 174 broken/210 fixed(p=0.074)被判为不可区分。
PriDe 与循环置换基线
PriDe 从 50 题校准集估计位置先验,按 $P_{\text{debiased}} \propto P_{\text{obs}}/\hat{P}_{\text{prior}}$ 校正预测分布,需 log 概率;循环置换把选项沿标签轮转 $k$ 次后多数投票,无需特殊访问但每题 $k$ 次。
两者是论文用来对照两种免标签策略的既有强基线,最终『cyclic 是最佳模型无关方法』的结论依赖于与它们的直接比较。
研究动机
多选题(MCQ)是 LLM 评估的主导格式:MMLU 含 14,042 道题、覆盖 57 个学科,ARC-Challenge 含 1,172 道检索式系统曾答错的小学科学题,两者都能自动评分、成本低。但已有工作表明,仅重排选项就会大幅改变模型表现(Pezeshkpour & Hruschka 2024;Zheng et al. 2024),Wang et al. (2025) 进一步指出模型可能靠选『最不错误项』而非真正解题得分,Nowak et al. (2026) 还记录了伪装成选项的隐藏偏差。这意味着 MCQ 准确率把『知识』与『对选项位置的敏感度』混在一起,分数不可尽信。而现有去偏手段代价高昂:循环置换每题需 $k$ 次调用、全排列需 $k!$ 次;PriDe 每题 1 次加固定校准开销,却要求访问 logit——许多商业 API 根本不暴露。
本文的目标是本文检验一个此前只被偶然提及的前提:如果模型在『承诺答案』时根本看不到选项标签,位置因素就无法影响预测,那么去偏是否能换来准确率提升?具体目标有三:其一,在 6 个模型(GPT-4.1 mini、Gemini 2.5 Flash、Llama 3.1 8B API/本地、Qwen 2.5 7B API/本地)× 2 个基准(各 1,000 题)上,评估两种无需重复查询、无需 logit 访问的免标签策略——两阶段提示与独立假设打分;其二,把它们与直接 MCQ 基线、循环置换、PriDe 对照;其三,用完整的 2×2 诊断网格与逐题 flip rate 定位失败环节,直接检验『降低顺序敏感性』与『提升准确率』这两件事是否同步发生。
与已有工作不同的是,已有三条研究线索各自独立发展:MCQ 脆弱性与顺序敏感性研究提出了 PriDe、BiasPrompting 等修复方法;开放作答与答案匹配研究主张自由文本是更忠实的测量界面(Chandak et al. 2025 发现答案匹配优于选择题评测);LLM-as-judge 文献记录了评审位置偏差、冗余偏差与自我增强偏差。但『去偏成功却未带来准确率提升』这类现象只在个别工作中被顺带报告,从未被正面、系统地检验。本文的独特切入是把『是否消除了位置影响』与『准确率是否变化』拆成两个可分别测量的量:用结构上无位置的策略作为干预,用逐题 flip rate 做直接测量,用 2×2 网格把失败归因到具体阶段,从而第一次系统地回答『消除位置影响到底值不值』。
核心方法
形式化上,模型预测写为 $P_M(A \mid Q, O, \phi)$,其中 $Q$ 是问题、$O=\{o_i\}_{i=1}^N$ 是语义选项集、$\phi$ 是呈现方式(顺序与标签分配)。理想情况是预测只依赖 $Q$ 和 $O$、对 $\phi$ 不变。直觉:与其事后校正偏差,不如在提示设计层面让 $\phi$ 无法进入决策。技术路线有两条:两阶段提示先生成自由文本 $E = M_{\text{gen}}(Q)$,再在 $P_M(A \mid Q, E, O, \phi)$ 下做选项匹配;独立假设打分则对每个选项单独调用 $s_i = M_{\text{score}}(Q, o_i) \in [0, 100]$,取 $\hat{A} = o_{\arg\max_i s_i}$,平局用以 run seed 与题目 ID 播种的伪随机决定。对照三个基线:直接 MCQ、循环置换多数投票、PriDe(仅在暴露 log 概率的三个模型上)。整个 2×2 诊断网格与统计体系都服务于『把去偏与准确率分开测量』这一目标。
核心创新不是提出更强的方法,而是一个受控的证伪框架。与 PriDe 这类『估计再扣除』或 Set-Based Prompting 这类『改注意力掩码』的方法不同,本文用纯提示层、无需 logit 的干预,并把『是否真正消除位置影响』与『准确率是否提升』分别度量。最重要的洞察是二者的系统性解耦:GPT-4.1 mini 在 MMLU 上 flip rate 从 21.6% 腰斩到 11.8%,准确率却从 81.8 降至 80.1;独立假设打分从构造上不可能受位置影响(其变体语义匹配的 flip rate 恒为 0.0%),准确率却在多数模型-基准对上下降。2×2 分解进一步揭示瓶颈在 Stage 1 隐藏选项而非匹配步骤——GPT-4.1 mini 隐藏选项+嵌入匹配仅 45.8,换成可见选项+嵌入匹配恢复到 81.7,相差 35.9 个百分点,与『隐藏选项会让 which-of-the-following 类问题无从作答』的欠规格化机制一致。
方法步骤详情
实验流程:①抽样——MMLU 从 50 个学科各取 20 题(seed 42,排除 7 个学科),ARC-Challenge 取 1,000/1,172 题,PriDe 另抽 50 题校准集且与评测集按构造不相交;②推理——所有条件 temperature 0.0、seed 42、max_tokens 500(独立假设打分覆盖为 4000,因 Gemini 思考 token 共享输出预算,500 上限时 976/1000 行触发 MAX_TOKENS);③两阶段 Stage 2 匹配走级联:精确匹配→子串包含(长度≥4 且唯一)→ all-MiniLM-L6-v2 余弦相似度(仅接受 ≥0.30);④独立假设打分每选项一次并行调用,0–100 分置于 标签内,正则提取、解析失败记 0 分但仍参与 argmax;⑤统计——准确率报 95% Clopper–Pearson 区间,RStd 用 10,000 次题目级 bootstrap,方法对基线用 McNemar 检验,flip rate 对每题做 4 次循环置换后统计语义答案是否变化。
技术新颖性
技术新颖性有四点。第一,诊断而非修复:不宣称新 SOTA 方法,而是给出首个把『位置影响消除』与『准确率变化』分开评测的对照实验,证明二者系统性地分离。第二,完整 2×2 分解:Stage 1(隐藏/可见选项)× Stage 2(LLM/嵌入匹配),且第四格严格复用同一批 Stage 1 输出——结果显示 Gemini 在 MMLU 上可见+嵌入(88.0)甚至超过可见+LLM 匹配(84.4),证明匹配器不是问题所在。第三,逐题 flip rate:不同于 RStd 的跨子集聚合,它直接回答『同一题换序后答案是否改变』,并揭示 Qwen-local 上 RStd 下降(MMLU 8.06→4.27)而 flip rate 上升(+5.2pp)的分离现象,说明两个指标度量的失败模式不同。第四,诚实的种子敏感性分析:对独立假设打分的平局在 10 个替代种子下重算,发现 MMLU 上报告值 51.2 低于全部种子范围 51.6–54.0,揭示看似 +1.0pp 的收益有多脆弱。
实验结果
准确率:两阶段在 12 个模型-基准对中 11 个下降(Gemini MMLU 84.9→68.3、ARC 96.9→86.6),唯一上升是 Llama-local ARC 58.0→58.3(噪声内);GPT-4.1 mini 零解析失败仍降至 80.1,非解析所致。独立假设在 11 个有效对中 8 个下降;Llama-local ARC +14.4pp(58.0→72.4)看似有效,但 cyclic(72.9)与可见+LLM 匹配(70.4)等无关方法收敛到相近水平,收益来自基准而非机制。循环置换在 MMLU 5/6、ARC 5/6 提升。诊断:隐藏选项+嵌入匹配全面崩溃(GPT 45.8、Llama-local 32.0),仅让选项可见即大幅恢复,瓶颈在隐藏选项而非匹配器。顺序敏感性:两阶段使 flip rate 在 7/12 对上升、RStd 在 5/12 对上升,均不可靠;语义匹配 flip rate 恒 0.0%、独立假设 RStd 仅 1.1–3.9(有限样本波动)。PriDe 反而伤 Llama-local:MMLU 50.2→44.2、ARC 58.0→48.8。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MMLU 两阶段提示(Gemini 2.5 Flash) | 端到端准确率 (%) | 68.3 [65.3–71.2] | 84.9 [82.5–87.1] | −16.6 pp(12 对中 11 对下降的典型代表) |
| ARC-Challenge 独立假设打分(Llama 3.1 8B 本地) | 端到端准确率 (%) | 72.4 [69.5–75.2] | 58.0 [54.9–61.1] | +14.4 pp,但 cyclic 72.9 与可见+LLM 70.4 相当,收益并非去偏特异 |
| MMLU + ARC 循环置换(全部模型) | 端到端准确率 (%) | 12 对中 10 对提升:Llama-local ARC 72.9、MMLU 57.0 | Llama-local ARC 58.0、MMLU 50.2 | 最高 +14.9 pp(Llama-local ARC) |
| MMLU 2×2 网格:隐藏+嵌入 vs 可见+嵌入(GPT-4.1 mini) | 端到端准确率 (%) | 45.8(隐藏+嵌入)→ 81.7(可见+嵌入) | 81.8(直接 MCQ) | 隐藏选项导致 −36.0 pp,证明瓶颈在 Stage 1 而非匹配器 |
| MMLU flip rate(GPT-4.1 mini,两阶段) | 逐题答案翻转率 (%) | 11.8 | 21.6 | −9.8 pp,但准确率反降 1.7 pp,是解耦论题的直接证据 |
| MMLU / ARC PriDe(Llama 3.1 8B 本地) | 端到端准确率 (%) | 44.2 / 48.8 | 50.2 / 58.0 | −6.0 / −9.2 pp,logit 去偏在弱模型上反而有害 |
局限与改进
作者承认:仅 6 个模型、2 个基准、四选项设定、每基准固定 1,000 题,对更多选项、不同题目分布、更大模型的普适性未知;除平局种子扫描外每个条件只跑一次,未测 provider 端非确定性带来的 run-to-run 方差;flip rate 实验没有相同顺序重复的对照组,API 模型的翻转可能部分来自服务端波动;每策略只有单一提示实例化,两个消融都不允许 Stage 1 推理,而这恰是答案匹配文献最直接建议的变体;未测试更强匹配器;PriDe 校准集固定 K=50;多个格子(语义匹配全部 12 个、Gemini 两阶段)因解析失败只覆盖部分题目,其 flip rate/RStd 只反映可评分子集,可能夸大位置盲程度;欠规格化机制援引的是前人工作,未在自己的数据上直接检验。我补充:Gemini×ARC 独立假设格子因 68.7% API 失败被整体剔除;ARC 有 3 题只有 3 个选项且云端提示渲染了占位第四选项;解析失败率依赖 provider 服务行为,跨模型可比性受限。
独立分析的弱点
独立分析可见五个弱点。①统计功效与运行次数:单次运行加 API 非确定性,意味着 flip rate 的中小幅差异(如 Llama-API MMLU 41.0→36.3)可能混入服务端波动,改进方向是每条件重复多次并加入相同顺序重复控制。②提示不对等:cyclic 基线用『只答字母』的无推理提示,独立假设打分却给 4000 token 预算并要求逐步分析,两者推理深度不匹配,『IHS 在 10/11 对上输给 cyclic』的结论部分可能是提示工程差异,应做推理深度对齐的比较。③嵌入匹配器过弱:all-MiniLM-L6-v2 是小型编码器,隐藏选项+嵌入格 45.8 的崩溃可能低估语义匹配的上限,应测试更强嵌入器或结构化 LLM 匹配。④机制未验证:欠规格化解释有说服力但未分层检验,可按题型(which-of-the-following 类 vs 自足题)分层重跑,或对 Stage 1 不可答问题做人工标注验证。⑤平局处理:Llama-local MMLU 平局率高达 43.2%,意味着近半题目预测近乎随机,独立假设打分对弱模型基本失效,应报告按模型能力分层的结论。
未来方向
作者提出的方向:把结果按题型分层以直接检验欠规格化机制;扩展到更多选项数、不同题目分布与更大模型;加入重复运行与相同顺序控制以剥离 provider 非确定性。基于其成果可延伸:①设计『可见选项+自由文本推理+LLM 匹配』的混合方法——第四格(可见+LLM)是唯一稳定匹配基线的配置,且 Llama-local ARC 70.4 接近 cyclic 的 72.9,若允许 Stage 1 看着选项推理可能超过两者;②研究为何 Llama-local 基线 flip rate 高达 80.3%(MMLU)而 GPT-4.1 mini 仅 21.6%,即模型规模、训练方式与位置敏感度的关系;③把 Chandak et al. (2025) 的答案匹配界面与顺序敏感性联合研究——答案匹配准确率最高但与真值一致性最差,与本文结论共同指向 MCQ 接口本身的局限;④形式化刻画『验证严格难于判别』,解释 IHS 平局率与模型强度的关系;⑤构建去偏方法的标准化审计协议,要求同时报告位置敏感性与准确率两类指标。
复现评估
可复现性较好。代码、提示模板与评测脚本以 MIT 许可开源在 github.com/cotenthusiast/choicebench,包括第四诊断格 runner 与 flip-rate 流水线;提示按版本快照进 run 目录;全局 temperature 0.0、seed 42。本地模型经 HuggingFace Transformers 在单张 A100 MIG 3g.40gb 上运行,共约 128 GPU 小时;API 模型走 OpenAI/Google/Groq/Together 四家,需付费且受速率限制(附录 C 给出配置)。数据划分精确定义(MMLU 50 学科×20 题、ARC 1,000/1,172,seed 42),PriDe 校准集与评测集按构造不相交。独立假设的种子扫描无需重新推理、只重跑 argmax 平局函数,复现成本极低。主要风险:provider 端漂移(Gemini 大量 API 失败)与 API 计费。总体难度中等:有 API 预算加单卡 A100 即可复现主表。
论文图表