← 返回 2026-08-18

先验审计-修复上下文使LLM验证器阈值向宽松偏移 Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

Parsa Mazaheri, Kasra Mazaheri 📅 2026-08-17 👍 4 2026-08-23 18:30
LLM-as-a-Judge ProcessBench 上下文效应 信号检测论 验证器偏差

先验审计-修复对话使LLM验证器误报率最多降11.5pp,本质是阈值移动而非判别力提升

前置知识

LLM-as-a-Judge 与审计-修复流水线

让一个 LLM 充当审计员(checker),逐步检查解题过程、代码或推理轨迹并输出错误裁决,另一个(或同一个)LLM 充当修复员(fixer),根据审计报告修改被标记的内容。这类 critic-correction 架构已有 CriticBench、CriticEval 等基准评估其修复质量,但管线如何"接线"(谁在什么上下文里审核)通常被视为纯工程细节。

本文的核心问题正是:管线中上游一段已完成的审计-修复交换,是否会改变审计员对下一个任务的报告行为,这是被所有人忽视的"接线"细节。

信号检测论:判别力 $d'$ 与判据 $c$

把分类器看作信号检测器:在标注正确样本上的误报率(FAR)与在标注错误样本上的检出率联合起来,可分解为判别力 $d'$(区分对错的能力)与判据 $c$(报告倾向/阈值)。FAR 单独下降既可能意味着判别力提升,也可能只是"懒得报错",必须配合检出率才能区分这两种解释。

论文用 $d'$/$c$ 把 FAR 的下降归因为阈值移动而非能力提升,这是第 6 节全部结论赖以成立的测量仪器。

ProcessBench

数学推理过程错误定位基准:每条数据是一道数学题加逐步候选解答,人工标注首个错误步骤。本文只取人工标注为"每步全对"的轨迹构造 clean 臂,因此模型报出的任何错误按构造都是误报;另配同 seed、按来源逐轨迹匹配的标注错误臂充当 detection 信号。

整个实验的因变量 FAR 直接建立在"轨迹已被人工验证全对"这一构造之上,没有它就没有"误报"的定义。

聚类自助法(cluster bootstrap)

当样本间共享随机成分时(此处每个冻结 episode 被约 9.3 个目标复用),按条目独立重采样会低估方差。聚类自助按 episode 整簇重采样 20,000 次,把 episode 可归因成分的有效样本量压回约 50,使头条区间相对按条目重采样中位数变宽约 14%,模拟校验覆盖率 0.94。

文中每个区间都是这种聚类 bootstrap,理解其口径才能正确解读各 pp 数值的置信区间与显著性。

Holm–Bonferroni 校正与声明式家族

大量对比检验时用 Holm 逐步下降法控制族错误率。本文的特点是"家族在代码里预先声明"(claim 家族 k=24、2×2 因果对比 k=9、$\Delta d'$ 与 $\Delta c$ 各自 k=9),缺员的家族按更小的 k 检验并打印警告;表格中的 † 是唯一用来下结论的存活标记。

所有表格的 † 与 surv. 计数都以这套校正为准,不看懂声明式家族就无法判断哪些对比真正"显著"。

仪器敏感度筛选

在检验主假设前,先测每个候选模型对三种 framing 控制(重述 PC、宽容 prime PCL、严格 prime PCH)的 FAR 是否会动:一个对任何 framing 都不动的因变量无法支撑任何"无效应"结论。规则是任一控制的区间清出该模型自己的 sham 噪声带即通过。

它解释了为什么只保留三个模型、为什么 Gemma 上显著反向的对比被划为探索性而非推翻主结论。

研究动机

在自动检查流水线里,让一个 LLM 充当审计员、另一个 LLM 修复它标记的内容已是标准架构,但"谁接着修复"通常被当作无关紧要的工程细节。两项近期工作给出相反方向的警示且各有混淆:Jin 与 Chen(2026)发现要求模型解释并修复会加剧对正确代码的误判,但修复请求与审计写在同一条响应里,效应可能与输出格式混淆;Khullar 等(2026)发现监控器对被框定为自己完成的工作更宽容,却又报告"显式声明该行为出自监控器本身并不诱发自归因偏差",效应取决于工作被放在哪个位置。更近的 Temkit(2026)在 84,088 次调用、12 个模型上发现判断会向前文对话的极性漂移($d=-0.17$),负面历史的漂移强度是正面的 1.52 倍,且漂移不随上下文长度(5 轮与 50 轮相同)或位置变化——按此理论,在上下文里放一段"报告了错误"的审计(明确的负面历史)应当推高误报率。这些结果要么混淆变量,要么预测方向不明,没有人把"一段已完成的审计-修复交换"单独拎出来测量过。

本文的目标是本文要回答一个上游问题:当当前任务(题目文本、步骤、指令、输出 schema、证据预算)逐字节相同、由自动化测试 diff 渲染提示强制保证时,仅仅在上下文里放一段已完成的审计→修复对话,会不会改变 LLM 验证器对当前任务的报告行为?作者刻意把因变量选为 ProcessBench 人工验证全对轨迹上的误报率 FAR 而非准确率,理由有二:操纵被假设作用于报告阈值;且每条误报都会触发一次对本来正确内容的修复循环,代价真实。更进一步,作者要求用信号检测论把 FAR 的任何变化分解为判别力 $d'$ 与判据 $c$ 的移动,从而区分"验证器变好了"与"验证器只是变懒了"这两种截然不同的解释,并评估这种无人要求的偏移在当前操作点是否恰好有益。

与已有工作不同的是,本文的独特切入是把"流水线里普通的一步"本身变成受控操纵。与 Zhou 等(2026)用选择性潜空间 steering 直接调节验证器严格度不同,这里没有任何人打算移动阈值:操纵只是把一段关于另一个题目的、模型自己在 $T=0$ 生成并冻结复用的真实审计-修复交换放进上下文。设计上三重去混淆:其一,当前任务逐字节相同,从根源排除输出格式效应(Jin 与 Chen 的混淆);其二,2×2 交叉设计(assistant/user 放置 × 自我/同伴标注,四个 cell 剥离长度匹配的标注后文本完全相同)分离放置与归属,回应 Khullar 等的放置混淆;其三,五个语义等价的指令措辞 F1–F5 全扫描,避免任何对比在单一措辞上被误读。预测方向上也与极性漂移理论尖锐对立:错误裁决 episode 应升高还是降低 FAR,两种理论给出相反答案,这正是决定性对照 AX−AS 的设计动机。

核心方法

直觉上,一个刚完成"找出错误并修复它"的模型,再去检查新题目时,报告错误的意愿可能已经改变。技术上,作者从 ProcessBench 的 1,101 条人工验证全对轨迹中切出三个不相交、按来源分层的臂:929 条 clean 目标、50 条用于生成 episode 的 warmup 题、122 条备用——不相交是承重的,否则模型等于提前审过要冷判的轨迹。另用同 seed 配 929 条标注错误臂作 detection 信号(126 GSM8K、315 MATH、301 OlympiadBench、187 OmniMath,与 clean 臂逐轨迹源匹配、无共享条目)。三个开源模型(Qwen3.6-27B、Qwen3.6-35B-A3B、Ministral-3-14B)在约束 JSON 解码、8 采样、$T=0.7$、禁用推理的设置下审计 465 条目标;操纵是在目标请求前放一段冻结 episode,按 assistant/user 放置 × 自我/同伴标注形成 AS/AO/US/UO 四个 cell(对比取四 cell 均值),再叠加以 AF 打头的五级对照系列。

核心创新是一套"对照阶梯 + 信号检测读数"的识别策略。AF(长度匹配填料:让模型重述一道无关题目,请求与回复均不含正确/错误/审核/修复字样,长度按 episode 逐对匹配,目标跨度 37–637 词)把"有过一次交换"与"交换是审计"分开;AV(删去修复轮只留审计)与 AN(修复请求换成"重述你的审计结论"、回复换成模型自己的重述,惰性续写)分离修复请求的贡献——AS 与 AN 都带审计和第二个 assistant 轮、只差那轮做什么,而惰性重述比被替换的修复长 20–35%,使 AS−AN 对长度保守,AV 更短所以 AS−AV 未被识别、作者不在其上下注。AX(episode 建在标注错误轨迹上、含一次真实修复)与 AXN(同池同构造但惰性续写)分离"真实修复内容"与"错误裁决本身",AXN−AN 因此是唯一"删掉的是真实修复"的对比。最后,极性漂移理论与"经验修复"假说对 AX−AS 给出方向相反的预测(前者说升 FAR,后者说降),使这个对比具有决定性判别力。

方法步骤详情

第一步,仪器敏感度筛选:假设检验前测每个候选模型对三种 framing 控制(重述、宽容 prime、严格 prime)的 FAR 响应,任一控制的区间清出该模型自己的 sham 噪声带即通过;三个模型通过,两个 Gemma 因 framing 跨度仅 1.94 pp 被淘汰。第二步,冻结 episode 池:每模型 50 条 warmup 题在 $T=0$ 生成审计与修复后冻结并做内容哈希。第三步,主测量:R0 与各先验上下文 cell(episode/AF/AV/AN/AX/AXN)在 465 目标上各测 8 采样、$T=0.7$ 的 FAR,用 20,000 次按 episode 聚类的 bootstrap 给区间,Holm–Bonferroni 在预声明家族(k=24)内校正。第四步,detection 臂:同条件测 929 条标注错误轨迹的检出率,配对算 $d'$、$c$ 与 balanced accuracy。第五步,推理复跑:两 Qwen 开思考重跑 R0/AS/AF,共 22,320 次生成。第六步:按错误类型比例抽 50 条 Ministral 误报人工四分类。

技术新颖性

新颖性体现在四点。第一,不变量的工程化:"当前任务逐字节相同"不是声明而是由测试 diff 渲染提示强制执行,episode 跨 cell 字节一致并经哈希校验、对比拒绝跨两个哈希形成,把输出格式混淆从根源排除。第二,识别纪律:明确只在被识别的对比上下结论——AS−AN 被识别而 AS−AV 不被识别(AV 同时改变长度与内容),AXN−AN 两侧取自不同池、无法分离裁决 token 与其描述轨迹的局限也被如实交代。第三,统计规范:家族在代码里声明、缺员报警并按更小的 k 检验;模拟校验聚类 bootstrap 覆盖率 0.94;$\Delta d'$ 与 $\Delta c$ 家族分开校正,并指出 $\mathrm{SE}(\Delta d')$ 恰为 $\mathrm{SE}(\Delta c)$ 的两倍、中位 $|\Delta c|/|\Delta d'|=1.85$,把"$\Delta d'$ 0/15 存活"的解读严格限定在检验灵敏度之内。第四,把多措辞扫描变成常规:预注册的 F1 多次不具代表性,任何对比不得在单一措辞上解读,跨措辞只报存活计数不报 p 值。

实验结果

主效应:相对长度匹配填料 AF,先验 episode 在 15/15 个模型×措辞组合上降低 FAR,F1 下为 −4.00、−3.59、−8.83 pp,最高 −11.5 pp;AF−R0 仅 +1.58、−0.18、−0.30 pp,是审计内容而非泛泛上下文在起作用。决定性对照 AX−AS 在 Ministral 五措辞全负(F1 −5.62 pp):错误 episode 反而更宽容,与极性漂移预测相反。组件互补:修复内容(AX−AXN)承载两 Qwen(各 4/5),错误裁决(AXN−AN)承载 Ministral(−8.96 pp,5/5),修复请求(AS−AN)三模型均有存活。信号检测:判据 $c$ 在 15/15 向少报错移动(13/15 存活),$\Delta d'$ 0/15 存活;balanced accuracy 15/15 上升(F1 +1.22/+2.62 pp)。基线 50 条误报人工审计 82% 属捏造,宽松化在此操作点方向正确。推理模式下效应按比例保留,$\Delta c$ +0.087/+0.058 而 $\Delta d'$ 贴零。

The episode effect and its controls at wording F1
Table 1: The episode effect and its controls at wording F1
The 4 claim contrasts discussed in the text at every wording, all three models
Table 2: The 4 claim contrasts discussed in the text at every wording, all three models
All five candidates at F1
Table 3: All five candidates at F1
Every claim contrast at every wording, all three models
Table 4: Every claim contrast at every wording, all three models
Every detection-arm contrast as one point in (threshold move, discrimination change)
Figure 2: Every detection-arm contrast as one point in (threshold move, discrimination change)
查看结构化数据
任务指标本文基线提升
干净轨迹审计误报抑制(ProcessBench 人工验证全对臂,465 目标) FAR 变化(百分点,F1 措辞,episode−AF) Qwen3.6-27B −4.00† [−5.26,−2.80];Qwen3.6-35B-A3B −3.59† [−5.38,−1.92];Ministral-3-14B −8.83† [−11.83,−5.91] 长度匹配填料 AF(自身相对 R0 仅 +1.58/−0.18/−0.30 pp);R0 基线 FAR 0.185/0.232/0.691 15/15 个模型×措辞组合成立,全范围 −2.8 至 −11.5 pp,相对降幅 9–25%
标注错误轨迹检出(ProcessBench 错误臂,929 条,信号检测) $\Delta d'$ / $\Delta c$ 家族存活数;balanced accuracy 变化 $c$ 在 15/15 向少报错移动(13/15 存活),$\Delta d'$ 0/15 存活;balanced accuracy 15/15 上升(6 存活),F1 为 +1.22 pp 与 +2.62 pp R0 检出率 0.908/0.901/0.969(AS 条件下 0.905/0.885/0.957) 无可检出的判别力增益;收益全部来自阈值移动,$\mathrm{SE}(\Delta d')$ 恰为 $\mathrm{SE}(\Delta c)$ 的两倍
误报质量人工审计(Ministral R0,F1) 误报四分类占比(50 条样本) 82% 纯属错误、16% 可辩护但更严格、2% 疑似标注错误、0% 不明确 可辩护占比 Wilson 区间 [8.3%, 28.5%];算术/代数类 21 例可辩护为 0(Fisher p=0.0034) 在 82% 误报为捏造的操作点上,向宽松的阈值移动方向正确

局限与改进

作者承认的局限:决定性 wedge 只在 Ministral 上全五措辞成立,Qwen3.6-27B 的 AX cell 是退化而非矛盾(50 条"修复"中 37 条仍断言 correct),35B 仅一个措辞到达家族;AXN 与 AN 取自不同池,没有对比能把"裁决 token"与它描述的轨迹分开;推理臂只覆盖两个模型,且截断与 schema 无效输出(每 cell 7–27/3720)与结果相关而非随机;误报人工审计只做了单模型、单措辞、单作者,无标注者间一致性;Gemma-4-31B 被预先筛除后其 episode 对比显著反向(+1.58 pp [+0.45,+2.82]),故报告的方向只描述"对 framing 有响应的模型";全部为开权重模型、单一 benchmark、单一任务族,无前沿或闭源 judge。我的补充:论文明确不命名机制,"组件互补"对部署者的行动指导有限;约 9.3 目标/episode 的簇结构限制统计功效;8 采样 $T=0.7$ 协议与常见单采样部署不同;数学之外的场景(代码审查、文本审核)完全未测。

独立分析的弱点

独立分析四点弱点。其一,外部效度窄:结论建立在数学过程审计上,FAR 的操作点(尤其 Ministral 高达 0.691 的基线)在代码审查等场景可能完全不同,而"阈值移动是否有益"恰恰依赖操作点——应在代码修复或文档审核等至少一个新任务族复刻该设计。其二,机制黑箱:三个组件跨模型互补意味着不存在共同路径,作者只能"命名无机制"——可用激活修补或 logit-lens 追踪 episode 轮次对裁决 token 概率的因果影响,定位效应发生的层与位置。其三,关键对照依赖运气:AX−AS 在两个 Qwen 上不可解释,因为 episode 的裁决分布不可控,而强制裁决又会破坏"episode 是模型自身工作"的不变量——可在更大的模型池里挑选裁决异质的模型获得天然分层,而非依赖单模型的 50 条池。其四,筛选的选择效应:按"对 framing 敏感"筛掉模型后,显著反向的 Gemma-4-31B 只能算探索性证据,读者无法知道总体中敏感与不敏感模型的比例——应报告更大、未筛选模型池的方向分布,把"仪器响应性"变成可测量的调节变量。

未来方向

作者提出或暗示的方向:设计一个既强制错误裁决、又不破坏"episode 是模型自身工作"不变量的第四池实验,以把裁决内容与轨迹内容分开(现有 AXN/AN 对比做不到);把推理臂扩展到 Ministral(其服务未暴露思考开关)与更多模型族,并处理与结果相关的截断丢弃;在机制层面识别为何修复内容在 Qwen、错误裁决在 Ministral 上承载效应。可延伸的方向:在多轮 agent 流水线中测量效应随交换次数累积或衰减的动态——极性漂移文献称 5 轮与 50 轮相同,本文尚未检验长度维度;把判据 $c$ 作为部署期监控指标,实时探测验证器被上游上下文悄悄推动;与 Zhou 等(2026)的选择性潜空间 steering 对接,比较"顺手放一段 episode"与显式 steering 的成本收益;以及修正极性漂移理论,纳入"经验修复"维度以解释本文的反向符号,并用更大的模型池检验"仪器响应性"是否预测效应方向。

复现评估

复现条件较好。代码开源(github.com/parsa-mz/crtitxer),冻结 episode 池做内容哈希、每个对比先验证两侧哈希一致才形成;逐条旗标、逐条置信度、每个对比的按条目区间与聚类区间全部持久化,聚类带来的差异可审计而非口头断言;多重性家族与筛选成员在代码中声明、缺员报警。模型全部开源并本地以约束 JSON 解码服务:Qwen3.6-27B、Qwen3.6-35B-A3B、Ministral-3-14B-Instruct-2512,无托管 API 调用。算力需求中等:主研究 8 采样 × 465/929 目标 × 多 cell,推理臂 22,320 次生成,14B–35B 级模型单卡或双卡可承担。复现实测:三个月后重跑同一冻结池,AS 的 FAR 精确复现 0.625960、R0 到五位小数;但 $T=0$ 在连续 batching 下不可复现,bootstrap 种子按(模型,对比)派生。总体难度中等:需要本地推理与约束解码基础设施以及细致的哈希/家族管理,最费人工的是 50 条误报的单人审计。