← 返回 2026-08-28

评估能许可什么结论:Inspect Evals 中声明重放的提交绑定普查 What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

Xi Qin 📅 2026-08-25 👍 3 2026-09-01 18:30
元科学 可复现性 基准测试 敏感性分析 评测方法 部分识别

对124个Inspect评测做声明重放普查:110个显式停止,14个可重放,胜者常比排名更稳健。

前置知识

已识别集(identified set)

部分识别的核心对象:同一问题未必有唯一答案。把所有被允许的口径 $f$ 代入同一冻结证据 $\mathcal{D}$ 与声明 $q$,全部候选答案构成集合 $I_q(\mathcal{D},\mathcal{F})$;集合单点称“已识别”,多点称“未识别”,此时给出不同答案的两口径构成“分歧见证”。

本文的全部结论都用已识别集表达:分数、方向、胜者、完整排序、成对关系各自成集,读懂它才能理解“排序可变而胜者不变”这类分层结论。

多重宇宙/规格曲线分析

心理学与机器学习中的敏感性分析方法:枚举数据预处理、指标聚合、样本筛选等所有“合理但可变”的分析选择,在每个选择组合上重算结果,画出色谱图或规格曲线,展示结论对研究者自由度的依赖程度。Steegen 等人 2016 年与 Simonsohn 等人 2020 年的工作是代表。

本文继承了“枚举分析口径”的思路,但把输出从标量范围或翻转标签升级为按声明分层的答案集合、分歧见证与稳定关系,并显式区分主分析与争议口径。

Inspect AI 与 Inspect Evals

Inspect 是英国 AI 安全研究所(UK AISI)与 Meridian Labs 开发的前沿模型评测框架,提供任务注册、评分器、结构化日志 EvalLog 与容器执行;Inspect Evals 是社区贡献的评测集合与注册表,含 200 多个覆盖编码、智能体、推理、知识、行为与多模态的评测。

本文的普查对象就是在冻结提交 32b79a2 下 Inspect Evals 的全部机械合格评测单元,理解该框架的任务/评分器/日志结构才能理解“证据未绑定”到底缺什么。

攻击成功率(ASR)与聚合口径

ASR 衡量智能体被提示注入等攻击攻破的比例,本文取越低越好。同一批攻击结果可以用多种文档化的口径汇总:micro 按样本汇总、macro 按套件平均、utility-conditional 只在模型正常完成用户任务时计入攻击、worst-suite 取最差套件。口径不同,分母与资格规则就不同。

开场的 AgentDojo 例子正是这些口径让 Gemini 与 GPT-4o-mini 名次互换(20.827 vs 27.186 反转为 32.000 vs 19.745),直接引出“哪一层结论稳定”的问题。

失败封闭(fail-closed)与提交绑定

来自软件工程封闭构建与供应链证明的纪律:所有依赖被哈希固定在特定提交;验证时若所需证据缺失,就显式失败并报告缺失项与最小补齐方案,而不是静默插补或继续运行。本文把这套纪律搬到评测结论层,产生带缺失对象和“最小解锁工件”的类型化 STOP 记录。

110 个评测单元的停止不是“零分”或“基准坏了”,而是基础设施诊断;没有这个概念会完全误读本文的普查结果。

研究动机

现代评测基础设施已经提供了任务注册表、评分器、结构化日志、容器执行和排行榜,但附着在这些执行之上的科学推断仍是“环境性”的:它依赖仓库布局、维护者知识、README 约定、隐含的缺失值规则和手工拼装的证据。论文用两个具体案例展示后果。其一是 AgentDojo:在同一批攻击结果上,公开的 published-micro 口径给出 Gemini 2.0 攻击成功率 20.827、GPT-4o-mini 27.186(越低越好),而 utility-conditional 口径反转为 32.000 与 19.745,两者名次互换,只有 Claude 3.5 在所有五个口径下保持第一(1.113–3.810)。其二是附录 L 的受控诊断:217 行轨迹与七条预测规则完全固定,仅改动一条终局处置规则,PageRank 减 Earliest 的采纳效应就从约 −40 个百分点(三种处置策略下 −43.03 至 −40.76 pp,95% 任务聚类区间如 [−50.82, −35.14])塌缩到恰好 0。这说明“能跑代码”不等于“能重放一个结论”:大量已发表的基准结论无法从绑定证据中重建。

本文的目标是本文要把这个隐含的推断步骤变成显式、可执行的对象,回答一个简单问题:对于一条给定的声明——一个精确值、一个方向或阈值穿越、一个胜者或一个完整排序——在被允许进入分析的每个评估器语义下,答案是否一致?为此论文做三件事:第一,提出“声明重放”契约,把历史观测、可准入的语义候选与被查询的声明绑定为可执行的 $(\mathcal{D}, \mathcal{F}, q)$ 三元组;第二,对冻结在 Inspect Evals 提交 32b79a2 上的全部 124 个机械合格评测单元做一次完整普查,逐一判定历史声明能否重放,不能重放时给出显式停止原因、首个缺失对象与最小解锁工件;第三,给出发布接口与审计格式,把数值、方向、胜者、完整排序、稳定成对关系分别报告,使语义敏感性成为可审阅的科学结果,而非一个笼统的“稳健/不稳健”标签。

与已有工作不同的是,已有工作各有缺口:多重宇宙与规格曲线分析枚举合理的分析选择,但通常把可执行变体合并进一个选择集,最后报告标量范围或“是否翻转”,既把无法重放的案例条件掉,又抹平了“哪一层结论变了”的结构;部分识别理论提供了集合值识别的标准机器,却很少被用于基准声明;基准敏感性研究扰动指标、数据与协议,但缺乏对“历史证据是否绑定”的失败封闭检查。本文的独特切入是把三个问题分开:证据是否充分(可执行性状态)、哪些语义算数(A/D/X 准入判定)、哪个分辨率的结论稳定(声明相对已识别集)。由此它保留全部 124 条记录——包括 110 条带缺失项与最小解锁的显式 STOP——把主分析与争议口径分成 $\mathcal{F}_{primary}$ 与 $\mathcal{F}_{review}$ 两族,为每个非单点答案给出双规格分歧见证,为每条不变结论给出稳定成对关系。

核心方法

直觉上,一条评测结论由三样东西决定:冻结的证据 $\mathcal{D}$(输出、裁判、状态、支持集)、被允许的评估器语义族 $\mathcal{F}$、被查询的声明 $q$;声明重放就是固定前两者,枚举后者在每个语义下的答案。技术上,论文先在提交 32b79a2 上机械构造有限框架:129 条严格路径候选、5 条规则排除,得到 124 个评测单元。证据采集分三路且永不合并:完整的 124 单元普查、每层抽 2 的冻结随机十例、3 个目的性深审计(AgentDojo、AutoML、BEIR SciFact)加 8 个事后暴露的探索案例。对可重放单元,分析器按 G1–G8 门序执行:绑定证据、固定声明与端点类型、做 A/D/X 准入判定,把 admitted 候选投影到 $\mathcal{F}_{primary}$、admitted+disputed 投影到 $\mathcal{F}_{review}$,再确定性枚举每个规格的值、top 集、弱序与成对关系,输出已识别集、分歧见证和稳定对;关键绑定缺失则显式 STOP。人类只负责声明定义与准入,此后一切计算确定性且失败封闭。

核心对象是“声明相对已识别集”:对声明 $q$,$I_q(\mathcal{D},\mathcal{F}) = \{q(V(f;\mathcal{D})) : f \in \mathcal{F}\}$ 收集该族内所有被允许的答案;对任意系统对,$R_{ab}(\mathcal{D},\mathcal{F})$ 收集所有成对关系,集合单点即“已识别/稳定”。与多重宇宙分析的本质区别有三:其一,声明分层——由 $\mathcal{F} \subseteq \mathcal{F}' \Rightarrow I_q(\mathcal{D},\mathcal{F}) \subseteq I_q(\mathcal{D},\mathcal{F}')$,扩展族只会扩大答案集,胜者可在完整排序变化时保持唯一;其二,主/评审两族分离,A/D/X 准入在看到结果前冻结;其三,失败封闭——证据不足产生带缺失对象与最小解锁的类型化 STOP,绝不插补。论文还把语义变异与抽样区间、打印精度及可逆单位变换(如 UCCB 的 $x \mapsto 20x$)四个坐标分开,避免把表示差异误报为语义不稳定。

方法步骤详情

第一步,冻结框架:在提交 32b79a2 的冻结树中匹配 src/inspect_evals//eval.yaml 的 129 条路径,按预声明规则排除 1 个先前已审计单元和 4 个含浮动外部资产的包,得到 124 个合格单元。第二步,逐单元过八道门:G1 源绑定、G2 声明选择、G3 端点类型、G4 观测绑定、G5 评估器可执行、G6 族判定(A/D/X)、G7 确定性执行、G8 综合验证;第一道未满足的门产生类型化 STOP,记录首个缺失对象、不插补理由与最小解锁工件。第三步,对 14 个完整单元:绑定 $\mathcal{D}$,评估每个 admitted 规格的语义映射 $M_f$、行规则 $\ell_f$ 与聚合 $A_f$,在两族中分别构造值、top 集、弱序与成对关系,为每个非单点答案生成最小双规格见证。第四步,验证:独立实现从绑定源表重算全部算术与答案集(844/844 检查通过);对 5 个完整包做受控证据消融,20 处定向删除全部恰在声明的 G1–G4 边界停止。新跑模型/裁判会改变 $\mathcal{D}$,回答的是新问题,不能替代历史重放。

技术新颖性

技术新颖性在于把软件工程的封闭构建、供应链证明与失败封闭验证纪律移植到“评测结论”层:发布物必须携带重建一条历史声明所需的最小工件,验证器对缺失证据显式失败并命名缺失项。与最近邻工作相比——部署完整基准测试问“基准证据能许可什么行动”,规格敏感性问“轨迹是否决定诊断对象”——本文问的是互补的历史问题:给定钉死的发布物和声明,哪些答案在被允许的语义族内成立?论文还给出五层保存模型(源、观测、中介/状态、支持、语义注册表),证明 task/scorer 代码和 EvalLog 只是第一层:裁判决策、沙箱终态、支持连接与语义注册表同样必须绑定,即 task/scorer/log 不能自动给出可执行的 $(\mathcal{D},\mathcal{F},q)$。同时它不把分歧归咎于单个挑战者:31 个去重分歧见证中 14 个是 admitted–admitted 对,76 次 leave-one-out 删除中 71 次分歧持续。110 条 STOP 不是“基准质量差”的评分,而是把证据负担变成可审计、可解锁的基础设施发现。

Three questions, three outputs. Missing evidence, multiple evaluator meanings, and disagreement across claim levels are not one generic robustness outcome.
Figure 1: Three questions, three outputs. Missing evidence, multiple evaluator meanings, and disagreement across claim levels are not one generic robustness outcome.
What the added interface changes. It preserves cases that cannot be replayed, separates primary from disputed meanings, and states what remains fixed alongside what changes.
Figure 2: What the added interface changes. It preserves cases that cannot be replayed, separates primary from disputed meanings, and states what remains fixed alongside what changes.
Executable contract. Human judgment fixes type and admission before this state machine. Thereafter both family projection and identified-set enumeration are deterministic; a missing critical binding exits through a typed stop.
Figure 12: Executable contract. Human judgment fixes type and admission before this state machine. Thereafter both family projection and identified-set enumeration are deterministic; a missing critical binding exits through a typed stop.

实验结果

普查:124 个单元中 14 个可确定性重放,110 个显式停止;首缺原因是证据绑定 47、缺比较观测 35、缺裁判轨迹 9。冻结随机十例完成 3/10 且全部未识别。三个目的性深审计:AgentDojo 主族排序 Claude 3.5 > Gemini 2.0 > GPT-4o-mini 唯一(3/3 对稳定),评审族加入三个争议口径后排序不唯一(utility-conditional 32.000 对 19.745 反转)但 Claude 恒为胜者、2/3 对稳定;AutoML 主族排序唯一(10/10),加入 worst-task AUC 后 9/10,仅 AutoWEKA/TPOT 交换、H2OAutoML 胜者不变;BEIR 五视角族下胜者唯一、2/3 稳定,25 视角下胜者失去唯一性、稳定对降至 0/3。汇总:15 条已识别成对关系 13 条在评审族仍识别,无一胜者丢失;31 个分歧见证中 14 个为 admitted–admitted。附录 L:仅改一条终局规则即把采纳效应从约 −40 pp 塌缩到 0,5 个弱序下 Mini 仍是唯一胜者。

AgentDojo targeted attack success rate (lower is better) over the same outcomes. The primary analysis uses the first two readings; the review family also asks what happens under the three disputed readings.
Table 1: AgentDojo targeted attack success rate (lower is better) over the same outcomes. The primary analysis uses the first two readings; the review family also asks what happens under the three disputed readings.
Three evidence streams and the statements they license.
Table 2: Three evidence streams and the statements they license.
What native evaluation objects provide, and what a historical claim still needs.
Table 3: What native evaluation objects provide, and what a historical claim still needs.
What stays fixed across evaluator meanings, separated by evidence stream. P/E denote the primary/review families.
Table 4: What stays fixed across evaluator meanings, separated by evidence stream. P/E denote the primary/review families.
What an available-case sensitivity summary can lose, and what claim replay adds.
Table 5: What an available-case sensitivity summary can lose, and what claim replay adds.
Nested accounting for the commit-bound frame. The rows are accounting views, not pooled result samples.
Table 7: Nested accounting for the commit-bound frame. The rows are accounting views, not pooled result samples.
Claim-relative family stress. P/E denote primary/review; pair entries are stable/total.
Table 13: Claim-relative family stress. P/E denote primary/review; pair entries are stable/total.
Task-disjoint adoption effects and frozen 95% task-cluster percentile intervals, in percentage points.
Table 23: Task-disjoint adoption effects and frozen 95% task-cluster percentile intervals, in percentage points.
One rule changes the conclusion while predictions stay fixed.
Figure 3: One rule changes the conclusion while predictions stay fixed.
First unavailable requirement among the 103 stops on the outcome-blind 114-case path. The distribution identifies release-interface bottlenecks; it is not a benchmark-quality score.
Figure 7: First unavailable requirement among the 103 stops on the outcome-blind 114-case path. The distribution identifies release-interface bottlenecks; it is not a benchmark-quality score.
Claim resolution across the six complete audits. P/E denote primary/review scopes.
Figure 8: Claim resolution across the six complete audits. P/E denote primary/review scopes.
Stable-backbone retention across declared complete-audit families. Bar length is the fraction of system pairs whose relation is invariant.
Figure 9: Stable-backbone retention across declared complete-audit families. Bar length is the fraction of system pairs whose relation is invariant.
Controlled result: effect typing and ranking structure separate. Panel A shows that symmetric terminal handling collapses the contrast-comparable effect to zero. Panel B shows that complete rankings can remain non-identified while a unique winner or stable relations survive.
Figure 15: Controlled result: effect typing and ranking structure separate. Panel A shows that symmetric terminal handling collapses the contrast-comparable effect to zero. Panel B shows that complete rankings can remain non-identified while a unique winner or stable relations survive.
查看结构化数据
任务指标本文基线提升
AgentDojo 目标攻击排序重放(949 个公开 run 键,629 个共享) 稳定成对关系数(主族/评审族) 主族 3/3 稳定且完整排序唯一;评审族 2/3 稳定,胜者 Claude 恒定 单一“翻转/不翻转”标签的常规敏感性报告 分离出“胜者固定 + 次序层翻转”的结构,并给出 Gemini/GPT-4o-mini 反转的最小见证对
AutoML Benchmark 排序重放(149 行 results_valid.csv,5 框架 3 任务 1 缺失格) 稳定成对关系数 主族 10/10 稳定且排序唯一(H2OAutoML > autosklearn > TPOT > AutoWEKA > oboe);评审族 9/10 把全部可执行口径合并为一个选择集的 multiverse 做法 定位唯一翻转对 AutoWEKA/TPOT(worst-task AUC 所致),同时保住 H2OAutoML 的唯一胜者地位
BEIR SciFact 检索排序重放(5183 文档、300 查询、3 个确定性 BM25) 稳定成对关系数 声明五视角族 2/3 稳定、胜者唯一;25 视角覆盖敏感性下 0/3 且胜者失去唯一性 单一指标(如 NDCG@10)排名 证明稳定骨架是 $(\mathcal{D}, \mathcal{F}_{scope}, q)$ 授予的,不伴随评估器本身
124 单元声明重放普查(Inspect Evals 提交 32b79a2) 可确定性重放比例 14/124 完成,110 条显式 STOP(含首缺对象与最小解锁) available-case 敏感性分析(把缺证据单元条件掉) 保留全部记录并给出发布接口瓶颈分布:证据绑定 47、比较观测 35、裁判轨迹 9
217 行正交诊断数据集的采纳效应(附录 L,不在普查分母内) PageRank−Earliest 采纳效应(百分点,95% 任务聚类区间) 对称终局规则下效应恰为 0;原单边规则 −43.03 [−50.82, −35.14] 至 −40.76 [−48.61, −32.98] pp 单一规格内的 bootstrap 精度(不积分被省略的语义层) 把约 40 pp 的表面效应定位到一条单边终局删除规则,同时显示 5 个弱序下 Mini 仍是唯一胜者

局限与改进

作者明确划定边界:所有头条结论只对命名的有限框架、证据流、冻结证据和枚举语义族负责;普查是框架内记账而非生态系统流行率估计,随机十例的 3/10 只许可该冻结平衡分层抽样的完成率估计(层大小 47/40/26/7/4 各抽 2),目的性与事后暴露案例不能并入概率分母。准入判定(A/D/X)、声明选择与可比支持判断由人类审计者做出,论文不为语义族完备性、基准构念效度或裁判准确性背书;搜索面之外的工件可能存在,漏检属可纠正的 provenance 错误。我自己的观察:其一,首停类别分布(证据绑定 47、比较观测 35)深刻反映当前发布惯例,可能随社区规范快速过时;其二,序数端点只逐规格显示数值而不合并,决策者常需要的精确效应量仍不可得;其三,前瞻效用未测——110 个停止中有多大比例能被新发布流程阻止是开放问题;其四,全部算术基于公开打印值(如五位数表格),未触及未舍入的潜值,BEIR 的 25 视角敏感性也只是探索性诊断而非 admitted 族。

独立分析的弱点

第一,准入主观性:哪些候选算“同一声明、可比支持”由审计者判断,不同团队可能构造出不同的 $\mathcal{F}$,而结论恰好相对该族成立;改进方向是多人审计一致性实验与对抗性准入(红队提交边缘候选并测结论漂移)。第二,成本不对称:发布逐样本输出、裁判轨迹、沙箱状态与支持掩码的开销远大于写 README,缺乏激励时 STOP 会成为常态;改进是把最小解锁工件做成作者侧发布清单或 CI 检查,在推送时自动验证。第三,可扩展性:成对关系随系统数平方增长,50 系统榜单有 1225 对,逐对报告需层级摘要(如仅报 top-k 内关系或聚合稳定性指数)。第四,语义与抽样坐标严格分离虽干净,但实践者想要“语义集合 × 抽样区间”的联合推断对象,论文只留概念区分未给方法。第五,搜索面与证据时界依赖快照时的公开资源,作者私有工件无法进入,会把“可协商解锁”误判为 STOP;可给 STOP 加“可协商”标注。第六,普查对象限于 Inspect Evals 的 eval.yaml,向 HELM、lm-eval-harness 等框架的迁移未被检验。

未来方向

作者在附录 K 明确提出前瞻效用测试:在结果可见前注册新发布的评测单元与声明,比较契约辅助接口与旧式接口的三个独立终点——重放完成率、审计耗时、决策改变率;110 条回顾性 STOP 只提供干预靶点和基线分类,不提供治疗效应。基于本文成果还可延伸多个方向:把声明重放字段原生集成进 Inspect 的 EvalLog 与分布式注册表,使最小工件在发布时被自动收集;系统研究不同声明类型的最小充分统计量——方向可能只需紧凑统计量、精确值需要逐样本键控输出、胜者介于两者之间;把已识别集与自助法/任务聚类区间结合,构造语义×抽样联合不确定度对象;对 A/D/X 准入与同目标/同支持筛查做部分自动化(如用类型系统推断端点类型);对裁判型基准做裁判版本绑定的专项研究(FrontierScience 与 MMMU 的停止都源于此);在多个评测框架上重复普查,检验 G1–G8 停止分类是否跨框架稳定;以及把稳定骨架思想用于动态排行榜的增量更新。

复现评估

复现性极高。arXiv 源码附带 anc/claim_replay_public_reproduction.zip 便携包,README.md 是入口;顶层验证器检查包闭合、路径卫生、声明重放验证器、确定性再生成与独立 844 项检查;独立实现从绑定源表重算分数、排序、稳定对与支持边界。框架钉死在公开提交 32b79a244f17…,五条排除规则逐条列举并给出对象级理由。因为论文不做任何新模型/裁判调用,三个确定性微型实验只需哈希绑定输入即可重建,无需 GPU;深审计只用公开冻结的输出表(对比 CORE-Bench 全量重放约需 15 GB capsule 加 Docker,本文刻意不重跑)。难点不在算力而在语义层:完整复刻 124 单元普查需执行 G1–G8 门序、A/D/X 准入与证据时界搜索,涉及大量审计人力;但主分析结论(AgentDojo/AutoML/BEIR 的已识别集与见证)可用附录精确数值直接核对。作者声明广泛使用生成式 AI 辅助,但所有数值与代码输出经确定性验证器与独立重算检查。