评估能许可什么结论:Inspect Evals 中声明重放的提交绑定普查 What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals
对124个Inspect评测做声明重放普查:110个显式停止,14个可重放,胜者常比排名更稳健。
前置知识
已识别集(identified set)
部分识别的核心对象:同一问题未必有唯一答案。把所有被允许的口径 $f$ 代入同一冻结证据 $\mathcal{D}$ 与声明 $q$,全部候选答案构成集合 $I_q(\mathcal{D},\mathcal{F})$;集合单点称“已识别”,多点称“未识别”,此时给出不同答案的两口径构成“分歧见证”。
本文的全部结论都用已识别集表达:分数、方向、胜者、完整排序、成对关系各自成集,读懂它才能理解“排序可变而胜者不变”这类分层结论。
多重宇宙/规格曲线分析
心理学与机器学习中的敏感性分析方法:枚举数据预处理、指标聚合、样本筛选等所有“合理但可变”的分析选择,在每个选择组合上重算结果,画出色谱图或规格曲线,展示结论对研究者自由度的依赖程度。Steegen 等人 2016 年与 Simonsohn 等人 2020 年的工作是代表。
本文继承了“枚举分析口径”的思路,但把输出从标量范围或翻转标签升级为按声明分层的答案集合、分歧见证与稳定关系,并显式区分主分析与争议口径。
Inspect AI 与 Inspect Evals
Inspect 是英国 AI 安全研究所(UK AISI)与 Meridian Labs 开发的前沿模型评测框架,提供任务注册、评分器、结构化日志 EvalLog 与容器执行;Inspect Evals 是社区贡献的评测集合与注册表,含 200 多个覆盖编码、智能体、推理、知识、行为与多模态的评测。
本文的普查对象就是在冻结提交 32b79a2 下 Inspect Evals 的全部机械合格评测单元,理解该框架的任务/评分器/日志结构才能理解“证据未绑定”到底缺什么。
攻击成功率(ASR)与聚合口径
ASR 衡量智能体被提示注入等攻击攻破的比例,本文取越低越好。同一批攻击结果可以用多种文档化的口径汇总:micro 按样本汇总、macro 按套件平均、utility-conditional 只在模型正常完成用户任务时计入攻击、worst-suite 取最差套件。口径不同,分母与资格规则就不同。
开场的 AgentDojo 例子正是这些口径让 Gemini 与 GPT-4o-mini 名次互换(20.827 vs 27.186 反转为 32.000 vs 19.745),直接引出“哪一层结论稳定”的问题。
失败封闭(fail-closed)与提交绑定
来自软件工程封闭构建与供应链证明的纪律:所有依赖被哈希固定在特定提交;验证时若所需证据缺失,就显式失败并报告缺失项与最小补齐方案,而不是静默插补或继续运行。本文把这套纪律搬到评测结论层,产生带缺失对象和“最小解锁工件”的类型化 STOP 记录。
110 个评测单元的停止不是“零分”或“基准坏了”,而是基础设施诊断;没有这个概念会完全误读本文的普查结果。
研究动机
现代评测基础设施已经提供了任务注册表、评分器、结构化日志、容器执行和排行榜,但附着在这些执行之上的科学推断仍是“环境性”的:它依赖仓库布局、维护者知识、README 约定、隐含的缺失值规则和手工拼装的证据。论文用两个具体案例展示后果。其一是 AgentDojo:在同一批攻击结果上,公开的 published-micro 口径给出 Gemini 2.0 攻击成功率 20.827、GPT-4o-mini 27.186(越低越好),而 utility-conditional 口径反转为 32.000 与 19.745,两者名次互换,只有 Claude 3.5 在所有五个口径下保持第一(1.113–3.810)。其二是附录 L 的受控诊断:217 行轨迹与七条预测规则完全固定,仅改动一条终局处置规则,PageRank 减 Earliest 的采纳效应就从约 −40 个百分点(三种处置策略下 −43.03 至 −40.76 pp,95% 任务聚类区间如 [−50.82, −35.14])塌缩到恰好 0。这说明“能跑代码”不等于“能重放一个结论”:大量已发表的基准结论无法从绑定证据中重建。
本文的目标是本文要把这个隐含的推断步骤变成显式、可执行的对象,回答一个简单问题:对于一条给定的声明——一个精确值、一个方向或阈值穿越、一个胜者或一个完整排序——在被允许进入分析的每个评估器语义下,答案是否一致?为此论文做三件事:第一,提出“声明重放”契约,把历史观测、可准入的语义候选与被查询的声明绑定为可执行的 $(\mathcal{D}, \mathcal{F}, q)$ 三元组;第二,对冻结在 Inspect Evals 提交 32b79a2 上的全部 124 个机械合格评测单元做一次完整普查,逐一判定历史声明能否重放,不能重放时给出显式停止原因、首个缺失对象与最小解锁工件;第三,给出发布接口与审计格式,把数值、方向、胜者、完整排序、稳定成对关系分别报告,使语义敏感性成为可审阅的科学结果,而非一个笼统的“稳健/不稳健”标签。
与已有工作不同的是,已有工作各有缺口:多重宇宙与规格曲线分析枚举合理的分析选择,但通常把可执行变体合并进一个选择集,最后报告标量范围或“是否翻转”,既把无法重放的案例条件掉,又抹平了“哪一层结论变了”的结构;部分识别理论提供了集合值识别的标准机器,却很少被用于基准声明;基准敏感性研究扰动指标、数据与协议,但缺乏对“历史证据是否绑定”的失败封闭检查。本文的独特切入是把三个问题分开:证据是否充分(可执行性状态)、哪些语义算数(A/D/X 准入判定)、哪个分辨率的结论稳定(声明相对已识别集)。由此它保留全部 124 条记录——包括 110 条带缺失项与最小解锁的显式 STOP——把主分析与争议口径分成 $\mathcal{F}_{primary}$ 与 $\mathcal{F}_{review}$ 两族,为每个非单点答案给出双规格分歧见证,为每条不变结论给出稳定成对关系。
核心方法
直觉上,一条评测结论由三样东西决定:冻结的证据 $\mathcal{D}$(输出、裁判、状态、支持集)、被允许的评估器语义族 $\mathcal{F}$、被查询的声明 $q$;声明重放就是固定前两者,枚举后者在每个语义下的答案。技术上,论文先在提交 32b79a2 上机械构造有限框架:129 条严格路径候选、5 条规则排除,得到 124 个评测单元。证据采集分三路且永不合并:完整的 124 单元普查、每层抽 2 的冻结随机十例、3 个目的性深审计(AgentDojo、AutoML、BEIR SciFact)加 8 个事后暴露的探索案例。对可重放单元,分析器按 G1–G8 门序执行:绑定证据、固定声明与端点类型、做 A/D/X 准入判定,把 admitted 候选投影到 $\mathcal{F}_{primary}$、admitted+disputed 投影到 $\mathcal{F}_{review}$,再确定性枚举每个规格的值、top 集、弱序与成对关系,输出已识别集、分歧见证和稳定对;关键绑定缺失则显式 STOP。人类只负责声明定义与准入,此后一切计算确定性且失败封闭。
核心对象是“声明相对已识别集”:对声明 $q$,$I_q(\mathcal{D},\mathcal{F}) = \{q(V(f;\mathcal{D})) : f \in \mathcal{F}\}$ 收集该族内所有被允许的答案;对任意系统对,$R_{ab}(\mathcal{D},\mathcal{F})$ 收集所有成对关系,集合单点即“已识别/稳定”。与多重宇宙分析的本质区别有三:其一,声明分层——由 $\mathcal{F} \subseteq \mathcal{F}' \Rightarrow I_q(\mathcal{D},\mathcal{F}) \subseteq I_q(\mathcal{D},\mathcal{F}')$,扩展族只会扩大答案集,胜者可在完整排序变化时保持唯一;其二,主/评审两族分离,A/D/X 准入在看到结果前冻结;其三,失败封闭——证据不足产生带缺失对象与最小解锁的类型化 STOP,绝不插补。论文还把语义变异与抽样区间、打印精度及可逆单位变换(如 UCCB 的 $x \mapsto 20x$)四个坐标分开,避免把表示差异误报为语义不稳定。
方法步骤详情
第一步,冻结框架:在提交 32b79a2 的冻结树中匹配 src/inspect_evals//eval.yaml 的 129 条路径,按预声明规则排除 1 个先前已审计单元和 4 个含浮动外部资产的包,得到 124 个合格单元。第二步,逐单元过八道门:G1 源绑定、G2 声明选择、G3 端点类型、G4 观测绑定、G5 评估器可执行、G6 族判定(A/D/X)、G7 确定性执行、G8 综合验证;第一道未满足的门产生类型化 STOP,记录首个缺失对象、不插补理由与最小解锁工件。第三步,对 14 个完整单元:绑定 $\mathcal{D}$,评估每个 admitted 规格的语义映射 $M_f$、行规则 $\ell_f$ 与聚合 $A_f$,在两族中分别构造值、top 集、弱序与成对关系,为每个非单点答案生成最小双规格见证。第四步,验证:独立实现从绑定源表重算全部算术与答案集(844/844 检查通过);对 5 个完整包做受控证据消融,20 处定向删除全部恰在声明的 G1–G4 边界停止。新跑模型/裁判会改变 $\mathcal{D}$,回答的是新问题,不能替代历史重放。
技术新颖性
技术新颖性在于把软件工程的封闭构建、供应链证明与失败封闭验证纪律移植到“评测结论”层:发布物必须携带重建一条历史声明所需的最小工件,验证器对缺失证据显式失败并命名缺失项。与最近邻工作相比——部署完整基准测试问“基准证据能许可什么行动”,规格敏感性问“轨迹是否决定诊断对象”——本文问的是互补的历史问题:给定钉死的发布物和声明,哪些答案在被允许的语义族内成立?论文还给出五层保存模型(源、观测、中介/状态、支持、语义注册表),证明 task/scorer 代码和 EvalLog 只是第一层:裁判决策、沙箱终态、支持连接与语义注册表同样必须绑定,即 task/scorer/log 不能自动给出可执行的 $(\mathcal{D},\mathcal{F},q)$。同时它不把分歧归咎于单个挑战者:31 个去重分歧见证中 14 个是 admitted–admitted 对,76 次 leave-one-out 删除中 71 次分歧持续。110 条 STOP 不是“基准质量差”的评分,而是把证据负担变成可审计、可解锁的基础设施发现。
实验结果
普查:124 个单元中 14 个可确定性重放,110 个显式停止;首缺原因是证据绑定 47、缺比较观测 35、缺裁判轨迹 9。冻结随机十例完成 3/10 且全部未识别。三个目的性深审计:AgentDojo 主族排序 Claude 3.5 > Gemini 2.0 > GPT-4o-mini 唯一(3/3 对稳定),评审族加入三个争议口径后排序不唯一(utility-conditional 32.000 对 19.745 反转)但 Claude 恒为胜者、2/3 对稳定;AutoML 主族排序唯一(10/10),加入 worst-task AUC 后 9/10,仅 AutoWEKA/TPOT 交换、H2OAutoML 胜者不变;BEIR 五视角族下胜者唯一、2/3 稳定,25 视角下胜者失去唯一性、稳定对降至 0/3。汇总:15 条已识别成对关系 13 条在评审族仍识别,无一胜者丢失;31 个分歧见证中 14 个为 admitted–admitted。附录 L:仅改一条终局规则即把采纳效应从约 −40 pp 塌缩到 0,5 个弱序下 Mini 仍是唯一胜者。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AgentDojo 目标攻击排序重放(949 个公开 run 键,629 个共享) | 稳定成对关系数(主族/评审族) | 主族 3/3 稳定且完整排序唯一;评审族 2/3 稳定,胜者 Claude 恒定 | 单一“翻转/不翻转”标签的常规敏感性报告 | 分离出“胜者固定 + 次序层翻转”的结构,并给出 Gemini/GPT-4o-mini 反转的最小见证对 |
| AutoML Benchmark 排序重放(149 行 results_valid.csv,5 框架 3 任务 1 缺失格) | 稳定成对关系数 | 主族 10/10 稳定且排序唯一(H2OAutoML > autosklearn > TPOT > AutoWEKA > oboe);评审族 9/10 | 把全部可执行口径合并为一个选择集的 multiverse 做法 | 定位唯一翻转对 AutoWEKA/TPOT(worst-task AUC 所致),同时保住 H2OAutoML 的唯一胜者地位 |
| BEIR SciFact 检索排序重放(5183 文档、300 查询、3 个确定性 BM25) | 稳定成对关系数 | 声明五视角族 2/3 稳定、胜者唯一;25 视角覆盖敏感性下 0/3 且胜者失去唯一性 | 单一指标(如 NDCG@10)排名 | 证明稳定骨架是 $(\mathcal{D}, \mathcal{F}_{scope}, q)$ 授予的,不伴随评估器本身 |
| 124 单元声明重放普查(Inspect Evals 提交 32b79a2) | 可确定性重放比例 | 14/124 完成,110 条显式 STOP(含首缺对象与最小解锁) | available-case 敏感性分析(把缺证据单元条件掉) | 保留全部记录并给出发布接口瓶颈分布:证据绑定 47、比较观测 35、裁判轨迹 9 |
| 217 行正交诊断数据集的采纳效应(附录 L,不在普查分母内) | PageRank−Earliest 采纳效应(百分点,95% 任务聚类区间) | 对称终局规则下效应恰为 0;原单边规则 −43.03 [−50.82, −35.14] 至 −40.76 [−48.61, −32.98] pp | 单一规格内的 bootstrap 精度(不积分被省略的语义层) | 把约 40 pp 的表面效应定位到一条单边终局删除规则,同时显示 5 个弱序下 Mini 仍是唯一胜者 |
局限与改进
作者明确划定边界:所有头条结论只对命名的有限框架、证据流、冻结证据和枚举语义族负责;普查是框架内记账而非生态系统流行率估计,随机十例的 3/10 只许可该冻结平衡分层抽样的完成率估计(层大小 47/40/26/7/4 各抽 2),目的性与事后暴露案例不能并入概率分母。准入判定(A/D/X)、声明选择与可比支持判断由人类审计者做出,论文不为语义族完备性、基准构念效度或裁判准确性背书;搜索面之外的工件可能存在,漏检属可纠正的 provenance 错误。我自己的观察:其一,首停类别分布(证据绑定 47、比较观测 35)深刻反映当前发布惯例,可能随社区规范快速过时;其二,序数端点只逐规格显示数值而不合并,决策者常需要的精确效应量仍不可得;其三,前瞻效用未测——110 个停止中有多大比例能被新发布流程阻止是开放问题;其四,全部算术基于公开打印值(如五位数表格),未触及未舍入的潜值,BEIR 的 25 视角敏感性也只是探索性诊断而非 admitted 族。
独立分析的弱点
第一,准入主观性:哪些候选算“同一声明、可比支持”由审计者判断,不同团队可能构造出不同的 $\mathcal{F}$,而结论恰好相对该族成立;改进方向是多人审计一致性实验与对抗性准入(红队提交边缘候选并测结论漂移)。第二,成本不对称:发布逐样本输出、裁判轨迹、沙箱状态与支持掩码的开销远大于写 README,缺乏激励时 STOP 会成为常态;改进是把最小解锁工件做成作者侧发布清单或 CI 检查,在推送时自动验证。第三,可扩展性:成对关系随系统数平方增长,50 系统榜单有 1225 对,逐对报告需层级摘要(如仅报 top-k 内关系或聚合稳定性指数)。第四,语义与抽样坐标严格分离虽干净,但实践者想要“语义集合 × 抽样区间”的联合推断对象,论文只留概念区分未给方法。第五,搜索面与证据时界依赖快照时的公开资源,作者私有工件无法进入,会把“可协商解锁”误判为 STOP;可给 STOP 加“可协商”标注。第六,普查对象限于 Inspect Evals 的 eval.yaml,向 HELM、lm-eval-harness 等框架的迁移未被检验。
未来方向
作者在附录 K 明确提出前瞻效用测试:在结果可见前注册新发布的评测单元与声明,比较契约辅助接口与旧式接口的三个独立终点——重放完成率、审计耗时、决策改变率;110 条回顾性 STOP 只提供干预靶点和基线分类,不提供治疗效应。基于本文成果还可延伸多个方向:把声明重放字段原生集成进 Inspect 的 EvalLog 与分布式注册表,使最小工件在发布时被自动收集;系统研究不同声明类型的最小充分统计量——方向可能只需紧凑统计量、精确值需要逐样本键控输出、胜者介于两者之间;把已识别集与自助法/任务聚类区间结合,构造语义×抽样联合不确定度对象;对 A/D/X 准入与同目标/同支持筛查做部分自动化(如用类型系统推断端点类型);对裁判型基准做裁判版本绑定的专项研究(FrontierScience 与 MMMU 的停止都源于此);在多个评测框架上重复普查,检验 G1–G8 停止分类是否跨框架稳定;以及把稳定骨架思想用于动态排行榜的增量更新。
复现评估
复现性极高。arXiv 源码附带 anc/claim_replay_public_reproduction.zip 便携包,README.md 是入口;顶层验证器检查包闭合、路径卫生、声明重放验证器、确定性再生成与独立 844 项检查;独立实现从绑定源表重算分数、排序、稳定对与支持边界。框架钉死在公开提交 32b79a244f17…,五条排除规则逐条列举并给出对象级理由。因为论文不做任何新模型/裁判调用,三个确定性微型实验只需哈希绑定输入即可重建,无需 GPU;深审计只用公开冻结的输出表(对比 CORE-Bench 全量重放约需 15 GB capsule 加 Docker,本文刻意不重跑)。难点不在算力而在语义层:完整复刻 124 单元普查需执行 G1–G8 门序、A/D/X 准入与证据时界搜索,涉及大量审计人力;但主分析结论(AgentDojo/AutoML/BEIR 的已识别集与见证)可用附录精确数值直接核对。作者声明广泛使用生成式 AI 辅助,但所有数值与代码输出经确定性验证器与独立重算检查。
论文图表
前瞻测试设计图:在结果可见前注册新发布的评测单元、声明与分析,随后比较旧式接口与契约辅助接口的三个终点——重放完成率、审计耗时、决策改变率;未来的证据供给不由 110 条回顾性停止提供。
它划清回顾诊断与前瞻干预的界线,是评估本文实用价值时必须引用的边界声明,也是后续研究的实验设计模板。