分数不能证明发现:面向AI科研智能体审计的发现认证协议(DCP) Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
用密封验证、恢复审计与反馈配对三道门,把AI科研高分变成可复放的发现证书
前置知识
信息边界(K、E₀、L⋆)
DCP 按信息来源把智能体可用材料切成三类:K 是运行前固定的背景(模型、任务规则、起始代码、工具、已知组件);E₀ 是与本次研究动作无关的初始观测(初始测量、训练样例、标签);L⋆ 是运行中由智能体自身动作产生、并被后续研究动作消费的历史(假设、候选提交、实验结果、分数、误差分析)。起始就存在的观测属 E₀,因选择某个动作而返回的测量属 L⋆,固定的人类指导进 E₀,依据中间结果选择的人类指导则进入人机谱系。
Gate 2 恢复审计的全部逻辑就是隐藏 L⋆、交付 K + E₀ + Wobs(目标运行看到的全部网页字节)。不理解这条按来源划分的边界,就无法判断'发现'与'已有知识'如何被严格区分开。
恢复见证与恢复概率上界
恢复见证指挑战者在无 L⋆ 条件下产出满足 $Valid(a) \wedge score(a) \geq x-\epsilon$ 的合法产物,一旦出现即一票否决 Core,这是证书资格规则;恢复概率 $p_B$ 则是注册分布 $Q_B$ 下一个完整 episode(best-of-k 算一个 episode)命中恢复的概率。$n$ 个独立 episode 零命中时,固定样本上界为 $p^{upper} = 1 - \alpha^{1/n}$,如 96 次零命中给出 0.0468。
见证证明'存在替代路径'(确定性证据),概率上界刻画'新 episode 的恢复风险'(统计证据),二者角色显式分离且不可互相替代——罕见恢复与极低恢复概率可以共存,这是理解 Core 判决的关键。
配对随机化与零校准
Gate 3 借鉴 Rubin 的随机化配对设计:从注册检查点 $c$ 分叉出新鲜配对分支,一支接受来自自身动作的真实反馈,另一支接受保持消息时序、格式与长度但剥离方向信息的中性策略,估计 $\Delta_{feedback} = E[u(A_{truthful}) - u(A_{neutral}) \mid c]$。零校准在答案由 E₀ 决定的独立任务上对比两个非信息策略,要求置信区间落入注册等价带 $\pm\delta_{sham}$(TOST 等价检验思想)。
没有零校准就无法排除'中性通道本身改变表现'的混淆;Evidence 判定要求 $LCB(\Delta) \geq \delta_{evidence} + \delta_{sham}$ 正是把这一混淆控制住后才允许宣称'反馈有用'。
密封评测与预注册
密封评测指评估数据与打分在全部候选生成关闭之前对研究者不可见,由同一对称评估器检查基线、目标与控制;预注册则在目标运行前冻结任务、模型、信息、接口、工具、预算、基线、有效性规则、选择与停止程序及统计分析,每个启动的确证审计消耗预分配的错误预算,A⋆ 由注册选择规则在密封评分前冻结。
DCP 的可信度完全建立在'先注册、后运行、分数后定'的流程约束上:注册在运行前,验证器在运行后确定性复算。这是理解其威胁模型(申诉方可能策略性作弊)和决策可复放性的前提。
研究动机
AI 科研智能体(AlphaTensor、FunSearch、AI Scientist 等)会自主选择动作、运行实验、读取测量并修订方案,输出程序、模型、数据产品和实验配方。设想一个智能体跑了 87 次实验后报告分数为 $x$ 的程序:密封测试只能证明程序有用,却无法回答两个同样可测的问题——一个拿到注册背景 K、初始观测 E₀ 和目标运行所见全部网页内容 Wobs、但没有研究历史 L⋆ 的匹配智能体,是否也能靠常规搜索到达 $x$?真实实验反馈相比中性信息流,是否真的提高了到达 $x$ 的概率?文献早已警示实现与基线选择会扭曲测得的收益(Melis et al. 2018;Musgrave et al. 2020),同一想法的独立实现可以改变排名。而现有评测体系各管一段:MLE-bench、PaperBench 只测工程与复现能力,评估污染研究只关心预训练暴露,Proof-of-Learning 只证明训练过程,没有人把'一个高分'背后的有用性、可恢复性与反馈效应拆成可独立检验的证据。
本文的目标是本文要为 AI 科研产出建立可执行、可复放、跨领域通用的认证协议 DCP(Discovery Certification Protocol),把关于一个数值结果的声明转化为可运行的恢复与反馈测试。具体有三问三答:其一,Gate 1 在密封评测上验证结果确实有用,要求置信下界满足 $LCB[\mu(A^\star)-\mu(b)] \geq \delta_{min}$;其二,Gate 2 向拿到注册信息边界内全部材料的全新匹配智能体隐藏研究历史 L⋆,任何有效方法达到 $x - \epsilon$ 即构成恢复见证并否决 Core,无恢复时给出有限样本上界 $p^{upper} \leq \rho$;其三,可选的 Gate 3 用随机配对实验量化真实反馈相对中性策略的平均效应,经独立零校准与注册效应边际后颁发 Evidence。最终由一个确定性、无 LLM 的离线验证器从冻结证据包复现 Core / Evidence / recovered / audit-incomplete 四种决策。
与已有工作不同的是,独特之处在于'结果层面的恢复规则':审计不要求复现原作者的方法,而是接纳一切有效路径——挑战者可以组合熟悉组件、跨域迁移技术或写出完全不同的实现,只要数值达标 $x - \epsilon$ 就平等构成见证。这与已有工作有本质区别:specialist-agent 研究只删除历史试验但保留当前最佳代码和分数;评估污染研究只处理预训练暴露且无法量化残余风险;Proof-of-Learning 记录训练状态却不含反事实挑战。DCP 还把三件事的证据含义显式分离:一次成功的目标运行、一个可恢复的结果、一个有益的反馈策略,分别对应 Gate 1、Gate 2 的见证/概率界与 Gate 3 的配对效应,避免用单一分数混淆三者。信息边界来自严格的来源追踪(起始即有的观测属 E₀,因动作而返回的测量属 L⋆),Web 访问经录制网关逐字节存档并完整披露给挑战者,使恢复界可以条件化在 Wobs 上。
核心方法
直觉是:高分只是起点,认证要追问三个独立问题。DCP 用五个对象定义审计的信息结构——背景 K、任务观测 E₀、研究历史 L⋆、最终输出 A⋆、机器判据 P。Gate 1 要求密封评测上 $LCB[\mu(A^\star)-\mu(b)] \geq \delta_{min}$ 且基线低于恢复区;Gate 2 给全新匹配智能体完整的 K、E₀ 和 Wobs,隐藏 L⋆,冻结策略以非方向性消息回应其动作,恢复规则为 $P(a) = Valid(a) \wedge score(a) \geq x - \epsilon$;任一合格见证立即触发 Core 否决,否则在 $n$ 个独立 episode 上以 $p^{upper} = 1 - \alpha^{1/n}$ 给出零恢复上界,Core 要求上界 $\leq \rho$ 且控制组合格——正控制必须能在提供必要信息时解出已知实例;可选 Gate 3 从注册检查点 $c$ 分叉配对分支,估计 $\Delta_{feedback} = E[u(A_{truthful}) - u(A_{neutral}) \mid c]$,Evidence 要求零校准通过且 $LCB(\Delta) \geq \delta_{evidence} + \delta_{sham}$。
核心创新有四点。第一,任何有效方法都是合格的恢复路径:恢复判据只看 $Valid(a)$ 与 $score(a) \geq x-\epsilon$,不关心方法是否与原实现相似——knapsack 案例中挑战者用不同于目标运行的方式写出 0.9363 与 0.9356 两个超线解,正是这条规则的直接体现。第二,见证与概率分离:见证是证书资格规则(存在即否决),概率上界 $p_B$ 刻画新 episode 的恢复风险,罕见恢复与极低恢复概率可以共存。第三,中性反馈策略只保留消息的时序、格式与长度而剥离方向信息,配合 TOST 式等价带 $\pm\delta_{sham}$ 的独立零校准,把'反馈有用'变成有因果含义的配对估计量。第四,威胁模型把申诉方视为潜在策略性作弊者:录制网关逐字节存档 Web、完整账本暴露漏报尝试与换模型行为、早期私分访问,证据生产与决策检查接口分离,无 LLM 的确定性验证器离线复算决策,使同一份证据可被任何第三方独立重放。
方法步骤详情
第一步,注册:目标运行前冻结任务、模型、信息、接口、工具、预算、基线、有效性规则、选择与停止程序及统计分析,每个启动的确证审计消耗预分配错误预算。第二步,Gate 1:目标与基线产物经同一对称评估器在密封负载上打分,要求 $LCB[\mu(A^\star)-\mu(b)] \geq \delta_{min}$、产物合法且基线低于恢复区,目标无效或增益不足则失败。第三步,Gate 2:挑战者获得 K、完整 E₀ 与模型可见的全部 Web 字节 Wobs,L⋆ 被隐藏,其动作由冻结策略以非方向性消息回应;从注册分布 $Q_B$ 抽取独立 episode,零命中时计算 $p^{upper} = 1 - \alpha^{1/n}$,并执行机会预算、信息包访问、独立抽取、有效输出率与正控制的充分性检查。第四步,Gate 3:在注册检查点分叉 30 对新鲜分支,真实臂收自身动作的测量,中性臂收同格式无方向的测量,配对二项效应给 99% 精确区间;另设 60 对零任务校准中性通道,区间须落入 ±0.17 等价带。第五步,验证器从冻结证据包确定性复现四种决策。
技术新颖性
技术上,DCP 的贡献是形式化而非模型创新:它把发现声明拆成三个可独立复放的统计对象,用'注册式反事实'替代事后论证。恢复规则 $P(a) = Valid(a) \wedge score(a) \geq x - \epsilon$ 的可移植性来自把领域知识下放给任务适配器(只定义 Valid、score、反馈),协议本体跨程序、模型、策略、数据产品通用。统计工具链每个组件都有出处——Rubin 1974 的随机化配对、Schuirmann 1987 的 TOST 等价检验、Nosek 2018 的预注册确证设计、零命中的固定样本上界——但把它们组装成'恢复审计 + 反馈审计'的两级证书是新的。工程上,录制网关、冻结的中性策略、共享检查点、配对 attrition 规则(预行动基础设施故障可整对替换而保留已启动名额)共同保证证据链可审计。与 Proof-of-Learning 不同,DCP 不依赖训练过程记录;与 DeepResearchGym 等稳定检索环境不同,DCP 把检索内容本身作为证据冻结进审计。
实验结果
四个案例全部通过 Gate 1,但判决出现分化。SQLite-Web(DeepSeek-v4-flash):16 个查询族只能选 4 个部分索引,主智能体从首个计划的 0.0369 迭代到密封分 0.8855(基线 0,VM 工作减少 88.55%);96 个拿到全部 Web 字节的无历史挑战者最高 0.6734 < 恢复线 0.8805,0/96 恢复,上界 0.0468 < ρ,正控制 45/45(召回下界 0.8889 ≥ 0.8),判 Core + Evidence;Gate 3 为 30/30 真实恢复 vs 0/30 中性,效应 1.0,99% CI [0.6379, 1.0],60 对零校准 CI [−0.0950, 0.0950] ⊂ ±0.17,边际 0.4679 > 0.34;成本 $61.17 / 507 会话。Virtual catalyst(v4-pro):32,768 配方空间,最终配方 1.0 vs 基线 0.5990,挑战者最高 0.8146 < 0.95,0/96,判 Core + Evidence,$56.40 / 435 会话。Device calibration:0/80、正控制 60/60、上界 0.0477,判 Core。Knapsack:挑战者产出 0.9363 与 0.9356 两个高于恢复线 0.9329 的解,前者超过目标 0.9349,触发 Core 否决。Affine:2 个正控制 episode 不足,判 audit incomplete。验证器离线复现了全部决策。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SQLite-Web 部分索引优化(密封私有负载) | 归一化密封分数(流量加权 VM 步数削减) | 0.8855(主智能体,从首次提交的 0.0369 迭代而来) | 0(无二级索引) | 密封负载上 VM 工作量削减 88.55% |
| 虚拟催化剂配方优化(5 控制 × 8 档 = 32,768 配方) | 密封分数(256 条密封条件下达到最优行为记 1.0) | 1.0000(最终静态配方) | 0.5990(固定基线配方) | +0.4010,达到满分最优 |
| Gate 2 恢复审计(SQLite-Web 与催化剂各 96 个无历史 episode) | 合格恢复数与零命中固定样本上界 p_upper | 0/96 与 0/96,上界均 0.0468;最佳挑战者 0.6734 / 0.8146,均低于恢复线 0.8805 / 0.95 | 目标运行 0.8855 / 1.0000 | 0.0468 < ρ 且正控制 45/45(召回下界 0.8889 ≥ 0.8),通过 Core |
| Gate 3 反馈效应(两域各 30 对随机化配对) | 配对二项恢复概率差 Δ 的 99% 精确区间 | 30/30 vs 0/30,Δ = 1.0,CI [0.6379, 1.0] | 中性反馈臂 0/30;60 对零校准对比 0,CI [−0.0950, 0.0950] ⊂ ±0.17 等价带 | 0.6379 − 0.17 = 0.4679 > 0.34 注册边际,通过 Evidence |
局限与改进
作者承认的边界:每个 Core/Evidence 决策只对注册的模型、信息与预算范围有效,换模型或预算必须重新注册审计(决策记录以 scope 显式标注);中性策略只承诺在注册的等价带内无方向信息,不排除其他偏置家族;Gate 3 的结论是特定策略对在检查点条件下的效应,而非'反馈普遍有用';确认性审计消耗预分配错误预算,两例完整审计分别花费 $61.17 与 $56.40,大规模推广成本可观。我的补充观察:全部实验在受控虚拟环境(私有 SQLite 库、确定性虚拟催化剂)中进行,真实开放科研场景的密封性与可冻结性未经验证;Core 的说服力受挑战者能力上限约束,若注册模型弱于目标系统,零恢复可能只反映能力差距而非信息不可达;恢复判定对 ε 高度敏感——knapsack 中 0.9363 对 0.9329 的差距仅 0.0034 就翻转了判决;'Wobs 完整性'完全依赖录制网关的可信实现,这在威胁模型下是一个单点信任假设。
独立分析的弱点
第一,挑战者能力与恢复结论耦合:Gate 2 的零恢复只在注册分布 $Q_B$ 内有意义,若社区模型整体变强,旧证书即需重新审计,建议注册多个强度档位并报告'最强可用挑战者'下的界。第二,成本结构:昂贵单元是注册的生成 episode(每例 96 个 episode、435–507 会话、约 $56–61),对逐篇审计不现实,可发展分层预筛——先少量 episode 估计,超阈值再追加样本。第三,ε 的选择缺乏方法论:knapsack 案例 0.0034 的分数差翻转判决,说明注册前需要领域敏感性分析或标准化的 ε 选取流程。第四,Gate 3 只测一对注册策略,结论外部效度有限,可对多个中性策略族做元分析并报告族内变异。第五,虚拟环境过于理想化:真实 Web 内容会变化、真实实验室不可逐字节回放,需要受审计的 Web 快照服务与环境容器化标准。第六,证书时效性只以'回溯审计区分时间范围'带过,缺乏证书自动失效与重新认证的正式机制。
未来方向
作者提出的方向:前瞻式部署流程(批准注册→密封评估→证据收集→控制执行→离线复放→独立会签)与回溯式恢复(分别测'发表前等效范围'与'当下可恢复性'两个时间范围);正式签发需独立来源验证与注册局会签;发布 dcp-audit、dcp-harness、示例证据包与决策复放工具链。基于成果可延伸:把 DCP 作为 MLE-bench、PaperBench 等基准之上的第二层证据层,让榜单分数附带恢复审计;对自驱动实验室等真实自动化科研系统做前瞻注册审计;实证研究挑战者模型能力与恢复概率的标度关系,回答'多强的模型才能恢复某发现';把 Gate 3 扩展为多反馈策略比较与最优反馈策略搜索;恢复见证可规范化为'替代路径'的发表通道,让被否决的发现成为可引用、可检索的负结果。
复现评估
复现友好度很高。决策复放是确定性、离线、无 LLM 的:冻结的机器可读证据包记录了任务构建、注册、模型与接口契约、评估单元、阈值、统计、预算、成本与标识符,第三方运行共享验证器即可重算全部决策,不需要 GPU 或调用模型。新鲜证据生产则需要注册指定的模型与环境:两例完整审计分别用 507 会话($61.17)与 435 会话($56.40),使用 DeepSeek-v4-flash / v4-pro,成本对个人研究者可承受。论文承诺发布 PyPI 包 dcp-audit(任务适配器)与 dcp-harness(把捕获、挑战、配对反馈测试、定稿、打包暴露为独立操作),以及示例证据包与图表生成脚本,链接在首页。难度分层:复放决策(低,脚本级);复跑完整审计(中,需重建录制网关与任务适配器并调用模型 API);把协议适配到新领域(高,需要定义 Valid、score、反馈与正控制)。
论文图表