← 返回 2026-08-17

Apodex Discovery:评估与构建发现型AI的现实基准与可执行环境 Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang 📅 2026-08-11 👍 54 2026-08-22 18:30
AI基准 智能体评估 现实环境 生物医学AI 科学发现 过程验证

用可执行环境、隐藏验证器与HDS6过程验证,把开放式现实难题变成可评测的AI发现任务

前置知识

重型求解器(Heavy-Duty Solver)

论文提出的发现型AI基本运作单元:不是裸的基础模型,而是"基础模型 + 脚手架(harness)+ 工具 + 记忆 + 控制策略"构成的完整系统,负责把一个开放式现实抱负一路推进到可验证的结果。它与普通答题模型的区别不在原始推理能力,而在能否支撑长时间、有状态、可自我纠错的调查——能在面对外部世界返回的意外结果时持续修正方向。

本文的评测对象自始至终是整个求解器系统而非单个模型,这决定了基准为何要固定 episode 接口、为何能把成败归因到模型、脚手架、回路或反馈处理等具体组件,是理解全部实验设计的钥匙。

环境–任务–Episode(回合)抽象

三层嵌套构造:环境是能对求解器动作返回新观测的有状态基底(文件系统、数据库、API、沙箱、模拟器、隐藏标签等),并规定时间/算力/工具调用/安全/数据访问预算;任务是环境内一个有范围的工作单元,自带输入、期望输出、成功判据与验证程序;episode 是任务的一次可运行实例,自带数据、预算与隐藏真值,并记录完整轨迹。求解器与环境只通过固定的 episode 接口相见。

这是 TRACES 基准的骨架:同一任务可实例化为多个 episode 使系统被跨实例测量而非单案例定论;固定接口使所有系统与基线可比,差异可归因。读方法与实验部分都依赖这套词汇。

结果验证 vs 过程验证

结果验证(outcome verification)评"做出了什么":用求解器看不到的隐藏真值给最终提交 $V^{\text{out}}_{\text{final}}(y, y^\star) \to r_{\text{final}}$ 和各任务级中间产物打分,真值延迟或不可观测时退而用可测代理(如高通量筛选的包装适应度)。过程验证(process verification)评"怎么做出的":只读记录的轨迹,盲评(不看结果、抹掉私有思维链、隐去求解器身份),由 HDS6 实现。两者互补:结果分稀疏且可能数月数年才揭晓,过程分即时且可诊断。

论文的核心主张就是这两条通道并行:理解二者的信息流边界(结果永远不回流给求解器、过程诊断可以回流)是理解验证–修复回路和所有结果表格的前提。

HDS6 / TRACES 六能力

HDS6(Heavy-Duty Solver Six Capabilities)是过程验证的具体度量,六个维度首字母恰拼成 TRACES:Tools(正确选择、调用、解释工具)、Repair(对失败或验证反馈定位并修正根因、确认修复)、Alternatives(显式管理竞争假设并随证据更新排序)、Coherence(长程状态、约束与逻辑一致)、Evidence(每个论断都落在观测、工具输出、文献或数据上)、Scope(说明结论成立的边界与不确定性)。共 25 个子能力,按任务定制的 0/1/2 三档子量规打分。

它是论文的三大贡献之一,也是修复回路和所有过程分析(能力矩阵、案例研究、修复实验)的评分语言;不了解六能力就无法读懂 Table 4、5、8 和两个案例研究。

AAV 衣壳设计

腺相关病毒(AAV)是基因治疗的主流载体,其蛋白质外壳(衣壳)决定载体能否被制造(装配并包装基因组)以及能否高效到达目标细胞。衣壳工程的难点在于:提升递送或降低免疫识别的突变可能同时破坏装配。基准捕捉四个阶段:活性预测(能否装配包装)、趋向性预测(富集于哪些组织/细胞)、结构预测(从序列重建三维结构)、生成式设计(在有限实验反馈预算下产出新颖可制造且命中目标的序列)。

这是论文最重要的结果展示域:四任务全线超越已发表 SOTA 的结论都来自这里,防泄漏的分布外切分(跨突变负荷、物种、结构沉积日期)也以此为例。

药物重定位与再制剂(DRR)

不发现新药,而是为已批准或已有临床表征的药物寻找新适应症并优化开发方案(人群、生物标志物、联合用药、制剂与递送)。论文将其形式化为前瞻性逐对预测:对每个"药物–疾病"对,在固定时间截点前只用地可获得的信息,输出有前景度 $\hat{y} \in [0,1]$、置信度 $c \in [0,1]$ 与证据支撑的理由;真值取自截点后的临床与监管结局,用五档非均匀 tier 刻度(0.00/0.15/0.45/0.65/1.00)表示。

它是"领域环境带来多大增益"这一核心问题的实验载体(GPT-5.5 +2.52、GPT-5.6-sol +7.60),其打分公式与随机锚归一化也是理解 Table 7 的必备知识。

Chao1 估计量与捕获–再捕获

生态学中估计物种丰富度的经典方法:未见过的物种数量可以从"只出现一次"和"恰好出现两次"的物种频次推断,$\hat{N} = S_{\text{obs}} + f_1^2/(2f_2)$。论文案例研究中用它从内容哈希指纹的跨源重复来估计一个数据源里唯一文档的总数(如 src_04 抽样 450 次见 391 个不同文档,其中 336 个只出现一次、51 个出现两次,估计 $391 + 336^2/(2 \times 51) \approx 1498$)。

Figure 9 案例研究的成败完全系于这个方法:初始轨迹"空口断言"每源约 100 篇导致估计差一个数量级,修复备注驱使其用 Chao1 实测——这是"过程诊断定位到缺失的推理环节"的最佳示例。

研究动机

现有评测范式无法衡量"发现"。静态问答基准(MMLU、GPQA、MATH、FrontierMath、Humanity's Last Exam)只考察"固定提示→正确答案"的映射,没有持久环境、外部动作、演化状态,也没有对中间失败的响应机会;交互式基准(SWE-bench、WebArena、OSWorld、$\tau$-bench)虽把模型放进可执行环境,但任务边界狭窄,且把整个回合压缩成一个最终成功信号,从不评估求解器是否正确分解了问题、是否把论断落在证据上、是否权衡了可行备择、是否在收到验证反馈后修复了方法。与此同时,人类最重要的难题——治愈当前无法治疗的疾病、实现商业可行的聚变能、发现变革性新材料——从不会以"目标、工具、成功标准均已指定"的形式到来。论文以 Apollo 登月作比:登月成功不只因工程师会解难题,而是先把宏图变成包含明确目标、约束、协同子系统、仿真、遥测与反复纠错的工程架构。前沿模型已能在问题被指定后解决高难任务,但最重大的现实挑战很少以可执行、可验证的形式出现,导致模型能力无法转化为对开放式重大问题的实质推进,而且现有评测既测不了这类工作,也提供不了让单次解题积累为真实成就的架构。

本文的目标是本文要为"发现型 AI(discoverative AI)"——指向做出真正发现的 AI——建立评测与构建的基础设施,让系统能得出尚不为人所知的结论,而非复现已有答案,并把开放式抱负变成一串可执行、可验证、可他人检查的调查动作。具体交付三件事:第一,一套系统化的问题侦察流程,把开放式现实问题转化为可解、可验证的任务——10 人 STEM 博士团队历时两个月调研 16 个板块下的 561 个行业,汇集 423 个高价值问题并选出 20 个作为初始发布;第二,通过统一的"环境–任务–episode"抽象把问题形式化为可执行环境,向求解器提供行动所需的数据、工具、约束与反馈,同时记录完整轨迹并对关键中间产物与最终提交做验证,形成 TRACES 现实基准(17 个可执行环境、218 个 episode);第三,提出 HDS6 过程验证框架,从 Tools、Repair、Alternatives、Coherence、Evidence、Scope 六能力独立于最终成败评估调查过程,使得在真值延迟、不完整或不可得时也能进行有意义的评测,并通过修复备注把评测变成"测量–诊断–改进"的闭环。

与已有工作不同的是,独特切入角度在于把评测单元从孤立的答案换成完整的调查回合(episode),并坚持三条现有工作没有同时做到的纪律。其一,评测对象是整个求解器系统(基础模型+脚手架+智能体回路),且所有系统与基线必须经过同一个固定 episode 接口,因此成绩差异可以归因到具体组件——模型、脚手架、回路、工具使用或反馈处理——而不是笼统归为"模型能力不行";同一环境既能固定模型比脚手架,也能固定脚手架比模型。其二,验证即基础设施:隐藏验证器对求解器结构性不可达,配防作弊硬门(污染/泄漏检查直接判负而非扣分)与基于"平凡基线 floor / 已知最优 ceiling"锚点的 0–1 归一化,从制度上封死泄题与投机。其三,首创独立于结果的盲过程验证 HDS6,专门服务于真值需数月数年才能揭晓的高价值问题,并产出结构化修复备注形成跨尝试的修复回路。与 Math-Shepherd、ProcessBench 等短数学链上的过程监督不同,它把过程评测扩展到数百步、工具密集、领域异构的真实调查;与 Coscientist、AI Scientist 等自主科研系统不同,它补的是这些系统都缺的"让发现回路的每一圈都可执行、可验证、可改进"的基础设施。

核心方法

直觉上像 Apollo 把"登月"变成工程架构:Apodex Discovery 把"做出发现"这一开放式抱负拆成四块可建设的地基——问题清单(manifest)、现实环境、验证机制、修复回路——再用重型求解器作为运作单元去执行。技术上,每个问题由清单静态声明:问题与成功判据(不必预知答案,但答案出现时必须能客观识别/验证/证伪)、任务分解(每个子任务各有输入/输出/判据,使承重中间结果在产生处即被检查,如 AAV 衣壳设计分解为活性、趋向性、结构、生成设计四任务)、目标结果与隐藏验证器、数据与工具(且仅限于此,与隐藏真值分开保管)、资源预算。环境是能对求解器动作返回新观测的有状态基底——工具输出、执行错误、检索文档、模拟结果、实验测量、验证反馈——环境不是 prompt,prompt 只给静态上下文,环境在求解器行动时产生新信息。求解器与环境只通过固定 episode 接口相见,接口两侧分别是输入/工具/预算/提交格式与隐藏验证器/硬门/结果指标。评测双通道并行(Figure 3):结果验证对照隐藏真值 $y^\star$ 给提交物打分且结果对求解器永不回流;过程验证(HDS6)盲读轨迹,其结构化诊断以修复备注形式回流,触发修复而不泄露答案。两个通道共同构成 episode 信号,使一个开放式问题成为可运行、可复现、可修复的评测整体。

核心创新有三点,合起来构成与已有工作的本质区别。第一,"现实问题→可执行环境"的工业化流水线:用三个独立维度(技术契合度:推理深度、可形式化、可执行、验证器保真度、验证延迟、数据可得性、最后一公里可部署性;价值:科研里程碑与商业机会取 max 而非平均;商业可达性)把 561 个行业筛到 10 个领域,再以七条硬性要求筛 423 个候选——每条必须有具体目标与输出物、任务分解、可测量量规、至少一个可运行实例、数据/证据/实验反馈来源、从求解动作到可外部验证结果的路径、同时具备影响与买方——最终发布 20 个问题;明确拒绝"专家目测"式的成功判定,这在基准构建方法学上是重投入的自觉。第二,验证的完整制度设计:结果验证细到任务级中间产物(如先验衣壳序列的编码/突变合法性、再验预测适应度),带泄漏/污染硬门(直接判负)与 floor–ceiling 归一化 $S_{\text{norm}} = \frac{S-S_R}{S_O-S_R} \times 100$;过程验证 HDS6 盲评轨迹,25 个子量规按 0/1/2 档打分,评分由"一个模型提案并引用具体步骤、第二个模型必须为不同档位提出最强反驳、第三个仲裁分歧"的智能体流程完成,每条引文都要在轨迹日志中重新落地以防裁判引用不存在的文本,另有完整性门专查幻影工具调用等最严重缺陷(一经发现整条轨迹作废)。第三,修复回路是固定程序而非人工干预:低于 band 3 的轨迹自动生成只含过程诊断、不含结果/真值/分数的修复备注,重跑后重评分量化增益——434 条缺陷轨迹平均 +0.155。

方法步骤详情

第一步,问题侦察(Figure 2):10 名 STEM 博士组成团队,自下而上构建 561 个互斥行业的主分类(并与美国政府 Genesis Mission 的挑战领域清单交叉核对),按三维度独立评估后由人工评审选出横跨 8 个板块、每板块不超过 2 个的 10 个领域(生物信息与基因组医学、科学推理基础模型、科学 HPC 代码生成、医疗 IT 与数字健康、天气驱动商品与能源预测、结构土木工程、AI 辅助芯片设计 EDA、市场数据与金融指数、材料发现、工业自动化);扩展成 423 个候选问题后按七条要求筛选,发布 20 个问题、17 个环境、218 个 episode,覆盖回顾式设定(创建者持有被扣留的已知结果)与前瞻式设定(发现挑战,评估开始时无权威答案,如帕金森病模型中基于全基因组存活筛选的保护/有害基因签名做因果性化合物重定位)。第二步,环境构建:manifest 声明任务、目标结果、隐藏验证器、数据、工具与预算;episode 实例化具体数据/种子/预算并保持隔离——隐藏真值结构性不可达、执行被封闭以防外部检索答案或结果外泄。第三步,验证:结果验证对最终提交 $V^{\text{out}}_{\text{final}}(y, y^\star) \to r_{\text{final}}$ 与各子任务 $V^{\text{out}(i)}(y_i, y_i^\star) \to r_i$ 分别打分,真值不可得时用代理(如 AAV 用高通量筛选测得的包装适应度),每个高风险验证器内置泄漏检查硬门,所有结果在 floor(随机/默认)与 ceiling(oracle/最强已知解)之间线性归一到 0–1;过程验证双路评分——子量规法(六能力 25 子能力、0/1/2 档、三模型对抗仲裁)与承重步骤法(重建轨迹依赖图、从提交反推权重找出承重步、由看不到求解器推理的模型面板独立重解每个承重步、按连续偏差加权聚合)。第四步,修复:把低于顶档子量规的"建议档位跃迁"与出错承重步的定位反馈综合成修复备注(不含结果、真值、分数),插入提示词后在相同条件下重跑并重评分。第五步,归因消融:两层设计——solver-configuration 层固定 episode 接口换脚手架与模型(6 脚手架 × 6 模型),episode-mechanism 层固定系统后开关初始技能引导与提交前验证器引导,量化框架本身与过程引导各自贡献。

技术新颖性

技术新颖性体现在四个层面。其一,评测对象与归因方法:把脚手架视为被测系统的一部分而非固定基础设施,配合统一接口实现组件级归因——同一 claude-opus-4-8 在领域环境 0.741 vs Claude Code 脚手架 0.716、ApodexHarness 在 GPT 与 Opus 两个模型上都领先 OpenHands(0.592 vs 0.560、0.611 vs 0.578),这类"脚手架效应独立于模型存在"的结论在模型与脚手架耦合的现有基准(Claude Code 只配 Claude、Codex 只配 GPT)里根本无法得出。其二,过程验证的系统化:现有过程监督(过程奖励模型、ProcessBench)集中在短数学推理链上的步级标注,HDS6 把过程评测扩展到长程、工具密集、领域异构的真实轨迹,且三重盲评(无结果、无身份、无私有思维链)+ 引文落地 + 对抗仲裁,专门防"为评分而表演";承重步骤法把单一标量诊断升级为"哪一步、错在哪、该怎么改、下一步查什么"的定位,且明确区分于环境设计时锁定的任务分解——承重步由过程验证器从单条轨迹中有机发现。其三,防作弊制度化:交付物常是训练好的模型、策展语料或数据流水线,最便宜的作弊是把隐藏评测数据走私进提交物,因此每个高风险环境内置泄漏检查硬门(如数据采购环境度量隐藏评测文本在提交语料中的复现率、去重环境要求流水线删除评测数据的每个副本),违规直接判负。其四,前瞻式发现挑战:在答案尚不存在时先冻结提交与评分规则、封存对照基准与部分排序,随真实实验(单细胞存活实验)与封存证据揭晓再结算,把"基准"延拓为可随时间结算的科学预言登记处。

Apodex Discovery mission architecture for a heavy-duty solver
Figure 1: Apodex Discovery mission architecture for a heavy-duty solver
Verification channels: outcome verifier and blind process verifier
Figure 3: Verification channels: outcome verifier and blind process verifier
HDS6 on two trajectories for one operator-alignment task
Figure 5: HDS6 on two trajectories for one operator-alignment task
Environment, tasks, and episodes
Figure 6: Environment, tasks, and episodes
The framework across the episode-interface boundary
Figure 7: The framework across the episode-interface boundary

实验结果

核心结果分四块。(1) AAV 衣壳设计全线超越已发表 SOTA(Table 5):apodex-1.1 在活性预测上分布外 AUROC 0.904(超过衣壳语言模型 CAP-PLM 的 0.878),趋向性 0.635(超过 Fit4Function 的 0.622),结构预测三层平均 0.649(超过 AlphaFold 3 加模板对称扩展的 0.605,且目标结构均沉积于 2021 年 9 月 30 日之后、晚于折叠引擎训练截止,排除记忆),生成式设计 0.180(超过专用生成方法 AAVGen 0.109、AAVDiff 0.116、ALICE 0.110),四个任务合计超出任务级已发表 SOTA 约 7%。环境增益同表可读:claude-opus-4-8 在领域环境任务 1–3 均分 0.741,高于用 Claude Code 的 0.716,差距在结构预测最大(0.657 vs 0.595)——恰是最依赖编排折叠引擎与验证中间结果的阶段。过程分与结果分趋势一致:结构任务上 kimi-k3 结果最强(0.679)且过程分最高(3.68),gpt-5.5 结果仅 0.544(低 20%)且因一贯跳过任务要求的自验证步骤、直接交一稿答案,过程分低至 1.38(单亚基环)与 0.94(完整壳)。(2) 药物重定位(Table 7/8):加 DRR 环境使 GPT-5.5 归一化连续分 53.78→56.30(+2.52)、GPT-5.6-sol 54.21→61.81(+7.60),分类准确率分别 +2.67pp(81.00%→83.67%)与 +4.33pp(80.67%→85.00%);连续与分类指标同向,排除归一化伪影。HDS6 显示增益集中在工具使用(+2.64/+2.57)、证据保真(+1.58/+1.68)与长程一致性(+1.13/+1.14),假设管理与范围控制增益较小;程序设计子任务中人群字段 2.89→3.78(+0.89),宏平均 3.72→3.94。(3) LLM 工程环境与消融(Table 10–12):7 个预设诊断环境 × 6 脚手架 × 6 模型中,最强聚合均分仅 0.588(GPT-5.6-sol),头部空间巨大;无单一脚手架普适占优——ApodexHarness 在 Opus 领先(0.611)、A-Evolve 在 GPT 领先(0.648),OpenHands 在 Opus 第二、在 GPT 垫底,存在明显模型–脚手架交互;技能引导在 OpenHands–GPT-5.6-sol 上把 pretrain-data-probe 从 0.534 提到 0.730(+0.196,六个 episode 全成功)、pretrain-data-filter +0.327,但对基线最高的 Claude Code–Opus-4.8 反而 −0.045/−0.044,说明引导不是固定增量;验证器引导亦有 +0.065 到 +0.308 的增益。(4) HDS6 校准与修复闭环(Table 3/13、Figure 8/9):409 条含数值结果的轨迹上过程分与结果分 Spearman $\rho$ 从 +0.24(AAV)到 +0.65(训练与系统),合并 +0.51(Pearson +0.56),单任务清晰时可到 0.8–0.9;434 条缺陷轨迹(HDS6<3)修复重跑平均 +0.155(204 改善/144 持平/86 下降),9/10 环境为正。两个案例把闭环讲透:临床安全表任务同一求解器两版提交数值全对,但初版分母无患者 ID 清单不可复算,被盲评裁判命中 Scope 与 Evidence 两个 band-1,修复后声明人群选择并记录全部 ID,结果分 0.83→0.95(证据子分 0.71→1.00);语料规模估计任务初版断言每源约 100 篇、提交 108(真值 1505,误差 93%),裁判发现其"声称用捕获–再捕获却未用已下载的指纹",修复后用 Chao1 实测各源规模(src_04 得 $\approx$1498)、提交 2471(误差 64%),估计分 0.05→0.30。

Real-world questions available in our initial benchmark
Table 1: Real-world questions available in our initial benchmark
One subrubric, two environments (claim grounding, bands 0/1/2)
Table 2: One subrubric, two environments (claim grounding, bands 0/1/2)
Outcome–HDS6 rank correlation over 409 judged trajectories
Table 3: Outcome–HDS6 rank correlation over 409 judged trajectories
Opportunity matrices: different tasks activate different HDS6 capabilities
Table 4: Opportunity matrices: different tasks activate different HDS6 capabilities
Model comparison across the four AAV tasks
Table 5: Model comparison across the four AAV tasks
Tier-scale values and their support among 10,427 concluded programs
Table 6: Tier-scale values and their support among 10,427 concluded programs
Outcome-prediction performance on the 100-pair public development set
Table 7: Outcome-prediction performance on the 100-pair public development set
HDS6 capability scores on matched drug–disease cases
Table 8: HDS6 capability scores on matched drug–disease cases
Drug repurposing and reformulation procedure-design results
Table 9: Drug repurposing and reformulation procedure-design results
Aggregate system-level performance across harness–model configurations
Table 10: Aggregate system-level performance across harness–model configurations
Harness performance comparison for two representative foundation models
Table 11: Harness performance comparison for two representative foundation models
Episode-mechanism ablations under corresponding run configurations
Table 12: Episode-mechanism ablations under corresponding run configurations
Outcome effect of verification-driven repair on deficient trajectories
Table 13: Outcome effect of verification-driven repair on deficient trajectories
Each point is a judged trajectory with outcome and HDS6 scores
Figure 4: Each point is a judged trajectory with outcome and HDS6 scores
A verification–repair episode on clinical_sap_tlf
Figure 8: A verification–repair episode on clinical_sap_tlf
A verification–repair episode on LLM-pretrain-data-probe
Figure 9: A verification–repair episode on LLM-pretrain-data-probe
查看结构化数据
任务指标本文基线提升
AAV 衣壳活性预测(Task 1) 分布外 AUROC 0.904(apodex-1.1) CAP-PLM 衣壳语言模型 0.878(已发表 SOTA) +0.026
AAV 衣壳趋向性预测(Task 2) 与实测组织富集的相关性 0.635(apodex-1.1) Fit4Function 0.622 +0.013
AAV 衣壳结构预测(Task 3,三层平均) 相对实验参考结构的评分 0.649(apodex-1.1) AlphaFold 3 + 模板对称扩展 0.605 +0.044
AAV 生成式设计(Task 4) 新颖/可制造/命中目标综合分 0.180(apodex-1.1) 最佳专用生成方法 AAVDiff 0.116(AAVGen 0.109、ALICE 0.110) +0.064(约 +55%)
药物重定位·GPT-5.5 归一化连续分(0–100,随机锚定) 56.30(加 Apodex 环境) 53.78(无环境闭卷) +2.52
药物重定位·GPT-5.6-sol 归一化连续分(0–100,随机锚定) 61.81(加 Apodex 环境) 54.21(无环境闭卷) +7.60
验证驱动修复(10 个环境汇总) 缺陷轨迹(HDS6<3)修复前后结果分差 +0.155(434 条,204 改善/86 下降) 修复前的原轨迹 9/10 环境为正,最高 +0.365(solution_verifier)
LLM 工程 7 诊断环境聚合 跨脚手架平均分(0–1) 0.588(GPT-5.6-sol,最佳模型均值;最佳单格 0.950) 其余模型 0.459–0.575;随机锚定 floor=0、已知最优 ceiling=1 最强配置仍未过半,暴露重型任务巨大头部空间

局限与改进

作者承认的局限:TRACES 只实现了 423 问题库中 20 个已选问题的子集(17 个环境、218 个 episode),且仅 2 个环境支持完整验证–修复回路,更多环境在开发中;DRR 结果是公开开发集上 3 次运行的描述性统计,不是测试集定论;修复研究把程序一次性应用于已收集的缺陷轨迹、没有"同一批缺陷轨迹无备注重跑"的匹配对照组,无法完全把 +0.155 与普通重跑波动分开;过程验证与结果分的对齐仍需进一步改进。我观察到的额外局限:(1) AAV 域上 $\rho$ 仅 +0.24,说明盲过程裁判对生物质量的相关性弱,HDS6 在湿实验领域可能被"表面合规"的轨迹说服;(2) Table 10 的脚手架覆盖故意不对称(Claude Code 只配 Opus、Codex 只配 GPT),聚合均值在跨模型比较时有系统偏差,作者只能靠平衡 4×6 子矩阵补救;(3) Opus 系列模型在生成式设计任务上一致触发生物安全拒答、直接缺测(Table 5 中标注 †),暴露安全对齐与重负载生物设计评测之间的摩擦,也使该任务的模型比较不完整;(4) 环境构建成本极高——作者自承"建一个带可信隐藏验证器的忠实环境至少与解题一样难",实际动用了 10 名博士两个月,社区复刻门槛很高;(5) DRR 的 GPT-5.5 增益(+2.52)与运行间标准差(±3.22/±1.56)量级相当,统计显著性存疑,作者也只敢称之为描述性。

独立分析的弱点

弱点一:HDS6 与结果的相关性在生物医学域偏低(AAV 仅 $\rho=+0.24$,而训练系统域 +0.65),且修复增益分布极不均匀——solution_verifier 与 aav_viability 最高(+0.365/+0.360)而 pretrain_data_filter 反而 −0.077(51 条中 20 条下降),说明过程诊断在部分域可能系统性误导修复方向。改进方向:按域校准子量规锚点、引入湿实验模拟器提供中间真值、对修复建议先做离线回测(预测哪些缺陷值得修)再下发。弱点二:修复闭环无对照组,+0.155 的均值可能混入重跑方差,86 条下降的轨迹尤其可疑——是修复建议误导还是正常波动无法区分。改进:同批缺陷轨迹做"无备注重跑"配对实验,报告配对差值的置信区间。弱点三:单任务 episode 太少(SWE-agent 训练 1 个、质量过滤 2 个、临床试验 3 个),且 episode-mechanism 消融每实例只跑一次,论文自己承认小差异不可作因果解释。改进:优先扩充 episode 数量并报告跨实例、跨种子的方差。弱点四:过程验证器本身是 LLM 智能体,存在被"表演给裁判看"的轨迹博弈风险——求解器可以学会写漂亮的证据链与假设管理戏剧而结果仍错,尤其是当 HDS6 被用作训练目标时这种 Goodhart 效应会放大。改进:用已知结果的回顾集做校准曲线、加入对抗性红队轨迹测试裁判稳健性、保持结果验证为最终裁决。弱点五:头部结果依赖闭源前沿模型(GPT-5.5/5.6、claude-opus 等)与未开源的 apodex-1.1,供应商版本漂移会破坏可比性,SOTA 声明无法被独立复核。改进:固定开源参考求解器与版本化模型快照,发布全部 218 episode 的原始轨迹供第三方重评。

未来方向

作者明确提出的方向:(1) 把 423 问题库逐步落地为更多可执行环境,扩展到更多科学、工程、金融、医疗、工业域,未来版本持续发布;(2) 改进过程验证与结果验证的对齐,并在更广应用上证明 HDS6 的有效性;(3) 首个发现挑战(帕金森病功能筛选化合物匹配)的头部候选将推进到单细胞存活实验,待封存对照与真实结局揭晓后按预冻结的评分规则结算,这本身就是一条"基准随科学进展而结算"的新路线。基于成果可自然延伸的方向:(4) 把 HDS6 过程分作为强化学习的过程奖励/监督信号训练发现型智能体——论文只把 HDS6 用于评测与修复引导,而其结构化、可定位、可对抗仲裁的特性天然适合做 reward model;(5) 区间校准型修复——案例研究明确指出剩余误差在校准轴(提交 2471 vs 真值 1505 过冲),下一轮修复应瞄准区间宽度与置信校准;(6) 技能库的自动搜索与匹配——消融显示技能引导效果强依赖求解器配置(对 OpenHands–GPT +0.196/–0.327、对 Claude Code–Opus 反而负增益),可学习"哪种技能配哪种 harness–model 组合";(7) 利用 Table 4 的机会矩阵构造按能力配平的最小评测套餐,使六个 HDS6 能力都能被高效覆盖;(8) 把发现挑战扩展为持续运行的前瞻性预测登记处,与外部实验进展自动联动结算。

复现评估

复现评估:TRACES 基准随论文发布于 discovery.apodex.com——17 个可执行环境、218 个 episode,全部带隐藏验证器,其中 2 个支持完整验证–修复回路;附录 A 给出领域与问题清单、附录 B 给出 AAV 全部任务定义/指标/切分/逐实例结果、附录 C 给出完整 harness×model 结果矩阵(11 环境)、附录 D 给出 DRR 完整任务与推理轨迹及过程评分示例,透明度在同类技术报告中属于高位。但完整复现有三重门槛:其一,头部结果依赖闭源前沿模型(GPT-5.5、GPT-5.6-sol、claude-opus-4-8/5、kimi-k3、glm-5.2、deepseek-v4-pro)与自研 apodex-1.0/1.1(论文未说明开源),超越 SOTA 的 apodex-1.1 数字无法独立复核;其二,HDS6 过程验证是三模型智能体流程(提案/对抗/仲裁、引文落地)加承重步面板重解,单条轨迹的评判算力远超普通基准,大规模重评成本高;其三,生物医学环境需要领域专家与外部数据授权(Bryant/Ogden 深度突变筛选、Fit4Function 筛选、LY6A/LY6C1 结合测量、临床试验数据),基线(CAP-PLM、Fit4Function、AlphaFold 3、AAVGen/AAVDiff/ALICE)各有专门基础设施。对工程师而言,跑 LLM 工程类环境相对可行(OpenHands、DeerFlow、A-Evolve 均开源,验证器如 held-out loss、位精确性套件可按需重算);复刻生物医学环境与整套 HDS6 评判系统则接近重建一个小型研究团队两个月的工作量。综合评级:使用环境中等难度,完整复现框架困难。