← 返回 2026-07-15

LLM准备好做科学发现了吗?面向能力的AI科学家评测基准SDABench Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

Chuhan Shi, Xiaoquan Ren, Sicheng Song, Haobo Li, Rui Sheng, Yushi Sun 📅 2026-07-13 👍 8 2026-07-19 18:30
LLM评测 因果推理 基准测试 科学数据分析 错误归因

提出按六种科研能力组织评测的科学数据分析基准SDABench

前置知识

科学数据分析的六类问题(Leek-Peng框架)

Leek和Peng(2015)将科研数据分析问题归为六类:描述性(总结测量值以刻画现象)、探索性(从数据中发现可检验的模式假设)、推断性(用样本对总体作出带不确定性的统计判断)、预测性(用观测变量估计未知或未来状态)、因果性(估计干预、暴露或扰动对结果的影响)、机制性(用数据和领域理论解释产生观测结果的底层过程)。这六类问题需要不同的假设、证据边界和有效性准则,即使依赖相似的统计流程,它们的难度差异极大。

SDABench的全部评测体系都建立在这套分类之上,理解它才能明白为什么用聚合准确率衡量LLM科研能力是有缺陷的。

语义图与结构因果模型(SCM)

本文构造SDA-Synth时为每个科学场景构建语义有向无环图(DAG)$G=(V,E)$,节点是源变量、中间变量和目标变量,每个节点带类型、单位、范围等元数据;每个非源变量的生成机制由构造LLM提出,表现为显式代数方程或数值求解器(如ODE)。具有因果语义的变量在子图$G'\subseteq G$上用内部标准化的结构因果模型(iSCM)建模,刻画干预如何经由中间变量传播到目标变量。生成数据时按拓扑序执行:源变量采样,中间/目标变量在固定参数下运行机制并叠加测量噪声与干扰列。

这套合成数据机制保证了精确的ground-truth可程序化推导,是SDA-Synth能产出6000条可验证实例的技术基石。

MCQ与OEQ两种评测格式

MCQ(多选题)为每道题提供候选选项,可通过选项匹配自动打分,但四选项有25%的随机基线;OEQ(开放题)要求模型直接产出答案,更适合开放式推理与分析执行。本文对OEQ采用数值评估器(相对误差容忍度)、文本评估器(精确与结构化字段匹配),并用LLM评估器(GPT-4o)作为确定性匹配失败时的兜底。两种格式的准确率不可直接比较,OEQ作为主指标、MCQ作为补充信号。

本文一个核心反直觉发现是MCQ候选选项有时反而拉低性能,理解这两种格式的差异是读懂Findings的前提。

五阶段错误分析框架

作者自下而上检视错误响应,识别出沿科研分析执行流程排列的五类失败模式:Scope Error(误判分析目标或任务范围)、Variable Error(选错分析变量)、Function Error(选错或误用分析方法)、Relationship Error(误判变量交互的存在/方向/强度/结构)、Conclusion Error(得出不被前述分析支持的最终推断)。对每个错误样本只标注其在执行链上首次出现的那类错误。为跨任务/域/模型比较,采用归一化错误率 $\mathrm{NER}_E(S)=n_E(S)/o_E(S)$,其中分子是该错误类型的出现次数,分母是该错误类型可能出现的样本数。

这是本文区别于其他基准的最关键贡献——把聚合准确率拆解成可定位的失败阶段,理解它才能看懂为何更强模型瓶颈会转移到后段错误。

基于扰动的干扰项生成(Distractor Generation)

MCQ的正确选项由推导程序$f_\tau$算出,错误选项则通过对变量或中间计算步骤做扰动产生,共四种策略:Diffusion(在变量间交换或重排取值与角色)、Confusion(改动单个局部元素如参数或算符)、Randomization(采样一个新的、任务合法但答案不同的指派)、Default(回退到简单数值变换)。设计目的是检验模型是否真的按预定分析路径推理,而非依赖排除法等浅层线索,并随机化选项顺序以削弱位置偏置。

理解干扰项如何构造,才能解释Kimi K2.5这类模型为何在MCQ上近乎随机——即候选选项诱发了局部模式匹配。

研究动机

现有评测科研数据分析能力的基准(如DataSciBench、KramaBench、ScienceAgentBench、DSBench、DA-Code等)主要从计算视角评估,即考查系统能否生成并执行分析代码或流水线(如选特征、建模型),再对结果与ground-truth或任务成功准则打分。这种范式有两个根本缺陷:第一,它把'成功执行'误当成'科学有效'——算出请求的结果并不代表该结果真的支撑了预期的科学论断;第二,聚合的工作流得分把具体的推理失败掩盖在一个数字背后,无法揭示模型究竟是在基础描述上失败,还是在复杂因果推断上失败。例如一个流水线分数无法区分模型是死在变量选择、方法套用,还是结论推断。这导致难以诊断模型真正缺少哪一类分析能力。

本文的目标是本文要构建一个按能力(capability)而非按操作(operation)组织评测的基准SDABench。具体目标包括:采用Leek-Peng六问题框架把数据科学问题重述为六种科研发现能力(descriptive、exploratory、inferential、predictive、causal、mechanistic);覆盖五个核心科学领域(Biology、Chemistry、Environment、Geography、Physics);同时提供真实数据集SDA-Real(527实例)和合成数据集SDA-Synth(6000实例),每种实例都给出MCQ与OEQ两种格式;并设计一套自动化构建流水线,把科研资源转化为可验证的分析实例,使答案可程序化推导、可大规模自动评测。

与已有工作不同的是,本文的独特切入角度是把评测的'单位'从'能完成什么工作流'改成'能推理哪类科学问题'。与已有基准组织在执行成功、流水线完成或领域任务上不同,SDABench按科学论断类型(描述、探索、推断、预测、因果、机制)切分,因为不同论断即便用相似分析程序,所需假设、证据边界与有效性准则都不同。此外本文还提出了与基准配套的五阶段错误分析框架(Scope/Variable/Function/Relationship/Conclusion),把聚合分数拆成沿执行流程可定位的失败阶段,这是其他基准几乎缺失的诊断维度——表1显示只有QRData具备部分错误分类能力,其他多数用'–'表示不满足。

核心方法

SDABench的设计思路可以分两层直觉。直觉层:科研分析最终是为了从数据中支撑科学论断,而论断类型决定了所需的假设与有效性标准,所以评测应围绕论断类型而非操作来组织。技术层:把每个实例形式化为 $z=(d, t, D, Q, g)$,其中 $d$ 是领域、$t$ 是任务类型、$D$ 是参考数据集及其元数据、$Q$ 是问题、$g$ 是ground-truth。基于此SDABench同时发布MCQ版本 $Q_{MCQ}(z)$(用合理干扰项支撑可扩展自动评测)与OEQ版本 $Q_{OEQ}(z)$(让模型直接作答,更适合开放式推理)。数据来自两部分:SDA-Real从KramaBench、BLADE、LLM-SRBench、QRData、DiscoveryBench、SciTS、ScienceAgentBench这7个种子资源中筛出的真实科学数据集;SDA-Synth用语义图自动生成的合成数据集(每个域10个、共50个验证数据集,每个数据集支持全部6种任务类型)。最终经分层采样得到6000条SDA-Synth实例(按5域×6任务各200条)和527条SDA-Real实例。

核心创新点是用任务类型(capability)作为评测的组织轴,并配套可程序化推导ground-truth的构建流水线与五阶段错误分析。与已有方法的本质区别有三:第一,把基准的'题目单位'从'能跑通什么流水线'升级为'能推理哪类科学论断',从而把'执行成功'和'科学有效'区分开;第二,ground-truth不靠人工标注或LLM自由生成,而是为每个模板$\tau$实现确定性推导过程 $g=f_\tau(D,p)$,其中 $p$ 是绑定到模板的具体参数,保证答案可被程序化地、确定性地算出,即使需要多步推理也能自动得到正确答案;第三,提供五阶段错误归因,使评测不只给出分数,还能定位失败发生在执行流程的哪一段,揭示聚合分数看不见的诊断信号。

方法步骤详情

构建流水线分三大阶段。阶段一数据策划:SDA-Real按'定量科学分析、结构化数据带清晰元数据、答案可程序化推导'三准则筛真实数据集;SDA-Synth先生成科学场景(指定可测变量、单位、范围),再构建语义DAG $G=(V,E)$,每个非源变量由构造LLM在父节点条件下提出机制(代数方程或ODE求解器),因果语义变量用iSCM在子图$G'\subseteq G$上建模,最后按拓扑序生成数据:源变量按元数据采样、中间/目标变量在固定参数下执行机制并叠加测量噪声与干扰列。阶段二问题构建用四智能体流水线:Taxonomist分配域与任务类型并标出所需列,Extractor把实体抽象成带占位符和约束的模板 $\tau$,Generator把占位符绑定到合法列/值/实体得候选问题 $Q$,Verifier剔除逻辑不一致、schema不匹配、答案泄漏或近重复的问题。阶段三ground-truth与选项生成:为每个模板实现确定性推导 $g=f_\tau(D,p)$,采样合法 $p$ 后运行得正确答案;MCQ选项用Diffusion/Confusion/Randomization/Default四种扰动策略生成干扰项并随机化顺序。最后经一致性检查、人工审计307个模板、去重,SDA-Synth按6:4分训练/测试集并保持格式配对防泄漏。

技术新颖性

技术新颖性体现在四点。其一,能力导向的评测框架——把六类科研论断类型作为评测轴,是首个同时覆盖描述/探索/推断/预测/因果/机制全部六类能力的基准(表1显示其他基准如QRData缺探索、LLM-SR仅描述与机制、DSBench仅描述与预测)。其二,程序化ground-truth推导——不依赖人工标注或LLM自由生成,而用确定性过程 $f_\tau$ 把参数$p$与数据$D$映射到正确答案$g$,既保证可大规模自动评测,又避免Zhuang等(2023)指出的弱数据锚定和不可验证答案问题。其三,合成数据用语义图+iSCM生成,每个数据集同时支持6种任务类型,解决了真实数据集难以在同一数据上评测全部能力、否则会混淆任务难度与数据集artifact的问题。其四,五阶段错误分析框架沿执行流程排序,能揭示'更强模型早段接地错误减少但后段错误持续'这一诊断信号——这是聚合准确率分数无法暴露的。

The SDA-Synth construction pipeline.
Figure 1: The SDA-Synth construction pipeline.
The Question construction pipeline.
Figure 2: The Question construction pipeline.

实验结果

在SDA-Synth测试集上评测15个LLM(表2),最强是闭源GPT-5.4达58.33% OEQ,Gemini 3.1 Pro 56.88%,Claude Sonnet 4.6 55.79%;微调Llama-3.1-8B(带error-type目标)也达55.33%,说明任务对齐监督能让8B小模型逼近前沿闭源。任务层级清晰:描述任务最强(GPT-5.4 OEQ 94.75%),推断与因果因需选假设、对潜结构推理而下降,机制任务在两格式间差距最大。一个反直觉发现是候选选项有时反而拉低性能:Kimi K2.5在预测任务上MCQ仅25.75%近乎随机,却在匹配OEQ实例上能解出,说明显式选项诱发局部模式匹配。错误分析(图4)揭示瓶颈随能力后移:Function Error在预测峰值37.7%,Relationship Error主导机制(32.1%)与探索(29.9%)任务,Conclusion Error在推断最突出(10.2%)。跨模型看,小模型Variable Error常超30%(失败在选变量),而GPT-5.4、DeepSeek V3.2等被Function Error主导,Kimi K2.5、Claude 4.6、Gemini 3.1 Pro的Relationship Error更高——更强模型把瓶颈从前段接地错误转移到后段方法执行与关系推理,这正是聚合准确率看不见的诊断信号。

Comparison with representative data analysis benchmarks.
Table 1: Comparison with representative data analysis benchmarks.
Accuracy (%) of LLMs on SDA-Synth under OEQ and MCQ.
Table 2: Accuracy (%) of LLMs on SDA-Synth under OEQ and MCQ.
Average OEQ accuracy (%) of LLMs on SDA-Synth across scientific data analysis tasks and scientific domains.
Table 3: Average OEQ accuracy (%) of LLMs on SDA-Synth across scientific data analysis tasks and scientific domains.
Accuracy (%) of LLMs on SDA-Real across scientific data analysis tasks.
Figure 3: Accuracy (%) of LLMs on SDA-Real across scientific data analysis tasks.
Normalized error rates across tasks, domains, and models on SDA-Synth.
Figure 4: Normalized error rates across tasks, domains, and models on SDA-Synth.
查看结构化数据
任务指标本文基线提升
SDA-Synth OEQ总体准确率 OEQ accuracy (%) GPT-5.4 58.33%(最强),微调Llama-3.1-8B(error-type) 55.33% 开源模型平均37.41%,闭源平均49.77%;Llama 3.3-70B仅6.96% 闭源前沿模型相比开源平均高约12个百分点;任务对齐微调让8B小模型逼近GPT-5.4水平
SDA-Synth MCQ总体准确率 MCQ accuracy (%)(25%随机基线) Gemini 3.1 Pro 69.46%、GPT-5.4 66.58%、Claude 4.6 66.38% 开源平均50.84%,Llama 3.3-70B 30.46% MCQ普遍高于OEQ但不可直接比较,部分模型(Kimi K2.5预测)MCQ反低于OEQ
六类任务的OEQ难度层级 闭源模型各任务平均OEQ (%) 描述91.05 > 推断55.50 > 预测32.95(待核实) ... 机制34.00 开源:描述66.78 > 推断40.16 > 因果32.72 > 机制29.72 能力类型间差距巨大(描述vs机制差约57个百分点),证明按能力切分评测的必要性
跨域OEQ准确率(表3) 平均OEQ accuracy (%) Environment 46.9最高,Biology 39.2最低 Geography 39.9、Physics 41.4、Chemistry 41.9 域间差异反映底层数据结构的推理负担而非术语:Environment受益于平滑连续变量,Biology受高维非线性交互拖累

局限与改进

作者明确承认三方面局限。第一,SDA-Synth依赖合成语义图,其机制虽经领域专家验证,但可能无法完全捕捉真实实验的混杂因素和测量伪影。第二,MCQ格式即便用了基于扰动的干扰项,仍可能在某些模型上诱发浅层模式匹配。第三,错误分类只标注执行链上首个错误,可能低估级联失败——即一个Variable Error可能引发后续Function/Relationship/Conclusion连锁错误,但只记一次。我自己还观察到两点:一是评测只对最终answer字段打分、reasoning字段仅用于错误标注,这意味着即使推理链错误但碰巧猜对答案也会被判正确,可能高估能力;二是只评了zero-shot base model,缺乏in-context/agent化(带工具调用、多轮迭代验证)条件下的能力刻画,而真实科研往往需要工具增强;三是6000条SDA-Synth实例按域×任务各200条分层,对某些任务(如机制)可能样本量不足以稳定刻画长尾失败模式。

独立分析的弱点

第一个弱点是ground-truth依赖构造流水线,其质量受种子问题和构造LLM(GPT-4o)限制,可能引入构造偏差——可改进方向是引入更多样化的种子资源和多构造LLM交叉验证。第二个弱点是错误标注只取首个错误,掩盖了级联效应——可改进方向是让标注支持多标签或因果链式错误归因,并量化每个错误对最终结果的贡献。第三个弱点是评测只对answer字段打分、忽略reasoning正确性,存在'猜对但推错'的噪声——可改进方向是同时评估中间步骤或用过程奖励模型打分。第四个弱点是只测zero-shot base model,未刻画带工具调用、代码执行、多轮验证的agent化科研能力,而这恰是真实科研的主流形态——可扩展为agentic评测轨道,允许模型执行代码并迭代验证。第五个弱点是五个域的覆盖仍偏自然科学,缺少社科、医学、工程等需要不同推理结构的领域——可扩充领域以增强泛化性。

未来方向

作者在讨论中明确指出未来三个方向:假设选择下的不确定性处理、变量交互的关系推理、以及针对任务约束的中间结果迭代验证——这些正好对应后段错误(Function/Relationship/Conclusion)持续存在的瓶颈。作者还建议把流水线式错误分类用于自适应训练课程,逐步针对每个分析阶段定位的能力缺口做监督。基于成果可延伸的方向还包括:把基准扩展为agentic评测轨道(允许工具调用与多轮代码执行);引入多标签或因果链式错误归因以捕捉级联失败;与过程奖励模型结合同时评估推理链正确性而非仅最终答案;扩充到社会科学、医学、工程等域;把SDA-Synth的语义图机制反向用于生成可控的训练课程数据,专门强化模型在弱项能力(机制/关系推理)上的表现。

复现评估

复现评估总体较好但有门槛。有利因素:作者发布了完整的基准实例(6,527条:6,000 SDA-Synth + 527 SDA-Real),每种都提供MCQ与OEQ两种格式,并按6:4划分训练/测试集且保持格式配对以防泄漏;构建流水线(语义图生成、四智能体模板构建、程序化推导 $f_\tau$、扰动式干扰项)描述详细,307个模板和推导过程均经人工审计。evaluator体系(数值/文本/LLM兜底)明确,便于重跑评测。不利因素:合成数据生成依赖GPT-4o等闭源构造LLM,其行为可能随版本变化而不可完全复现;评测15个LLM中多数为闭源模型(GPT-5.4、Claude 4.6、Gemini 3.1等),复现其分数需要付费API且成本可观;错误标注涉及人工+LLM标注,归一化错误率NER的计算依赖 $o_E(S)$(错误类型可能出现次数),这部分标注协议的细节若不完全开源会影响NER可比性。整体算力门槛中等:评测主要是API调用而非大规模训练,但要在自家复现全部15模型×6任务×5域×两格式×数千实例的推理,仍需相当的API预算。