← 返回 2026-08-14

OmniScientist:全模态全学科的 AI 科学家 OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu 📅 2026-08-13 👍 91 2026-08-25 18:30
AI Scientist LLM Agent 多智能体系统 多模态智能体 科学发现 自主科研

直接感知原始多模态证据,端到端自动完成从数据到可验证论文的科研闭环

前置知识

ReAct 循环

ReAct(Reasoning + Acting)是 LLM 智能体的基础范式:模型在循环中交替产出「思考—行动—观察」,先推理下一步该做什么,再调用工具(执行代码、检索文献、查看图像),把工具返回结果作为新观察继续推理,直到完成任务。它让智能体行为由环境反馈动态驱动,而非一次性输出完整计划。

OmniScientist 的选题、实验、写作三个阶段内部都是 ReAct 循环,论文反复强调「观察如何塑造研究问题」,只有理解 ReAct 才能明白原始观察是在循环的哪一步注入并影响后续决策的。

HARKing 与多重比较问题

HARKing(Hypothesizing After Results are Known)指先看到结果再回头编造假设,把探索性发现包装成验证性结论。配套的多重比较问题指:检验跑得越多越容易碰出「显著」,需 Bonferroni/FDR 校正,且校正分母必须计入所有尝试过的检验,否则可人为制造显著性。

本文的核心卖点之一是用代码强制执行反 HARKing 与严格的多重比较校正(Algorithm 1 第 7–10 行),理解这两个统计概念才能看懂系统「严谨性检查」到底在防范什么、为什么校正分母要计入被降级的检验。

数据泄漏与有效样本量

数据泄漏指模型评估用到了不该见到的信息(测试集标签、未来信息、与标签相关的元数据等),导致指标虚高、结论不可泛化;有效样本量则考虑样本间的相关性——同一台站、同一受试者的记录并非独立,真实独立样本数远少于表面样本数。两者都会让看似漂亮的统计结论失效。

系统在选题检查和实验退出检查中都内置泄漏检查与有效样本量估计;论文中心音案例(仅凭录音协议元数据预测异常 AUC 0.60、跨数据源塌缩到 0.35)正是典型泄漏混杂,是理解系统严谨性机制的基础。

视觉-语言模型(VLM)感知

视觉-语言模型通过对比预训练(如 CLIP)和指令微调,把图像等原始信号与文本对齐到同一表示空间,从而能用自然语言回答关于视觉内容的问题。本文的感知层用固定的 VLM(Sonnet 5)直接检视波形、显微图像、点云等原始证据,提取空间、时间、跨通道结构,而不依赖人工预提取的特征。

论文的盲消融正是「VLM 直接看原始数据」对「只给预计算标量特征」的配对比较,理解 VLM 的能力与局限才能正确解读 85% 胜率和 +2.8 接地增益这些结论的含义与边界。

AI Scientist(自动化科学发现系统)

指能自动完成假设生成、实验执行、论文撰写全流程的 LLM 智能体系统,代表工作包括 AI Scientist、Agent Laboratory、InternAgent、协作科研生态等。它们通常从人类给定的研究方向或代码库出发,以「指标提升+生成论文」为产出,输入接口几乎都是文本、代码或预计算摘要。

本文的动机与差异化全部建立在对这类系统「工作流完备但证据不完备」的批评之上,了解它们的能力边界才能准确理解论文所指出的 gap 与贡献定位。

研究动机

现有端到端 AI 科学家系统(AI Scientist、Agent Laboratory、InternAgent 等)虽已能自动完成从想法生成、代码执行到论文撰写与自审的完整工作流,但其数据接口几乎都是人类预先准备好的文本、代码、标签或预计算标量摘要。问题在于科学证据的内部结构差异巨大——三分量地震图的跨通道极化、病理切片的局部纹理异质性、迁移轨迹的时间顺序、CAD 点云的主轴几何——这些空间、时间、跨通道与程序性关系一旦被序列化为文字说明或特征向量就会永久丢失。论文给出的具体例子很生动:STEAD 地震基准中 750 条被标记为「噪声」的记录里实际有 163 条(21.7%)携带真实震动;心音数据集仅凭录音协议这类元数据就能以 AUC 0.60 预测异常、跨数据源时塌缩到 0.35,暴露标签混杂——这些在预计算接口下根本不可见。因此现有系统「工作流完备但证据不完备」:智能体在研究开始前就被继承了一个人为选定的表征,它能注意到的异常、能提出的假设、能支撑的结论都被这个接口预先框死。

本文的目标是本文的目标是构建一个端到端、全模态、学科无关的 AI 科学家 OmniScientist:任务输入只需一个规范文件(数据集+科学主题+目标属性+对应的原始数据),系统直接从异构原始证据出发,完成从观察、问题形成、实验设计执行、结果检验到编译出一篇可复现论文的完整科研闭环,具体方法完全由智能体自主决定。同时,作者要求每个环节都有硬性保证而非仅靠提示词约束:新颖性筛查与可证伪性由选题检查强制、统计有效性与执行溯源由退出检查强制、每个报告数字与论文主张都必须能追溯到真实程序输出。评估层面,作者要系统回答一个此前未被量化的问题:在跨 5 个学科族、4 个证据族、36 个真实数据集的案例上,「全生命周期直接感知」究竟给科研产出带来多大、体现在哪些维度上的增益——为此设计了与盲变体的配对消融实验。

与已有工作不同的是,本文的独特切入点有三层。第一,它提出按「解释证据所需的主要推理类型」而非数据表征形式,把科学证据划分为 4 个学科无关的证据族:感知、符号、定量-统计、程序性,使同一个引擎无需任何领域专用代码即可处理地震图、CAD 网格或 500 万边的知识图谱——扩展新学科只需新增一个规范文件。第二,与已有工作把多模态感知局限在孤立环节(检查自己生成的图、给图表打分、读软件界面、监控仪器)不同,本文让原始观察在选题、实验设计、结果检查和论文主张形成的每个阶段都主动发挥作用,观察可以直接改变研究问题本身。第三,控制结构上的创新:用一条「薄的确定性流水线」包裹开放式智能体,阶段间转换、失败回退(实验塌缩或零结果时回到选题,最多 2 次)与产出验证全部由代码控制而非依赖模型生成的消息,在保持阶段内推理开放性的同时让过程可预测、可审计。配对盲消融的设计也让「感知的贡献」第一次被干净地量化分离。

核心方法

直觉上,这篇论文的立场是:科学判断应当来自对原始证据的直接观察,而不是别人消化过的摘要;但完全开放的 LLM 智能体又会伪造数据、反复跑检验挑显著结果,所以必须用确定性的代码检查把每个阶段的产出关进笼子。技术路线上,系统由一条确定性流水线串联 3 个自主智能体——选题、实验、写作——每个阶段内部运行 ReAct 循环(观察-推理-行动交替),并共享一个感知层:工件先按证据族分类,再按具体模态用注册工具检视,覆盖 16 个学科案例、11 种模态。感知策略讲究成本收益:优先做原生数值分析(如直接从原始波形提取 FFT 峰与趋势点),只有当空间或结构模式对结论必要时才渲染图像,且视觉检查有预算上限(选题阶段为 $\min(24, \max(8, 2g))$ 次、$g$ 为标签组数,实验阶段 8 次)。每个阶段的产出必须通过代码强制的检查:选题检查(完整性、新颖性、可执行性、泄漏检查)、实验退出检查(Algorithm 1:溯源+多重比较校正+反 HARKing)、主张检查(数字与主张逐项对齐执行记录);实验失败或零结果则回退选题(最多 2 次),形成「实验塌缩→重新选题」的闭环。

核心创新是「全生命周期感知 + 代码强制验证」的组合,与已有系统的本质区别体现在两个层面。其一是感知的角色:现有 AI Scientist 系统把感知排除在研究循环之外,科学多模态 benchmark 又把感知当成固定的问答任务,而 OmniScientist 让原始观察直接决定问什么问题、如何设计实验、执行后检查什么、论文里能主张什么——机制分析(表 7)显示感知版与盲版形成完全不同的研究轨迹,例如地震学案例中盲版只能基于文本特征名设计出需要实际不存在字段的实验而被迫大范围重新规划,感知版则从一开始就提出立即可执行的假设。其二是验证方式的本质差异:Prompt 约束只是「建议」,不同强度的模型遵守程度不一;代码检查则是数学保证——Algorithm 1 要求每个报告数字逐字出现在真实 stdout 中、数据集必须真实从磁盘加载、报告多个 p 值时校正分母必须计入所有尝试过的检验(包括后来不被支持的)、头条结论必须来自被支持的初级分析,否则整份产出被拒绝。这解释了为什么换用更弱的开源骨干时,事实准确性维度依然最稳定。

方法步骤详情

输入是单一规范文件(数据集+主题+目标属性+原始数据),输出是编译好的 PDF 论文加结构化 JSON 记录与可重放执行轨迹。阶段一「选题」:智能体清点材料并决定是否检视原始观察,经 OpenAlex 检索文献,生成至少 5 个候选想法、择优定稿;产出须通过选题检查:结构完整、≥5 个自筛候选、≥3 次聚焦检索、可代码执行、泄漏检查与有效样本量估计,并自动把「首次」降级为「探索不足」。阶段二「实验」:在受控 run_python 环境(150 秒超时)中迭代写码调试,至少含 4 项分析(主假设检验+基线/消融/机制探针/敏感性扫描);退出检查(Algorithm 1)验证真实执行、数字溯源、对全部尝试过的检验做多重比较校正、独立性与反 HARKing;零结果回退重选题(最多 2 次)。阶段三「写作」:按 5 种 venue 风格解析文体,每节只从执行记录对应切片展开、无法引入未给过的细节,摘要最后写以对齐数字;规划器选出头条主张,元审计后编译 PDF。预算:选题 ≤24 步、实验 ≤50 步,单次运行 $0.03–$4.34。

技术新颖性

技术新颖性可从四个角度看。第一,证据族分类学(感知/符号/定量-统计/程序性)按推理类型而非表征形式组织,这是让「一个引擎跨学科」成立的关键抽象,也解释了 36 个案例为何能用零领域代码覆盖从拉曼光谱到知识图谱。第二,防伪造的工程化细节在同类系统中罕见:对调试循环中所有尝试过的检验计数(含被降级者),堵住了「缩小校正分母人为制造显著性」的漏洞;数字必须逐字存在于真实 stdout 的溯源规则,使任何报告的指标在原则上都可重放验证。第三,写作阶段的节级切片机制从结构上抑制幻觉——每一节只能展开它被分配到的记录切片,不可能引入从未产生过的细节,摘要最后写作保证正文与摘要数字一致。第四,评估方法论:把感知模型固定为同一模型(Sonnet 5)而只更换推理骨干,使跨骨干分数差异可归因于推理本身;配对盲消融(同一任务、同一骨干、仅移除感知)把感知贡献从模型能力中分离出来。当然,这些检查本质仍是启发式(字符串匹配、结构性检查),并非语义级验证,这是其新颖性主张之外的边界。

Overview of the OmniScientist framework.
Figure 1: Overview of the OmniScientist framework.
Architecture of the OmniScientist framework.
Figure 3: Architecture of the OmniScientist framework.
Raw observations and derived discoveries processed by the perception layer across 16 cases, 11 modalities, and all 4 evidence families.
Figure 4: Raw observations and derived discoveries processed by the perception layer across 16 cases, 11 modalities, and all 4 evidence families.
Two-stage verification pipeline for experimental results and manuscript claims.
Figure 5: Two-stage verification pipeline for experimental results and manuscript claims.

实验结果

36 案例均完成从原始数据到编译论文,Sonnet 5 骨干 7 维评审均值 6.3/10,最强替代骨干 GLM-5.2(6.5)同区间,弱开源模型落后(Qwen3.5-9B 4.0)且完成率仅 18/32;跨学科鲁棒性上,按学科/模态分组的中位复合分稳定在 6.1–7.1;事实准确性在各骨干均居首(Sonnet 5 达 7.7),与篇幅无关(ρ=0.16);盲消融(5 对)中感知版 7 维全胜、赢 85% 判断,最大增益为接地 +2.8、意义 +1.8,事实准确性因共享溯源检查持平;组件消融中,去文献检索使新颖性 6.9→5.7,去新颖性检查降约 1 分;骨干缩放上,准确性/稳健性在最强最弱模型差 2.9 分,多模态接地仅差 1.2 分;STEAD 审计发现 750 条噪声标记中 163 条(21.7%,CI [18.8, 24.9])携带相干跨通道瞬态,去符合项后塌缩至 2.0%,跨零模型与 417 台站 bootstrap 稳定于 19–25%;儿科胸片中 patchiness 效应量 d=1.25,AUC 0.851 对原始像素 0.634,全过 Bonferroni 校正。

The demonstration suite: 5 categories, 36 cases, one real downloadable dataset each, with the sample count N per dataset.
Table 1: The demonstration suite: 5 categories, 36 cases, one real downloadable dataset each, with the sample count N per dataset.
The 4 families of scientific evidence OmniScientist is designed to perceive.
Table 2: The 4 families of scientific evidence OmniScientist is designed to perceive.
Detailed review scores across reasoning backbones.
Table 3: Detailed review scores across reasoning backbones.
Backbone generality across the 36-case suite.
Table 4: Backbone generality across the 36-case suite.
Backbone quality aggregated by evidence modality and discipline family.
Table 5: Backbone quality aggregated by evidence modality and discipline family.
Review rubric performance across the complete evaluation suite using the Sonnet 5 backbone.
Table 6: Review rubric performance across the complete evaluation suite using the Sonnet 5 backbone.
Comparison of feature utilization between the two systems.
Table 7: Comparison of feature utilization between the two systems.
Overview of 13 end-to-end runs, grouped by evidence modality and spanning all 4 families.
Table 8: Overview of 13 end-to-end runs, grouped by evidence modality and spanning all 4 families.
Numbers the system produced for the STEAD noise audit.
Table 9: Numbers the system produced for the STEAD noise audit.
Numbers the system produced for the paediatric chest radiograph study.
Table 10: Numbers the system produced for the paediatric chest radiograph study.
Per-case review profiles across the seven review dimensions (two-judge panel, 0–10).
Figure 6: Per-case review profiles across the seven review dimensions (two-judge panel, 0–10).
Dimension-wise perception gain.
Figure 7: Dimension-wise perception gain.
Breakdown of head-to-head judgments.
Figure 8: Breakdown of head-to-head judgments.
Component ablation on the seismology case.
Figure 9: Component ablation on the seismology case.
Review dimension scores across different backbone strengths.
Figure 10: Review dimension scores across different backbone strengths.
The seismic audit at a glance.
Figure 11: The seismic audit at a glance.
Visualization and evaluation of sliding-window local-entropy features.
Figure 12: Visualization and evaluation of sliding-window local-entropy features.
查看结构化数据
任务指标本文基线提升
36 案例端到端论文生成(7 维评审复合分,0–10) Overall 均分 6.3(Sonnet 5,36/36 案例全部完成) GPT-5.6: 5.6(9/10 完成);Qwen3.5-9B: 4.0(18/32);Gemma-4-26B: 4.2(25/34) 最强开源模型落后约 2 分且完成率仅 56–75%;最强闭源替代(GLM-5.2 6.5)基本持平
配对盲消融(5 案例,仅预计算标量特征 vs 全感知) 成对评审胜率 感知版赢得 85% 成对判断,7 个维度全部占优 同骨干同任务的盲变体(无法访问原始观测) 多模态接地 +2.8、科学意义 +1.8;排除平局后各维度赢面 70–87%
STEAD 地震基准审计(噪声标签质量核查,n=750 噪声标记) 噪声标记中携带真实事件的比例 21.7%(163/750),95% CI [18.8, 24.9]% 仅幅度检测基线 2.0%;去掉跨通道符合项的消融 2.0% 约 10 倍,且在 3 种零模型/4 种窗宽/417 台站 bootstrap 下稳定于 19–25%
儿科胸片肺炎判别(held-out 测试集) AUC 0.851(平均熵 + patchiness);patchiness 单独 0.847 原始像素基线 0.634;仅平均熵 0.840 较原始像素 +0.217;效应量 Cohen's d=1.25 且全过 Bonferroni 校正
超导材料外推误差评估(UCI 超导数据集,n=21,263) leave-one-family-out 与随机 k-fold 的 RMSE 之比 发现留一化学族外推的 RMSE 比随机 k-fold 高 3.1–7.0 倍 随机 k-fold 交叉验证(常见默认评估协议) 暴露随机划分系统性低估外推误差的评估陷阱
符号回归指数估计方差(Feynman 数据集 8 条单项式定律) 方差-采样范围对数斜率(Cramér–Rao 预测 −1) 实测斜率 −1.002,$R^2=0.998$,8/8 条定律全部吻合 理论 Cramér–Rao 下界形式 $\mathrm{Var}(\hat{a})=\sigma^2/(N\mathrm{Var}\log x)$ 预测斜率 −1 跨所有采样范围与噪声水平与理论精确一致,验证了理论感知能力

局限与改进

作者承认的局限:36 案例是作者挑选的「演示套件」而非标准化基准;盲消融仅 5 对案例,85% 胜率样本量小;评审完全依赖两个 LLM(deepseek-v4-flash 与 gemini-2.5-flash-lite),无人类专家;部分骨干只评估了子集(GPT-5.6 仅 10 案例、Kimi 9 案例),跨骨干比较公平性受限;失败运行被排除在均分外,可能存在幸存者偏差。我的补充观察:其一,「发现」的科学新颖性无法由 LLM 评审保证——21.7% 噪声标签这类结论对地震学界可能并不新鲜(STEAD 的噪声标注本就可能含弱事件),系统没有与领域文献系统性比对确认新颖性;其二,溯源检查是字符串级匹配(数字逐字出现在 stdout),可被「照抄输出」规避,也不验证推理的语义正确性;其三,预算限制(实验 ≤50 步、单次 150 秒超时)排除了需长时间训练或大规模仿真的学科;其四,每案例只跑一次、未报告运行方差;其五,感知固定为 Sonnet 5,感知与骨干的交互未探索;其六,程序性证据族只以轨迹/仿真出现,未触及真实湿实验闭环。

独立分析的弱点

独立分析的弱点及改进方向:(1) 评审方法学单薄——结论全建立在 LLM 评审上,评审模型与被测系统同生态、可能共享偏好。改进:子样本招募领域专家盲评并报告人机一致性,或引入第三方代码重执行作为硬性可复现性指标。(2) 单次运行无方差——智能体轨迹方差大,6.3 的均值缺乏误差条。改进:每案例跑 k 次报告均值±标准差。(3) 盲消融样本过少——5 对案例支撑「感知是决定性的」过于单薄。改进:为全部感知族案例预计算标量特征做配对比较,并区分「发现差异」与「写作风格差异」。(4) 新颖性核查薄弱——OpenAlex 检索难覆盖预印本,「降级措辞」只是修辞。改进:接入 arXiv/Semantic Scholar 全文检索做嵌入级相似度筛查。(5) 溯源机制可被博弈——数字逐字匹配可被规避。改进:对关键数字做重执行抽查,或用数据流追踪替代字符串匹配。(6) 感知预算与「何时渲染图像」是硬编码启发式,跨模态最优分配未知。改进:学习化的预算分配或按不确定度触发的主动感知。

未来方向

作者将系统定位为「未来 AI 科学家的基础蓝图」,扩展新学科只需新增规范文件。自然延伸:(1) 真实实验闭环——把程序性证据族从轨迹/仿真扩展到连接自动化实验室与仪器,让假设接受物理世界检验,从「写论文的科学家」走向「做实验的科学家」;(2) 感知-推理联合缩放规律——当前感知固定为 Sonnet 5,值得探索感知模型与推理骨干的能力矩阵,回答「多少感知能力可被推理补偿」;(3) 把 36 案例套件连同盲版预计算特征接口标准化为公开 benchmark,使「感知贡献」可跨系统比较;(4) 跨案例记忆与知识累积——当前每次运行独立,一个案例发现的混杂模式(如录音协议元数据泄漏)应能迁移预警到新数据集;(5) 发现的价值评估——引入领域专家抽查、与文献的语义比对、后续被引/被复现追踪;(6) 检查失败模式的自动修复——弱模型完成率低(Qwen3.5-9B 仅 18/32),检查拒绝后的定向自修复可提升可用性并摊薄成本。

复现评估

复现评估:代码已开源(github.com/Omni-Scientist/OmniScientist),有项目主页(omni-scientist.github.io);36 个数据集全部真实、公开、可下载,表 1 给出引用与样本量;规范文件示例在附录 E,三阶段 prompt 与评审 rubric 在附录 F/G 逐字给出,Algorithm 1 有伪代码,文档层面可复现性很好。主要障碍:其一,依赖 9 个前沿模型,Sonnet 5、GPT-5.6、GLM-5.2、Kimi K2.7 为闭源 API,版本更迭会改变行为,LLM 评审的非确定性使精确分数难复现;其二,单次运行 $0.03–$4.34 不贵,但 36 案例×9 骨干加消融的完整复现需要一定预算;其三,感知层 11 种模态的工具注册与确定性检查实现是主要工程成本。总体难度中等:复现单个案例(如地震审计的 STA/LTA+跨通道符合性检测器)用经典信号处理即可、无需 LLM;复现完整系统则需要较强的多模态工具链工程能力与稳定 API 访问。