S1-Omni:面向科学理解、预测与生成的统一多模态推理模型 S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
用单一统一多模态推理模型打通科学理解、预测与生成
前置知识
视觉-语言模型(VLM)
视觉-语言模型是一种能同时处理图像和文本的多模态大模型,通常由视觉编码器(如 ViT)和语言模型(如 Transformer decoder)组成,通过投影层将视觉特征对齐到语言空间。S1-Omni 选用 S1-VL-32B 作为共享骨干,承担跨模态任务理解和科学推理。
理解本文必须先理解 VLM 作为'共享骨干'的角色:所有科学对象最终都进入这个统一骨干,再由它把隐藏状态分发给各个下游解码器。
科学对象的序列化表示(SMILES/CIF/FASTA)
SMILES 用 ASCII 字符串表示分子图(如 CN1C(=O)... 表示含酰胺的稠环),CIF 用文本描述晶体对称性与原子坐标,FASTA 用单字母编码蛋白质/核酸序列。这些'可序列化'对象通过文本通道进入 VLM,而图谱、医学影像等则走视觉通道。
本文的核心争议点是'统一 ≠ 均匀 token 化'。理解这些原生科学格式,才能明白作者为何要保留对象边界,并为不同输出空间设计专门解码器。
领域专家解码器(Diffusion / SimpleFold / MMDiT)
扩散模型通过逐步去噪生成分子图或 3D 构象;SimpleFold 是轻量蛋白质结构预测网络,输出全原子 3D 坐标;MMDiT(多模态扩散 Transformer)配合 VAE 解码器生成科学图像。这些解码器各自保留了输出空间的几何/数值约束。
S1-Omni 的关键创新是'共享推理 + 专门解码'。读懂数值标量、残基概率、分子结构、原子坐标、像素图像这五类输出如何由不同解码器产生,是理解整篇方法的前提。
思维链与结构化推理监督
思维链(chain-of-thought)指模型在给出答案前先生成中间推理步骤。本文对比了'无约束自由推理'、'结构化属性约束推理'、'无推理'三种监督,结构化版本强制教师模型先记录结构/组成观察,再挑选与目标性质最相关的 3-5 个因素并说明方向与交互。
本文最重要的实验结论之一就是:自由流畅的推理反而比不写推理更差(MAE 34.818 vs 20.457),只有结构化、属性约束的推理才能稳定提升。这颠覆了'推理越多越好'的直觉。
性质预测与 ADMET
性质预测是从分子/晶体结构推断连续数值或类别标签,如带隙、介电常数、溶解度。ADMET(吸收/分布/代谢/排泄/毒性)是药物早期筛选的核心指标,包括 CYP 酶代谢、hERG 心脏毒性、HIA 肠道吸收等端点,是本文重点评测的药物发现任务族。
性质预测是本文五大任务族之一,也是验证'统一表示'跨模态能力的试金石——同一个模型要同时吃 SMILES 和 CIF,同时做回归和分类。
蛋白质功能位点预测
蛋白质功能位点预测是残基级的二分类问题:判断序列中哪些氨基酸残基参与蛋白-蛋白互作、结合 DNA/RNA、配位金属离子、结合小分子或构成抗体表位。S1-Omni 用 ESM2 残基嵌入加对 VLM 任务上下文的交叉注意力来实现。
这是验证'专门解码优于自由文本生成'的关键任务:直接生成残基索引文本 F1≈0,而残基级解码头可达 0.536,说明这是密集预测而非问答问题。
研究动机
当前 AI for Science(AI4S)的能力高度碎片化,沿三条割裂的路线发展:一是 AlphaFold 3、ESM3 这类领域专用模型,围绕单一科学实体(蛋白、分子、材料)做到极致但难以迁移;二是 GPT-Rosalind、Claude Science 这类工具增强型通用大模型,把科学能力外包给外部工具和工作流,知识并未内化进模型;三是 NatureLM、LOGOS、BioMatrix 这类科学语言模型,把不同对象映射进共享 token 空间,却尚未解决如何把科学定律、专家知识和领域约束注入训练与推理。结果是,跨学科、跨模态、跨任务的联合建模仍无法实现:处理晶体带隙的模型不会看分子毒性,能做蛋白结构的模型不会画科学插图,通用大模型在生成有效 3D SDF 文件上频频失败。例如 GPT-5.5 在谱图-分子生成上 100 个样本只有 71 个能解析,精确匹配仅 4 例;Gemini-3.1-Pro 甚至无法产出有效 SDF。这种碎片化限制了异构数据、科学定律与专家知识的联合建模。
本文的目标是本文要把上述分散的能力整合进一个单一、连贯的科学推理模型 S1-Omni,使其能在同一模型流程内完成跨学科、跨模态、跨任务的科学理解、预测与生成。具体目标有四个层面:第一,统一表示——把自然语言指令与 CIF、SMILES、蛋白序列、谱图、科学图像等异构对象映射进共享表示空间,同时保留对象类型边界与编码路径;第二,自然世界知识对齐——在数据构造与训练中注入科学定律、专家经验与实验事实,让模型从科学证据出发形成中间判断;第三,领域原生解码——根据任务目标选择输出表示与解码器,支持性质预测、谱图-分子生成、蛋白位点和结构预测、科学图像生成与编辑;第四,可验证性——输出必须是各领域原生结果空间(标量、残基集、分子图、3D 坐标、图像)中可直接验证的形式。
与已有工作不同的是,本文的独特切入点在于:它既不满足于'提供自然语言接口',也不满足于'把不同对象转成统一 token'。作者明确指出,统一科学智能的关键不在于接口或 token 化,而在于三件事必须在一个模型流程内协同:在同一个骨干里组织异构科学数据、通过隐式表示把科学定律与领域约束注入任务理解与推理、最后产出在原生科学形式下可验证的输出。这与以往三类工作形成本质区别——领域模型牺牲了迁移性,工具型模型把能力外包,科学语言模型只统一了对象表示却没统一'智能'。S1-Omni 用'共享骨干 + 任务路由 token + 专门解码器 + 结构化证据推理'这套组合,首次把统一表示、知识对齐、原生解码三者放在同一个可扩展的训练范式里系统验证。
核心方法
直觉是'一个会科学推理的大脑 + 多个会原生表达的专家手'。用户给出指令和科学对象(CIF、SMILES、蛋白序列、谱图、图像)后,共享视觉-语言骨干 S1-VL-32B 把所有输入融合成任务条件化的隐藏表示,再生成可选科学推理 $\hat{r}_i$、文本答案 $\hat{a}_i$ 和内部任务 token $\hat{s}_i$。结果能用自然语言表达时文本答案即输出;输出在专门空间(标量、残基概率、分子结构、3D 坐标、像素)时,任务 token 选解码器把共享表示转成原生可验证形式。训练记录定义为 $d_i=(x_i,y_i,t_i,m_i)$,$x_i=(x^{text}_i,x^{task}_i)$,$y_i=(y^{text}_i,y^{task}_i)$。骨干用 prefill 形成 $\hat{h}_i=F^{prefill}_{\theta}(c_i)$,由 $Extract_t$ 按任务把隐藏状态池化、选 token 级或全局状态、或投影到任务条件空间,再交给解码器 $G_{\phi_{\hat{s}_i}}$ 产出原生结果。该设计避免了单一表示或单一输出头。
核心创新在于'任务 token 路由 + 专门解码器 + 共享推理表示'的三位一体,且训练上严格分两阶段。与已有方法的本质区别有三:第一,统一不等于均匀——可序列化对象(SMILES/CIF/FASTA)走文本通道,图像/谱图走视觉通道,保留对象边界与模态角色,高分辨率残基/谱峰/像素信息仍可直接被下游解码器读取;第二,推理监督的'结构化属性约束'而非自由思维链——教师模型必须先记录结构-组成观察,再挑选 3-5 个与目标性质最相关的因素并说明方向、强度与交互,这是表示学习信号而非模板;第三,prefill 表示作为稳定的下游接口——任务解码器优先从回答生成前的'问题侧 prefill 状态'提取特征,而不是池化整条思维链,因为长推理状态会把科学证据与措辞、终止预测混在一起稀释任务信号。最独特的是解码器训练阶段冻结骨干 $\theta^{\star}$ 后只训解码器 $\{\phi_t\}$,用各自的损失 $loss_{t_i}$(连续值用数值偏差、分类用类别误差、分子/结构用生成监督、图像用 latent flow-matching),从而把'跨任务共享理解'与'领域原生生成'解耦。
方法步骤详情
训练分两阶段。Stage 1 训练共享 VLM:以 $y^{text}_i=(s_i,r_i,a_i)$ 序列化作监督,优化自回归交叉熵 $L_{VLM}(\theta)=-\frac{1}{\sum_i|y^{text}_i|}\sum_i\sum_k \log p_\theta(y^{text}_{i,k}|c_i,y^{text}_{i,<k})$;原生目标 $y^{task}_i$ 不进入响应。Stage 2 冻结骨干 $\theta^{\star}$,抽取任务条件 $e_i=Extract_{t_i}(F^{prefill}_{\theta^{\star}}(c_i))$,各解码器读 $e_i$ 与 $x^{task}_i$,在各自结果空间优化 $L_{task}=E[loss_{t_i}(G_{\phi_{t_i}}(e_i,x^{task}_i),y^{task}_i)]$,解码器独立训练。数据构造(图 3)经防泄漏源分离划分、科学定律与专家证据约束、单位/索引/目标泄漏一致性验证三步完成。输出为 $(\hat{r}_i,\hat{a}_i)$ 或三元组,不外露。
技术新颖性
技术新颖性体现在四层。架构上,首次把'统一表示 + 知识对齐 + 原生解码'三者放进单一 VLM 流程,用任务 token($\langle linear\_pre\rangle$、$\langle prot\_cla\rangle$、$\langle spectra\_st\rangle$、$\langle prot\_st\rangle$、$\langle image\_gen\rangle$)作内部控制信号路由到不同解码器,而非用一个统一 token 化覆盖所有科学对象。数据上,提出'结构化属性约束推理'作为表示学习目标——实验证明自由推理反而比无推理差,只有强制教师按'观察→筛选性质相关因素→声明方向与交互'的稳定模式才提供稳定学习信号,有力反驳'推理越多越好'。训练上,两阶段解耦让跨任务迁移发生在共享骨干,领域精度由独立解码器保证,prefill 表示作稳定接口避免长思维链稀释任务信号。评测上,在统一文本+图像协议下跨 66 个任务、五大科学模态系统比较,并用 BOOM 标签偏移、binned $R^2$ 尾部相关性等更深指标揭示统一表示在低密度区域的退化模式。
实验结果
在五大任务族、超 60 个基准上评测。性质预测:48 个性质上超更强闭源模型 40 个、超领域专家 8 个;18 个 ADMET 端点上超两闭源模型 16 个,BBBP/HERG/HIA_HOU 等多项超专家,但量子化学仍被专家压制近一个数量级(COMPAS-1D MAE 0.05 vs 0.007 量级),材料每个性质都有专家更强。谱图-分子生成:QM9S 1 万样本 Acc@1 0.4569、3D 键角误差最低 6.13×10⁻³,而 GPT-5.5 仅 71/100 可解析。蛋白位点:PPI、表位、小分子结合三项均超现有最优专用模型,但金属/DNA/RNA 位点弱于专用模型。蛋白结构:固定 SimpleFold-700M 下推理条件使均值 TM-score 0.8288→0.8291、中位 RMSD 降 0.126。科学图像:生成 GenExam 51.4、TechImage-Bench 60.68 超开源对手;编辑在 MSD、cigRockSEM、SynthRAD2025、IXI 四项超专家。聚合:统一协议下对 GPT 家族胜率 95.5%、对 Gemini 家族 83.3%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ADMET 性质预测(CYP/hERG/HIA 等 18 端点) | ROC-AUC/PRC-AUC | 16/18 端点超越两个闭源模型,HERG 0.8734、HIA_HOU 0.9921、CYP2D6_VEITH 0.8816 | ChemFM-3B HERG 0.8480、HIA_HOU 0.9840;GPT-5.5/Gemini-3.1-Pro 普遍 0.5-0.6 | 在分类排序端点上系统性领先,闭源模型被打平或超越 16/18 项 |
| 谱图-分子生成(QM9S,IR+Raman+UV-Vis) | Acc@1 / MCES | Acc@1 0.4569,MCES 1.1765,3D 键角误差 6.13×10⁻³ | DiffSpectra Acc@1 0.4056,键角 7.30×10⁻³ | Acc@1 +0.0513,MCES -0.1508,键角误差最低 |
| 蛋白-蛋白互作位点(MPBind 测试集) | AUPR | 0.666 | MPBind 0.540;GPT-5.5/Gemini 无有效排名 | +0.126 AUPR,AUROC 0.830→0.859 |
| 表位预测(RoBep 测试集) | AUPR | 0.472 | RoBep 0.268;DiscoTope 3.0 0.237 | +0.204 AUPR,F1 +0.167,MCC +0.153 |
| 小分子结合位点(COACH420) | AUROC | 0.880 | GraphBind 0.870;P2Rank 无排名 | +0.010 AUROC,MCC 0.303→0.366 |
| 科学图像编辑-MSD 医学分割 | Dice | 0.8496 | Swin UNETR 专家 0.7868;GPT-Image-2 0.3787 | +0.0628 超专家,远超所有通用图像模型 |
| 科学图像编辑-SynthRAD2025 CBCT→CT 翻译 | PSNR (dB) | 47.87 | VBoussot 专家 34.78;Nano Banana 2 40.08 | +13.09 dB 超专家 |
| 结构化推理监督消融(6 项材料回归) | Material MAE ↓ | 结构化推理 17.255,MAD/MAE 1.260 | 自由推理 34.818;无推理 20.457 | 自由推理反而比无推理差,结构化最好 |
| 聚合任务级对比(66 任务,统一文本+图像输入) | 胜率 | 对 GPT 家族 95.5%,对 Gemini 家族 83.3% | GPT-5.5/GPT-Image-2、Gemini-3.1-Pro/Nano Banana 2 | 跨标量/残基/结构/像素四类输出均系统性领先 |
局限与改进
作者明确承认四类局限。第一,未做大规模科学预训练——只是从现成 VLM 出发在精选科学任务上训练,因此无法揭示数据、参数、算力的扩展定律。第二,分子结构、蛋白坐标、科学图像并非由共享骨干原生生成,而是依赖扩散或专家解码器,这是统一任务表示与统一原生生成之间的中间态。第三,任务覆盖深度不足——只测了性质预测、结构重建、蛋白任务和科学图像,缺乏复杂多阶段问题、跨任务族 OOD 泛化与跨任务迁移。第四,科学任务训练削弱了部分通用能力,且评测集中于有界单轮问题,多轮规划、长程状态跟踪、工具使用与纠错尚未充分探索。我额外观察到三点:一是绝对精度上量子化学和材料专家仍大幅领先(COMPAS-1D MAE 差近一个数量级),说明统一表示在需要精细电子/几何先验的任务上结构性受限;二是 OOD 尾部相关性差——gap/HOMO/LUMO/μ 的 binned $R^2$ 为负,模型向训练分布中心收缩,无法恢复尾部斜率;三是蛋白结构提升极微(TM-score 仅 +0.0004),更像兼容性证明而非实质突破,且仍在 700M 小骨干上验证。
独立分析的弱点
第一,统一表示对精细电子与几何结构建模不足。量子化学 COMPAS-1D 上专家 MAE 0.0067-0.0170,S1-Omni 为 0.0508-0.0699,差近一个数量级;材料每个性质都有专家更强,反映缺 3D 等变/电子结构先验。改进:在骨干或解码器引入等变图神经网络模块。第二,OOD 低密度尾部退化明显。gap/HOMO/LUMO/μ 的 binned $R^2$ 为 -1.91 至 -3.04,预测向中心收缩。改进:在低密度标签区加强监督或对几何敏感性质施加更直接 3D 约束。第三,金属、DNA、RNA 位点弱于专用模型(平均 MCC 0.467 vs LABind 0.655),因缺金属特异性化学先验与静电特征。改进:把金属配位几何与静电势作辅助条件注入残基解码。第四,蛋白结构提升微弱(TM-score +0.0004)且依赖外部 SimpleFold。改进:把结构生成内化进骨干或更大变体验证扩展性。第五,文字渲染(CVTG-2K 80.39 vs GLM-Image 91.16)和临床有效性未充分验证。改进:增加字符级渲染训练并用临床指标补充 PSNR。
未来方向
作者明确提出的方向包括:在大规模上做持续科学预训练并测量科学表示、跨任务迁移与领域能力如何随扩展变化;系统比较 token、扩散、混合方案,看多少结构与生成能力可移入共享骨干而不丢失连续空间所需的归纳偏置;扩展任务覆盖,纳入复杂多阶段问题、跨任务族 OOD 与跨任务迁移研究;把通用能力保留与科学性能作为联合目标,评测规划、执行、反馈驱动的长程科研工作流;并探索工具增强的研究工作流。基于成果我可延伸出:把推理条件 + 等变几何先验结合以攻克 OOD 尾部问题;把蛋白结构生成原生化而非外挂 SimpleFold;用'自然世界知识对齐'范式扩展到反应预测、合成路线、临床试验等更高阶任务;构建跨任务迁移基准(如用分子性质知识辅助材料发现);以及把 BOOM 标签偏移这种深度评估协议推广为统一模型的标配,逼出真正的外推能力而非 ID 拟合。
复现评估
复现支持总体较好。作者以 Apache-2.0 许可发布模型权重、建模与推理服务代码,并发布高质量 S1-Omni-Corpus-10K 子集(与全语料同记录格式),可通过 HuggingFace、ModelScope、GitHub 获取。训练记录格式 $d_i=(x_i,y_i,t_i,m_i)$、两阶段损失(VLM 自回归交叉熵 + 各解码器原生损失)、五类任务 token 与对应解码器/抽取策略(Table 1)都给出明确定义,消融覆盖推理结构、池化范围、数值区间、预测器共享、训练阶段与数据规模、标签归一化等关键变量,透明度高。但仍有障碍:全语料 800 万+记录未完全开源,结构化属性约束推理的'教师选择 3-5 个因素'的具体系统提示只在附录给案例未完全公开;骨干 S1-VL-32B、ESM2、SpecFormer、SimpleFold-700M、MMDiT 等依赖多个外部组件,端到端复现需大量算力与多专家协同;图像生成骨干与 Qwen-Image 共享但具体微调细节有限。对学术研究者,复现核心消融和单任务解码较可行,复现完整统一系统需要工业级资源。难度评估为中高。
论文图表
以条形图展示八种 QM9 性质的 OOD/ID RMSE 比,越接近 1 越好。S1-Omni 在 α、Cv、HOMO、LUMO、μ、ZPVE 上比值最低(多在 1.15-2.67),R² 比值最高 8.02;RT 在 α、R² 上发生灾难性失败(比值 2.52×10⁴、1.19×10³)。
这张图揭示了统一模型相比自回归数值解码(RT)的关键稳健性优势——连续回归头不会产生数量级爆炸的极端值,同时点明 R² 性质仍存在大尺度误差放大,是理解 OOD 局限的核心。