Intern-S2-Preview:科学智能体基础模型 Intern-S2-Preview: Scientific Agentic Foundation Model
397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一
前置知识
RLVR(可验证奖励的强化学习)
RLVR 指用规则、程序或测试(如数学答案比对、单元测试通过与否)自动判定模型输出对错,并将判定结果作为强化学习的标量奖励,而非依赖人工标注或偏好奖励模型。它要求任务存在客观可验证的成功标准,因此天然适合数学、代码、科学计算等有明确答案的领域,是当前推理模型后训练的主流范式。
本文的多任务推理 RL 和智能体 RL 全部建立在 RLVR 之上:科学问答用答案验证器,编码任务用测试套件,智能体任务用可执行环境的最终状态判定。理解 RLVR 才能明白第 4.3-4.4 节各种奖励设计与防作弊机制的动机。
GRPO 与留一法 REINFORCE
GRPO 类方法对每个问题采样一组 $G$ 个回答,用组内平均奖励作为基线来计算相对优势,从而省去价值网络。留一法(leave-one-out)变体的优势为 $A_i = R_i - \frac{1}{G-1}\sum_{j \neq i} R_j$,即用去掉自身后的组均值做基线。这类方法实现简单、显存友好,被 DeepSeek、Intern 等系列广泛采用。
本文统一 RL 目标(式 27-29)就是留一法 REINFORCE,再叠加 GEPO 熵控制与自适应长度正则两次优势整形。不懂组相对优势估计,就无法理解这两项改进到底修改了什么。
MoE(混合专家)与训练-推理不一致
MoE 模型在每层用路由器把 token 分派给少数专家前馈网络计算,能以稀疏激活支撑超大参数量(本文 397B)。问题在于:训练引擎与推理引擎对同一 token 可能选出不同专家,加上数值精度差异,会导致两边算出的概率不一致,给 RL 训练引入系统性偏差。
本文用 Rollout Routing Replay(R3)记录并重放 rollout 时的专家选择,再用双向二值 KL 异常掩码过滤残余数值离群 token。这些是理解 4.3.1 节训练稳定性设计的前提。
投机解码(Speculative Decoding)
投机解码用一个小草稿模型连续起草 $K$ 个候选 token,再由大模型并行验证,通过精确拒绝采样保证最终输出分布与大模型自身采样完全一致,是一种无损加速。加速比取决于草稿模型与大模型的分布重叠度(接受率 $\alpha = 1 - D_{TV}(p, q)$),草稿模型越贴合策略,接受率越高。
本文的在线投机解码让草稿模型在 RL 过程中用最新策略的轨迹持续更新,解决了固定草稿模型随策略演化而接受率衰减的问题,最终带来 rollout 约 2 倍、端到端约 1.7 倍加速。
智能体 RL 与 harness 概念
智能体 RL 训练的是多轮工具交互行为而非单次回答:模型在环境中观察、调用工具、接收反馈直到任务完成,奖励来自最终任务状态。harness 指驱动智能体的运行时,包括控制循环、上下文管理、工具协议等;task 指初始环境、目标与验证器的组合。同一模型可在不同 harness 下表现迥异。
本文提出的 harness × task 抽象是全部智能体训练基础设施的骨架:把运行时与任务分布解耦,才能让 Claude Code、OpenClaw 等黑盒智能体共享同一套 rollout、验证与训练协议。
反向 KL 散度与在线策略蒸馏
蒸馏是把教师模型的分布迁移给学生的过程。反向 KL $D_{KL}(\pi_\theta \| \pi_T)$ 以学生分布为第一参数,倾向让学生集中在教师的高概率模式上(mode-seeking)。在线策略蒸馏让学生先自己生成轨迹,再由教师在学生产生的前缀上逐 token 打分,从而避免学生轨迹落在教师分布支撑之外导致的监督噪声。
本文最后用在线策略蒸馏把推理专家与智能体专家合并进统一模型,其优势构造(式 33)和通信优化(只传采样 token 的教师对数概率)都依赖对这些概念的理解。
研究动机
现有模型家族难以支撑完整的科研工作流。一方面,通用大模型具备广泛的指令跟随与推理能力,但对异构科学模态——图表、显微图像、遥感影像、分子结构、数值时间序列——缺乏专门的感知与推理能力,也不熟悉各学科的实验协议和可验证的工具交互。论文的对比评测直接暴露了这一差距:在多组学基准 Biology-Instructions 上,Qwen3.5-397B 仅得 4.49 分、GPT-5.5 只有 10.52 分,DNA/RNA/蛋白质序列对通用模型几乎是不曾见过的语言;在材料结构生成 MP20 上多数通用模型得分不足 17。另一方面,已有的科学多模态模型虽然改善了专业输入的感知,但大多仍作为静态问答系统被评测,无法在需要规划、工具调用、环境反馈和迭代执行的长程任务中持续工作。此外,科学知识长尾分布且快速演化,任何固定的后训练检查点都无法覆盖所有细分领域,而直接对骨干模型做领域微调又会扰动其通用推理、多模态与智能体能力,形成特化与通用的两难。
本文的目标是本文的目标是构建统一的科学智能体基础模型系列 Intern-S2-Preview(主模型 397B 参数),让单一模型同时具备四类能力:科学多模态理解、领域科学推理、跨科学模态的生成(分子、材料结构、时间序列预测等),以及长程智能体式的工具交互与迭代执行。目标可拆解为两个架构层面需求和一条完整训练管线。架构上:其一,把时间序列建模从高效长序列理解扩展到数值预测,使模型既能读懂长达约 30 万步的科学信号,又能预报未来系统状态;其二,提供一条不改写 397B 冻结骨干的快速领域特化路径(Memory Decoder),让新科学领域能力即插即用地挂载而不损失通用能力。训练上:从科学多模态预训练出发,经监督微调、可扩展多任务强化学习、黑白盒智能体强化学习,最终用在线策略蒸馏把推理专家与智能体专家合并为统一模型,并在科学、多模态、智能体、通用和时序五类基准上达到开源领先或有竞争力的水平。
与已有工作不同的是,本文的独特切入是把科学问答升级为科学智能体,并在三个方向上给出不同于已有工作的解法。其一,提出 harness × task 抽象,把智能体运行时(如何实例化、驱动、观察智能体)与可执行任务分布(初始环境、目标、验证器)解耦,配合 token-in-token-out(TITO)服务接口和 PrefixTree 轨迹存储,使 OpenClaw、Claude Code、OpenHands、Mini-SWE 等黑盒智能体框架与白盒控制循环共享同一套 rollout、验证与训练协议——此前的工作要么只能训练自家白盒智能体,要么难以从异构运行时恢复 token 级可训练经验。其二,把领域扩展从改写骨干参数变成挂载参数化记忆:独立训练的 4B Memory Decoder 通过轻量路由器与冻结 397B 骨干逐 token 动态融合输出分布,规避灾难性遗忘。其三,将时间序列从纯理解扩展到带专用数值预测分支的统一生成,避免用离散文本 token 生成数值造成的精度损失。此外,论文罕见地系统公开了一整套 RL 工程细节(部分回滚+离策略校正、GEPO、自适应长度正则、在线投机解码),这类内容在同类技术报告中往往语焉不详。
核心方法
直觉上,这篇论文想回答:如何把一个通用大模型改造成既能读懂科学文献与数据、又能像科研人员一样反复使用工具解决问题的科研同事。技术路线是一条五阶段流水线。第一阶段是科学多模态持续预训练:除常规文本语料外,引入 Visual Pre-training——把科学 PDF 渲染成页面图像,用冻结视觉编码器抽取前景视觉特征,让 LLM 以对比式下一潜变量预测直接学习图表、公式与版面结构;同时用 MinerU2.5-Pro 解析 PDF,构建文本-图像-文本交错的版面感知序列,并用视觉增益(加入图像前后困惑度之差 $\Delta = PPL_{without} - PPL_{with}$)过滤低价值页面;再用 8B 嵌入模型加 Milvus 向量库检索高质量科学图像提升采样比例。第二阶段是监督微调,用上一代模型 Intern-S1-Pro 与领先开源模型做拒绝采样生成高质量思维链,经模型与人类领域专家双重校验。第三阶段是可扩展多任务 RLVR,配合部分回滚+离策略校正、自适应长度正则、在线投机解码、GEPO 熵控制等稳定性与效率技术。第四阶段是大规模黑白盒智能体 RL,基于 harness × task 抽象在编码、终端与自进化合成任务上训练。第五阶段用在线策略蒸馏把分别训练的推理专家与智能体专家合并为最终统一模型。
核心创新可归纳为三点。第一,harness × task 抽象加训练感知的模型服务:智能体 RL 的最大障碍是异构运行时产生的交互轨迹无法对齐到 token 级训练信号。本文让 LLM 服务层在正常响应智能体请求的同时透明捕获精确 token ID、rollout 对数概率和 MoE 路由专家选择(TITO 接口),并用每会话增量 PrefixTree 保存从会话历史到 token 的无损映射,从而把任何符合 OpenAI/Anthropic 协议的黑盒智能体的执行轨迹转化为可训练的 RL 经验,这与以往为每个智能体定制 RL 管线的思路有本质区别。第二,与 PPO 式裁剪代理目标不同,本文在 REINFORCE 目标中直接裁剪并 detach 重要性权重(式 11),配合 R3 路由重放与双向二值 KL 异常掩码(式 13),系统性解决部分回滚暂停-续跑机制引入的多版本行为策略问题,使长轨迹训练在共置 GPU 上稳定进行,同时保留每个未掩码 token 的非零梯度贡献。第三,两专家在线策略蒸馏:与其混合训练所有任务导致优化冲突,不如从同一 SFT 检查点分别训练推理专家与智能体专家,再以采样 token 的教师-学生对数概率差作为蒸馏优势(式 33),把教师侧通信开销从 $O(HV)$ 降到 $O(H)$,把两种互补能力无损合并进一个模型。
方法步骤详情
训练流程按时间顺序展开。(1)持续预训练:文本路径用解析后的 PDF 文本做语言建模;视觉路径把页面图像经冻结编码器得到特征,前景掩码后按光栅序投影进 LLM 做对比式下一潜变量预测,联合损失 $\mathcal{L} = \lambda_{text}\mathcal{L}_{CE} + \lambda_{vis}\mathcal{L}_{VP}$;交错图文管线输出不超过 256K token、共享 512 token 重叠的文档级序列。(2)SFT:覆盖通用对话、代码、图文、工具使用与长程智能体轨迹的混合数据。(3)推理 RL:每组采样 $G$ 个回答,先算留一法优势 $A^{LOO}_i = R_i - \frac{1}{G-1}\sum_{j \neq i} R_j$,经 GEPO 按组级熵缩放(低熵组衰减正优势、高熵组衰减负优势),再经自适应长度正则——仅当正响应比例超过阈值 $\tau$ 时按 $w_i = \alpha + (1-\alpha)(1 - \frac{L_i - L^+_{min}}{L^+_{max} - L^+_{min} + \epsilon})^\gamma$ 对正响应降权——最终以裁剪重要性权重加 BKL 掩码的 REINFORCE 目标(式 29)更新;共置部分回滚系统在批次凑齐后暂停未完成 rollout,权重同步后续跑;Muon 优化器、学习率 $1 \times 10^{-6}$、每批 8192 条响应、最大生成 65,536 token;在线草稿模型($K=4$、混合 LK 损失)带来 rollout 约 2 倍、端到端约 1.7 倍加速。(4)智能体 RL:把 SWE-smith(59,136 任务)、Nemotron-Terminal(80,000)等公开集合与自进化技能图合成任务统一成环境+目标+验证器契约;整段会话共享结果奖励,过程标注器对格式错误、无效工具调用打 adv_penalty;金补丁与隐藏测试在评分前才注入以防奖励作弊。(5)OPD:先用两专家轨迹做轻量 SFT 预热,再按领域选教师,最小化学生前缀上的反向 KL(式 31-36)。
技术新颖性
从技术新颖性看,本文的贡献不是单一算法突破,而是一整套可复用的系统与训练方法论,其中多项设计具有明确的首创性或差异化。自适应长度正则不同于显式长度奖励或独立长度控制微调阶段:它只重加权正响应的组内相对优势(式 15),并只在模型已基本掌握该问题(正例率超阈值)时激活,既不与任务奖励冲突,也不扰动先前 RL 阶段习得的能力——图 8 显示 35B 模型在奖励曲线持平的同时平均输出长度从约 12,000 token 显著缩短。在线投机解码以接受率自适应混合 forward KL 与 TV 距离(式 22-23),让草稿模型随策略共同演化,解决了固定草稿模型在 RL 中接受率持续衰减的老问题。GEPO 利用现成分组样本估计组级熵,对低熵组衰减压低正优势、对高熵组衰减负优势(式 26),在不强制任务间统一熵目标的前提下校正了组相对方法中优势跨组不可比的隐含偏差。智能体侧的 TITO + PrefixTree + 过程感知优势控制(式 30,只对正优势施加过程惩罚、保留失败轨迹的负信号)同样是针对会话级稀疏奖励与多段可训练区间这一智能体特有结构的精细设计。Memory Decoder 则把领域持续学习转化为检索蒸馏压缩加轻量路由器融合,是对冻结骨干加外挂记忆路线在科学领域的大规模验证。
实验结果
评测覆盖科学、多模态、智能体、通用与时序五类基准,对比 Qwen3.5-397B-A17B、DeepSeek-V4-pro、Kimi-K2.7-Code、GLM-5.2 与 GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.8 等。科学知识类最突出:Biology-Instructions 56.92(次优 GPT-5.5 仅 10.52)、Mol-Instructions 52.37(次优 40.49)、SciReasoner 63.97(超 GPT-5.5 的 61.15)均列第一;MolecularIQ 61.49、TOMG-Bench 65.66 为开源最佳;内部评测集 MP20 达 67.88、ProteinBinder-9 通过率 4.36% 远超所有对比模型(均低于 2.5%)。通用能力上,MMLU-Pro 89.75、SimpleQA-Verified 69.90、MMMU-Pro 80.46、ChartQAPro 69.65 均为开源最佳,逼近闭源前沿(Gemini-3.1-Pro MMLU-Pro 91.00)。智能体任务是相对短板:SciCode 49.11 落后 Claude-Opus-4.8 的 56.21;SWE-Bench-Multilingual 81.67 为开源最佳;Terminal-Bench 2.1 67.42 明显低于 Claude 的 84.60;ResearchClawBench 18.44 绝对值仍低。时序模块收益显著:SciTS 理解上以不到 Intern-S1-Pro 一半的参数量在 9 个共同任务中 7 个领先,PHU01 的 F1 从 36.8 升至 66.9,并新增雷达任务 RAU01 88.4、RAU02 60.2;SciTS 预测 7 项全部成功率 100% 且 MAPE 全面优于 TimeOmni、Chronos 等专用模型(ENG02 60.2 vs 68.6),horizon 预测器准确率 99%,GIFT-Eval 零样本 MASE 0.785。Memory Decoder 实验中,Intern-MemDec-4B 将 Biology-Instructions 从 56.92 提至 60.32(约 +6%),通用基准几乎不变,验证了模块化特化的可行性。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多组学序列分析 Biology-Instructions | 平均分 | 56.92 | GPT-5.5:10.52 | +46.40 分(约 5.4 倍),全榜第一 |
| 材料结构生成 MP20 | 结构匹配率(%) | 67.88 | GPT-5.5:16.12 | +51.76 个百分点,SOTA |
| 蛋白结合剂设计 ProteinBinder-9 | 全流程通过率(%) | 4.36 | Claude-Opus-4.8:2.40 | +1.96 个百分点(约 1.8 倍),SOTA |
| 科学推理 SciReasoner | 平均分 | 63.97 | GPT-5.5:61.15 | +2.82 分,全榜第一 |
| 时序理解 SciTS PHU01(生理信号) | F1 | 66.9 | Intern-S1-Pro(万亿参数):36.8 | +30.1,以不到一半参数量反超 |
| 时序预测 SciTS ENG02 | MAPE(成功率) | 60.2 (100%) | TimeOmni:68.6 (100%) | MAPE 降低 12.2%,7 项任务全部领先 |
| SWE-Bench-Multilingual(多语言代码修复) | 解决率(%) | 81.67 | GLM-5.2:82.00 | 基本持平,开源最佳梯队 |
| 知识推理 MMLU-Pro | 准确率(%) | 89.75 | Gemini-3.1-Pro:91.00 | 开源最佳,距最强闭源 1.25 分 |
| 生物学领域特化(Memory Decoder) | Biology-Instructions 平均分 | 60.32(挂载 Intern-MemDec-4B) | 冻结 397B 骨干:56.92 | +3.40(约 6%),通用基准不变 |
局限与改进
作者坦承 Intern-S2-Preview 仍是预览系统:长科学工作流的可靠性有待提高、验证器需要强化、与专业科学工具的集成仍浅。我自己的观察还有几点。其一,部分科学成绩出自内部评测集(论文明言 MP20 与 ProteinBinder-9 为 our internal evaluation sets),协议由作者自定,横向可比性弱于公开榜单。其二,科学智能体任务并非全面领先:SciCode 49.11 落后 Claude-Opus-4.8 约 7 分;Terminal-Bench 2.1 落后约 17 分;WildClawBench 44.68 距第一梯队(Claude 64.72)差距明显;ResearchClawBench 18.44 的绝对值表明端到端自动科研远未解决。其三,报告未披露预训练 token 总量、数据配比与总算力,多数工程技巧无法独立定量验证。其四,竞赛数学 HMMT-2026 为 91.57,仍落后 GPT-5.5 的 97.06。其五,对比模型版本与评测 harness(ResearchHarness v0.0.49、Terminus 2 等)的选择都可能影响公平性,部分闭源成绩引自第三方。
独立分析的弱点
独立分析几处弱点。第一,397B(即便 MoE 稀疏)部署门槛高,而 Memory Decoder 推理时要求骨干与 4B 记忆并行前向并逐 token 融合,服务成本和延迟显著高于单模型,论文未报告 MemDec 的具体开销——改进方向是把记忆压缩进路由稀疏层或做异步融合。第二,Memory Decoder 只在生物学上验证,跨域行为未知:同时挂载多个领域记忆时路由器如何归一化、记忆间是否互相污染缺乏实验支撑,多记忆联合训练是自然的下一步。第三,自进化任务合成受社区技能分布约束,步骤级 skip 掩码依赖行为分类器准确性,误标会把正确的探索当错误惩罚——可引入验证器交叉审计与人工抽检的双通道机制。第四,防奖励作弊的验证器工程(金补丁隔离、Git 历史清洗、全对语义)极其复杂,任何遗漏都是新的攻击面,论文未量化拦截比例与残余风险。第五,horizon 预测器 99% 准确率依赖指令解析,对模糊指令(如预测未来一段时间)的鲁棒性存疑;预测分支与文本生成分离,无法用语言先验交叉验证数值预测的合理性。第六,SFE 上 61.67 仍略低于 Qwen3.5 的 62.97,说明视觉预训练对细粒度科学图表感知的增益有限。
未来方向
作者提出的方向包括:提升更长科学工作流上的可靠性、扩展领域专属记忆与任务环境、强化验证器、深化与专业科学工具的集成。在此基础上可有若干自然延伸。其一,把 Memory Decoder 从单域扩展为可组合的多记忆库,支持跨域检索式记忆共享,甚至让智能体在推理中自主决定挂载哪块记忆,形成记忆即工具的范式。其二,将自进化任务合成的闭环从技能图推广到自动假设生成-实验设计-验证的完整科研循环,以 ResearchClawBench 类端到端任务作为优化信号,逼近自动科研。其三,过程感知优势控制目前依赖规则标注的过程错误,可引入基于验证模型的过程奖励模型(PRM)做更细粒度的信用分配,覆盖非确定性的低质量行为。其四,时序模块可与智能体框架深度结合:模型在分析信号后自主调用预测分支、解释预测不确定性,并根据预测结果规划下一步实验,形成感知-预测-决策闭环。其五,OPD 的两专家设计可随任务族扩展为多教师层级蒸馏,且只传采样 token 教师对数概率的做法($O(H)$ 通信)可推广到异步多教师并发蒸馏。其六,公开 MP20、ProteinBinder-9 等内部评测集与验证器实现,将大幅提升社区的可复现性与跟进速度。
复现评估
复现难度评估:模型权重在 HuggingFace 开放(internlm/Intern-S2-Preview),智能体 RL 框架基于开源 XTuner(github.com/InternLM/xtuner),论文给出大量超参——Muon 优化器、学习率 $1 \times 10^{-6}$、权重衰减 0.01、rollout 批 8192 条、8 个 mini-batch、最大生成 65,536 token、投机解码 $K=4$、轨迹陈旧度上限 3 次更新等——透明度高于多数技术报告。但端到端从零复现不现实:预训练语料(科学 PDF、交错图文、图像检索库)未公开,397B MoE 的多任务 RL 与双专家 OPD 估计需要千卡级集群,LMDeploy+XTuner 共置部分回滚系统的工程细节需自行调通;评测所用部分 harness 与内部评测集也非标准配置。对普通团队,可行路径有三:下载权重做多卡或量化部署后复现推理与公开基准评测(约需 8 卡 H100 级);复现 Intern-MemDec-4B 式小规模记忆训练(4B 记忆+冻结骨干+路由器,式 1-4 给出完整目标函数,成本可控);或在自己的智能体任务上复用 harness × task 抽象与 TITO 设计。总体评价:思想可学习、评测可部分复现、训练不可复现。
论文图表
通用与智能体基准对比:MMLU-Pro 89.75、SimpleQA-Verified 69.90、MMMU-Pro 80.46、ChartQAPro 69.65 均为开源最佳;SWE-Bench-Pro 61.56、SWE-Bench-Multilingual 81.67 处开源第一梯队;Terminal-Bench 2.1 67.42、WildClawBench 44.68 落后 Claude-Opus-4.8(84.60、64.72)。
界定了模型的通用能力边界:知识与多模态理解逼近闭源前沿,而长程终端执行类任务仍有明显差距,是客观评估其实际可用性的关键。