← 返回 2026-08-17

Intern-S2-Mobius:知识与推理解耦的基础模型架构 Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou 📅 2026-08-14 👍 32 2026-08-22 18:30
持续预训练 推理效率 模型架构 潜在推理 知识推理解耦

把FFN知识库与注意力推理器解耦共享,同等精度下推理提速近4倍、训练数据省37%

前置知识

FFN 即知识存储器

Transformer 的前馈网络(FFN)通常被视为模型的长期知识存储:其两层线性变换加激活函数的结构近似一个键值知识向量池,输入隐藏状态作为查询,检索并注入与当前 token 相关的事实性知识。这一视角已被大量可解释性工作支持。

Mobius 的全部设计都建立在'FFN 存知识、注意力做推理'的分工之上,不理解这一点就无法理解'解耦'的对象和意义。

残差连接

残差连接把某层输入直接加到输出上,即 $\mathbf{y} = \mathbf{x} + \mathcal{F}(\mathbf{x})$,为信息提供跨层捷径、稳定梯度传播。DenseNet、Hyper-Connections 等变体加强了连接密度或容量,但都保持单向性:信息只能从浅层流向深层。

论文提出的'反向残差连接'是 Mobius 两大核心能力之一,需先理解传统残差为何只能单向传递信息,才能体会双向访问的价值。

MoE 稀疏激活

混合专家(MoE)把 FFN 拆成多个专家模块,每个 token 经路由器只激活其中一小部分,从而以远小于稠密模型的单次计算量获得巨大的总参数容量,是当前大模型扩容的主流手段。

Mobius 在大参数规模下采用类似 MoE 的分块划分技术切分共享知识库并稀疏激活,用于控制全局共享存储带来的访存压力。

潜在推理与思维链

思维链(CoT)让模型把推理过程显式写成中间 token 再给出答案,代价是序列解码开销大;潜在推理则把推理压缩在连续隐藏状态中迭代精炼,不解码为文本,代表工作有 COCONUT、循环 Transformer、暂停 token 等。

Mobius 原生支持动态潜在推理,这是它输出更短 CoT、端到端推理更快的根本原因,也是理解实验结果的关键。

持续预训练(CPT)

从已有开源预训练权重出发,在大规模无监督语料上继续训练,再接监督微调(SFT)与强化学习(RL),是低成本改造模型能力或架构的常用路线,区别于昂贵的从零预训练。

主力模型 Intern-S2-Mobius-35B 正是从 Qwen3.5-35B 持续预训练而来,论文最亮眼的结果全部基于这一实验设定。

研究动机

Transformer 长期统治语言、视觉、视频与科学计算,但两条传统发展路线如今都撞上天花板。第一条路线保持架构不变、靠扩展取胜:堆参数、堆语料、拉长推理链,但 Scaling Law 已进入边际收益递减区,且模型不论问题难易都输出冗长绕圈的思维链——作者尖刻地指出,这种不分难易的啰嗦在人类社会通常被视为智力不足的信号。第二条路线靠降低架构复杂度省算力:针对自注意力 $O(n^2)$ 复杂度提出的线性注意力、SSM、GDN 等方案虽然降低了计算量,却以牺牲大量模型能力为代价,始终达不到可商业部署的性价比。更深层的结构性病灶在于:Transformer 把知识存储(FFN)与推理算子逐层刚性绑定,残差连接只允许浅层信息流向深层,若关键知识未在浅层被激活,模型当轮就无法解码有价值的 token,只能生成低信息密度的 token 走完整个前向、再靠思维链在下一轮补救,造成大量算力浪费。

本文的目标是面对这一瓶颈,作者选择与'降低架构复杂度'相反的道路:通过提高架构复杂度来抬高模型智能上限,同时降低端到端开销。具体目标是把 FFN(知识向量)与 Self-Attention(推理算子)解绑,构建一个所有推理算子都能随时访问的全局共享知识向量数据库。可衡量的目标有两个:其一,更好的知识压缩——用显著更少的训练数据达到与 Transformer 相同的下游水平;其二,更高的推理效率——在保持同等推理精度的前提下,实现同等参数量下近 4 倍的端到端推理加速。最终产物是 Mobius-v0 架构及其两个实例:从零训练的 7B 模型和从 Qwen3.5-35B 持续预训练的 Intern-S2-Mobius-35B。

与已有工作不同的是,现有研究要么改造注意力的计算形式(稀疏注意力、线性注意力、Mamba/GDN),要么加强前向残差通路(Highway Networks、DenseNet、Hyper-Connections),要么在解码层面做文章(投机解码、MTP、精简 CoT)。Mobius 的独特切入在于根本质疑 Transformer 的一个隐含假设——'知识必须与推理逐层绑定':它把所有 FFN 水平拼接成一个扁平的全局知识库,让每一层的推理器都能访问模型的全部知识,而不是加强某一方向的通路。这一'扁平化'操作同时原生产生两个此前架构不具备的能力:双向知识访问(反向残差连接)和少层数多轮的潜在迭代推理(动态潜在推理),从而绕开了显式反向残差的基础设施难题与长思维链的 token 冗余问题。

核心方法

直觉上可以把 Transformer 想象成一栋每层都自带档案柜的写字楼:知识(FFN)与推理(Self-Attention)在各层成对出现,跨层借阅档案困难、档案多处重复存放。Mobius 把全部档案集中到一个中央资料库——全局共享的 Memory(由各层 FFN 参数水平拼接而成,存储知识向量),各层只保留推理员 Reasoner(Self-Attention 块)。技术上,Mobius-v0 以隐藏状态作为缓存与载体:推理器反复查询 Memory 检索所需知识向量,知识再回传给推理算子完成组合推理,多轮迭代后才在深层同步解码出 token。构建共享知识库时采用直接的水平拼接,以保持 FFN 作为键值知识向量池中原有的对应关系;在 35B 这样的大参数规模下,为避免全量激活带来的显存与访存压力,进一步采用类似 MoE 的分块划分技术对 FFN 切分并稀疏激活。训练验证上做了从零训练(7B-A1B MoE,1TB token)与持续预训练(Qwen3.5-35B-A3B 起点,1TB token 后接 SFT 与 RL)两条线。

核心创新是'一石二鸟'的知识-推理解耦,一次性带来两项 Transformer 不具备的原生能力。第一是反向残差连接:传统残差只把浅层信息传给深层,关键知识一旦没在浅层被激活就只能靠低信息 token 硬闯;Mobius 的共享存储让浅层隐藏状态能取用深层知识、深层状态也能回访浅层知识,任何一层的推理器都面对完整知识库,等价于把残差从单向升级为双向。直接实现双向残差会导致复杂计算图和难以并行的异步问题,共享存储是一种对基础设施友好的间接实现。第二是动态潜在推理:Transformer 中一个 token 的推理必须遍历全部层才能完成,Mobius 只用极少的层就能对着完整知识库迭代精炼潜在状态,潜在向量不绑定特定 token,深思熟虑、试错与修正被内化为连续向量的可微优化,只在深层同步解码出多个高信息密度 token,为不同 token 动态分配算力。

方法步骤详情

实验分三条步骤。第一步,从零训练(TFS)对照:分别以 Mobius 和 Transformer 架构训练两个 7B-A1B 的 MoE 模型,均在 1TB token 语料上预训练,全程记录 MMLU 曲线,并计算 Mobius 达到 Transformer 终值分数所需的最少 token 数,得到数据效率比。第二步,持续预训练(CPT)主线:以开源 Qwen3.5-35B-A3B 为起点,切换为 Mobius 架构后在 1TB token 上继续预训练,随后进行监督微调(SFT)与强化学习(RL),产出 Intern-S2-Mobius-35B。第三步,多维度评估:在 MMLU Pro、GPQA Diamond、IMO Bench、AIME 2026、HMMT 2026、UGD hard、AMO、SimpleQA、HLE 九个通用基准和 Biology-Instructions、Mol-Instructions、MolecularIQ 三个科学任务上与 Qwen3.5-35B 逐项对比;测量请求吞吐量随批大小变化的曲线、聚合平均加速比;统计平均输出长度;最后做逐步对齐的推理轨迹案例分析(如同一道线性代数选择题上 516 对 2,364 token 的逐段对比),判断变短的 CoT 是省略了必要推导还是消灭了重复劳动。

技术新颖性

与已有工作的本质区别体现在四个维度。相对潜在推理研究(COCONUT 把末层隐藏态回填为输入嵌入、CODI 用自蒸馏压缩 CoT、循环 Transformer 共享模块反复应用),Mobius 把高频潜在迭代做成原生架构能力:每次更新只跨极少数层,却始终面对完整共享知识库,单次迭代还能联合支撑多个未来 token。相对投机解码与 MTP(一遍前向遍历全部知识后预测多 token),Mobius 在内部完成多轮知识遍历与多 token 迭代,在最终解码前就形成高信息密度隐藏状态,原生支持多 token 预测。相对残差增强工作(Hyper-Connections、Attention Residual 仍只强化前向通路),Mobius 用共享存储间接实现双向知识访问,规避了显式反向连接的工程困难。相对 MoE,其分块划分服务于'知识库稀疏检索'而非传统专家路由,目标是知识压缩与访存效率;相对扩散语言模型,它无需掩码-去噪过程即可并行精炼连续表征。

The Comparison between Transformer and Mobius.
Figure 1: The Comparison between Transformer and Mobius.
The comparison between RNN, Transformer, and Mobius.
Figure 5: The comparison between RNN, Transformer, and Mobius.

实验结果

五组核心证据支撑论文结论。1) 数据效率:从零训练的 7B-A1B 对照中,Mobius 在整个训练过程的 MMLU 都领先 Transformer,达到 Transformer 在 1TB token 时的分数只需约 0.626×10³(即 626B)token,数据效率 1.6 倍。2) 通用能力不降反升:CPT 得到的 Intern-S2-Mobius-35B 对 Qwen3.5-35B 在 MMLU Pro 89.05 对 85.31、GPQA Diamond 80.81 对 80.24、IMO Bench 81.25 对 77.50、AIME 2026 95.31 对 92.08、HMMT 2026 85.51 对 78.50、AMO 58.00 对 50.00、SimpleQA 28.90 对 21.39,平均 67.88 对 65.05;仅 UGD hard(73.02 对 78.02)与 HLE(19.11 对 22.40)小幅回落。3) 科学任务暴涨:Biology-Instructions 51.40 对 3.77、Mol-Instructions 45.73 对 21.70、MolecularIQ 59.29 对 29.13,平均 52.14 对 18.20,约 2.9 倍。4) 推理效率:聚合多基准平均约 2.9 倍请求加速,IMO Bench 与 AIME 上达 4.6 倍,端到端近 4 倍。5) CoT 显著变短:平均输出长度缩短 1.2–1.5 倍,个别基准 token 数缩短 5.0 倍;Table 2 案例中 Mobius 用 516 token 完成 Qwen3.5-35B 需 2,364 token 的线性代数题,省去的正是重复推导与反复检查段落,作者以此论证是'推理更高效'而非'投机取巧'。

Performance comparison across general and scientific benchmarks.
Table 1: Performance comparison across general and scientific benchmarks.
Step-aligned comparison between Intern-S2-Mobius-35B and Qwen3.5-35B on a linear-algebra multiple-choice question.
Table 2: Step-aligned comparison between Intern-S2-Mobius-35B and Qwen3.5-35B on a linear-algebra multiple-choice question.
The MMLU score of Mobius and Transformer pre-trained from scratch.
Figure 2: The MMLU score of Mobius and Transformer pre-trained from scratch.
The inference efficiency of Mobius continual pre-trained from Qwen3.5.
Figure 3: The inference efficiency of Mobius continual pre-trained from Qwen3.5.
The average output length of Mobius continual pre-trained from Qwen3.5.
Figure 4: The average output length of Mobius continual pre-trained from Qwen3.5.
查看结构化数据
任务指标本文基线提升
从零预训练数据效率(MMLU) 达到基线同分所需训练 token 数 0.626×10³ B tokens(约626B) Transformer 7B-A1B:10³ B tokens 数据效率 1.6×
MMLU Pro(CPT 后) 分数 89.05 Qwen3.5-35B:85.31 +3.74
GPQA Diamond(CPT 后) 分数 80.81 Qwen3.5-35B:80.24 +0.57
IMO Bench(CPT 后) 分数 81.25 Qwen3.5-35B:77.50 +3.75
AIME 2026(CPT 后) 分数 95.31 Qwen3.5-35B:92.08 +3.23
HMMT 2026(CPT 后) 分数 85.51 Qwen3.5-35B:78.50 +7.01
科学任务平均(Biology/Mol-Instructions/MolecularIQ) 平均分 52.14 Qwen3.5-35B:18.20 +33.94(约2.9×)
端到端推理效率(聚合多基准) 请求吞吐量 平均 2.9× 加速,IMO/AIME 达 4.6× 同参数 Transformer 近 4× 端到端加速
推理链长度(线性代数案例) 生成 token 数 516 Qwen3.5-35B:2,364 缩短约 4.6×

局限与改进

作者坦承三点:数据效率提升与 CoT 变短的机制'尚未完全弄清',仅有假设(Transformer 各层冗余存储同一知识,故解耦后压缩率更高;潜在推理把深思内化为可微优化);缩短的 CoT 是否只是投机取巧仍需进一步判定,目前只靠 Table 2 一类案例分析支持'真更高效'的结论;自进化、世界模型、科学发现、软硬件协同四大潜在优势全部停留在立场论述,没有任何实验验证。我的补充观察:其一,共享知识库带来更高访存压力与更低单遍前向效率,4 倍加速是批处理吞吐口径,对延迟敏感的单请求或预填充场景收益存疑;其二,CPT 实验同时改变了架构、数据配方与后训练流程,1TB token 中混入的科学数据可能才是分子/生物任务暴涨的主因,无法完全归因于架构本身;其三,UGD hard 与 HLE 的退步说明解耦并非免费午餐,可能损害了某些需要深层专门化知识的任务;其四,论文未披露稀疏激活比例、路由细节、Figure 3 的硬件与并行配置,复现门槛高。

独立分析的弱点

弱点一:访存瓶颈。全局共享知识库即使经 MoE 式分块稀疏激活,每次检索触达的参数量仍远超传统逐层 FFN,作者承认'更高访存压力、更低单遍前向效率',在内存带宽受限的硬件或小批量推理下优势可能缩水——改进方向是按检索热度对知识向量分级缓存、常驻显存。弱点二:反向残差是间接实现,依赖'把全部 FFN 拼成一个大库'这一粗粒度手段,缺少显式跨层门控,可与 Hyper-Connections 式可学习门控结合做精细化控制。弱点三:机制黑箱。0.626× 数据为何够用、CoT 为何变短都只有事后假设,缺少干预性实验——可对共享库做层间知识冗余度度量、对潜在迭代轨迹做探针分析来验证'冗余压缩'假说。弱点四:评估混淆。CPT 数据配方未披露,缺少'同数据配方的 Transformer CPT'对照组,科学任务 2.9 倍的提升难以与数据贡献分离。弱点五:只报告批处理吞吐与输出长度,缺少单请求首 token 延迟、长上下文伸缩性、显存占用等部署关键指标。每个弱点都可指向具体实验设计,这也是该架构从'有趣'走向'可信'必须补的课。

未来方向

作者在第五节明确提出四个方向。1) 自进化:知识-推理解耦使知识库可无界扩展而推理能力跨域复用,有望避免端到端训练带来的灾难性遗忘,但需与基础模型、智能体系统、环境反馈联合设计验证。2) 世界模型:作者估计 Transformer 完美建模连续空间需要 PB 级参数,推理成本天文数字,而 Mobius 原生潜在推理为连续空间建模提供更强先验,但注意力机制可能需要重新设计。3) 科学发现:潜在空间的可微优化利于形成科学直觉,扁平化知识库让更多知识同时交互、提升跨域组合泛化概率。4) 软硬件协同:推理参数常驻 GPU、知识参数主要存 SSD 按需调入,是比 Transformer 更友好的软硬件协同设计范式。基于已有成果还可延伸:把共享知识库做成可插拔、可在线更新的模块并与 RAG 对比;研究知识分片与检索稀疏化的硬件感知策略;建立 Mobius 上的持续学习与知识编辑协议;将动态潜在迭代轮数与问题难度自适应绑定,实现测试时算力的按需分配。

复现评估

开源情况较好的一面:模型权重已发布在 HuggingFace(https://huggingface.co/internlm/Intern-S2-Mobius),可直接下载推理,独立验证基准分数、吞吐量与输出长度这三类核心结论。复现训练则门槛很高:TFS 线需要在 1TB token 上从头训练两个 7B-A1B 模型,CPT 线需要 Qwen3.5-35B-A3B 权重、1TB token 持续预训练再加 SFT/RL,均为大厂级算力投入,普通实验室难以负担。论文是技术报告风格,多处关键细节缺失:训练超参、数据配比、MoE 式分块的稀疏激活比例与路由策略、从 Qwen3.5 逐层 FFN 重排为共享库的参数初始化映射、Figure 3 的推理硬件与并行框架均未说明。可行的低成本复现路径:按论文描述用 0.5B–1B 规模从零复现 Figure 2 的数据效率曲线(数百卡天量级),或仅做推理侧复现——在开源权重上重测吞吐与 CoT 长度,验证 2.9–4.6 倍加速与 1.2–1.5 倍长度缩短是否在不同硬件上稳定成立。