Intern-S2-Mobius:知识与推理解耦的基础模型架构 Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
把FFN知识库与注意力推理器解耦共享,同等精度下推理提速近4倍、训练数据省37%
前置知识
FFN 即知识存储器
Transformer 的前馈网络(FFN)通常被视为模型的长期知识存储:其两层线性变换加激活函数的结构近似一个键值知识向量池,输入隐藏状态作为查询,检索并注入与当前 token 相关的事实性知识。这一视角已被大量可解释性工作支持。
Mobius 的全部设计都建立在'FFN 存知识、注意力做推理'的分工之上,不理解这一点就无法理解'解耦'的对象和意义。
残差连接
残差连接把某层输入直接加到输出上,即 $\mathbf{y} = \mathbf{x} + \mathcal{F}(\mathbf{x})$,为信息提供跨层捷径、稳定梯度传播。DenseNet、Hyper-Connections 等变体加强了连接密度或容量,但都保持单向性:信息只能从浅层流向深层。
论文提出的'反向残差连接'是 Mobius 两大核心能力之一,需先理解传统残差为何只能单向传递信息,才能体会双向访问的价值。
MoE 稀疏激活
混合专家(MoE)把 FFN 拆成多个专家模块,每个 token 经路由器只激活其中一小部分,从而以远小于稠密模型的单次计算量获得巨大的总参数容量,是当前大模型扩容的主流手段。
Mobius 在大参数规模下采用类似 MoE 的分块划分技术切分共享知识库并稀疏激活,用于控制全局共享存储带来的访存压力。
潜在推理与思维链
思维链(CoT)让模型把推理过程显式写成中间 token 再给出答案,代价是序列解码开销大;潜在推理则把推理压缩在连续隐藏状态中迭代精炼,不解码为文本,代表工作有 COCONUT、循环 Transformer、暂停 token 等。
Mobius 原生支持动态潜在推理,这是它输出更短 CoT、端到端推理更快的根本原因,也是理解实验结果的关键。
持续预训练(CPT)
从已有开源预训练权重出发,在大规模无监督语料上继续训练,再接监督微调(SFT)与强化学习(RL),是低成本改造模型能力或架构的常用路线,区别于昂贵的从零预训练。
主力模型 Intern-S2-Mobius-35B 正是从 Qwen3.5-35B 持续预训练而来,论文最亮眼的结果全部基于这一实验设定。
研究动机
Transformer 长期统治语言、视觉、视频与科学计算,但两条传统发展路线如今都撞上天花板。第一条路线保持架构不变、靠扩展取胜:堆参数、堆语料、拉长推理链,但 Scaling Law 已进入边际收益递减区,且模型不论问题难易都输出冗长绕圈的思维链——作者尖刻地指出,这种不分难易的啰嗦在人类社会通常被视为智力不足的信号。第二条路线靠降低架构复杂度省算力:针对自注意力 $O(n^2)$ 复杂度提出的线性注意力、SSM、GDN 等方案虽然降低了计算量,却以牺牲大量模型能力为代价,始终达不到可商业部署的性价比。更深层的结构性病灶在于:Transformer 把知识存储(FFN)与推理算子逐层刚性绑定,残差连接只允许浅层信息流向深层,若关键知识未在浅层被激活,模型当轮就无法解码有价值的 token,只能生成低信息密度的 token 走完整个前向、再靠思维链在下一轮补救,造成大量算力浪费。
本文的目标是面对这一瓶颈,作者选择与'降低架构复杂度'相反的道路:通过提高架构复杂度来抬高模型智能上限,同时降低端到端开销。具体目标是把 FFN(知识向量)与 Self-Attention(推理算子)解绑,构建一个所有推理算子都能随时访问的全局共享知识向量数据库。可衡量的目标有两个:其一,更好的知识压缩——用显著更少的训练数据达到与 Transformer 相同的下游水平;其二,更高的推理效率——在保持同等推理精度的前提下,实现同等参数量下近 4 倍的端到端推理加速。最终产物是 Mobius-v0 架构及其两个实例:从零训练的 7B 模型和从 Qwen3.5-35B 持续预训练的 Intern-S2-Mobius-35B。
与已有工作不同的是,现有研究要么改造注意力的计算形式(稀疏注意力、线性注意力、Mamba/GDN),要么加强前向残差通路(Highway Networks、DenseNet、Hyper-Connections),要么在解码层面做文章(投机解码、MTP、精简 CoT)。Mobius 的独特切入在于根本质疑 Transformer 的一个隐含假设——'知识必须与推理逐层绑定':它把所有 FFN 水平拼接成一个扁平的全局知识库,让每一层的推理器都能访问模型的全部知识,而不是加强某一方向的通路。这一'扁平化'操作同时原生产生两个此前架构不具备的能力:双向知识访问(反向残差连接)和少层数多轮的潜在迭代推理(动态潜在推理),从而绕开了显式反向残差的基础设施难题与长思维链的 token 冗余问题。
核心方法
直觉上可以把 Transformer 想象成一栋每层都自带档案柜的写字楼:知识(FFN)与推理(Self-Attention)在各层成对出现,跨层借阅档案困难、档案多处重复存放。Mobius 把全部档案集中到一个中央资料库——全局共享的 Memory(由各层 FFN 参数水平拼接而成,存储知识向量),各层只保留推理员 Reasoner(Self-Attention 块)。技术上,Mobius-v0 以隐藏状态作为缓存与载体:推理器反复查询 Memory 检索所需知识向量,知识再回传给推理算子完成组合推理,多轮迭代后才在深层同步解码出 token。构建共享知识库时采用直接的水平拼接,以保持 FFN 作为键值知识向量池中原有的对应关系;在 35B 这样的大参数规模下,为避免全量激活带来的显存与访存压力,进一步采用类似 MoE 的分块划分技术对 FFN 切分并稀疏激活。训练验证上做了从零训练(7B-A1B MoE,1TB token)与持续预训练(Qwen3.5-35B-A3B 起点,1TB token 后接 SFT 与 RL)两条线。
核心创新是'一石二鸟'的知识-推理解耦,一次性带来两项 Transformer 不具备的原生能力。第一是反向残差连接:传统残差只把浅层信息传给深层,关键知识一旦没在浅层被激活就只能靠低信息 token 硬闯;Mobius 的共享存储让浅层隐藏状态能取用深层知识、深层状态也能回访浅层知识,任何一层的推理器都面对完整知识库,等价于把残差从单向升级为双向。直接实现双向残差会导致复杂计算图和难以并行的异步问题,共享存储是一种对基础设施友好的间接实现。第二是动态潜在推理:Transformer 中一个 token 的推理必须遍历全部层才能完成,Mobius 只用极少的层就能对着完整知识库迭代精炼潜在状态,潜在向量不绑定特定 token,深思熟虑、试错与修正被内化为连续向量的可微优化,只在深层同步解码出多个高信息密度 token,为不同 token 动态分配算力。
方法步骤详情
实验分三条步骤。第一步,从零训练(TFS)对照:分别以 Mobius 和 Transformer 架构训练两个 7B-A1B 的 MoE 模型,均在 1TB token 语料上预训练,全程记录 MMLU 曲线,并计算 Mobius 达到 Transformer 终值分数所需的最少 token 数,得到数据效率比。第二步,持续预训练(CPT)主线:以开源 Qwen3.5-35B-A3B 为起点,切换为 Mobius 架构后在 1TB token 上继续预训练,随后进行监督微调(SFT)与强化学习(RL),产出 Intern-S2-Mobius-35B。第三步,多维度评估:在 MMLU Pro、GPQA Diamond、IMO Bench、AIME 2026、HMMT 2026、UGD hard、AMO、SimpleQA、HLE 九个通用基准和 Biology-Instructions、Mol-Instructions、MolecularIQ 三个科学任务上与 Qwen3.5-35B 逐项对比;测量请求吞吐量随批大小变化的曲线、聚合平均加速比;统计平均输出长度;最后做逐步对齐的推理轨迹案例分析(如同一道线性代数选择题上 516 对 2,364 token 的逐段对比),判断变短的 CoT 是省略了必要推导还是消灭了重复劳动。
技术新颖性
与已有工作的本质区别体现在四个维度。相对潜在推理研究(COCONUT 把末层隐藏态回填为输入嵌入、CODI 用自蒸馏压缩 CoT、循环 Transformer 共享模块反复应用),Mobius 把高频潜在迭代做成原生架构能力:每次更新只跨极少数层,却始终面对完整共享知识库,单次迭代还能联合支撑多个未来 token。相对投机解码与 MTP(一遍前向遍历全部知识后预测多 token),Mobius 在内部完成多轮知识遍历与多 token 迭代,在最终解码前就形成高信息密度隐藏状态,原生支持多 token 预测。相对残差增强工作(Hyper-Connections、Attention Residual 仍只强化前向通路),Mobius 用共享存储间接实现双向知识访问,规避了显式反向连接的工程困难。相对 MoE,其分块划分服务于'知识库稀疏检索'而非传统专家路由,目标是知识压缩与访存效率;相对扩散语言模型,它无需掩码-去噪过程即可并行精炼连续表征。
实验结果
五组核心证据支撑论文结论。1) 数据效率:从零训练的 7B-A1B 对照中,Mobius 在整个训练过程的 MMLU 都领先 Transformer,达到 Transformer 在 1TB token 时的分数只需约 0.626×10³(即 626B)token,数据效率 1.6 倍。2) 通用能力不降反升:CPT 得到的 Intern-S2-Mobius-35B 对 Qwen3.5-35B 在 MMLU Pro 89.05 对 85.31、GPQA Diamond 80.81 对 80.24、IMO Bench 81.25 对 77.50、AIME 2026 95.31 对 92.08、HMMT 2026 85.51 对 78.50、AMO 58.00 对 50.00、SimpleQA 28.90 对 21.39,平均 67.88 对 65.05;仅 UGD hard(73.02 对 78.02)与 HLE(19.11 对 22.40)小幅回落。3) 科学任务暴涨:Biology-Instructions 51.40 对 3.77、Mol-Instructions 45.73 对 21.70、MolecularIQ 59.29 对 29.13,平均 52.14 对 18.20,约 2.9 倍。4) 推理效率:聚合多基准平均约 2.9 倍请求加速,IMO Bench 与 AIME 上达 4.6 倍,端到端近 4 倍。5) CoT 显著变短:平均输出长度缩短 1.2–1.5 倍,个别基准 token 数缩短 5.0 倍;Table 2 案例中 Mobius 用 516 token 完成 Qwen3.5-35B 需 2,364 token 的线性代数题,省去的正是重复推导与反复检查段落,作者以此论证是'推理更高效'而非'投机取巧'。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 从零预训练数据效率(MMLU) | 达到基线同分所需训练 token 数 | 0.626×10³ B tokens(约626B) | Transformer 7B-A1B:10³ B tokens | 数据效率 1.6× |
| MMLU Pro(CPT 后) | 分数 | 89.05 | Qwen3.5-35B:85.31 | +3.74 |
| GPQA Diamond(CPT 后) | 分数 | 80.81 | Qwen3.5-35B:80.24 | +0.57 |
| IMO Bench(CPT 后) | 分数 | 81.25 | Qwen3.5-35B:77.50 | +3.75 |
| AIME 2026(CPT 后) | 分数 | 95.31 | Qwen3.5-35B:92.08 | +3.23 |
| HMMT 2026(CPT 后) | 分数 | 85.51 | Qwen3.5-35B:78.50 | +7.01 |
| 科学任务平均(Biology/Mol-Instructions/MolecularIQ) | 平均分 | 52.14 | Qwen3.5-35B:18.20 | +33.94(约2.9×) |
| 端到端推理效率(聚合多基准) | 请求吞吐量 | 平均 2.9× 加速,IMO/AIME 达 4.6× | 同参数 Transformer | 近 4× 端到端加速 |
| 推理链长度(线性代数案例) | 生成 token 数 | 516 | Qwen3.5-35B:2,364 | 缩短约 4.6× |
局限与改进
作者坦承三点:数据效率提升与 CoT 变短的机制'尚未完全弄清',仅有假设(Transformer 各层冗余存储同一知识,故解耦后压缩率更高;潜在推理把深思内化为可微优化);缩短的 CoT 是否只是投机取巧仍需进一步判定,目前只靠 Table 2 一类案例分析支持'真更高效'的结论;自进化、世界模型、科学发现、软硬件协同四大潜在优势全部停留在立场论述,没有任何实验验证。我的补充观察:其一,共享知识库带来更高访存压力与更低单遍前向效率,4 倍加速是批处理吞吐口径,对延迟敏感的单请求或预填充场景收益存疑;其二,CPT 实验同时改变了架构、数据配方与后训练流程,1TB token 中混入的科学数据可能才是分子/生物任务暴涨的主因,无法完全归因于架构本身;其三,UGD hard 与 HLE 的退步说明解耦并非免费午餐,可能损害了某些需要深层专门化知识的任务;其四,论文未披露稀疏激活比例、路由细节、Figure 3 的硬件与并行配置,复现门槛高。
独立分析的弱点
弱点一:访存瓶颈。全局共享知识库即使经 MoE 式分块稀疏激活,每次检索触达的参数量仍远超传统逐层 FFN,作者承认'更高访存压力、更低单遍前向效率',在内存带宽受限的硬件或小批量推理下优势可能缩水——改进方向是按检索热度对知识向量分级缓存、常驻显存。弱点二:反向残差是间接实现,依赖'把全部 FFN 拼成一个大库'这一粗粒度手段,缺少显式跨层门控,可与 Hyper-Connections 式可学习门控结合做精细化控制。弱点三:机制黑箱。0.626× 数据为何够用、CoT 为何变短都只有事后假设,缺少干预性实验——可对共享库做层间知识冗余度度量、对潜在迭代轨迹做探针分析来验证'冗余压缩'假说。弱点四:评估混淆。CPT 数据配方未披露,缺少'同数据配方的 Transformer CPT'对照组,科学任务 2.9 倍的提升难以与数据贡献分离。弱点五:只报告批处理吞吐与输出长度,缺少单请求首 token 延迟、长上下文伸缩性、显存占用等部署关键指标。每个弱点都可指向具体实验设计,这也是该架构从'有趣'走向'可信'必须补的课。
未来方向
作者在第五节明确提出四个方向。1) 自进化:知识-推理解耦使知识库可无界扩展而推理能力跨域复用,有望避免端到端训练带来的灾难性遗忘,但需与基础模型、智能体系统、环境反馈联合设计验证。2) 世界模型:作者估计 Transformer 完美建模连续空间需要 PB 级参数,推理成本天文数字,而 Mobius 原生潜在推理为连续空间建模提供更强先验,但注意力机制可能需要重新设计。3) 科学发现:潜在空间的可微优化利于形成科学直觉,扁平化知识库让更多知识同时交互、提升跨域组合泛化概率。4) 软硬件协同:推理参数常驻 GPU、知识参数主要存 SSD 按需调入,是比 Transformer 更友好的软硬件协同设计范式。基于已有成果还可延伸:把共享知识库做成可插拔、可在线更新的模块并与 RAG 对比;研究知识分片与检索稀疏化的硬件感知策略;建立 Mobius 上的持续学习与知识编辑协议;将动态潜在迭代轮数与问题难度自适应绑定,实现测试时算力的按需分配。
复现评估
开源情况较好的一面:模型权重已发布在 HuggingFace(https://huggingface.co/internlm/Intern-S2-Mobius),可直接下载推理,独立验证基准分数、吞吐量与输出长度这三类核心结论。复现训练则门槛很高:TFS 线需要在 1TB token 上从头训练两个 7B-A1B 模型,CPT 线需要 Qwen3.5-35B-A3B 权重、1TB token 持续预训练再加 SFT/RL,均为大厂级算力投入,普通实验室难以负担。论文是技术报告风格,多处关键细节缺失:训练超参、数据配比、MoE 式分块的稀疏激活比例与路由策略、从 Qwen3.5 逐层 FFN 重排为共享库的参数初始化映射、Figure 3 的推理硬件与并行框架均未说明。可行的低成本复现路径:按论文描述用 0.5B–1B 规模从零复现 Figure 2 的数据效率曲线(数百卡天量级),或仅做推理侧复现——在开源权重上重测吞吐与 CoT 长度,验证 2.9–4.6 倍加速与 1.2–1.5 倍长度缩短是否在不同硬件上稳定成立。
论文图表