← 返回 2026-07-20

Loopie:算力对等预算下的循环深度混合专家大模型 Loop the Loopies!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai 📅 2026-07-17 👍 71 2026-07-25 18:30
大模型预训练 强化学习对齐 循环Transformer 数学推理 混合专家模型MoE 算力对等缩放

用层循环配方让循环MoE在等算力下稳定胜过普通堆叠

前置知识

混合专家模型(Mixture-of-Experts, MoE)

MoE 把前馈网络替换成多个并行的「专家」子网络,每个 token 由路由器(如 Top-K)只激活其中少数几个专家。这样总参数量可以很大(决定模型容量),而每个 token 的激活参数量却很小(决定训练/推理算力)。例如 Qwen3-30B-A3B 有 30B 总参数但每 token 只激活约 3B。本文 Loopie-20B-A2B 即 20B 总参数、2B 激活。

现代旗舰模型几乎都转向 MoE;Loopie 的全部论证都建立在「循环必须与 MoE 兼容并能扩展到 20B 量级」之上,不读懂 MoE 的总参数/激活参数之分就无法理解其算力核算逻辑。

循环 Transformer(Looped / Universal Transformer)

不靠堆叠大量互不相同的层来增加深度,而是反复复用同一组(或共享的)参数做循环计算 $h_{t+1}=F_\theta(h_t,x,e_t)$,其中 $e_t$ 可编码循环步号。Universal Transformer 是其原型。好处是参数效率高、有迭代精炼与算法式推理的归纳偏置;代价是循环 N 次,预训练算力也放大 N 倍。

Loopie 的核心命题就是「循环 Transformer 在算力对等时能否赢过普通 Transformer」,不懂循环机制与它的算力核算困境,就抓不住本文要解决的问题。

算力对等比较(compute-matched comparison)

指固定硬件、序列长度、每优化步 token 数、优化器、训练数据,仅按「实测的每步墙钟时间」匹配两个模型,使总训练算力近似相等,而不是按理论 FLOP 或参数量匹配。例如 Ouro-2.6B 循环 4 次应与约 10.4B 基线、Huginn-3.5B 循环 32 次应与约 112B 基线对比。

这是本文的评判准绳。只有算力对等,循环的胜利才有意义;否则循环模型只是偷偷多花了算力。读懂这一约定才能理解所有实验为何如此设计。

层循环 vs 模型循环(layer-loop vs model-loop)

model-loop(Ouro/Huginn 用)把整堆层跑完再从头重复:Layer1→2→3→1→2→3;layer-loop(Loopie 提出)让每层在原地连续循环两次再进入下一层:Layer1→1→2→2→3→3。前者让同一物理层在相差极大的有效深度处被复用,后者只在相邻深度复用,参数共享更自然、流水线局部性更好。

layer-loop 是本文的关键架构创新,所有消融都围绕它展开,不理解两种循环的区别就无法读懂图 1、图 2、图 5 的实验。

监督预训练(Supervised Pre-training, SPT)

本文提出的后训练新范式:损失掩码采用 SFT 的做法(只在「监督目标 token」上计算交叉熵,prompt/context 被掩掉),但优化规模采用预训练的做法(全局批 ≥1024、序列长 ≥128K、每批约 1.28 亿 token、共 2T token)。损失函数仍是交叉熵 $\mathcal{L}_{CE}=-\sum w_{i,t}\log p_\theta(z_{i,t}|z_{i,<t})$,区别只在哪些 token 进损失以及优化规模。

SPT 是 Loopie 拿到前沿推理能力却同时提升基础指标、且连续 10 个 epoch 不过拟合的关键,是后训练章节的核心,也是与传统 SFT/PT 对比的焦点(表 2)。

研究动机

循环 Transformer(如 Universal Transformer)通过反复复用同一组参数来增加有效深度,长期面临一个根本性的算力核算困境:让模型循环 N 次,预训练算力也会被放大约 N 倍,而在这种诚实的同等算力比较下,把同样预算花在增大参数量上往往反而更划算。例如 Ouro-2.6B 循环 4 次应与约 10.4B 的基线相比,Huginn-3.5B 循环 32 次甚至应对标约 112B 的稠密模型。此前工作(Ouro、Huginn、Csordás 等)大多把循环当作提升参数效率的手段,且只在稠密骨干上验证;而现代旗舰模型(Qwen3、Kimi K2.5、GLM-5、DeepSeek-V4、MiniMax-M2 等)几乎都转向 MoE。循环架构若不能与 MoE 兼容、又不能在算力对等下胜出,就难以通往万亿参数的旗舰规模。这使得「循环能否在真实大模型预训练中真正胜出」一直悬而未决。

本文的目标是本文要回答一个明确的核心问题:在相同的预训练算力预算下,循环 Transformer 能否追平甚至超越普通(非循环)Transformer?围绕这一问题,作者训练了两个循环 MoE 大模型——Loopie-20B-A2B(总参数 20B、激活 2B)和 Loopie-6B-A0.6B(总参数 6B、激活 0.6B),各使用两步层循环。目标不是在相同参数量下刷点,而是要在「每一步优化器的实测墙钟时间一致、总训练算力一致」的严苛条件下证明:循环深度可以成为与参数量、数据量并列的、可扩展的第三缩放轴。此外,作者还希望用一套新的后训练流程(监督预训练 + 强化学习)赋予模型前沿水平的推理能力,让循环架构具备真正的实用价值。

与已有工作不同的是,本文的独特切入点是 Loopie Recipe:不再把循环简单当作「省参数」的替代品,而是把存储宽度、存储深度、循环深度三者放在固定算力预算下联合优化。其关键洞察在于——循环之所以在固定算力下吃亏,往往是因为没有搭配合适的宽度-深度-循环次数折中;而减少存储深度带来的激活内存节省,可以通过翻倍微批次、减半梯度累积转化为实测吞吐提升,再把这些白捡的效率回投到更大的模型容量上。配合作者提出的 layer-loop(层循环)调度,让复用发生在相邻有效深度处而非相差极大的深度处,参数共享更自然;再配合全新的监督预训练(SPT),Loopie 第一次让循环 MoE 在与普通 MoE 公平算力比较下系统性胜出,填补了循环架构通往旗舰级大模型的空白。

核心方法

整体思路可概括为「先用循环换内存,再用内存换吞吐,最后用吞吐换容量」。作者以一个强劲的非循环 MoE 参考模型(类 Qwen3-30B-A3B,宽度 $D_0=2048$、存储层数 $L_0=48$、循环次数 $R_0=1$)为基准。第一步构造循环种子模型:把存储层减半得 $L=24, R=2$,这样 $LR=48$ 保持不变,领头阶前向块计算量 $LRD^2$ 与参考一致,但激活内存项 $M_{act}\propto s\,b\,D\,L$ 立刻减半。第二步执行层循环:每一层在原地重复应用两次后再把表示传给下一层,而非把整堆模型整体重复。第三步把省下的内存用于翻倍每卡微批次 $b_1=2b_0$ 并相应减半梯度累积步 $g_1=g_0/2$,全局批次不变,却提高了每步的硬件利用率。最后在 Megatron-LM 中对各候选 $(D,L)$ 组合做大规模 TP/PP/EP/MBS 网格搜索,选实测每步时间最接近参考的那个:$D_1=2304, L_1=27, R_1=2$,即 Loopie-20B-A2B。

核心创新有两层。第一层是 layer-loop 调度,与此前 Ouro、Huginn 使用的 model-loop 本质不同:model-loop 把整堆层跑完再从头重复(Layer1→2→3→1→2→3),同一个物理层会在相差极大的有效深度处被复用——例如一个 48 层模型两次循环时,第 3 层在有效深度 3 和 $48+3=51$ 处各执行一次,需同一组参数同时扮演截然不同的深度角色,易产生梯度冲突;而 layer-loop 让每层在相邻的有效深度处连续迭代(局部精炼),参数共享模式更自然、更连贯。同时复用发生在流水线同一 stage 内,执行局部性更好,避免 model-loop 把输出从最后一级绕回第一级造成的循环依赖与流水线气泡。第二层是把「匹配」从理论 FLOP 改为实测墙钟时间——循环模型名义算力更高,但被翻倍微批次带来的吞吐增益抵消,最终在真实硬件上达成算力对等。这让循环从「省参数设备」升级为「算力对等的缩放机制」。

方法步骤详情

输入是非循环参考模型及其训练配方(数据、硬件、序列长 8192、全局批 1024、每步 token 数)。① 构造循环种子 $D=2048, L=24, R=2$,使 $LRD^2=24\cdot2\cdot2048^2=48\cdot2048^2$ 与参考的领头阶计算代理一致。② 实施层循环:检查点实现中存储层的所有循环应用都包在同一检查点单元里,激活内存只随存储深度而非执行深度增长。③ 候选隐藏维度限为 128 的倍数,扫描 $(D,L)$(如表 1 的 2176×25、2304×27、2432×28),报告 $\hat C=LRD^2/(48\cdot2048^2)$ 与 $\hat M_{act}=DL/(48\cdot2048)$。④ 在 Megatron-LM 中对参考与各候选联合搜索张量/专家并行与微批次,测每步墙钟时间。⑤ 选最接近参考的 $D_1=2304, L_1=27$($\hat C\approx1.424$、$\hat M_{act}\approx0.633$,实测可翻倍微批次),即 Loopie-20B-A2B。

技术新颖性

技术新颖性体现在三处。其一,首次把「算力对等」明确作为循环大模型的评判准则,并给出可复现的硬件感知配方:用测量而非解析 FLOP 来匹配预算,绕开了 MoE 路由、通信、kernel 启动等低阶开销带来的误差。其二,layer-loop 调度是对循环结构的重新设计,兼具经验缩放优势(训练约 1.2T token 后反超 model-loop)、基础设施友好性(流水线局部性好、检查点与梯度累积简化)和参数共享的自然性(只在相邻有效深度复用)。其三,后训练阶段提出监督预训练(SPT),把 SFT 的「仅监督目标 token」损失掩码与预训练的超大批次(≥1024 全局批、≥128K 序列长、每批约 1.28 亿 token、共 2T token)相结合,既显著提升推理指标又不退化基础能力、连续 10 个 epoch 不见过拟合——这挑战了「SFT 必然导致灾难性遗忘」的传统认知。

Illustration of the contrast between layer-loop and model-loop.
Figure 1: Illustration of the contrast between layer-loop and model-loop.
Comparison of the average downstream benchmark scores between layer-loop and model-loop variants of Loopie-6B-A0.6B.
Figure 2: Comparison of the average downstream benchmark scores between layer-loop and model-loop variants of Loopie-6B-A0.6B.
Layer-loop ablation for Loopie-6B-A0.6B.
Figure 5: Layer-loop ablation for Loopie-6B-A0.6B.
Comparison between N× layer-loop and N× stored-layer scaling.
Figure 6: Comparison between N× layer-loop and N× stored-layer scaling.
Composition of the Stage-2 high-quality annealing data pool.
Figure 7: Composition of the Stage-2 high-quality annealing data pool.
Overview of the Loopie training pipeline.
Figure 8: Overview of the Loopie training pipeline.

实验结果

① 算力对等主对比(图 3):与复现的 Qwen3-30B-A3B 同算力训 800B token,Loopie 约 600B token 后反超;实测吞吐 261.53 TFLOPS/s,比 Qwen3 的 189.65 高约 38%。② 缩放阶梯(图 4):0.15B/0.25B/0.5B/1B 四档 Loopie 全胜,差距随规模增大(约 +0.6/+1.1/+1.7/+2.2 点)。③ 层循环消融(图 5):去掉 layer-loop、其余相同的对照模型被明显压制且带来 2.14× 加速,证明提升来自循环安排而非额外算力。④ 循环次数扫描(图 6):$R=2/3/4$ 时循环的边际收益随 N 快速衰减,故选 $R=2$。最终(表 3)Loopie-20B-A2B 仅用 3.5T token(不足 Nemotron 的 1/7)即在 MMLU 81.28、BBH 82.28、IFEval 84.72 多项追平或超过 25T 的 Nemotron;推理侧 AIME24 92.09、AMC 94.21 列第二;6B 档 AIME24/25 拿 80.42/70.83 领先同档。

Candidate configurations generated from the Qwen3-like 30B-A3B reference.
Table 1: Candidate configurations generated from the Qwen3-like 30B-A3B reference.
Comparison of supervised pre-training (SPT), conventional SFT, and pre-training (PT).
Table 2: Comparison of supervised pre-training (SPT), conventional SFT, and pre-training (PT).
Comparison of Loopie-20B-A2B with similarly sized MoE reasoning models.
Table 3: Comparison of Loopie-20B-A2B with similarly sized MoE reasoning models.
Comparison of Loopie-6B-A0.6B Thinking with compact reasoning models.
Table 4: Comparison of Loopie-6B-A0.6B Thinking with compact reasoning models.
Comparison of Loopie-20B-A2B with reproduction of Qwen3-30B-A3B under matched per-step pre-training wall-clock time.
Figure 3: Comparison of Loopie-20B-A2B with reproduction of Qwen3-30B-A3B under matched per-step pre-training wall-clock time.
Scaling ladder for Loopie.
Figure 4: Scaling ladder for Loopie.
Training loss for Loopie-6B-A0.6B during supervised pre-training.
Figure 9: Training loss for Loopie-6B-A0.6B during supervised pre-training.
Trends in reasoning metrics during supervised pre-training.
Figure 10: Trends in reasoning metrics during supervised pre-training.
Trends in pre-training metrics during supervised pre-training.
Figure 11: Trends in pre-training metrics during supervised pre-training.
查看结构化数据
任务指标本文基线提升
AIME 2024(数学竞赛,avg@8) 准确率(%) 92.09 Nemotron-3-Nano-30B-A3B: 85.00 +7.09
MMLU(综合知识) 准确率(%) 81.28 Nemotron-3-Nano-30B-A3B: 80.52 +0.76
BBH(BIG-Bench Hard) 准确率(%) 82.28 Nemotron-3-Nano-30B-A3B: 68.76 +13.52
IFEval(指令遵循,inst_level_loose) 准确率(%) 84.72 Nemotron-Cascade2-30B-A3B: 79.21 +5.51
AMC(美国数学竞赛) 准确率(%) 94.21 Nemotron-3-Nano-30B-A3B: 91.80 +2.41
大规模预训练吞吐 TFLOPS/s 261.53 Qwen3-30B-A3B: 189.65 +71.88 (约+38%)
AIME 2024(6B 档,avg@8) 准确率(%) Loopie-6B-A0.6B: 80.42 Ouro-2.6B-Thinking: 62.50 +17.92

局限与改进

作者明确承认若干局限。其一,后训练几乎只覆盖数学与代码推理,未涉及科学问答、指令遵循、人类对话偏好对齐、智能体任务求解等更广泛能力。其二,受算力所限未对监督预训练(SPT)做充分消融,SPT 为何能同时提升基础与推理指标仍缺乏系统性解释。其三,研究聚焦预训练算力匹配,未系统研究推理时算力的匹配与优化(如循环次数在测试时自适应)。其四,为避免混淆因素,刻意选用干净可控的 Qwen3-30B-A3B 骨干,未探索与其它新架构(更精细专家路由、低秩递归适配器等)的协同。我的补充观察:所有算力对等都基于特定 Megatron-LM 实现与特定 GPU,跨框架/硬件的可移植性未必成立;Loopie 名义算力更高意味着推理时也付出约 2 倍层前向的代价,论文对推理吞吐/延迟的讨论偏少;此外 $R=2$ 的结论高度依赖「循环边际收益快速衰减」这一经验观察,更大模型上是否仍成立需要更多验证。

独立分析的弱点

独立分析的弱点:① 算力对等依赖「翻倍微批次能换来吞吐」这一硬件经验,若在内存受限场景(极长序列、巨大 KV cache)下微批次无法翻倍,Loopie Recipe 的收益会缩水——改进方向是引入更细粒度的重计算/卸载策略或线性注意力以保留内存优势。② 推理成本被淡化:$R=2$ 意味着每 token 多一次层前向,延迟敏感场景吃亏,可结合提前退出(early exit)或自适应循环让简单 token 少循环。③ layer-loop 与 model-loop 的对比主要在小模型上做,大规模上图 2 反超点的可解释性不足——可补充对表示相似度、梯度冲突的探针实验。④ SPT 虽有效但机制不清,且依赖海量高质量监督数据(2T token),对中小团队难复现——可研究更小预算下 SPT 的缩放律与关键超参。⑤ 仅用 $R=2$ 可能过于保守,放弃了循环在测试时多算上的潜力——可在推理期允许更大 $R$ 并研究其外推性,把训练用 $R=2$、推理按难度动态调做成混合策略。

未来方向

作者提出的方向:把后训练扩展到科学问答、指令遵循、偏好对齐、智能体等更广任务与偏好信号;系统研究推理时算力的匹配与优化(参考 Parallel Loop Transformer 的并行循环思路);与更新的架构(专家路由、低秩递归、隐式状态空间等)结合探索协同效应。基于成果可延伸的方向:① 把 Loopie Recipe 推广到万亿参数级旗舰模型,验证算力对等优势是否在 Chinchilla 最优点附近仍成立;② 把 layer-loop 与自适应循环深度、提前退出结合,实现训练用 $R=2$、推理按难度动态调的混合策略;③ 对 SPT 做理论与缩放律研究,明确其避免灾难性遗忘、抑制过拟合的关键因素;④ 将循环的「可复用更新规则」偏置与工具调用、检索增强等外部计算结合,检验其在多跳组合推理上的优势;⑤ 在 ARC-AGI、数独、迷宫等抽象推理任务上系统检验 layer-loop 的组合泛化与长度外推能力。

复现评估

作者已开源权重(Loopie-20B-A2B、6B-A0.6B)与代码(megatron-loopie、vllm-loopie),并公开关键配方:数据来自 Nemotron-CC-v2 等,两阶段约 3T + 1.26T(合计约 3.5T token);AdamW($\beta_1=0.9,\beta_2=0.95,\epsilon=10^{-15}$、权重衰减 0.1),warmup-stable-only 学习率(6B 用 $5\times10^{-4}$、20B 用 $3\times10^{-4}$,预热后恒定不衰减),全局批 1024、序列长 8192。评测框架(LM Eval Harness、EvalScope)、RL 算法(GSPO+DAPO)、数据集(Guru-RL)均可获取。但完整复现门槛高:20B MoE 的大规模 Megatron 训练、3.5T 预训练加 2T 监督预训练需海量算力;算力对等依赖具体硬件与并行配置,跨平台需重做 TP/PP/EP/MBS 网格搜索。整体属「权重加配方可复现、完整复训困难」。