← 返回 2026-09-11

NCP-ArchPreview 技术报告:基于下一概念预测迈向潜空间语言模型 NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

NCP Team, Jiaqi Cao, Chiyu Chen, Shuang Cheng, Xu Cheng, Beiya Dai, Yufan Feng, Kewen Ge, Ruijun Ge, Jiayi Huang, Yang Jiao, Dahua Lin, Zhouhan Lin, Yifan Liu, Yuliang Liu, Biqing Qi, Mowen Ruan, Junzhe Shen, Yunchong Song, Hao Sun, Zhongbo Tian, Yixuan Wang, Rubin Wei, Jiaxin Xiong, Kangyu Yang, Qian Yao, Qi Zhang, Bowen Zhou 📅 2026-09-09 👍 213 2026-09-12 18:30
Muon优化器 下一概念预测 向量量化 大规模预训练 架构创新 潜空间语言模型

8.9B模型联合下一概念预测与token预测,仅用51.3%数据即追平OLMo-3-7B。

前置知识

Next Token Prediction (NTP)

自回归语言模型的标准训练目标:给定前缀 $x_{\le t}$,用交叉熵损失 $\mathcal{L}_{NTP}=-\log p(x_{t+1}|x_{\le t})$ 逐位置预测下一词。监督完全限定在token粒度,高层语义抽象只能作为副产品涌现,没有显式损失引导语义结构如何跨多token展开。

本文的全部动机建立在『NTP缺少多token跨度的显式监督』这一观察上,提出的Next Concept Prediction正是对NTP的补充目标,理解NTP的局限才能理解NCP的设计初衷。

向量量化与乘积量化 (VQ / Product Quantization)

VQ维护码本 $\{e_1,\dots,e_N\}$,把连续向量映射到最近码字 $n=\arg\min_n\|c-e_n\|^2$,得到有限离散空间。乘积量化把向量切成 $S$ 段、每段独立小码本,组合出 $N^S$ 种可能,大幅扩展容量;训练时用带stop-gradient的损失把码字拉向编码器输出分布。

本文用乘积量化从模型自身隐状态构建离散概念词表(32个码本×128条目),它是NCP目标的结构化预测空间,也是预训练后轻量域适配的17M参数接口。

JEPA (联合嵌入预测架构)

联合嵌入预测架构不重建原始输入,而是直接在表示空间预测未来内容的抽象表征,丢弃难预测的输入细节、保留语义不变结构。该范式在图像(I-JEPA)与视频(V-JEPA、V-JEPA 2)上取得突破,但语言建模因缺乏合适的潜空间目标而进展缓慢。

NCP可视为JEPA思想在语言中的规模化落地:直接在潜空间预测『下一概念』而非重建token,理解JEPA有助于把本文放进更大的研究脉络。

Muon 优化器

Muon对矩阵参数做正交化更新 $W_t=W_{t-1}+\lambda_w d\,W_{t-1}-\eta_t\lambda_M O_t/\sqrt{\max(d_{in},d_{out})}$,$O_t$ 为正交化更新方向,使各方向尺度更均衡,大规模预训练中效率占优。本文用其变体Moonlight Muon,嵌入与偏置仍用AdamW。

本文训练采用Moonlight Muon(学习率 $6\times10^{-5}$),并发现它与OLMo-3的逐层Q/K归一化相互作用会引发注意力logit爆炸,这一工程发现与解决方案是论文的重要部分。

多token预测 (MTP)

在主NTP目标之外增加辅助头预测未来若干位置的token,如DeepSeek-V3额外加一层预测第2个未来token、损失权重0.3。训练时提供更密集的监督信号,推理时其额外头可用作投机解码的起草器。但其损失仍绑定在表层token上,只是监督位置变多。

本文5.2节专门验证NCP与MTP的叠加增益(NCP带来的损失下降甚至大于给基线加MTP),并以此论证概念级监督与token级多位置监督的本质区别。

投机解码与平均接受长度 (MAL)

投机解码用小起草模型一次提出多个token,由目标模型并行验证后接受,加速取决于每轮接受的token数;块并行起草器(如DFlash2)一次提议整块token进一步降低延迟。效率用平均接受长度 $MAL=\frac{1}{R}\sum_r c_r$ 衡量,$c_r$ 为第 $r$ 轮接受的token数。

本文展示把概念表征注入DFlash2起草器(仅加0.04M参数)可让MAL从5.933提升到6.180(+4.17%),证明学到的潜空间在推理期也有实用价值。

研究动机

标准NTP的训练信号完全局限在单个token上:以OLMo-3-7B为例,它要在5.73T token的Dolma-3语料上完成预训练,代价极其高昂,而模型内部形成的高层语义抽象(概念、世界知识的潜表示)只是逐token交叉熵的副产品,没有任何显式目标引导语义结构如何跨多token展开。已有潜空间方案各有短板:Hourglass、MegaByte采用固定层级或固定字节块;BLT、H-Net做动态分块但只改变计算粒度;Large Concept Model在外部句子嵌入空间做连续回归,目标空间由单独编码器定义、容易自由漂移;Multi-Token Prediction虽然监督多个未来位置,损失却仍绑定在表层token上。换言之,社区一直缺乏一个『在模型内部学习、结构化、且能与NTP联合扩展到万亿token』的概念级训练目标,以及它在真正大规模上的可行性证据。

本文的目标是本文的目标是把『潜空间预测』从辅助技巧提升为基础模型的架构蓝图,并给出最大规模的可行性验证。具体而言:基于OLMo-3-7B骨干构建8.9B参数的NCP-ArchPreview,在完全相同的Dolma-3数据(Stage-1用Dolma 3 Mix、Stage-2用Dolmino)上联合NTP与NCP训练5.73T token,回答三个问题——概念级目标能否降低训练损失、加速收敛;增益是否来自潜空间架构本身而非参数或计算量增加;学到的概念空间在预训练结束后是否还有用(轻量域适配、加速投机解码)。同时按OLMo协议评测30个基准家族,并开源全部中间检查点与训练配方。

与已有工作不同的是,本文的独特切入角度有三点。第一,概念词表不是来自外部编码器,而是用乘积量化直接从模型自身隐状态中学出,预测目标被约束在这个结构化的离散空间内;第二,预测方式既不是自由连续回归(LCM式,目标无约束易漂移),也不是不可导的argmax/采样,而是对码字分布取期望得到的可导加权组合,兼顾结构约束与端到端训练;第三,与直接基础ConceptLM(从零训练不超过1.5B参数、另在8B模型上做继续预训练)不同,本文首次让NCP从预训练第一步就生效,在8.9B参数、5.73T token上完整走完Stage-1与Stage-2课程,并配合MUDDFormer式分层残差(IRC+CRC)实现跨层、跨模块的信息路由,这是迄今潜空间语言模型最大规模的演示。

核心方法

直觉上,模型在每个位置不仅要『猜下一个词』,还要『猜接下来4个token共同表达的概念』:概念级目标迫使编码器组织出可预测的高层语义,预测的概念又反馈回来辅助token预测,输出端保持与标准自回归解码完全一致。技术上,32层Transformer拆成16层Token Encoder、8层Concept Module、16层Token Decoder:Encoder输出 $h_{1:T}$,每 $k=4$ 个隐状态平均池化为连续概念 $c_m$;VQ模块(32码本×128条目×128维)把概念切成32段分别量化;Concept Module读取概念历史 $c_{<m}$,对每段输出softmax分布 $\pi_m^s$,以码字加权和 $\hat{c}_m^s=\sum_n\pi_{m,n}^s e_n^s$ 得到可导概念预测;预测概念重复 $k$ 次、因果平移 $\Delta=k$ 后残差注入token流 $\tilde{h}_t=h_t+b_t$,由Decoder输出token分布。总损失 $\mathcal{L}_{total}=\mathcal{L}_{NTP}+\alpha\mathcal{L}_{NCP}+\beta\mathcal{L}_{VQ}$ 端到端优化,IRC/CRC分层残差让信息跨层跨模块流动。模型约8.94B参数、上下文8192,用Moonlight Muon(学习率 $6\times10^{-5}$)训练。

核心创新是把『从自身隐状态学出的离散概念词表』变成一级预测目标,这在三点上与已有方法有本质区别。与LCM等连续潜空间方法相比:NCP的预测空间不是外部编码器定义的自由连续空间,而是模型内部联合学出的结构化码本,MSE回归被约束在『码字的线性组合』内,避免了目标自由漂移、不知道什么输出才算合法概念的问题。与MTP相比:MTP只是把token级监督复制到更多未来位置,NCP则在每个概念位置(覆盖4个token)提供跨token依赖的显式监督,粒度完全不同。与VQ-VAE式离散方法相比:NCP不采样、不argmax,而是用分布期望加权码字,保持预测路径全程可导,无需直通估计器。梯度设计也很讲究:带stop-gradient的 $\mathcal{L}_{VQ}$ 只移动码本、不干扰编码器;$\mathcal{L}_{NCP}$ 的目标 $c_m$ 被detach,编码器只通过历史概念 $c_{<m}$ 接收NCP梯度,从而学会保留对预测下一概念有用的信息;而 $\mathcal{L}_{NTP}$ 为全模型提供密集监督,保证标准自回归能力不被破坏。

方法步骤详情

步骤1(编码):$x_{1:T}$ 经Token Encoder得 $h_{1:T}$。步骤2(池化):$c_m=\frac{1}{k}\sum_{i=1}^{k}h_{(m-1)k+i}$,每 $k=4$ 个状态压成一个概念,长度变为 $M=\lfloor T/k\rfloor$。步骤3(量化):$c_m$ 切成 $S=32$ 段,各段取最近码字 $n_m^s=\arg\min_n\|c_m^s-e_n^s\|^2$,拼接得 $d_m$,组合空间达 $128^{32}$。步骤4(VQ损失):$\mathcal{L}_{VQ}=\frac{1}{MS}\sum\|sg(c_m^s)-d_m^s\|^2$ 只更新码本。步骤5(概念预测):$u_m=\text{ConceptModule}(c_{<m})$,各段softmax头给出 $\pi_m^s$,可导预测 $\hat{c}_m^s=\sum_n\pi_{m,n}^s e_n^s$。步骤6(NCP损失):$\mathcal{L}_{NCP}=\frac{1}{M-1}\sum_{m=2}^{M}\|\hat{c}_m-sg(c_m)\|^2$,目标停梯度。步骤7(注入):$\hat{c}$ 重复 $k$ 次、按 $\Delta=k$ 因果平移得 $b_t$($t<\Delta$ 时为0防信息泄漏),融合 $\tilde{h}_t=h_t+b_t$。步骤8(token预测):$\mathcal{L}_{NTP}=-\frac{1}{T-1}\sum_t\log p_\theta(x_{t+1}|\tilde{h}_{\le t})$,三损失联合端到端。残差方面:IRC用MLP从块输出 $R_s^\ell$ 生成可带符号的非归一化系数 $w_s^\ell$,对各深度候选加权,初始化等价标准残差;CRC用 $\alpha_{s\leftarrow u}^\ell=\text{softmax}(\text{MLP}(T_s^\ell))$ 对源模块各层加权、经对角缩放后注入目标流,设Encoder→CM、Encoder→Decoder、CM→Decoder三条通路。

技术新颖性

技术新颖性体现在四个层面。规模层面:这是迄今最大的潜空间语言模型实验(8.9B参数、5.73T token),首次证明概念级目标在万亿token从头预训练中稳定可行,而ConceptLM只做到1.5B从零+8B继续预训练。表示层面:用乘积量化(32段×128码字)在容量与预测难度间取得平衡——单个码本只有128条目,softmax分类可行,组合空间 $128^{32}$ 又足够表达丰富概念,这比单一巨型码本更易训练。可导性层面:『分布期望加权码字』的预测形式是一个干净的设计,既避免离散采样的不可导问题,又保留离散空间的结构约束,介于自由连续回归和硬量化之间。信息路由层面:IRC采用非归一化、可带符号的组合系数(区别于DenseFormer的输入无关权重和AttnRes的全softmax),保留单隐流、初始化即标准Transformer;CRC则做目标条件化的跨模块深度选择,且跨粒度通路通过对角缩放和小值初始化保证训练起点贴近原始骨干。此外,论文还贡献了有普适价值的工程发现:Muon全矩阵更新与逐层Q/K归一化耦合会导致少数注意力头主导、logit爆炸,逐头Q/K归一化可有效抑制。

Overview of NCP-ArchPreview.
Figure 2: Overview of NCP-ArchPreview.
Numerical instabilities observed when using the OLMo-3-7B layer-wise Q/K normalization.
Figure 5: Numerical instabilities observed when using the OLMo-3-7B layer-wise Q/K normalization.
Ablation of the numerical instability.
Figure 6: Ablation of the numerical instability.

实验结果

(1)Stage-1损失(图1a):相同5.73T token上损失差距扩大至0.091,仅用51.3% token即达到OLMo-3-7B最终损失,收敛快1.95×。(2)Stage-2(图1b):最终损失再低0.027,66.2% token追平,1.51×加速且波动更小。(3)下游(表1):Stage-1宏平均46.59→49.04(+2.45),GSM8K +5.99、MATH类+3.75、MC-Non-STEM +4.63(PiQA +8.60)、MMLU +2.58;Stage-2宏平均仅+0.59,代码类-0.65(HumanEval -3.69)。(4)消融(图3、表2):+CM→+Residual→+NCP逐级降损,完整模型以34/40=85%计算逼近40层参数对齐基线。(5)分层残差(表3):IRC+CRC降损0.0323(+0.051% FLOPs),优于Block AttnRes的-0.0180。(6)Scaling law(图4):1.74×计算效率。(7)数值稳定性(图5/6):逐头Q/K归一化抑制Muon下的logit爆炸。(8)VQ域适配(表4-7):仅17M参数,代码+2.65且四项全升,数学+4.27超LoRA的+3.15,TriviaQA +9.19低于Full的+18.00;吞吐15,632 tokens/s/GPU为LoRA的1.50×、全量的2.02×,显存32.4%。(9)MTP协同(表8、图8):NCP降损0.0098大于基线加MTP的0.0065,NCP+MTP共降0.0141且FLOPs更少,交叉在更新2,285。(10)投机解码(表9):MAL 5.933→6.180(+4.17%),HumanEval最大+7.59%。

Downstream performance grouped by task domain.
Table 1: Downstream performance grouped by task domain.
Model configurations under parameter- and computation-aligned settings.
Table 2: Model configurations under parameter- and computation-aligned settings.
Ablation of hierarchical residual connections on the 1B-scale NCP-ArchPreview model after 150B training tokens.
Table 3: Ablation of hierarchical residual connections on the 1B-scale NCP-ArchPreview model after 150B training tokens.
Parameters of the three training strategies.
Table 4: Parameters of the three training strategies.
Code adaptation from Stage-1 across four programming benchmarks, together with performance retained on general benchmarks.
Table 5: Code adaptation from Stage-1 across four programming benchmarks, together with performance retained on general benchmarks.
Mathematics adaptation from the corresponding Stage-1 checkpoints on GSM8K and MATH-500, with general benchmarks measuring retained capabilities.
Table 6: Mathematics adaptation from the corresponding Stage-1 checkpoints on GSM8K and MATH-500, with general benchmarks measuring retained capabilities.
Results after knowledge adaptation, initialized from the corresponding Stage-1 checkpoints.
Table 7: Results after knowledge adaptation, initialized from the corresponding Stage-1 checkpoints.
Comparison of residual-aligned OLMo-3-3B variants and the 3B-scale NCP-ArchPreview model.
Table 8: Comparison of residual-aligned OLMo-3-3B variants and the 3B-scale NCP-ArchPreview model.
Mean accepted length on the evaluation set.
Table 9: Mean accepted length on the evaluation set.
Comparison of training dynamics between OLMo-3-7B and our NCP-ArchPreview during pretraining Stage-1 and Stage-2.
Figure 1: Comparison of training dynamics between OLMo-3-7B and our NCP-ArchPreview during pretraining Stage-1 and Stage-2.
Training-loss ablation of NCP-ArchPreview over the first 200B training tokens.
Figure 3: Training-loss ablation of NCP-ArchPreview over the first 200B training tokens.
The scaling law curves for OLMo-3 and NCP-ArchPreview.
Figure 4: The scaling law curves for OLMo-3 and NCP-ArchPreview.
Training speed and per-GPU memory usage for full training, LoRA, and VQ training.
Figure 7: Training speed and per-GPU memory usage for full training, LoRA, and VQ training.
NTP loss over the first 150B training tokens, smoothed with a 200-update exponential moving average.
Figure 8: NTP loss over the first 150B training tokens, smoothed with a 200-update exponential moving average.
查看结构化数据
任务指标本文基线提升
Stage-1 预训练损失收敛 达到基线最终损失所需训练token比例 51.3% OLMo-3-7B 100% 1.95× 收敛加速(最终损失低0.091)
Stage-2 预训练损失收敛 达到基线最终损失所需token比例 66.2% OLMo-3-7B 100% 1.51× 收敛加速(最终损失低0.027)
下游任务宏平均(Stage-1) 30个基准宏平均(%) 49.04 OLMo-3-7B 46.59 +2.45
GSM8K(Stage-1) 准确率(%) 45.26 39.27 +5.99
MATH 类平均(Stage-1) 四项数学基准平均(%) 24.54 20.79 +3.75
PiQA(Stage-1) 准确率(%) 80.85 72.25 +8.60
下游任务宏平均(Stage-2) 宏平均(%) 57.57 56.98 +0.59(代码类 -0.65)
计算对齐消融(200B token) 训练损失 34块计算(85%)逼近40块参数对齐基线 Vanilla computation-aligned(34块)/ size-aligned(40块) 显著优于两种对齐基线
Scaling law compute-optimal 验证损失 1.74× 计算效率 OLMo-3 1.74×
代码域适配(Stage-1起点) HumanEval/+/MBPP/MBPP+平均 +VQ 32.69(+2.65,四项全升) +LoRA 31.38;+Full 28.43 较LoRA +1.31、较Full +4.26
数学域适配 GSM8K+MATH-500平均 +VQ 34.83(+4.27) +LoRA 33.71;+Full 36.72 超LoRA 1.12分且通用平均不降(+0.39)
3B规模MTP对比(150B token) 平均LM损失(相对残差对齐基线) NCP -0.0098;NCP+MTP -0.0141 基线+MTP -0.0065 NCP增益大于加MTP,且FLOPs更少
块并行投机解码 平均接受长度 MAL 6.180(+0.04M参数注入概念) DFlash2/DFlare组合基线 5.933 +4.17%(HumanEval +7.59%)

局限与改进

作者承认两点局限。其一,未包含长上下文训练,只在标准上下文长度完成5.73T预训练与100B中期训练,而概念通路在压缩序列上运作,长上下文可能是潜空间建模最有利的场景。其二,损失优势向下游的转化依赖训练分布:Stage-1宏平均+2.45,Stage-2只剩+0.59且基准间波动,还观察到Stage-2三个配置(V1-V3)损失递减、下游反而递减的反常,说明单看交叉熵不足以指导检查点选择。我的补充观察:一是模型40块约8.94B参数,比32块的OLMo-3-7B多约25%参数,纯效率比较只有compute-aligned(34块)一档,且分层残差的分析FLOPs未计源状态物化与显存开销;二是概念分块固定 $k=4$、与语义边界无关,未借鉴BLT/H-Net式动态分块;三是VQ适配无法改写骨干FFN中的事实记忆,TriviaQA增益(+9.19)不到全量训练(+18.00)的一半;四是主结果仍保留与Muon相互不稳定的逐层Q/K归一化(为保对照公平),可能低估架构潜力;五是Stage-2代码回退(HumanEval -3.69)暴露混合分布拟合与单域能力的冲突。

独立分析的弱点

第一,下游转化率随阶段衰减:Stage-1增益2.45分到Stage-2缩水至0.59分,代码类回退(HumanEval -3.69、BigCodeBench -1.16),削弱了『省预算换能力』的卖点;改进方向是能力感知的逐域数据配比搜索,而非整体混合拟合。第二,参数与显存代价:参数从约7B增至8.94B(+25%),部署成本更高,可考虑Concept Module与Decoder共享权重或对其剪枝蒸馏。第三,VQ适配天花板:冻结骨干无法编辑事实记忆(TriviaQA +9.19 vs Full +18.00),可设计VQ+LoRA混合方案,让概念通路管格式与推理风格、低秩分支管事实改写。第四,固定分块 $k=4$:代码与自然语言的最优粒度可能不同,可引入输入自适应的段边界预测或可学习分块器。第五,稳定性工程:主实验为对照公平保留了不稳定的逐层Q/K归一化,主结果可能低估潜力,应在主配方中直接采用逐头归一化重跑对照。第六,评测口径:下游限于OLMo协议的英文基准,缺少多语言、指令跟随与长文本任务,概念级目标在这些域的表现未知。

未来方向

作者提出的方向包括:把架构扩展到长上下文训练(概念压缩序列在长依赖上应有天然优势);探索更好的中期训练配方与能力感知的数据选择代理指标(附录C方向);设计结合语言建模损失、下游与代理评测的检查点选择准则,以解决『损失降、下游不升』的错配。基于本文成果可自然延伸的方向还有:动态概念分块,让段边界随输入语义自适应,统一BLT/H-Net与NCP两条路线;概念空间的解释性与可控性研究——离散码本天然适合做概念级探针、定位与编辑,可用于可解释AI和模型手术;把NCP与MTP的叠加推广为系统的多粒度监督框架,并直接用于投机解码(本文已证明概念信号提升MAL 4.17%,可进一步让起草器在概念空间自回归起草整块);在指令微调与RLHF阶段保留概念通路,检验其对推理类能力的增益是否在对齐后保持;以及向多模态扩展,概念词表或可桥接文本与视觉token的语义层级,实现语言版Latent Diffusion式的效率红利。

复现评估

开源情况很好:权重发布在HuggingFace集合(ArchSpace-Collection/ncp-archpreview),含Stage-1每100,000步中间检查点、对应投机起草器、最终Stage-1与Stage-2检查点;推理支持在InternLM/lmdeploy,评测代码在LUMIA-Group/ncp_olmo_eval;论文声称发布训练配方与推理脚本,数据为完全公开的Dolma-3,评测沿用OLMo-Core协议(附录E给出完整任务与prompt配置)。复现门槛分层明显:完整复现主结果需在8.9B参数上训练5.73T token,是数千GPU天量级的投入,只有大型机构可行;但多数科学结论有低成本验证路径——1B/3B消融只需150B-200B token(图3、表3、表8),VQ域适配从公开Stage-1检查点出发仅训17M参数,8卡节点即可完成(吞吐15,632 tokens/s/GPU、显存32.4%),投机解码注入仅加0.04M参数。总体:权重、代码、数据、配方齐备,验证性复现难度中等,从头复现难度极高。