← 返回 2026-08-19

基于层级语言模型的动态多字节预测 Dynamic Multi-Byte Prediction With Hierarchical Language Models

Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar 📅 2026-08-16 👍 18 2026-08-24 18:30
多Token预测 字节级语言模型 层级架构 投机解码 推理加速

用边界感知的LCA掩码让层级字节模型单头并行预测多字节,加速推理且性能基本不掉。

前置知识

字节级语言模型

直接以原始UTF-8字节为输入输出的语言模型,不使用BPE等子词分词器。优点是无分词器假设、可表示任意文本、对稀有词和跨语言场景更公平(代表工作有ByT5、MegaByte、BLT);缺点是字节序列比子词序列长数倍,注意力计算与自回归解码都更慢。

本文的全部动机建立在字节模型表示自由但解码慢的矛盾上,理解字节级建模的成本结构才能明白为什么需要多字节并行预测。

层级字节模型与潜在token

先用边界预测器把字节流切成可变长片段,池化成更短的潜在token序列,在其上做深层Transformer计算,再上采样回字节层(如BLT、H-Net、FlexiTokens)。压缩率指字节数与潜在token数之比,本文固定为3倍。

LCA-MBP直接构建在FlexiTokens架构上,核心思想是把潜在token从压缩单元升格为并行生成单元,不懂层级结构就无法理解片段对齐的变长预测窗口。

多Token预测(MTP)

训练模型在一次前向中并行预测未来n个token而非1个。经典实现(Medusa、Gloeckle等)为每个未来位置配独立预测头,损失为各位置交叉熵的加权和;可提升样本效率,也可配合投机解码加速生成。

本文的MBP是MTP在字节层级的重构:用单个LCA掩码头替代n个头,对比理解两者差异是把握论文贡献的关键。

投机解码

由快速草稿模型一次提出多个候选token,再用目标模型一次前向并行验证,接受的前缀与目标模型直接采样的分布完全一致,从而在不改变输出的前提下加速推理(Leviathan等,2023)。

论文用两种候选接受策略评估MBP:概率阈值接受(可能改变输出)与投机解码验证(输出分布不变),这是解读Figure 5与Figure 6结论差异的前提。

因果注意力掩码

自回归Transformer中阻止位置i注意位置j>i的掩码,保证训练与推理的因果一致性。LCA掩码是其片段级推广:同片段内允许互相注意,片段之间仅允许看紧邻的前一片段。

LCA掩码是论文最核心的技术构件,它的片段内双向加相邻片段可见的设计既保住因果性又实现并行,是全文创新的落点。

研究动机

子词分词是现代语言模型的主流设计,但固定词表带来三个实际问题:稀有词被过度碎片化、编码语言与文字特有的偏差、在跨领域/非英语/词汇演化场景下泛化差。字节级建模直接操作原始字节,可消除分词器假设并表示任意文本,但字节序列远长子词序列,Transformer注意力开销剧增,且自回归解码逐字节进行,推理速度成为硬瓶颈。层级字节模型(BLT、H-Net、FlexiTokens)用启发式或可学习的边界预测器把字节流压缩成更短的潜在token序列,降低了表示与计算成本,但推理阶段仍是一个字节一个字节地生成,解码瓶颈并未解决。与此同时,把MTP加速技术直接套到字节层级会遇到障碍:每个未来位置需要独立预测头,参数随候选数线性增长,且固定偏移预测无视字节序列局部结构的可变性——有的区域作为整块高度可预测,有的区域需要细粒度顺序建模。

本文的目标是本文目标是让层级字节级语言模型在推理时一次前向并行生成多个字节,在不增加任何参数、几乎不损失下游性能的前提下显著提高吞吐。具体做法是提出多字节预测(MBP)范式:把层级模型边界预测器学到的可变长潜在token(片段)当作并行生成的天然单元,用一个配备边界感知注意力掩码(LCA)的多字节解码器替代传统MTP的n个独立预测头。作者设定的成功标准是:在指令跟随(IFEval)、问答(CoQA)、摘要(CNN/DailyMail)和机器翻译(Opus-100)四类生成任务上达到性能-吞吐的Pareto最优权衡;在概率阈值接受与投机解码验证两种策略下都能工作;并能作为外挂起草器加速其他层级基线。实验模型为373M参数,在FineWeb-edu的50B字节上预训练,使用4块NVIDIA B200。

与已有工作不同的是,独特切入角度在于对潜在token用途的重新定义。此前层级模型(BLT、H-Net、FlexiTokens)只把潜在token当作压缩表示:先压缩输入、处理短序列、再解码回字节,推理仍是逐字节自回归;而MTP方法(Medusa、Gloeckle、EAGLE、Hydra)依赖逐位置独立预测头和固定偏移窗口。本文首次把学到的字节片段同时用作压缩单元和多字节并行生成单元,用单头加LCA掩码实现变长、片段对齐的预测,消除逐token头的参数开销。方法论上,作者还系统比较了概率阈值接受与投机解码验证两种候选接受策略,并展示LCA可作为起草器与外部FxT验证器组合,以2.1-2.3倍加速且质量持平——这与并发的FastBLT(独立训练边界预测器的扩散语言建模)形成清晰的路线差异。

核心方法

直觉上,层级模型的边界预测器已经把文本切成语义连贯的可变长片段,片段内字节高度可预测,因此可以一次并行生成整个片段,而非固定偏移地猜n个字节。技术路线基于FlexiTokens四模块架构并加以改造:编码器(2层)对字节序列$x_{1:T}$做因果注意力得到$h_e$;边界预测器输出边界概率$\hat{B}\in[0,1]^T$,经Gumbel Sigmoid采样离散边界,均值池化得到潜在序列$h_\downarrow$,压缩率3倍,由$\mathcal{L}_{BP}=\max(k/T-\alpha,0)+\max(\beta-k/T,0)$控制($\beta=0.261,\alpha=0.333$);LM模块(16层)对前移一位(学习到的[BOS])的潜在序列计算得$h'\downarrow$再上采样;解码器拆成下一字节头与MBP头,共享unembedding矩阵。MBP头为2层Transformer,输入是上采样后的LM输出加残差,用LCA掩码并行预测一个片段内的全部字节。整个模型373M参数,以总批量1048576字节/步预训练1个epoch。

核心创新是Latent Causal Attention(LCA)掩码。MBP头中每个查询字节允许注意:自己、同片段内更早位置、以及紧邻前一片段的全部字节;同片段更后的位置和更远的过去全部被屏蔽。因果性为何不被破坏?因为LM模块用[BOS]把潜在序列前移了一位,片段内每个字节位置的输入都只是前一个潜在token表示的重复加残差,不含本片段的未来信息,所以片段内互相注意在推理时不泄露任何未来。与已有方法的本质区别:MLP-MBP用n个独立MLP头从同一共享隐状态各自预测,条件独立假设使其预测高置信但常错(字节接受率61.91%-65.01%但下游质量差);LCA用Transformer层让每个候选字节以前一片段上下文及其片段内位置为条件,接受率虽低(45.95%-51.68%),端到端质量却更高、落在Pareto前沿。此外单头设计使参数量不随候选数n增长,n可在推理时自由调整。

方法步骤详情

训练:(1)编码器计算$h_e$,缓存残差$r_1=h_e$;(2)边界预测器输出边界概率,Gumbel采样后均值池化得$h_\downarrow$,缓存残差$r_2=h_\downarrow$;(3)LM模块处理前移一位的$h_\downarrow$得$h'\downarrow$;(4)上采样后加$r_1$过下一字节解码器(2层)预测$x_{t+1}$;(5)MBP头(2层)输入为上采样($h'\downarrow+r_2$),经LCA掩码预测右移两位的目标字节。总损失为$\mathcal{L}_{LM}+\lambda_2\mathcal{L}_{BP}$,其中$\mathcal{L}_{LM}=-\lambda_0\sum_t\log P_\theta(x_{t+1}\mid x_{1:t})-\lambda_1\sum_t\log P_\theta(x_{t+2}\mid x_{i:t})$,$\lambda_0=\lambda_1=1,\lambda_2=10$。推理(Algorithm 1):提示过编码器并缓存残差;仅当边界为1或无缓存时才运行LM模块,否则复用缓存;下一字节头输出总被接受;MBP头复制最后潜在token生成候选,自左向右接受$P_\theta\ge\tau$者(默认$\tau=0.9,n=3$),首个低于阈值者及其后全部丢弃。

技术新颖性

技术新颖性有四点。(1)范式转换:把层级模型的潜在token从压缩表示升格为并行生成单元,多字节预测窗口与边界预测器学到的片段天然对齐,取代所有固定偏移MTP(Medusa、EAGLE、Gloeckle等)的静态视界。(2)结构创新:LCA掩码让单个共享Transformer头完成多字节预测,通过片段内双向加仅见紧邻前片段的注意力模式在数学上保证因果性,去掉逐token头的参数开销,且推理时复制最后潜在token即可改变n,而MLP-MBP的头数被固定在训练时刻。(3)接受机制分析完整:概率阈值接受下最优n是任务相关的(翻译峰值n=7约+3点,DailySum峰值n=6,+2.11点);投机解码验证下性能按构造不变,n成为纯粹的吞吐旋钮(增益+29%-37%)。(4)通用性:LCA可作为外挂加速器,同尺寸FxT验证下质量持平且加速2.1-2.3倍,暗示任何层级字节模型都能配一个LCA对应物获益;这与FastBLT的扩散式加速路线不同。

Overview of the MBP architecture
Figure 1: Overview of the MBP architecture
The Latent Causal Attention (LCA) mask
Figure 2: The Latent Causal Attention (LCA) mask

实验结果

(1)Pareto前沿:Figure 3中LCA-MBP在IFEval、CoQA、CNN/DailyMail摘要三个任务上位于六方法吞吐-性能平面的前沿;es-en翻译上FxT/Eff-FxT的COMET略高但吞吐显著更低;预训练语料不含翻译数据仍能迁移,说明多字节结构可泛化到非英语生成。(2)接受率悖论:Table 1中MLP-MBP字节接受率更高(61.91%/63.45%/58.08%/62.67%/65.01%)但下游质量不如LCA-MBP(45.95%/46.62%/48.89%/51.68%/49.74%),归因于MLP头的条件独立假设。(3)τ消融:$\tau$从0.9降至0.7,平均接受率50.1%升至56.7%,吞吐增约10%,性能降约3点,$\tau=0.75$为均衡点。(4)投机解码:性能恒定,吞吐随n单调增,n从3到7-8增益+29%-37%,LCA全面超过MLP-MBP(如CoQA 22.11对20.85、DailySum 38.09对32.73;平均接受率73.20%对87.28%)。(5)外接验证:LCA+FxT验证在DailySum/es-en/fr-en分别加速2.29/2.18/2.19倍且质量持平($n=7$)。(6)$n=6$时每步平均接受3.05个候选,15%的步全收,首个解码步无候选被接受。

Byte acceptance rates of MLP and LCA multi-byte prediction heads across five downstream tasks
Table 1: Byte acceptance rates of MLP and LCA multi-byte prediction heads across five downstream tasks
Architectural configurations used across model variants
Table 2: Architectural configurations used across model variants
Throughput (bytes/sec) of LCA-MBP across speculative-candidate counts n ∈ {3,4,5,6,7} at acceptance threshold τ = 0.75
Table 3: Throughput (bytes/sec) of LCA-MBP across speculative-candidate counts n ∈ {3,4,5,6,7} at acceptance threshold τ = 0.75
Performance and acceptance rate under speculative decoding acceptance
Table 4: Performance and acceptance rate under speculative decoding acceptance
Token acceptance rates (%) across three tasks under self and external (FxT) verification using n = 7 candidate bytes
Table 5: Token acceptance rates (%) across three tasks under self and external (FxT) verification using n = 7 candidate bytes
Performance vs. throughput across four downstream tasks
Figure 3: Performance vs. throughput across four downstream tasks
Ablation on the acceptance threshold
Figure 4: Ablation on the acceptance threshold
Performance vs. Candidates (n at τ = 0.75.)
Figure 5: Performance vs. Candidates (n at τ = 0.75.)
Throughput vs. candidates n under speculative decoding acceptance
Figure 6: Throughput vs. candidates n under speculative decoding acceptance
Distribution of accepted speculative bytes over 100 decoding steps
Figure 7: Distribution of accepted speculative bytes over 100 decoding steps
Throughput vs. performance across four inference strategies
Figure 8: Throughput vs. performance across four inference strategies
Performance vs. throughput on French–English translation
Figure 9: Performance vs. throughput on French–English translation
查看结构化数据
任务指标本文基线提升
指令跟随(IFEval) loose accuracy LCA-MBP约44.97-45.95,位于Pareto前沿 MLP-MBP 46.54(投机解码)但吞吐更低;FxT性能相近但吞吐显著低 相近性能下吞吐最高
对话问答(CoQA) F1 LCA-MBP 22.11(投机解码)/46.62接受率 MLP-MBP 20.85 +1.26 F1,吞吐更高
摘要(CNN/DailyMail) ROUGE LCA-MBP 38.09(投机解码) MLP-MBP 32.73;FxT约38-40但吞吐约低一半 比MLP-MBP +5.36 ROUGE,位于Pareto前沿
西班牙语-英语翻译(es-en) COMET LCA-MBP 0.8147(投机解码);FxT验证下2.18倍加速且质量持平 MLP-MBP 0.8178;FxT 0.822 质量持平时加速2.18倍
法语-英语翻译(fr-en) BLEU/COMET LCA-MBP位于Pareto前沿(附录Figure 9 BLEU显著高于MLP-MBP);FxT验证下2.19倍加速 MLP-MBP;FxT 相近吞吐下BLEU显著更高;质量持平时加速2.19倍

局限与改进

作者承认的局限:(1)仅在373M参数、50B字节FineWeb-edu单一规模上实验,增益是否随规模保持是未验证的开放问题;(2)评测集中于英语中心任务,未覆盖低资源和形态丰富的语言,尽管LCA的分词行为直接继承边界预测器、理论上无需架构改动即可迁移;(3)阈值接受下投机视界n是任务相关的,带来小调参成本(投机解码验证下消失)。我的补充观察:阈值接受下接受率仅约46%-52%,意味着过半候选被拒;加速收益依赖batch=1的单块B200墙钟测量,其他硬件与批大小配置未验证;翻译成绩来自在无翻译数据的预训练语料上轻量微调,多语言泛化证据仍较薄弱;层级结构中边界预测器的错误会在推理时级联影响片段划分与MBP质量,论文未做边界质量的误差分析;与FastBLT等并发方法只有定性讨论、无直接实验对比。

独立分析的弱点

(1)规模外推风险:373M/50B字节的结论未必保持到数十亿参数,层级结构的收益曲线可能随规模改变;改进方向是与BLT/H-Net的公开大规模训练接轨复验。(2)全局固定阈值τ:概率阈值接受对代码、数学等高风险生成可能引入连锁错误,且阈值与位置无关;可按片段熵或边界置信度自适应调节τ。(3)固定3倍压缩率:最优压缩率随语言和域变化(Ahia等2024的工作表明分词率影响多语言公平性),恒定压缩率可能伤害某些语言;可让压缩率动态化并与MBP联合优化。(4)外接验证的双模型开销:LCA+FxT验证需要两个同尺寸模型同时驻留显存,2.1-2.3倍加速以近双倍显存为代价;可通过跨模型KV缓存共享、量化或蒸馏验证器降低成本。(5)训练成本分析缺失:论文报告推理加速但未报告MBP目标对预训练FLOPs和收敛速度的影响,$\lambda_1=2$的SFT权重也只给出经验值。

未来方向

作者提出的方向:在更大模型规模上验证增益;把评测扩展到低资源和形态丰富语言;借助投机解码验证消除n的任务相关性调参成本。基于成果可延伸:研究LCA对预训练样本效率的影响(MTP在子词模型上已被证明改善样本效率,Gloeckle等2024);把LCA移植到H-Net、BLT等其他层级架构并开源通用实现;按局部困惑度或信息量动态调整片段粒度与候选数n,实现难处慢、易处快的自适应解码;与树形草稿、EAGLE式特征层验证等投机解码生态结合;探索边界预测器与MBP头的联合训练目标,直接优化整片段接受率;在流式与长上下文场景检验Eff-FxT式LM模块缓存复用与LCA的组合效果。代码承诺发布于github.com/skai-research/lca-multibyte。

复现评估

复现要素披露较完整:架构(373M、$d_{model}=1024$、$d_{inner}=4096$、上下文4096、8头/8KV头)、层分配(Table 2逐方法列出)、训练超参(学习率3e-4余弦调度、Adam $\beta_1=0.9$/$\beta_2=0.999$、梯度裁剪0.25、批量1048576字节、warmup 2000步、压缩率3倍即$\beta=0.261$/$\alpha=0.333$、$\lambda_0=\lambda_1=1$、$\lambda_2=10$、1 epoch)在正文和附录A给出;数据集全部公开(FineWeb-edu、Tulu-3 SFT、Opus-100、CNN/DailyMail、CoQA、IFEval);评测协议明确(温度0.7/top_p 0.9仅用于IFEval,其余贪心;默认$\tau=0.9$、$n=3$;单块B200、batch=1)。主要门槛是算力:预训练用4块NVIDIA B200,从零复现成本高;若有checkpoint,评测与微调单卡即可。代码承诺开源于github.com/skai-research/lca-multibyte但撰写时未见确认,综合判断为中高难度复现。