← 返回 2026-08-05

ARCHead:大语言模型输出头的激活度量残差校正压缩 ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel 📅 2026-08-03 👍 6 2026-08-10 18:30
LM头压缩 低秩近似 大语言模型部署 模型量化 激活感知量化

压缩大模型量化后残留的BF16输出头,存储降3.7-3.9倍且几乎无损

前置知识

权重后训练量化(Weight-only PTQ)

后训练量化(PTQ)是在不重新训练的前提下,把模型权重从高精度(如 BF16)压缩到低比特(如 INT4/INT8)的技术。GPTQ 利用二阶 Hessian 信息逐层顺序量化权重,AWQ 保护对激活敏感的通道,bitsandbytes NF4 用正态分布 4 比特码本表示权重。这些方法主要压缩 transformer block 内的线性层(注意力和 MLP),权重在推理时按需反量化。

理解这些主流块量化方法,才能明白它们为何会留下一个未量化的稠密 LM-head,而这正是 ARCHead 要解决的缺口。

语言建模头(LM-head)

LM-head 是 transformer 最后一层之后将隐状态映射到词表 logits 的输出投影,权重 $W \in \mathbb{R}^{V \times D}$(V 为词表大小,D 为隐维度)。它把最终隐状态 $h \in \mathbb{R}^{D}$ 映射成每个词的 logit $hW^{\top}$,再送 softmax 得词分布。与 block 内部线性层不同,LM-head 误差后面不接归一化、残差或可学习变换,而是直达 softmax。

LM-head 这种『直达 softmax、无后续修复』特性使其误差影响极大;大词表模型下它的存储也很可观,这正是论文动机的核心。

权重空间 vs 激活空间重建误差

朴素低比特量化最小化权重空间 Frobenius 误差 $\|W - \hat{W}\|_F^2$,把每个隐维度等同看待。但真实困惑度损失取决于激活分布:最终隐状态是各向异性的,沿频繁激活方向的微小误差会扰动大量词表 logit,而沿几乎不激活方向的较大误差影响很小。正确目标应是基于隐状态分布的期望输出误差 $\frac{1}{N}\|H\Delta^{\top}\|_F^2 = \mathrm{Tr}(\Delta C \Delta^{\top})$,其中 $C = H^{\top}H/N$。

这是整篇论文最核心的洞见:用激活派生的度量加权残差校正,而非权重空间均匀重建。不懂这一点就无法理解激活度量校正为何有效。

Eckart-Young-Mirsky 定理

Eckart-Young-Mirsky 定理指出,对给定矩阵,在所有秩不超过 $r$ 的矩阵中,使其 Frobenius 范数逼近误差最小的,正是该矩阵的截断 SVD $U_r \Sigma_r V_r^{\top}$,这是低秩近似的基本最优性结论。ARCHead 通过变量代换 $\tilde{B} = B T_p$ 把带度量的问题 $\|(E - AB)T_p\|_F^2$ 化为标准 Frobenius 问题,直接套用该定理得到条件最优解。

这是论文校正阶段条件最优性的理论基石,理解它才能读懂为何激活度量下的截断 SVD 是该度量下的最佳秩-r 校正。

研究动机

GPTQ、AWQ、bitsandbytes NF4 等后训练量化方法在工程实现上聚焦于 transformer block 权重,却几乎总是把最终语言建模头(LM-head)以 BF16/FP16 原样保留。对于大词表模型这一缺口尤其突出:Qwen3-8B-Base 和 Gemma-4-E4B 的 BF16 输出投影分别占用约 1.18 GB 和 1.28 GB。作者检查量化后的 Qwen3-8B-Base 检查点发现,AWQ 和 bitsandbytes NF4 都把 lm_head 留作形状为 $151{,}936 \times 4{,}096$ 的 BF16 Linear 层。在 transformer block 已压到 4 比特后,这个投影就成了剩余最大的稠密张量之一。更关键的是,LM-head 误差后面没有归一化、残差或可学习变换缓冲,直达 softmax,因此权重误差被放大。而朴素的 INT4 头量化并不对症:它最小化权重空间重建误差 $\|W-\hat{W}\|_F^2$,把每个隐方向等同看待,完全忽略了激活的各向异性分布。

本文的目标是作者的目标是设计一个专门的、打包的 LM-head 压缩器 ARCHead,它(1)结合量化低秩核心、分组 INT4 残差和一个在激活派生度量中拟合的低秩校正;(2)不存储任何稠密 BF16 头,把 Qwen3-8B-Base 上 LM-head 的持久化存储降到 BF16 的 25.6%;(3)在相近存储下获得接近稠密的困惑度(相对困惑度 1.007),远优于朴素 INT4 的 1.14–1.16;(4)作为可直接替换的输出头,与 AWQ、bitsandbytes 等块量化器正交叠加,附加交叉熵仅 0.006–0.007,吞吐变化小于 2%。ARCHead 明确声明它补充而非取代块量化器,专门压缩它们留下的大输出投影。

与已有工作不同的是,本文的独特切入角度有三点。第一,目标不同:现有量化方法主要针对 transformer block 线性层,而 ARCHead 直击块量化器留下的稠密输出投影。第二,目标函数不同:与压缩 LM 本身的低秩方法(Hsu 等 2022)和 LoRA 不同,ARCHead 先固定量化核心,再对核心残差用激活派生度量做变换后拟合低秩校正,把校正容量直接分配到影响观测 logit 的隐方向。第三,对『存储』的严谨处理:作者强调很多原型声称的比特宽度并不能反映真实可部署存储(反量化时可能仍保留稠密张量),因此所有字节数都来自打包头实际注册的张量(state_dict),并把持久化参数存储与后端相关的前向峰值内存严格区分开。

核心方法

ARCHead 的直觉是:与其在权重空间均匀地重建稠密头,不如把『还会造成多大 logit 误差』用激活协方差显式建模出来。技术路线是两阶段分解。给定稠密头 $W \in \mathbb{R}^{V \times D}$ 和来自 N 个校准 token 的最终隐状态 $H \in \mathbb{R}^{N \times D}$,先用一个量化低秩核心 $W_d$ 近似 $W$,它由秩-$r_c$ 近似加上对剩余残差的分组 INT4 量化构成;再计算核心残差 $E = W - W_d$,把它按激活派生的度量 $T_p$ 变换后做秩-$r_r$ 截断 SVD,得到低秩校正 $A_w B_w$。最终近似 $\hat{W}_c = W_d + A_w B_w$,logit 计算为 $\hat{Y} = HW_d^{\top} + (HB_w^{\top})A_w^{\top}$,全程不重建稠密头。Qwen3-8B-Base 上取 $r_c=10$、$r_r=6$、分组 64、$p=0.75$、ridge $10^{-3}$。

核心创新是『激活度量残差校正』。朴素量化最小化权重空间 Frobenius 误差 $\|\Delta\|_F^2$,等价把协方差当单位阵 $C=I$,无法区分频繁激活与几乎不激活的隐方向。ARCHead 推导出真正目标是期望 logit 误差 $\frac{1}{N}\|H\Delta^{\top}\|_F^2=\mathrm{Tr}(\Delta C\Delta^{\top})$,并用阻尼协方差 $C_\lambda=C+\lambda\bar{c}I=Q\Lambda Q^{\top}$ 构造度量 $T_p=Q\Lambda^p Q^{\top}$ 及逆:$p=\tfrac12$ 给阻尼经验 logit-MSE 几何,$p=0.75$ 强调主导方向。关键定理:固定核心 $W_d$ 与可逆 $T_p$ 后,未量化校正是 $\|(E-AB)T_p\|_F^2$ 在所有秩-$r_r$ 乘积中的最优解(变量代换套 Eckart-Young-Mirsky)。这与 GPTQ 顺序局部更新本质不同——它把校正容量全局分配到词表残差的主导模态。

方法步骤详情

完整构建流程:输入稠密头 $W$、激活 $H$、核心秩 $r_c$、校正秩 $r_r$、分组 $g$、度量幂 $p$、阻尼 $\lambda$。(1)估计激活几何 $C\leftarrow H^{\top}H/N+\lambda I$,特征分解 $C=Q\Lambda Q^{\top}$。(2)构建量化核心 $W_d=Q_5(A_c)Q_8(B_c)+Q_{SC4}(W-A_c B_c)$:$A_c B_c$ 为秩-$r_c$ 近似,$Q_{SC4}$ 为带组尺度的有符号 INT4 残差。(3)用实际核心反量化后形成 $E=W-W_d$。(4)在激活度量中拟合:构成 $ET_p$ 做随机化秩-$r_r$ 截断 SVD 得 $U_r\Sigma_r V_r^{\top}$,映射右因子回原空间 $A_w=U_r\Sigma_r$、$B_w=V_r^{\top}T_p^{-1}$。(5)打包:$A_w$ 行级 INT8、$B_w$ 分组 INT8,连同核心、组尺度、形状元数据打包并丢弃稠密源。推理时两路径分别计算、不重建稠密头;集成顺序为块量化器先压 block 再替换输出头。

技术新颖性

技术新颖性体现在几方面。其一,首次把输出头压缩形式化为激活派生度量下的最优问题,并证明对固定量化核心,ARCHead 校正因子是该度量下的最佳秩-$r$ 近似(因子量化之前成立)。其二,度量可调:通过幂 $p$ 在无加权残差近似($p=0$)与阻尼经验 logit-MSE 几何($p=\tfrac12$)间插值,Qwen 用 $p=0.75$。其三,打包表示真实可部署——不像保留反量化稠密张量的原型,它从 state_dict 实测字节数,Qwen3-8B-Base 实测仅 303.96 MB(BF16 的 25.6%)。其四,定位上正交于 GPTQ/AWQ/NF4:作者实测确认 bitsandbytes NF4 与 AWQ 下 lm_head 仍是 BF16 Linear,故『全量化』部署仍可能藏着稠密输出投影,ARCHead 专门补这个洞。其五,随机化 SVD 使构建比 GPTQ 快 2.36–2.58 倍。

ARCHead decomposes the dense output head into a packed quantized core Wd and an activation-metric low-rank correction.
Figure 1: ARCHead decomposes the dense output head into a packed quantized core Wd and an activation-metric low-rank correction.
ARCHead compression
Algorithm 1: ARCHead compression

实验结果

核心发现可归为四点。一、仅头部质量与跨模型(Table 3/4):Qwen3-8B-Base 上 ARCHead 以 0.256 倍 BF16 存储达相对困惑度 1.007,而相近存储的 Group INT4、SVD8+INT4 退化到 1.151、1.211;三模型上 ARCHead 均优于朴素 INT4,Qwen 优势最大、Gemma 较窄。二、打包存储真实可部署(Table 1/6):五模型压缩 3.71–3.91×,数字全部来自实测 state_dict 字节。三、混合部署与 GPTQ 对比(Table 5/7/16):替换 AWQ/NF4 留下的稠密头附加 CE 仅 +0.006/+0.007;2K–16K 三种子下各预算均值相对困惑度与 logit MSE 都低于 GPTQ 头部且构建更快,保留 93.05% top-1 token(基线约 76%)、KL 降一个数量级。四、消融与稳定性(Table 9/11):仅核心 1.134,加秩-6 激活度量校正降到 1.007,证明校正是关键;校准 4K–64K 稳定在 1.0070–1.0076,吞吐变化均小于 2%。

Detailed packed ARCHead storage validation, calculated from the instantiated PyTorch state_dict buffers.
Table 1: Detailed packed ARCHead storage validation, calculated from the instantiated PyTorch state_dict buffers.
Qwen3-8B-Base head-only results on WikiText-103.
Table 3: Qwen3-8B-Base head-only results on WikiText-103.
ARCHead replaces the dense head left by two block-quantization backends on Qwen3-8B-Base.
Table 5: ARCHead replaces the dense head left by two block-quantization backends on Qwen3-8B-Base.
Three-seed, head-only comparison on Qwen3-8B-Base.
Table 7: Three-seed, head-only comparison on Qwen3-8B-Base.
Fidelity to dense Qwen logits.
Table 8: Fidelity to dense Qwen logits.
Qwen head-only ablation.
Table 9: Qwen head-only ablation.
Downstream accuracy sanity check.
Table 10: Downstream accuracy sanity check.
Calibration sensitivity sweep on Qwen3-8B-Base.
Table 11: Calibration sensitivity sweep on Qwen3-8B-Base.
Hybrid model results on Qwen3-8B-Base.
Table 16: Hybrid model results on Qwen3-8B-Base.
ARCHead maintains generation throughput.
Table 18: ARCHead maintains generation throughput.
Qwen3-8B-Base head-storage and perplexity trade-off.
Figure 2: Qwen3-8B-Base head-storage and perplexity trade-off.
Qwen3-8B-Base calibration sensitivity.
Figure 4: Qwen3-8B-Base calibration sensitivity.
查看结构化数据
任务指标本文基线提升
Qwen3-8B-Base 仅头部困惑度(WikiText-103) 相对困惑度 Rel. PPL(越低越好) 1.007(存储 0.256×) Group INT4 1.151 / SVD8+INT4 1.211(相近存储) 相对困惑度退化降约 93%(0.151→0.007)
跨模型仅头部困惑度 相对困惑度 Rel. PPL Qwen 1.007 / Gemma 1.010 / VibeThinker 1.027 朴素 INT4 1.151 / 1.013 / 1.050 Qwen 与 VibeThinker 明显更优,Gemma 接近
打包头持久化存储 相对 BF16 压缩比 3.71–3.91×(五模型) 稠密 BF16 头(1.0×) 存储降至 25.6%–26.9%
与 GPTQ 风格头部对比(三种子均值) 相对困惑度退化减少比例 2K/4K/8K/16K 各预算均更低 GPTQ 头部 退化减少 44.0%/49.3%/33.6%/40.6%,构建快 2.36–2.58×
logit 保真度(Qwen3-8B-Base) top-1 一致率 / KL 散度 top-1 93.05%,KL 0.0113 存储匹配基线 top-1 约 76%,KL 0.1611–0.1671 top-1 提升约 17 个百分点,KL 降一个数量级
混合部署(AWQ/NF4 + ARCHead) 额外交叉熵 Extra CE +0.006(AWQ)/ +0.007(NF4) 保留 BF16 头(0.000) 头存储降到 0.256×,质量损失极小
消融:激活度量校正的作用 相对困惑度 Rel. PPL 1.007(完整 ARCHead,0.256× 存储) 仅核心 1.134(0.230× 存储) 校正带来决定性提升

局限与改进

作者承认的局限主要有五点。其一,适用范围窄:ARCHead 专攻输出头,不压缩 transformer 的 MLP/注意力权重;收益只在词表投影既稠密又对普通低比特敏感时最大,例如 Gemma-4-E4B 上朴素 INT4 已略好,ARCHead 优势消失甚至略差。其二,下游评估有限:仅 HellaSwag、TruthfulQA MC2、WinoGrande 三任务做『健全性检查』,作者明确表示不足以建立任务级改进或完整能力/安全性保持。其三,主要质量指标是 WikiText 困惑度与 logit 保真度,各维度不同不应混为一谈。其四,理论最优性是『条件的』:Eckart-Young-Mirsky 结论只适用于固定核心、未量化的秩-$r$ 校正,核心、度量幂、阻尼并未联合优化,INT8 因子量化引入额外近似,端到端不保证全局最优。其五,峰值内存是后端相关的,3.7–3.9× 只针对持久化参数,不等于运行时峰值 VRAM。我的观察:实验模型偏少(质量评估仅 3 个,打包验证 5 个),缺主流超大模型覆盖;融合 Triton 核心结果标注『初步』且仅单卡,生产后端优化仍是未来工作。

独立分析的弱点

第一个弱点是模型敏感性导致收益不稳定。Qwen 上朴素 INT4 相对困惑度灾难性退化到 1.151,ARCHead 大幅胜出;但 Gemma 上朴素 INT4 已是 1.013,ARCHead 在圆整结果中甚至略差,说明方法对激活几何高度依赖而非普适改进。改进方向:研究何种词表/嵌入结构使朴素低比特已足够强,自动判断何时该用 ARCHead。第二个弱点是校正容量固定且未联合优化:核心秩 $r_c$、校正秩 $r_r$、度量幂 $p$、阻尼 $\lambda$ 都是手工选取,条件最优性又限定在固定核心。改进方向:把核心与度量纳入联合优化,或做预算自适应(按存储预算自动选秩)。第三个弱点是 INT8 因子量化破坏理论最优性,校正因子量化后不再保证度量最优,作者也未报告量化前后误差差距。改进方向:引入量化感知 SVD 变体或在度量内直接做量化低秩分解。第四个弱点是评估范围窄,下游仅 3 任务、无长上下文/多语言/安全评估。改进方向:扩展到 lm-eval-harness 完整套件与对抗安全测试。

未来方向

作者明确提出的方向包括:扩展到更广的架构、语言、上下文长度与校准域;把融合 Triton 核心从初步/单卡扩展到更多硬件和生产后端;强调 ARCHead 是块量化器的补充而非替代。基于成果可延伸的方向:(1)把激活度量思想推广到 transformer block 内部线性层——目前 GPTQ/AWQ 在块内有 Hessian/通道敏感度,能否用同样的『协方差度量 + 截断 SVD 残差』范式进一步压缩 attention/MLP 投影;(2)研究 LM-head 嵌入结构的因果,解释为何 Gemma 朴素 INT4 已强、Qwen 却崩溃,给出无需试错就能预测收益的指标;(3)联合优化核心与校正,或用可学习度量幂 $p$ 适配不同模型;(4)与极端压缩(如 AQLM 加性码)结合,探索输出头的更激进压缩;(5)与蒸馏结合,用激活度量目标在微调数据上对压缩头做轻量校正以恢复能力;(6)评估在 RAG/长上下文等 logit 敏感场景下,93% top-1 保真度是否真的无损。

复现评估

复现性较好。作者开源代码(github.com/suayptalha/archead),给出检查点名(Qwen/Qwen3-8B-Base、google/gemma-4-E4B、WeiboAI/VibeThinker-3B、mistralai/Mistral-7B-v0.3、LiquidAI/LFM2.5-8B-A1B)与校准集(wikitext-103 训练集,16384 测试 token 与校准不重合)。关键超参数给出(Qwen 上 $r_c=10,r_r=6$、分组 64、$p=0.75$、ridge $10^{-3}$);GPTQ 对比用 2K/4K/8K/16K token 与 seed 0/1/2 匹配激活缓存,协议清晰。存储度量协议(实测 state_dict 字节、峰值内存测量前清缓存+重置+同步)严谨。难点:构建需稠密 LM-head 与校准激活,单机 GPU(RTX Pro 6000)即可;混合实验依赖 AutoAWQ 与 bitsandbytes。主结果应可在中端 GPU 复现,生产部署(融合核、峰值内存)需额外工程。