← 返回 2026-08-13

ReRound:用重建式舍入化解免校准 LLM 量化的中点歧义 ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

He-Yen Hsieh, H. T. Kung 📅 2026-08-11 👍 3 2026-08-18 18:30
低比特推理 免校准量化 后训练量化 扩散先验 舍入优化

用扩散先验从低比特权重重建连续权重,为 RTN 中点歧义舍入提供证据,免校准提升 3/4 比特精度

前置知识

后训练量化(PTQ)与 RTN

PTQ 指不对预训练模型做再训练、直接把全精度权重映射成低比特整数的方法。RTN(Round-To-Nearest,就近取整)是最朴素的 PTQ:给定组量化的 scale 和 zero-point,每个权重先被映到连续的量化坐标 $\tilde w = w/\Delta + z = \ell + r$($\ell$ 是地板整数,$r\in[0,1)$ 是小数部分),然后按标量距离就近舍入到 $\ell$ 或 $\ell+1$。

本文的全部改动就发生在 RTN 的最后一步舍入上:scale、zero-point、分组与推理流程都与 RTN 完全一致,理解 RTN 是理解论文的基线。

中点歧义与翻转代价

当小数部分 $r$ 接近 0.5(量化区间中点)时,向上和向下取整的标量误差几乎相等。论文定义翻转代价 $c_{flip}(r)=|e_u(r)-e_\ell(r)|=\Delta^2|1-2r|$,在中点处为零、向两侧量化整数线性增大。即单个翻转几乎不增加误差,但一个矩阵内大量翻转会整体改变该线性层的舍入模式。

中点歧义正是 ReRound 的切入点:只在翻转代价小、RTN 决策不可靠的位置允许用学习到的证据修改舍入方向。

组量化(scale $\Delta$ 与 zero-point z)

非对称均匀量化把权重按每 $G$ 个(本文 $G=128$)分成组,每组统计 min/max 得到缩放因子 $\Delta$ 和零点 $z$,权重 $w$ 映射为 $\tilde w=w/\Delta+z$ 后取整,反量化为 $\Delta(q-z)$。分组越细,量化误差越小。

ReRound 把全精度权重和重建权重都映到同一量化坐标下比较,偏差 $\rho$ 以量化步长 $|\Delta|$ 为单位度量,容差 $\tau$ 也定义在这个坐标系里。

条件扩散模型(DDPM)

扩散模型通过逐步加噪把数据变成高斯噪声,再训练一个去噪网络 $\epsilon_\theta$ 学会逆过程。条件扩散在此基础上额外输入条件(如图像的低分辨率版本),从纯噪声出发逐步去噪生成符合条件的数据样本,训练目标是 $\mathcal{L}_{diff}=\mathbb{E}\|\epsilon-\epsilon_\theta(P_t,t,P_{low})\|_2^2$。

ReRound 把每个 LLM 的权重 patch 当作训练数据,学一个以 2-bit 量化版本为条件的扩散模型,用它把低比特权重重建回连续值。

随机舍入(Stochastic Rounding, SR)

对量化坐标 $\tilde p=\ell+r$,SR 不做确定性取整,而是以概率 $1-r$ 取地板 $\ell$、以概率 $r$ 取天花板 $\ell+1$,使取整结果在期望上无偏。本文用它生成扩散训练的条件:2-bit 随机舍入的 patch 形式更多样,迫使模型学会从各种低比特观测中恢复原 patch。

训练用 SR 条件、推理用确定性 RTN 条件的组合,是重建质量的关键设计;论文附录 J 还用 Tweedie 公式证明了理想去噪器的输出即条件均值。

奇异值与谱保持

矩阵 $W$ 的奇异值 $\sigma_1\ge\sigma_2\ge\dots$ 来自 SVD 分解,刻画该线性层各主方向的能量大小。前 $k$ 个 leading singular values 概括了矩阵的主导变换结构,不需要任何激活数据即可计算。

ReRound 用谱差异 $D_{spec}$ 作为矩阵级准则,在候选舍入方案中挑出最保持原矩阵主导结构的那个,这是它免校准仍有效的关键。

研究动机

权重-only 后训练量化在 scale、zero-point 和分组确定后,每个权重只剩“向上还是向下取整”这一个自由度。RTN 按标量距离就近取整:权重靠近某个量化整数时选择明确,但落在区间中点附近时,两个方向的误差几乎相同,决策仅取决于到中点的小距离差。论文给出翻转代价 $c_{flip}(r)=\Delta^2|1-2r|$,在 $r=0.5$ 处为零:单次翻转几乎无额外标量误差,但一个矩阵内的一组此类修改会整体改变线性层的舍入模式。实际后果明显:W3A16 下 group-wise RTN($G=128$)使 Gemma 3 1B 的四任务零样本平均从 16-bit 的 60.8 跌到 55.3,Gemma 2 2B 从 68.1 跌到 61.9,channel-wise RTN 更差(Gemma 3 1B 仅 46.0)。已有工作(AdaRound、SignRound 等)虽证明 RTN 的舍入有改进空间,但依赖校准数据做输出重建,且没有回答“中点附近到底该把哪些权重改成另一个方向”。

本文的目标是本文目标是构建完全免校准(calibration-free)的舍入修正框架:在不使用任何激活样本、校准文本或下游标签的前提下,重新审视 RTN 在中点歧义区的向下/向上决策;同时保持量化 scale、zero-point、分组大小 $G=128$ 与量化层覆盖(含 lm_head)完全不变,每矩阵只修改不超过 1% 的量化整数指派。最终产物必须与 RTN 使用相同的低比特表示和推理流程,不引入任何推理时开销;并且框架要能直接套用在其他 PTQ 方法给出的量化参数(如 SINQ 的 scale)之上,充当通用的“最后一公里”舍入优化器,重点服务 3-bit 和 4-bit 的小型 LLM。

与已有工作不同的是,独特之处在于证据来源与决策粒度。作者把“从量化值恢复原权重”看作逆问题,借用图像去量化领域的条件扩散先验思想(Vavilala 等人的去量化工作),但训练数据不是外部语料,而是目标 LLM 自己的全精度权重 patch——模型自身的权重分布就是先验。与 AdaRound/FlexRound/SignRound 等用激活输出重建损失逐层优化舍入不同,ReRound 只在中点歧义区、且重建权重明确支持反方向时才翻转决策;与 GPTQ/AWQ/OmniQuant 等在舍入前优化量化设置的方法不同,它专门优化此前被视为“已定局”的最终舍入步骤;与 CafeQ 等 weight-space proxy 方法相比,它用只依赖权重矩阵本身的谱匹配作为矩阵级选择准则,完全不需要数据。

核心方法

直觉:量化把一整段区间的值映到同一个整数,因此单个量化整数不携带“原值靠近地板还是天花板”的信息;但若用一个学到的先验把低比特权重“反量化”回连续值,重建结果就隐含了权重应该长什么样的判断,可当作中点附近舍入方向的证据。技术路线分三步。第一步,对每个目标 LLM 训练一个条件扩散模型:从权重矩阵裁剪 $64\times64$ patch,按量化组归一化到 $[0,1]$,以 2-bit 随机舍入版本为条件学习 $p_\theta(P\mid P_{low})$,损失为 $\mathcal{L}_{diff}=\mathbb{E}_{P,t,\epsilon}\|\epsilon-\epsilon_\theta(P_t,t,P_{low})\|_2^2$。第二步,推理时以确定性的 2-bit RTN patch 为条件,从纯高斯噪声出发用 DDPM 的 super27 调度做 27 步反向扩散,重建出连续矩阵 $W^{rec}$——它只用于引导舍入,不会被部署。第三步,ReRound PTQ 把 $W$ 与 $W^{rec}$ 映到同一目标量化空间,按位置相关容差接受一部分方向翻转,对一组容差参数 $\tau$ 扫描生成多个候选量化整数矩阵,最后选反量化后 leading singular values 与原全精度矩阵最匹配的候选作为最终权重。

核心创新是三个机制的耦合。其一,证据来源:重建权重 $w^{rec}$ 不被部署,只用来给“地板还是天花板”投票——只有当 $q_{rec}=\mathrm{round}(\tilde w^{rec})$ 恰好等于 RTN 的反方向 $q_{alt}=\ell+u-q_{rtn}$ 时才提出修改,这与 Neural Network Diffusion、D2NWG 等直接生成权重的路线本质不同。其二,位置相关容差 $\tau_{pos}(r;\tau)=\tau\exp\big(-\beta([0.5-\delta-d(r)]^+/(0.5-\delta))^2\big)$:由翻转代价 $c_{flip}(r)=\Delta^2|1-2r|$ 在中点最小这一事实推出,重建证据只应在 $r$ 靠近 0.5 时说话,靠近量化整数时倾向保留 RTN;$\delta=0.1$ 定义中心歧义区 $r\in[0.4,0.6]$(区内容差恒为 $\tau$),$\beta$ 控制区外衰减锐度。其三,矩阵级谱选择:以 $D_{spec}(\tau)=\|\sigma_{1:k}(W^\tau)-\sigma_{1:k}(W)\|_2/(\|\sigma_{1:k}(W)\|_2+\epsilon)$ 为准则在候选间挑选;由于 $\tau=0$(即原样 RTN)总在候选集内,选出的候选在该准则下保证不劣于 RTN。

方法步骤详情

完整流程如下。(1) 训练准备:提取所有二维权重矩阵(含 lm_head,排除 token embedding 与 normalization),转 FP32,按 128 一组非对称归一化到 $[0,1]$,裁成 $64\times64$ patch(不足则补零并用 mask 标记,训练时以 0.5 概率水平翻转)。(2) 扩散训练:条件用 2-bit 随机舍入生成($\tilde p=\ell+r$ 时以 $1-r$ 概率取 $\ell$、$r$ 概率取 $\ell+1$);基于 DeepFloyd IF Stage-II(IF-II-M-v1.0)冻结 U-Net、只训 ControlNet,单通道 patch 复制成三通道,T5 端用空提示嵌入;AdamW 学习率 $2\times10^{-5}$,5 个 epoch、每 epoch 100 万 patch,双卡 RTX 4090 有效 batch 64,耗时约 1.8–3.4 小时。(3) 重建推理:单卡 batch 128,DDPM super27 共 27 步,从左到右、逐行处理全部 patch,反归一化后拼回 $W^{rec}$,一次生成、3-bit 与 4-bit 复用,耗时约 3.7–9.6 小时。(4) ReRound PTQ:算偏差 $\rho=|\tilde w^{rec}-\tilde w|$ 与距离 $d(r)=\min\{r,1-r\}$;仅当 $q_{rec}=q_{alt}$ 且 $\rho\le\tau_{pos}(r;\tau)$ 时改写为 $q_{alt}$,每矩阵修改不超过 1%;对 $\tau\in\mathcal{T}$(如 $\{0,0.15,0.25,0.35\}$)生成候选 $Q^\tau$,反量化后取前 $k=\min\{m,128,\max(32,\lfloor m/16\rfloor)\}$ 个奇异值计算 $D_{spec}$,取最小者,单模型仅需 42–124 秒。

技术新颖性

技术新颖性体现在四点。(1) 应用层面的新组合:把扩散先验从图像域引入权重域的“舍入决策”这一极小但关键的自由度——此前 Diff-OneBit 用扩散加数据一致性做 1-bit 测量重建、Neural Network Diffusion 与 D2NWG 生成网络参数、weights2weights 编辑权重空间,但没有工作用“目标模型自身权重的条件扩散先验”来指导 PTQ 舍入。(2) 与校准类舍入优化的本质区别:AdaRound 学局部输出重建、SignRound(V2) 用有符号梯度联合优化舍入与裁剪,都需要校准数据;ReRound 的全部信号来自权重矩阵本身,属完全免校准路线,且推理表示与 RTN 逐比特一致、零推理开销。(3) 可证明的保守性:附录 J 证明被接受的修改满足 $(r-1)/2\le\rho\le\tau_{pos}\le\tau$,从而每处翻转的额外标量误差 $c_{flip}\le2\Delta^2\tau$ 有界;谱准则下 $D_{spec}(\tau^\star)\le D_{spec}(0)$ 保证不劣于 RTN。(4) 决策粒度升级:容差参数扫描加谱选择把逐元素规则变成矩阵级组合决策,且同一 $W^{rec}$ 可跨 3/4-bit 复用,按各自量化网格独立选候选。

Conditional weight reconstruction.
Figure 2: Conditional weight reconstruction.
Reconstruction-guided rounding.
Figure 3: Reconstruction-guided rounding.
Candidate selection via spectral preservation.
Figure 4: Candidate selection via spectral preservation.
Visualization of the position-dependent tolerance metric.
Figure 6: Visualization of the position-dependent tolerance metric.

实验结果

主实验在 Gemma 2 2B、Gemma 3 1B、Qwen3 1.7B、OLMo 2 1B、SmolLM2 1.7B 上对比免校准方法(channel/group-wise RTN、HQQ、BNB FP4、Hadamard+RTN),测 WinoGrande/PIQA/BoolQ/SIQA 零样本准确率。W3A16 下 ReRound 在全部五个模型取得最高四任务平均,比 group-wise RTN 提升 0.1–0.9 点(SmolLM2 56.0→56.9、OLMo 54.3→55.1);W4A16 下在五分之四的模型最佳或持平,提升 0.2–1.3 点,OLMo 2 1B 从 58.1 升至 59.4,为最大 4-bit 增益。与校准方法对比(Table 3):Gemma 2 2B 上 ReRound 67.4 超过 GPTQ 66.7、AdaRound 66.9、SignRound 67.0、CafeQ 65.9;Gemma 3 1B 上 59.3 超过 SignRound 59.1,且全程不用校准数据。消融(Table 4,OLMo 2 1B)证实三组件缺一不可:等量随机翻转 W4 58.5、固定中点窗 58.4、权重 MSE 选择 58.7,均低于完整版 59.4。Table 5 套用 SINQ 量化参数(Qwen3 1.7B):W4 平均 62.1→62.6、困惑度均值 18.53→18.46;W3 57.1→57.3、24.26→24.06,说明可叠加于其他 PTQ。Figure 5 与 Table 10 扩展到 Llama 3.2 1B、Pythia 1.4B、Phi-2 2.7B、Falcon 3-1B:八个模型 W3/W4 全部正增益(W4 +0.2~+1.3,W3 +0.1~+1.6)。Table 11 中 ReRound 在六个模型上平均全部高于用校准数据的 AdaRound(最多 +1.9)。Table 6:扩散训练 1.8–3.4 小时(双 4090)、重建推理 3.7–9.6 小时(单卡)、PTQ 仅 42–124 秒,推理零开销。

Calibration-free weight-only PTQ on Gemma 2 2B, Gemma 3 1B, and Qwen3 1.7B.
Table 1: Calibration-free weight-only PTQ on Gemma 2 2B, Gemma 3 1B, and Qwen3 1.7B.
Calibration-free weight-only PTQ on OLMo 2 1B and SmolLM2 1.7B.
Table 2: Calibration-free weight-only PTQ on OLMo 2 1B and SmolLM2 1.7B.
Comparison with calibration-based PTQ under W4A16 quantization on Gemma 2 2B and Gemma 3 1B.
Table 3: Comparison with calibration-based PTQ under W4A16 quantization on Gemma 2 2B and Gemma 3 1B.
Component ablation on OLMo 2 1B.
Table 4: Component ablation on OLMo 2 1B.
Rounding with SINQ quantization scales on Qwen3 1.7B.
Table 5: Rounding with SINQ quantization scales on Qwen3 1.7B.
Offline runtime of ReRound.
Table 6: Offline runtime of ReRound.
ReRound hyperparameters for each model.
Table 8: ReRound hyperparameters for each model.
Additional results across LLM architectures.
Table 10: Additional results across LLM architectures.
Comparison with AdaRound under W4A16 quantization on OLMo 2 1B, SmolLM2 1.7B, Llama 3.2 1B, Falcon 3-1B-Base, Phi-2 2.7B, and Qwen3 1.7B.
Table 11: Comparison with AdaRound under W4A16 quantization on OLMo 2 1B, SmolLM2 1.7B, Llama 3.2 1B, Falcon 3-1B-Base, Phi-2 2.7B, and Qwen3 1.7B.
Average-accuracy gains of ReRound over group-wise RTN across eight LLMs.
Figure 5: Average-accuracy gains of ReRound over group-wise RTN across eight LLMs.
查看结构化数据
任务指标本文基线提升
W4A16 权重量化 · Gemma 2 2B(四任务零样本平均) Avg. acc (%) 67.4 group-wise RTN (G=128): 66.4;最佳校准方法 SignRound: 67.0 +1.0 vs RTN;+0.4 vs SignRound(且免校准)
W4A16 权重量化 · OLMo 2 1B Avg. acc (%) 59.4 group-wise RTN (G=128): 58.1 +1.3(对比中最大的 4-bit 增益)
W4A16 权重量化 · Gemma 3 1B Avg. acc (%) 59.3 group-wise RTN: 58.8;SignRound: 59.1 +0.5 vs RTN;+0.2 vs SignRound
W4A16 权重量化 · Qwen3 1.7B Avg. acc (%) 62.6 group-wise RTN: 62.2 +0.4
W3A16 权重量化 · SmolLM2 1.7B Avg. acc (%) 56.9 group-wise RTN: 56.0 +0.9(W3 下全模型最佳)
W3A16 权重量化 · OLMo 2 1B Avg. acc (%) 55.1 group-wise RTN: 54.3 +0.8
SINQ-scale W4A16 · Qwen3 1.7B(G=64) Avg. acc (%) / PPL Avg. 62.6 / 18.46 SINQ-scale RTN: 62.1 / 18.53 准确率 +0.5,困惑度 -0.07
W3A16 权重量化 · Falcon 3-1B-Base Avg. acc (%) 67.9 group-wise RTN: 66.3 +1.6(Table 10 中最大增益)

局限与改进

作者承认的局限:候选集受既有量化参数约束,无法联合优化 scale/zero-point;只在 1–2.7B 的小型 LLM 上验证;每个 LLM 需单独训练一个扩散模型,离线成本不可忽视(尽管 $W^{rec}$ 跨 3/4-bit 复用,扩展到大量模型仍昂贵);谱选择只在权重空间进行,未必对每个下游任务选出最优候选;patch 级重建看不到长程与跨层依赖。我的补充观察:4-bit 下面对 BNB FP4 这类强免校准基线并非总赢(OLMo 2 1B 上 BNB FP4 平均 61.1 vs ReRound 59.4、HQQ 60.4);$\tau$ 候选集与 $\beta$ 逐模型手工设定(Table 8 中 $\beta$ 从 8 到 128 跨两个数量级),跨模型泛化性存疑;每矩阵 1% 的修改上限与 $\eta$ 截断是启发式;评估仅四个零样本任务(SINQ 实验除外未测困惑度),未覆盖生成任务与多语言;重建推理耗时(最长 9.55 小时)甚至超过训练时间,工程优化空间大;论文也未分析各层修比例(Figure 7/8 显示非均匀分布)与精度增益之间的因果关系。

独立分析的弱点

独立分析的弱点与对应改进方向:(1) 先验不可迁移——每换一个模型就要重训扩散模型,可探索在多个模型的权重 patch 上联合训练通用权重先验,或学习按模型家族条件化的先验以摊薄成本;(2) 感受野受限——$64\times64$ patch 内联合重建无法感知整行/整列结构与跨层耦合,可用多尺度 patch、全局低秩条件或轻量注意力扩大视野;(3) 谱准则与任务脱节——只匹配前 $k$ 个奇异值,可能保住主模式却丢失任务敏感方向,可引入免数据的激活代理(用权重自身统计合成伪激活)或多准则加权选择;(4) 超参敏感——$\tau$ 集合、$\beta$、1% 修改上限均为逐模型手调(Table 8),可改为按 $D_{spec}(\tau)$ 曲线自动确定 $\tau$、按层敏感度自适应 $\beta$ 与修改比例;(5) 重建成本高——27 步 DDPM 采样是主要瓶颈,可用一致性模型、少步蒸馏或直接回归头替代,把小时级降到分钟级;(6) 覆盖面窄——只验证 weight-only、3/4-bit、1–2.7B 模型,2-bit 极限量化、激活/KV cache 量化以及 7B 以上模型均未验证。

未来方向

作者在讨论中提出的方向:联合优化量化参数与重建引导舍入(摆脱候选集受限于固定 scale/zero-point 的束缚)、把方法推广到 LLM 之外的 AI 模型、降低重建成本、跨模型迁移权重先验、以及使用更广的结构准则。基于本文成果还可延伸:(1) 与旋转类方法(QuaRot/SpinQuant/FlatQuant)组合——旋转改变权重分布后中点歧义的分布也随之改变,ReRound 可作为其末端精修器;(2) 用重建置信度(如同条件多次采样的方差)替代固定容差,做不确定性驱动的自适应舍入;(3) 理论上刻画谱保持与下游精度、泛化之间的联系,回答“为什么保住 leading singular values 就够”;(4) 将扩散先验用于 KV cache 或激活量化的码本决策;(5) 训练一次即可用的通用权重扩散先验,配合目标模型少量微调,使方法可扩展到模型 zoo 级别的批量量化;(6) 探索 MoE 专家矩阵等稀疏结构上的适用性。

复现评估

复现条件良好。代码开源在 GitHub(louisYen/ReRound);所有评测模型均为公开 HuggingFace checkpoint(Table 12 逐一列出,如 google/gemma-2-2b、Qwen/Qwen3-1.7B、microsoft/phi-2 等);扩散实现基于 DeepFloyd IF Stage-II(IF-II-M-v1.0)加 ControlNet,软件版本在 Table 7 完整给出(PyTorch 2.5.1、Diffusers 0.35.2、Transformers 4.57.1、lm-eval 0.4.11 等);训练配置明确:5 epoch、每 epoch 100 万 patch、有效 batch 64、AdamW 学习率 $2\times10^{-5}$、seed 1;$\delta=0.1$ 全模型统一,各模型的 $\tau$ 候选集与 $\beta$ 列于 Table 8;评估协议固定(seed 0,NumPy/PyTorch seed 1234)。算力门槛低:两张消费级 RTX 4090 训练约 2–3.5 小时,单卡重建 3.7–9.6 小时,PTQ 只需几十秒到两分钟。主要不确定性在于扩散采样的随机性和各基线的复现细节(论文已给出 GPTQ/AdaRound/SignRound/HQQ/BNB 的具体配置与版本)。整体复现难度:中等偏低,有单张 24GB 显卡即可复现核心结果。