字节级精确 KV 状态嫁接:冻结小模型的可验证知识飞轮 Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
用字节精确的 KV 状态嫁接,让冻结 12B 模型同时变强又变便宜
前置知识
KV Cache(键值缓存)
Transformer 在自回归生成时,每生成一个 token 都要对前面所有 token 做注意力计算。为了避免重复计算,推理引擎会把每一层每个历史 token 的 Key、Value 投影向量保存下来,这就是 KV Cache。有了它,新 token 只需计算自己的 Q/K/V,然后用 Q 去和已缓存的 K 做点积,再和 V 加权求和。KV Cache 随序列长度线性增长,是长上下文推理显存占用的主要来源,也是本文要持久化、嫁接的核心对象。
本文的全部创新都围绕 KV Cache 展开——把它从易失的内存对象变成磁盘上字节精确的可移植文件,是理解所有成本和能力结论的基础。
Rotary Position Embedding / RoPE(旋转位置编码)
RoPE 通过对每一层的 Query 和 Key 向量施加一个与位置相关的旋转矩阵来注入位置信息:位置 $m$ 处的向量被旋转角度 $m\theta_i$。理论上注意力分数只依赖相对位置 $m-n$,因为 $\cos a \cos b + \sin a \sin b = \cos(a-b)$。但在 32 位浮点下,这个三角恒等式并不逐位成立,同一相对几何用不同绝对角度表达会得到不同的舍入结果。本文发现这个细微的数值事实正是限制位置可移植性的根本原因。
理解 RoPE 的数值特性是理解论文最关键的洞见——为什么 own-position 嫁接是唯一能字节精确的工况点,而把块搬到别的位置不可能无损。
Prefill 与 Decode 两阶段
大模型推理分两个阶段:Prefill 阶段一次性处理整个 prompt,计算所有 token 的 KV 并填入缓存,是计算密集型、耗时长的阶段;Decode 阶段逐个生成新 token,每次只计算一个新 token 的 KV,是访存密集型阶段。本文的 85.6 倍加速本质就是用嫁接替代 Prefill——只解码 1 个 token 而非重新计算 11,994 个 prompt token。
Prefill 成本是推理账单的大头,理解两阶段划分才能看懂为什么嫁接能把 token 成本压缩 6,574 倍。
AIME 2025 与数学竞赛基准
AIME(美国数学邀请赛)是难度极高的高中数学竞赛,每题答案为 0–999 的整数,可被程序确定性判定对错,非常适合做'验证型'学习。AIME 2025 于 2025 年 2 月发布,晚于 Gemma-4 模型声称的 2025 年 1 月预训练截止,因此是真正的'截止后'数据,能干净地测试模型是否学到了训练时没有的能力。
论文所有能力和泛化结论都在 AIME 2025 上测量,且其'截止后'性质排除了模型只是背诵训练数据的质疑。
滑动窗口注意力(Sliding Window Attention)
普通注意力让每个 token 看到所有历史 token;滑动窗口注意力只让每个 token 看到最近 W 个 token(如 Gemma 的窗口),从而把注意力的显存和计算复杂度从 $O(n^2)$ 降到 $O(nW)$。代价是早期 token 的 KV 会被滑出窗口丢弃,标准的 prompt cache 只能从稀疏检查点恢复,导致相同请求重复发送时仍要重算大部分 prompt。本文通过给窗口层启用全尺寸 KV 修复了这一点。
这是论文第 4.3 节必须打两个补丁才能让原生缓存显示同样加速的原因,理解它能看懂工程细节如何'静默地击败朴素测量'。
KL 散度与 SHA-256 字节相等
KL 散度 $D_{KL}(p \| q) = \sum_i p_i \log(p_i/q_i)$ 衡量两个分布的差异,为 0 当且仅当两分布完全相同。SHA-256 是密码学哈希,对任意长度输入产生 256 位摘要,输入差一个字节摘要就完全不同。论文用 SHA-256(grafted logits 字节) == SHA-256(fresh logits 字节) 做最强的逐位等价检验,用 KL=0 和 argmax 一致做分布层面的检验。
这两套指标共同支撑'字节精确'这一承重声明——若嫁接只是近似而非精确,后续所有能力和成本结论都会被数值漂移混淆。
研究动机
当前大模型领域有两笔成本在叠加。第一笔是'让模型变强'的成本:业界默认靠重训练或微调,单次大规模训练的碳排可达数百吨二氧化碳当量,而且动辄需要更大的集群。第二笔更隐蔽却更普遍:'使用强模型'的成本——每次调用都要重新 prefill 同一个上下文,计算出的注意力状态被当作易失品,在数十亿次调用中被重复计算又丢弃。现有的近似复用方案各有取舍:原生 prompt cache 快但绑定活进程,对滑动窗口模型只能从稀疏检查点恢复;RAG 把知识作为 token 前缀每次重新读,成本反复发生;权重编辑推理时免费却需要一次训练来安装,且无法在单条事实粒度上组合。论文用 Gemma-4-12B 给出量化场景:8 道它在 401,026 token 采样预算下永远解不出的题,反映出强模型在硬推理上仍存在能力天花板。
本文的目标是作者的目标是用单一机制,让一个冻结(不更新任何权重)的 12B 小模型同时实现两件事:既更聪明——能解出它原本证明解不出的题;又更便宜——只付出原本极小比例的 token 与能耗。具体而言,要把'已验证的知识'以字节精确(bit-exact)的 KV 状态工件形式一次性存盘,之后在任何新的推理上下文中无损恢复(graft 嫁接)。关键是这个'精确'必须是字面意义上的精确——恢复出的 logit 向量与重新计算的向量逐字节相同(SHA-256 相等)、分布 KL 散度为 0、argmax 100% 一致,从而让任何能力变化都干净地归因于知识本身,而非数值噪声。
与已有工作不同的是,本文的独特切入角度在于区分两种被业界混为一谈的复用:'近似且易失'(如 CacheBlend、前缀复用)与'精确且持久'。作者声称这是首个公开演示的、字节精确、持久、可移植的 KV 状态嫁接,并以此作为推理时学习的基底。不同于 RAG(知识是 token,每次重读,成本反复发生)和微调(改权重,需训练且不精确),本文把知识做成磁盘上的普通文件,可零额外显存存储、可跨机器复制后仍字节相同地工作。更独特的贡献是对'精确性工况点'的数值刻画:通过对抗式测试证明 own-position 嫁接是 32 位旋转编码下任何引擎唯一可达字节精确的工况点,并据此主动撤回了原本关于'位置组合字节精确'的更强声明。
核心方法
整体思路源于一个朴素观察:模型读 prompt 时产生的 KV 状态是输入、权重、数值精度的确定性函数。若能把它精确捕获、写盘、之后无损恢复到不同上下文,则'算过一次的知识'永不需要重算,且无需任何梯度步就能给模型永久添加它当前不具备的知识。作者把字节精确的嫁接机制命名为 Taliesin,把建在其上的'验证-缓存'学习环命名为 Galahad。技术路线分三步循环:用额外推理算力解一道题,用外部可信检查验证解的正确性,再把验证通过解的 KV 状态存为持久块。检索时把新查询路由到单个相关块并嫁接,避免把多块平铺成一个前缀导致模型抓错条目。
核心创新是把'精确复用'从近似提升到字节级,并据此把状态复用变成一种推理时学习。形式化定义为:对位置 $p$,令 $\ell_{fresh}$ 为重新计算的 logit 向量、$\ell_{graft}$ 为嫁接恢复的 logit 向量,当 SHA-256(bytes($\ell_{graft}$)) = SHA-256(bytes($\ell_{fresh}$)) 时称嫁接字节精确,由此推出 $D_{KL}(p_{graft} \| p_{fresh}) = 0$ 且 argmax 一致。与已有方法的本质区别有三:原生 prompt cache 快但易失、对滑动窗口只从稀疏检查点恢复;RAG 持久但每次重读 token 成本反复;权重编辑推理免费但需训练、不精确、不可在单条事实粒度组合。本文的块是磁盘普通文件,零额外显存、可跨机复制、复制后仍字节相同地工作,这是把'复用'升级为'学习单元'的承重属性。
方法步骤详情
Galahad 飞环协议刻意简单。第一步 Solve:对冻结模型无法可靠解出的题,用额外推理时算力(多次采样、长思维链、代码执行)求解。第二步 Verify:用外部可信检查验证——AIME 上执行模型生成的程序确认打印出已知答案;LiveBench 上匹配 ground truth,只有通过验证的解才入存储。第三步 Deposit:把验证解的 KV 状态存为持久块(8 道硬题约 4,571 token、441 MB)写盘,零额外显存。检索分两个被严格区分的工况:Recurrence 按精确查找读回已验证答案不重算;Transfer 用一次性分类选块、嫁接后让冻结模型把缓存方法适配到新实例。关键工程修正是每个验证解存为独立块、按查询路由到单个相关块再嫁接,而非平铺成单一前缀——后者让模型在多条目并存时抓错(召回从 5/8 提升到 8/8)。所有字节精确测量都在钉死的确定性配置(GGML_DETERMINISTIC=1、CUBLAS_WORKSPACE_CONFIG=:4096:8)下进行,使两次连续 fresh 计算本身也逐位相同。
技术新颖性
技术新颖性体现在四个层面。其一,首个公开的、字节精确、持久、可移植的 KV 状态嫁接,用作推理时学习基底;之前最接近的系统要么精确但易失(原生 prompt cache),要么持久但有损(CacheBlend、RAG)。其二,对'精确性工况点'的数值刻画:通过对抗式测试排除 7 种候选解释(半精度舍入、滑动窗口缓冲、偏移量量级、双旋转路径、频率失配、大角度参数归约、归约树重结合),证明 own-position 嫁接是 32 位旋转编码下任何引擎唯一可达字节精确的工况点,根因是 $\cos a\cos b + \sin a\sin b = \cos(a-b)$ 在 32 位浮点下不逐位成立。其三,诚实的方法论:作者测出位置重定位不字节精确后主动撤回更强声明,并通过预注册的 B200 replay 验证跨架构结论。其四,'提交输入哈希到哈希输出到可独立核验分数'的可复现构造,让闭源引擎仍能被审计。
实验结果
核心发现可归纳为四条。其一,字节精确性坐实:50 样本上嫁接分布 KL 中位数与 p99 均为 0、0/50 argmax 不一致、0/50 失败,Mann-Whitney $p=1.0000$、Cliff's delta 0.0000,SHA-256 字节相等 5/5;并刻画了精确工况点——own-position 嫁接 KL 约 $10^{-27}$ 字节精确,重定位到偏移 $M$ 的 KL 约 0.015,对照实验证明这恰是模型自身 32 位旋转编码的位置敏感度(fresh-vs-fresh 不同偏移也发散 0.014),故 own-position 是任何引擎唯一可达精确的工况点。其二,能力提升:AIME 2025 上冻结 Gemma-4-12B 从 80.0%(24/30)升到 93.3%(28/30),8 道硬题库恢复 6 道,超过自身模型卡 77.5% 与 31B 的 89.2%;精简 code-routing 达 90.0%、每题仅 4,360 decode token。其三,成本骤降:8 道基线 best-of-5 在 401,026 token 下解 0 道的题,飞环用 61 总 token(7.6/题)全解,token 减少 6,574 倍、能耗减少约 3,000–8,700 倍;prefill 加速 85.6 倍;2,854,766 token(87 倍 32k 窗口)存储零额外显存、0.29 s 恢复不随深度增长。其四,跨架构与泛化:H100 冻结 31B 迁移 7/7、recurrence 8/8、全 30 题 100%、云花费约 8–12 欧元;预注册 B200 replay 通过 SHA 字节相等 10/10;库内路由 15/15,off-distribution 4/4 弃权。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AIME 2025 能力(冻结 Gemma-4-12B,置信门控系统) | 准确率(30 题) | 93.3%(28/30,22 题直接解出 + 6 题从嫁接库恢复) | 80.0%(冻结 12B 自身最优配置 24/30);模型卡 12B 77.5%、31B 89.2% | +13.3 个百分点,超过自身模型卡与更大 31B 的模型卡锚点 |
| AIME 2025 复现成本(8 道硬题) | decode token 总数 / 准确率 | 61 token,8/8 全对(7.6 token/题) | best-of-5 基线 401,026 token,0/8 | token 减少 6,574 倍,从全错到全对 |
| Prefill 加速(Gemma-4-12B) | 冷 prefill vs 嫁接推进 1 token 的墙钟时间 | 11,994 token 冷 1,547.3 ms → 嫁接 18.1 ms | 原生 prompt cache(滑动窗口稀疏检查点) | 85.6 倍(新前缀 83.7 倍) |
| 可用上下文扩展 | 可服务总 token 数 / 额外显存 | 2,854,766 token(40.6 GB 磁盘),0 额外显存,0.29 s 恢复 | 32 GB 卡上 32,768 token 的服务窗口 | 87.1 倍,且每访问成本不随深度增长 |
| Held-out 迁移泛化(31B,H100) | 同结构新题准确率 | AIME 迁移 7/7(100%);LiveBench 时序 held-out 71.7%(43/60) | 12B 本地迁移 5/7;全块平铺合并 LiveBench 56.7% | 更大模型迁移更稳,路由优于平铺合并 |
局限与改进
作者坦承多重边界。其一,飞环在模型不失败时无效:一个 12B 首次就能解的任务族上学习臂与冻结对照都 216/216,没有失败空间。其二,缓存过程可能有害:为已掌握任务规定手工方法反而降 55 点、token 翻十倍。其三,字节相等是架构内的:同架构(H100→H100)可字节相同复制,跨架构只保证功能正确。其四,位置重定位不字节精确且原理上不可能,仅 own-position 是精确工况点,作者撤回了位置组合的更强声明。其五,LiveBench 多示例复杂块复现偏弱(31B recurrence 仅 5/20),与 AIME 单解块 8/8 形成对比。其六,路由器在 graft 与 answer 间无置信门,结构性上存在'自信但错'可能,尽管样本量内未发生。其七,分页测量是单节点双槽服务器,不带高并发声明。其八,'100% AIME'与'93.3% AIME'是飞环系统数,最难的 8 题本质是 recurrence,干净的未见泛化数是迁移(31B 7/7、12B 5/7)。我自己的观察:单作者、未经同行评审、所有结果依赖闭源 Merlin/Taliesin 引擎,且 50/30/8 等样本量偏小,强结论需更大规模独立复现坐实。
独立分析的弱点
独立分析下有五处弱点。第一,引擎闭源是最根本弱点:Taliesin/Merlin 的状态捕获与恢复、存储布局、去重哈希均专有,外部只能审计数字诚实性而无法复现生成,这削弱了'字节精确'声明在独立复现下的可信度——改进方向是把 capture/restore 算法以参考实现开源。第二,样本量普遍偏小(KL 50 样本、AIME 30 题、硬题 8 道、迁移 7 例),统计说服力有限——应在 MATH、GPQA、代码生成等更多基准上扩展。第三,路由器缺置信门是结构性风险——应在 graft 前加轻量校验(先复述缓存解关键步骤或对答案做自洽检查)。第四,迁移边界(仅参数化程序可迁移)暴露缓存表示局限——应把缓存从'具体程序'升级为'参数化方法模板',让 deposit 阶段就做参数提取。第五,跨架构字节不等价限制'可移植'声明强度——应研究跨架构数值对齐协议(固定累加顺序、软件模拟统一归约树)。
未来方向
作者明确点出的未来方向包括:路由器的更大样本表征、高并发扩展声明、跨架构字节精确化、为路由加置信门、以及改善多示例复杂块的复现。基于本文成果可延伸的方向我补充四点:第一,把'验证-缓存'飞环从数学竞赛推广到代码生成、定理证明、Agent 工具调用等可验证任务,因为这类任务天然有外部 sound check,是飞环的最佳土壤。第二,研究 own-position 之外是否能通过'数值对齐层'(如在 RoPE 前做角度归一化)逼近字节精确的位置组合,从而支持多块自由拼接。第三,把缓存块做成可组合的知识市场——不同团队 deposit 不同领域的验证块,路由器跨域检索,形成模型的'外部长期记忆'。第四,理论上刻画'何时缓存过程会反而有害'的判据,给出 deposit 的安全条件,避免重蹈中国剩余定理卡的覆辙。
复现评估
复现评估需分层。强复现:所有报告分数都有 SHA-256 摘要背书——输入数据集与运行脚本在每次运行前哈希、输出结果文件与原始生成在退出时哈希,跨架构 replay 还预注册了源码树哈希、通过标准与可证伪预测;结果文件含每题原始生成与 solver 代码,读者可独立重跑 solver 核验分数,无需引擎即可审计数字诚实性;字节精确测量附带构建与确定性配置(GGML_DETERMINISTIC=1、CUBLAS_WORKSPACE_CONFIG=:4096:8)。弱复现:生成复现需闭源 Merlin/Taliesin benchmark 套件,仅按单独条款提供;状态捕获与恢复、存储布局、去重哈希等核心机制完全闭源。算力门槛:本地证明在 RTX 5090(32 GB)上跑,规模提升需租 H100/B200,作者报告 31B 全 30 题总云花费约 8–12 欧元,对个人可负担,但'字节精确'依赖企业版引擎后端(realmerlin-v3.4),难在开源栈(vLLM/llama.cpp)上直接复现。综合看,这是'结果可审计但机制不可复现'的典型工业经验报告。
论文图表
表格对比冷 prefill 与暖嫁接:冷路径需重新计算 11,994 个 prompt token、耗时 1,547.3 ms;暖路径仅推进 1 个 prompt token、耗时 18.1 ms,加速 85.6 倍。下半段还记录了让原生缓存显示同样补贴所需的两个工程补丁:给滑动窗口层启用全尺寸 KV(代价 19.7–25.5 GB @ 64k 上下文)、把缓存调用钉到承载缓存的 slot。
这个表格是成本侧的基础测量,量化了嫁接替代 prefill 的直接收益,并诚实地暴露了原生缓存的两个'静默击败朴素测量'的细节,是理解工程真实成本的关键。
表格列出同一硬件同一 30 题上四种配置的准确率与每题 decode token:bare frozen 12B pass@1 为 56.7%、约 3,300 token;sampling-and-voting ladder 为 76.7%、约 25,000 token;精简 code-routing 无缓存知识为 76.7%、约 4,100 token;code-routing + 嫁接验证库为 90.0%、约 4,360 token。
这个表格是能力与成本权衡的核心数据,清晰展示了'用采样买能力'与'用缓存知识买能力'在 token 经济性上的巨大差距(约五十倍),支撑了论文的经济学论点。
表格列出在租用 H100 上冻结 Gemma-4-31B 的三种工况:Recurrence 8/8、61 token、0.229 Wh、2.7 s;Transfer(held-out 新变体)7/7、25,361 token、72.15 Wh、8.4 min;Full-30 系统分 30/30、56,189 token(1,872/题)、194.45 Wh、21.9 min。整个 run 云花费约 8–12 欧元。
这个表格把论点从 12B 消费级显卡扩展到 31B 数据级 H100,并预注册了输入哈希,证明了方法的可扩展性与跨架构稳健性,是论文最干净的未见泛化证据(迁移 7/7)。
表格以五条诚实负面结论的形式记录边界:飞环在模型不失败时无效(同任务族 216/216 平手);缓存过程可能有害(中国剩余定理卡使准确率降 55 点、token 翻十倍);字节相等是架构内的;位置重定位不字节精确且不可能;LiveBench 多示例块 recurrence 偏弱(5/20)。
这个'负面清单'是工业经验报告诚信度的关键,明确告诉从业者方法的适用边界,也佐证了作者'把负面与正面一起报告'的诚实姿态。