冻结的12B模型在可验证任务上击败前沿模型:100%准确率、零token、位精确、永久有效 A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
冻结模型加验证记忆层,已解决任务零token位精确复用。
前置知识
验证记忆 (Verified Memory) 与冻结模型
一种独立于模型权重的持久化知识库。每条候选解在入库前必须通过一个独立的、绝不参考答案密钥的验证闸门(如机器形式化证明检查器、一致性/变异测试、分层候选测试),只有通过才被存储。模型本身始终冻结、从不微调,能力增长完全发生在记忆层。系统名为 Galahad,底层存储与完整性引擎叫 Merlin。
理解本文的关键在于明白'能力'不在权重里,而在经过验证的可复用方法库里。这彻底区别于'重新训练提升能力'的主流路径,是后续所有 180/180、零 token 结果的因果前提。
无答案验证 (Answer-Key-Free Verification)
闸门在判定候选解是否正确时,绝不查看基准测试的标准答案,而是依赖任务本身的内在可验证性质:形式化证明、输入输出的数学一致性(变异测试 metamorphic testing)、边界用例测试。每个候选要在 150 个边界用例上演练。这样能避免'作弊式'记忆,保证存储的是真正可推广的方法而非对答案的拟合。
这是整个系统能'永久可信'的基石。一个会偷看答案的闸门只能复现基准题,而本文的负对照(清空记忆得 0 分)与细微错误候选被拒实验都依赖闸门有真正的'牙齿'。
精确内容寻址 (Exact Content Addressing) vs 近似检索
给定查询,系统用确定性内容键精确匹配记忆库条目(而非用近似相似度向量)。实测每个键计算只要 3.7 ns,4500 条中零碰撞,单核 16 GB/s、十六核 63 GB/s 吞吐。对照里一个故意有损的紧凑相似签名匹配器把 94.3% 的条目映射到错误邻居。
本文证明对于可执行的可验证知识,近似检索会灾难性失败而非优雅退化。理解这一点才能看懂 §2.7 把精确寻址定为'设计要求而非偏好'的论断,也是它对整个向量检索行业的核心警示。
位精确确定性复用 (Bit-Exact Deterministic Reuse)
同一个已验证条目被复用时,无论何时执行都返回逐字节相同的输出。这是因为系统在新输入参数上重新执行已存储的验证方法(一次新计算),而非解码新 token。一个'新实例'是参数迁移(如单族出现 3105、390、15150 等从未见过的输入值),所以这不是缓存答案而是缓存方法。
这是审计、可复现、合规场景所需、而普通模型生成永远给不了的属性。标题里'Bit-Exact, Forever'正是这一点,也是它与前缀/KV 缓存(仍要解码新 token)的本质区别。
可移动上下文窗口 (Movable Window)
验证记忆还可作为工作上下文使用。系统在单块 46 GB GPU 上以平坦显存(24433→24696 MB,+263 MB 漂移)维持一个 6,000,000 token 的可移动窗口,5/5 探针在 0.55-0.59 s 深度无关召回。关键:这是有限窗口而非全局注意力——把探针故意放别处时答案就错。
读者极易把'6M token'误解为'全局注意力 6M 上下文'。理解'可移动窗口'这一边界,才能正确评估它与 vLLM(30,399 硬错误)、SGLang(~32000 静默截断)对比的含义与局限。
研究动机
当前提升语言模型能力的主流路径是重新训练或微调权重,但这带来三个结构性代价。第一是昂贵——改进以 GPU-月计价。第二是不透明——每个训练周期产出一个新模型,行为变化需从零重新审计。第三是不可重复——同一个问题问同一个模型不能可靠地得到相同答案,这使普通生成无法满足审计追踪、可复现性或合规签署的需求。更具体地,行业普遍把前沿 API 当作过度参数化、非确定性的执行引擎来用:每次查询都付一次完整生成(往往还带代码执行)代价,按公开每 token 价格计费,去重新推导早已被解决并验证过的工作。作者把这称为'架构浪费',而非前沿智能。在 4500 条的验证库上,行业默认的近似相似检索有 94.3% 的概率选错条目,意味着'看起来已验证'的答案其实是错的——这是当前知识访问方式的系统性隐患。
本文的目标是作者的目标是建立一种模型与知识之间的新契约:模型永远冻结(不微调、不改权重),能力增长发生在一个独立的、持久化的验证记忆层里。每一个被解决的问题族只'存入'一次(解决→无答案验证→存储),之后该族的任何新实例都以零生成 token、位精确、确定性的方式作答,只要记忆存在就永远如此。作者要在输入-输出层面测量这套系统(Galahad,底层 Merlin)的真实表现——准确率、token 数、能耗、延迟、确定性、可扩展性——并公开一个测试台让任何人直接观测这些头部数字,而非凭信任接受。标题宣称被严格限定在'已解决并验证的领土',冷启动推理明确排除在外。
与已有工作不同的是,论文的独特切入角度是'派生与执行解耦':派生一次、无答案验证一次,然后永远以零边际生成 token 执行。这与重新训练、语义缓存/RAG、前缀/KV 缓存、agent 技能库都不同。作者明确按行业经验报告标准(输入-输出层面、可观测、有存档原始构件+哈希锚定)而非方法论文标准来写,因此刻意略去架构/算法/配置。他们甚至引用公开基准承认前沿模型在原始推理上领先任何 12B(AIME 2026 77.5、LiveCodeBench-v6 72.0、MMLU-Pro 77.2),论点只针对'已解决并验证后,谁更优'。审计了六类已发布系统后,作者发现没有一套同时具备精确选择、位精确确定性复用、独立预存储验证三者的——这正是他们切入的空白。
核心方法
整体思路可以直觉地理解:把一个冻结的语言模型和一个不断增长的'验证记忆'并排放置。当一条新查询进来,系统不生成新 token,而是先用确定性精确寻址在记忆里找出对应的已验证方法,再把该方法在新的输入参数上重新执行(这是一次新计算,不是查表),返回位精确结果。技术路线上分两条执行路径:单条已验证项的直接复用,以及把多条已验证项合并进一个工作上下文让模型跨项推理。整个系统的可信度由一条链保证——精确选对条目、位精确重放、独立验证——任何一环变成近似都会让整条链退化为'有时自信地给错答案'的普通检索。可信复用路径比完全沙箱路径快 93.9× 且 140/140 字节一致,五个对抗候选全部被拦,非终止工作返回有界超时而非挂起。$N^* = C_{\text{deposit}} / C_{\text{query}}$ 为盈亏点,约 17-34 次查询回本。
核心创新是把'能力'从权重里剥离出来,放进一个独立、持久、经验证的记忆层,并用精确内容寻址而非近似相似检索来访问。这与已有方法的本质区别有四点同时成立:(1) 精确选择存储条目(4500 条零碰撞),而语义缓存/RAG 按设计就是近似的;(2) 位精确确定性作答,而前缀/KV 缓存[5,8,9]仍要解码新 token;(3) 入库前进行无答案验证且能拒绝细微错误候选,而 agent 技能库[1-4]的接受步骤通常是另一个模型的判断或任务特定 oracle;(4) 复用时零生成 token,180/180×4 模型。作者强调单个机制都不新(验证原理来自差分测试[11,12]、基于测试的选择[13,14]、机器证明[10]),但'精确选择+位精确确定性复用+独立预存储验证'三者合一在一条链上,是他们审计六类系统后没找到的组合。
方法步骤详情
按论文描述的输入-输出层面,方法可分五步。第一步存入:冻结模型(或外部来源)对一个问题族生成候选解。第二步验证:候选进入与领域相适应的无答案闸门——机器形式化证明、自动一致性/变异检查、分层候选测试,每个候选在 150 个边界用例上演练;拒绝的永不入库,接受的唯一化、崩溃安全、精确寻址地存储。第三步复用:新实例进来后,Merlin 用精确内容寻址(实测 3.7 ns/键、$2.71\times10^8$ 键/秒)选出对应条目,冻结模型在该条目上重新执行得到新计算结果(即便从未见过的输入值),端到端选-复用-验证链 1.6 µs 中位、17 µs 95 分位,远低于 6 ms 复用下限。第四步组合:需要多条已验证项的复合问题被求解(5/5 在零 token),移除任一必需项则 0/5,组合结果本身作为新验证知识存储。第五步合并上下文:多条已验证项可被合并进一个工作上下文(最多测到 6 项/14134 token 跨域带溯源),模型在其中命名、推理甚至跨域计算(如 44 N 物理计算需同时用到常数项和计算规则项,二者都不含答案)。
技术新颖性
技术新颖性在于把验证链每一环都做精确并实测,而非停留在设计意图。具体为:(a) 闸门有牙——一个朴素单次检查会接受的细微错误候选被分层验证捕获并拒绝(记录了反例),全部测试输入上零错误候选入库;(b) 唯一性在规模上强制——喂入 6000 条候选(2000 唯一),引擎恰好接收 2000、滤掉 4000 字节相同重复,单字节差异即视为新;(c) 完整性套件 14/14 通过,内容键计算比密码学哈希快 60.2×、比标准库默认快 18.5×,达 3.7 ns/键,跨 100000 次解析输出一致;(d) 故障恢复——硬内存上限下朴素存储直接崩溃(进程死),Merlin 的有界存储在同等上限和工作负载下拒绝超额并存活;中断写后先前提交项完全可读(撕裂写测试零损坏),全进程重启逐字节恢复每条,而同等中断下传统文件存储完全不可读。这些测量把'设计保证'变成了'出货引擎的实测保证'。
实验结果
核心发现可逐一分析。首先,9 个算法/数学问题族的 180 个新参数实例上,冻结 Gemma-4-12B 以零生成 token 得 180/180(100%),整组实测能耗 6.5 Wh;新实例意味着从未见过的输入值(单族就有 3105、390、15150 三种),证明非记忆化。其次,架构不变性——同一机制套到四家厂商四个不相关开放模型(Gemma-4-12B、Qwen3-14B、DeepSeek-Coder-V2-Lite、Phi-4)上,全部 180/180、零 token、能耗 6.3-6.5 Wh。第三,负对照——记忆清空后系统一题都解不出(0 分),权重在两条件下从未改变,全部能力归因于存储知识;一个超出冻结模型自身能力的族,放入外部作者验证解后 30/30 零 token 正确,模型什么都没生成。第四,存储知识组合成新答案——需三条独立存储解的复合问题 5/5 零 token 正确,移除任一必需项则 0/5。第五,验证开放式推理——机器形式化证明被检查器首次接受,故意假命题 2+2=5 被拒;跨四模型各 20+ 推理框架 88/88 一致性闸门接受复用;推理方法迁移 77/80;每次复用零 token,恢复-重验证周期 6-23 ms。第六,Merlin 完整性层——6000 候选接收 2000 唯一、零错误候选入库、14/14 保证、3.7 ns/键、4500 条零碰撞、撕裂写零损坏。第七,精确 vs 近似——4500 条上精确寻址零碰撞,故意有损近似匹配器 94.3% 选错。第八,6M token 窗口——单块 46 GB GPU 平坦显存(24433→24696 MB,+263 MB)维持 6,000,000 token,5/5 探针 0.55-0.59 s 深度无关召回;同卡 vLLM 在 30,399 硬错误,SGLang 过 ~32000 静默截断;复用速度比竞品快 13×/41×/55×(4k/16k/30k)。每验证答案能耗 ~36 mWh(LED 泡亮 13 s),自取材族一次性 solve-and-verify 为 81.1 Wh,组合 run 0.09 Wh,存入 9 族共耗 16579 token。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 9 族 180 新实例核心验证复用 | 准确率 / 每答案生成 token 数 / 整组能耗 | 180/180 (100%),0 token/答案,6.3-6.5 Wh/模型 | 冻结模型 + 清空记忆(负对照):0/180,一题都解不出 | 从 0% 跃升至 100%,且能力完全归因于验证记忆而非权重 |
| 精确寻址 vs 近似相似检索 (4500 条验证库) | 选错条目率 | 0% (4500 条零碰撞,3.7 ns/键) | 故意有损紧凑相似签名匹配器:94.3% 选错邻居 | 选错率从 94.3% 降至 0%,证明精确寻址是设计要求而非偏好 |
| 单 46 GB GPU 存储上下文窗口容量 | 可持有 token 数 (平坦显存) | 6,000,000 token,5/5 探针深度无关 0.55 s 召回 | vLLM 30,399 硬错误;SGLang 过 ~32000 静默截断 | 约 200× 容量差距(类别差异而非余量),复用快 13×/41×/55× |
| 一致性闸门开放式推理复用 | 接受并复用率 (跨 4 模型) | 88/88 (核心),推理方法迁移 77/80,63/66 首次通过 | 形式化检查器拒绝 2+2=5 等假命题(闸门有判别力) | 143 次复用全部零 token,与精确复用一样模型无关 |
| 每答案经济性 vs 前沿 API | 边际 token / 延迟 / 确定性 | 0 token,6-23 ms,位精确,~36 mWh | 前沿 API 每查询一次完整生成 pass(非确定、未验证) | 盈亏点 $N^*\approx17$-$34$ 次查询后永久节省 |
局限与改进
作者承认的局限明确且诚实:(1) 这是行业经验报告而非方法论文,刻意略去架构/算法/配置,验证依赖存档原始构件(NDA 下)和公开测试台;(2) 冷启动推理明确不在范围,公开基准上前沿模型在原始推理领先任何 12B,标题宣称仅针对'已解决并验证的领土';(3) 6M token 窗口是可移动窗口而非全局注意力,深度探针故意放别处时答案就错——这恰恰证明非全局注意力;(4) 合并上下文组合到测试上限(9 小项、6 大项/14134 token 带溯源),跨项计算答案只演示了 2 个,超出未测;(5) 大规模公开基准扫描是预注册未宣称,需先有大记忆库;(6) 机制只适用于你自己运维的模型,闭源文本 API 不暴露零成本复用所需的东西。我自己的观察:闭源+NDA 使独立复现几乎不可能;9 个问题族规模偏小,'族'的定义和难度未充分披露;负对照虽有力但只说明记忆必要、不说明记忆边界;94.3% 选错率用的是'故意有损'设定,对现代生产级向量检索未必公平;2.10 的引擎基线用 Qwen2.5-7B(无引擎能加载该 12B),所以是每引擎能力上限而非同模型三元组。
独立分析的弱点
独立分析的弱点:(1) 可验证性矛盾——论文最大卖点是'可验证',但核心构件在 NDA 下、架构不公开,独立研究者只能信公开测试台的输入-输出,无法审查内部是否真做了所宣称的事(如'闸门从不看答案密钥'无法外部核验)。改进方向:开放 Merlin 引擎或发布可复现的最小子集。(2) 问题族规模与代表性——9 个族、180 实例对一个声称要'累积到数千项'的系统而言是极小样本,且族的具体内容未列。改进方向:在标准算法竞赛题集上做大样本配对统计。(3) 近似检索对比不公平——用'故意有损的紧凑相似签名'得出 94.3% 选错率,再一棍子打死整个向量检索行业,现代嵌入+重排未必如此。改进方向:与真实生产级向量检索做公平 head-to-head。(4) 可移动窗口易被误读——'6M 上下文'的摘要式宣称容易被读者理解为全局注意力,实际是有限窗口。改进方向:清晰量化窗口大小、切换开销、命中率。(5) 验证门槛的领域局限——一致性闸门、形式化证明只覆盖特定可机器检查领域,对人文、创意等无法机器检查的领域不适用。改进方向:扩展到声明式事实知识的独立符号权威(作者已列为 roadmap)。
未来方向
作者明确列出的 roadmap(标注为未来、非宣称):(1) 把记忆扩展到跨多域数千验证项,所需的安全存入闸门和唯一性账本已演示(§2.6);(2) 扩大存储知识组合为更大计算结果(§2.4 是已演示核心),包括超出已测 9 项的合并上下文组合;(3) 在生产流量上做命中率研究,把每族盈亏点 $N^*$ 转为系统级节省数字;(4) 记忆足够大后做大规模公开基准评估并配对统计;(5) 通过独立符号权威把验证闸门扩展到声明式事实知识(早期闸门结果已存档,完整留出评估是未来工作);(6) 自主知识累积——持续自驱 solve-verify-deposit,以与上述相同证据标准演示。基于成果可延伸的方向:把可验证记忆与 RLHF/偏好学习结合用于不可形式化领域;把可移动大窗口用于长文档/代码库的检索增强;把验证链范式迁移到多模态(图像/视频的可验证计算);以及把'派生-执行解耦'思路用于多智能体间的可信知识共享。
复现评估
复现评估:作者提供了公开测试台(https://corbenic-galahad-bench.hf.space,仓库 https://github.com/corbenicai/galahad-bench),免费但限时限流,任何人可亲自跑'冻结模型冷启动 vs 验证记忆'对比,看 token/能耗/确定性/验证状态——这是输入-输出层面的可复现。但系统本体(Galahad/Merlin)是闭源专有,架构/算法/配置全部略去,哈希锚定的原始构件在 NDA 下(Appendix A),因此无法独立复现内部机制。算力要求相对温和:复用电池单模型 6.3-6.5 Wh、每答案 ~36 mWh、一次性 solve-and-verify 81.1 Wh,单块 46 GB GPU 即可(6M token 窗口也是这块卡)。9 个问题族的具体内容未公开列出,是复现的另一个障碍。综合判断:输入-输出可验证、内部机制不可复现,整体复现难度高(依赖信任公开测试台与 NDA 下的存档构件)。
论文图表
对比两种回答已解决问题的方式。上半路径:前沿模型每次查询都付一次完整生成+代码执行 pass(数百到数千 token、非确定、多秒往返)。下半路径:Galahad 用 1.4 µs 选出验证记忆项,冻结模型在新参数上重新执行,在 6-23 ms 内以 0 生成 token 返回位精确答案。存入路径(解决一次→无答案验证→存储)每个问题族只跑一次。
一图说清整个论文的核心主张——'派生与执行解耦',是理解后续所有数字(零 token、毫秒级、位精确)的锚点。