← 返回 2026-08-12

幂律图注意力:缩放点积注意力的精确推广与推理期的经验坍缩 Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

Burc Gokden 📅 2026-08-10 👍 7 2026-08-17 18:30
Lean形式化验证 Perron–Frobenius理论 大语言模型 学习双线性算子 注意力机制 自组织临界性

用输入生成的幂律正算子替换注意力的固定双线性形式,训练后坍缩为可缓存的常量算子。

前置知识

缩放点积注意力(SDPA)

Transformer 的标准注意力:得分由查询与键的欧氏内积 $q^\top k/\sqrt{d_k}$ 给出,经因果掩码 softmax 后对值向量加权平均。其比较两个向量所用的双线性形式被固定为单位矩阵 $I$,所有数据集层面的注意力结构都弥散在线性投影权重 $W_Q W_K^\top$ 中。

本文的核心对象 PLGA 正是把 SDPA 中这个固定的双线性形式替换为由输入生成的可学习算子 $G_{LM}$;『$G_{LM}=I$ 时精确包含 SDPA』是全文第一条定理(Lean 机器检验),读懂一切对比都必须以它为参照点。

旋转位置编码(RoPE)

对每个位置的查询、键施加正交块对角旋转 $R_n$,平面频率 $\theta_j=\Theta^{-2(j-1)/d_k}$(参考配置 $\Theta=10^4$),满足 $R_nR_m=R_{n+m}$,使 $G=I$ 时得分只依赖位置差 $m-n$(相对位置性质)。

PLDR-LLM 中 RoPE 被施加两次:既作用于打分,也作用于构成密度算子的旋转查询。Proposition 4.1 的交换子判据(哪些算子保持相对位置依赖)与 5.4 节的『旋转捻搓』不变性机制,完全建立在旋转群的表示结构上。

双线性形式

形如 $B(q,k)=q^\top G k$ 的函数,$G$ 为 $d_k\times d_k$ 矩阵;欧氏内积对应 $G=I$。若查询和键都用同一可逆线性映射 $S$ 变换,保持 $B$ 不变的变换律是合同变换 $G'=S^{-\top}GS^{-1}$,而非相似变换,因此正确的不变量是合同不变量(如对称部分的符号差、秩数据)而不是特征值。

本文的『算子扇区』就是一个头空间双线性形式:判断常量算子能否被吸收进查询投影(Theorem 5.4(ii))、以及 Conjecture 8.3 的跨域算子迁移变换律,都直接依赖双线性形式的合同几何。

Perron–Frobenius 理论

经典矩阵分析结果:元素严格为正的方阵,其谱半径 $\rho(A)$ 是单重正特征值(Perron 根),对应的左右特征向量均为正,其余特征值的模严格小于 $\rho(A)$。它把『正性』转化为可检验的谱结构约束。

PLGA 的交互张量 $A_{LM}$ 因构造满足逐元素 $A_{LM}\ge\epsilon=10^{-9}$,故自动具备该谱结构(Theorem 3.8)。这是论文『正性带来可证明结构』的核心实例,也是后续对训练检查点做谱测量与秩一奇点分析的数学基础。

自组织临界性(SOC)

沙堆等缓慢驱动、耗散系统的现象学:系统无需精细调参即自发演化到临界态,呈现幂律分布与无特征尺度的长程关联。物理上用控制参数(驱动)与序参量(涨落统计量)刻画相变:临界点关联长度发散、谱隙闭合,离开临界点则指数衰减。

源论文把 PLDR-LLM 预训练解读为 SOC:$(\eta_{\max},T_w)$ 是控制参数,演绎输出波动的序参量 $m(\theta)$ 区分近临界/亚临界两相。本文把这一解读降格为现象学框架并列出可证伪判据,这是理解全文认识论立场的关键背景。

NOTEARS 无环性正则

结构学习中把 DAG 搜索转成连续优化的技巧:对矩阵 $M$,量 $h(M)=\mathrm{tr}\,e^{M\odot M}-d$ 可展开为闭走(closed walk)计数的级数,恒非负且为零当且仅当 $M$ 的加权支撑图无有向环,因此可作为平滑的环惩罚。

PLDR-LLM 用它正则化演绎输出张量,但论文证明正性($A_{LM}\ge\epsilon$)使精确无环不可达——未归一化下限 $d_k\epsilon^2\approx6.4\times10^{-17}$、归一化对数损失下限 $\log(1+\epsilon^2)\approx10^{-18}$,只能读作『环内容惩罚』。这一『正性障碍』分析是方法章的重要一环。

研究动机

现代大语言模型几乎全部构建在缩放点积注意力之上:注意力得分是线性投影后 token 表示的欧氏内积,比较查询与键所用的双线性形式被先验地固定为单位阵 $I$。这意味着注意力中数据集层面的结构全部弥散在投影权重里,不存在一个可直接正则化、谱测量或跨模型移植的『算子扇区』。作者此前系列工作(CoulGAT 2019、Power Law Graph Transformer 2021、PLDR-LLM 2024–2026)报告了三项经验发现:预训练后演绎输出对输入变化近似不变(相对涨落 $10^{-6}$ 至 $10^{-11}$,最优模型达浮点零);生成器 $A$ 收敛到数值秩一、跨头同行的『学习奇点』;训练是否落在临界样区间(由最大学习率与预热步数控制)决定模型能否泛化。但这些发现散落在各源论文中,解释性说法(『度量张量』『能量-曲率』『自组织临界性』)与严格结论混在一起:浮点零行列式曾被当作低秩证据(后被证明只是数值下溢),证明与猜想未分级,缺乏统一的分析性描述。

本文的目标是本文的目标是对 PLGA 注意力与 PLDR-LLM 架构给出完整的分析性刻画,并把整个研究纲领的每条断言放到与其真实证据强度相符的位置上。具体做四件事:(a) 形式化定义每个组件与端到端模型映射,逐条对照三个钉定快照的参考实现(TensorFlow v500、PyTorch v510、HuggingFace 移植)验证;(b) 证明支撑三大经验发现的结构性质,包括精确不变性下的推理坍缩定理、显式常数的扰动界,以及一个关于不变性起源的三阶段条件性机制分析,其假设凡可测量者均在发布检查点上直接实测;(c) 把 PLDR-LLM 相对 SDPA 基点的每项优势绑定到对应结果的认识论等级,并以同等显式程度列出代价(训练开销、临界区搜索、小规模基准持平、理论债、单次运行证据);(d) 把开放主张整理为精确可证伪的猜想:不变算子的刚性、序参量的谱形式、跨域算子迁移。全文每条结论标注为定理、条件定理、测量或猜想四类之一,部分证明核心以 Lean 4 机器检验。

与已有工作不同的是,独特切入角度在于认识论的严格化,而非再提一个新注意力变体。作者把先前工作中的物理隐喻全部降级为类比:明确指出逐元素正性既不蕴含对称也不蕴含正定,故 $A_{LM}$、$G_{LM}$ 并非真正的黎曼度量或信息度量;『尺度维数』『RG 固定点』只作为显式标注的类比保留。凡可测量的假设一律实测而非假定:秩一奇点用奇异值谱(而非病态行列式)确认;LayerNorm 尺度误差、捻搓能量、交换子残差、复合行映射的雅可比、缓存-重算逐层偏差,全部在钉定的 41B token 检查点上逐一测出,甚至报告了与便利假设相矛盾的测量(独立性理想化实测偏离 33%、扰动预算无法闭合解码边际)。核心代数与解析证明以 Lean 4/mathlib 形式化并过内核检验,CI 公理审计确保只依赖标准经典原理,附录 C 给出逐条覆盖表。由此得到一条主证据链,每环的认识论地位显式标注,低阶结果从不当高阶结论的前提——这种『先分类证据、再谈机制』的做法在架构论文中极为罕见。

核心方法

先说直觉:PLGA 让『如何比较两个 token』这件事本身由模型从当前输入中学出来。SDPA 用固定的欧氏内积打分,PLGA 则为每次输入实时生成一个 $d_k\times d_k$ 双线性算子 $G_{LM}$,再按 $q^\top G_{LM}k$ 打分。技术上是一条五算子链:输入 $\to$ 查询 Gram『密度算子』$\hat D=\hat Q^\top\hat Q$ $\to$ 经深度行级度量学习者 $\Phi_{res}$ 得生成器 $A$ $\to$ 正性化得交互张量 $A_{LM}$ $\to$ 逐元素幂律得势张量 $A_P$ $\to$ 线性叠加得得分算子 $G_{LM}=aA_P+b_a$,最后经 $\hat Q G_{LM}\hat K^\top/\sqrt{d_k}$、因果掩码 softmax 产生注意力输出。关键设计是 $A\mapsto A\odot P=\exp(P\odot\log A)$ 的逐元素幂律(指数 $P$ 逐元素可学习)与 $\epsilon=10^{-9}$ 下限保证的严格逐元素正性。这些中间张量 $(A,A_{LM},A_P,G_{LM},E_{LM})$ 与下一 token 概率一起作为『演绎输出』暴露。整体是 decoder-only 架构:RoPE 旋转在形成 Gram 与打分之前各施加一次;训练目标是块状交叉熵加 NOTEARS 式 DAG 正则;推理支持 KV-cache 与 G-cache 两级嵌套缓存,后者跳过整条度量学习链,实测约 3 倍加速。

核心创新是把注意力的『比较规则』本身变成输入生成、可暴露、可缓存的对象,并证明训练会自发坍缩掉它的输入依赖。与已有方法的本质区别有三层。第一,SDPA 的双线性形式 $W_QW_K^\top$ 虽是习得常量,但被锁死在预投影坐标里;PLGA 的 $G_{LM}$ 由当前输入的旋转查询 Gram 经深度非线性正幂律链现算,训练时得分映射对输入是非线性的,梯度额外流经 $\partial G_{LM}/\partial(\Phi_{res},W,P,a,b_a)$——Theorem 5.4(iii) 证明两种参数化诱导不同的梯度流(训练-推理不对称),匹配数据与调度的消融中可学习 $G_{LM}$ 优于身份/随机/移植常量。第二,近临界预训练后演绎输出对输入近似不变(相对涨落 $10^{-6}$–$10^{-11}$,41B token 模型达浮点零),Theorem 5.4(ii) 证明:精确不变性下推理映射与删除整条子网络 (3.3)–(3.6)、代之以常量 $G^*$ 的模型完全相同——深度网络在推理时可被单个缓存张量替换,发布基准成绩不变。第三,该算子扇区是可检验的『定律表示』:正性给 Perron–Frobenius 结构,秩一奇点、交换子残差、DAG 环内容、序参量均可直接测量,这是 SDPA 按构造不具备的。

方法步骤详情

逐步流程(单头,宽 $d_k$,$h$ 头共享度量学习者):(1) 密度算子:对旋转后查询取未中心化二阶矩 $\hat D=\hat Q^\top\hat Q$(对称半正定,秩 $\le\min(S,d_k)$)。(2) 生成器:$A=\Phi_{res}(\mathrm{LN}(\hat D))$;$\Phi_{res}$ 每层一个、由 $N_{res}=8$ 个残差单元组成、每单元两个完整 SwiGLU 门控块,全部行级独立作用,故存在单一共享行映射 $\phi$(Proposition 3.11),这也解释了训练后跨头同行的观测。(3) 正性化:$A_{LM}=\mathrm{iSwiGLU}(WA+b_W)+\epsilon$,其中 $\mathrm{iSwiGLU}(u)=u^2\varsigma(u)\ge0$、$\epsilon=10^{-9}$。(4) 幂律:$A_P=A_{LM}\odot P=\exp(P\odot\log A_{LM})$。(5) 叠加:$G_{LM}=aA_P+b_a$。(6) 打分与输出:$E_{nm}=\hat q_n^\top G_{LM}\hat k_m/\sqrt{d_k}$,因果掩码 softmax 得 $E_{LM}$,$V_{LM}=E_{LM}V$。(7) 训练:块内所有对齐行做交叉熵(中间行的标签同时出现在条件集中,属目标暴露的辅助项;首行与末行结构性地等于部署条件),加 DAG 正则 $\frac{1}{BLh}\sum\log(\mathrm{tr}\,e^{M\odot M}/d_k)$。(8) 推理:KV-cache 缓存旋转键、值与提示期推断的 $A$;G-cache 进一步缓存 $A_{LM},G_{LM}$ 并跳过 (3.4)–(3.6),每步按 (4.13) 用冻结算子打分,实测约 3 倍加速且发布基准逐位不变。

技术新颖性

与最近邻工作的逐点对照显出其新颖性。Synthesizer 直接生成或学习得分矩阵、talking-heads 跨头学线性映射,但都不产生暴露的正算子链;快权重程序员一系(含线性注意力)以累积外积状态 $S_t=\sum_{n\le t}\phi(k_n)v_n^\top$ 逐 token 因果更新,按构造保持『历史行前缀一致性』,而 PLGA 用一个序列全局的查询 Gram 故意换掉该性质,让所有已知 token 共同塑造一个非线性习得算子(掩码累积 Gram (4.16) 是可插拔的折中选项);PaTH attention 把数据依赖的 Householder 乘积放进每对 query-key 的位置路径,逐链构造;CCQ 用中心化因果运行键协方差 $\Sigma_t$ 的 prescribed 仿射收缩 $I-\lambda_t\Sigma_t$ 做逐 token 读出修正;XCiT 把特征空间协方差矩阵本身(归一化加 softmax)当作注意力图以换取线性复杂度,而 PLGA 把查询 Gram 喂给深行级学习者,产生的 $G_{LM}$ 仍作用于普通 token-token 注意力内部;AoH 提取 SDPA 头的冻结双线性形式做数据无关谱诊断,但既无输入条件生成器也无算子移除定理。PLGA 独有的组合是:从旋转查询 Gram 出发、经深度严格正幂律生成器、逐调用生成单个 $d_k\times d_k$ 算子、全行共享、并作为演绎张量被正则化、谱测量、移植与缓存。

Information flow in one PLGA head
Figure 1: Information flow in one PLGA head

实验结果

发现按认识论分三层。定理层(核心经 Lean 4 检验):PLGA 在 $G_{LM}=I$ 处精确包含 SDPA;逐元素正性赋予 $A_{LM}$ Perron–Frobenius 谱结构;非共振下只有 RoPE 交换子中的算子保持相对位置依赖,$d_k=64$ 时交换子实维数 64,其余 $64^2-64=4032$ 维/头均为绝对位置敏感方向;精确输入不变性下推理坍缩为常量算子广义 SDPA。测量层(41B token 检查点 $L=5,h=14,d_k=64$,560 个层-头-提示实例):生成器 $A$ 在全部实例中数值秩一($\sigma_2/\sigma_1\le1.4\times10^{-8}$),跨头相对 RMS $\le1.6\times10^{-8}$,而初始化对照为秩 63、$\sigma_2/\sigma_1$ 中位 0.69,证明坍缩是训练结果;$A_{LM}$ 接近满秩(中位 62.5/64),浮点零行列式确系下溢;缓存与全量重算在 960 次逐层比较中 $G_{LM}$ 逐位相等,logit 最大偏差 $3.6\times10^{-5}$,实测最小 top-2 边际 $6.0\times10^{-3}$,贪心 token 全程一致;历史行在 2,048,000 次随机后缀比较中零变动(对照检查点 74.5% 移动);WikiText-2 上块状 CE 与顺序 NLL 均为 3.479446 nats/token(差 $1.8\times10^{-9}$);8 个基准任务 800 项两种打分协议零 argmax 翻转,TruthfulQA mc2 均值 0.397662 完全一致。诚实层:扰动预算组装系数 $\approx7.3\times10^{46}$,在单次舍入半径 $3.4\times10^{-5}$ 下超出半边际约 45 个数量级,不能证明逐位解码;捻搓在实测长度仅移除约 10%(中位)非交换子能量;序参量 $m$($G_{LM}$ 恰为 0、最敏感的 $A$ 最大 $4.9\times10^{-9}$)在相层面区分近临界与亚临界(后者 $m\sim1$–50),缓存带来约 3 倍推理加速。

任务指标本文基线提升
缓存推理保真度(贪心解码 48 token × 4 提示,960 次逐层比较) 缓存算子偏差 / logit 最大偏差 / 最小 top-2 边际 G_LM 在全部 960 次比较中逐位相等(ε_G=0);logit 最大偏差 3.6×10⁻⁵(中位 ≈10⁻⁵),最小边际 6.0×10⁻³,贪心 token 选择逐步一致 全前缀每步重算的参考语义(未缓存在线循环) G-cache 实测约 3× 加速且在测试负载上与未缓存模型在 10⁻⁵ logit 层面不可区分(低于最小决策边际两个数量级)
历史行前缀一致性(同长输入共享前缀、随机后缀扰动 2,048,000 次比较) 被扰动的比较条目比例 坍缩检查点:0 条目变动(逐位不变,唯一移动是层 4 中 270 个 |A|≤1.17×10⁻¹⁰ 的条目) 未坍缩对照检查点:74.5% 条目移动(最大 9.4×10⁻⁴),逐层 G_LM 偏差达 3.0×10⁻² 坍缩使一次性块式打分的历史行等价于部署的最终行条件;前缀一致性的出现与坍缩现象绑定
块状 CE vs 顺序 NLL(WikiText-2 验证集 48 个 257-token 窗口,12,288 个评分位置) nats/token 3.479446 vs 3.479446,聚合差 1.8×10⁻⁹,逐 token 缺口中位 9.6×10⁻⁷、最大 2.4×10⁻⁵ 对照(未坍缩)检查点聚合差 4.3×10⁻⁶,逐 token 缺口大两个数量级(最大 2.8×10⁻³)且随窗口内位置衰减 坍缩检查点上块式目标值即自回归 NLL,训练目标与部署语义在测量精度内一致
真实基准项两种打分协议(8 任务 × 100 项,3,052 候选,32,246 个候选 token) argmax 翻转数 / TruthfulQA mc2 概率质量差 7 个 argmax 任务零翻转、零不一致对(2,901 对);TruthfulQA mc2 均值 0.397662 在两协议下一致(差 8.5×10⁻¹⁰,逐项差中位 0、最大 3.7×10⁻⁷) 对照检查点:两协议仍零翻转,但 TruthfulQA 逐项最大差 4.7×10⁻⁵、候选级分数差随长度增长至 2.3×10⁻³ 发布的单次块式评分协议在坍缩检查点上可安全替代顺序链式评分,结论对打分协议稳健
算子不变性(序参量 m(θ):两次独立生成运行的演绎输出相对 RMS 波动) 相对 RMS 涨落 近临界模型 m ∼ 10⁻⁶–10⁻¹¹;41B token 模型的 G_LM/AP 达浮点零(审计复现:G_LM 恰为 0,A 最大 4.9×10⁻⁹) 亚临界模型 m ∼ 1–50(训练损失更低但生成退化为 token 沙拉、基准近随机) 序参量在相层面分离泛化好坏并同意基准排名,给出 SDPA 不具备的内在评估诊断(其算子扇区按构造恒常、m 恒为零)

局限与改进

作者明确承认并经我补充的局限如下。证据基础:全部经验锚点来自单一研究纲领、每条件单次训练运行、无不确定性量化;最强的 41B token 不变性观测与训练量混淆;已发布实验规模约 110M 参数、8B/41B token,基准成绩与 SDPA 参考相当而非占优(41B 长跑仅在平均上反超),十亿参数级行为未知。理论债:不变性机制是『带已证要素的定量假设』——第二阶段的独立性理想化被实测证伪(前后半段聚合差中位 33%、最高 90%);第三阶段的收缩只在采样点验证(逐单元并不收缩:单元雅可比范数中位 0.47、最大 20.8,复合后才收缩 7 个数量级以上),无管道一致 Lipschitz 证书;第一阶段的捻搓在实测上下文长度 $S=32$–43 仅移除约 10% 非交换子能量,$C_\Theta/S\approx43.9$ 在 $S=1024$ 是空界。坍缩定理本身条件于不变性,而不变性是测量假设;匹配资源下 SDPA 无法实现同函数的严格分离未证明。审计范围:一个检查点、八条 32–43 token 提示、单一软件栈;预算代理距证明逐位解码差约 45 个数量级。我的补充观察:审计中贪心解码出现重复循环(重复 4-gram 比例 0.49–0.80),作者声明不据此评判生成质量,但小规模生成退化值得警惕;『隐藏权重』部署非对称被作者自己标注为未建立的安全性;训练开销(度量学习者参数约为注意力参数 129–149 倍)与临界区搜索的脆弱性使其难以在标准流程中落地。

独立分析的弱点

弱点一:单运行、无种间方差。近临界/亚临界的相区分建立在每格点一次训练上,序参量在相内的非单调反转无法解释。改进方向:按第 9 节纲领做多种子、$(\eta_{\max},T_w)$ 网格化训练,报告 $m(\theta)$ 与基准分的置信区间。弱点二:机制第二阶段的统计理想化与数据相距甚远(实测前后半段差 33%),捻搓又只解释约 10% 能量移除,归因实际全靠第三阶段直接测量,机制链条的中间环节偏弱。改进方向:放弃独立性假设,改用因果依赖下的集中论证,或对 $\hat D$ 的谱做经验分布建模并做频率分解审计。弱点三:坍缩只在终态测量;训练中途目标暴露(中间行标签进入条件集)是否被利用完全未测。改进方向:沿训练轨迹同时跟踪历史行一致性与块式-顺序 NLL 差距,定位坍缩涌现点。弱点四:缓存保真只有经验不可区分加一个失效的保守界,无裕度感知证书。改进方向:区间分析或随机平滑式传播,沿实际解码状态认证 $2B<\Delta$。弱点五:SOC 框架有循环定义风险(相由序参量与生成质量定义再用其解释),无自调反馈机制、有限尺寸标度或雪崩统计证据。改进方向:预先固定独立相判据并盲评;在合成 SOC 系统上先验证谱字典。弱点六:工程成本——度量学习者参数为注意力参数的 129–149 倍、临界区搜索对初始化与 SwiGLU:LU 比例敏感、有 dragon-king 失败模式,而 SDPA 更易训练。改进方向:研究缩小近临界窗的调度或正则化,或用 $m(\theta)$ 在线监控自动 abort 坏跑。

未来方向

作者提出的方向非常具体。理论侧:(1) 从梯度流推导共享行映射 $\phi$ 在临界 $(\eta_{\max},T_w)$ 处向常量映射流形的收敛,把 Hypothesis 5.14 变成训练动力学定理,理想情况是把常量映射流形识别为吸引不变流形(开放问题 1);(2) 构造显式粗粒化使层映射近似协变,把 RG 类比升级为定理(开放问题 2);(3) 跨尺度、检查点与训练轨迹测量 $G^*$ 到 RoPE 交换子的距离——审计已给首个测量(逐层残差中位 0.98/0.99/0.93/0.71/0.66),开放问题是其随规模的行为,并把交换子投影做成因果消融(开放问题 3)。猜想侧:Conjecture 8.1 的有限尺寸幂律 $\epsilon\sim d_k^{-\alpha}N_{\text{tokens}}^{-\beta}$;Conjecture 8.2 把序参量升级为可从单次前向计算的谱判据(近临界模型谱在 1 处幂律堆积、亚临界有均匀谱隙,推理能力单调依赖指数 $\vartheta$);Conjecture 8.3/8.4 的算子合同对齐迁移 $G_2^*=S^{-\top}G_1^*S^{-1}$ 与整模型域迁移,可用两个同类 SOC 沙堆模拟器训练后直接检验。工程侧:Gram 侧有效掩码或累积 Gram (4.16) 以恢复一次性全行自回归语义与填充批处理;裕度感知缓存认证;把 $m(\theta)$ 推进为小模型、非语言域、数据受限场景的内在评估工具;以及同栈匹配实现的性能剖析以厘清 27–39% 速度优势的归属。

复现评估

复现条件异常充分,在单作者论文中少见。代码:五个仓库(TensorFlow 原框架、PyTorch KVG-cache、SOC 训练、CoulGAT、Power Law Graph Transformer)加两个评估 harness fork,全部钉定 commit;HuggingFace fromthesky 组织提供各系列预训练模型(110M 级)与自定义 PldrllmForCausalLM 移植,配置超参齐全($A_{dff}=170,N_{res}=8,n_A=2,d_k=64,\epsilon_{LN}=10^{-6}$,RoPE 基数 $10^4$)。验证:Lean 4/mathlib 形式化仓库 PLDR-LLM-Math-Foundations 无 sorry/admit,CI 公理审计只允许三个标准公理,附录 C 给逐条覆盖表;附录 D 数值审计的代码、依赖清单、结果文件与原始数组随仓库发布,模型 revision、modeling 文件 SHA-256、数据集 parquet revision 与逐文件哈希全部钉定,另有模型无关单元测试从原始数组重导全部摘要。算力:审计在单张消费级 GPU 上 float32 eager 运行,钉定 cuBLAS workspace 并强制确定性算法后可逐位复现(两次背靠背完整重跑逐字节一致)。难度评估:复现审计与缓存推理属中等偏低(下载检查点、单 GPU 即可);复现训练较难——需在 $(\eta_{\max},T_w)$ 平面搜索近临界区且对初始化细节(如 $W_V$ 初始化差异会移动临界区)敏感;独立复现跨规模基准表则成本随规模上升。