← 返回 2026-08-20

训练留痕:用于语言模型血缘验证的中心化残差签名 Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

Aman Singh Thakur, Rayan Khoury 📅 2026-08-14 👍 18 2026-08-25 18:30
LLM供应链安全 权重指纹 模型审计 模型溯源 残差网络

从残差分支乘积中剔除通用恒等结构,仅凭权重判断两个模型检查点是否同源

前置知识

残差块与分支乘积

残差网络的基本单元满足 $x_{\ell+1}=x_\ell+F_\ell(x_\ell)$:skip 连接让恒等映射直接通过,分支 $F_\ell$ 只学习对表示的修正。当分支由 $K$ 个线性层与中间非线性组成时,丢弃非线性、把线性层连乘得到 $M_\ell=W_K\cdots W_1\in\mathbb{R}^{d\times d}$,称为分支乘积。它把残差流映射回自身坐标系,对角元可以"同类相比",是论文所有分析的载体。

论文的血缘信号完全定义在分支乘积的结构上,理解它才能看懂中心化操作和签名提取。

迹集中度 s(M)

定义为 $s(M)=|\operatorname{tr}(M)|/\|M\|_F$,度量矩阵能量沿单位阵方向的占比。论文观察到:训练后正确配对的分支乘积 $s$ 远高于错配投影(后者期望约 $1/\sqrt{d}$),且该现象跨六个语言模型家族成立。但独立训练的模型同样具备该结构,所以它只是"训练过的残差网络"的通用指纹。

迹集中度用于验证残差结构存在并门控不可靠分支;论文最关键的转念恰是证明它本身不能当血统证据。

函数保持变换与重参数化不变性

逐块置换隐藏单元($W_{\text{in}}\leftarrow PW_{\text{in}},\;W_{\text{out}}\leftarrow W_{\text{out}}P^{\top}$)和互逆缩放($W_{\text{in}}\leftarrow DW_{\text{in}},\;W_{\text{out}}\leftarrow W_{\text{out}}D^{-1}$)都不改变模型计算的函数,却能让朴素权重距离彻底失效。Re-Basin 等方法通过求解置换对齐来恢复比较,但每对模型代价 $O(Ld^3)$。

检查点"清洗"攻击正是利用这些对称性伪装盗版模型;本文签名对此具有代数级不变性,是核心卖点。

匈牙利算法

求解最优指派问题的多项式算法(复杂度 $O(L^3)$):给定 $L\times L$ 相似度矩阵 $G$,找到使总相似度最大的块一一对应 $\pi^*=\arg\max_{\pi}\sum_i G_{i,\pi(i)}$。在模型比较语境下用于把两个网络的隐藏单元或层对齐,是 permutation-based 比较的标准工具。

打分前必须把两个模型的残差块正确配对,配对质量直接决定血缘分数的可靠性。

经验零分布与 conformal 校准

用 $n$ 个独立训练的同架构模型 $U_j$ 与参考模型 $A$ 计算分数,构成零分布 $N_A=\{L(A,U_j)\}$,判定阈值取其最大值 $\tau=\max_j L(A,U_j)$。该协议给出 p 值 $\le 1/(n+1)$ 的统计保证,但要求样本可交换——同一根模型的后代彼此不独立,有效样本量取决于独立根的个数。

判定 RELATED 需要知道"无关模型最高能得多少分",这是方法统计严谨性的来源,也是其主要软肋所在。

研究动机

开放权重语言模型早已不是一次性发布物:基座会被微调、RLHF、量化、剪枝、LoRA 合并甚至多模型线性插值后改名再分发,形成大量"权重后代",而血统往往没有文档、甚至被刻意抹去。逐一检验现有机制(论文 Table 1)会发现全面失效:密码学哈希在任何权重改动后立即失效;模型卡、元数据与 proof-of-learning(Jia et al., 2021)依赖分发者诚实记录;参数水印/后门水印必须在发布前主动植入,而 Lukas et al.(2022)的调研发现没有方案能可靠同时存活微调与剪枝,存量无水印检查点根本无从验证;IPGuard、CKA、SVCCA 等行为或表征方法需要探测数据和前向传播,度量的是"输出/表征相似"而非权重继承;权重余弦、Frobenius 距离等是未校准的全局标量,一次隐藏单元置换就能摧毁;Re-Basin 虽能恢复对齐,但每对模型要解 $L$ 个匈牙利指派($O(Ld^3)$)。于是核心问题浮现:给定两个架构兼容的检查点,能否只看权重、不用任何数据,判断它们是否共享权重祖先?

本文的目标是本文要建立一个"被动、数据免费、白盒"的血缘验证协议:输入为深度 $L$ 与隐藏维度 $d$ 都相同的残差架构检查点对,验证器仅读权重,输出 RELATED/UNRELATED;分数对称($L(A,B)=L(B,A)$),只能证明共同祖先、不能判定下降方向。可量化的目标包括:对微调、LoRA 合并、最高 70% 剪枝、8/6-bit 量化等常见后训练操作保持 AUROC=1.0;在函数保持的"检查点清洗"(逐块置换、互逆重缩放及其组合)下分数不变,同时比最鲁棒的基线 Re-Basin+scale 在 GPT-2 上快 76 倍(5.1ms 对 387.9ms);能明确区分权重继承与行为模仿——蒸馏学生的输出几乎照抄教师但血缘分数接近零($L\approx 0.002$)。最后在六个语言模型家族和公开 LLaMA-2 生态(3 个文档化后代、7 个独立训练的架构克隆)上完成真实世界验证。

与已有工作不同的是,本文的切入角度建立在一个被忽视的观察(Park, 2026)及其"反面"之上:训练后的残差块中,正确配对的投影矩阵乘积迹高度集中——但独立训练的模型同样如此,因此迹集中只是"训练过残差网络"的通用指纹,不能当血统证据(论文实测:只依赖迹的验证器 AUROC 仅 0.417)。作者的关键转念是做减法:把分支乘积沿恒等方向的通用分量减掉,只比较检查点专属的无迹残差,再用独立模型构建经验零分布校准阈值。与既有路线相比定位独特:不需要发布前植入(对比水印)、不需要数据与前向传播(对比 CKA/SVCCA/REEF)、不需要检查点集合(对比 MoTHer)、不依赖文档(对比模型卡),单对权重即可完成校准判定。这填补了"事后、被动、可对抗重参数化"的模型溯源空白。

核心方法

直觉上,训练像雕刀,会在权重里留下只能被继承、无法被复刻的凿痕。残差块的分支由若干线性层构成,其连乘 $M_\ell=W_K\cdots W_1$ 恰好把残差流映射回自身坐标系,因此训练诱发的结构可以直接从矩阵读出:正确配对的分支乘积能量向单位阵集中(迹集中度 $s(M)$ 远高于错配,训练后的 ResNet 达到 100% 配对而同 loss 的 PlainNet 只有 3%)。但这个"对齐恒等"的结构是所有训练过的残差模型共有的,真正携带血统的是减去 $\frac{\operatorname{tr}(M_\ell)}{d}I$ 之后剩下的无迹残差 $R_\ell$:权重保持的后代操作会原样继承它,而独立训练在统计上无法复现。技术路线为:对每个残差块按架构提取完整分支乘积,中心化并单位化得到签名 $\phi_\ell$,用匈牙利算法跨模型对齐块,平均块级余弦相似度得到血缘分数 $L(A,B)\in[-1,1]$,最后与独立训练模型构成的经验零分布比较给出校准判定。全程不需要数据、前向传播或对齐搜索。

全文最重要的想法是把分支乘积做正交分解 $M_\ell=\frac{\operatorname{tr}(M_\ell)}{d}I+E_\ell$(Frobenius 内积下恒等阵与无迹矩阵张成正交子空间),并论证两个成分扮演完全不同的角色:恒等对齐分量是训练动力学的通用产物——独立模型同样具备,故不能证明血统(只用迹的验证器 AUROC=0.417);无迹余量 $E_\ell$ 才是检查点专属、可继承、不可复刻的"基因"。与已有方法的本质区别有三。其一,与 Re-Basin 类"先对齐再比较"不同,签名对隐藏单元置换与互逆重缩放的不变性是代数自带的——$P$ 与 $D$ 在乘积 $W_{\text{out}}W_{\text{in}}$ 中相消——因此无需任何对齐搜索,换来 76 倍提速。其二,与减法同样重要的是校准:独立模型零分布把"分数多大算无关"变成统计问题。其三,机制上作者提出梯度耦合解释:skip 使分支只学修正,$W_{\text{in}}$ 与 $W_{\text{out}}$ 是同一条修正的两端,梯度天然相关,相关更新沿恒等方向累积;四个实验(初始化消融、ResNet 对 PlainNet、雅可比正交性测量、梯度打乱与合成注入)支撑该解释并排除了动力学等距假说。

方法步骤详情

第一步,架构感知因子化:按 Table 9 为每类残差块组合完整线性路径——GELU 型 Transformer MLP 取 $W_2W_1$,SwiGLU 取 $W_{\text{down}}W_{\text{up}}$(另有 $W_{\text{down}}W_{\text{gate}}$ 备选),注意力取 $W_OW_V$ 与 $W_QW_K^{\top}$,ResNet 瓶颈必须取三层乘积 $W_3W_2W_1$(跳层的两层乘积掉到随机水平)。输出:每块一个 $d\times d$ 矩阵 $M_\ell$。第二步,中心化签名:$R_\ell=M_\ell-\frac{\operatorname{tr}(M_\ell)}{d}I$,单位化为 $\phi_\ell=\operatorname{vec}(R_\ell)/\|\operatorname{vec}(R_\ell)\|_2$,并用迹集中度门控不可靠分支(相似度乘以 $\min(s_A/\tau_s,\,s_B/\tau_s,\,1)$)。第三步,块配对:计算 $G_{ij}=\langle\phi^A_i,\phi^B_j\rangle$,匈牙利算法求 $\pi^*$;保持块序的后代应恢复恒等置换(六个家族实测 100%)。第四步,打分:$L(A,B)=\frac{1}{L}\sum_\ell\langle\phi^A_\ell,\phi^B_{\pi^*(\ell)}\rangle\in[-1,1]$,相关检查点接近 1、无关接近 0。第五步,校准判定:从 $n$ 个独立模型构造零分布 $N_A=\{L(A,U_j)\}$,当 $L(A,B)>\max_j L(A,U_j)$ 判 RELATED,对应 conformal p 值 $\le 1/(n+1)$。复杂度为乘积 $O(Ld^2h)$、相似度矩阵 $O(L^2d^2)$、指派 $O(L^3)$;GPT-2 基准平均每对 5.1ms。

技术新颖性

与最相关工作的具体差异:相对 Park(2026),本文证明迹集中现象横跨六个语言模型家族并外溢到视觉、语音架构(ViT、Whisper、ResNet),且首次指出"迹集中不等于血统"、必须中心化才有判别力——消融显示中心化把独立对相似度从 0.019 降到 0.0004(约 50 倍,独立根上 0.027 到 0.0015 为 18 倍)。相对权重相似度基线(余弦、Frobenius、SVD),本文的不变性是代数性质而非数值巧合:清洗实验中 weight cosine 的 Gap-Z 从 +76.3 崩到 +2.1,公开 7B 模型上损失 93–95% 信号,而本文 $\Delta L<10^{-7}$。相对 Re-Basin+scale,本文免去每对 $O(Ld^3)$ 的对齐搜索,GPT-2 上 5.1ms 对 387.9ms。相对 CKA/SVCCA/REEF/HuRef,本文无需数据、激活或检查点集合,单对即可。机制侧的新颖性在于用四组受控实验把因果链钉住——尤其是打乱跨块梯度使指纹下降 68%、无反传的合成对角注入($\Delta W=-\varepsilon\, e_ie_j^{\top}$ 型更新)能从零构建指纹——这在指纹与溯源文献中很少见。

Centered residual signatures for lineage verification
Figure 1: Centered residual signatures for lineage verification
Evidence for the gradient-coupling mechanism
Figure 2: Evidence for the gradient-coupling mechanism
Block pairing score matrices s(i, j) for GPT-2 models from 124M to 1.5B parameters
Figure 3: Block pairing score matrices s(i, j) for GPT-2 models from 124M to 1.5B parameters
Distribution of trace values tr(WoutWin) across GPT-2 scales
Figure 4: Distribution of trace values tr(WoutWin) across GPT-2 scales
Block pairing accuracy as model size increases
Figure 5: Block pairing accuracy as model size increases

实验结果

现象普适性:六个语言模型家族(GPT-2 124M–1.5B、BERT、LLaMA-2、Mistral、Qwen2.5、DeepSeek-R1)在标准 MLP 路径 down×up 上的块配对准确率全部 100%(随机初始化基线不超过 4%,AUC 0.97–1.00);SwiGLU 的 down×gate 替代路径较弱(Qwen 68%、DeepSeek 84%);现象还迁移到 ViT-B/16(100%)、Whisper(100%)与 ImageNet 预训练 ResNet-50/101/152 layer3(91–100%)。基线对比:MLP 基准(52 对)上本文与 weight cosine、aligned Frobenius、SVCCA 均达 AUROC=1.0,但 CKA 仅 0.83、IPGuard 0.70(Gap-Z 为 −3.5,会把非后代排得更高);GPT-2 基准(45 对)上 SVD 退化到 0.73、CKA 0.86。清洗鲁棒性是决定性差异:P/Dm/Ds/PD/PDFT 六种函数保持清洗下本文恒为 AUROC=1.0、Gap-Z 约 +53(MLP)/+31(GPT-2);aligned Frobenius 在 MLP 置换下降至 0.50、强缩放 0.0;weight cosine 在 PD 下 0.80 且 Gap-Z 从 +76.3 崩至 +1.8;Re-Basin+scale 同样满分但慢 76 倍。公开生态:LLaMA-2-7B 对 chat(0.995)、Vicuna(0.996)、CodeLlama(0.336)判 RELATED,7 个架构完全相同的独立模型全部 $|L|<5\times10^{-5}$;四个 7B 家族置换清洗后本文 $\Delta L<10^{-7}$,weight cosine 损失超过 93%。后训练存活(GPT-2 基准):量化 0.999、LoRA 合并 0.998、微调 0.980、剪枝 30–70% 均值 0.937(最小 0.855),而蒸馏学生 0.002、独立 0.003,形成约 200 倍间隔;蒸馏只让 top-1 一致性提升 1.4 个百分点,不产生任何血统信号。困难场景(40 对层嫁接/线性合并):本文 Spearman $\rho\ge 0.96$,SVD 在 merge 上 $\rho=0.23$、IPGuard 在 graft 上 AUROC=0.05、CKA 0.78–0.81。ResNet-18/CIFAR-10 复验 AUROC=1.0(相关 $L\in[0.695,1.000]$,无关最大 0.004)。对抗抑制攻击:把分数压到零分布阈值 $L\approx 0.084$ 需付出 +1.5% 效用,可靠压到零分布以下需 +12%。消融证明各组件必要:只用迹 AUROC=0.417;中心化把无关对均值从 0.019 降到 0.0004。

Why retroactive lineage verification is hard
Table 1: Why retroactive lineage verification is hard
Trace concentration in MLP branch products across language model families
Table 2: Trace concentration in MLP branch products across language model families
Baseline comparison for lineage detection
Table 3: Baseline comparison for lineage detection
Public checkpoint case study (LLaMA-2 family)
Table 4: Public checkpoint case study (LLaMA-2 family)
AUROC under function-preserving laundering
Table 5: AUROC under function-preserving laundering
Permutation laundering on public language model derivatives
Table 6: Permutation laundering on public language model derivatives
Lineage scores under post-training transformations
Table 7: Lineage scores under post-training transformations
Per-method latency (ms) on GPT-2 benchmark
Table 8: Per-method latency (ms) on GPT-2 benchmark
Architecture-aware residual branch products
Table 9: Architecture-aware residual branch products
Per-path pairing accuracy across language model families
Table 10: Per-path pairing accuracy across language model families
Lineage score L survival under post-training modification
Table 11: Lineage score L survival under post-training modification
Initialization ablation on depth-24 residual MLPs
Table 12: Initialization ablation on depth-24 residual MLPs
Jacobian orthogonality across GPT-2 scales
Table 13: Jacobian orthogonality across GPT-2 scales
Centering ablation on the GPT-2 benchmark
Table 14: Centering ablation on the GPT-2 benchmark
Gap-Z under function-preserving laundering
Table 15: Gap-Z under function-preserving laundering
Harder-regime benchmark on layer grafts and linear merges
Table 16: Harder-regime benchmark on layer grafts and linear merges
Pareto frontier for suppression attack
Table 17: Pareto frontier for suppression attack
Trace concentration in vision and speech architectures
Table 18: Trace concentration in vision and speech architectures
GPT-2-Small-Lite lineage benchmark
Figure 6: GPT-2-Small-Lite lineage benchmark
ROC for lineage verification on depth-24 residual MLPs
Figure 7: ROC for lineage verification on depth-24 residual MLPs
查看结构化数据
任务指标本文基线提升
血缘判别(MLP 基准,52 对已知真值) AUROC 1.00(Gap-Z +53.0) CKA 0.83、IPGuard 0.70(SVCCA 1.00 但需数据与前向传播) 较 CKA +0.17、IPGuard +0.30,且完全数据免费
血缘判别(GPT-2 30M 基准,45 对) AUROC 1.00(Gap-Z +31.0) SVD 0.73、CKA 0.86、IPGuard 0.91 较 SVD +0.27、CKA +0.14
函数保持清洗鲁棒性(MLP,强重缩放 Ds) AUROC 1.00 Aligned Frobenius 0.00、SVD 0.00 从完全失败到完美判别
清洗后分离余量(GPT-2,置换 P) Gap-Z +31.0(清洗前后不变) Weight Cosine +0.8(清洗前 +30.7,分数坍缩 97%) 余量保持不坠 vs 崩溃
单对验证延迟(GPT-2 基准,GPU) 毫秒/对 5.1 ms(均值,最大 15.1) Re-Basin+scale 387.9 ms、SVD 1438.2 ms 快 76 倍 / 283 倍
公开 LLaMA-2 血缘验证(3 后代 vs 7 独立克隆) 血缘分数 L 后代 0.336–0.996,独立模型 $|L|<5\times10^{-5}$ Weight cosine 在置换清洗下损失超过 93% 信号 $\Delta L<10^{-7}$,完美分离
部分继承(层嫁接/线性合并,40 对) Spearman ρ(分数随重叠度单调性) ρ ≥ 0.96(graft 与 merge 均保持) SVD merge ρ=0.23、IPGuard graft AUROC=0.05、CKA 0.73–0.75 唯一在两种部分继承下都保持高单调性的方法之一

局限与改进

作者明确承认的边界:需要白盒访问,API-only 模型无法验证;只适用于残差架构,纯前馈网络、RNN、状态空间模型不在范围内;且要求深度 $L$ 和隐藏维度 $d$ 完全匹配,跨架构(如 LLaMA 对 GPT-2)不支持。分数对称意味着不借助元数据无法判断谁是祖先、也不能证明所有权;方法只做单对比较,不能重建多跳血统或家谱,部分继承(层嫁接、线性合并)只反映共享块比例而不指明具体是哪些块。信号随转换强度单调衰减:85% 剪枝降到 $L=0.58$,CodeLlama 式大量继续预训练降到 0.336。签名对残差流正交旋转 $M\to QMQ^{\top}$ 不具备不变性(旋转保迹但毁掉中心化余量);LayerNorm/RMSNorm 的逐维学习参数 $\gamma,\beta$ 恰好使 Q 旋转非函数保持从而天然免疫,但采用无学习缩放归一化的架构理论上可被 Q 旋转清洗。我补充的观察:校准的有效样本量很小(GPT-2 基准共 8 个根、LLaMA-2 家族仅 7 个独立克隆),conformal 保证实际上限宽松;清洗实验的函数保持门限(输出变化 $\le 10^{-4}$)只在受控小模型上验证过;各基准的"独立模型"共享训练配方或数据分布,真实生态中共数据的独立模型是否真的 $L\approx 0$ 缺乏大规模检验;LayerNorm 参数本身可能携带血统线索却被该方法完全忽略。

独立分析的弱点

第一,Q 旋转漏洞:对无学习缩放归一化的架构,攻击者可用残差流正交旋转洗掉签名。改进方向是把签名构造在旋转不变量上(如 $R_\ell R_\ell^{\top}$ 的特征值谱或逐块谱统计),代价是损失跨块方向信息、可能降低配对精度。第二,零分布校准脆弱:阈值取 n 个独立模型的最大分数,n=3–8 时 p 值下界只有 $1/(n+1)$,对稀缺架构几乎给不出严格 FPR;改进方向是合成增广独立根(不同种子/数据序/初始化,但需先验证其零分布与真独立等价),或对 null 拟合参数分布而非取 max。第三,阈值不可跨家族迁移:CodeLlama(真后代)0.336 与 chat 0.995 相差 3 倍,使用者无法预知某个中间分数对应的转换强度,应提供按转换类型校准的衰减曲线与置信区间,而非二值判定。第四,部分继承诊断缺失:匈牙利匹配矩阵 $G_{ij}$ 本身已含逐块对应与相似度,完全可以输出"哪些层被继承"的取证热图,论文只放进附录,工具价值未兑现。第五,7B 以上成本:$O(L^2d^2)$ 相似度矩阵与 fp32 双模型载入在百亿参数以上显著膨胀,可用 Hutchinson 式随机迹估计与低秩近似压缩签名。第六,对抗评估不足:抑制攻击只在 $d=64$ 的深度 24 MLP 上运行,攻击者在 LLM 上拥有全参数微调预算时的效用-隐蔽性 Pareto 可能宽松得多,需要在真实规模上重测。

未来方向

作者在结论与局限性中隐含的方向:覆盖更广的公开检查点生态;突破"同 L 同 d"限制做跨架构比较;从成对验证走向家谱/模型树重建(可与 MoTHer 等需要检查点集合的方法互补);方向性归因结合元数据。基于成果的自然延伸包括:其一,构造对 Q 旋转也封闭的谱不变签名,把代数不变性补全为对全部函数保持变换封闭;其二,把逐块签名矩阵 $G_{ij}$ 产品化为取证报告——定位继承层、估计合并模型中各父本贡献比例,对 model soup 与 task arithmetic 做"血统成分分解";其三,签名随训练的演化轨迹本身可作训练过程审计:$\phi_\ell$ 的漂移速度可能揭示继续预训练的数据域与时长;其四,与主动机制(签名哈希、水印)组合成双层供应链审计——主动层证明"发布者是谁",被动层证明"权重从哪来";其五,理论上把梯度耦合解释形式化,推导迹集中度随深度、宽度、训练时长的标度律,论文中 GPT-2 雅可比数据(训练后比随机初始化"更不正交"5–12 倍)是很好的起点。

复现评估

开源情况:论文承诺接收后发布代码、配置文件、七个基线的复现实现、逐对分数 JSON 与绘图脚本(阅读时尚未见到公开仓库),全部结果由固定种子(torch/np seed 0)的确定性脚本产出。算力门槛非常低:所有实验在单张 NVIDIA L4(24GB 显存)加 AMD EPYC CPU 上完成;最大操作是对公开 LLaMA-2-7B 做推理级权重提取(无需训练),fp16 下两个 7B 模型约 28GB,24GB 单卡需逐层流式处理。数据全部公开:TinyStories(HuggingFace)、CIFAR-10(torchvision)、官方 HF 检查点。自建基准也轻量:8 个 30M 参数 GPT-2 各训 3 个 epoch 的 TinyStories 单卡数小时可完成,MLP 基准分钟级。方法核心是"线性层连乘+中心化+余弦+匈牙利算法",几十行代码即可复现主结果;主要工程量在架构感知因子化(SwiGLU 双路径、注意力 Q/K 与 V/O、ResNet 三层瓶颈)与复刻七个基线。综合评估:复现难度中偏低,无敏感超参、无大规模训练,既适合作为复现练习,也适合直接集成进模型审计工具链。