← 返回 2026-09-08

拆分式LLM训练中的隐私失效:被回传梯度瓦解的诱饵防线 Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys

Georgios Politis, Evangelos Pappas 📅 2026-09-03 👍 5 2026-09-12 18:30
差分隐私 拆分学习 梯度泄露 系统安全 隐私审计

未被审计的回传梯度以精确零值暴露真实数据行,令前向信道的隐私门形同虚设

前置知识

Split Learning(拆分学习)

一种隐私保护的分布式训练框架:把模型切成两段,数据方(TLN,可信本地节点)持有原始数据、嵌入头与私有损失,云端(UCN)只托管中间若干层。每步训练中数据方前传保护后的激活,云端完成前向并回传输出,数据方算出损失后再把输出梯度回传给云端更新其层,目标是训练不离开私有数据也能借助云端算力。

本文的威胁模型、三条通信线路(前向/返回/回传)与全部泄露机制都建立在该协议之上,不熟悉协议就无法理解为什么输出梯度会由可信方发给不可信方。

Decoy rows / Chaff(诱饵行)

防御方在每帧 80 行激活中混入 48 行从历史数据块循环采样的真实潜变量行,只有 32 行真正承载私有损失;设计意图是让云端分不清哪些行参与损失,从而扩大匿名集。术语 chaff 借自雷达箔条对抗。诱饵不是噪声,而是真实数据的回收行,以抵御内容侧分析。

泄露的核心正是诱饵行:它们的返回梯度恒为精确零,使其苦心构造的匿名集被逐帧精确击穿,这是全文标题的由来。

Zero-support gradient(零支撑集梯度)

若某行不参与损失计算,损失对该行的梯度不是近似零而是恒等于精确的 0。于是返回梯度张量中哪些行恰为 0 构成一个确定性的二值指纹,无需任何训练或统计推断就直接复制了真实行/诱饵行的划分。与之对照,裁剪和噪声只会让非零行变小,不会让零行变非零。

这是论文发现的泄露机制本体——一种结构性元数据泄露,与内容重建完全不同层次的问题,也是'实现缺陷'与'评估失效'双重归因中的前者。

注入式校准与阳性/阴性对照

借鉴差分隐私审计的纪律:向系统按已知剂量(覆盖率×幅度)注入人工泄露,测出每个指标能检测到的最低剂量,即剂量-响应曲线,证明测量仪器'看得见'泄露(阳性对照);再用标签打乱的阴性对照证明仪器不会把无泄露读成有泄露。阈值必须在跑正式实验之前依据校准曲线预先声明。

论文的全部可信度都建立在这套校准协议上,这是它与其审计的三篇近期评估(均缺失至少一项对照)的本质差别,也是理解其结论边界的关键。

Wilson–Bonferroni 门限统计量

攻击效果是 top-1 token 准确率减去常数基线(约5–6%)之差,以百分点计。对 9 个预声明探针臂取 Bonferroni 校正后的 Wilson 95% 上界 $G=\max_j[\mathrm{UB}(b_j)-b_{\text{const}}]$,超过 +1.0 pp 判隐私失败。

论文中所有'通过/失败'的判定都由这个预先声明的统计门限给出,理解它才能理解每一个实验结论的精确含义与统计强度。

研究动机

被审计的系统是一个两节点拆分 LLM 训练实现:Qwen3-0.6B 在第 14 层切出、第 26 层接回(委托 11 层给云端),每帧 80 行激活(32 真实行 + 48 诱饵行),潜宽 $D=64$,配以逐请求 Haar 旋转、置换与尺度混淆,及 $C=1.0$ 裁剪加 $\sigma=0.35C$ 高斯噪声。其原始隐私评估只把前向线路(发往云端的激活)声明为隐私面并使其通过隐私门,而承载输出梯度的回传线路从未被声明为对手可见信道,因此从未被测试。由于私有损失在诱饵行之前截断,诱饵行的返回梯度恒等于精确零,云端不做任何训练即可逐帧读出真实/诱饵划分,48 个诱饵形同虚设。更普遍的问题是评估方法论:作者定点审计的三篇近期拆分 LLM 评估(BiSR、DualGuard、Prompts to Responses)无一同时具备注入式校准、标签打乱阴性对照和预先声明门限,这类'通过'结论因此缺乏统计学地基。

本文的目标是本文目标有三层。第一,对一个真实部署形态的拆分训练系统给出'经过验证的诊断':用预先固定的协议证明回传梯度泄露真实存在,且排除仪器失灵、假阳性等替代解释。第二,示范一套信道显式的评估方法:先枚举对手可见的全部信道(前向、后向、联合、成员、时序等 9 族),再对每个指标用已知剂量的人工泄露做剂量-响应校准(19 个剂量点),并设置事先声明的判定门限——隐私门 $G>+1.0$ pp 判失败,效用门为 held-out 交叉熵增量 $\le 0.35$ nats。第三,量化泄露的危害边界,区分确定性的结构划分泄露与温和的频繁词内容推断,并验证每行梯度裁剪加噪声这一修复的效果与效用代价,最终论证'仅在已测信道上通过'不等于安全。

与已有工作不同的是,本文的独特之处在于它把'评估本身'当作被测对象,而非提出新攻击。梯度泄露与双向攻击面在梯度反演和拆分学习文献中早已确立,作者明确声明不在此争新;它瞄准的是一个具体评估在未声明信道上返回'通过'的失效模式:信道未被枚举就天然豁免于门限,度量未经校准就无资格为隐私背书。作者把差分隐私审计的三大纪律——注入金丝雀校准、标签打乱阴性对照、预先声明的操作点——改造成信道级、指标级的协议,应用于这一个系统,并自我定位为系统安全案例研究而非通用方法论;同时对三篇近期评估做定点审计,证明它们各自缺失至少一项对照。这种'先校准仪器再读数、并诚实记录未测信道'的姿态,是拆分学习隐私评估文献中罕见的。

核心方法

直觉上这像雷达箔条战的反面:防御方撒出 48 行诱饵让云端分不清真假,但损失函数只看 32 行真实数据,于是回传梯度在这 48 行上精确为零——零值模式本身就是答案。技术路线上,系统为两节点拆分训练:TLN 持数据、冻结前缀、私编码器 $E$($H\to D=64$)与解码器,UCN 持中间 11 层;云端还训练一个约 100–161 参数的规范等变小代理替代真实中层。每帧 80 行激活经逐请求旋转 $R$、置换 $\Pi$、尺度 $s$ 混淆($\tilde z=\Pi\,\mathrm{diag}(s)\,zR$),裁剪至范数 $\le 1.0$ 并加 $\sigma=0.35C$ 高斯噪声后经 TLS 1.3 发往云端;云端回传的输出同样加噪;TLN 计算私有损失与输出梯度并回传——这一路在修复前既不裁剪也不加噪。评估协议四步走:枚举 9 族信道、按覆盖率×幅度 19 剂量点校准 4 个指标、固定 Wilson–Bonferroni 门限 $G>+1.0$ pp、以种子 42–47 探索、48–50 复制、51–53 做浅层拓扑修复验证。

核心创新不是新攻击,而是把隐私评估当作被测对象,并给出一个双重归因的失效诊断:零支撑构造是实现与系统设计缺陷(损失截断使诱饵行梯度精确为零),而假'通过'是评估失效(回传信道不在声明的对手视野内,门限从未测试它)。与已有工作的本质区别有三。其一,已有拆分学习攻击研究内容重建,本文证明存在更基础的确定性结构泄露:云端零训练、逐帧精确分类全部帧。其二,内容推断用配对效应(相对约 5–6% 的常数基线)加 Bonferroni–Wilson 上界度量,并以标签打乱阴性对照($|N|\le 0.08$ pp)排除假阳性,这套对照是被审计评估都不具备的;论文甚至用它自我纠错,撤销了一个被阴性对照证伪的成员泄露主张。其三,用表征匹配的阳性对照(同一探针在无防御裸边界恢复 +24.19 pp)证明防御单元的低读数源于防御有效而非攻击者失明。

方法步骤详情

第一步,声明信道:枚举 9 族对手可见信道并记录测量状态,未声明即豁免正是原始评估的漏洞。第二步,仪器校准:注入覆盖率×幅度可控的 token 泄露,19 个剂量点测出 4 条剂量-响应曲线——token top1 在覆盖率 0.04–0.06 陡增(0.35→0.98→4.19 pp),rare token top1 最敏感(覆盖 1.0 时 100% 恢复),token 交叉熵直到泄露占主导才动,membership AUC 全程平坦并被证伪降为诊断;据此逐指标预设阈值。第三步,阳性对照:4 层 8 头 Transformer 探针反演无防御裸边界得 +24.19 pp,同一探针在防御边界均贴地板,证明不失明。第四步,采集与攻击:每运行捕获 4,096 帧(2,048 探针训练+2,048 评估),9 臂探针族计算门统计量;零支撑检查逐帧比对梯度非零行与真实行;联合臂拼接前向帧与梯度。第五步,修复运行:改用 4 层委托拓扑,回传梯度逐行裁剪 $C=0.01$ 加噪声,3 种子×2 数据集验证闭合与代价。

技术新颖性

技术新颖性体现在协议组合而非单点原语。其一,剂量-响应校准把'该指标能检测多弱的泄露'变成可测曲线并据以逐指标设阈值,取代单一拍脑袋阈值;作者实测四个指标显著分歧,任何单一阈值都不成立。其二,信道级标签打乱阴性对照是成员推断审计中参考分布思想的信道特定移植,且论文真的用它自纠:撤销了 +0.068 的前向成员泄露主张。其三,攻击者台账(表 11)穷举全部已试攻击族并报告负结果,包括交叉 Gram 特征 $X^\top G$ 的否定:前向激活矩阵与返回梯度共享每请求旋转,二者乘积使其相消,但预声明探针族未计算该特征;作者补测后确认两个发射器下均贴地板,并声明其余跨张量攻击开放。其四,工件级可追溯:模型权重与语料的 SHA-256 指纹、种子组分工(42–47 探索/48–50 复制/51–53 修复)、事先固定的协议文件,同时诚实记录原始张量留在集群侧的可用性边界。

The three hops of one training step
Figure 1: The three hops of one training step
Anatomy of one training cycle, per frame
Figure 2: Anatomy of one training cycle, per frame
Dose–response per metric on the coordinate-mode sweep (amplitude 1.0)
Figure 3: Dose–response per metric on the coordinate-mode sweep (amplitude 1.0)

实验结果

结构泄露:9 个种子每次运行 4,096 帧全部精确匹配(行级一致度 1.000),零支撑读出零训练即可分离 32 真实行与 48 诱饵行,且划分在每个深度、宽度、预算格均精确。内容推断:频繁词探针九种子合并配对效应 +0.92 pp(95% CI [0.74,1.09],$\tau=0.23$,$I^2=77\%$),单种子 +0.6456 至 +1.5008 pp,阴性对照 $|N|\le 0.08$ pp;梯度臂相对前向臂增量多在 +0.18 pp 内,说明回传线路贡献的主要是划分而非内容。修复运行:6 个防御单元(3 种子×2 数据集)全过前向与效用门,但联合臂全部击穿 +1.0 pp 门(+1.44 至 +2.18);公语料 3 种子中 2 个梯度单独破门。修复后支撑泄露 0/1,024 帧、全臂贴地板,代价约 0.01 nats。形状:12/11 委托层可检出、8/6 层不可;$D=64/96$ 可检出、$D=128$ 不可;预算 40k→100k 步无增益。裸对照联合视图 +34 pp,证明仪器不失明。主配置自身效用门失败(Δloss 0.9185,对 0.35 门限)。

Experimental setup for the main configuration and for the replication and mitigation runs
Table 1: Experimental setup for the main configuration and for the replication and mitigation runs
Trust split at the evaluated operating point
Table 2: Trust split at the evaluated operating point
The declared channel families and their status
Table 3: The declared channel families and their status
Coordinate-mode coverage sweep at amplitude 1.0
Table 4: Coordinate-mode coverage sweep at amplitude 1.0
Per-metric thresholds, set in advance
Table 5: Per-metric thresholds, set in advance
One probe architecture, one protocol, three boundaries
Table 6: One probe architecture, one protocol, three boundaries
Result categories and where each is established
Table 7: Result categories and where each is established
Exploratory seeds 42–47 and the replication runs (seeds 48–50)
Table 8: Exploratory seeds 42–47 and the replication runs (seeds 48–50)
The mitigation runs
Table 9: The mitigation runs
The nine-cell audit
Table 10: The nine-cell audit
The attacker ledger: every attack family tried against the system
Table 11: The attacker ledger: every attack family tried against the system
Selected audit verdicts
Table 12: Selected audit verdicts
Positioning against the closest systems
Table 13: Positioning against the closest systems
Per-result availability
Table 14: Per-result availability
Techniques at a glance: what each mechanism is, concretely, where it lives, and its status
Table 15: Techniques at a glance: what each mechanism is, concretely, where it lives, and its status
Compromise-fraction battery on the defended cell
Table 16: Compromise-fraction battery on the defended cell
External matching-attack families vs. the defended cell (regenerated bundles)
Table 17: External matching-attack families vs. the defended cell (regenerated bundles)
K=3 Byzantine median verification
Table 18: K=3 Byzantine median verification
Attack-specific shape across audit cells
Figure 4: Attack-specific shape across audit cells
查看结构化数据
任务指标本文基线提升
结构划分泄露(真实/诱饵行分类) 帧精确匹配率 / 行级一致度 4,096/4,096 帧、一致度 1.000(每个种子) 随机猜测基率 32/80 = 0.400 从 0.400 的基率提升到 1.000 的确定性精确分类,无统计波动
频繁词内容推断 配对 top-1 效应(超常数基线,百分点) +0.92 pp(95% CI [0.74, 1.09],九种子合并) 常数基线(永远猜最高频评测词,约 5–6% 准确率) +0.92 pp;标签打乱阴性对照 ≤0.08 pp 证明非伪影
表征匹配阳性对照(裸边界反演) Wilson 上界 top-1 超基线 +24.19 pp(28.54% vs 4.35%) 防御边界 +0.29 pp(D=64)/ +0.27 pp(D=1024),贴地板 同一探针逾 6 倍基线反演裸边界、读不穿防御,排除攻击者失明
联合视图攻击(可部署配置) 门统计量(Bonferroni–Wilson 上界超基线) +1.44 至 +2.18 pp,6/6 防御单元击穿 +1.0 pp 门 同一单元前向门 +0.41 至 +0.76 pp(通过) 仅测前向信道会把这些单元误判为安全
梯度裁剪+噪声修复 支撑泄露帧数 / held-out 交叉熵代价 0/1,024 帧,代价 ≈0.01 nats 未修复 1,024/1,024 帧精确泄露 划分信号完全消失且效用几乎无损(Δ +0.063→+0.078)

局限与改进

作者明确承认的:结论只覆盖一个实现;主配置、校准与形状分析都用私有 WikiText-2 切片,第二语料只是 3 种子的诊断性稳健性检查而非语料无关性证明;9 族信道中 5 族未测量(成员/性质 AUC、响应侧恢复、时序元数据、有状态远程状态、跨训练步累积历史),主动扰动有度量但未在修复运行规模上执行;TAG/LAMP/FILM/DAGER 式序列重建未适配到'切点梯度'这一对象,因此只确立频繁词判别加精确划分,不确立文本重建;held-out 是展平语料流内的块级 held-out 而非文档级;独立评分器复现由内部完成且不可仓库级重执行;九格形状分析每格仅单种子;修复运行是 2,000 步诊断,未达收敛规模。我的补充观察:频繁词效应 CI [0.74, 1.09] 跨过 +1.0 门限,统计上与门限不可分,实际内容危害有限、严重性主要在结构层;修复单元关闭了逐行尺度规范,结论以此为条件;0.6B 模型对更大规模外推有限;0.01 nats 的修复代价在块级协议下测得,文档级协议下未知。

独立分析的弱点

独立分析出四个弱点。第一,内容推断与结构泄露的危害被捆绑叙述,但频繁词 +0.92 pp 对真实私有数据(对话、代码、罕见实体)威胁有限,真正致命的是划分本身——若与更强的内容反演组合(论文引用深层 LLM 状态可恢复提示的攻击),划分泄露的价值会被放大,而本文未测这种组合,应量化'划分+强反演'的复合上限。第二,统计功效不足:九种子合并区间跨过门限,无法断言效应在门限之上还是之下,需要更多种子或更高效的配对设计、序贯检验。第三,修复的适用性存疑:$C=0.01$ 裁剪加噪声只在 2,000 步诊断、0.6B 模型、单一拆分点上验证,收敛规模与更大模型未测,且逐行尺度规范被关闭使防御栈不完整,应给出防御-效用帕累托前沿。第四,透明度边界:原始预测张量留在集群、独立评分器不可重执行、种子 42 曾由旧容器服务,这类'记录但不可复核'的证据在安全审计中是减分项,改进方向是发布端到端可重执行的最小复现包。

未来方向

作者点名的方向:测量五族未测信道,尤其是跨训练步累积观察与有状态远程状态攻击;把 TAG/LAMP/FILM/DAGER 式序列重建适配到切点梯度这一对象;在修复运行规模上执行主动扰动幅度扫描;在收敛规模与文档级 held-out 协议下复验。基于其成果可延伸的:其一,把信道显式评估协议(枚举—校准—门限—阴性对照)工具化为拆分学习框架的自动隐私门禁,扫描任意切分点/宽度/防御组合并输出校准过的判定;其二,系统探索'划分泄露+强内容反演'的复合攻击面,特别是 $X^\top G$ 之外的其他跨张量特征(作者明言其余开放);其三,从损失构造层面根治——例如对诱饵行注入校准过的伪梯度使零支撑指纹消失并量化代价;其四,将该协议用于审计更多已发布的拆分 LLM 防御,检验'未校准的通过'在领域内的普遍程度;其五,理论刻画结构元数据泄露与内容泄露之间的转换条件与信息论界。

复现评估

开源情况:GitHub 工件库(setloop-io/Privacy-Failure-in-Split-LLM-Training...)提交了协议文件、指标-门限映射、逐种子配对 JSON 与阴性对照记录、校准与九格形状记录及作图脚本、修复运行配对摘要与 7.4GB 束存储的 SHA-256 清单;Qwen3-0.6B 权重(精确 SHA-256)与语料指纹公开,种子 42–53 全部写明。可复现边界:校准与形状结果可从提交的摘要加代码端到端再推导;探索与修复结果只能'重显示'提交的派生摘要,原始预测张量留在集群侧;独立评分器检查已记录但不可仓库级重执行;完整转录按原始数据政策仅限主机。算力:0.6B 模型、2k–100k 步训练、每次运行捕获 4,096 帧,单张 24GB 级消费级 GPU 应可承担大部分格子,束存储需约 7.4GB。总体难度中等偏高:核心结构泄露(零支撑检查)复现门槛低,但完整统计协议(Bonferroni–Wilson 门限、分层自助、阴性对照、预注册文件)需要仔细照搬其代码与预声明文件。