基于可复制上下文的安全防护无法为大语言模型提供可靠安全性 Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
证明可复制证据下LLM防护存在能力-安全-开放三难困境。
前置知识
全变差距离 Total Variation distance
衡量两个概率分布 $P$ 和 $Q$ 差异的标准度量,定义为 $\mathrm{TV}(P,Q)=\frac{1}{2}\sum_x|P(x)-Q(x)|$,取值在 $[0,1]$。关键性质是对任意有界函数 $f:X\to[0,1]$ 有 $|\mathbb{E}_P[f]-\mathbb{E}_Q[f]|\le \mathrm{TV}(P,Q)$(即论文式1)。论文用它同时度量两件事:攻击者复制合法交互策略的误差 $\delta_\kappa=\inf_{Q\in C_\kappa}\mathrm{TV}(P_B^\kappa,Q)$,以及可信凭证 $S$ 区分合法/恶意用途的分离度 $d=\mathrm{TV}(P_S^B,P_S^M)$。
整篇论文的鲁棒性结论(式12、式22)都建立在 TV 上界上。不理解 TV 的定义与“期望差被 TV 控制”这一不等式,就无法看懂为什么复制误差 $\delta_\kappa$ 会把理论地板 $\Gamma(q)$ 连续地松弛掉,也看不懂必要条件 $\beta+d+\eta_\kappa\ge\Gamma(q)$ 中三个可独立汇报项的来历。
马尔可夫核 Markov kernel 与交互式防护
马尔可夫核 $\kappa(y|x)$ 是一个从输入 $x$ 到输出分布的条件概率映射,即随机化的 $x\to y$ 映射。论文把一次“访问验证交互”建模为一串马尔可夫核:用户策略产生提问 $X_t$,防护的固定策略 $\kappa_t$ 回复 $Y_t$,最终用终端释放核 $g(\cdot|h)$ 决定输出 $A$。合法过程 $P_B^\kappa$ 与恶意过程 $P_{M,\sigma}^\kappa$ 都是这种交互生成的对话定律。
论文要证明“任何交互式防护在可复制证据下等价于静态释放前沿”,必须先把“提问、澄清、多轮、随机化”这些防御手段统一表达成马尔可夫核 $\kappa$ 和 $g$,否则无从形式化“交互能否带来信息增益”。
概率单纯形与凸包前沿 $\Gamma(q)$
对有限集 $X$,$\Delta(X)$ 是 $X$ 上所有概率分布的集合(单纯形)。把每个释放 $a\in A$ 映成点 $(u_B(a),u_M(a))$,其凸包 $V=\mathrm{conv}\{(u_B(a),u_M(a)):a\in A\}$ 是随机化释放可达的全部(合法效用,恶意助力)对。论文定义能力地板 $\Gamma(q)=\min\{y:(x,y)\in V,\,x\ge q\}$(式4),它是 $V$ 在合法效用 $\ge q$ 处的下包络,有限 $A$ 下必定达到、单调非降、凸、分段线性。
$\Gamma(q)$ 是整篇论文的基准地板:Theorem 1 证明交互式防护在最坏情况下恰好等于 $\Gamma(q)$,Corollary 1 的三难困境边界就是 $\beta<\Gamma(q)$。不理解凸包前沿就无法理解“为什么加权已有的释放菜单已经包含在 $\Gamma(q)$ 的最小化里”。
对偶用途条件 dual-use condition
论文式5 的核心假设:对每个释放 $a\in A$,只要它在合法用途上有价值就必然存在某个恶意下游用途,即 $u_B(a)>0\Rightarrow u_M(a)>0$。由有限 $A$ 可定义 $\rho=\min_{a:u_B(a)>0}u_M(a)/u_B(a)>0$,于是 $u_M(a)\ge\rho\,u_B(a)$ 处处成立。例子:漏洞分析报告对授权评估员和入侵者几乎同样有用,完整利用链既承载评估价值也承载入侵价值。
正是这个条件推出地板的下界 $\Gamma(q)\ge\rho q>0$(式6),即“任何能给合法用户带来正价值的共享输出分布都不可能让攻击者助力为零”。它是三难困境中“可靠安全=零助力不可能”的源头。
可信凭证 trusted credential 与等先验最优平衡准确率
可信信号 $S$ 是攻击者无法自由获取/复现、且其分布能预测真实下游用途的信号(编码已验证身份、角色、平台状态等)。设 $Z\in\{B,M\}$ 标注真实用途,分离度 $d=\mathrm{TV}(P_S^B,P_S^M)$。在两过程等先验下,仅用 $S$ 的最优二分类器平衡准确率为 $\mathrm{Acc}^\star(S)=\frac{1+d}{2}$(式13,标准等先检验恒等式,Tsybakov 2009)。
论文把抽象的“需要不可复制证据”翻译成可测的标量 $d$(或 $p=\mathrm{Acc}^\star$)。Theorem 3 的必要条件 $p\ge(1+\Gamma(q)-\beta-\eta_\kappa)/2$ 直接给出部署时“我的凭证预测精度够不够”的可检验门槛,Corollary 3 还给出零助力的充要支撑条件 $S_0=\{s:P_S^M(s)=0\}$。
研究动机
当前 LLM 安全防护——安全训练(Bai et al. 2022)、请求/响应过滤、安全补全策略(Sharma et al. 2025;Yuan et al. 2025)——都在观察到答案“将如何被真实使用”之前就做释放决策。这对对偶用途任务是致命的:同一份漏洞分析对授权测试员与入侵者、同一份根因解释对持牌研究员与恶意行为者,在技术内容上完全相同(Forge 2010;Bostrom 2011)。表达出的意图与交互历史能改善路由(Uppaal et al. 2026;Zheng et al. 2026;Deng et al. 2026),但它们生成的可观测证据仍发生在下游应用之前,故自适应攻击者可提交相同请求、声称相同目的、复现相同答案。经验上反复被验证:The Attacker Moves Second(Nasr et al. 2025)在观察防御后攻击,对 12 种近期防御中的大多数成功率超过 90%;Concealment of Intent 用技能组合隐藏恶意目标;被披露的网络滥用把任务分解与“为合法组织工作”的虚假声明结合,使用途声明沦为可复制证据。已有的不可行性结果——组合可允许答案的不安全泄露(Glukhov et al. 2024)、过滤的计算不可行性(Ball et al. 2025)、效用保持防御包装的约束(Bhatt et al. 2026)——揭示不同障碍,但都未精确刻画由“隐藏下游用途 + 可复制证据”共同造成的攻击者助力下界。
本文的目标是论文要回答一个精确量化问题:当每个有用答案同时也可能帮助恶意下游用途、且防护在释放前看到的所有证据都可被攻击者复现时,在仍要保持目标合法效用的前提下,最少有多少攻击者助力不可避免?作者不想再提一个分类器,而要给一个紧的、与机制无关的刻画——任何安全训练、任何多轮提问、任何随机化都无法打破它。除刻画地板外,目标是精确指出需要哪种额外成分(一种能提供不可复制、用途可预测信息的可信凭证)才能突破地板,并把需求翻译成可测量的量:信号分离度 $d=\mathrm{TV}(P_S^B,P_S^M)$,或等先验最优平衡准确率 $p=(1+d)/2$。论文还希望把此前分离的三类工作——对偶用途研究、意图/澄清研究、访问控制/凭证研究——统一在同一个形式化问题下:可观测的访问证据何时对策略性用户有价值?
与已有工作不同的是,独特切入角度是把前人混在一起的两件事干净地分开:被释放的能力(菜单上有哪些输出、每个输出带来多少合法价值/恶意价值)与关于下游用途的证据(释放前防护观察到的一切)。此前的不可行性结果要么限制了机制类(Bhatt et al. 要求连续且效用保持;Ball et al. 研究计算性过滤器),要么研究的是另一种障碍(Glukhov et al. 组合固定的可允许答案)。本文对释放规则不施加任何连续性、任何计算性限制,并证明在可复制证据下即便任意强大的交互式防护也会精确退化为静态凸包前沿 $\Gamma(q)$。它还首次把“证据的可复制性”提升为一等公民的可量化对象(通过全变差距离 $\delta_\kappa$),同时给出精确结果(Theorem 1)与近似鲁棒性(Theorem 3,式22:$\beta+d+\eta_\kappa\ge\Gamma(q)$)。最后,它把抽象要求“不可复制证据”转化为 Corollary 3 中具体、可检验的条件:零助力要求足够多的合法效用落在恶意过程以零概率产生的信号取值上。
核心方法
框架先固定公开任务上下文 $W=w$(含任务、身份、角色与声称用途),防护承诺释放菜单 $A$(终端输出,含拒答 $a_0$)。部署用两个反事实世界衡量每个输出:世界 $B$(合法,价值 $u_B(a)$)与世界 $M$(最佳允许恶意用途,$u_M(a)=\sup_{m\in M_w}v_{M,w,m}(a)$)。合法效用目标 $q$ 下的最小不可避免助力是静态线性规划量 $\Gamma(q)=\min_{\mu\in\Delta(A)}\sum_a\mu(a)u_M(a)$ 约束 $\sum_a\mu(a)u_B(a)\ge q$(式4);对有限 $A$ 它等于凸包 $V=\mathrm{conv}\{(u_B(a),u_M(a))\}$ 上 $\min\{y:(x,y)\in V,\,x\ge q\}$,必定达到、单调非降、凸且分段线性。整个技术问题变成:任何交互式协议(一串马尔可夫核 $\kappa_t$ 加终端释放核 $g$)能否把最坏情况助力压到这个静态地板下?直觉是:交互只有在迫使攻击者产生合法用户不会产生的证据时才有帮助;若攻击者能在每个可达历史上复制合法响应核(Proposition 1),对话定律重合,交互毫无价值。
核心创新是“复制定律论证”:只要证据通道可复制——恶意对话定律的闭凸包 $C_\kappa=\mathrm{co}\{P_{M,\sigma}^\kappa\}$ 包含合法参考定律 $P_B^\kappa$——任何依赖对话的释放规则都退化为对合法核取平均后不依赖对话的规则,于是最坏助力恰为 $\Gamma(q)$,无论交互多聪明或随机(Theorem 1)。这立即给出 Corollary 1 的三难困境:在对偶用途条件 $u_B(a)>0\Rightarrow u_M(a)>0$(蕴含 $\rho=\min u_M/u_B>0$、$\Gamma(q)\ge\rho q>0$)下,(1) 有用能力(效用 $\ge q$)、(2) 可靠安全(助力 $\le\beta<\Gamma(q)$)、(3) 仅用可复制证据的开放访问三者不能同时满足。逃生通道在结构上完全不同:可信信号 $S$ 其分布在合法/恶意用途间不同且不可复现。其预测价值被标量 $d=\mathrm{TV}(P_S^B,P_S^M)$ (等价平衡准确率 $(1+d)/2$)捕捉,零助力当且仅当 $q\le q_{\max}\cdot P_S^B(S_0)$,$S_0=\{s:P_S^M(s)=0\}$。
方法步骤详情
步骤1:固定 $W=w$ 与菜单 $A$,定义 $u_B$ 与 $u_M(a)=\sup_m v_{M,m}(a)$,验证对偶用途条件并算 $\rho$ 与前沿 $\Gamma(q)$。步骤2:把交互形式化为产生对话 $H=(X_1,Y_1,\dots,X_T,Y_T)$ 再终端释放 $A\sim g(\cdot|h)$,写出 $z\in\{B,M\}$ 的联合定律$P_z^{\kappa,g}(h,a)=P_z^\kappa(h)g(a|h)$(式2-3)。步骤3:定义可复制条件 $P_B^\kappa\in C_\kappa$(式9),对 $g$ 在合法核上取平均 $r_g(a|s)=\sum_h K_B^\kappa(h|s)g(a|s,h)$ 证明约简 $R_\kappa(q)=\Gamma(q)$(Theorem 1)。步骤4:推出三难困境(Corollary 1)与实现边界 $R_{\kappa,\mathrm{impl}}(q)\ge\Gamma(q)$(Corollary 2)。步骤5:引入可信信号 $S$,定义 $d$ 与条件复制定律 $Q_{\mathrm{copy}}^\kappa(s,h)=P_S^M(s)K_B^\kappa(h|s)$(式14),证明 $R_{H,S}^\kappa(q)=\Gamma_S(q)$(Theorem 2)。步骤6:刻画零助力 $\Gamma_S(q)=0\Leftrightarrow q\le q_{\max}P_S^B(S_0)$(Corollary 3)。步骤7:令 $\eta_\kappa=\inf_{Q}\mathrm{TV}(Q,Q_{\mathrm{copy}}^\kappa)$,由 TV 不等式得必要条件 $\beta+d+\eta_\kappa\ge\Gamma(q)$(Theorem 3,式22)。步骤8:扩展到任务族($\Gamma_\nu(q)=\sum_w\nu(w)\Gamma_w(q_w)$)、逐轮近似($\delta_\kappa\le\min\{1,\sum_t\epsilon_t\}$)与相关多会话的精确可加复合 $R_{\mathrm{sum}}^N(q)=\sum_i\Gamma_i(q_i)$(Proposition 2)。
技术新颖性
三点新颖性突出。第一,机制无关:不同于 Bhatt et al.(2026)限制为连续效用保持包装或 Ball et al.(2025)研究计算过滤器,本文允许有限空间上任意随机释放规则仍得到精确地板——所以障碍不在可实现性而在信息。第二,可复制性作为可量化的、基于距离的对象:$\delta_\kappa=\inf_{Q\in C_\kappa}\mathrm{TV}(P_B^\kappa,Q)$ 让界连续退化($[\Gamma(q)-\delta_\kappa]_+\le R_\kappa(q)\le\Gamma(q)$,式12),把“攻击者能模仿用户”从二值假设变成可测的策略特定量。第三,可信凭证的分离结果(Theorem 2)表明在条件复制下交互历史 $H$ 相对可信信号 $S$ 不增加任何最坏情况价值——所以花在越来越精细访问对话上的资源是浪费的,除非它们编码了不可复制的用途预测信息。框架还干净地复合:地板在相关会话间精确相加,从过程层面瓦解任务分解攻击。
实验结果
结果是定理而非基准数字。对偶用途条件结合 $A$ 有限给出 $\rho=\min_{u_B>0}u_M/u_B>0$,进而 $\Gamma(q)\ge\rho q>0$(式6):不存在能给合法用户正价值同时让攻击者助力为零的共享输出分布。Theorem 1 证明可复制证据下任何交互式防护最坏助力恰为 $\Gamma(q)$,更多提问、随机化或跨重试合并证据都无效。Corollary 1 形式化三难困境:{有用能力、可靠安全、开放访问}至多取二。Corollary 2 表明实现受限类仍无法击败 $\Gamma(q)$,高出它是纯实现损失。对可信信号 $\mathrm{Acc}^\star(S)=(1+d)/2$(式13);Theorem 2 表明条件复制下交互历史相对 $S$ 不增价值。Corollary 3 给零助力充要条件 $q\le q_{\max}P_S^B(S_0)$。Theorem 3 给可部署必要条件 $\beta+d+\eta_\kappa\ge\Gamma(q)$(式22),即瞄准 $\beta$ 需平衡准确率 $p\ge(1+\Gamma(q)-\beta-\eta_\kappa)/2$。Proposition 2 表明地板在 $N$ 个相关会话间精确相加,故任务分解无法降总助力。第4节收集支持性经验证据而非跑新实验:对偶用途引用 Internal Safety Collapse(Wu et al. 2026)与 OpenSafeIntent;复制引用 The Attacker Moves Second(12 种防御中大多数成功率 >90%)、Concealment of Intent、Crescendo/Red Queen/Foot-In-The-Door与人类可比率的 CAPTCHA 求解器;能力损失引用 XSTest/OR-Bench 过度拒答、Defensive Refusal Bias(Campbell et al. 2026)、同谱系丢失的漏洞分析效用(Li et al. 2026);凭证引用 Parno et al. 2010、OpenAI Trusted Access for Cyber(2026)与 Anthropic 计划。
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 自适应攻击下防御绕过率(The Attacker Moves Second, Nasr et al. 2025) | 观察防御后的攻击成功率 | 理论:可复制证据下交互式防护最坏助力恰为静态地板 $\Gamma(q)$,无法低于 | 12 种近期防御(提示注入/越狱防护) | 为 >90% 绕过率提供机制级解释:这些防御依赖的都是可复制证据 |
| 对偶用途任务存在性(Internal Safety Collapse / OpenSafeIntent) | 满足 $u_B(a)>0\Rightarrow u_M(a)>0$ 的可释放输出占比 | 理论:对偶用途条件蕴含 $\Gamma(q)\ge\rho q>0$,零助力不可能 | 前沿 LLM 在合法专业任务上的 Internal Safety Collapse 触发 | 把经验性“安全塌缩”现象形式化为不可打破的助力下界 |
| 可信凭证消除助力的门槛 | 等先验最优平衡准确率 $p=(1+d)/2$ | 必要条件 $p\ge(1+\Gamma(q)-\beta-\eta_\kappa)/2$;零助力充要 $q\le q_{\max}P_S^B(S_0)$ | 无可信凭证($d=0,\eta_\kappa=\delta_\kappa$,回到式12) | 把“需要不可复制证据”翻译成可测标量 $d$ 与支撑条件 $S_0$ |
局限与改进
作者承认分析假设了固定的效用标定、有限的运算分辨率与一个特定的攻击者类;部署特定的论断还需策略特定的复制误差估计 $\delta_\kappa$(或 $\eta_\kappa$)。这里的“开放访问”指对一个已承诺的推理时机制的无凭证访问,而非对已发布模型权重的访问——权重访问场景会改变机制/释放菜单,落在模型之外。我自己的观察:框架仅在复制定律前提成立时精确,而实践中该前提是一个理想化;为真实部署估计 $\rho$、$\Gamma(q)$,尤其是 $\delta_\kappa$,本身是一个论文未解决的困难测量问题。地板 $\Gamma(q)\ge\rho q>0$ 是运算性的(关于所选分辨率下的正性),而非部署规模的余量——定量天花板 $\beta>0$ 只有在 $\beta<\Gamma(q)$ 时才不可能。威胁模型本质是单防御者、单攻击者类,未涉及合谋、多方凭证或经济/战略均衡。最后,第4节的经验证据是相关/示意性的——没有任何论文直接为真实防护测量 $\Gamma(q)$ 或 $\delta_\kappa$。
独立分析的弱点
(1)整个体系建立在复制定律前提 $P_B^\kappa\in C_\kappa$ 之上;对真实 LLM 访问协议,没有原则性方法界定 $\delta_\kappa$,从业者难以判断适用 Theorem 1(精确)还是 Theorem 3(近似)以及 $\eta_\kappa$ 有多大。改进方向:构建经验估计特定分类器/过滤器 $\delta_\kappa$ 的红队评测框架。(2)效用 $u_B,u_M$ 被假设为给定且有限;实践中它们主观、依赖部署、难以征询,使 $\Gamma(q)$ 本身不确定。改进:对地板做效用误指定的敏感性分析。(3)可信凭证逃生要求具有大 $d$ 的不可复制信号;论文除指出 $P_S^M$ 变化外,并未定量分析凭证窃取、转让或妥协。改进:建模凭证经济学与吊销。(4)威胁模型忽略合谋与多攻击者联盟,而后者可共享凭证。(5)权重访问(开放权重)部署被明确排除在外,却日益成为真实场景。改进:把访问证据模型扩展到用户控制机制的设定。
未来方向
作者指向测量前提:为特定任务族(Internal Safety Collapse、OpenSafeIntent)确立动作级对偶用途条件并测量 $\rho$,以及估计策略特定的 $\delta_\kappa$。基于结果,自然的延伸包括:(a) 设计在保持可用性、最小化凭证转让/妥协下 $P_S^M$ 增长的同时最大化 $d$ 的凭证;(b) 扩展到二元/成功计数目标(论文通过 $1-(1-r)^N$ 草拟但未展开);(c) 把有界重试的累积历史纳入可信信号 $S$;(d) 与凭证市场的经济/博弈论模型闭环;(e) 把框架移植到用户控制“机制”的开放权重设定;(f) 在真实对偶用途基准上直接拟合 $\Gamma(q),\rho,d$ 做经验验证,而非依赖间接证据。
复现评估
这是一篇理论论文,没有代码、数据集或训练模型可发布;可复现性因此简化为检查证明,它们短小自足(复制定律取平均技巧、全变差不等式式1、标准等先验检验恒等式)。数学前置(马尔可夫核、全变差、单纯形凸几何、Blackwell 信息)都是标准的,推导可由读者重做。第4节的经验论断全部是二手引用(Internal Safety Collapse、OpenSafeIntent、The Attacker Moves Second、XSTest/OR-Bench、OpenAI Trusted Access),故复现经验叙述需查阅这些来源;引用的数字没有一条来自本文自己的实验。计算成本可忽略(纯理论)。部署式可复现的主要障碍是未测量的量 $\delta_\kappa$ 与 $\rho$,论文明确把它们标为部署特定且未提供估计工具。
论文图表