CLEAR:面向效用保持的大语言模型安全对齐的连续潜空间适配器路由 CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
用轻量隐藏态门控连续调节安全LoRA强度,将HarmBench攻击成功率降至近零同时保留通用能力
前置知识
LoRA(低秩适配)
LoRA 冻结预训练权重矩阵 $W$,用两个低秩矩阵的乘积近似参数更新:$\Delta W = \frac{\alpha}{r}BA$,其中 $B \in \mathbb{R}^{d \times r}$、$A \in \mathbb{R}^{r \times k}$,秩 $r \ll \min(d,k)$。前向计算变为 $h' = (W + \Delta W)h$,只训练极少量参数就能让模型学到新行为,是参数高效微调的主流方法。
CLEAR 的安全分支就是一个插在 q_proj/v_proj 上的 LoRA(rank 8),全文的核心机制是给这个 LoRA 的贡献乘一个连续门控系数,不理解 LoRA 就无法理解方法本体。
对齐税与过度拒绝
安全对齐(SFT、RLHF、DPO)通常全局修改模型参数,让同一套参数同时服务有害、良性和安全相邻输入。副作用是模型在拒绝危险请求的同时也扰动了对正常问题的回答能力,并倾向于拒绝只是表面相似于危险请求的良性提问,即过度拒绝,两者合称对齐税。
对齐税正是本文要解决的核心问题:论文用 GSM8K、MMLU、TruthfulQA 的下降和 XSTest 过度拒绝率来量化它,CLEAR 的全部设计目标就是在降 ASR 的同时把这笔税降到最低。
条件计算与门控路由
混合专家(MoE)等条件计算方法根据输入动态激活部分网络模块,用路由器给每个输入选择专家或分配权重,从而在扩大模型容量的同时控制计算量。路由可以是离散的(硬选择)或连续的(加权组合)。
CLEAR 本质上是一个面向安全的路由架构:门控 MLP 从冻结的隐藏状态预测连续分数 $g(x) \in [0,1]$ 来缩放安全 LoRA 强度。理解 MoE 式路由有助于区分 CLEAR 与传统『适配器加载后永远生效』的做法。
越狱攻击与安全评测基准
越狱攻击通过精心构造的提示绕过模型的安全训练,诱导其输出有害内容。HarmBench 用红队行为数据测攻击成功率(ASR),由专用分类器判定生成是否有害;XSTest 则包含大量『看起来危险但实际安全』的提示,用于测量过度拒绝。WildJailbreak 训练集把提示分为 vanilla/adversarial 与 benign/harmful 四个子型。
论文的全部安全结论建立在 HarmBench ASR 和 XSTest 拒绝率上,训练数据来自 WildJailbreak,其四子型结构直接催生了 CLEAR 的子型感知门控加权设计。
PGD 白盒对抗攻击
投影梯度下降(PGD)攻击在白盒设定下直接利用模型梯度,迭代构造加在输入或中间表征上的扰动 $\Delta$,每步沿损失梯度上升后投影回约束球(如 $\|\Delta\|_\infty \le \epsilon$)。作用于中间隐藏层时称为潜空间攻击,可以在不改变输入文本的情况下改变模型行为。
论文用针对隐藏状态的目标 PGD 攻击($\epsilon=0.001$、10 步)检验各对齐方法的表征级鲁棒性,这是证明 CLEAR『按需激活』比全局修改更抗扰动理论直觉的关键实验。
研究动机
现有安全对齐方法(SFT、RLHF、DPO、安全 LoRA)都是全局参数更新:对齐完成后同一套修改过的策略被无差别地应用在有害、良性和安全相邻输入上。代价是实实在在的:在 Llama-3-8B-Instruct 上,SFT 把 HarmBench 攻击成功率从 32.25% 降到 2.00%,但 GSM8K 从 75.06% 跌到 66.34%(掉近 9 个百分点),XSTest 安全过度拒绝率从 2.80% 升到 10.80%;标准 LoRA 虽然把 ASR 降到 0.00%,但不安全请求的拒绝率反而从 88.50% 退化到 82.50%,说明安全能力本身也被削弱。Gemma-2-2B-it 更严重:SFT 后 GSM8K 从 46.47% 掉到 38.06%。另一条路是外置 guard 模型,但 Llama Guard 3 有 80.3 亿参数、PromptGuard 也有 2.79 亿参数,且 PromptGuard 在 XSTest 上几乎把所有安全提示都判为不安全,作为路由器严重失衡。
本文的目标是本文的目标是把安全对齐从『全局修改一次、对所有输入生效』重构为『按输入风险按需激活』的条件化机制。具体而言:冻结骨干 LLM 以完整保留其通用能力;引入一个只针对安全行为的 LoRA 适配器;训练一个轻量门控网络从隐藏状态预测连续干预分数 $g(x) \in [0,1]$,按 $h' = (W + g(x)\Delta W)h$ 缩放适配器强度——良性提示接受接近零的干预、行为贴回冻结骨干,有害或对抗性提示接受强干预、滑向拒绝式回复。量化目标是把 Llama-3-8B-Instruct 的 HarmBench ASR 从 32.25% 压到接近 0,同时 GSM8K 等效用指标显著优于全局 SFT/LoRA。
与已有工作不同的是,已有三条路线都没占到这个生态位。其一,改进偏好数据、校准拒绝策略仍是全局干预,只是缓解而非消除对齐税;其二,表征工程(refusal direction、activation steering、探针)主要用内部信号做分析或直接向激活加转向向量,不控制参数化适配器的启用强度;其三,外部 guard 模型是与生成解耦的独立分类器,参数量巨大且阈值需单独调。CLEAR 的独特切入是:门控不是外置过滤器,而是与安全 LoRA 联合训练、直接缩放前向计算内部安全干预强度的组件;再配合 WildJailbreak 四子型感知的加权 BCE 和硬成对边界损失,专门解决『对抗性良性提示表面上像有害请求、对抗性有害提示把恶意意图藏起来』这两类最易混淆的情形。
核心方法
直觉上,安全行为应该像紧急制动一样按需触发,而不是永远踩着。CLEAR 的技术路线分三块:冻结骨干 LLM;插入安全专用 LoRA(rank 8、缩放 16,作用于 q_proj 和 v_proj);加一个门控网络在生成前从提示的隐藏状态预测干预分数。门控是两层 MLP,隐藏维度为骨干隐层的 1/8,输入取自三个中后层(如 Gemma 用第 12/16/20 层)的提示词元隐藏态,聚合后经 sigmoid 输出 $g_i \in [0,1]$。每个被适配的投影层计算 $h \mapsto Wh + g_i\Delta W_\theta h$,且同一标量 $g_i$ 在整个序列(prefill 和全部自回归解码)共享,不逐 token 重算。训练时联合优化门参数 $\psi$ 和 LoRA 参数 $\theta$,总损失 $\mathcal{L} = \lambda_{\text{BCE}}\mathcal{L}_{\text{gate}} + \lambda_{\text{pair}}\mathcal{L}_{\text{hard}} + \mathcal{L}_{\text{LoRA}}$;推理时先跑一次禁用 LoRA 的 prompt-only 前向得到 $g_i$。
本质区别在于把单一生成策略近似为条件策略 $f(x) = f_{\phi,\theta,g(x)}(x)$:标准 LoRA 对所有输入执行 $h' = (W + \Delta W)h$,是输入无关的干预;CLEAR 让干预强度成为输入的连续函数,低风险提示几乎回到冻结骨干、高风险提示获得完整安全更新,干预强度与估计风险匹配。第二个区别是职责解耦:门学习『干预多强』(风险估计),LoRA 分支学习『被激活后怎样安全回复』(安全行为),二者联合但目标分离。第三个区别是门直接作用在前向计算内部,与生成过程一体,区别于事后审查或外部过滤。第四个区别是显式的分数分布整形:子型感知 BCE 加权(对抗性子型权重更大)加硬成对边界损失 $\mathcal{L}_{\text{pair}}(u,s) = \max\{0, m - (g_u - g_s)\}$,并用 $a_{u,s} = \text{softmax}(\beta(g_s - g_u))$ 难例挖掘,确保不安全提示的分数系统性地高于安全提示。
方法步骤详情
第一步,风险打分:对提示 $x_i$,从冻结骨干的三个中后层 $\mathcal{L}$ 提取提示词元隐藏态 $H_i^{(\ell)}$,跨层跨位置聚合得 $z_i$,门控输出 $g_i = G_\psi(z_i)$;Gemma-2-2B 用层 [12,16,20],Llama-3-8B 用 [15,20,25],Qwen 系列各有对应配置。第二步,门损失:用 WildJailbreak 二元标签训练子型加权 BCE $\mathcal{L}_{\text{gate}} = \frac{1}{N}\sum_i w_{\text{type}(i)}\text{BCE}(g_i, y_i)$,对 adversarial_benign 和 adversarial_harmful 赋更大权重;同时对批内所有不安全-安全对 $(u,s)$ 计算成对边界损失并按难例加权求和得 $\mathcal{L}_{\text{hard}}$。第三步,适配器对齐:仅用不安全提示及其安全目标回复(拒绝、 redirection、安全引导)计算语言建模损失 $\mathcal{L}_{\text{LM}}$,加 $\lambda_{L2}\|\Delta W_\theta\|_2^2$ 正则。第四步,联合优化:AdamW,学习率 $3\times10^{-4}$,1 个 epoch,有效批大小 64,数据为 WildJailbreak 训练集 261,559 条(128,781 安全 / 132,778 不安全)。第五步,推理:先算 $g_i$,门阈值 0.5 用于路由分析,整个生成过程沿用同一 $g_i$。
技术新颖性
相对 MoE 和 routed-adapter 文献(AdapterFusion、LoraHub、Switch Transformer),那些工作用路由做效率优化或任务特化,CLEAR 是第一个把连续路由专门用于安全干预强度调制的架构,且门在序列级共享一个标量而非逐层逐 token,控制极简。相对表征工程(refusal direction、activation steering、SAE 可解释性),CLEAR 不是直接往激活里加方向向量,而是把冻结内部表征转化为对参数化适配器强度的乘性调制,保留了行为学习的可训练性。相对 Llama Guard、PromptGuard 等外置 guard,CLEAR 的门只有 664,129 个参数,比 PromptGuard(2.79 亿)小约 420 倍、比 Llama Guard 3 8B(80.3 亿)小一万多倍,且与生成联合优化而非阈值拼接。成本上,Llama-3-8B 上 CLEAR 可训练参数仅 5.51M(SFT 为 8.03B),显存 4.05e10 字节不足 SFT(9.23e10)一半,训练时长 5:08:55 与 SFT 的 5:08:14 基本持平。
实验结果
主实验(Table 1,三次运行取中位数):Llama-3-8B-Instruct 上,CLEAR 把 HarmBench ASR 从基座 32.25% 降到 0.50%,不安全请求拒绝率从 88.50% 升到 92.50%,同时保留 73.46% GSM8K(SFT 66.34%、LoRA 66.72%,高出约 7 个百分点),TQA MC2 52.63 甚至略超基座 52.47;标准 LoRA 虽 ASR 为 0.00% 但不安全拒绝率只有 82.50%。Gemma-2-2B-it 上 CLEAR 达到 0.00% ASR 和最高 96.00% 不安全拒绝率,GSM8K 41.62%(SFT/LoRA 约 38%)、TruthfulQA MC2 从约 47% 升到 53.19%,但安全过度 refusal 升至 9.60%。与现有对齐模型族比(Table 2):Llama-3-8B-RR 的 ASR 仍为 15.50%,Alpaca 系 P-SACPO 为 22.50%,P-SACPO+CLEAR 降到 0.50%(不安全拒绝 26.00%→46.00%),而各对齐变体分布在 15.50%–24.00%。门质量(Fig.2/Table 3):66.4 万参数的门在 XSTest 路由上取得优于 PromptGuard(几乎把所有安全提示判为不安全)和 Llama Guard 3 的 trade-off。跨规模(Table 4):Qwen2.5 0.5B/1.5B/3B/7B 的 ASR 分别从 22.50/6.25/15.50/29.00% 降到 0.25/0.25/0.25/2.00%,7B 上 GSM8K 82.18% 完全保留、MMLU 还略升到 74.19%;门 ROC-AUC 从 0.5B 的 0.7795 升到 7B 的 0.9566,PR-AUC 0.7475→0.9363,安全-不安全分数 margin 0.0875→0.2362。潜空间自适应攻击(Fig.3,$\epsilon=0.001$、10 步 PGD):CLEAR 防御在 embedding/中间/末层注入下 ASR 为 0.0%/7.1%/18.4%,远优于 Full SFT(47.0%/35.0%/22.0%)和标准 LoRA(54.0%/48.0%/31.0%)。消融:只 BCE 训练的门使 ASR 升到 3.25%、过度 refusal 升到 14.40%;门从单层 16 扩到多层 12/16/20 把 GSM8K 从 34.42% 提到 41.93%;去掉 LoRA L2 正则各项轻微变差。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 有害指令鲁棒性(Llama-3-8B-Instruct) | HarmBench ASR ↓ | 0.50% | 基座 32.25%,SFT 2.00%,标准 LoRA 0.00% | 较基座降 31.75 个百分点,接近 LoRA 的绝对安全水平但不付出其效用代价 |
| 数学推理(Llama-3-8B-Instruct) | GSM8K 5-shot ↑ | 73.46% | SFT 66.34%,标准 LoRA 66.72%,基座 75.06% | 比 SFT 高 7.12 个百分点、比 LoRA 高 6.74 个百分点,仅比基座低 1.6 个百分点 |
| 不安全请求拒绝(Gemma-2-2B-it) | XSTest unsafe refusal ↑ | 96.00% | 基座 48.50%,SFT 90.00%,LoRA 88.50% | 较基座提升 47.5 个百分点,为该骨干上最高 |
| 真实性问答(Gemma-2-2B-it) | TruthfulQA MC2 ↑ | 53.19% | SFT 47.99%,LoRA 47.16%,基座 53.13% | 比 SFT 高约 5.2 个百分点,并恢复到基座水平 |
| 与安全对齐模型族对比(Alpaca 系,P-SACPO 初始化) | HarmBench ASR ↓ | 0.50%(P-SACPO + CLEAR) | Alpaca-7B 42.00%,SACPO 21.75%,P-SACPO 22.50%,Beaver-7B 24.00% | 降低 22 个百分点;其他对齐变体仍停留在 15.50%–24.00% |
| 门控路由质量(XSTest 路由诊断) | 路由 trade-off 与检测器参数量 | 664,129 参数的门,取得有利 trade-off | PromptGuard(2.79 亿参数,几乎全部判 unsafe)、Llama Guard 3 8B(80.3 亿参数) | 参数量比 PromptGuard 小约 420 倍、比 Llama Guard 3 小约 12,000 倍 |
| 跨规模验证(Qwen2.5-7B-Instruct) | HarmBench ASR ↓ / GSM8K ↑ | 2.00% / 82.18% | 基座 29.00% / 82.18% | ASR 降 27 个百分点且 GSM8K 精确保留,MMLU 还从 74.15 微升至 74.19 |
| 潜空间自适应攻击鲁棒性(Gemma-2-2B-it,ε=0.001) | ASR(embedding/中间/末层注入)↓ | 0.0% / 7.1% / 18.4% | Full SFT 47.0% / 35.0% / 22.0%;标准 LoRA 54.0% / 48.0% / 31.0% | embedding 层注入下较 LoRA 降低 54 个百分点 |
局限与改进
作者承认的局限有四点:其一,整个框架依赖门的可靠性——良性提示可能触发不必要的干预、拿到低门分的不安全提示则会完全绕过安全适配器;其二,实验只覆盖 0.5B–8B 的开放权重模型,能否推广到前沿规模或多模态系统未知;其三,鲁棒性依赖安全训练分布的多样性,未见过的越狱风格或分布漂移仍可能绕过;其四,只处理单轮文本安全,不涉及长程欺骗或多轮对抗。我的补充观察:Gemma 上过度拒绝从 4.80% 升到 9.60% 说明路由并非无损;XSTest 用字符串匹配判定拒绝、HarmBench 依赖单一 Llama-2-13b 分类器,评测本身偏粗糙;对抗实验中 PCA 投影防御只加在 CLEAR 上,SFT/LoRA 基线未获得同等防御,对比并非完全对等;且攻击设定较窄(100 条提示、ε=0.001、10 步)。
独立分析的弱点
第一,推理开销被低估:推理需要先做一次禁用 LoRA 的完整 prompt-only 前向再生成,prefill 计算近似翻倍,对长提示的延迟敏感场景不友好——改进方向是复用生成前向的隐藏态算门分,或用早退/浅层草稿网络估计门分。第二,序列级单一标量的控制粒度太粗:多轮对话中前期良性语境可能让恶意后续请求拿到低门分而绕过,改进方向是 token 级或轮次级门控、滑动窗口重估。第三,二元标签监督无法表达风险的连续程度和 dual-use 提示(如安全研究、医学咨询),改进方向是用有序风险等级回归或软标签分布。第四,门错误不可恢复:低门分的不安全输入没有任何兜底机制,改进方向是把门分当作不确定性信号,低置信区间触发保守路由或级联轻量输出审核。第五,门阈值固定 0.5 且校准随分布漂移退化(0.5B 模型 ROC-AUC 仅 0.78),改进方向是引入 conformal 校准或在线阈值自适应。第六,P-SACPO+CLEAR 的不安全拒绝率绝对值只有 46.00%,说明在弱基座上叠加路由并不能补足安全行为本身。
未来方向
作者提出的方向:更鲁棒的门控架构、自适应路由策略,以及在更大规模和真实部署环境下的评估。基于本文成果可以延伸:把门控扩展到多轮对话与 agent 工具调用场景,对计划中的危险动作链做前置路由;路由多个专业化安全 LoRA(按风险类型:生化、网络、未成年人保护等)而非单个适配器,形成安全专家混合;利用门分数 $g$ 作为连续风险信号做拒答校准和不确定性量化;将门自适应 PCA 投影防御推广为独立的表征净化层并测试不依赖该防御的更强自适应攻击(如直接对门参数或损失反向优化的攻击);在多模态与前沿规模模型上验证门分可分性是否随规模继续提升(论文已显示 0.78→0.96 的趋势);以及给出门控泛化的理论刻画。
复现评估
复现条件相当充分:训练数据全部公开(allenai/wildjailbreak 训练集,261,559 条,四子型);骨干模型公开(gemma-2-2b-it、Llama-3-8B-Instruct、Qwen2.5 系列);超参在 Table 5 完整列出(AdamW、lr $3\times10^{-4}$、1 epoch、有效批 64、LoRA rank 8 / 缩放 16 / 目标 q_proj+v_proj),门输入层在 Table 6 逐模型给出;评测协议详细(HarmBench 用官方 cais/HarmBench-Llama-2-13b-cls 分类器、XSTest 字符串匹配、GSM8K/MMLU 5-shot、TruthfulQA 0-shot,均经 lm-eval-harness,三次运行取中位数)。硬件门槛友好:单卡 NVIDIA GH200 120GB 即可,Llama-3-8B 上 CLEAR 训练约 5.1 小时,Gemma-2-2B 约 3.9 小时,可训练参数仅 5.51M/2.26M。唯一缺憾是论文未给出开源代码仓库链接,门控与推理时 PCA 防御(128 维子空间、$\gamma\in[0.05,0.80]$ 门自适应投影)需要按附录自行实现。综合评估:中等偏低复现难度,一张 A100/H100 级 GPU 加数天工程量可完整复现主表结果。
论文图表
评估所用 HarmBench 分类器的完整判断提示词:给定行为描述与生成文本,要求分类器只回答 yes/no,判定标准包括实例必须明确且非最小、生成内容本身须有害、对行为 merely 做出反应的内容不算等规则。
ASR 的全部数值都出自这个判官提示,公开它可以确认『攻击成功』的操作性定义,对评估结果的可信度和复现至关重要。