← 返回 2026-08-20

越流行越难遗忘:面向大模型遗忘的自适应流行度方法 The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina 📅 2026-08-14 👍 17 2026-08-25 18:30
LLM遗忘 机器遗忘 梯度上升 流行度差距 约束优化 隐私与合规

用外部流行度为每条事实定制遗忘梯度强度,自动平衡深度擦除与能力保留

前置知识

机器遗忘(Machine Unlearning)

从已训练模型中定向删除特定知识(遗忘集)而无需完整重训练的技术,同时用保留集衡量模型其他能力是否受损。主流分为梯度上升类(GA、GD、WGA,直接最大化遗忘集负对数似然)与偏好优化类(NPO,把遗忘重构为让输出分布远离记忆回答的对齐问题)。前者激进但易伤及保留能力,后者温和但对记忆深的事实收敛慢。

AdaPop 是一种训练时梯度上升类遗忘方法,全文所有公式与实验都围绕「遗忘集损失上升、保留集不塌」这一框架展开,不懂这个框架无法理解方法与评测。

流行度差距(Popularity Gap)

预训练语料中出现频率高的事实被参数编码得更深:Kandpal 等(2023)证明模型回忆率与语料频率呈幂律关系,Merullo 等(2025)发现高频事实的线性表征更强。用于梯度遗忘时表现为:流行事实(如知名首都)抵抗删除,改写问法仍能问出;罕见事实则一推就掉且容易被过度擦除、连带损伤保留质量。外部统计(Wikipedia sitelink 数)可作为事实流行度的离线代理。

这是论文的问题出发点:AdaPop 的公式设计(流行度→指数)、锚点校准、分层评测(Table 5)全部针对这一差距,Figure 8 还专门量化了它。

置信度加权梯度上升(WGA)

Wang 等(2025a)提出的遗忘方法:用模型当前对每个 token 的预测概率给遗忘损失加权,数学上恰好让每个 token 对梯度的贡献均等,缓解了 GA 的高置信 token 主导问题。但其权重是「局部信号」——只反映模型当前输出什么,一旦表面答案被压制权重就饱和,无法触及参数编码深度,导致事实仍可经改写或对抗提示恢复。

WGA 是本文最强、最主要的对比基线;AdaPop 的核心论点「外部流行度信号优于模型自身置信度信号」就是围绕与 WGA 的对比建立的(其遗忘集 ΔRank 为负是关键证据)。

对偶上升与拉格朗日约束优化

把「保留损失漂移 ≤ ε」写成不等式约束,引入对偶变量 λ 作为拉格朗日乘子:约束被违反时 λ 增大、收紧保留惩罚 α=α0+λ,未违反时 λ 衰减、放开遗忘力度。AdaPop 在每个 epoch 做一次投影更新 $\lambda_{k+1}=\Pi_{[0,\lambda_{\max}]}(\lambda_k+\eta_\lambda(\delta_k-\varepsilon))$,从而在线自动调节遗忘-保留权衡。

这是方法的第二大组件:它免去逐(数据集、模型)网格搜索保留系数,并在遗忘压力增大时防止保留崩塌(消融显示无控制器时保留从 ≥0.927 跌至 0.769)。

LoRA 低秩微调

不更新原模型权重,只训练注入到注意力/前馈层的低秩矩阵(秩 r,缩放系数 α)。本文用 r=32、α=64,学习率 1e-4,5 个 epoch。LLM 遗忘研究的事实标准配置;引用 Borisiuk 等(2026)的结论:全量微调在流行事实上要么不收敛要么灾难性遗忘,因此被排除。

论文全部实验基于 LoRA,复现、对比与理解其局限(未验证全量微调)都必须知道这一设置。

DUET 与 RWKU 基准

两个真实世界知识遗忘基准。DUET 是带 Wikidata 流行度标注的城市事实问答集(分数 69–3763,中位数 1090,跨近两个数量级),可直接观察流行度差距;RWKU 侧重精准擦除与语义邻近知识保留,自带 9 种对抗提示攻击(前缀注入、角色扮演、反向提问、跨语言改写等)的鲁棒性子集,流行度分数 0–704(中位数 130),可由 sitelink 计数补算。

所有主表(Table 1–3)与鲁棒性结果(Table 4)都在这两基准 × 三模型族上报告;两者流行度分布的差异正是检验方法稳健性的设计核心。

研究动机

现有梯度类遗忘方法(GA、GD、WGA)与偏好类方法(NPO)对遗忘集里每条事实施加同质的、或仅按模型当前置信度调制的梯度压力,隐含假设「所有事实同样难擦」。但预训练记忆深度与语料频率呈幂律:高频事实(国家首都、知名城市)参数编码深、抵抗删除;低频事实一推就掉。结果是系统性失败模式「流行度差距」:罕见事实被过度擦除,连带损伤保留质量(GD 在 RWKU 上保留 ROUGE-L 跌到 0.334–0.462,GA 直接把 MMLU 打到 0.23–0.25 的随机水平);流行事实则擦不干净,换种问法或对抗提示就能把答案问出来——Krishnan 等(2025)的受控预训练实验与 Borisiuk 等(2026)在真实事实上的评测都记录了这一现象,但都只刻画问题、未给训练时解法。更隐蔽的是 WGA 这类置信度加权方法会在表面答案被压制后停止施压:其 DUET 遗忘集 ΔRank 为 −3,714(金答案相对排名不降反升),改写查询下遗忘 ROUGE-L 高达 0.104–0.396,说明事实本体仍可恢复——模型只是学会了「不说」,不是「忘了」。

本文的目标是本文目标是做出第一个在训练阶段就把「每条事实的外部流行度」纳入遗忘梯度设计的方法,具体拆成三件事:(1) 把外部流行度代理(Wikidata sitelink 分数,或无知识图谱覆盖时的 LLM-as-Judge 打分)经幂律映射转成每条事实的指数 $\beta_i$,对 token 级上升信号重加权——流行事实获得「压力维持」梯度(越擦越用力),罕见事实获得「自限制」梯度(擦掉即停)防止过擦;(2) 用 epoch 级对偶上升控制器在线调节保留惩罚 $\alpha$,把保留损失相对漂移约束在 $\varepsilon=0.1$ 内,免去逐(数据集、模型)超参网格搜索;(3) 在 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-7B-it 三个模型族 × DUET/RWKU 两个真实基准上验证:改写查询下泄漏比竞争方法少约 5 倍、对抗改写下少约 1.6 倍,同时 MMLU 与遗忘前差距不超过 0.05,且内部表征指标证明遗忘发生在参数层面而非输出掩盖。

与已有工作不同的是,本文的独特切入是「信号来源」。重加权遗忘信号本身不新,但已有方法的权重都从模型自身导出:WGA 与 FaLW(Yu 等,2026,来自长尾图像分类)都用模型预测概率——这是局部信号,报告的是模型当前输出什么,一旦表面答案被压制就饱和,恰好停在 WGA 改写召回仍然存活的位置;FaLW 还需要同类未见数据的参考分布,而事实级遗忘中每条事实自成一类、这种分布不存在。按模型内在量(如逐 token 置信度)校准的方法原理上都解决不了差距,因为置信度不反映参数编码深度,Łucki 等(2025)也指出面向输出的干预留下参数知识完好。AdaPop 反其道而行:用一个训练前固定、与模型输出完全无关的外部语料频率代理(Wikidata sitelink 分数,与 Pile-train 383B token 上 infini-gram 实测频率在 log 空间 Pearson 0.970)决定每条事实的梯度区制。另外,约束式方法 PDU 虽有控制器但梯度内部一视同仁;AdaPop 是首个把「外部流行度重加权」与「在线保留控制器」两个解耦组件组合的方案,2×2 消融证明缺一不可。

核心方法

直觉上,遗忘一条事实像拔一根桩:打得深就要用大力气,但不分深浅都用力过猛,浅桩周围的地面(保留能力)会被砸坏。AdaPop 用外部流行度分数 $s_i$ 度量「桩的深度」,映射成幂律指数 $\beta_i=a\cdot s_i^{-b}$,再变成 token 级权重 $w_{i,t}=\mathrm{sg}[p_{i,t}^{\beta_i}]$(sg 为停梯度)去重塑遗忘集 NLL 上升信号。技术路线是把定向遗忘框成约束优化:最小化流行度加权的遗忘损失 $\mathcal{L}_f$,同时要求保留损失相对漂移 $\delta_k\le\varepsilon$;保留系数 $\alpha=\alpha_0+\lambda$ 作为拉格朗日乘子,由对偶上升控制器逐 epoch 更新 $\lambda_{k+1}=\Pi_{[0,\lambda_{\max}]}(\lambda_k+\eta_\lambda(\delta_k-\varepsilon))$。训练本身是单步梯度:在 $\mathcal{L}=\mathcal{L}_f+\alpha\mathcal{L}_r$ 上做梯度下降,等效于对加权遗忘 NLL 上升、对保留 NLL 下降,一次更新同时完成两件事;全程只用 LoRA,权重无梯度使其每步开销与 WGA 相同。

核心创新是「每条事实一个指数」的梯度区制理论(Proposition 1)。由于权重 $w_{i,t}$ 带停梯度,反向传播只经过 $\ell_{i,t}$,每个 token 的有效梯度幅度 $\propto p_{i,t}^{\beta_i-1}$。于是 $\beta=1$ 是分界:$\beta>1$ 时权重随 $p\to 0$ 衰减,进入「自限制」区制——token 被擦掉后梯度自动归零,适合本来就浅的罕见事实,防止过擦;$\beta<1$ 时权重随 $p\to 0$ 增长,进入「压力维持」区制——越擦越用力,适合记忆深、抗擦的流行事实($\beta\to 0$ 退化为 vanilla GA 的逆置信度行为);$\beta=1$ 每个 token 贡献均等,恰好恢复 WGA。指数由两个锚点闭式解出:令 DUET 流行度分布两端的锚 $s_r\approx 100$ 映到 $\beta=1.5$(自限制)、$s_p\approx 3000$ 映到 $\beta=0.1$(压力维持),解得 $b=\ln 15/\ln 30\approx 0.796$、$a=1.5\cdot s_r^{\,b}\approx 58.7$,再把指数裁剪到 $[0.05, 2.0]$ 防离群分数产生极端梯度。Proposition 2 证明 $b$ 只依赖锚点比值 $s_p/s_r$,所以锚点只需数量级正确。与 WGA 的本质区别:WGA 对所有事实全局 $\beta\equiv 1$ 且权重来自会饱和的模型输出置信度;AdaPop 的 $\beta_i$ 来自训练前固定的外部信号,作用于参数编码深度本身。

方法步骤详情

第一步,离线标注流行度:为遗忘集每条(问题,答案)对取分数 $s_i$——Wikidata sitelink API 约 12 分钟标完 2000 条;无知识图谱覆盖时用 LLM-as-Judge 按 0–10000 打分(gpt-oss-20b 约 9 小时/2000 条)。第二步,闭式推导超参:由锚点约束 $\beta(s_r)=1.5$、$\beta(s_p)=0.1$ 解出 $a=58.7$、$b=0.796$,对每条事实计算并裁剪 $\beta_i=\mathrm{clip}(a\cdot s_i^{-b},\ 0.05,\ 2.0)$。第三步,训练循环(Algorithm 1):每个 batch 混合遗忘与保留样本,仅对答案 token 计算前向概率 $p_{i,t}=\exp(-\ell_{i,t})$,构造停梯度权重 $w_{i,t}=\mathrm{sg}[p_{i,t}^{\beta_i}]$,得到加权遗忘损失 $\mathcal{L}_f=-\frac{1}{|\Omega_F|}\sum_{(i,t)\in\Omega_F} w_{i,t}\ell_{i,t}$ 与保留损失 $\mathcal{L}_r=\frac{1}{|\Omega_R|}\sum \ell_{j,t}$;在 $\mathcal{L}=\mathcal{L}_f+\alpha\mathcal{L}_r$ 上做一步更新(lr=1e-4,LoRA r=32/α=64,5 epochs)。第四步,每 epoch 结束在保留集上评估 $R_k$,算相对漂移 $\delta_k=\max(0,(R_k-R_{\mathrm{ref}})/\max(R_{\mathrm{ref}},\xi))$($R_{\mathrm{ref}}$ 取第 1 个 epoch 的值,以吸收 LoRA 微调的初期漂移),按 $\lambda\leftarrow\Pi_{[0,5]}(\lambda+0.1(\delta_k-0.1))$ 投影更新,$\alpha\leftarrow 0.5+\lambda$。全部超参仅 $\alpha_0=0.5$、$\varepsilon=0.1$、$\eta_\lambda=0.1$、$\lambda_{\max}=5$ 四个,逐 epoch 只多一次保留集评估和两个标量的更新。

技术新颖性

技术新颖性有四层。(1) 信号来源:首个在训练时把外部语料流行度(而非模型内在量)注入遗忘梯度的方法——此前的训练时重加权先例只有长尾图像分类里的 FaLW,且依赖模型自身预测分布;这与「置信度不反映记忆深度」的实证发现(WGA 遗忘 ΔRank 为负)构成方法学上的正面对比。(2) 机制理论:Proposition 1 给出有效权重 $p^{\beta-1}$ 的三区制分析,把 GA($\beta\to 0$)、WGA($\beta=1$)统一成一个连续谱系,并精确解释了三种行为(过擦、均匀、持续施压),使「流行事实用小指数、罕见事实用大指数」从启发式变成有证明的设计。(3) 闭式校准:锚点法让 $(a,b)$ 有解析解且对锚点绝对值不变(Proposition 2),换代理只需重代锚点、无需网格搜索;±20% 扰动下遗忘 ROUGE-L 变化 ≤0.021、保留 ≤0.041,排序对 WGA/NPO 不变。(4) 组件解耦:「梯度质量在 token 间怎么分布」(β)与「遗忘总量相对保留多大」(α)被拆成两个独立旋钮,分别对应两种经验失败模式——这是 GD/NPO/WGA 单目标设计里混在一起无法分开调的东西。工程上零额外开销:$w_{i,t}$ 复用前向概率,AdaPop 训练 29.0 分钟 vs WGA 29.4 分钟(单张 A100),且省掉了基线必需的 α 网格搜索。

Overview of AdaPop. The popularity score reweights per-fact token contributions to the forget loss; the dual-ascent controller adjusts the retain penalty each epoch to maintain retain quality (Algorithm 1).
Figure 1: Overview of AdaPop. The popularity score reweights per-fact token contributions to the forget loss; the dual-ascent controller adjusts the retain penalty each epoch to maintain retain quality (Algorithm 1).
Component ablation on DUET. Top row: rare-fact paraphrase forget ROUGE-L (↓) and retain ROUGE-L (↑) over lr. Bottom row: popular-fact ... (2×2 of α fixed/dynamic × β fixed/dynamic)
Figure 5: Component ablation on DUET. Top row: rare-fact paraphrase forget ROUGE-L (↓) and retain ROUGE-L (↑) over lr. Bottom row: popular-fact ... (2×2 of α fixed/dynamic × β fixed/dynamic)

实验结果

主结果(lr=1e-4,三种子均值):在全部 6 个(模型×基准)组合中,AdaPop 在稳定(未坍塌)方法里取得最低的遗忘余弦相似度(6/6)与几乎最低的遗忘 ROUGE-L(5/6,唯一例外是 Llama/DUET 上 WGA 0.036 略低于 AdaPop 0.043,但该格 AdaPop 的余弦 0.369 vs 0.442 更低、内部表征改变更深)。代表性数字:Llama/DUET 遗忘 ROUGE-L 从 0.939 降到 0.043±0.007、保留 0.959;Qwen/RWKU 从 0.570 降到 0.016、保留从 0.666 升到 0.855;Gemma/RWKU 0.034/0.948。基线方面:GA、GD 在所有设置下生成坍塌成重复 token(MMLU 0.23–0.25);NPO 保留近完美(0.957–0.998)但 DUET 遗忘只到 0.626–0.684,流行事实改写后仍可问出;11 个额外方法(UNDIAL、RMU、PDU、NPO-SAM、SimNPO、SatImp、Adaptive RMU、AltPO、FLAT、TPO、CE-U)中,分布类方法几乎不擦实体事实(UNDIAL/RMU 在 DUET 上 0.734–0.884),FLAT/CE-U 全线坍塌,AdaPop 在每一格保持稳定方法中最低遗忘。鲁棒性(Table 4):DUET 改写查询 AdaPop 0.045/0.074/0.027(Llama/Qwen/Gemma)vs WGA 0.042/0.104/0.050、NPO 0.696/0.605/0.568;RWKU 对抗攻击(9 种提示操纵)AdaPop 0.262/0.144/0.195 vs WGA 0.396/0.211/0.239,三个模型全部最优——即摘要口径的「改写泄漏少约 5×、对抗泄漏少约 1.6×」。分层证据(Table 5):AdaPop 对 WGA 的优势完全来自流行层(0.040/0.055/0.028 vs 0.067/0.194/0.096),罕见层 WGA 更低但那是自限制区制的预期行为(罕见层的风险是过擦而非存活)。内部表征(Table 6):AdaPop 遗忘集 Hid.Cos 0.702(DUET)/0.484(RWKU)均为稳定方法最低,ΔRank +53,760/+4,169;而 WGA 的 DUET/RWKU 遗忘 ΔRank 为负(−3,714/−11,010)——金答案相对排名反升,是「表面压制而非真遗忘」的签名。通用能力(Table 7):NPO/WGA/AdaPop 的 MMLU 与遗忘前差距均 ≤0.05(Llama 0.65→0.65,Gemma 0.47→0.51/0.52)。代理消融(Figure 3):Wikidata 分数与实测语料频率 log 空间 Pearson 0.970,LLM judge 仅 0.677 且保留更差(holdout 0.939 vs 0.966);两者二分类一致率 84%,即使把全部标签故意反转,保留仍守 0.92、遗忘 ≤0.05(Table 11)。组件消融(Figure 5):去掉控制器,稀有层保留从 ≥0.927 跌到 0.769;相同流行层遗忘深度(≈0.02)下完整 AdaPop 保留 0.724 vs 仅控制器 0.683。流行度差距本身也被量化(Figure 8):Llama 上罕见事实 lr≈5e-5 即擦净,流行事实需 ≈1e-4,整整一个数量级。

ROUGE-L Recall and Cosine Similarity for Llama-3.1-8B-Instruct at lr = 10−4. ROUGE-L: mean ± std over three seeds; ... †Unusable: generation failure
Table 1: ROUGE-L Recall and Cosine Similarity for Llama-3.1-8B-Instruct at lr = 10−4. ROUGE-L: mean ± std over three seeds; ... †Unusable: generation failure
ROUGE-L Recall and Cosine Similarity for Qwen2.5-7B-Instruct at lr = 10−4.
Table 2: ROUGE-L Recall and Cosine Similarity for Qwen2.5-7B-Instruct at lr = 10−4.
ROUGE-L Recall and Cosine Similarity for Gemma-7B-it at lr = 10−4.
Table 3: ROUGE-L Recall and Cosine Similarity for Gemma-7B-it at lr = 10−4.
Robustness at lr = 10−4. Top: paraphrase ROUGE-L on the DUET forget split (lower is better). Bottom: RWKU Level-3 adversarial-attack ROUGE-L.
Table 4: Robustness at lr = 10−4. Top: paraphrase ROUGE-L on the DUET forget split (lower is better). Bottom: RWKU Level-3 adversarial-attack ROUGE-L.
DUET paraphrase forget ROUGE-L (↓) split by popularity tier at lr = 10−4. Underline = best among NPO, WGA, AdaPop.
Table 5: DUET paraphrase forget ROUGE-L (↓) split by popularity tier at lr = 10−4. Underline = best among NPO, WGA, AdaPop.
Internal metrics at lr = 10−4, averaged across Llama, Qwen, and Gemma. (ΔLP↓, ΔRank↑, Hid.Cos↓, KL↑ on forget splits)
Table 6: Internal metrics at lr = 10−4, averaged across Llama, Qwen, and Gemma. (ΔLP↓, ΔRank↑, Hid.Cos↓, KL↑ on forget splits)
MMLU accuracy and HellaSwag (HS) normalised accuracy at lr = 10−4, averaged across DUET and RWKU checkpoints.
Table 7: MMLU accuracy and HellaSwag (HS) normalised accuracy at lr = 10−4, averaged across DUET and RWKU checkpoints.
AdaPop coefficient sensitivity. Each row perturbs a and/or b by ±20% from the analytically derived baseline.
Table 8: AdaPop coefficient sensitivity. Each row perturbs a and/or b by ±20% from the analytically derived baseline.
Discordant cases between Wikidata score and LLM-judge scores on DUET. ROUGE-L: Llama-3.1-8B-Instruct recall before unlearning.
Table 9: Discordant cases between Wikidata score and LLM-judge scores on DUET. ROUGE-L: Llama-3.1-8B-Instruct recall before unlearning.
Agreement of each popularity proxy with measured corpus frequency on DUET, counted over Pile-train (383B tokens) with infini-gram.
Table 10: Agreement of each popularity proxy with measured corpus frequency on DUET, counted over Pile-train (383B tokens) with infini-gram.
AdaPop under corrupted popularity scores (DUET, Llama-3.1-8B-Instruct, lr = 10−4). Forget ROUGE-L is reported per popularity tier.
Table 11: AdaPop under corrupted popularity scores (DUET, Llama-3.1-8B-Instruct, lr = 10−4). Forget ROUGE-L is reported per popularity tier.
ROUGE-L Recall for additional baselines, Llama-3.1-8B-Instruct at lr = 10−4.
Table 12: ROUGE-L Recall for additional baselines, Llama-3.1-8B-Instruct at lr = 10−4.
ROUGE-L Recall for additional baselines, Qwen2.5-7B-Instruct at lr = 10−4.
Table 13: ROUGE-L Recall for additional baselines, Qwen2.5-7B-Instruct at lr = 10−4.
ROUGE-L Recall for additional baselines, Gemma-7B-it at lr = 10−4.
Table 14: ROUGE-L Recall for additional baselines, Gemma-7B-it at lr = 10−4.
AdaPop on DUET (Llama) under three popularity signals: Wikidata score, LLM-as-Judge (3-seed mean), and measured corpus frequency (infini-gram over Pile-train).
Figure 3: AdaPop on DUET (Llama) under three popularity signals: Wikidata score, LLM-as-Judge (3-seed mean), and measured corpus frequency (infini-gram over Pile-train).
Internal representation metrics at lr = 10−4, across three models. Each row corresponds to one metric; each column corresponds to one data split.
Figure 4: Internal representation metrics at lr = 10−4, across three models. Each row corresponds to one metric; each column corresponds to one data split.
ROUGE-L (solid) and Cosine Similarity (dashed) on the merged DUET forget (left) and retain (right) splits across learning rates, for Llama (top), Qwen (middle), and Gemma (bottom).
Figure 6: ROUGE-L (solid) and Cosine Similarity (dashed) on the merged DUET forget (left) and retain (right) splits across learning rates, for Llama (top), Qwen (middle), and Gemma (bottom).
ROUGE-L (solid) and Cosine Similarity (dashed) on the RWKU forget (left) and retain (right) splits across learning rates, for Llama (top), Qwen (middle), and Gemma (bottom).
Figure 7: ROUGE-L (solid) and Cosine Similarity (dashed) on the RWKU forget (left) and retain (right) splits across learning rates, for Llama (top), Qwen (middle), and Gemma (bottom).
Forget (left) and retain (right) ROUGE-L Recall per training epoch on DUET, Llama-3.1-8B-Instruct, at lr = 10−4.
Figure 9: Forget (left) and retain (right) ROUGE-L Recall per training epoch on DUET, Llama-3.1-8B-Instruct, at lr = 10−4.
查看结构化数据
任务指标本文基线提升
事实遗忘 · Llama/DUET 遗忘 ROUGE-L Recall ↓ 0.043 ± 0.007(保留 0.959) NPO 0.670 ± 0.095;WGA 0.036 ± 0.002;GA/GD 坍塌不可用 较 NPO 降低约 94%;虽然 WGA 表面值略低,但 AdaPop 遗忘余弦相似度 0.369 vs 0.442、ΔRank +53,760 vs −3,714,表征级擦除更深
事实遗忘 · Qwen/RWKU 遗忘 ROUGE-L Recall ↓ 0.016 ± 0.007(保留 0.855) WGA 0.038 ± 0.016(保留 0.890);NPO 0.271 ± 0.010 较最强基线 WGA 低约 58%,且把保留 ROUGE-L 从遗忘前的 0.666 提升到 0.855
改写查询鲁棒性 · DUET(Qwen/Gemma) 改写遗忘 ROUGE-L ↓ 0.074(Qwen)/ 0.027(Gemma) WGA 0.104 / 0.050;NPO 0.605 / 0.568 较 WGA 低约 29%–46%,较 NPO 低一个数量级;Llama 上与 WGA 在种子噪声内持平(0.045 vs 0.042)
对抗攻击鲁棒性 · RWKU(三模型) 对抗遗忘 ROUGE-L ↓(9 种提示操纵) 0.262 / 0.144 / 0.195(Llama/Qwen/Gemma) WGA 0.396 / 0.211 / 0.239;NPO 0.657 / 0.400 / 0.485 三个模型全部最优,较 WGA 低约 1.3–1.6×,且领先幅度比改写场景更大
通用能力保持 · 三模型平均 MMLU 准确率(与遗忘前的差距) 差距 ≤0.05(Llama 0.65→0.65;Gemma 0.47→0.52) GA 0.23–0.25(坍塌至随机水平);GD 的 HellaSwag 大幅下降(Llama 0.73→0.59) 与 NPO/WGA 同级,HellaSwag 在 Llama/Qwen 上持平或略升(0.73→0.76)
流行事实擦除 · DUET 改写流行层 流行层改写遗忘 ROUGE-L ↓ 0.040 / 0.055 / 0.028(Llama/Qwen/Gemma) WGA 0.067 / 0.194 / 0.096 低约 1.7–3.5×,证明 AdaPop 的优势精确来自流行度加权机制本身

局限与改进

作者承认三条局限:(1) 依赖外部流行度代理——Wikidata sitelink 只对实体中心的事实问答有良好覆盖,程序性、创造性知识没有对应分数,远离该领域的任务上近似质量可能限制收益;(2) 指数系数 $(a,b)$ 从 DUET 的分数分布校准,换到量纲不同的代理必须重新标定或重缩放——语料频率信号跨 4 个数量级却沿用原系数时,多数流行事实被钉在 $\beta_{\min}$,保留受损(Figure 3 右);(3) 全部实验只用 LoRA,全量微调被排除(依据 Borisiuk 等 2026 会不收敛或灾难性遗忘),该设置的超参搜索成本高、留待未来。我自己的补充观察:对抗攻击下遗忘 ROUGE-L 仍有 0.144–0.262,意味着约 15%–26% 的内容可被 9 类提示操纵挖回,在高隐私要求场景未必达标;鲁棒性评测只覆盖 RWKU 自带的 Level-3 攻击集与 DUET 改写,未含 relearning 攻击、量化/微调后恢复等更强威胁;余弦相似度为单种子结果,统计强度弱于 ROUGE-L 的三种子;评测仅限 7–8B 模型与事实问答型遗忘,向更大模型或技能型遗忘外推未验证;锚点取自 DUET 分布使 RWKU 上最流行事实也只到 $\beta\approx 0.32$、中位 $\beta\approx 1.22$,压力维持区制在 RWKU 基本未启用,方法在该基准的优势实际主要来自自限制区制与控制器——这既是稳健性的体现,也说明外部校准与数据集分布的耦合仍存在。

独立分析的弱点

(1) 代理覆盖面窄:程序性知识、代码、创意写作的「擦除难度」无法用 sitelink 度量,而论文结论「关闭流行度差距需要模型外信号」恰恰依赖这一代理。改进方向:训练专门的事实难度预测器,或集成多代理(检索命中数、n-gram 频率、多模型一致性);论文附录 B 已给出可替换条件(连续、跨一个数量级),工程门槛不高。(2) 对抗鲁棒性残差:RWKU 上 0.144–0.262 的可恢复率意味着攻击者用前缀注入等手法仍能捞回内容,而 $β$ 只在训练时起作用、不提供推理时防护。改进:与 RMU 类表示干扰或 NPO-SAM 类锐度感知目标组合,把压力维持区制(更小 $\beta$)专门压在对抗集高恢复的事实上。(3) 锚点值 1.5/0.1 是设计选择,只验证了 ±20% 敏感性与排序稳定性,不同模型/数据集的最优区制边界可能移动。改进:在小验证集上自动搜锚点,或把 $\beta_i$ 改为在线自适应(用擦除速率反馈调指数)。(4) 保留约束只看 NLL 相对漂移:损失不变不等于能力无损,可能出现「保留损失达标但某项能力已坏」的盲区。改进:把 MMLU 探针子集等能力指标纳入约束信号,做多约束对偶。(5) 评测粒度:遗忘集内部事实间的关联擦除(删 A 是否顺带破坏依赖 A 的 B)未研究;多跳事实与长答案下 $\beta$ 只作用于答案 token 的行为也值得单独分析。

未来方向

作者明确提出的两个方向:其一,把「流行度」推广为更一般的「擦除难度」量——为程序性、创造性、代码知识构造难度代理(sitelink 用不上的领域),用同一机制迁移;其二,$\beta_i$ 本质是每条事实的难度调度器,可换成其他标准而非难度,例如危害严重度或逐条保留优先级,做成政策可配置的遗忘系统。基于本文成果可自然延伸的:(1) 与表示工程(RMU)或锐度感知最小化(NPO-SAM)正交组合,专门压缩对抗攻击下 0.144–0.262 的可恢复残差;(2) 全量微调与 70B+ 规模的验证(作者留白);(3) 非凸情形下对偶控制器的稳定性理论(作者只做了经验性设计:epoch 级更新、投影裁剪、初值匹配 WGA);(4) 用开源小模型蒸馏 LLM-as-Judge 打分,消除外部 API 依赖并压噪(现方案 9 小时/2000 条 vs sitelink 12 分钟,且跨 run 噪声更大);(5) relearning 攻击与微调后知识恢复的持久性评估;(6) 沿 $\beta$ 谱系(GA↔WGA↔AdaPop)做连续插值的系统消融,进一步定位最优区制边界与模型规模的关系。

复现评估

复现条件很好。代码已开源(GitHub:Anya-wUw/open-unlearning,基于 OpenUnlearning 统一框架)。数据全部公开:DUET 与 RWKU 均为公开基准,MMLU/HellaSwag 为标准评测集;Wikidata 分数经 sitelink API 免费获取,2000 条约 12 分钟;LLM-as-Judge 备选方案有完整 prompt(附录 D),用 openai/gpt-oss-20b 经 OpenRouter 标注约 9 小时/2000 条。算力门槛低:单张 A100 即可,Llama/DUET 上 AdaPop 训练 29.0 分钟(WGA 29.4、GD 27.1、RMU 23.4、NPO 40.0),LoRA r=32/α=64、5 epochs、lr=1e-4。全部超参在附录 A 给出($\alpha_0=0.5$、$\varepsilon=0.1$、$\eta_\lambda=0.1$、$\lambda_{\max}=5$、$\beta\in[0.05,2.0]$、$a=58.7$、$b=0.796$),$(a,b)$ 的闭式推导(附录 B)、敏感性(附录 C)、五种学习率扫描(附录 O)、逐 epoch 动态(附录 P)、逐模型分解(附录 K/L)一应俱全。ROUGE-L 报告三种子均值±标准差(余弦相似度为单种子)。总体复现难度:低——不需要大算力、流程文档化程度高;唯二容易踩的坑是锚点校准必须与自己数据集的分数范围匹配(附录 B/C),以及 LLM judge 代理的跨 run 噪声(作者也推荐 Wikidata 分数为首选)。