从重加权到重写:释放训练数据归因中高影响样本的干预效应 From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution
用影响函数选样本、改写其回答而非调权重,可显著放大SFT行为干预效果
前置知识
训练数据归因(TDA)
训练数据归因研究如何为训练集中的每个样本打分,量化它对模型某个特定行为、预测或能力的贡献程度。典型做法是把关心的模型量(例如在某类查询上的损失或对数似然)作为目标函数 $f(\theta)$,再反推每个训练样本对其的影响大小,从而回答「是哪些训练数据造就了这个行为」。归因分数随后常被用于数据清洗、筛选、重加权等下游干预。
本文质疑的正是 TDA 的评估闭环:用 TDA 方法(影响函数)选出的样本去做数据干预到底有没有用。理解 TDA 的定位与用途,是读懂全文动机的前提。
影响函数(Influence Functions, IF)
影响函数估计「对单个训练样本的权重做无穷小扰动 $\epsilon$」对模型的影响。对加权目标 $\theta(\epsilon)=\arg\min_\theta[\mathcal{J}(\theta)+\epsilon \mathcal{L}(z_i,\theta)]$ 求导可得影响分 $I_f(z_i)=-\nabla_\theta f(\theta)^\top H_\theta^{-1}\nabla_\theta \mathcal{L}(z_i,\theta)$,其中 $H_\theta$ 是训练目标的 Hessian。正分预测上采样该样本会提高目标量 $f(\theta)$,负分相反。它在数学上就是一种局部重加权分析。
IF 是本文选择干预样本的核心工具,文中所有 helpful/harmful 样本集合都由 IF 排名的两端定义,标题中的「重加权」也直接源于 IF 的定义式。
EK-FAC 曲率近似
大模型的 Hessian 逆无法显式计算。K-FAC 假设每层曲率可分解为激活二阶矩与输出梯度二阶矩的 Kronecker 积 $H_W\approx A\otimes S$,使逆曲率乘积变为 $(A\otimes S)^{-1}=A^{-1}\otimes S^{-1}$。EK-FAC 在此基础上保留 Kronecker 特征向量,用逐样本梯度投影的经验值修正每个方向的特征值 $\lambda_k=\mathbb{E}_z[(U_A\otimes U_S)^\top\mathrm{vec}(\nabla_W L)]^2_k$,在效率与精度间取得平衡。
没有 EK-FAC 这类近似,就不可能在十亿级参数 LLM 上对数万 SFT 样本逐一计算影响分。本文用 Kronfluence 开源包实现并在全部 SFT 数据上估计统计量,这是方法可扩展性的工程基础。
监督微调(SFT)与 response-only 损失
SFT 用「指令-回答」对 $z_i=(x_i,y_i)$ 微调模型。本文采用 response-only 损失 $\mathcal{L}(z_i,\theta)=-\sum_t \log p_\theta(y_{i,t}\mid x_i, y_{i,<t})$,只对回答部分计损。SFT 数据取自 Tülu 3 混合数据集的前 64,000 条(固定打乱种子),训练 1 个 epoch、有效 batch 128、序列长 4096、bf16。
本文的全部干预都发生在 SFT 数据层面,「保持指令不变、只改写回答」的设计正是利用了 SFT 样本的二元结构;理解 response-only 损失也是理解影响分计算对象的前提。
认知性拒答(epistemic abstention)与 AbstentionBench
认知性拒答指模型在问题无法可靠回答时应主动放弃作答,典型场景包括 answer unknown(不存在公认答案)与 false premise(问题建立在错误前提上)。AbstentionBench 覆盖 20 个数据集、6 种拒答场景;本文用其快速模式(18 个数据集 × 100 题 = 1.8k 题),由 LLM judge(Qwen3.6-35B-A3B)判定是否拒答,主指标为召回率 $\mathrm{Recall}=\frac{\#\{\text{正确拒答的不可答问题}\}}{\#\{\text{不可答问题}\}}$。
拒答是本文的目标行为试验场:影响分的目标函数、改写模板、评测指标全部围绕它构建。它有清晰的「行为对齐/对立」改写目标,是检验干预框架的理想载体。
研究动机
训练数据归因(TDA)的一个核心实用目标是支持可操作的数据干预:常见流程是用影响函数(IF)找出对目标行为影响最大的训练样本,再通过上采样或删除这些样本来引导模型行为。但近年多项研究发现,在现代 LLM 上这条路线效果令人失望——IF 选出的样本在权重型干预下往往只与随机选择相当,效果微弱、不稳定甚至反向(Li et al., 2025; Lee et al., 2026a)。问题在于,这一负面结果混淆了两个不同的命题:其一,IF 是否找对了应该干预的样本;其二,权重型干预本身能否有效改变这些样本教给模型的内容。IF 的定义式 $\theta(\epsilon)=\arg\min_\theta[\mathcal{J}(\theta)+\epsilon\mathcal{L}(z_i,\theta)]$ 本质上只是无穷小重加权下的局部一阶分析,而实践中 $\alpha=2$ 的上采样或整条删除是远离线性区的有限干预;同时,样本对行为的贡献也可能主要蕴含在「它教了什么内容」而非「它占多大权重」之中。两个因素不拆开,既无法判断 IF 选样是否有效,也无法为 TDA 建立合理的干预评估标准,数据干预只能停留在盲目试错。
本文的目标是本文要回答的问题是:IF 选出的样本究竟是本身缺乏干预价值,还是被权重型干预埋没了行为杠杆?为此作者提出影响引导的回答改写(influence-guided response rewriting):IF 只负责「在哪里干预」(选出高影响样本),改写负责「提供什么行为信号」(保持指令 $x_i$ 不变,把回答 $y_i$ 替换为行为对齐或行为对立的监督),从而把「选样本」与「怎么干预」解耦。实验在四个开源 LLM(OLMo2-1B、Qwen3.5-2B、Gemma3-4B、OLMo2-7B)上以认知性拒答为主要试验场:对同一批 IF 选出样本系统比较四种干预(上权重 $\alpha=2$、删除 $\alpha=0$、对齐改写、对立改写),并与匹配随机样本对照,在固定数据顺序与相同 SFT 配方下重训,追踪全程训练轨迹上的拒答召回率变化,以检验影响力样本是否具有超越重加权的干预潜力,并推动建立 intervention-aware 的 TDA 评估范式。
与已有工作不同的是,本文的独特切入是把评估视角从「影响分能否预测重加权效果」转变为「影响分能否识别出有行为杠杆的训练位置」。此前的 TDA 应用几乎都通过重加权或数据过滤来使用和评估影响分,负面结论也因此被笼统归咎于选样质量;少数直接修改影响力样本的工作,要么局限于分类任务的影响引导重标注(Kong et al., 2022; Banerjee et al., 2024),要么是视觉领域的扰动式投毒 Infusion——其效应在语言模型较长训练中会消退。本文首次在真实 LLM SFT 设定中,对同一批 IF 选出样本并行比较删除、上权重、语义级回答改写三类干预,在固定数据顺序、同一基座与配方下重训并追踪完整轨迹;并进一步用「固定参照影响分析」和贝叶斯影响函数配对比较,从梯度与影响分两个层面解释改写为何有效。这一 selection/intervention 解耦设计,让「IF 选样有价值、只是重加权实现不了」这一假设第一次变得可检验。
核心方法
直觉上,一条训练样本可以从两个维度影响模型:它以多大权重参与训练(教多少),以及它的内容教了什么(教什么)。权重型干预只动前者,改写直接动后者。技术路线分五步:(1)行为归因——对 SFT 数据集 $D_{train}=\{z_i=(x_i,y_i)\}_{i=1}^N$,以 300 个 held-out 目标查询的平均回答对数似然 $f(\theta)=\frac{1}{M}\sum_{j=1}^M \log p_\theta(y_{q_j}\mid x_{q_j})$ 作为行为代理,用 EK-FAC 影响函数 $I_f(z_i)=-\nabla_\theta f(\theta)^\top H_\theta^{-1}\nabla_\theta \mathcal{L}(z_i,\theta)$ 给每个样本打分;(2)选样——取排名 Top-$K$ 与 Bottom-$K$($K=1600$,占 SFT 数据 2.5%)构成 supposedly helpful 与 supposedly harmful 两组,另采多个匹配随机组作对照;(3)干预——对同一批选样分别施加四种操作:上权重($\alpha=2$)、删除($\alpha=0$)、行为对齐改写(回答替换为拒答模板)、行为对立改写(替换为顺从模板),指令一律不变;(4)受控重训——从同一基座模型、固定数据顺序、相同超参重训 SFT,取约 10 个 checkpoint;(5)轨迹评估——在每个训练步 $t$ 计算相对未修改基线的召回率变化 $\Delta R_t = R_t^{\text{intervention}} - R_t^{\text{baseline}}$,同时考察方向有效性(是否朝预期方向移动)与选样优势(是否显著强于随机选样上的同款干预)。
核心创新在于把影响函数从「重加权效应的预测器」重新定位为「高杠杆训练位置的探测器」。改写会完全改变样本贡献的梯度 $\nabla_\theta\mathcal{L}(x_i,\tilde{y}_i^d)$($d\in\{\text{align},\text{opp}\}$),因此改写后的干预不再是影响函数局部预测(式 $I_f(z_i)=-\nabla_\theta f(\theta)^\top H_\theta^{-1}\nabla_\theta\mathcal{L}(z_i,\theta)$)的有限实现——IF 在这里只用于决定改哪些样本,而非预测效果。这个概念区分正是实验设计的关键:如果在 IF 选出的样本上改写的效果显著大于在匹配随机样本上施加完全相同的改写,就说明 IF 排名识别出了超越「重加权原始监督」的干预杠杆;反之若随机样本改写同样有效,则说明此前 IF 干预失败完全是干预方式的锅。与已有方法的本质区别在于:传统用法把 IF 的正负号当作干预方向说明书(要求干预落在一阶有效域内),本文把 IF 排名当作干预靶点地图(不要求);同时改写以内容替换直接改变监督信号方向,绕开了有限重加权偏离线性区、信号被其余 97.5% 数据淹没等问题。
方法步骤详情
第一步,构建目标查询集:从 CoCoNot、SelfAware、KUQ 抽取 300 道不可答问题(主要覆盖 answer unknown 与 false premise 两场景),用 DeepSeek-Chat 为每题生成单句拒答式目标回答(8 种风格指令随机采样,temperature 1.5,presence/frequency penalty 1.0,并与训练数据去重),格式为两轮对话。第二步,影响分计算:在 Tülu 3 SFT 混合集固定取前 64,000 条,用 Kronfluence 实现 EK-FAC,曲率统计在全部 SFT 数据上估计、对被追踪 MLP 层拟合块对角近似,逐样本计算对 $f(\theta)$ 的影响分。第三步,选样:Top-1600 为 helpful、Bottom-1600 为 harmful,另抽 4 个随机组(每条件 4 个种子报告 95% CI)。第四步,四种干预:上权重 $\alpha=2$、删除、对齐改写(从 80 条通用拒答模板池中选取,刻意多样化以避免依赖单一拒答短语)、对立改写(20 条顺从模板);只替换回答、指令固定。第五步,受控重训:从各自基座出发,相同数据顺序与配方训 1 epoch(有效 batch 128,学习率 OLMo2-1B $3\times10^{-5}$、Qwen3.5-2B $4.5\times10^{-5}$、Gemma3-4B $9\times10^{-6}$、OLMo2-7B $3\times10^{-5}$),全部实验在 8×H200 上完成。第六步,评估:AbstentionBench 快速模式 1.8k 题、Qwen3.6-35B-A3B 判定拒答,报告拒答召回率全程轨迹 $\Delta R_t$(移动平均去噪),辅以精确率/F1/准确率、分场景召回、通用能力(GSM8K、HellaSwag、ARC-C/E)与 9 个安全基准评测。
技术新颖性
技术新颖性体现在四个层面。概念层面:明确指出 IF 的定义式本质是局部重加权分析,因此「IF 预测失败」与「IF 选样失败」是两个命题,并用改写这种脱离 IF 一阶有效域的干预来分离二者。任务层面:区别于分类重标注与视觉投毒 Infusion,本文在真实 LLM SFT 中做语义级回答改写,系统比较三类干预并追踪训练轨迹,避免了 Infusion 式「效应只在短训练可见」的陷阱。诊断方法层面:为解释改写为何有效,设计了固定参照影响分析——保持 checkpoint $\theta^{orig}$、目标梯度 $g_Q^{orig}$ 与曲率 $\hat{H}^{orig}$ 不变,仅把样本梯度从 $\nabla_\theta\ell_i^{orig}$ 换成 $\nabla_\theta\ell_i^{align}$,得到配对差值 $\Delta s_i = (g_Q^{orig})^\top(\hat{H}^{orig})^{-1}(\nabla_\theta\ell_i^{align}-\nabla_\theta\ell_i^{orig})$;再引入贝叶斯影响函数(局部化后验下的损失相关 $\rho_{i,t}^r=\mathrm{Corr}_{p_{\gamma,t}}[\ell_i^r(\theta),\mathcal{L}_Q(\theta)]$)做每个 checkpoint 内的对称配对比较,规避了「影响分跨 checkpoint 不可比」的通病。评估理念层面:倡导 intervention-aware 的 TDA 评估,即按「选样杠杆 × 干预实现方式」两个因子评价归因方法,而非只在重加权一种干预下打分。
实验结果
主实验(Figure 2、Table 3):重加权不可靠,改写强、持久且双向。四个模型上,上权重与删除的召回轨迹不稳定、常不优于基线甚至反向;把系数 $\alpha$ 从 0 扫到 2 也扫不出剂量-响应关系(Figure 3)。改写则方向明确:对齐改写提升、对立改写降低拒答,且远强于随机改写。具体数字:OLMo2-1B 基线召回 0.3541,harmful-对齐改写达 0.4902(+13.6pt);Qwen3.5-2B 0.4754→0.6321(+15.7pt);Gemma3-4B 0.4197→helpful-对齐 0.6279(+20.8pt);OLMo2-7B 0.4689→0.6328(+16.4pt);随机改写仅 +3pt 左右(OLMo2-7B 为 0.5020)。F1 在四个模型上均高于随机改写,精确率略降(过度拒答)但准确率基本不变。预算消融(Figure 11):改写效果随 $k$(800/1600/3200,即 1.25%/2.5%/5%)单调增强,重加权无单调关系甚至反向。选样器对比(Figure 8):带符号 IF 与 |IF| 的改写效果在训练后期超过 TRAK、梯度内积/相似度、梯度范数、probing、loss、random 等全部替代选样器。机理分析(Figure 4/5/6):影响样本的不可答性投影分显著高于整体(均值:全数据 0.534、随机 0.985、helpful 1.131、harmful 2.301)但非最极端;仅用投影选样在对立改写下与 IF 相当、对齐改写下几乎无额外增益,说明 IF 找的是「有改写余量」的位置。固定参照分析显示改写让 originally harmful 样本影响分由 $-25.7k$ 反转为 $+48.2k$($\Delta$+73.9k),helpful 由 $13.9k$ 升至 $59.3k$;BIF 配对比较确认 aligned 回答全程得分更高(helpful $\Delta$=+0.179、harmful $\Delta$=+0.017)。目标特异性(Figure 7/9/10):增益集中于归因目标场景 answer unknown 与 false premise,非目标场景(subjective、underspecified)增益小,而随机改写在非目标场景泛化更广——改写不是无差别增加拒答。通用能力(Table 4):GSM8K 38.74→35.46~37.07 但随机改写同等下降,HellaSwag 稳定在 62.7~62.9,ARC 波动小,无系统性退化。安全泛化(Table 2,OLMo2-7B):对齐改写把 WJB-Harmful 0.792→0.880、DAN 0.693→0.750、TrustLLM 0.763→0.803;对立改写使 WildGuard 最低跌至 0.514;重加权依旧无系统效果(如上权重 harmful 组 0.784 反低于基线 0.792);代价是 XSTest 良性题从 0.516 跌至 0.252。跨模型(Figure 12/13):OLMo2-1B 与 OLMo2-7B 的 Top/Bottom 集分别重叠 41.5%/49.5%;Gemma3-4B 的 Bottom 集与其他模型 Top 集有 12.5%~15.2% 的异常跨端重叠;把 OLMo2-1B 排名迁移到其他三个模型,效果虽有变化但仍显著优于随机选样。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 认知性拒答·answer unknown(OLMo2-7B) | abstention recall | Harmful-Aligned 改写 0.6328 | SFT 基线 0.4689;Random 改写 0.5020 | +0.164(相对基线),比随机改写高 +0.131 |
| 认知性拒答(Qwen3.5-2B) | abstention recall | Harmful-Aligned 改写 0.6321 | SFT 基线 0.4754;Random 改写 0.4758 | +0.157(相对基线) |
| 认知性拒答(Gemma3-4B) | abstention recall | Helpful-Aligned 改写 0.6279 | SFT 基线 0.4197;Random 改写 0.4746 | +0.208(相对基线) |
| 认知性拒答(OLMo2-1B) | abstention recall | Harmful-Aligned 改写 0.4902 | SFT 基线 0.3541;Random 改写 0.3852 | +0.136(相对基线) |
| 安全拒答·WJB-Harmful(OLMo2-7B) | refusal(越高越安全) | Helpful-Aligned 改写 0.880 | Raw 基线 0.792 | +0.088 |
| 安全拒答·WildGuard(OLMo2-7B) | refusal | Opposed 改写(Helpful)最低跌至 0.514;Aligned 最高 0.952 | Raw 基线 0.937 | 双向大幅变化(−0.423 至 +0.015),改写方向可控而重加权无效 |
| 过度拒答·XSTest(OLMo2-7B) | 良性提示正确率(越高越好) | Aligned 改写 0.252 | Raw 基线 0.516 | −0.264(安全增益的代价,暴露过度拒答权衡) |
局限与改进
作者承认的局限:(1)框架最适用于存在明确「行为对齐/对立」改写目标的行为(拒答、安全拒绝),推广到无固定模板目标的行为(推理、风格、知识)仍是开放问题;(2)安全场景的改进伴随明显的过度拒答代价——XSTest 从 0.516 跌至 0.252,作者归因于安全归因目标集过于宽泛聚合;(3)改写动力学存在模型依赖差异(如 Gemma3-4B 上 harmful 改写并非最终位移最大),跨模型排名重叠远未饱和,目前只有相关性证据。我自己的观察:(4)拒答召回提升伴随精确率普遍下降(如 OLMo2-1B 0.6627→0.6167),文中缺少校准机制控制假阳性拒答;(5)改写模板本质是 80/100/20 条固定句式,行为信号较人工化,与更自然的「LLM 重写回答」相比可能高估或扭曲真实干预潜力;(6)归因目标需为每个行为手工构造 300 条带目标答案的查询,扩展成本不低;(7)EK-FAC 影响计算加每条件全量重训开销大(8×H200),且每条件只训 1 epoch、用 64k 样本子集,更长训练下改写效应的持久性未验证(作者引用的 Infusion 恰在长训练中效应消退);(8)abstention 与 safety 都是「拒答类」行为,对齐改写模板本身就是拒答句,监督内容与目标行为几乎同构,这可能是改写优势如此显著的部分原因,换到非同构行为上优势可能缩小。
独立分析的弱点
弱点一:行为覆盖面窄。改写依赖「能写出对齐/对立回答」这一前提,对数学推理正确性、事实性、写作风格等无法用模板表达的行为不适用。改进方向:用 LLM 对原回答做行为导向的自动重写(保留指令语义、只调整目标属性),或改用 DPO 风格的对比目标(chosen/rejected 对)替代硬模板。弱点二:缺乏过度拒答校准。安全实验中 XSTest 从 0.516 跌至 0.252,拒答实验中精确率也普遍下降。改进方向:在归因目标 $f(\theta)$ 中同时纳入「应当回答」的对照查询,构造双向目标(如对齐-对立损失差),并在选样阶段排除对良性查询影响过大的样本。弱点三:影响分与改写效应之间只有经验联系。改写后的样本不再是 IF 预测的实现,为什么 IF 排名两端恰好是高改写杠杆位置,解释仍停留在「与不可答性表征相关且有改写余量」。改进方向:发展面向「替换监督内容」这一操作的 counterfactual influence 估计,直接预测改写后的行为变化。弱点四:归因成本高、迁移不完美。EK-FAC 需在全部 SFT 数据上拟合曲率,且 Gemma3-4B 的排名结构与其他模型差异明显。改进方向:系统研究小模型→大模型的排名迁移条件(文中已给出初步证据),或用低秩/采样近似降低曲率拟合成本。弱点五:只验证了拒答同构类行为,结论外推需谨慎,应在异构行为上重复同一对照实验。
未来方向
作者提出的方向:(1)把框架推广到没有明确对齐/对立改写目标的行为,建立更普适的「监督内容干预」理论与工具;(2)为安全拒绝设计更细粒度的归因目标与改写策略,缓解过度拒答权衡;(3)推动 intervention-aware 的 TDA 评估成为社区标准,按「选样杠杆 × 干预方式」两因子评测归因方法;(4)研究影响排名何时、为何能跨模型迁移,利用小模型归因为大模型选样以降低归因成本。基于其成果可延伸的方向:(5)把 IF 选点与 LLM 自动重写结合,形成「归因→改写→再归因」的迭代数据优化循环,可能成为一种新的数据引擎范式;(6)与 DPO/RLHF 数据构建结合,用影响分挑选并改写偏好对;(7)用机制可解释性手段(如作者团队另一工作 mechanistic data attribution)把「不可答性表征方向」的解释升级为因果解释,说明高影响样本为何具有改写杠杆;(8)在预训练数据而非 SFT 数据上检验类似结论,考察改写式干预在更大规模、更长训练下是否仍然有效;(9)探索改写与重加权的联合干预,例如对齐改写后再上权重,检验两种杠杆是否可叠加。
复现评估
复现条件总体友好但算力门槛较高。论文在附录 A–I 提供了非常完整的细节:EK-FAC 推导与实现(Kronfluence 开源包、默认设置、全 SFT 集统计)、固定参照分析与贝叶斯影响函数的完整公式与超参(RMSProp 预条件 SGLD,步长 $1\times10^{-5}$、定位强度 $\gamma=1000$、有效逆温度 $n\beta=1000$)、四模型训练超参表、三个模板池全文(拒答 80 条/安全 100 条/顺从 20 条)、查询集构造流程与示例,并声明模板与代码将随论文发布。数据与模型全部公开:Tülu 3 SFT mixture、OLMo2/Qwen3.5/Gemma3 开源权重、AbstentionBench、Ai2 Safety 评测工具、公开的 LLM judge(Qwen3.6-35B-A3B)。主要资源需求是算力:完整复现需在 8×H200 上对 4 个模型 × 多种干预 × 多选样条件重训,并对全部 64k SFT 样本计算影响分;单模型(1B)单改写条件的核心验证规模则小得多。难度评估:影响函数工程(EK-FAC 拟合、逐样本梯度)是主要门槛但有 Kronfluence 现成支持;其余流程(选样、模板替换、重训、judge 评测)皆为标准工程,中高级研究者数周内可复现核心结论,建议从 OLMo2-1B 加单一改写条件入手。
论文图表
在非目标场景 underspecified context 上的轨迹:影响选样改写并不稳定优于随机改写,甚至常常更弱。
反事实对照:若改写只是「教模型多拒答」,应在该场景同样见效;无迁移恰说明干预是靶向的。