面向分布偏移下忠实生成的 Token 级离策略标注方法 TOPL Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
把后训练重构为token级正确性二元分类,提升分布外事实忠实度
前置知识
LoRA(低秩适配)
LoRA 冻结预训练权重 $W$,只在选定层旁路注入低秩更新 $W + \alpha BA$,其中 $A\in\mathbb{R}^{r\times d}$、$B\in\mathbb{R}^{d\times r}$、秩 $r$ 很小(本文 $r=4, \alpha=8$)。其优势是可训练参数极少、训练稳定、且训练后可与骨干合并、推理零额外开销。本文进一步把 LoRA 拆解为 A 矩阵(条件投影/概念方向)和 B 矩阵(转向方向),并从条件转向视角解释其工作机制。
TOPL 全程用 LoRA 训练并合并,且论文核心机制分析完全建立在 LoRA=A(分类)+B(转向)的分解之上,不懂 LoRA 无法理解其为何有效。
在策略 vs 离策略后训练
在策略方法(on-policy,如 GRPO)需在线采样和重复 rollout 来获取当前策略下的数据,泛化好但训练复杂、成本高。离策略方法(off-policy,如 DPO)复用已有的偏好/标注数据直接训练策略模型,更轻量简单,但在分布偏移下泛化能力有限。TOPL 属于离策略方法,只用预生成的扰动数据训练,无需在线采样。
TOPL 的定位是在保留离策略简单性的同时提升分布外泛化,理解这一权衡是把握其动机的前提。
条件转向(Conditional Steering)
条件转向通过沿一个概念方向 $c$ 修改隐藏表示来控制模型行为:$h' \leftarrow h + \alpha\cdot g(\text{sim}(h, \text{proj}_c h))\cdot v$,其中 $g$ 为门函数,$v$ 为转向方向,转向强度由 $h$ 与 $c$ 的相似度决定(因此是输入相关的、条件的)。与全局固定转向不同,它可根据当前表示动态调整。论文证明 LoRA 可写成 $h' = Wh + \alpha\sum_i v_i(c_i^T h)$,每一秩项都恰好是条件转向形式。
TOPL 不直接优化生成却能改善生成,其全部解释都依赖把 LoRA 等价于条件转向这一视角,这是理解 A/B 两个矩阵各自作用的关键。
token 级与序列级监督
序列级监督(如 DPO)给整条响应一个奖励/偏好标签,粒度粗,难以定位错误位置。token 级监督给每个 token 单独打标签(本文为二元:忠实/被扰动),粒度细,可精确定位幻觉 span。本文实验表明同样 token 数下,单类标签会明显退化,而正负监督同时存在(对比监督)是关键。
TOPL 的核心创新就是把后训练变成 token 级二元分类,理解序列级与 token 级监督的差异是判断其贡献的基础。
FAVA 与幻觉扰动
FAVA 数据集提供模型生成的摘要及细粒度编辑(即模拟典型幻觉的扰动,如把 'November' 改成 'October')。TOPL 用这些扰动构造 token 级标签:被扰动 span 标 0(坏 token),其余标 1(好 token)。评估端用 AggreFact 的 11 个数据集做分布外测试,并用 Bespoke-MiniCheck-7B 自动判定事实一致性。
TOPL 的训练数据和评估协议都围绕 FAVA/AggreFact 构建,不懂这套数据与标注方式无法理解其实验设置。
研究动机
LLM 在生成任务中仍普遍存在幻觉与事实性问题。当前缓解手段分两类:在策略方法(如 GRPO)通过在线采样和重复 rollout 获得泛化提升,但训练复杂、成本高昂;离策略方法(如 DPO)复用已有偏好数据更轻量简单,但在分布偏移(distribution shift)下泛化能力有限(Xu et al., 2024; Ma et al., 2025)。在文档摘要这类忠实生成任务中,训练分布与真实测试分布存在偏移,事实一致性仍是难题。已有的 token 级方法如 TLDR 将奖励模型当作独立组件,缺乏直接优化生成的统一公式;而序列级监督(DPO、SOPL)粒度过粗,难以精确定位错误 token。具体场景是用 FAVA 扰动数据训练后,在 11 个 AggreFact 数据集上评估 OOD 事实性,传统方法表现不佳。
本文的目标是本文目标是提出 TOPL(Token-Level Off-Policy Labeling),一种离策略训练范式,将后训练重新定义为 token 级正确性预测任务。核心直觉是:通过训练模型区分响应中的好 token(忠实)和坏 token(幻觉),自然引导模型生成好 token,同时避免直接用离策略 token 做生成训练的陷阱。具体目标包括:(1) 在文档摘要任务上实现强 OOD 泛化,在 11 个数据集上取得平均最优;(2) 验证 token 级监督的细粒度优势相对序列级方法;(3) 迁移到机器翻译以验证跨任务泛化;(4) 通过对 LoRA 的机制分析解释为何有效。
与已有工作不同的是,本文独特切入角度有三点。第一,不直接优化下一 token 预测(如 SFT 的 one-hot 标签),而用二元分类预测每个 token 是否正确或被扰动,提供更少噪声的监督信号。第二,与 TLDR 等把奖励模型当独立组件不同,TOPL 把 token 级奖励信号直接作为后训练目标,形成单模型统一公式,既 token 级细粒度又可解释。第三,通过条件转向(conditional steering)视角分析 LoRA:LoRA-A 作为投影到概念方向的分类器,LoRA-B 作为转向向量,为二元分类为何能改善生成提供可解释解释——这是以往 token 级方法未触及的机制层面分析。
核心方法
TOPL 整体思路是:与其训练模型直接生成正确 token,不如训练它判断每个 token 是否正确。直觉上,学会区分好坏 token 后,模型内部表示会自然向忠实区域偏移。技术路线上,在 LLM(Qwen3-8B / Llama-3.1-8B / Gemma-3-4B)的选定中间层 $m$ 截断模型得 $f_{0:m}$,附加一个轻量奖励头 $h$。先计算隐藏状态 $H = \text{FinalRMSNorm}(f_{0:m}(D, S)) \in \mathbb{R}^{|S|\times D_{\text{hidden}}}$,对每个 token 用 $\sigma(h(H_k))$ 预测正确性概率,用二元交叉熵训练。只用 LoRA($r=4, \alpha=8$)更新选定层。训练后丢弃奖励头,把 LoRA 合并回骨干模型,再用原始解码头 $\ell$ 做标准前向生成。训练数据来自 FAVA,token 级标签 $z_k\in\{0,1\}$ 标识扰动。关键发现是中间层 LoRA 效果最好,最后层反而损害性能。
核心创新是把后训练重新表述为 token 级正确性二元分类。本质区别在监督目标:(1) SFT 的下一 token 预测用 one-hot 标签,只鼓励单个参考 token 而惩罚所有其他 token,监督噪声大;TOPL 放松为二元好/坏分类,噪声更小。(2) DPO/SOPL 用序列级奖励,粒度粗;TOPL 提供 token 级细粒度。(3) TLDR 虽 token 级但奖励模型独立,TOPL 是单模型统一公式。(4) TOPL 不直接优化生成目标 $\mathcal{L}=\text{BCE}$,而是通过分类间接重塑中间表示空间。机制分析显示它鼓励忠实与幻觉行为间更可分离的内部表示。另一个创新是层选择:中间层 LoRA 效果最好,最后层反而损害,揭示最后层与词表解码的耦合。
方法步骤详情
完整步骤:(1) 数据构造。给定文档 $D$ 与真实摘要 $S$,生成扰动版 $S'$(FAVA 的 token 插入/删除/替换模拟幻觉),为每个 token 分配标签 $z_k\in\{0,1\}$(1=忠实,0=扰动)。(2) 模型构建。截断 LLM 到中间层 $m$ 得 $f_{0:m}$,在选定层插入 LoRA(Qwen 为 0-29 层,Llama/Gemma 为 0-27 层,$r=4,\alpha=8$)。(3) 前向计算 $H=\text{FinalRMSNorm}(f_{0:m}(D,S'))$,输出 $P(z_k=1\mid D,t_{\le k})=\sigma(h(H_k))$。(4) 训练。所有响应 token 上用二元交叉熵损失,只更新 LoRA。(5) 层选择。滑动窗口搜索发现中间层最优。(6) 合并生成。丢弃奖励头 $h$ 与归一化层,把 LoRA 合并进 $f_{0:m}$ 得 $f_{\text{merge}}$,用原始解码头 $\ell$ 标准前向生成。(7) 评估。Bespoke-MiniCheck-7B 评分,11 个数据集取平均。
技术新颖性
技术新颖性体现在五点。(1) 训练范式创新——首次把后训练表述为 token 级二元正确性分类(而非下一 token 预测),用 FinalRMSNorm + 奖励头 $h$ 替换解码头 $\ell$。(2) 统一公式——区别于 TLDR 的独立奖励模型,TOPL 单模型同时学习判别并通过 LoRA 合并改善生成。(3) 条件转向分析——首次从 LoRA = A 矩阵(条件投影)+ B 矩阵(转向方向)的视角解释:LoRA-A 在低秩子空间分离好坏 token(AUROC $0.7541$ 远高于 SFT 的 $0.6272$),LoRA-B 作为转向向量推动隐藏状态向忠实行为偏移。(4) 层选择发现——中间层最优、最后层反而损害,揭示最后层与词表解码耦合紧密。(5) 实验证据——LoRA-A 分离度与 OOD 性能正相关,可作为表示级泛化指标。
实验结果
发现:(1) 主结果(Figure 2):11 个 AggreFact 数据集 OOD 评估中,TOPL 在 Qwen3-8B 和 Gemma-3-4B 上最高、Llama-3.1-8B 上与最强基线竞争,跨骨干平均最优(Bespoke-MiniCheck-7B,$[0,1]$ 区间)。(2) 层选择(Figure 3):中间层 LoRA 最佳,结合早期层提升;最后层更差,因其与词表解码耦合,分类目标会扰乱生成行为。(3) 标签敏感性(Figure 4):Balanced/Bad-skewed/Good-skewed 性能相近说明比例非主导;Dense Balanced 显著优于 Good-only 说明对比监督是关键;随机标签在 Llama/Gemma 上严重退化,Qwen3-8B 仍优于基线。(4) 机器翻译(Figure 5):FLORES-Plus 上 OOD 用 XCOMET 评估,TOPL 最强。(5) 机制(Table 1):TOPL 的 LoRA-A AUROC $0.7541$、OOD $0.8706$,远优于 SFT 的 $0.6272$/$0.8530$,正相关。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文档摘要 OOD 事实性(11 个 AggreFact 数据集平均) | Bespoke-MiniCheck-7B 句级评分(越高越好,[0,1]) | TOPL 跨 Qwen3-8B/Gemma-3-4B 取得最高,平均最优 | SFT / DPO / SOPL / TDPO / TLDR / Unlikelihood | 跨骨干模型平均最优,Qwen/Gemma 单项最佳,Llama 与最强基线竞争 |
| 机器翻译 OOD 质量评估 | XCOMET 分数(越高越好,en-de/en-zh/ro-en/et-en 四语言对) | TOPL 在 FLORES-Plus 上 OOD 最强 | SFT / DPO / SOPL / TDPO / TLDR / Unlikelihood | OOD 基准上超越全部对比方法 |
| LoRA-A token 分离度(Qwen3-8B) | AUROC(越高越好) | TOPL 0.7541±0.1573 | SFT 0.6272±0.0666;DPO 0.6026;SOPL 0.6064 | AUROC 提升约 0.13,分离度显著更高 |
| OOD 事实性(Qwen3-8B) | Bespoke-MiniCheck-7B 评分 | TOPL 0.8706 | SFT 0.8530;DPO 0.8468;SOPL 0.8434 | 提升约 1.7-2.7 个百分点 |
局限与改进
作者承认的局限:(1) 数据质量——自动生成的 token 级扰动可能含噪声,未来可用更干净的扰动提升性能。(2) 虽观察到 LoRA-A 分离度与 OOD 性能相关,但不声称严格因果关系,该因果仍是开放问题。(3) 主要验证文档摘要与机器翻译两类忠实生成任务。我的观察:(1) 评估依赖 Bespoke-MiniCheck-7B 与 XCOMET 两个自动 LLM 打分器,其自身偏差可能影响结论,论文缺乏人工评估交叉验证。(2) 只测了 8B/4B 规模模型,未验证更大或更小模型是否同样受益,规模效应未知。(3) 训练扰动来自 FAVA 合成数据,与真实场景幻觉分布可能不完全匹配。(4) 层选择依赖经验性滑动窗口搜索,不同模型需重新搜索,成本高且缺乏理论指导。(5) 仅覆盖忠实生成,未扩展到推理、多轮对话等更广任务(作者列为未来工作)。
独立分析的弱点
弱点一:评估高度依赖自动 LLM 打分器(Bespoke-MiniCheck-7B、XCOMET),可能引入系统性偏差,改进方向是补充人工评估或多个独立打分器交叉验证。弱点二:训练扰动来自 FAVA 合成数据,与真实幻觉分布存在 gap,改进方向是用真实错误标注数据或更逼真的扰动生成(如对抗式扰动)。弱点三:机制分析主要在摘要任务、Qwen3-8B 上展开,跨模型与跨任务的机制一致性未充分验证,建议在更多骨干上系统分析 LoRA-A/B 的作用。弱点四:仅覆盖摘要和翻译两类忠实生成,未触及推理、代码、多轮对话等,改进方向是扩展到正确性依赖中间步骤的推理任务(作者也提及 TOPL 可捕获细粒度错误)。弱点五:层选择靠滑动窗口搜索,成本高且依赖经验,改进方向是自动化层选择或用理论(如最后层与词表耦合的假设)指导选择。
未来方向
作者明确提出:改进 token 级扰动数据质量以减少监督噪声;扩展到推理任务(正确性依赖中间步骤,TOPL 可捕获细粒度错误);改变 token 级标签以实现超越事实性的灵活行为控制;揭示 LoRA-A 分离度与泛化的因果关系。基于本文成果可延伸的方向包括:把条件转向解释推广到其他后训练方法(DPO、GRPO)以统一理解;研究 TOPL 与 on-policy 方法结合的混合范式;探索更大规模模型上的表现与缩放规律;应用到多模态忠实生成(如图文、视频摘要);研究 token 级标签如何编码更丰富语义(如不确定性、风格)以实现多目标控制;把 LoRA-A 分离度作为训练过程中的早停或模型选择指标。
复现评估
复现性较好但需注意。骨干模型(Qwen3-8B / Llama-3.1-8B / Gemma-3-4B)、数据集(FAVA、AggreFact、MLQE-PE、FLORES-Plus)和评估器(Bespoke-MiniCheck-7B、XCOMET)均公开可得。关键超参数在附录 A.3 给出(LoRA r=4, α=8,各模型层范围明确)。但论文正文未见明确的代码/模型权重开源链接(GitHub/HuggingFace),这可能增加复现门槛。计算成本:训练需在 8B 模型上做 LoRA,且层选择(Figure 3 滑动窗口)、标签敏感性(Figure 4 多种配置)等消融涉及大量实验,算力需求中等偏上;评估 11 个数据集乘以多种方法也有显著开销。整体细节足以复现主结果,但完整复现全部消融成本不低,且部分实验细节(如具体学习率、训练步数)需查阅附录补充。
论文图表