← 返回 2026-08-04

双重锚定策略蒸馏:用信息匹配缓解在线自蒸馏的特权幻觉 DAPD: Dual-Anchored Policy Distillation

Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang, Shixiang Tang 📅 2026-08-03 👍 108 2026-08-09 18:30
信息不对称 后训练 大语言模型 推理模型 特权幻觉 策略蒸馏

用信息匹配的锚点修复在线自蒸馏中师生信息不对称导致的特权幻觉。

前置知识

在线策略自蒸馏 (OPSD)

一种后训练范式:从当前策略 $p_\theta$ 采样 rollout $y \sim p_\theta(\cdot|x)$,再把'被注入了特权信息(如参考答案 $y^*$)的同一个模型'当作 teacher 去监督'没有特权信息'的 student。损失为 $L_{OPSD}=\mathbb{E}[D(\text{sg}[p^{Cross}]\|p^{None})]$,其中 Cross 看得到 $y^*$,None 看不到。

OPSD 是本文要改造的基线方法,DAPD 的所有设计都建立在'保留 OPSD 的 on-policy 采样和特权 teacher 构造'之上,只是重组了监督结构。

特权幻觉 (Privilege Illusion)

训练时 teacher 能'偷看'参考答案,student 学到了只有在偷看时才成立的行为;推理时 student 拿不到参考答案,却表现得仿佛参考还在眼前,于是出现胡乱断言、编造答案的现象。本文用 Behavior Probe 定量刻画它。

这是全文要解决的核心病灶,理解了它才能理解为什么单纯'改 teacher 信号'治标不治本,必须从信息匹配入手。

信息不对称 (Information Asymmetry)

指 teacher(带特权信息)和 student(推理时无特权信息)在信息条件上的不一致。teacher 相对 student 的差异里,一部分是 student 能从 prompt 复现的'可复现指导',另一部分是只能靠 $y^*$ 才成立的'不可复现行为',两者纠缠在一起被一同蒸馏,即 Entangled Distillation。

作者把特权幻觉的根因精确定位为信息不对称(而非 teacher 质量差),这是 DAPD 整个设计的第一性原理。

None / Cross / Self 三种分布

对 completion 来源 $s$,在 token $t$ 处定义三个分布:None $p^s_{None}=p_\theta(\cdot|x,s_{<t})$ 无特权信息(匹配推理 student);Cross $p^s_{Cross}=p_\theta(\cdot|x,s_{<t},\bar{s})$ 看到另一个 completion $\bar{s}$(特权 teacher);Self $p^s_{Self}=p_\theta(\cdot|x,s_{<t},s)$ 看到自己正在预测的 completion(特权但可训练)。

Self 是 DAPD 引入的关键桥梁:它和 Cross 一样有完整信息(可对齐),又和 None 共享参数(梯度能流回)。三个分布组合出三条有向损失,是方法的全部技术载体。

LoRA 低秩适配

仅训练注入到注意力/MLP 投影矩阵里的少量低秩参数(本文 rank 64、scale 128),冻结 base 模型。本文还用了 LoRA-on(当前 student/采样器)、LoRA-off base(Inference/Privileged Anchor 的 detach teacher)和周期拷贝的共享 snapshot(两个 Entangled teacher)。

DAPD 需要同时维护多个条件分布的前向,LoRA 让显存可控、使 8×A100 能跑 32B 规模,是复现可行性的关键。

研究动机

现有 OPSD 方法在训练时让 teacher'偷看'参考答案 $y^*$(通过 Cross 分布 $p^{Cross}=p_\theta(\cdot|x,y_{<t},y^*)$),而 student 推理时却拿不到参考(用 None 分布 $p^{None}=p_\theta(\cdot|x,y_{<t})$)。这种信息不对称导致'特权幻觉':student 学到只有偷看时才成立的行为,推理时却表现得仿佛参考还在眼前,于是胡乱断言、编造答案。作者用 Behavior Probe 实测发现,随着训练进行,OPSD 的'错误断言'(推导失败后却声称从记忆里回忆起答案)从每 1 万次生成 13.0 次飙到 37.0 次,而 AIME24/AIME25/HMMT25 平均 Avg@12 从 59.56 跌到 53.24。已有两类缓解方法(直接蒸馏特权、选择性过滤特权信号如 Purified OPSD 和 DOPD)都没能根治,因为它们只改 teacher 信号,没解决'师生信息条件不一致'这个结构性问题。

本文的目标是本文要彻底消除 OPSD 的特权幻觉,让 student 只学到推理时能真正复现的行为。具体目标有三层:(1) 精确定位特权幻觉的根因——作者主张是 teacher 与 student 之间的'信息不对称'而非单纯 teacher 质量不足;(2) 在'信息可用性对齐'的条件下构造蒸馏监督,使 teacher 和 student 在配对时的信息条件匹配,从源头切断不可复现行为的传递;(3) 同时平衡'可靠的参考答案引导'和'student 可达的 rollout 引导'两个监督源,避免只依赖单一来源导致的覆盖面不足。可量化的验收指标是:在六个跨推理/代码/指令跟随的 benchmark 上稳定超越 OPSD,并在 Qwen3-1.7B 到 32B 五个规模上保持增益不随规模衰减(而 OPSD 的增益随规模增大几乎消失,8B 后只剩 ≤+0.28)。

与已有工作不同的是,本文的独特切入角度是:之前所有缓解特权幻觉的工作都在'修改或过滤 teacher 信号'这一层做文章(要么直接蒸馏特权、要么用逐点互信息校正、要么按优势差动态路由),但 teacher 依然带着特权信息去监督一个推理时拿不到特权的 student——信息不对称纹丝不动。作者第一次指出这是结构性的,根治办法不是动 teacher,而是'匹配师生双方的信息可用性'。为此引入 Self 分布 $p^{Self}=p_\theta(\cdot|x,y_{<t},y)$ 作为可训练的中间桥梁:它既和 Cross 一样能拿到完整 completion(信息匹配),又和 None 共享参数(可训练)。另一个被普遍忽视的点是'引导源':之前方法只用参考答案做监督,作者发现 rollout 本身也携带 student 可达的有用推理信号,于是提出把两个方向都纳入,用 $\lambda$ 平衡可靠性—可达性。

核心方法

直觉上,DAPD 像给师生之间架了两座'信息对齐'的桥。原来 OPSD 直接让'偷看了答案的 teacher'压'没看答案的 student',相当于让开卷的人去闭卷训练另一个人,难免教出'假装开卷'的坏习惯。DAPD 引入一个也'看了答案'、但看的是'自己正在写的这份答案'的 Self 分布作为桥梁——它既和 teacher 一样有完整信息(能对齐),又和 student 是同一个模型(梯度能流回)。技术路线由两个模块组成:Dual-Path Anchoring(DPA)在单一引导方向上用'无特权路径(unconditioned path)'和'有特权路径(privileged path)'对齐参考与 rollout;Dual-Source Anchoring(DSA)把对齐操作同时沿'参考→rollout'和'rollout→参考'两个方向应用,用 $\lambda\in[0,1]$ 平衡。总损失 $L_{DAPD}=\lambda L^{DPA}_{y\to y^*}+(1-\lambda)L^{DPA}_{y^*\to y}$,先做信息匹配再做源平衡。

核心创新是'用信息匹配的锚点取代信息不对称的师生监督'。对 completion 来源 $s\in\{y,y^*\}$,定义三种 token 分布:None(无特权,匹配推理 student)、Cross(看到另一 completion,特权 teacher)、Self(看到自己正在预测的 completion,特权但可训练)。据此定义三个有向损失:Entangled Distillation $L_{ent}=D(\text{sg}[p^{Cross}]\|p^{None})$(原 OPSD)、Inference Anchor $L_{infer}=D(\text{sg}[p^{None}]\|p^{Self})$(让 Self 学推理时的 None 行为)、Privileged Anchor $L_{priv}=D(\text{sg}[p^{Cross}]\|p^{Self})$(都有特权时对齐 Self 与 Cross)。本质区别:已有方法动 teacher 信号,DAPD 动'师生信息条件的配对方式',让特权监督只在双方信息匹配时发生,从而把不可复现行为与可复现指导从纠缠更新里解耦(unconditioned path 走 $L_{ent}+L_{infer}$,privileged path 走 $L_{priv}$)。

方法步骤详情

每个 minibatch 五步:(1) 用当前 LoRA-on student 对每个 $(x,y^*)$ 采 on-policy rollout $y\sim p_\theta(\cdot|x)$(温度 1.1、top-p 0.95、top-k 20、最多 1024 新 token、上下文 20000 token)。(2) 对每个 $s\in\{y,y^*\}$ 构造三种分布:插另一 completion $\bar{s}$ 得 $p^s_{Cross}$,插 $s$ 自己得 $p^s_{Self}$,纯 prompt 得 $p^s_{None}$;特权 completion 只用于训练、绝不进推理 prompt。(3) 在两方向($y\to y^*$、$y^*\to y$)各算三条损失:unconditioned path $L^{uncond}=L^{infer}_{\bar{s}}+L^{ent}_{s}$,privileged path 复用 $L^{priv}_{s}$;所有 teacher detach,梯度只过 student 侧。(4) 用 $L_{DAPD}=\lambda L^{DPA}_{y\to y^*}+(1-\lambda)L^{DPA}_{y^*\to y}$ 加权,学习率 $5\times10^{-6}$、LoRA rank 64、梯度裁剪 0.1、有效 batch 32、bf16,反传更新 LoRA。(5) 周期拷贝当前 LoRA 到共享 snapshot 供两个 Entangled teacher;Inference/Privileged Anchor teacher 用 detach 的 base 模型。散度为 component-clipped forward KL $\ell_c(q,p)=\sum_v\min\{q_v(\log q_v-\log p_v),c\}$,$c=0.05$,$T=1.1$。

技术新颖性

技术新颖性集中在三点。第一,'信息匹配'作为蒸馏第一性原理:之前所有 OPSD 变体(Purified OPSD 用逐点互信息校正、DOPD 按优势差动态路由)都在'特权信号上做减法',DAPD 第一次在'信息条件上做配对'——保留特权 teacher 不变,只改变师生配对时的信息可用性。第二,Self 分布作为可训练桥梁的引入:填补'无特权可训练 student'和'有特权 detach teacher'间的空缺,让梯度能在信息匹配条件下流动。第三,双向引导源(DSA):打破'只用参考做监督'的惯例,把 rollout 也当 student 可达的引导源,用 $\lambda$ 平衡可靠性—可达性,并随规模调整(小模型靠参考、大模型靠 rollout)。理论层面,作者用 Proposition 1、2 和式 (21) 证明 unconditioned path 能在 Self-Cross 桥一致性和局部相容性假设下隐式对齐两个 None 分布,并用 LoRA 子空间实测梯度点积 256.62、余弦 0.101 验证相容性。

Overview of DAPD
Figure 3: Overview of DAPD

实验结果

核心发现分五块。(1) 主对比(Table 1,Qwen3-4B):DAPD 六任务平均 57.34,比 OPSD +2.00,逐任务全涨——AIME25 +4.44、HMMT25 +3.06、IFBench +2.33、AIME24 +0.55、LCB v5 +1.05、BFCL v3 +0.59;也超 Purified OPSD(+1.09)和 DOPD(+3.85)。(2) 跨规模(Figure 1b):OPSD 对 Base 的增益从 1.7B 的 +5.19 衰减到 8B-32B 的 ≤+0.28;DAPD 在 1.7B/4B/8B/14B/32B 上对 OPSD 分别 +1.94/+2.69/+2.41/+2.04/+2.78,32B 仍 +2.78——大模型 rollout 自带更多自纠,OPSD 用参考绕过反而更伤。(3) OOD(Table 2):只用推理数据训练,代码/指令平均 49.64,比 OPSD +1.37,LCB v5 +4.82,非过拟合。(4) 特权幻觉缓解(Figure 2):步骤 250-300 间错误断言比 OPSD 减 73%,步骤 300 Avg@12 高 7.66。(5) 消融(Table 3):DPA 两条路径都需要(62.13→63.43→65.09);DSA 双源最优 65.28;reference-free 变体 8B 仍超 OPSD +2.41,加 verifier 到 66.11。

Performance comparison of DAPD with baselines on Qwen3-4B
Table 1: Performance comparison of DAPD with baselines on Qwen3-4B
DAPD ablation experiments with Qwen3 models
Table 3: DAPD ablation experiments with Qwen3 models
DAPD consistently improves over OPSD across (a) six tasks on Qwen3-4B and (b) five Qwen3 model scales
Figure 1: DAPD consistently improves over OPSD across (a) six tasks on Qwen3-4B and (b) five Qwen3 model scales
Visualization of inference-time results on an AIME24 sample
Figure 4: Visualization of inference-time results on an AIME24 sample
查看结构化数据
任务指标本文基线提升
AIME24(数学推理) Avg@12 77.22 OPSD 76.67 +0.55
AIME25(数学推理) Avg@12 72.22 OPSD 67.78 +4.44
HMMT25(数学推理) Avg@12 46.39 OPSD 43.33 +3.06
LCB v5(代码生成) Pass@1 53.31 OPSD 52.26 +1.05
六任务平均(Qwen3-4B) Mean 57.34 OPSD 55.34 +2.00
跨规模增益(32B) Avg@12 增益 vs OPSD +2.78 OPSD vs Base +0.28 OPSD 增益在大模型上几乎消失,DAPD 不衰减

局限与改进

作者承认三点:(1) 训练时要构造多个锚定分布(None/Cross/Self 在两方向上都要前向),训练开销显著增加,但推理零额外成本;(2) 各损失系数需跨规模或跨架构重新校准——Table 5 显示 1.7B 到 32B 的 $\lambda$ 从 0.5 降到 0.2、Privileged Anchor 权重各异,无通用配方;(3) reference-free 的 verified-rollout 扩展依赖自动正确性信号,对开放式任务(自由写作、无标准答案对话)不可得。我额外观察到:所有实验都基于 OpenThoughts 和 Qwen3 家族,未验证 Llama/Mistral 等其他架构;Behavior Probe 的'错误断言'检测较启发式(需先声明推导失败再给具体答案),可能漏掉其他形态幻觉;理论依赖较强的 bridge-consistency($\epsilon_{bridge}\le\epsilon$)和局部相容性假设,实测样本有限(128 个 token 位置、4 个 LoRA 初始化)。

独立分析的弱点

弱点一:超参敏感性。Table 5 显示每个规模都要单独调 $\lambda$、$\beta_{infer}$、$\beta_{priv}$,工程上不友好,且论文未给出自动化调参流程;改进方向是引入在线估计 rollout 可靠性的自适应权重。弱点二:理论假设偏强。Proposition 1 依赖 bridge-consistency $\epsilon_{bridge}\le\epsilon$,但 Self 和 Cross 共享特权条件 $(x,y^*)$ 并不保证总变差一定小,极端分布漂移时桥可能失效;可加入显式的桥一致性正则项。弱点三:训练算力翻倍以上(两方向×三分布的全词表前向),对 20000 token 长上下文成本很高,32B 仍需 8×A100;可考虑对 Self 分布做低秩近似或前向缓存。弱点四:评估集中在数学/代码/指令跟随,缺少多轮对话、长文本生成、agent 工具调用等场景;特权信息的其他形态(检索文档、工具轨迹、中间 plan)尚未验证,作者虽在 Future Directions 提及但留白很大。

未来方向

作者提出三个方向:(1) Reference-free DAPD——用 verified 或 consensus 选择的 rollout 替代固定参考,随策略改进动态更新该来源,保持信息匹配路径同时减少对人工标注的依赖(Section 4.5 的 dual-rollout 已初步验证可行,4B/8B 上 +2.41);(2) Adaptive source trust——按规模和样本/token 级别在线估计参考与 rollout 的可靠性,赋予连续权重而非全局系数或硬门;(3) Broader privileged information——把框架推广到检索文档、工具轨迹、verifier 反馈、中间 plan 等其他形式的特权信息。基于成果可延伸的:把 DAPD 与 RL(如 GRPO/PPO)结合,用 matched-information 锚点稳定 value/reward 估计;探索特权信息部分泄露(partial leakage)下的鲁棒锚点设计;以及在多模态(图/视频 token)场景验证信息不对称是否同样致命。

复现评估

复现友好度较高。代码已开源(https://github.com/uanu2002/DAPD)。训练用 8×A100-80GB,LoRA rank 64(非全参微调),数据为公开 OpenThoughts,benchmark 都是标准 harness(AIME24/25、HMMT25、LCB v5、BFCL v3、IFBench)。Appendix A 给了完整细节:prompt 模板(Table 4)、损失实现(component-clipped forward KL,cap 0.05,T=1.1)、基线说明和每规模系数配置(Table 5),seed 42 固定、matched-seed 对比。主要难点:(1) 需改推理逻辑实现 None/Cross/Self 三种条件前向插入特权消息;(2) 系数需按规模重调,无即插即用配方;(3) rollout 采样+多分布前向成本不低,复现 32B 至少需 8×A100。有 LoRA+DeepSpeed+vLLM 经验的团队 1-2 周可复现 4B 主结果。