OPD-V:基于模态平衡的视觉在线自蒸馏 OPD-V: Visual On-Policy Self-Distillation with Modality Balance
把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理
前置知识
On-Policy Self-Distillation (OPSD)
在线自蒸馏是一种大模型后训练范式:学生模型先采样自己生成的响应轨迹 $y \sim p_\theta(\cdot|I,x)$,再用同一个模型的 detached 副本(教师)在这些学生实际访问过的前缀 $y_{<t}$ 上提供逐 token 的密集目标分布 $q^{priv}_t(\cdot) = p_{\bar\theta}(\cdot|I,x,a^*,y_{<t})$。教师只在训练时获得特权信息(如已验证答案 $a^*$),推理时不需要,从而省去单独训练外部教师。
OPSD 是本文的基线和改造对象,OPD-V 正是在 OPSD 的损失框架上引入模态平衡的 token 选择机制,不理解 OPSD 的『轨迹由学生生成、目标由教师打分』结构就无法理解 OPD-V 改了哪里。
Privileged Information(特权信息)
特权信息是仅训练时提供给教师、推理时不暴露的辅助输入,用来构造更有信息量的教师监督。常见形式包括已验证的文本答案、参考答案、基于证据区域的裁剪图(evidence-centered crop)、视觉思考等。OPD-V 的核心创新是把『模态平衡』这一模型内部状态转成显式的教师输入(Zoom-In 图和 Mask 图)作为特权信息。
整篇论文都在回答『如何设计特权信息使其在模态不平衡下仍然有效』,特权信息的构造方式直接决定 OPSD 的效果上限。
Modality Imbalance(模态不平衡)
指 MLLM 在生成时过度依赖文本上下文而相对忽视视觉输入的倾向,即使任务实际依赖图像,强文本先验仍可主导生成。论文用模态平衡注意力比 $\rho(c;y) = \frac{\sum_{t\in T_y}\alpha^V_t(c)}{\sum_{t\in T_y}\alpha^T_t(c)+\epsilon}$(视觉注意力质量与文本注意力质量之比)来量化它,比值越大表示视觉相对文本的注意力越强。
模态不平衡是本文识别的核心问题,所有方法设计都围绕『让特权信息反映更强的视觉证据使用』展开,不掌握这个概念就看不懂正负教师为何这样构造。
Jensen-Shannon Divergence 与 Top-K 蒸馏
JSD 是对称的分布距离度量,OPD-V 用 $\beta=0.5$ 的 JSD 作为学生 $p_{\theta,t}$ 与正教师 $q^+_t$ 之间的逐 token 蒸馏目标 $D_{JS}(q^+_t, p_{\theta,t})$。为降低全词表 logits 蒸馏的显存开销,采用 top-K 策略:取学生 top-$K=100$ token 集合 $K_t$,对每个分布保留 top-K 概率并把剩余词表质量并入一个尾部桶 $s^{tail}_t = 1 - \sum_{v\in K_t}s(v)$,构成 $K+1$ 维分布,尾部质量 $<10^{-13}$ 近乎无损。
OPD-V 的损失函数 $\mathcal{L}_{OPD-V}$ 的核心项就是 JSD,top-K 是把方法落到 H200 上的工程关键,读懂损失公式必须先理解 JSD 与 top-K。
EMA 教师(Exponential Moving Average)
教师参数不单独训练,而是学生权重的指数滑动平均:每个训练步后 $\bar\theta \leftarrow (1-\tau)\bar\theta + \tau\theta$,本文 $\tau=0.05$(即保留 95% 旧教师参数)。正教师、负教师共享同一组 EMA 参数,它们的分布差异完全来自输入图像操作,而非参数不同。
这是『self-distillation』中 self 的体现,也解释了为何 OPD-V 不增加额外模型参数——正负教师是同一权重在不同图像输入下的两次前向。
研究动机
当前提升 MLLM 视觉推理的标准后训练手段是 OPSD(在线自蒸馏),它从多样化输入源抽取特权信息来指导蒸馏,常见做法包括给教师喂已验证文本答案、基于证据区域的裁剪图(Vision-OPD)、视觉思考(Visual-OPSD)、或通过改变视觉内容访问来制造教师对比(VA-OPD、VCSD)。然而这些设计都忽视了一个 MLLM 推理固有的挑战——模态不平衡:因为每个 token 预测都同时条件于图像、文本指令和自回归前缀,强文本先验会主导生成,使模型即便拿到精心设计的特权信息也无法充分整合多模态输入,特权信号被低估利用,限制了 OPSD 的有效性。论文图 1 在 5K 样本上的测量显示,遮罩图(负教师)的模态平衡注意力比 $\rho$ 最低(约 0.148),原图(学生)居中(约 0.226),放大图(正教师)最高(约 0.263),证明同一查询下不同图像操作确实暴露出不同程度的模态不平衡。
本文的目标是本文的具体目标是回答一个核心问题:『如何设计特权信息,使其在模态不平衡条件下仍对 MLLM 的 OPSD 有效?』作者不打算简单地再换一种视觉变换或文本提示,而是要把『模态平衡』这一原本描述模型内部注意力分配的隐含状态,转译成显式的、可拼接到教师输入的形式,并进一步转化为逐 token 的监督信号。最终目标是提出一个统一的视觉 OPSD 范式 OPD-V,在 6 个基准、4 种 MLLM 骨干、5 种后训练方法上持续提升推理准确率,同时相比标准 OPSD 降低训练成本。
与已有工作不同的是,本文的独特切入角度是:以往特权信息都是『外在输入』(答案、裁剪、思考),而模态平衡是『内在状态』,不能直接拼接到教师上下文。作者的关键洞察是『模态平衡本身可作为特权信息』,并用一组配对的图像操作(Zoom-In 放大图作为正教师、Mask 遮罩图作为负教师)把内部状态外化为教师输入差异:通过比较两个教师在同一学生 token 上打分的高低(模态平衡 Logits 边际 $\delta^{MB}_t$),判定该 token 的教师支持是否反映了更强的视觉证据使用,从而只在『模态平衡信任域』内施加蒸馏。这与以往按教师置信度或固定区域选 token 的做法有本质区别。
核心方法
方法整体思路是『先直觉、再技术路线』。直觉:若某 token 在放大任务相关区域(Zoom-In)后比遮蔽该区域(Mask)得到更高的概率支持,说明该预测依赖视觉证据而非文本先验,则正教师分布值得蒸馏给学生。技术路线三步:第一步配对教师视图,学生喂原图 $I$,正教师喂放大图 $I_{zoom}$(基于训练数据证据中心 bbox 裁剪并放大),负教师喂遮罩图 $I_{mask}=\text{Mask}(I_{zoom})$;第二步在同一学生前缀 $y_{0\}$,仅在该域内对正教师做 JSD 蒸馏。训练在 6.2K 视觉推理样本、4 张 H200、batch=48、每 prompt 8 条 rollout、1 epoch 下完成。
核心创新点在于把『模态平衡』这一不可直接拼接的内部状态,转化为可计算的、token 级的、方向性的教师对比信号。本质区别有三:其一,正负教师共享同一 EMA 参数 $\bar\theta$,分布差异 100% 来自图像操作而非模型差异,因此对比信号纯净地反映视觉证据的边际贡献;其二,token 选择不再依据教师置信度绝对值,而是依据『放大视觉信息后支持是否增强』的方向性边际 $\delta^{MB}_t$,从而避开文本先验驱动的伪高置信 token;其三,边际 $\delta^{MB}_t>0$ 同时充当两重角色——既是进入信任域的门控,又是该 token JSD 蒸馏损失的加权系数 $r_t\delta^{MB}_t D_{JS}(q^+_t,p_{\theta,t})$。这与 Vision-OPD 仅用裁剪图、VA-OPD 仅做有无视觉的二值对比相比,提供了更细粒度且自带方向性的监督。
方法步骤详情
对应 Algorithm 1,输入训练集 $\mathcal{D}$、学生 $p_\theta$、rollout 数 $n=8$、EMA 率 $\tau=0.05$。每步先初始化 $\bar\theta\leftarrow\theta$;采样小批量 $\mathcal{B}$,对每个 $(I,x)$ 取 $I_{zoom}$ 并生成 $I_{mask}=\text{Mask}(I_{zoom})$;对每条 rollout 采样 $y\sim p_\theta(\cdot|I,x)$,逐生成 token 位置 $t$ 置 $r_t=1$,计算 $p_{\theta,t}$、$q^+_t=p_{\bar\theta}(\cdot|I_{zoom},x,y_{0$ 且 $r_t=1$ 时取 top-$K=100$ 词表集并并入尾部桶(尾部质量 $<10^{-13}$),算 $D_{JS}(q^+_t,p_{\theta,t})$ 按 $\delta^{MB}_t$ 加权累加;最后用 $\mathcal{L}_B/(n|\mathcal{B}|)$ 更新 $\theta$,EMA 更新 $\bar\theta\leftarrow 0.95\bar\theta+0.05\theta$。目标 $\mathcal{L}_{OPD-V}=\mathbb{E}[\sum_{t\in\mathcal{R}_{MB}} r_t\delta^{MB}_t D_{JS}(q^+_t,p_{\theta,t})/\sum_t r_t]$,信任域 $\mathcal{R}_{MB}=\{t:\delta^{MB}_t>0\}$。
技术新颖性
技术新颖性体现在四点。第一,问题定义新颖:首次把模态不平衡识别为限制 MLLM OPSD 特权信息有效性的瓶颈,并用注意力比 $\rho$ 给出可测量定义。第二,特权信息形式新颖:模态平衡是模型内部状态而非外部输入,作者通过 Zoom-In/Mask 这对图像操作将其外化为可拼接的教师输入差异,这是『把内部状态变成特权信息』的新范式。第三,token 选择机制新颖:信任域 $\mathcal{R}_{MB}(y)$ 由方向性边际 $\delta^{MB}_t$ 定义,且该边际同时做门控与加权,相比按置信度或固定区域选 token 更具模态针对性。第四,效率反直觉新颖:OPD-V 比标准 OPSD 多一次负教师前向,却因响应更短(4B 上 141 vs 554 token,降 74.5%)和更轻量的教师输入构造(9B 上教师 batch 构造从 79.2s 降到 15.3s,双教师合并前向 27.1s 仍低于单教师 40.4s)反而把 4B/9B 步延迟分别降 31.8%、24.7%。
实验结果
核心发现分四层。整体效果(RQ1,Table 1):Qwen3.5-4B 上 OPD-V 把平均准确率从基线 64.30% 提到 80.01%(+15.71 个百分点),6 个基准全面超过最强对手 Vision-OPD(77.10%),MME-RealWorld 提升 20.5%;4B 模型超过所有闭源(GPT-5.2 71.81%、Gemini-3.5-Flash 79.24%)和更大开源(397B Qwen3.5 77.44%、1T Kimi-K2.6 72.81%)。跨架构(Figure 4):Qwen3-VL-4B/8B 与 Qwen3.5-9B 分别从 68.00/68.93/69.75 升至 74.14/73.03/77.63,覆盖两种视觉融合机制,说明改进与架构无关。计算效率(RQ2,Figure 5):4B 步延迟 352→240s(↓31.8%),9B 451→340s(↓24.7%)。机制有效性(RQ3,Figure 6):双教师 80.01% 高于单正教师 74.62%、单负教师 71.98%;Zoom-In+Mask 最强,其余变换 Repeat 75.95%、Blur 74.31%、Prune 73.74%、No Image 72.17%。训练动态(Figure 3):信任域占比 4B 53.8%、9B 49.6%,策略熵 0.827/0.761 稳定,响应长度比 OPSD 降 74.5%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 6 基准平均(V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld EN/CN) | 准确率 Average (%) | Qwen3.5-4B + OPD-V: 80.01% | Qwen3.5-4B 基线 64.30%;最强后训练对手 Vision-OPD 77.10% | 比基线 +15.71 个百分点,比 Vision-OPD +2.91 个百分点 |
| 跨骨干平均准确率 | 准确率 Average (%) | Qwen3-VL-4B 74.14 / Qwen3-VL-8B 73.03 / Qwen3.5-9B 77.63 | 对应基线 68.00 / 68.93 / 69.75 | 分别 +6.14 / +4.10 / +7.88 个百分点 |
| 训练步延迟(Qwen3.5 4B / 9B) | Wall-clock step time (s) | 240s (4B) / 340s (9B) | OPSD 352s (4B) / 451s (9B) | 分别 ↓31.8% / ↓24.7% |
| 最终十步平均响应长度(4B) | Response token 数 | OPD-V 140.9 token | OPSD 553.8 token | ↓74.5% |
| 双教师消融(Qwen3.5-4B 平均) | 准确率 (%) | 双教师 80.01% | 单正教师 74.62%、单负教师 71.98% | 双教师比单正教师 +5.39、比单负教师 +8.03 个百分点 |
局限与改进
作者承认与可观察到的局限包括:第一,依赖证据中心 bbox。Zoom-In 图直接取自 Vision-OPD 训练数据提供的 bbox_images 字段(Table 4),Mask 也基于该裁剪生成,意味着方法在缺乏任务相关区域标注的数据上无法直接套用,泛化到无 bbox 的真实数据存疑。第二,骨干覆盖窄。所有实验局限于 Qwen 家族(Qwen3.5-4B/9B、Qwen3-VL-4B/8B),未验证 Llama、InternVL、Gemini 系等不同视觉编码器与对齐策略的骨干。第三,训练规模小。仅 6.2K 样本、1 epoch、单一数据集,方法在更大、更多样语料下的稳定性未检验。第四,Mask 操作较粗糙。仅随机矩形黑块遮蔽,未探索更结构化的遮挡(如按显著性、按对象分割)。第五,评测仅 non-thinking 模式,未报告 thinking/CoT 模式表现。第六,方法只在图像问答这类判别式任务上评测,未涉足视频、开放生成等场景。
独立分析的弱点
独立分析的弱点及改进方向如下。弱点一:bbox 依赖是工程硬约束。Zoom-In 需要 ground-truth 任务相关区域,真实部署往往没有这种标注。改进方向是用显著性检测/开放词汇分割/GroundingDINO 自动生成候选裁剪,并把『裁剪框来源』做成可学习或弱监督。弱点二:Mask 的随机性可能噪声大。随机矩形遮蔽有时恰好不遮任务区域,使负教师对比信号失效。改进方向是按注意力热力图或对象掩码做语义化遮蔽,并引入多候选 Mask 取最informative 的一个。弱点三:信任域门控是硬阈值 $\delta^{MB}_t>0$,对接近 0 的边际同样一刀切。改进方向是把边际软化成连续权重(如 sigmoid 温度缩放)或加入边际直方图自适应阈值。弱点四:仅 Qwen 家族验证。改进方向是扩展到 InternVL、Llama-Vision、开源 Gemini 复刻,并增加视频骨干验证时序模态平衡。弱点五:负教师多一次前向在超大模型上开销不可忽略。改进方向是对负教师做共享 KV-cache、低秩近似或间歇性激活(隔若干步算一次)。
未来方向
作者提出的延伸方向是把模态平衡作为通用 OPSD 准则扩展到更多 OPSD 方法(论文已在 5 种后训练方法上验证增益),并把 token 选择思想迁移到其他多模态场景。基于成果可延伸的研究有:其一,把『模态平衡信任域』推广到视频、音频、3D 等更多模态,定义跨模态的注意力比与信任域;其二,探索模态平衡与其他特权信息(答案、视觉思考)的组合,构造多源正负教师的联合信任域;其三,研究 trust region 比例(现稳定在约 50%)与训练数据难度、模型容量的关系,设计自适应 rollout 与信任域调度;其四,把方法用于推理时扩展(test-time OPD-V),在推理阶段动态放大关键区域做自一致性校验;其五,结合 thinking 模式研究长链推理中的模态漂移与平衡控制。
复现评估
复现评估:论文提供了 Algorithm 1 完整伪代码、损失公式与 top-K 蒸馏细节(Appendix B)、训练 prompt 示例(Figure 7)、骨干配置表(Table 3)、训练超参表(Table 4)、评测协议表(Table 2),关键超参($\tau=0.05$、$K=100$、batch=48、rollout=8、maxlen 1024/8192、JSD $\beta=0.5$、1 epoch、4×H200)均有明确数值,复现门槛中等偏易。数据来自公开的 Vision-OPD 数据集(6241 样本,含 bbox_images),评测用公开基准(V* Bench 191、ZoomBench 845、HR-Bench 4K/8K 各 800、MME-RealWorld EN 23609/CN 5917),骨干均为开源 Qwen 模型。主要难点在于:算力需求(4×H200 训练 6.2K 样本 1 epoch 仍非消费级),且未明确开源代码与 checkpoint,Mask 随机种子、EMA 实现细节、W&B 离线日志等需自行补齐。整体可复现性良好但需一定工程投入。
论文图表
左图展示模态平衡注意力比 $\rho$ 在三种条件下递增:负教师(Mask 图)约 0.148 最低、学生(原图)约 0.226 居中、正教师(Zoom-In 图)约 0.263 最高,证明同一查询下配对图像操作确实暴露不同程度模态不平衡。右图按模态平衡 Logits 边际分箱(低/中/高),随着边际增大,正负教师注意力比之差 $\Delta\rho$ 拉大,同时学生正确率从 84 区间升到 92.2%,达 100% 的teacher discrimination 上限。
这张图是整篇论文动机的实证基础,直接支撑『模态平衡可作为特权信息』这一核心论点,是理解后续正负教师与信任域设计的关键。
完整伪代码:初始化 EMA 教师 $\bar\theta\leftarrow\theta$;每步采样小批量,对每个 $(I,x)$ 取 $I_{zoom}$ 并生成 $I_{mask}$;对每条 rollout 逐 token 计算 $p_{\theta,t}$、$q^+_t$、$q^-_t$ 与边际 $\delta^{MB}_t$;边际为正且 $r_t=1$ 时累加 $\delta^{MB}_t D_{JS}(q^+_t,p_{\theta,t})$;用 $\mathcal{L}_B/(n|\mathcal{B}|)$ 更新学生,再 EMA 更新教师 $\bar\theta\leftarrow(1-\tau)\bar\theta+\tau\theta$。
这是方法的可执行蓝图,把损失公式落到训练循环,是复现与方法理解的必备细节。