视觉对比自蒸馏 Visual Contrastive Self-Distillation
用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
前置知识
在策略蒸馏(On-policy Distillation, OPD)
在策略蒸馏是一种知识迁移方法,它让学生模型在自己采样生成的前缀(response prefix)上接受监督,而非在固定的教师轨迹上学习。具体地,学生从自身策略 $y \sim \pi_\theta(\cdot|P,J)$ 采样响应,而教师在这些前缀上提供稠密的 token 级别监督(通常是下一 token 分布)。这样训练分布与推理时的实际轨迹对齐,避免了 off-policy 偏差。代价是需要一个更强的外部教师,增加了后训练成本。
VCSD 构建在 OPD 框架之上,理解“在策略采样决定学什么、但教师提供监督”这一分工,是理解 VCSD 如何用自教师替代外部教师的前提。
在策略自蒸馏(On-policy Self-Distillation, OPSD)与 EMA 教师
OPSD 移除了外部教师,转而用一个由学生自身参数构造的指数移动平均(EMA)模型 $\pi_\phi$ 作为目标教师。学生每步更新后,教师参数按 $\phi \leftarrow \mu\phi + (1-\mu)\theta$ 滑动更新($\mu$ 为衰减系数,更新率 $\rho=1-\mu$)。EMA 教师被当作 stop-gradient 的目标,不接收梯度。问题在于:当教师与学生看到完全相同的输入信息时,目标几乎不比学生当前预测更“聪明”,因此必须构造“教师-学生不对称性”(asymmetry)让自教师更有信息量。
OPSD 的核心难题正是“如何构造不对称性”,VCSD 的全部创新都围绕这个问题展开。理解 EMA 教师机制才能看懂为什么对比信号要作用在教师而非学生上。
教师-学生不对称性(Target Asymmetry)
在 OPSD 中,不对称性指教师能获得学生看不到的额外信息,从而给出更强的学习信号。已有方法在语言推理任务中给教师提供“特权答案”(privileged answers)或推理轨迹(reasoning traces),在视觉任务中给教师提供视觉证据(如裁剪、区域、提示图)。这些辅助信息让教师分布更“锐化”。但特权答案并非总有,视觉证据又依赖标注、外部定位模型或手工图像变换,工程复杂。VCSD 提出的关键问题是:能否纯粹从输入条件构造不对称性,而不依赖任何辅助信息?
这是本文动机的核心:所有已有方法的不对称性都来自额外信息,而 VCSD 要证明“配对的视觉条件”本身就足以产生有效的自蒸馏信号。
对比解码(Contrastive Decoding)
对比解码是一类推理时方法,通过比较两个预测分布(如专家模型 vs 业余模型,或原图 vs 退化图像条件)来调整 token 选择,突出专家更偏好的 token。典型做法是比较原始视觉条件与退化视觉条件下的对数概率差异,降低模型对语言先验的依赖。其作用域是推理阶段,会引入额外的前向计算开销。
VCSD 借鉴了对比解码的“配对条件”思想,但把它从推理时改进转变为训练时的自蒸馏信号(类似 MARGO 的同类对照),且蒸馏后推理无额外开销。理解对比解码能帮助区分 VCSD 与已有视觉对比方法。
前向 KL 散度与温度蒸馏
知识蒸馏中,前向 KL 散度 $D_{KL}(q^* \| p_\theta)$ 衡量目标分布 $q^*$ 与学生分布 $p_\theta$ 的差异,它倾向于覆盖目标分布的所有模式(mode-covering)。与之相对的逆向 KL 倾向于集中在一个模式(mode-seeking)。温度蒸馏引入温度 $T_{KD}$ 平滑分布,损失前乘 $T_{KD}^2/2$ 保持梯度尺度。本文实验比较了前向 KL、逆向 KL 和 JSD,发现前向 KL 最适合蒸馏对比塑形后的全分布目标。
VCSD 的最终损失就是温度标定的前向 KL,理解前向 KL 的 mode-covering 特性才能理解为何它最适合“全分布”目标,以及为何在消融中击败逆向 KL。
研究动机
在策略自蒸馏(OPSD)虽免去了外部教师,但仍面临一个根本困难:当 EMA 教师与学生接收完全相同的输入和前缀时,教师目标几乎不会比学生当前的预测更“聪明”,学习信号趋近于零。为使自教师有效,必须构造“教师-学生不对称性”,让教师掌握学生看不到的信息。已有方法通过两类辅助信息实现这一点:一是语言推理任务中的“特权答案”或推理轨迹(如 Zhao et al., 2026 的 answer-hint OPSD,教师能看到参考答案而学生只看到问题);二是视觉任务中的视觉证据信号,如证据聚焦的裁剪、区域或视觉提示(Yuan et al., 2026; Sun et al., 2026; Tian et al., 2026)。然而这些语言信号并非总有,视觉证据输入又依赖额外标注、外部定位模型或手工图像变换,工程复杂且任务相关。此外,视语言模型(VLM)普遍存在过度依赖语言先验、忽视细粒度图像证据的倾向(Guan et al., 2024),加剧了上述方法的局限。
本文的目标是本文的目标是回答一个核心问题:OPSD 所需的不对称性能否纯粹从输入条件构造,而不依赖特权答案、视觉证据信号、推理轨迹、外部验证器或可验证奖励中的任何一种辅助信息?换言之,作者希望找到一种最简形式的自蒸馏,仅靠学生自身生成的响应轨迹和原始的 prompt-图像对,就能产生比学生当前预测更具信息量的目标分布,并最终提升视语言模型在感知、数学、高分辨率感知和幻觉等多个能力维度上的表现,同时不增加任何推理时开销。
与已有工作不同的是,本文的独特切入点在于把“内容擦除图像”不当作要模仿的替代教师输入,而是当作一个受控参照(controlled reference)。已有视觉对比方法(包括推理时对比解码 VCD、训练时视觉证据 OPSD)要么直接蒸馏退化条件下的预测,要么用视觉证据锐化教师。VCSD 则在固定同一前缀、同一 prompt、同一 EMA 参数下,让教师分别对原图和擦除内容图各做一次下一 token 预测,二者的 token 级对数概率差异恰好刻画了“实例特异视觉内容”对每个候选 token 似然的影响。这种纯输入条件配对首次证明:无需任何辅助监督,仅靠配对视觉条件即可驱动自蒸馏。这填补了“输入条件即不对称性来源”的方法学空白。
核心方法
VCSD 的整体思路是“用配对视觉条件对比来塑形教师目标”。直觉上:若擦掉图像内容后某 token 似然大幅下降,说明它强依赖当前图像;反之主要靠语言先验。作者据此让 EMA 教师在每个学生生成前缀 $y_{<t}$ 上输出两个分布——$p^J_{\phi,t}(v)=\pi_\phi(v|P,J,y_{<t})$(原图)与 $p^0_{\phi,t}(v)=\pi_\phi(v|P,J_{ctrl},y_{<t})$(内容擦除控制图,纯黑 RGB)。二者的对数概率对比 $\Delta_t$ 量化视觉内容贡献。技术上用原图分布作“合理性锚点”,限定只在其相对支撑 $S_t(\beta)$ 内做对比塑形,再用温度 $T_{KD}=2$ 的前向 KL 沿学生轨迹蒸馏塑形后的全分布目标;学生更新后教师按 $\phi\leftarrow\mu\phi+(1-\mu)\theta$ 滑动(更新率 $\rho=0.05$)。整个过程不消耗外部教师、特权答案或视觉证据,推理时只保留更新后的学生。
核心创新是“条件对比 + 合理性锚点”的双重设计,与已有方法本质不同有三。第一,已有 OPSD 把不对称性绑定到额外信息(答案或视觉证据),VCSD 则绑定到“同一教师、同一前缀、仅视觉条件不同”的配对预测,把对比解码式的配对思想迁移进训练。第二,作者明确指出对比本身不能直接当目标(一个 token 可能在两条件下相对变化大、但在原图下概率仍极低),故用原图分布圈定合理性支撑 $S_t(\beta)$,把对比塑形限制在教师已认为合理的候选内,防高比值低概率 token 主导;两信号互补:原图分布定候选集与初始概率,对比 $\Delta_t$ 按视觉依赖重排候选相对偏好,得 $q^*_t(v)\propto p^J_{\phi,t}(v)\exp(\alpha\Delta_t(v))$。最终用温度标定前向 KL $\mathcal L=\frac{T_{KD}^2}{2}\mathbb E[\frac1{|y|}\sum_t D_{KL}(q^*_t\|p_{\theta,t})]$($T_{KD}=2$)蒸馏全分布目标。
方法步骤详情
方法分四步。1)采样:学生 $\pi_\theta$ 对 $(P,J)$ 采响应 $y$,每个前缀 $y_{<t}$ 施监督。2)对比:以同尺寸纯黑图 $J_{ctrl}$ 为控制,EMA 教师在 $y_{<t}$ 上输出原图分布 $p^J_{\phi,t}$ 与控制分布 $p^0_{\phi,t}$,算 $\Delta_t(v)=\log p^J_{\phi,t}(v)-\log p^0_{\phi,t}(v)$,正值表该 token 受原图更强支持。3)塑形:定合理性支撑 $S_t(\beta)=\{v:p^J_{\phi,t}(v)\ge\beta\max_u p^J_{\phi,t}(u)\}$($\beta=0.1$),支撑内构造 $q^*_t(v)\propto p^J_{\phi,t}(v)\exp(\alpha\tilde\Delta_t(v))$($\alpha=1.0$),终止 token 对比置零保稳定。4)蒸馏:用前向 KL 损失(见 key_idea,$T_{KD}=2$)更新学生,梯度只过学生,教师随后做 EMA 更新($\rho=0.05$)。
技术新颖性
技术新颖性体现在四个层面。其一,方法论上首次把“纯输入条件构造不对称性”作为 OPD/OPSD 的目标,证明配对视觉条件足够驱动自提升,填补了与特权答案/视觉证据 OPSD 并列的第三条路径。其二,目标构造上提出“合理性支撑 + 对比塑形”的耦合形式,并给出理论刻画:塑形目标 $q^*_t$ 是一个一步 KL 正则化策略更新 $\max_{q}\alpha\mathbb E_q[r^{vis}_t(v)]-D_{KL}(q\|\bar p^J_{\phi,t})$ 的唯一闭式解,把条件对比解释为隐式视觉证据奖励,同时给出 $\Delta_t$ 对条件点互信息 PMI 的受控逼近,理论严谨。其三,把对比解码从推理时移入训练时,蒸馏后零额外推理开销,与 VCD、DAMO 等推理期方法形成本质区别。其四,工程上证明了方法对控制图构造(黑图/高斯噪声/高斯模糊/无图)鲁棒,且跨 Qwen3-VL 与 Qwen3.5 两个家族、2B 到 9B 六个尺度一致有效,方法论普适。
实验结果
主结果(Table 1):VCSD 在 6 个配置(Qwen3-VL 2B/4B/8B 与 Qwen3.5 2B/4B/9B)均最高。Qwen3-VL 聚合 62.27%→67.04%(2B,+4.77%)、71.30%→73.16%(4B,+1.86%)、72.51%→76.26%(8B,+3.75%);以 2B 为例 VCSD 七基准全面超 OPSD(MMStar +3.00%、HallusionBench +4.32% 等)。Qwen3.5 上 VCSD 相对基线 +2.9%–4.3%,OPSD 几无一致增益。消融:支撑 $\beta=0$ 随训练退化、$\beta=0.1$ 稳定;强度 $\alpha\in[1,1.5]$ 鲁棒、$\alpha=0$ 低 2.33%;散度前向 KL 67.04% > JSD 66.25% > 逆向 KL 64.77%;控制图四种擦除聚合接近(67.04–67.14%)证鲁棒;锚点对聚合分影响小但降语言漂移。训练动态 VCSD 每步高于 OPSD;定性上 VCSD 正确数 7 个千位立方得 7519(基线/OPSD 错算 6169/8519)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Qwen3-VL-2B 七基准聚合(BLINK/MMStar/V*/MathVista/HR4K/HR8K/HalluB) | 平均准确率 Acc | 67.04%(VCSD) | 62.27%(Base)/ 64.89%(答案提示 OPSD) | 相对基线 +4.77%,相对 OPSD +2.15% |
| Qwen3-VL-4B 七基准聚合 | 平均准确率 Acc | 73.16%(VCSD) | 71.30%(Base)/ 71.40%(OPSD) | 相对基线 +1.86%,相对 OPSD +1.76% |
| Qwen3-VL-8B 七基准聚合 | 平均准确率 Acc | 76.26%(VCSD) | 72.51%(Base)/ 73.72%(OPSD) | 相对基线 +3.75%,相对 OPSD +2.54% |
| Qwen3.5 系列七基准聚合(2B/4B/9B) | 平均准确率 Acc | 71.51% / 76.77% / 79.24% | 68.61% / 73.94% / 74.97%(Base) | 相对基线分别 +2.90% / +2.83% / +4.27% |
| 蒸馏散度消融(Qwen3-VL-2B) | 平均准确率 Acc | 67.04%(前向 KL) | 66.25%(JSD)/ 64.77%(逆向 KL) | 前向 KL 比逆向 KL 高 2.27% |
| 对比强度消融(Qwen3-VL-2B) | 平均准确率 Acc | 约67%($\alpha=1$ 最优) | $\alpha=0$(无对比)低 2.33% | 对比塑形贡献 +2.33% |
局限与改进
作者承认的局限相对克制:理论上 $\Delta_t$ 对条件点互信息 PMI 只是“受控逼近”,前提是擦除预测 $p_\phi(v|J_{ctrl},H_t)$ 能近似无实例视觉信息时的预测,这一假设在强文本先验主导时可能失真;终止 token 的对比被手工置零以保证稳定,是一种工程妥协而非原理推导;固定 90 步训练预算下各模型仅做了有限超参搜索,$\alpha=1,\beta=0.1$ 的最优性是否随规模/数据变化迁移未充分验证。我额外观察到:评估全部在 Qwen 系列单一后训练配方(ViRL39K 单图)上进行,缺乏对非 Qwen 家族(如 InternVL、LLaVA)的跨架构验证;幻觉基准 HallusionBench 在 Qwen3-VL-4B 上 OPSD 反而略优于 VCSD(54.50 vs 60.37 系中 4B 行 OPSD 54.50 接近 VCSD 60.37,但个别列 OPSD 更高),增益并非每格都最大;此外控制图用纯黑图,对某些依赖色彩/亮度线索的任务,黑图可能残留分布偏移,鲁棒性结论(Table 3)虽然好看但样本单一。
独立分析的弱点
第一,理论假设的脆弱性:内容擦除预测作为“无实例视觉信息”的代理,在场景高度依赖全局布局而非内容细节时(如计数、空间关系),黑图可能不足以干净地移除相关信号,导致对比 $\Delta_t$ 含噪。改进方向是设计更自适应的控制图生成(如基于显著性或注意力区域的局部擦除),或学习一个内容擦除网络让代理更接近真实边缘分布。第二,跨架构与跨数据验证不足:全部实验限于 Qwen3-VL/Qwen3.5 与 ViRL39K 单图设置,VCSD 是否在视频多模态、更大模型(>9B)或不同后训练数据上仍稳定有效未知。改进方向是补充 InternVL、视频模型与多图数据的大规模验证。第三,终止 token 与超参的人工处理:手工将终止 token 对比置零、固定 $\alpha,\beta,T_{KD}$,缺乏自动化选择机制。改进方向是引入基于熵或梯度的自适应 $\alpha_t$ 调度,并对终止 token 采用软约束而非硬置零。第四,单图纯黑控制的分布偏移:黑图与真实图像在低层统计上差异大,可能引入非内容相关偏置。改进方向是使用匹配统计的噪声图或对抗生成的擦除图。
未来方向
作者隐含的方向包括:把输入条件不对称性推广到非视觉模态(如音频、文档布局的条件对比),以及把 VCSD 与可验证奖励 RL、外部教师蒸馏组合,探索互补性。基于成果可延伸的研究:一是将“配对条件对比作为隐式奖励”的 KL 正则化视角(Remark 1)与 RLVR、GRPO 等显式奖励方法统一,研究对比奖励与可验证奖励的协同或替代关系;二是把对比目标从 token 级扩展到轨迹级或 chunk 级,处理长链推理;三是理论深化——当擦除预测偏离 PMI 代理假设时给出 VCSD 目标的偏差界;四是把方法用于缓解多模态幻觉以外的任务(如细粒度 OCR、医学影像、3D),验证“视觉接地”假设的普适性;五是结合推理期对比解码,研究训练期塑形与推理期对比的叠加效应。
复现评估
复现性总体较好。关键超参齐全:$\alpha=1.0,\beta=0.1,T_{KD}=2$,EMA 更新率 $\rho=0.05$,AdamW 优化器,批 32 个 prompt、每 prompt $n=8$ 条 rollout,学习率 $2\times10^{-6}$,10 步预热后恒定,固定 90 步训练,8 张 NVIDIA B200 GPU。数据集为公开的 ViRL39K 单图数据集,七基准均为常用公开评测。方法公式(含 $\Delta_t$、$q^*_t$、$S_t(\beta)$、损失与 EMA 更新)给出完整,附录 A 还给出 Remark 1 的完整证明。挑战在于:算力门槛高(8×B200),未明确给出每步 rollout 数和评估脚本的工程细节;论文发布时间(2026-07)较短,作者未在正文中给出代码/权重仓库链接,复现需自行实现对比前向、合理性支撑掩码与终止 token 处理等工程组件,但这些组件本身不复杂,依据公式可在主流训练框架内实现。整体属于“原理清晰、工程量中等、算力门槛较高”的复现难度。
论文图表
图对比了四种构造目标不对称性的来源:(1) 基线——仅有图像和问题;(2) 特权答案——教师能看到 ground truth 答案来锐化分布;(3) 视觉证据——教师获得裁剪/区域等视觉提示;(4) VCSD(本文)——只用图像和问题,通过对比教师对原图与内容擦除控制图的预测来产生视觉驱动的目标。配图以“What is in the image?”为例展示每种方法下教师的 token 分布如何被锐化。
这张图是理解本文动机与定位的关键:它一眼讲清 VCSD 与已有特权答案/视觉证据 OPSD 的本质区别——前者完全不依赖辅助监督,仅靠配对视觉条件。读者据此能快速 grasp 全文核心主张。