← 返回 2026-08-17

自监督视觉在线策略蒸馏:用学生视图退化构造免费师生不对称 Self-Supervised Visual On-Policy Distillation

Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang, Zhenfei Yin, Di Fu, Philip Torr, Nuno Vasconcelos 📅 2026-08-14 👍 167 2026-08-22 18:30
后训练 数据增强 知识蒸馏 自监督学习 视觉语言模型

反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号

前置知识

在线策略蒸馏(On-Policy Distillation, OPD)

知识蒸馏的变体:学生模型对每个 prompt 自己采样生成轨迹,教师再对学生已生成的每个前缀 $y_{<t}$ 给出下一个 token 的目标分布,逐 token 计算散度并回传梯度。与离线蒸馏(在固定数据集上模仿教师输出)不同,监督精确落在学生推理时真正会经过的状态上,消除训练-推理分布失配;信号比 RL 的稀疏标量奖励稠密得多,因此常用于后训练阶段。

本文的全部目标函数与训练流程都建立在这一框架上,理解它才能明白'教师对学生 rollout 打分'到底在算什么。

EMA 教师与在线策略自蒸馏(OPSD)

指数滑动平均(EMA)教师是学生参数的平滑副本,每步按 $\phi \leftarrow (1-\eta)\phi + \eta\theta$ 更新(本文 $\eta=0.05$)。由于 $\phi$ 是历史参数的加权平均,它比当前学生更稳定、通常略好,可充当无需额外训练的目标模型,这就是自蒸馏:BYOL、DINO 等都用此机制实现'自己教自己'。

本文的教师既非独立训练、也没有任何特权输入,就是这个 EMA 副本;消融显示冻结它仅损失 0.40% 的收益,是理解方法本质的关键。

KL 散度与广义 Jensen–Shannon 散度

KL 散度度量两个分布的差异:前向 KL 是覆盖型的(coverage-seeking),强迫学生匹配教师的全部概率质量;反向 KL 是模式寻求型的(mode-seeking),允许学生只押注高置信模式。广义 JSD 通过混合分布 $m_t=\alpha p+(1-\alpha)q$ 在两者之间插值($\alpha=0.5$ 为对称中点),且有界,对低重叠分布更稳定。

本文的损失就是教师与学生 next-token 分布之间的散度,选哪种散度直接影响蒸馏效果;论文表 6 证明 JSD(76.05%)优于前向 KL(74.74%)和反向 KL(75.49%)。

自监督学习中的增强视图

自监督学习不依赖人工标签,而是从同一无标签输入的不同增强视图间构造监督:SimCLR/MoCo 用对比损失拉近两个增强视图的表征,BYOL/SimSiam/DINO 让一个视图为另一个增强视图提供回归目标。增强在这里不只是正则化,而是监督的定义者——它决定了模型学到哪些不变性。

S2VOPD 借用了'增强定义监督'的思想,但用途被反转:增强不是为了学习不变性,而是为了制造师生预测落差。理解这一渊源才能读懂方法的动机与定位。

细粒度视觉感知基准

V*Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld(含中文子集)等基准专门考察 VLM 的高分辨率细节感知能力:在大图中定位小目标、按指定倍率读图、辨认密集场景元素等,要求模型依赖真实视觉证据作答,而不是靠语言先验猜答案。

论文的主要评测都在这类基准上(六项感知基准 + 三项数学基准);理解其考察点,才能解释为什么'下采样+噪声'这种保留布局、削弱信号的增强与这些能力天然对齐。

研究动机

视觉在线策略蒸馏(OPD)在 LLM 与 VLM 后训练中效果显著,但其成立前提是教师必须拥有学生不具备的信息优势:要么使用更大更强的教师模型(如从 Qwen3-VL-235B 级别蒸馏),要么依赖特权监督——在线策略自蒸馏(OPSD)虽免去了独立教师,却要给教师喂参考答案、环境反馈或真值感兴趣区域(ROI)。文中给出具体例子:Vision-OPD 训练时使用真值区域标注,ZwZ 依赖真值 ROI,OPSD 需要已验证的推理轨迹。随着模型能力逐渐超过人类能可靠提供的监督上限,这类外部特权信号越来越难获得且代价高昂。于是论文提出一个根本问题:当没有任何特权信息可用时,有信息量的师生不对称性还能从哪里来?

本文的目标是本文的目标是构建一种完全自给的视觉在线策略蒸馏方法:不使用真值标注、外部奖励、特权上下文,也不引入额外更强教师,仅靠被训练模型自身及其指数滑动平均(EMA)副本,就产生致密的 token 级监督信号。具体量化目标是在六项细粒度感知基准上把 Qwen3.5-4B 的平均准确率从 70.68% 显著提升(最终达到 77.44%,提升 6.76%),同时恢复特权信息方法约 96% 的改进幅度,并且不以牺牲数学推理为代价——事实上 4B 模型感知提升 +5.7%、数学推理提升 +3.7%(9B 上为 +3.6% 和 +3.2%),实现感知与推理的同步改进。

与已有工作不同的是,本文独特的切入点是把不对称性的来源方向反转:传统做法是给教师添加更多信息(更大模型、参考答案、真值区域),本文改为从学生端减去信息——教师观察原始干净图像 $x$,学生只在强增强后的退化视图 $ ilde{x}=T(x)$ 上行动,两者可用视觉证据的差异自然产生预测分布落差,这个落差本身就是免费的学习信号,不需要标注、奖励、特权上下文或独立教师。该思想与自监督学习(SimCLR、BYOL、DINO)同源,但用途不同:不是在表征层对齐增强视图,而是用增强制造 token 级生成蒸馏所需的师生落差;与 NoisyRollout、VPPO、PRPO 等用增强辅助外部奖励驱动 RL 的工作也不同,这里增强是唯一的监督来源。

核心方法

方法直觉:如果把学生能看到的图像信息削去一部分,学生对自己 rollout 的预测会变差,而看过原图的教师对相同前缀的预测更可信,两者逐 token 分布的差异就是可最小化的监督信号。技术路线:给定图像-问题对 $(x,q)$,学生 $\pi_\theta$ 在增强视图 $\tilde{x}=T(x)$ 上采样 on-policy 轨迹;EMA 教师 $\pi_\phi$(按 $\phi\leftarrow(1-\eta)\phi+\eta\theta$ 更新)在干净视图 $x$ 上为每个前缀 $y_{<t}$ 给出分布。损失为逐 token 散度均值 $\mathcal{L}(\theta)=\mathbb{E}_{y\sim\pi_\theta}\frac{1}{|y|}\sum_{t}D\big(\pi_\phi(\cdot|x,q,y_{<t})\,\|\,\pi_\theta(\cdot|\tilde{x},q,y_{<t})\big)$,$D$ 取广义 Jensen–Shannon 散度($\alpha=0.5$),两个分布限制在教师 top-k token 上重新归一化。

核心创新是把师生信息差的来源从'教师更有信息'反转为'学生更缺信息'。传统 OPD 用更大教师,OPSD 给教师喂参考答案或真值 ROI 等特权输入;S2VOPD 的教师只是学生自身的 EMA 副本,两者唯一差别是输入视图:教师看原图 $x$,学生看退化视图 $\tilde{x}=T(x)$,因此教师对相同生成前缀的预测分布天然更可信,逐 token 散度提供了与任务对齐的致密信号,完全不需要标注或奖励。消融证明该不对称性正是收益来源:去掉增强(学生与教师看同一张图)后收益坍缩回基线水平(70.52% 对基线 70.68%),而冻结教师不更新仍保留 93% 的收益(75.95%,仅低 0.40%),说明监督主要来自构造出的视图落差,而非教师自我改进。这是与所有前人方法在机制层面的本质区别:不对称性由输入端构造,而非由模型能力或特权信息提供。

方法步骤详情

第一步:取图像-问题对 $(x,q)$,按全局概率 $p$、算子概率 $\rho_j$ 与强度 $\lambda_j\sim P_j$ 抽取变换 $T$ 并按固定顺序复合,生成学生视图 $\tilde{x}=T(x)$,教师保留原图。第二步:学生在 $\pi_\theta(\cdot|\tilde{x},q)$ 上采样 $n=8$ 条 rollout。第三步:对每条轨迹每个位置,计算教师条件于干净视图与学生条件于退化视图的 next-token 分布。第四步:在教师 top-k 支持集上归一化,计算广义 JSD($\alpha=0.5$)取均值作为损失,梯度更新学生。第五步:以 $\eta=0.05$ 更新 EMA 教师。默认配方 $T(x)=A_{noise}(A_{down}(x;s);\lambda_{noise})$,$s\sim U(0.3,0.6)$,下采样后不缩回分辨率,噪声以 $\rho=0.5$ 概率施加 DDPM 前向 $t=200$ 步($\sigma\approx0.11$)。训练用 12K FineVision(或 Vision-OPD-6K)样本,训练 130 步(6K 数据 65 步)。

技术新颖性

技术新颖性体现在三方面。其一,据作者所知这是首个面向 OPD 的受控大规模增强空间搜索:把增强形式化为算子族(信息削减、几何、光度、遮挡共 15 种算子)、应用概率、强度范围、复合顺序与全局概率 $p$ 五要素(表 1),系统回答'什么样的师生落差才是好的监督'。其二,提出落差的双重判据——幅度上,性能随 token 级 JSD 落差先升后降,峰值约 0.014(太弱或太强都变差);语义上,落差必须保留与问题相关的证据,强裁剪产生的落差最大却只有 67.44%,因为学生输入已变得无法回答。其三,用广义 JSD 替代前向/反向 KL(76.05% 对 74.74%/75.49%),在覆盖性与模式寻求之间取得平衡,恰好适配'学生无法访问教师全部视觉细节'这一新设定,这一散度选择分析在视图不对称蒸馏场景下是首次。

Overview of S2VOPD. The student generates rollouts from a corrupted view of the image; an EMA teacher scores the same generated prefixes under the clean view; a top-k generalized JSD transfers the teacher's better-informed token distributions to the student.
Figure 1: Overview of S2VOPD. The student generates rollouts from a corrupted view of the image; an EMA teacher scores the same generated prefixes under the clean view; a top-k generalized JSD transfers the teacher's better-informed token distributions to the student.

实验结果

主结果(表 2,12K FineVision 训练):S2VOPD 把 Qwen3.5-4B 在六项感知基准的平均准确率从 70.68% 提到 77.44%(+6.76%),超过 Qwen3-VL-235B(75.75%)、GPT-5.4(72.77%),追平 397B 的 Qwen3.5,并优于全部特权监督方法(Vision-OPD 77.07%、OPSD 72.85%)。公平对比(表 3,同在 Vision-OPD-6K 训练 65 步):4B 达 75.33% 居首,超过最强自奖励 RL 基线 TTRL 73.30%(+2.0%);感知与数学分别 +5.7%/+3.7%,特权方法普遍伤数学(OPSD 使 MathVision 4B 降 9.3%),自奖励 RL 保数学但感知弱——S2VOPD 兼得。增强分析(图 2):对称自蒸馏降到 65.21%;四族增强全部有效,信息削减最佳(75.65%);性能随师生落差先升后降,峰值在 JSD≈0.014,强裁剪落差最大却只有 67.44%。消融(表 4-6):去增强坍缩至 70.52%,去 EMA 仅降 0.40%,EMA 衰减率 0.95–0.999 波动 <0.8%,JSD 优于前向/反向 KL。

Overview of augmentation operators on the student policy.
Table 1: Overview of augmentation operators on the student policy.
Performance of S2VOPD trained on a 12k subset of FineVision, compared with open-source, proprietary, and methods that use privileged information on fine-grained perception benchmarks (accuracy, %; AVG is the average over the 6 benchmarks).
Table 2: Performance of S2VOPD trained on a 12k subset of FineVision, compared with open-source, proprietary, and methods that use privileged information on fine-grained perception benchmarks (accuracy, %; AVG is the average over the 6 benchmarks).
Comparison with prior methods trained on the Vision-OPD training data, across six fine-grained perception and three mathematical-reasoning benchmarks at different model scales.
Table 3: Comparison with prior methods trained on the Vision-OPD training data, across six fine-grained perception and three mathematical-reasoning benchmarks at different model scales.
Component ablation on S2VOPD-4B. w/o aug removes the view asymmetry by showing the student the same clean image as the teacher; w/o EMA keeps the augmentation but freezes the teacher at the base model.
Table 4: Component ablation on S2VOPD-4B. w/o aug removes the view asymmetry by showing the student the same clean image as the teacher; w/o EMA keeps the augmentation but freezes the teacher at the base model.
Comparison of different divergences. AVG is over 6 perception benchmarks.
Table 6: Comparison of different divergences. AVG is over 6 perception benchmarks.
(a) Performance of each augmentation family applied alone; (b) Accuracy vs. the teacher–student predictive gap induced by the augmentation.
Figure 2: (a) Performance of each augmentation family applied alone; (b) Accuracy vs. the teacher–student predictive gap induced by the augmentation.
查看结构化数据
任务指标本文基线提升
六项细粒度感知基准平均(V*Bench/ZoomBench/HR-4K/HR-8K/MME-RealWorld/中文子集,12K FineVision 训练) 平均准确率 (%) 77.44 基线 Qwen3.5-4B 70.68;特权监督最强 Vision-OPD 77.07 +6.76,同时超过 Qwen3-VL-235B(75.75)与 GPT-5.4(72.77)
V*Bench(高分辨率小目标定位感知) 准确率 (%) 91.48 Qwen3.5-4B 基线 84.29 +7.19
九基准平均(六感知+三数学,Vision-OPD-6K 公平对比,4B) 平均准确率 (%) 75.33 TTRL 73.30(自奖励 RL 最强);Vision-OPD 74.77(特权监督) +2.03 / +0.56,无特权信息下全场最佳
MathVista(数学推理,4B) 准确率 (%) 81.50 基线 75.80;特权方法 ZwZ-4B 71.80 +5.70,且感知方法普遍伤数学的规律被打破
九基准平均(同设置,9B) 平均准确率 (%) 76.35 Intuitor 75.65;Vision-OPD 76.56 +0.70 / −0.21,与 Vision-OPD 并列前二

局限与改进

作者承认的局限:受算力限制,增强空间分析在 2048 token 贪心解码协议下进行(表 4-6 的数字略低于表 3 的 4096 token 协议),且每个配置都是一次完整训练,搜索粒度有限。我自己的观察:其一,增强设计强依赖'退化后问题仍可回答'这一语义约束,裁剪族已经暴露失效风险(强裁剪 67.44%),但目前只能靠穷举训练来判断算子是否任务一致,缺乏先验判据;其二,冻结教师即可获得 93% 的收益,说明'蒸馏'框架可能有一定包装成分,本质更接近视图不对称正则化,EMA 带来的额外显存与前向开销性价比存疑;其三,实验局限于 Qwen3.5-4B/9B 与自然图像 VQA 类基准,对文档、视频或纯文本推理任务的迁移未验证;其四,训练仅一个 epoch(130 步),更长训练下 EMA 教师与学生互动的稳定性、以及增强落差是否会随学生适应而衰减,均是未知数。

独立分析的弱点

弱点一:增强策略需要按模态人工设计,信息削减类算子(下采样、模糊、噪声)在图像上很自然,但文本、音频或动作序列的对应物尚未探索,可扩展性受限——改进方向是把算子选择建模为可学习策略,或用信息论代理指标(如互信息下降量)自动筛选算子。弱点二:最优强度范围(如 0.3–0.6 倍缩放)与峰值落差(JSD≈0.014)来自网格搜索,换模型或任务需要重跑大量完整训练——可引入训练中自适应课程,用实时测量的 token 级落差动态调节增强强度,把落差维持在峰值附近。弱点三:EMA 教师贡献甚微(冻结仅差 0.40%)却增加一份模型显存与前向计算,推理端还需维护两份分布——可考虑低频快照或干脆采用固定教师以节省资源。弱点四:收益集中在感知密集型基准,MathVision 在 4B 上几乎持平(65.26→65.13),说明方法对知识型、推理型误差帮助有限,更适合与推理侧增强手段互补组合而非单独包打天下。

未来方向

作者提出的方向:把'从学生端减信息构造不对称'的原则推广到更多模态与任务形态(视频时序降质、文本信息删除、音频降采样),以及与特权监督方法互补融合。我的延伸:其一,自适应/学习式增强策略——用当前落差信号在线调节强度,形成课程式蒸馏,自动找到每个任务自己的 JSD 峰值点;其二,理论刻画'落差幅度—学习信号'的定量关系,解释 0.014 这个峰值是否具有跨模型普适性;其三,下采样学生视图会同时减少 rollout 与前向的视觉 token 数量,可系统研究精度-效率曲线上的最优操作点,把免费信号与免费算力合并成卖点;其四,与自奖励 RL 结合,用视图落差对感知关键 token 加权,兼顾 TTRL 类方法的推理收益与本文的感知收益;其五,把同一思想迁移到 LLM 的上下文蒸馏(教师看完整上下文、学生看遮蔽上下文),检验其在纯语言域是否成立。

复现评估

复现条件较清晰:论文给出完整超参(batch 96 prompt、每 prompt 8 条 rollout、学习率 $2\times10^{-6}$、10 步预热、EMA $\eta=0.05$、prompt 8192/回复 1024 token、vLLM 推理),默认配方只有两个算子——下采样到 0.3–0.6 倍(不缩回)加 DDPM $t=200$ 高斯噪声,实现难度低。数据全部公开:FineVision 12K 子集与 Vision-OPD-6K 均为公开数据集,六个感知基准与三个数学基准开源,评测协议(贪婪解码 4096 token、近精确匹配 + Qwen2.5-72B 仲裁)写得足够细。项目网站 https://williamium3000.github.io/s2vopd 存在,但文中未明确承诺开源训练代码,是复现最大不确定项。算力上需支持 VLM on-policy rollout 的多卡训练(4B/9B、每步 768 条 rollout),估计数十张 A100/H100 级别;复现主表难度中等偏高,但复现单族增强的定性结论(如无增强自蒸馏退化)所需算力小得多。