OracleZoom:策略自蒸馏启发的参考约束递归图像超分辨率 OracleZoom: On-Policy Self-Distillation Inspired Reference-Constrained Recursive Image Super Resolution
以最后可用真值为跨尺度参考约束递归超分训练,无真值深尺度幻觉降低2–5倍且质量达SOTA
前置知识
递归超分辨率(Recursive SR / Chain-of-Zoom)
将固定倍率(如4×)超分模型反复应用于自身输出:每步用缩放算子从上一级预测中选出要放大的区域,再由多尺度VLM对比观察生成文本提示引导SR模型生成,等效于对图像连续数字变焦。CoZ借此将放大倍率推到256×。
本文研究的正是这种递归过程超出真值可用范围后,如何继续训练并约束模型而不失控。
在线策略自蒸馏(On-Policy Self-Distillation, OPSD)
让模型在自己的生成轨迹上训练,而不是在固定的教师输出上训练,同时利用仅训练期可得的“特权信息”(本文中是真值图像)监督这些轨迹,从而消除训练输入与推理输入的分布失配,思想可追溯到scheduled sampling与DAGGER。
OracleZoom直接沿用该思想:训练时沿自身递归预测链前向并反向传播,使深尺度损失也能更新早期预测。
一步潜空间扩散超分(OSEDiff + SD3)
以Stable Diffusion 3 (SD3-medium)为骨干的真实世界超分模型,在VAE潜空间一步完成去噪式重建,推理快且保留生成式细节合成能力。CoZ即用它作为共享SR骨干。
本文冻结该骨干、VAE解码器和VLM提示器,只在SD3 transformer上训练7.1M参数的LoRA,所有潜空间正则(KL先验、EMA)都定义在这个潜空间上。
LoRA 低秩适配
在预训练权重旁增加低秩分支 $W+\frac{\alpha}{r}BA$($r\ll d$),只训练极小参数量即可适配大模型。本文设置 rank-16、$\alpha=32$、作用于to_q/to_k/to_v与add_*_proj,共7.1M可训练参数。
理解“只训适配器、骨干全冻结”的训练设置,以及合并LoRA后推理延迟几乎不增的结论。
KL散度约束的潜空间先验
将适配后与冻结基座的潜码建模为高斯 $\rho_\theta^j=\mathcal{N}(z_\theta^j,\sigma^2I)$ 与 $\rho_0^j=\mathcal{N}(z_0^j,\sigma^2I)$;共享各向同性协方差时KL散度退化为潜空间MSE(差常数 $d/2\sigma^2$),约束质量优化不得使分布漂移。
这是防止“质量分高但内容幻觉”的关键正则项,并支撑命题1中质量偏差的Lipschitz上界。
EMA(指数移动平均)一致性
维护参数滑动平均 $\bar\theta\leftarrow\mu\bar\theta+(1-\mu)\theta$(本文 $\mu=0.95$),EMA参数不接收梯度、变化更平缓,其输出可作为稳定的一致性目标(类似Mean Teacher)。
五项训练损失之一:在监督边界 $s_m$ 处用EMA潜码约束当前模型,稳定直接监督消失瞬间的训练。
无参考图像质量评估(NR-IQA)
不需要参考图的感知质量打分器,如NIQE(越低越好)、MUSIQ、MANIQA、CLIPIQA(越高越好)。本文训练时用冻结的TOPIQ-NR作为可微质量奖励 $Q(\cdot)$,评测时用上述指标衡量无真值尺度的质量。
深尺度没有真值时,NR-IQA是唯一的细节质量引导信号,也是主要评测手段;其选择直接改变生成风格。
感知保真指标 LPIPS / DISTS 与投影版 P-DISTS
基于深度特征的图像相似度,越低表示越接近参考;DISTS对纹理漂移更鲁棒。P-DISTS是论文提出的投影变体:把16×预测下采样回4×分辨率,再与对齐的真值区域比较。
论文核心主张“质量提升不以保真为代价”正是由4×的LPIPS/DISTS和16×的P-DISTS等指标支撑。
研究动机
递归超分把模型预测不断喂回自身以实现极端放大(CoZ可到256×),但获得监督真值的代价随倍率几何级数增长:对512×512输入连续做4×放大,4×、16×、64×、256×各级目标分别需要 $2048^2$、$8192^2$、$32768^2$、$131072^2$ 像素的源区域,一张未压缩的 $131072\times131072$ RGB图像约需52 GB存储,深尺度监督事实上不可行。因此真值通常只在最初一两个尺度(如4×)可得,更深的合成细节没有任何视觉目标可验证;VLM生成的文字提示只能提供语义引导,无法校验合成纹理是否与可见图像一致。结果是模型在监督边界之外进入近乎无约束的生成状态:实验显示CoZ在64×/256×的幻觉率分别升到0.55和0.70,并出现重复纹理、材质被拉成条纹等系统性退化。
本文的目标是构建一个在真值仅到4×可得时、仍能安全训练至16×→64×→256×完整递归链的框架,并满足三个子目标:其一,在监督范围内不牺牲对真值的保真(4×的LPIPS/DISTS不劣于基线);其二,在监督边界之外把“还能验证的内容”与“无法确定的细节”显式分开——前者用最后一次可见真值 $I_m^{gt}$ 作跨尺度参考加以约束,后者由冻结的无参考质量模型引导细节合成;其三,用KL约束的预训练SR先验和EMA一致性限制质量优化导致的分布漂移。最终目标是在七个数据集、四个倍率上取得SOTA感知质量的同时,把深尺度幻觉率降低2–5倍,且不增加任何推理开销。
与已有工作不同的是,此前工作要么像CoZ那样只靠多尺度VLM文本提示(加GRPO偏好对齐)引导每步缩放,要么用一般感知/质量目标做间接监督,均未利用一个关键观察:缩放算子链是确定性的,因此最后一次真值 $I_m^{gt}$ 中仍然包含后续每一步放大区域的可验证信息。本文的独特切入是把OPSD(在自身轨迹上训练+特权信息监督)引入递归SR,并提出“参考约束递归”:通过缩放路径定义对齐算子 $\mathcal{A}_{m\to j}$ 与投影算子 $\mathcal{P}_{j\to m}$,把深尺度预测拉回真值可观测的分辨率做跨尺度对齐,从而把无监督的深尺度合成转化为围绕可见证据与预训练先验的有约束优化。
核心方法
直觉上,深尺度预测中“缩放路径覆盖的区域”在最后一次真值 $I_m^{gt}$ 中仍可观察,因此可以验证;而投影后无法区分的细节(多个高分辨率图可投影到同一低分辨率观测)只能靠质量先验引导,但必须防止漂移。技术路线上,OracleZoom冻结OSEDiff(SD3-medium)骨干、VAE解码器和GRPO调优的Qwen2.5-VL-3B提示器,仅训练SD3 transformer上rank-16的LoRA(7.1M参数)。训练沿4×→16×递归链前向且保留计算图(on-policy):对 $i\le m$ 用解码空间LPIPS直接监督;对 $j>m$ 计算跨尺度一致性 $\mathcal{L}_{xscale}$($\hat I_j$ 经 $\mathcal{P}_{j\to m}$ 投影后与 $\mathcal{A}_{m\to j}(I_m^{gt})$ 对齐区域比LPIPS)、质量目标 $\mathcal{L}_{qual}=-Q(\hat I_j)$(冻结TOPIQ-NR)、以及KL潜先验 $\mathcal{L}_{prior}$(与冻结基座 $F_0$ 的潜MSE);在监督边界 $s_m$ 处再加EMA一致性 $\mathcal{L}_{ema}$。总损失 $\mathcal{L}=\mathcal{L}_{sup}+\lambda_{xscale}\mathcal{L}_{xscale}+\lambda_{qual}\mathcal{L}_{qual}+\lambda_{prior}\mathcal{L}_{prior}+\lambda_{ema}\mathcal{L}_{ema}$,权重分别为1.0/0.4/8.0/0.1。推理时只保留适配后的递归SR转换,参考、质量模型、KL与EMA分支全部丢弃,推理流程与CoZ完全相同。
核心创新是“把最后可用真值带过监督边界”。论文先证明两个观察:(1) 持久视觉参考——确定性缩放路径 $\mathcal{A}_{m\to j}=\mathcal{Z}_{\gamma_j}\circ\cdots\circ\mathcal{Z}_{\gamma_{m+1}}$ 从 $I_m^{gt}$ 中提取的区域,可与 $\mathcal{P}_{j\to m}(\hat I_j)$ 在同一分辨率直接比较,无需 $I_j^{gt}$;(2) 不可观测细节——对投影零空间中的任意扰动 $\delta$ 有 $\mathcal{P}_{j\to m}(X+\delta)=\mathcal{P}_{j\to m}(X)$,跨尺度约束管不到这些细节。据此方法把无目标尺度的合成拆成两部分:可验证部分用跨尺度LPIPS约束,不可验证部分用质量模型引导、KL先验兜底,并由命题1给出质量偏差上界 $|Q(\hat I_j)-Q(D(z_0^j))|\le L_q\sigma\sqrt{2\epsilon_{prior}/d}$。与CoZ的本质区别:CoZ在深尺度只有VLM文本引导与偏好对齐,丢掉了像素级视觉证据;本文让像素证据以参考约束的形式在训练中继续生效。
方法步骤详情
第一步,数据构建:从4KLSDB训练集129,484张候选中精选1,000张(短边≥2048像素、剔除最差10%质量、按caption内容分组均衡、DFN5B/SigLIP2过滤摄影内容、相似度+CLIP去近重复),另留2,000张验证。第二步,递归前向:给定 $I_0$,缩放算子 $\mathcal{Z}_{\gamma_i}$ 选择放大区域得 $I_i^{ini}$,VLM $G$ 对比上一级预测与当前输入生成提示 $p_i=G(\hat I_{i-1},I_i^{ini})$,SR模型输出潜码 $z_i^\theta=F_\theta(I_i^{ini},p_i)$,VAE解码得 $\hat I_i=D(z_i^\theta)$,全程保留计算图以便反向传播穿过整条链。第三步,计算损失:4×处 $\mathcal{L}_{sup}$ 用解码空间LPIPS(附录Table 7证明比潜空间MSE更好:LPIPS 0.171 vs 0.243);16×及以上计算 $\mathcal{L}_{xscale},\mathcal{L}_{qual},\mathcal{L}_{prior}$;在4×边界计算 $\mathcal{L}_{ema}=\mathrm{MSE}(z_m^\theta,z_m^{ema})$,其中 $z_m^{ema}$ 来自EMA适配器 $\bar\theta$ 且带stop-gradient。第四步,优化:AdamW,学习率 $5\times10^{-5}$、权重衰减 $10^{-2}$、500步线性warmup后恒定、有效batch 4(逐图累积)、fp32;EMA衰减0.95;每100步评估,patience 8、min-delta $10^{-3}$ 早停,约9.3k步收敛,单8×H100节点一天内训完。第五步,推理:仅用训好的LoRA配合冻结骨干/解码器/提示器执行与CoZ相同的4步递归到256×;将LoRA合并进骨干后SR阶段每步仅比CoZ多0.001s。
技术新颖性
技术新颖性体现在四个层面。第一,问题形式化创新:首次明确定义“递归SR监督鸿沟”,并把无目标尺度的合成解耦为可验证/不可验证两部分,给出了严格的信息论式论证(投影零空间分析)。第二,机制创新:跨尺度参考约束利用缩放路径的确定性,把对齐+投影作为训练专用算子(推理零开销),使像素级监督原则上可延伸到任意深尺度,这是对“无真值即无监督”假设的直接突破。第三,正则组合创新:把OPSD的on-policy反向传播(对齐训练-推理输入分布)与扩散SR中的分布正则结合——KL先验约束生成分布、EMA稳定监督边界,并用Lipschitz质量模型的假设证明了质量驱动的偏差是有界的,而非经验性堆损失。第四,工程极简:7.1M参数、1,000张训练图、单节点一天训练即达SOTA,且与标准知识蒸馏/自训练不同,基座 $F_0$ 不充当替代监督目标,质量模型 $Q$ 只评估当前预测,监督来源的语义与既有方法可清晰区分。
实验结果
在七个数据集(4KLSDB域内;DIV2K、DIV8K、DRealSR、RealSR、FFHQ、Flickr2K域外)和四个倍率(4/16/64/256×,统一512×512中心裁剪、相同CoZ递归路径与提示)上评测。(1) 聚合结果(Table 2):平均CLIPIQA 0.713全场最佳,MUSIQ 57.80、MANIQA 0.598、LPIPS 0.199、DISTS 0.160均第一,NIQE 6.90第二。(2) 4×真值保真:4KLSDB上LPIPS 0.169/DISTS 0.142、DIV8K上LPIPS 0.223/DISTS 0.161/DINOv2 0.930均第一,说明感知提升不以保真为代价;但DRealSR/RealSR上与CoZ互有胜负(如RealSR LPIPS 0.220 vs CoZ 0.193),真实退化域收益有限。(3) 深尺度质量:256×聚合CLIPIQA 0.706 vs CoZ 0.579、OSEDiff 0.532;FFHQ差距最大(0.771 vs 0.579,+0.192),所有数据集优势均超0.10,且距监督边界越远优势越大(4×域外仅+0.036~0.040)。(4) 16×投影参考保真:P-DISTS 0.215 vs CoZ 0.239,投影DINOv2相似度0.691 vs 0.633,说明深尺度预测更好保留了最后一次可见证据。(5) 锚定VLM裁判(跨家族InternVL3.5-38B,每尺度120例,Table 6):4×/16×胜率0.50/0.53持平,64×/256×分别0.68 [0.59,0.75]与0.78 [0.70,0.85];幻觉率从早期与CoZ相当降至64×的0.21和256×的0.14,CoZ则升至0.55/0.70,即幻觉少2–5倍。(6) 消融(Table 3):去 $\mathcal{L}_{sup}$ 使4× LPIPS 0.199→0.215;去 $\mathcal{L}_{xscale}$ 使P-DISTS 0.215→0.232;去 $\mathcal{L}_{qual}$ 使CLIPIQA 0.714→0.594;去 $\mathcal{L}_{prior}$ 则CLIPIQA虚高到0.794但P-DISTS恶化至0.330、幻觉0.303→0.907,证明先验是防“刷分式幻觉”的关键;去 $\mathcal{L}_{ema}$ 各指标轻微变差,定位为训练稳定器。(7) 效率(Table 5):每递归步1.505s vs CoZ 1.486s,合并LoRA后SR阶段差距缩至0.001s。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 递归SR 4×全参考保真(七测试集聚合) | LPIPS ↓ / DISTS ↓ | 0.199 / 0.160 | CoZ 0.215 / 0.170 | LPIPS降低7.4%,DISTS降低5.9%,且MUSIQ/MANIQA/CLIPIQA同步最佳 |
| 递归SR 4×保真(DIV8K,域外) | LPIPS ↓ / DISTS ↓ / DINOv2 ↑ | 0.223 / 0.161 / 0.930 | CoZ 0.238 / 0.166 / 0.910 | 三项保真指标全面领先 |
| 256×无参考质量(七测试集平均) | CLIPIQA ↑ | 0.706 | CoZ 0.579;OSEDiff 0.532;SwinIR 0.463 | 较CoZ +0.127(约+22%),FFHQ上优势最大达+0.192 |
| 16×投影参考保真 | P-DISTS ↓ / 投影DINOv2 ↑ | 0.215 / 0.691 | CoZ 0.239 / 0.633 | P-DISTS降低0.024,DINOv2相似度提高0.058 |
| 256×锚定成对忠实度判定(InternVL3.5-38B裁判) | 胜率(已判定比较,95% Wilson CI) | 0.78 [0.70, 0.85](91胜25负) | CoZ 0.22 | 领先56个百分点;64×为0.68 [0.59,0.75] |
| 幻觉率(锚定VLM判定) | 幻觉率 ↓ @64× / @256× | 0.21 / 0.14 | CoZ 0.55 / 0.70 | 幻觉减少约2.6–5倍 |
| 推理延迟(500张DIV2K,单张H100) | 每递归步耗时 | 1.505 s(LoRA合并后1.500 s) | CoZ 1.486 s | 仅+0.019 s,合并后SR阶段仅+0.001 s,训练期辅助分支零推理开销 |
局限与改进
作者承认的局限:其一,4×以上没有真值,无法度量精确恢复,只能用投影参考指标和锚定VLM裁判评估“与可见证据的一致性”而非正确性,输出可能看似合理但不可验证;其二,评测遵循合成中心裁剪递归,不能直接代表物理相机变焦或任意用户选区;其三,训练集是精选4K摄影图像,在DRealSR/RealSR上保真收益变小(如RealSR 4× LPIPS 0.220劣于CoZ的0.193),说明特定域退化仍具挑战;其四,方法依赖固定的无参考质量模型和预训练SR先验,两者都会偏置深尺度被鼓励的细节类型。我的补充观察:裁判与训练奖励存在代理指标风险——去掉 $\mathcal{L}_{prior}$ 后CLIPIQA反而升到0.794,说明这些无参考分数容易被对抗性“刷高”,论文虽排除了TOPIQ-NR本身参与主评测,但CLIPIQA/MUSIQ等同族指标仍可能被同向偏置;跨尺度一致性只约束缩放路径覆盖的中心区域,对路径外新增视野无监督(当前协议恰好回避了这一点);训练只在4×→16×两步递归上进行却推理到256×,更深链上的误差传播未被直接优化;VLM裁判的可靠性未做人工校验,68–78%的胜率可能包含裁判自身纹理偏好。
独立分析的弱点
第一,幻觉“降低”本质上衡量的是与低倍率锚的一致性,模型可能学会保守生成(少添细节)来压低幻觉率,从而牺牲深尺度本可合理推断的细节;改进方向是构建真实多分辨率采集的小规模真值集(显微、卫星、变焦相机连拍)做绝对正确性校验,并在裁判中区分“保守”与“忠实”。第二,无参考质量模型是单点依赖:Table 9显示换用HyperIQA使平均CLIPIQA降0.031并引入重复纹理,换Laplacian锐度则降0.100且丢失细结构,说明生成风格被奖励模型分布绑架;可改为多质量模型集成或按不确定性加权。第三,训练递归深度(2步)与推理(4步)不匹配,误差累积只在测试时出现;可引入课程式延长训练链或随机深度截断的BPTT变体。第四,参考对齐 $\mathcal{A}_{m\to j}$ 依赖确定性中心裁剪路径,用户自由选区时需重算且未验证;可把缩放算子改为可学习/可微并在训练中随机采样路径。第五,真实相机域增益有限,说明跨尺度一致性没有显式建模退化;可在投影比较前加入退化估计模块,使参考约束对模糊/噪声鲁棒。第六,命题1依赖质量模型局部Lipschitz的假设,实际神经质量模型在分布外可能违反,理论保证的实际约束力有限。
未来方向
作者在结论与局限中提出:扩展监督到退化模型、自适应缩放路径,以及构建更强的“参考感知”评测协议以支撑更深递归放大。基于本文成果可自然延伸的方向包括:(1) 把“最后可用参考约束”迁移到视频超分与自回归视频生成,让上一帧作为时间维度的可验证锚;(2) 结合不确定性量化,对深尺度不可验证区域输出置信度,实现“带置信度声明的极端变焦”,适配安全关键场景;(3) 将KL先验替换为更强的感知流形投影或与基座的特征级一致项,进一步压缩漂移空间;(4) 用GRPO类偏好优化直接以锚定裁判信号优化忠实度,与本文的梯度式约束互补;(5) 在医学影像(如OCT视网膜分层)、遥感等天然存在多分辨率真值的领域验证并利用真实深尺度监督;(6) 研究超过256×的更长递归链的误差传播规律与自动早停判据,以及裁判模型与生成模型解耦的评测基准。
复现评估
复现友好度较高但未声明开源代码。论文披露的实现细节非常完整:骨干为CoZ的OSEDiff(SD3-medium)、提示器为GRPO调优的Qwen2.5-VL-3B-Instruct、rank-16 LoRA($\alpha=32$,作用于to_q/to_k/to_v与add_*_proj,7.1M参数)且给出了Table 4的完整训练配置(AdamW $\beta_1=0.9,\beta_2=0.999$、lr $5\times10^{-5}$、wd $10^{-2}$、500步warmup、有效batch 4、EMA 0.95、损失权重1.0/0.4/8.0/0.1、seed 0、约9.3k步早停);数据侧给出4KLSDB精选1,000张的全部清洗规则;评测协议完全对齐CoZ并公布InternVL3.5-38B裁判的原始rubric(图7/8)与120例/尺度的判定统计。所有组件(SD3、Qwen2.5-VL、TOPIQ-NR、七个数据集)均公开,训练仅需单8×H100节点不到一天,推理在单卡H100上每步约1.5秒。主要复现风险在于:数据精选管线(DFN5B/SigLIP2过滤、内容分组均衡、去重)的细节未完全量化,裁判prompt与解析逻辑的工程对齐,以及TOPIQ-NR作为可微奖励接入训练的实现细节。综合评估:中等难度,若有代码发布则属低-中难度。
论文图表
首图对比:512×512输入经连续4×放大到256×时所需源分辨率指数增长(一个131072×131072图像约52 GB),监督在4×后即断供;CoZ在深尺度继续裸奔生成,而OracleZoom以最后一次真值为参考、经跨尺度对齐与KL约束先验继续递归,幻觉减少2–5倍。
一图讲清论文动机(监督鸿沟)与核心卖点(带参考的递归),是理解全文问题设定的入口。