← 返回 2026-09-11

Mi-Ripple:修复迭代AI编辑造成的图像退化 Mi-Ripple: Restoring Images Degraded by Iterative AI Editing

Jiayin Chen, Yicheng Xu, Muting Wang 📅 2026-09-10 👍 37 2026-09-12 18:30
AI生成图像 伪影修复 图像恢复 迭代编辑 频域分析

诊断引导的三阶段工作流,区分可滤波的周期伪影与内容纠缠纹理,修复迭代AI编辑的数字波纹

前置知识

参考条件迭代图像编辑

把一张已有图像和文本指令一起喂给编辑模型,输出修改后的图;若把每次输出再当作下一次的参考输入,就形成 gen0→gen4 这样的编辑链。它便于增量修改并保持视觉身份,但上一代的伪影会随参考图传播到下一代。

本文研究的问题正是这种迭代复用造成的'数字波纹'伪影,理解链式生成机制才能理解伪影为何累积、为何可以通过清理参考图来阻断。

CIELAB L* 亮度空间

CIELAB 是感知均匀的颜色空间,L* 分量表示感知亮度(0–100)。在 L* 上测量残差标准差(SD)意味着'1 个单位'接近人眼可感知的最小亮度差,比 RGB 空间中的数值更有物理含义。

论文所有失真指标(整图残差 SD 0.08–0.44、结构窗口 SD≤0.6)都以 L* 单位报告,不懂这个空间就无法判断这些数字对应的视觉损伤有多小。

傅里叶幅度谱与谱异常

对图像补丁做 2D 傅里叶变换取幅度谱并取对数,周期性纹理会表现为孤立的能量峰。谱异常 $A(u,v) = S(u,v) - B(r)$ 把每个频率点的对数幅度 $S$ 减去同半径 $r$ 处的中位数基线 $B(r)$,峰越高说明越偏离自然图像的径向衰减规律。

谱异常是论文诊断格点伪影的核心探针:照片对照中位数约 1.73,而生成源达 4.13–4.61;陷波滤波也直接作用于这个谱。

陷波滤波

经典的周期噪声去除方法:在频域中找到噪声对应的窄带位置,只对这几个频率 bin 做衰减,其余频谱不动。本文的版本是 $\hat{F} = F \exp[-G_{1.5}(KE)]$,对诊断出的孤立峰按超出量 $E$ 做高斯羽化的指数衰减,保持相位不变。

这是本文处理'谱可分离'伪影的主要工具,理解它才能理解为什么格点伪影能在近乎无损(残差 SD<0.5)的前提下被移除。

自相关与周期检测

把图像与自身平移副本做相关运算,周期为 $p$ 的纹理会在位移 $p$ 处出现相关峰。对高通滤波后的亮度图做窗功率谱归一化自相关,可以估计伪影的周期向量(水平/垂直位移),并能区分重复周期一致的格点与位移不一致的颗粒。

周期向量是格点伪影的指纹,也是论文分析 Banana100 七个模型家族(如 Qwen 的 6 像素水平周期)外部证据的测量基础。

研究动机

迭代式参考条件图像编辑——把上一次输出作为下一次编辑的输入——虽然方便增量修改,却会让不想要的纹理随参考链传播。在原生分辨率下,受影响图像出现网格、蜂窝状图案或颗粒状表面,作者统称为'数字波纹'(digital ripple),这类伪影在缩略图里不显眼,容易混入正式资产。已有研究要么用频谱差异来检测合成图像(如 Frank、Dzanic、Corvi 等),要么从架构层面解释伪影成因(上采样、混叠、去卷积棋盘效应),但都停留在'判断图像是否为 AI 生成',没有回答更实际的修复问题:一张已有可见伪影的图,能否在不破坏合法细节的前提下被清理。Banana100 数据集的百次递归复制实验进一步表明,递归退化会击穿无参考图像质量评估。本文实测显示伪影高度依赖访问配置:Channel B 的 43/43 个输出格点阳性,Channel A 在 1280×720 下 20/20 阴性、但在 1536×1024 下 6/6 阳性——厂商名称本身无法预测伪影是否出现。

本文的目标是目标是把可见伪影恢复为干净的表面与连贯细节,同时保护合法纹理不被擦除。具体分解为三个决策:第一,用互补的谱探针和空间探针诊断伪影类型,区分谱上可分离的周期格点伪影与内容纠缠的颗粒纹理;第二,格点伪影走选择性谱陷波加结构感知平滑,保持像素对齐达到交付级质量;颗粒纹理则先做参考级清理(允许更强压制、明确保护人脸),再从清理后的参考图重新生成;第三,用与被优化分数无关的图像差异指标验证候选,并记录全部观察、许可动作、决策与验证结果,形成可审计的修复流程。作者强调要把'可测量的伪影下降'与'肉眼可见的更干净'绑定,而不是把谱分数本身当作优化终点。

与已有工作不同的是,本文的独特切入是把频率分析从'检测器'改造为'治疗指南':谱异常不再用于给整图贴'合成'标签,而是用来定位可处理的谱分量并决定处理路径。相比 Alias-free GAN 等在架构上消除采样伪影的工作,本文的设定是生成模型权重完全固定、无法修改,递归只通过推理期的参考图发生,属于推理期污染的事后修复。相比 Banana100 关注递归复制让 NR-IQA 指标失效,本文分析其补充的 more_models 序列,把'持续周期性'与'强度累积'分开报告(例如 Qwen 十步保持 6 像素周期但强度不增)。相比经典陷波滤波只做频率切除,本文加入二维局部基线的孤立峰选择(避免误切方向性内容形成的谱脊)和滤波后的对齐残差验证,并把'交付级滤波'与'参考级清理'区分为两种不同强度预算的操作,这是现有伪影文献中缺失的工程化区分。

核心方法

整体思路先直觉后技术:周期性格点伪影在傅里叶幅度谱上表现为孤立峰,理论上只需削掉这几个峰,其余像素不动;颗粒纹理没有孤立峰可供陷波,只能局部带阻,或者换一张干净的参考图重新生成。为此作者设计了三阶段工作流:诊断→滤波或再生成→验证。所有测量在 CIELAB L*(0–100)上进行。谱异常定义为 $A(u,v) = S(u,v) - B(r)$,其中 $S = \log(1 + |\mathcal{F}[(P-\bar{P})w]|)$ 是 Hann 窗加窗补丁的对数幅度谱,$B(r)$ 是半径 $r$ 处对数幅度的中位数基线;整图格点探针改用 21×21 局部谱中位数,要求至少两个保留分量且最大超出 ≥2.5。选择性陷波按 $\hat{F} = F\exp[-G_{1.5}(KE)]$ 衰减诊断峰,其中 $K$ 为保留分量、$E$ 为超出量、$G_{1.5}$ 为 1.5 bin 的高斯羽化,操作只改幅度、保持相位、默认不动色度。验证不看被滤波优化的异常分数,而看独立的失真指标:结构窗口残差 SD ≤ 0.6 亮度单位、高频保留 ≥ 90%、整图残差 SD ≤ 1.0。

核心创新是把'伪影是否与内容谱上纠缠'作为修复路由的决策变量,而不是把谱分数本身当优化目标。格点伪影谱上孤立,选择性陷波可以在整图残差 SD 0.08–0.44 的失真内将其移除并保持像素对齐;颗粒伪影与毛发、树叶等合法纹理纠缠,滤波必然破坏结构,因此改走参考级清理加再生成,并把再生成产物当作'可能发明细节的新候选'重新诊断,而不是与原图做像素对齐比较。与对照方法径向基线软裁剪(对所有超过径向中位数的大偏差一律压制)相比,选择性陷波把超过 85% 的去除能量集中在谱半径最低的四分之一,几乎不碰图像其余部分。这套'诊断决定治疗'的逻辑还延伸到流程治理:规则路由是默认实现,可选的语言模型层只允许在许可动作中选择、无权修改数值阈值;再生成需要显式许可和有界重试次数;同场景递归被明确建议避免。

方法步骤详情

第一步诊断。格点探针:384 像素平坦补丁或整图上计算谱异常 $A(u,v)=S(u,v)-B(r)$,21×21 局部中位数基线下保留超出 1.2、半径 24 之外、支撑 ≤80 个频率 bin 的连通分量,阳性需 ≥2 个分量且最大超出 ≥2.5;再用自相关估计周期向量,格点周期可重复,颗粒只在 9–20 像素半径出现低于 0.05 的不一致弱峰。颗粒探针:96 像素窗需带通 SD≥0.35、超额峰度≤8、斑点覆盖≥19%、各向异性≤0.35;整帧补 128 像素 tile(步长 64)的 scale index,<2% 记 none、[2%,6%) 记 suspected、≥6% 记 structured。第二步处理。格点做式(2)陷波 $\hat{F}=F\exp[-G_{1.5}(KE)]$,反射填充抑制边界效应、不动色度;颗粒在非结构区用结构许可掩码做严格带阻,交付级边界为边强 0.8–2.5、一致度 0.15–0.45、纹理密度 1.8–4.0,参考级放宽到 1.5–4.0、0.35–0.70、5–10 并加 ±10 像素方向平均;人脸框扩大 25% 并羽化 10 像素保护。第三步验证。结构窗口残差 SD≤0.6,高频保留 $100\,\mathrm{SD}(H_{out})/\mathrm{SD}(H_{in})\geq 90\%$($H=L-G_1L$),平坦窗带通 SD 增幅≤0.02,整图残差 SD≤1.0;每次执行记录观察、许可动作、决策与验证结果。

技术新颖性

与频谱检测类工作(Frank、Dzanic、Corvi 等)的本质区别是用途反转:他们把谱差异当分类特征判别整图是否合成,本文用同类信号定位'可治疗的谱分量'并据此路由。与 Alias-free GAN、亚像素卷积等架构级修复的区别在设定:通道是黑盒商业 API,无权重、无种子、无采样参数,唯一可干预的是输入参考图和输出成品。与经典陷波滤波(Gonzalez & Woods)的区别是加入了二维局部基线峰选择(紧凑峰选择避免方向性内容的长谱脊被误切)以及滤波后的对齐残差验证。与 Banana100 的区别是把递归退化研究从'指标失效'推进到'图像可修复性':描述性递归 $R_n = I + \alpha R_{n-1}$(不动点 $I/(1-\alpha)$)在本文中成为避免同场景递归的操作依据。工程上的新颖点还有:把 regenerate 显式建模为可能改变内容的新候选、区分交付级与参考级两套掩码边界、以及用 LLM 层只在许可动作集内做路由而不触碰数值阈值。

Native crops and difference-of-Gaussians (DoG) views of a lattice-positive candidate and a granular region.
Figure 2: Native crops and difference-of-Gaussians (DoG) views of a lattice-positive candidate and a granular region.

实验结果

伪影真实且依赖配置:384 像素补丁谱调查中照片中位数异常 1.73、网络参考图 1.95,三个生成源为 4.61、4.17、4.13;Channel B 全部 43/43 格点阳性,Channel A 在 1280×720 下 20/20 阴性、1536×1024 下 6/6 阳性。参考清理有效:配对实验输出碎屑密度从 1,842 降到 1,020/百万像素(−45%),密苔藓 scale index 从 35.3% 降到 15.8%;结构感知清理使 sea 带通 SD 1.05→0.87、railing 2.61→1.77,但 sky 0.20→0.25,效果区域依赖。选择性陷波失真极小:garden-tilt 案例掩码仅覆盖 0.11% 频率 bin,背景补丁异常 3.49→1.77,整图残差 SD 0.18;十四次 notch-only 执行整图残差 SD 0.08–0.44;六个人像候选全部检出格点并通过失真检查(SD 0.21–0.49,高频保留 98.9–99.8%),六个 hair 约束候选 SD 0.25–0.44。跨版本八场景中恢复路径把 6/8 个 gen4 端点降到 none 级:moss 25.3%→11.1%、wisteria 41.1%→12.1%、ice cave 20.0%→0.0%。提示词约束不可靠:叶片约束 8 对中 5 升 3 降,P/N/Q 平均差 +3.3/−1.3/−0.3 个百分点(符号检验 p=0.29/0.73/0.73),同条件重复调用中位极差 8.4 个百分点。Banana100 分析:Qwen 全部 10 步保持 (6,0) 水平周期,Grok (0,5) 出现 9–10/10 步且 ρ=0.89–0.99,GPT 峰高仅 0.06–0.16 为弱周期,五个家族有持续/晚期周期、四个强度随步数上升。

Representative measurements and treatments for artifact characterization. Values use the stated measurement convention.
Table 1: Representative measurements and treatments for artifact characterization. Values use the stated measurement convention.
Spectral-anomaly survey under the same 384-pixel patch convention. Photographs have three valid images out of four; Chelsea has no qualifying patch.
Table 2: Spectral-anomaly survey under the same 384-pixel patch convention. Photographs have three valid images out of four; Chelsea has no qualifying patch.
Native-resolution scale-tile percentages over five same-scene outputs on Channel B. Mixed-resolution trajectories are descriptive; canvas dimensions are specified below.
Table 3: Native-resolution scale-tile percentages over five same-scene outputs on Channel B. Mixed-resolution trajectories are descriptive; canvas dimensions are specified below.
Cross-version scale-tile percentages. Each trajectory lists gen0 through gen4; repair is the archived processed endpoint. All readings use the same canonical canvas convention. One chain per scene and version.
Table 4: Cross-version scale-tile percentages. Each trajectory lists gen0 through gen4; repair is the archived processed endpoint. All readings use the same canonical canvas convention. One chain per scene and version.
Native-window periodicity in eleven Banana100 sequences. Period vectors are given as absolute horizontal and vertical displacements. Counts are out of ten steps.
Table 5: Native-window periodicity in eleven Banana100 sequences. Period vectors are given as absolute horizontal and vertical displacements. Counts are out of ten steps.
Scale-tile percentages at 1280×720. An asterisk marks a Lanczos-normalized output; native readings are supplied in Table 7. Full denotes the complete foliage constraint; P, N, Q denote its noun, property, and negation parts.
Table 6: Scale-tile percentages at 1280×720. An asterisk marks a Lanczos-normalized output; native readings are supplied in Table 7. Full denotes the complete foliage constraint; P, N, Q denote its noun, property, and negation parts.
Native scale indices for the normalized entries in Table 6. Dashes indicate that the common-canvas value is already native. Moss 1 gen0 is 0.9% natively.
Table 7: Native scale indices for the normalized entries in Table 6. Dashes indicate that the common-canvas value is already native. Moss 1 gen0 is 0.9% natively.
Restoring GPT-image-2.5 gen4 outputs with reference cleaning, one regeneration per scene, and final notching. Normalized scale-tile percentages decrease from 25.3% to 11.1% in moss gorge (H), 41.1% to 12.1% in wisteria tunnel (W), and 20.0% to 0.0% in ice cave (K).
Figure 1: Restoring GPT-image-2.5 gen4 outputs with reference cleaning, one regeneration per scene, and final notching. Normalized scale-tile percentages decrease from 25.3% to 11.1% in moss gorge (H), 41.1% to 12.1% in wisteria tunnel (W), and 20.0% to 0.0% in ice cave (K).
GPT-image-2.5 gen4 face close-up and the Mi-Ripple output. The comparison illustrates the visual change after reference cleaning, regeneration and final notching.
Figure 3: GPT-image-2.5 gen4 face close-up and the Mi-Ripple output. The comparison illustrates the visual change after reference cleaning, regeneration and final notching.
Input windows, selective notch outputs and radial soft-clipping outputs for matched skin, eyes and foliage regions.
Figure 4: Input windows, selective notch outputs and radial soft-clipping outputs for matched skin, eyes and foliage regions.
Amplified signed residuals for selective notching and radial soft clipping on the matched regions. Gray denotes zero change; residuals are shown with six-fold amplification.
Figure 5: Amplified signed residuals for selective notching and radial soft clipping on the matched regions. Gray denotes zero change; residuals are shown with six-fold amplification.
查看结构化数据
任务指标本文基线提升
格点伪影陷波(整图失真) 整图残差 SD(CIELAB L* 单位) 0.08–0.44(十四次 notch-only 执行) 径向基线软裁剪:匹配平坦窗残差 SD 1.66–2.78 残差低约一个数量级,且高频保留 98.9–99.8%(要求 ≥90%)
清理参考图后再生成的输出质量 碎屑密度(Canny 组件/百万像素) 1,020 未清理参考:1,842 降低 45%
颗粒纹理抑制(跨版本八场景 gen4 端点) scale index(合格 128px tile 百分比) moss 25.3%→11.1%;wisteria 41.1%→12.1%;ice cave 20.0%→0.0% 未处理的 Image 2.5 gen4 端点 8 个场景中 6 个降至 none 级(<2%)
伪影诊断区分度 谱异常中位数(384px 平坦补丁) 生成源 4.13–4.61 照片对照 1.73、网络参考图 1.95 生成源约为真实图像对照的 2.2–2.7 倍,可作为格点诊断信号
局部颗粒抑制(掩码带阻) 带通 SD(天空/海面区域) sky 0.38→0.18;sea 1.21→0.71 处理前退化样本 47–53% 下降,同时掩码保护头发与面部结构

局限与改进

作者承认:研究特定阈值需要更大范围校准;混合通道、混合画布的链无法隔离因果编辑效应;单次抽取(single-draw)比较只展示修复路线而非总体平均收益;再生成会改变细节,星形工作流的质量优势未被 benchmark;通过失真检查只说明测量失真在限内,不等于纹理、身份或语义保真被独立认证;漏检人脸仍是操作风险。我的补充观察:其一,十四次 notch-only 执行复用同一候选而非十四张独立图,样本有效性偏弱;其二,face 和 beach 链的 scale index 全程 0.0%,说明探针对某些退化形态(如面部细节劣化)不敏感,作者也承认零 tile 不等于无需修复;其三,一张照片因 JPEG 块效应谱异常达 3.12,接近生成源区间,探针特异性有限;其四,再生成路径没有像素级 ground truth,'锐度 3.18→4.34'只能描述性解读,一例还引入了颜色偏移;其五,结论建立在 GPT 系通道的抽样访问条件加 Banana100 二手数据上,跨厂商普适性未知。

独立分析的弱点

弱点一:统计功效不足。八场景每格只有一条链、提示词实验仅 8 对且共享对照,而同条件重复调用的中位极差达 8.4 个百分点、最大 23.6,足以淹没处理效应。改进方向:每条件至少 10 条独立链并做多重比较校正,报告置信区间。弱点二:探针依赖大量手工阈值(超出 1.2/2.5、tile 覆盖 19%、带通 SD 0.35、各向异性 0.35 等),校准集只有 14 个标注窗口。改进方向:在更大标注集上自动搜索阈值并报告 ROC。弱点三:修复质量评估缺少感知维度,scale index 下降不等于更好看(H 链中带相对对比更低但单位直径相当),一例清理后还出现颜色偏移。改进方向:补充配对人工评估或 LLM 评审,并把色差 $\Delta E$ 纳入验收。弱点四:可选的语言模型决策层从未与纯规则路由对照,价值未量化。改进方向:在边界案例集上 A/B 比较两种路由。弱点五:陷波依赖'孤立峰'前提,格点与合法周期纹理(织物、砖墙)共存时的路由策略未讨论。

未来方向

作者提出:星形工作流(每次从同一干净参考出发,切断对上一输出的直接依赖)的质量优势需要正式 benchmark;匹配通道、匹配分辨率的因子实验(当前场景变化与通道变化混杂)有待进行;需要独立标注的图像来建立治疗成功率;研究特定阈值需要更广校准。基于成果可延伸的方向:其一,把描述性递归 $R_n = I + \alpha R_{n-1}$($0 \leq \alpha < 1$,不动点 $I/(1-\alpha)$)从描述升级为在线估计的累积预警器,在编辑链中预测伪影到达可感知阈值的时间点,自动建议何时换参考;其二,建立跨厂商的周期指纹库,结合水印检测(如 Tree-Ring、Stable Signature 的周期信号)判定格点来自合成、缩放还是投递链路;其三,把参考级清理做成发布前标准步骤,用大规模 A/B 验证'清理参考→再生成'在真实创作工作流中的收益;其四,把探针扩展到视频帧序列,研究数字波纹的时域累积与传播;其五,用扩散模型的中间噪声预测替代黑盒再生成,实现可控的内容保真修复。

复现评估

开源情况:论文称测量与处理模块(诊断、scale 索引、notching、掩码抑制、参考清理、再生成、验证、编排)位于仓库的 visual-canon scripts 目录,实验记录、提示词、sidecar、trace 保留在 figure process archive;但在线编译包只含手稿图,不含完整实验档案。归档报告含十九项合成与协议测试(已知格点/颗粒输入、干净梯度、无平坦窗案例、失真上限、mock 客户端再生成),不过作者明确这些是软件检查而非检测器精度的独立验证。数据方面:Banana100 为公开数据集(CC BY-NC-SA 4.0,2026-09-06 快照),其分析部分可复现;但 Channel B 由作者机构运营,第三方拿不到相同 API 访问条件,商业通道无权重、无种子、无采样参数,同提示重复调用的中位极差达 8.4 个百分点,精确复现单张修复不可能。综合评估:算法与测量代码开源、协议在附录 A–E 详述,测量部分复现难度中等(需自备图像与编辑通道),完整实验复现难度高;算力需求极低,全部计算是经典信号处理,无需 GPU 训练。