← 返回 2026-08-19

EditBridge:面向忠实且高效的超高分辨率图像编辑 EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang 📅 2026-08-18 👍 22 2026-08-24 18:30
DiT 图像编辑 扩散桥 稀疏注意力 超分辨率 超高分辨率

扩散桥加先验引导稀疏注意力,让图像编辑忠实高效地冲上4K

前置知识

扩散桥(Diffusion Bridge / Brownian Bridge)

标准扩散模型学习从高斯噪声到数据分布的生成路径,而扩散桥建模两个数据分布之间的随机转移路径。给定配对端点 $(x_0, x_1)$,中间状态满足 $X_t | (x_0, x_1) \sim \mathcal{N}((1-t)x_0 + t x_1, t(1-t)I)$,即一个带噪插值,噪声水平在 $t=0.5$ 时最大、在两端为零。网络用速度匹配目标学习瞬时速度场 $u_t(X_t|x_0,x_1) = \frac{x_1 - X_t}{1-t}$。

本文的核心公式化就是扩散桥:把低分辨率编辑结果到高分辨率输出的精修过程建模为数据到数据的转移,而非从噪声重新生成,这是理解全文设计的基石。

DiT(Diffusion Transformer)

以 Transformer 为骨干的扩散模型架构,用自注意力机制建模图像 token 之间的依赖关系,取代早期 U-Net 的卷积设计。DiT 的注意力擅长捕捉长程依赖,已成为图像生成与编辑的主流骨干(如 Qwen-Image-Edit 等统一编辑基础模型)。代价是注意力对序列长度 $N$ 的计算复杂度为 $O(N^2)$,分辨率升高时 token 数平方级增长,导致显存与延迟瓶颈。

EditBridge 直接构建在 DiT 骨干(Qwen-Image-Edit)之上,其效率问题与稀疏注意力方案都源于 DiT 的全局注意力结构。

稀疏注意力(Sparse Attention)

为规避全注意力 $O(N^2)$ 的开销,稀疏注意力让每个 query 只与一个稀疏子集的 key 交互。常见策略包括局部窗口、块级稀疏(如 VMoBA)或基于检索的 token 选择。若每个 query 只关注 $k \times k$ 的局部窗口,复杂度可从 $O(N^2)$ 降到 $O(N \cdot k^2)$,在高分辨率场景收益巨大。

本文提出的 PG-BSA 就是一种任务定制的块级稀疏注意力,用语义对应先验决定每个目标 token 应该关注源图像的哪些块,是效率提升的关键。

LoRA(Low-Rank Adaptation)

一种参数高效微调方法:冻结预训练权重,为每个线性层注入低秩分解矩阵 $\Delta W = BA$(秩 $r \ll d$),只训练 $B$ 和 $A$。训练量小、显存占用低,同时能保留基础模型的大部分能力,常用于扩散模型的可控精调。

EditBridge 在 Qwen-Image-Edit 的所有线性层上加 LoRA($r=128$, $\alpha=128$)训练桥模型,了解 LoRA 才能理解其训练配置与算力需求。

研究动机

高分辨率图像编辑在专业工作流中需求旺盛,但受限于注意力机制的二次复杂度 $O(N^2)$ 和巨大的显存需求,现有基于扩散的编辑模型(如基于 DiT 的各类编辑基础模型)推理分辨率基本被限制在 1K(1024×1024)以下。为了拿到更高分辨率的输出,业界普遍采用两阶段流水线:先在低分辨率上执行编辑,再用独立的超分辨率(SR)模型放大。这条路线有两个公认的致命缺陷:其一,信息分歧(Information Divergence)——SR 模型缺少高分辨率源图的引导,会凭空幻觉出高频纹理,论文图 1(c) 中人脸细节与 HR 源图完全不一致就是典型例子,这违背了忠实编辑的根本目标;其二,纹理退化(Texture Degradation)——生成结果呈现过平滑或过锐化的伪影,视觉保真度明显下降。另一条路是直接在高分辨率上原生训练编辑模型,但这既需要天量算力,又缺乏大规模高分辨率编辑数据集,训练完成后推理依然受二次注意力复杂度拖累,实践中不可行。

本文的目标是本文的目标是回答一个关键问题:能否以更忠实、更高效的方式实现超高分辨率图像编辑?具体来说,希望在不原生训练高分辨率模型的前提下,让编辑结果在高分辨率下依然与原始高分辨率源图保持细节一致(解决信息分歧),避免过平滑/过锐化的纹理伪影(解决纹理退化),同时把推理开销压到实用水平:论文给出的量化目标是 2K 分辨率下相对扩散 SR 方法取得 3.6–8.4 倍加速,并让 4K 编辑在约 61 秒内完成,最终在最高 4K 的分辨率上取得当时最先进的高保真编辑效果。

与已有工作不同的是,现有高分辨率生成加速工作(如 I-Max、HiFlow、CLEAR)都面向纯生成任务,不要求源图与目标图的细粒度一致性,直接搬到编辑场景会破坏忠实性;而 ScaleEdit 等编辑专用方案基于 U-Net 架构,无法用于日益主流的 DiT 编辑框架。本文的独特切入点有三层:第一,把高分辨率精修从『条件生成』重构为『数据到数据的结构化平移』——起点不是随机噪声而是一个具体的低分辨率编辑图,因此天然适合扩散桥而不是标准扩散;第二,显式地把未受破坏的原始 HR 源图作为条件引导,从根上解决 SR 缺少 HR 引导的问题;第三,观察到高分辨率编辑并不需要目标与源之间穷尽的全对全注意力——未编辑区域只需对齐保真、编辑区域只需局部上下文——于是从第一阶段低分辨率编辑的注意力图中免费提取语义对应先验,用它约束跨图交互,实现既快又忠实的稀疏注意力。

核心方法

超分失败是因为只看得到低分辨率输入,只能靠猜补细节,而原图的高分辨率版本就在手边。EditBridge 采用粗到细两阶段:第一阶段用现成低分辨率编辑模型 $G$ 完成语义修改得到 $x_t^{LR}$;第二阶段不是简单超分,而是学习条件化精修映射 $x_t^{HR} = H(\tilde{x}_t^{HR}, x_s^{HR})$,以原始 HR 源图 $x_s^{HR}$ 为条件精修上采样后的编辑结果。第二阶段采用扩散桥:上采样编辑图为源端点 $x_0$,目标高分辨率编辑图为终端点 $x_1$,中间状态满足 $X_t \sim \mathcal{N}((1-t)x_0 + t x_1,\ t(1-t)I)$,DiT 骨干上的 $v_\theta$ 以速度匹配损失 $\mathcal{L}(\theta) = \mathbb{E}\|v_\theta - u_t\|^2$ 学习条件速度场,推理从 $t=0$ 单步积分到 $t=1$。为高效注入 HR 引导,框架配备先验引导的块级稀疏注意力 PG-BSA,把跨图交互复杂度从 $O(N^2)$ 降到 $O(N \cdot k^2)$。

核心创新是与传统范式的两点本质区别。第一,生成路径的范式转换:传统流程是『低分辨率编辑 → 从噪声扩散重建高分辨率』(图 1a),模型必须凭空再造整幅图像,缺少 HR 引导导致幻觉;EditBridge 则是『低分辨率编辑图 → 高分辨率编辑图』的扩散桥(图 1b),沿轨迹全程保留低分辨率输入的结构信息,生成轨迹更短,且显式以未破坏的 $x_s^{HR}$ 为条件,确保真实细节被恢复而不是被重新想象。第二,信息路由方式的创新:朴素做法是把 HR 源 token 直接拼接进 DiT 做全注意力,token 爆炸加上二次复杂度在高分辨率下完全不可行。作者的关键洞察是:未编辑区域只需对 HR 源中语义对应的锚点做高保真复制,编辑区域只需吸收局部上下文合成新细节,都不需要全局交互。于是从第一阶段编辑的跨域注意力图中提取硬对应先验 $\pi(i) = \arg\max_j A_{ij}$,作为空间路线图约束第二阶段的跨图注意力感受野,把冗余的无关交互剪掉——效率和忠实性在这里同时受益。

方法步骤详情

第一步,低分辨率编辑:HR 源图下采样后与指令 $c$ 一起输入预训练模型 $G$ 得到 $x_t^{LR}$,同时保存该阶段目标域 query 与源域 key 间的注意力图 $A$。第二步,构建对应先验:对每个目标 token 取最大响应得硬对应 $\pi(i) = \arg\max_j A_{ij}$,再用坐标上采样扩展到高分辨率网格($S=2$ 时对应复制到 $2\times2$ token 簇),形成空间对齐的引导场 $\hat{\pi}(\cdot)$。第三步,桥精修训练:输入为 [文本 | 目标图 | 源图] 拼接嵌入,对配对端点采样加噪中间态 $X_t$,用 LoRA($r=128$)适配所有线性层,以 Prodigy 优化器在 8 张 H800 上回归速度场。第四步,PG-BSA 推理:注意力解耦为域内自注意力与先验引导的跨域注意力——目标 query $q_j$ 只对以锚点 $\hat{\pi}(j)$ 为中心的 $k\times k$ 窗口内的源 key 做加权求和,底层用 VMoBA 加 FlashAttention,单步积分完成 4K 输出。

技术新颖性

技术新颖性体现在四个层面。其一,任务公式化的新颖:把高分辨率编辑的精修阶段定义为扩散桥的数据到数据平移,这在 DiT 编辑框架内是新的——此前桥模型多用于图像翻译等任务,且现有高分辨率编辑方案(ScaleEdit 等)都锚定在 U-Net 上。其二,先验来源的新颖:语义对应先验不需要额外模块或标注,而是从第一阶段编辑的注意力图中免费回收,经坐标上采样后服务于高分辨率阶段,属于跨阶段的注意力知识复用。其三,稀疏模式的新颖:不同于通用稀疏注意力按学习或检索选块,PG-BSA 的分块由空间语义对齐决定,与『未编辑区域保真、编辑区域局部合成』的任务结构精确匹配,作者消融实验显示它能避免全注意力在 2K 下的上下文渗漏伪影(mLPIPS 0.390 对全注意力的 0.425)。其四,效率工程的新颖:结合 VMoBA 与 FlashAttention 内核,使跨域复杂度严格线性于 $N$,支撑了 1K 单步 0.84 秒、2K 4.08 秒、4K 61.10 秒的实测延迟。

Overview of our proposed EditBridge. The upper section illustrates the inference process of the diffusion bridge, which transports the low-resolution edit to its high-resolution counterpart. The lower section details the construction of the correspondence prior and the proposed Prior-Guided Sparse Attention (PG-BSA) mechanism.
Figure 2: Overview of our proposed EditBridge. The upper section illustrates the inference process of the diffusion bridge, which transports the low-resolution edit to its high-resolution counterpart. The lower section details the construction of the correspondence prior and the proposed Prior-Guided Sparse Attention (PG-BSA) mechanism.

实验结果

主实验(Table 1)在 1K/2K/4K 档与直接推理、扩散 SR、ScaleEdit、HiFlow 对比,指标为 HaarPSI 与掩码 mLPIPS 等六项。1K 档:HaarPSI 0.4992 最佳,仅 0.84 秒,比 ScaleEdit(181.20 秒)快两个数量级。2K 档:全面领先(HaarPSI 0.4673),耗时 4.08 秒,相对扩散 SR 加速 3.6–8.4 倍。4K 档:mPSNR 24.1380 最佳,61.10 秒完成,比直接推理(695.23 秒)快 11 倍,使 4K 编辑实用化。消融一(Table 2):1K 下全注意力 HaarPSI 0.539 略优于稀疏的 0.499,但 mLPIPS 劣化(0.599 对 0.382)且产生鬼影(图 5);2K 下稀疏几乎全面占优(mSSIM 0.871 对 0.705)。消融二(Table 3):单步 HaarPSI 0.4991 优于 5 步(0.4131)和 10 步(0.4020),说明桥轨迹短、单步即达最优。定性对比(图 3、图 4)显示基线过锐化或幻觉细节,本文与 HR 源一致性最高。

Quantitative comparison results. ↑/↓ indicate whether higher/lower values are better. Bold numbers represent the best results.
Table 1: Quantitative comparison results. ↑/↓ indicate whether higher/lower values are better. Bold numbers represent the best results.
Performance comparison between our PG-BSA and full attention across 1K and 2K settings.
Table 2: Performance comparison between our PG-BSA and full attention across 1K and 2K settings.
Qualitative comparison at 1K resolution. Our method better preserves fidelity while enhancing visual clarity.
Figure 3: Qualitative comparison at 1K resolution. Our method better preserves fidelity while enhancing visual clarity.
Qualitative comparison at 2K resolution. Our method better preserves fidelity while enhancing visual clarity.
Figure 4: Qualitative comparison at 2K resolution. Our method better preserves fidelity while enhancing visual clarity.
Ablation of Attention Sparsity. Full attention leads to noticeable source-induced artifacts, whereas our sparse attention maintains superior visual fidelity and alignment.
Figure 5: Ablation of Attention Sparsity. Full attention leads to noticeable source-induced artifacts, whereas our sparse attention maintains superior visual fidelity and alignment.
Impact of sampling steps. Perceptual quality and high-frequency details are maximized at T = 1. Increasing the number of inference steps does not yield significant visual gains, further validating the efficiency of our refinement framework.
Figure 6: Impact of sampling steps. Perceptual quality and high-frequency details are maximized at T = 1. Increasing the number of inference steps does not yield significant visual gains, further validating the efficiency of our refinement framework.
查看结构化数据
任务指标本文基线提升
1K 分辨率指令图像编辑 HaarPSI ↑ / 推理时间 ↓ 0.4992 / 0.84s ScaleEdit 0.4824 / 181.20s;DiT-SR 0.4523 / 2.44s 保真度更高且比 ScaleEdit 快约 215 倍
2K 分辨率指令图像编辑 mSSIM ↑ / 推理时间 ↓ 0.8712 / 4.08s DiT-SR 0.8265 / 14.82s;ScaleEdit 0.6818 / 662.50s 相对扩散 SR 方法加速 3.6–8.4 倍,mSSIM 提升 4.5 个百分点
4K 分辨率指令图像编辑 mPSNR ↑ / mLPIPS ↓ / 时间 ↓ 24.1380 / 0.2112 / 61.10s TSD-SR 22.2766 / 0.2399 / 108.72s;直接推理 695.23s 比 SR 方法快 1.8–2.1 倍,比直接推理快 11 倍
消融:稀疏注意力 vs 全注意力(1K) mLPIPS ↓ 0.382(稀疏) 全注意力 0.599 稀疏注意力显著减少编辑区域的上下文渗漏伪影
消融:推理步数 HaarPSI ↑ / 时间 ↓ 单步 0.4991 / 0.84s 5 步 0.4131 / 4.03s;10 步 0.4020 / 8.10s 单步质量与效率双优,验证桥轨迹的高效性

局限与改进

作者承认的局限:Table 2 显示 1K 下全注意力的 HaarPSI(0.539 对 0.499)和 mPSNR(19.080 对 18.653)略优,作者将其解释为逐像素指标在局部编辑场景下的误导性,但这至少说明稀疏化在部分指标上存在折衷;先验引导依赖 $\hat{\pi}(\cdot)$ 上采样,窗口大小 $k$ 需随分辨率增大以补偿离散化误差,说明高倍上采样下对应先验会失准。我自己的观察:训练目标图由 Nano Banana Pro 合成、指令由 Gemini 3 自动生成,评测集又是同一风格的两阶段 SR 对比,可能存在对合成数据分布的偏好,且未报告用户研究或指令遵循类指标(如 CLIP 文本-图像一致性);编辑幅度大的区域语义本身已改变,$\arg\max$ 硬对应在源图中可能没有合理锚点,此时稀疏注意力行为未单独分析;4K 训练数据仅 1500 对,极端宽高比与非常规内容的泛化未验证;推理时间统计包含先验估计开销,但未给出不同 $k$、不同分辨率下的显存占用曲线,稀疏注意力的实际显存收益只能从复杂度推断。

独立分析的弱点

弱点一:硬对应先验的脆弱性。$\pi(i) = \arg\max_j A_{ij}$ 是硬分配,当指令大改局部语义时,目标 patch 在 HR 源图中可能缺乏语义锚点,$k \times k$ 窗口会框住无关区域。改进方向:保留 top-$m$ 软对应候选,或用熵值检测对低置信度区域自适应扩大搜索范围。弱点二:先验是静态快照。先验在第一阶段一次性提取并上采样固定使用,不随第二阶段去噪轨迹更新,误差会被 2×2 簇最近邻扩展放大。改进方向:在桥轨迹的少数时间步上用当前 $X_t$ 的注意力轻量刷新先验。弱点三:评测体系偏几何保真。所有指标都围绕源图一致性,缺少指令遵循度与人眼偏好评估,方法可能在『编辑质量 vs 源图保真』间系统性偏向后者。改进方向:补充指令遵循基准与大规模用户研究。弱点四:训练数据闭环依赖商业模型(Gemini 3 生成指令、Nano Banana Pro 合成目标),有许可风险且分布偏向该商业编辑器风格。改进方向:用真实摄影图对加人工指令构建高质量校准集。弱点五:窗口大小 $k$ 手工设定且随分辨率调整,缺乏自适应机制,可按先验置信度或局部内容复杂度动态分配注意力。

未来方向

作者方向:论文结论指出该框架确立了高保真编辑的高效可扩展范式,隐含的自然延伸是推向 8K 及以上分辨率、扩展到视频编辑(时序维度上对应先验可以复用为跨帧对应)、以及把桥精修阶段与更多 DiT 编辑基础模型(而非仅 Qwen-Image-Edit)结合验证通用性。基于成果可延伸的方向:第一,把先验引导稀疏注意力与 KV 缓存、量化和蒸馏叠加,进一步压低 4K 延迟;第二,将单步桥推理与一致性模型或流匹配蒸馏结合,探索亚秒级高分辨率编辑;第三,把对应先验从硬 $\arg\max$ 升级为可学习的软路由器,端到端联合训练先验提取与稀疏注意力;第四,将该范式迁移到多参考图编辑与主体一致性生成场景——那里同样存在『源图就在手边、不该从噪声重造』的结构;第五,用桥框架处理局部重绘/外扩(outpainting),源端点与条件信息的组织方式可直接复用。

复现评估

复现难度中等偏高。有利条件:方法描述完整,扩散桥的 $X_t$ 分布、速度场 $u_t = \frac{x_1 - X_t}{1-t}$、匹配损失、先验上采样与稀疏窗口定义等公式齐备;项目页 https://editbridge.github.io/ 已上线;基座模型 Qwen-Image-Edit 开源,VMoBA 与 FlashAttention 有公开实现,评测协议沿用 ScaleEdit 可对齐。不利条件:论文未明确承诺开源代码与权重;训练数据非公开——需自行从 Aesthetic-4k 和 Aesthetic-Train-V2 收集并中心裁剪,再用 Gemini 3 生成指令、Nano Banana Pro 合成目标图,两者均为商业 API,构建 5000 对 1K/2K 加 1500 对 4K 数据集成本不小;训练需 8 张 H800(80GB)加 LoRA($r=128$,$\alpha=128$)和 Prodigy 优化器(学习率 1.0),算力门槛不低。推理侧复现相对容易:拿到权重或完成 LoRA 训练后,单步推理加 VMoBA 稀疏核在单张高端显卡上应可跑通 2K。