← 返回 2026-07-17

自纠正耦合马尔可夫跳过程:图像理解与生成的并发统一 Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu 📅 2026-07-14 👍 33 2026-07-22 18:54
remasking 图像编辑 多模态生成 离散扩散 视觉推理 马尔可夫跳过程

首个让文本与图像在同一步内互相纠正的并发扩散采样器

前置知识

Masked Diffusion Models (MDMs, 掩码扩散模型)

一类面向离散 token 的扩散模型。前向过程把干净序列 $x \in \mathcal{V}^L$ 中的 token 按调度 $\alpha_t$ 逐步替换为吸收态 $\mathbf{m}$,得到带噪状态 $z_t$;训练目标是让去噪网络 $x_\theta$ 从 $z_t$ 预测原始 $x$。反向采样时所有 mask 位置被一次性并行预测(而非像自回归那样从左到右),天然适合并行解码。代表工作包括 D3PM、MDLM、Sahoo et al. 2024。

本文方法完全建立在 MDM 之上:SC-CMJP 把 MDM 的连续时间形式(CTMC)扩展为耦合双模态跳过程,CO2Jump 是一个跑在冻结 MDM 之上的训练自由采样器,必须先理解 MDM 的前向/反向/ELBO 才能看懂改造点。

Markov Jump Process (MJP, 马尔可夫跳过程)

定义在离散状态空间上的连续时间马尔可夫过程,由速率矩阵 $R_t(z, z')$ 刻画:状态在无穷小时间间隔内以速率 $R_t$ 发生跳变。MDM 的连续时间形式(Campbell et al. 2022)就是状态空间 $\mathcal{V}^L$ 上的一个 MJP,其速率矩阵 $R_t = -\dot{\alpha}_t/\alpha_t \cdot (I - \mathbf{m}\mathbf{1}^\top)$。精确反演要用 Gillespie 算法(一次更新一个位置,序列长度大时不可行),实际用 $\tau$-leaping 这种并行近似。

本文的理论框架就是 Coupled MJP:把文本和图像两条 MJP 的速率耦合起来,让一个模态的跳变强度依赖另一模态的置信度,再加上一个 death/remask 跳变。看懂 $R_t$、$\tau$-leaping、birth-death 这些概念才能理解 CO2Jump 的死/生两步操作。

Remasking (重掩码, ReMDM)

标准 MDM 反向后验有一个根本缺陷:一旦某个 token 被揭示(unmask)就不能再修改,错误会沿轨迹一直持续到采样结束。ReMDM (Wang et al. 2025) 引入每步重掩码概率 $\sigma_t \in [0,1]$,让已确定的 token 以概率 $\sigma_t$ 重新变回 $\mathbf{m}$,从而可以重新采样。修改后的后验 $q_\sigma(z_s | z_t, x)$ 在 $\sigma_t \leq \min(1, (1-\alpha_s)/\alpha_t)$ 时仍保持原始边际分布。

CO2Jump 的「自纠正」一半直接来自 ReMDM,但 ReMDM 的 $\sigma_t$ 调度只看模态内似然,无法发现跨模态矛盾。本文的关键贡献是把 remasking 信号跨模态耦合起来——把「跨模态矛盾」作为触发重掩码的判据。

Chain-Rule Factorization (链式法则分解)

联合反向后验可分解为 $p(z^\text{text}_s, z^\text{image}_s | z_t, c) = p(z^\text{text}_s | z_t, c) \cdot p(z^\text{image}_s | z_t, z^\text{text}_s, c)$。第一项(文本)只依赖当前 $z_t$,第二项(图像)理想情况下应当条件在最新采样的 $z^\text{text}_s$ 上。精确评估第二项需要每步多做一次前向传播,本文用单次前向传播里已有的隐藏表示和跨模态注意力来近似 $z^\text{text}_s$。

这是 CO2Jump 「非对称打分」的全部理论依据:文本用纯自置信打分,图像用「自置信 + 跨模态信号」的熵门控混合打分。理解这个分解就能立刻看懂为什么文本和图像的打分公式长得不一样。

Cross-Modal Attention (跨模态注意力)

在统一词表的多模态 Transformer 中,文本和图像 token 在同一 backbone 内通过自注意力互相 attend。本文抽取最后一层的隐藏表示 $H^\text{text}_t \in \mathbb{R}^{L_\text{text} \times D}$、$H^\text{image}_t \in \mathbb{R}^{L_\text{image} \times D}$,事后计算 image→text 的交叉注意力 $A^{\text{image}\to\text{text}}_t = \mathrm{Softmax}(H^\text{image}_t (H^\text{text}_t)^\top/\sqrt{D} + B_t)$,其中 $B_t$ 是一个 mask-aware 偏置,降低对当前 mask 位置的注意力权重。

跨模态注意力是 CO2Jump 把「另一模态的置信度」传播过来的唯一通道。它不引入任何新参数、不修改架构,只在冻结 backbone 的一次前向传播里从最后一层读取,是「训练自由」这一卖点的关键技术支撑。

研究动机

在多模态生成场景下(比如「看图说话 + 改图」「读迷宫文字 + 画路径」),文本理解和图像生成必须互相约束才能产出一致结果。然而现有的 MDM 多模态采样器(如 MMaDA-Parallel、UD-VLA)即便名义上「并行解码两个模态」,实际上每一步都把联合更新分解成各自独立的分支——文本和图像的更新只共享「上一步的历史状态」$z_t$,而看不到对方在同一步 $s$ 内的最新决策。更严重的是标准 MDM 反向后验无法 remask(Austin 2021、Sahoo 2024):token 一旦在某步 $t$ 被确定就不可逆。这两点叠加导致「跨模态矛盾」既检测不到也修复不掉——文本可能 commit 一段图像根本画不出来的描述,图像也可能画出文本从未提及的内容,错误沿整条采样轨迹传播。在迷宫、nonogram 这类「文本答案和图像解必须逐位置对齐」的任务上,这种 drift 会直接导致联合答案完全错误。

本文的目标是本文要让两个模态在每一个去噪步骤内真正「协商」彼此的承诺,而不是各自为政。具体目标包括:(1) 把联合多模态生成写成单一的耦合随机过程,使一个模态的转移速率显式依赖另一模态当前的置信度;(2) 在不修改骨干网络、不引入额外评估器、每步只用一次前向传播的前提下,让已确定的 token 在出现跨模态矛盾时能够被撤回(remask);(3) 在图像编辑(ImgEditBench 扩展协议)和两个新视觉推理任务(迷宫 JMaze、nonogram JNono)上,同时改善文本理解质量、图像生成保真度和「联合正确率」这一最严格的指标,并使性能随去噪步数(NFE)单调上升。

与已有工作不同的是,已有 remasking 工作分三类:predictor-corrector、训练式 remasking(GIDD、Zhao 2026)、训练自由 remasking(ReMDM、Ouyang 2026),但没有任何一个把 remasking 信号跨模态耦合。已有并发采样器(UD-VLA、MMaDA-Parallel)也只是把「并发」实现成共享历史的交错更新。本文的独特切入点是:把「跨模态矛盾」直接当作触发自纠正的判据——一个模态的跳变速率由另一模态经跨模态注意力加权后的置信度决定,已确定的 token 在跨模态证据反悔时被 retract。同时它把这个机制做成训练自由、单前向传播的可插拔采样器,无需任何架构改动或额外训练就能套在冻结 MDM 上。

核心方法

直觉上,作者把人类教师在白板前「边讲边画」建模成两条耦合随机过程:嘴巴说出的每个词影响下一笔,画出的每条线又改变下一句话。技术上,他们在统一词表 $\mathcal{V} = \mathcal{V}_\text{text} \cup \mathcal{V}_\text{image}$ 上把联合样本 $x = (x^\text{text}, x^\text{image})$ 当成一条序列,前向过程 $q(z_t | x) = \mathrm{Cat}(z_t; \alpha_t x + (1-\alpha_t)\mathbf{m})$ 同时作用在两模态上,共享吸收 token $\mathbf{m}$ 和调度 $\alpha_t$。由于逐位置边际可分解,联合 NELBO $\int_0^1 \dot{\alpha}_t/(1-\alpha_t) \sum_\ell \log x^\ell_\theta(z_t,t), x_\ell \, dt$ 与单模态 MDM 形式一致,无需额外跨模态项——但 $x_\theta$ 在每个位置都能 attend 到整个联合状态,所以训练隐式地把跨模态去噪信号编码进网络。CO2Jump 在推理时通过单次前向传播抽出这些潜在跨模态信号。

核心创新是非对称链式分解下的「耦合置信度」。基于 $p(z^\text{text}_s, z^\text{image}_s | z_t, c) = p(z^\text{text}_s | z_t, c) \cdot p(z^\text{image}_s | z_t, z^\text{text}_s, c)$,文本项无跨模态依赖,故文本位置用自置信 $\mathrm{Score}^\text{text}_\ell = \mathrm{SelfConf}_\ell$ 打分;图像项理想应条件在最新 $z^\text{text}_s$,精确评估需第二次前向传播,作者用同一前向传播的跨模态注意力 $A^{\text{image}\to\text{text}}_t$ 把文本自置信加权传播到图像位置得到 CrossSignal,再用熵门控标量 $\lambda = \bar{H}^\text{image}/(\bar{H}^\text{image}+\bar{H}^\text{text}+\epsilon)$ 混合:$\mathrm{Score}^\text{image}_\ell = (1-\lambda)\,\mathrm{Rank}(\mathrm{SelfConf}) + \lambda\,\mathrm{Rank}(\mathrm{CrossSignal})$。图像局部混乱时 $\lambda\to 1$,图像听从文本;反之 $\lambda\to 0$。这是与所有「分支独立」采样器的本质区别:同一步内文本决策被立即传播到图像打分,配合 death/remask 撤回跨模态矛盾。

方法步骤详情

完整 CO2Jump 步骤:(1) 初始化 $z_1 \leftarrow \{\mathbf{m}\}^{L_\text{text}+L_\text{image}}$;(2) 对 $i=T$ 到 1,令 $t=i/T$、$s=(i-1)/T$,$z_s \leftarrow z_t$;(3) 对冻结 $x_\theta(z_t,c)$ 跑一次前向传播,提取最后一层 $H^\text{text}_t$、$H^\text{image}_t$ 与逐模态平均熵 $\bar{H}^\text{text},\bar{H}^\text{image}$;(4) Gumbel-max 采样 $\hat{x}_\ell = \arg\max_v \log p_\theta(v|z_t,c)+\gamma_v$,记录 SelfConf $= p_\theta(\hat{x}_\ell)$;(5) 非对称打分:文本用 $\mathrm{SelfConf}$;图像算 $A^{\text{image}\to\text{text}}_t = \mathrm{Softmax}(H^\text{image}_t (H^\text{text}_t)^\top/\sqrt{D}+B_t)$、$\mathrm{CrossSignal}_\ell = \sum_j A_{\ell j}\mathrm{SelfConf}^\text{text}_j$、$\lambda$ 门控,模态内百分位归一化后混合出 CoupledConf;(6) 算 death rate $\sigma_t \leftarrow \min(\eta, (1-\alpha_s)/\alpha_t)$ 与理想化计数 $U^a_t = \lfloor \alpha_t L^a \rfloor$、$M^a_t = \lfloor (1-\alpha_t) L^a \rfloor$;(7) Death 跳:每模态内把得分最低的 $N^a_\text{remask} = \lfloor U^a_t \sigma_t \rfloor$ 个已确定 token 重新置为 $\mathbf{m}$;(8) Birth 跳:在剩余 mask 位置中揭示得分最高的 $N^a_\text{unmask} = \lfloor (\alpha_s-\alpha_t)/(1-\alpha_t) M^a_t \rfloor + \lfloor \sigma_t (1-\alpha_t)/\alpha_t M^a_t \rfloor$ 个。两跳都用非对称打分,最终输出 $z_0$ 即统一多模态样本。

技术新颖性

技术新颖性体现在三个层次:(1) 理论上首次把图像理解与生成建模为单一耦合随机过程 SC-CMJP,一条模态的转移速率成为另一模态置信度(经跨模态注意力加权)的泛函;(2) 算法上把 ReMDM 的「模态无关」remasking 改造为「跨模态耦合」remasking,把跨模态矛盾作为 death 跳的触发条件,并用熵门控 $\lambda$ 动态决定每个步骤应当信文本还是信图像;(3) 工程上做成完全训练自由、单前向传播、无架构修改、无辅助评估器的可插拔采样器。和 GIDD(改训练目标)、Zhao 2026(训独立评估器)、ReMDM(模态内启发式 $\sigma_t$)相比,CO2Jump 是唯一把耦合信号和 remasking 触发都跨模态化的方案;和 MMaDA-Parallel、UD-VLA 这些只在历史层面共享信息的并发采样器相比,CO2Jump 在「同一步骤内」就完成跨模态协商。

CO2Jump 在图像编辑、迷宫、nonogram 三任务上的联合轨迹快照(中间步 $t$ 与最终步)
Figure 1: CO2Jump 在图像编辑、迷宫、nonogram 三任务上的联合轨迹快照(中间步 $t$ 与最终步)
CO2Jump 采样器:单步 death & birth 跳变示意
Figure 2: CO2Jump 采样器:单步 death & birth 跳变示意

实验结果

扩展 ImgEditBench(Table 1)上,CO2Jump 单次前向传播取得最好联合表现:ImgEditBench 1.93 vs MDM 1.78 / ReMDM 1.73 / MMaDA-Parallel 1.44;Overall mAP@0.5:0.95 为 0.369 超 MDM 0.354、ReMDM 0.353、MMaDA-Parallel 0.335;target mAP(要求图像分支把编辑对象放进文本分支宣告的 box)0.346 vs 三基线 0.322/0.318/0.304。CO2Jump 同时击败了「免费拿到生成目标图」的串行 grounding 参考 Qwen3-VL-8B(target 0.346 vs 0.330,overall 0.369 vs 0.360),证明并发耦合不劣于先理解后生成;并呈现「理解越强、生成越强」的链式签名:理解最强的 CO2Jump 编辑分也最高,最弱的 MMaDA-Parallel 两项都最差。视觉推理(Table 2)CO2Jump 在迷宫和 nonogram 全 6 列领先:迷宫总联合准确率 0.432(MDM 0.424、MMaDA-Parallel 0.390、ReMDM 0.180),nonogram 0.168(MMaDA-Parallel 0.138、MDM 0.100、ReMDM 0.002)。OOD 上 nonogram CO2Jump 0.175 vs MDM 0.050、MMaDA-Parallel 0.113——MDM 从分布内到 OOD 跌 55%、MMaDA-Parallel 跌 21%、CO2Jump 几乎持平,说明跨模态耦合对网格尺寸泛化更鲁棒。NFE 扩展(Figure 5)CO2Jump 是唯一两项指标都单调上升的采样器:ImgEditBench 1.72→1.93、overall mAP 0.074→0.369(8→512 NFE),而 MDM/ReMDM 高 NFE 平台甚至倒退、MMaDA-Parallel 从 1.52 退到 1.44;8 NFE 时四种方法 mAP 相差不到 0.009,512 NFE 时 CO2Jump 领先 +0.015/+0.016/+0.034,耦合效应沿轨迹累积。消融(Table 3):去 Shared Percentile Rank 编辑分 1.93→1.87;去 Entropy Gating overall mAP 0.369→0.354;去 Self-Correction overall mAP 0.369→0.337(最伤),证实跨模态耦合 remasking 是理解指标的主要来源。

扩展 ImgEditBench 上的图像编辑与理解结果
Table 1: 扩展 ImgEditBench 上的图像编辑与理解结果
JMaze-Test500 与 JNono-Test500 的联合准确率(分布内 / OOD / 总计)
Table 2: JMaze-Test500 与 JNono-Test500 的联合准确率(分布内 / OOD / 总计)
CO2Jump 消融:分别移除 Shared Percentile Rank / Entropy-Based Gating / Self-Correction
Table 3: CO2Jump 消融:分别移除 Shared Percentile Rank / Entropy-Based Gating / Self-Correction
采样步数(NFE)扩展曲线:ImgEditBench 与 overall mAP
Figure 5: 采样步数(NFE)扩展曲线:ImgEditBench 与 overall mAP
(a) 熵门控 $\lambda_\text{image}$ 随步骤变化;(b) 耦合象限:图像侧 remask 事件在 (Self-Conf, Cross Signal) 空间的分布
Figure 7: (a) 熵门控 $\lambda_\text{image}$ 随步骤变化;(b) 耦合象限:图像侧 remask 事件在 (Self-Conf, Cross Signal) 空间的分布
查看结构化数据
任务指标本文基线提升
图像编辑 (ImgEditBench 扩展协议) ImgEditBench oracle 分 ↑ 1.93 MDM 1.78 / ReMDM 1.73 / MMaDA-Parallel 1.44 +0.15 相对最强基线 MDM,相对 MMaDA-Parallel 提升 +34%
图像编辑 - 跨模态理解 Overall mAP@0.5:0.95 ↑ 0.369 MDM 0.354 / ReMDM 0.353 / MMaDA-Parallel 0.335 / Qwen3-VL-8B(串行) 0.360 +0.015 相对 MDM,并超过免费拿到目标图的串行 Qwen3-VL-8B
图像编辑 - 目标 grounding Target mAP@0.5:0.95 ↑ 0.346 MDM 0.322 / ReMDM 0.318 / MMaDA-Parallel 0.304 / Qwen3-VL-8B 0.330 +0.024 相对最强基线 MDM
迷宫求解 - 联合正确率 Joint Accuracy (JMaze-Test500, 3×3-22×22) ↑ 0.432 MDM 0.424 / MMaDA-Parallel 0.390 / ReMDM 0.180 +0.008 相对 MDM
Nonogram 求解 - OOD 联合正确率 Joint Accuracy (网格 {3,4,26,27}) ↑ 0.175 MMaDA-Parallel 0.113 / MDM 0.050 / ReMDM 0.000 +0.062 相对最强基线 MMaDA-Parallel,MDM 跌 55% 而 CO2Jump 持平

局限与改进

作者承认:SC-CMJP 虽号称 modality-agnostic,但只在文本+图像上实例化,扩展到音频/视频/结构化输出留作未来工作;框架要求统一词表联合训练,依赖具备跨模态注意力的统一骨干(本文 Lumina-DiMOO),无法直接套到单模态扩散模型上。我的观察:(1) 图像侧链式第二项 $p(z^\text{image}_s | z_t, z^\text{text}_s, c)$ 用 $z^\text{text}_t$ 近似 $z^\text{text}_s$,当文本同一步发生大量 unmask 时误差可能较大;(2) ImgEditBench 的 understanding 评估用「每个模型各自生成不同目标图 → Gemini 在自己的(source,target)对上构造伪 scene graph」,引入第三方 MLLM 偏差;(3) 视觉推理绝对联合准确率仍偏低(迷宫 0.432、nonogram 仅 0.168),任务整体远未解决;(4) remasking 调度极简($\sigma_t = 0.01$ 在 $[0.25,0.75]$,其余 0),未系统探索动态方案。

独立分析的弱点

弱点一:单前向传播近似在文本快速收敛的早期步骤可能不准。改进:自适应机制,仅当一步内文本侧发生大量 unmask($z^\text{text}_s$ 与 $z^\text{text}_t$ 差异显著)时触发第二次前向传播,其余保持单次。弱点二:熵门控 $\lambda$ 是逐步骤标量,所有图像位置共用同一权重,无法处理「图像某些区域已清晰、某些还需文本引导」的局部差异。改进:把 $\lambda$ 做成逐位置(甚至逐 patch),用图像位置的局部熵而非全模态平均熵。弱点三:remasking 调度过于粗糙(常数 0.01 区间),未利用跨模态矛盾强度做动态 $\sigma_t$。改进:由 CoupledConf 分布尾部驱动自适应 $\sigma_t$,矛盾大时多 remask。弱点四:任务难度天花板——nonogram 联合准确率仅 0.168,大尺寸(25×25 以上)搜索空间远超当前 MDM 容量。改进:把行列线索作为结构化 bias 注入 $B_t$,或对超大网格做层次化分解。弱点五:数据依赖 Qwen3-VL-235B 合成 scene graph 与 thinking trace,监督质量受外部 MLLM 可靠性限制。

未来方向

作者明确指出:把 SC-CMJP 推广到更多模态(音频、视频、结构化输出),并继续发挥 NFE 单调上升特性。基于本文成果的延伸:(1) 把耦合从「文本↔图像」推广到「文本↔图像↔视频帧」三模态,理论上只需把 $A^{\text{image}\to\text{text}}_t$ 扩展为多对跨模态注意力,门控 $\lambda$ 重设计为多通道;(2) 探索「逐位置 $\lambda$」+「自适应 $\sigma_t$」组合能否进一步推高 NFE 曲线斜率(目前 512 NFE 仍未饱和,说明还有头部空间);(3) 把 chain-rule 非对称性推广到任意拓扑(如「文本规划→图像执行→文本复核」三段耦合),让自纠正更结构化;(4) 用 SC-CMJP 做 agent 的「思考-行动-观察」联合生成,这类任务天然多模态、需中途修正。数据集方向:把 JMaze/JNono 升级为含动态障碍版本,或引入更多「文本与图像逐位置对齐可验证」的任务(数独、电路布线)作为更严格 benchmark。

复现评估

复现门槛较高但有希望。开源方面,作者承诺会发布 checkpoint、代码及三个数据集(JEdit-1M、JMaze-200K、JNono-200K),但截至论文发表尚未实际放出(项目页 coupled-jump.github.io)。训练算力需求高:每任务在 64× H100 80GB、总 batch size 512、学习率 $2 \times 10^{-5}$ 下从 Lumina-DiMOO 微调,对学术小团队是不小的门槛。好消息是 CO2Jump 本身 training-free,拿到 fine-tuned checkpoint 后推理时只需替换采样器代码、单卡可跑。数据合成依赖 Qwen3-VL-235B 和 Gemini 3 Flash 两个闭源 MLLM 产 scene graph 和 thinking trace,复刻数据集要么调 API(成本与配额受限)要么换开源 MLLM 重新合成(质量可能有差)。benchmark 评估也大量依赖 Gemini(迷宫答案抽取、nonogram 图像比对、ImgEditBench oracle 分),复现评估需要同样 API 访问。综合:算法(CO2Jump sampler)易复现,数据与评估流程难完全复现,建议等官方 release checkpoint 后直接做采样器层面对比实验。