← 返回 2026-09-09

让潜在视觉推理成为必要:因果视觉循环推理 CVRR Reason Through the Latent! Making Latent Visual Reasoning Necessary

Suhyeong Park, Junha Jung, Jaewoo Kang 📅 2026-09-06 👍 33 2026-09-12 18:30
因果干预分析 多模态大模型 循环深度推理 潜在视觉推理 视觉问答

让潜在视觉推理成为预测的因果必经之路,且不损失预训练视觉能力。

前置知识

潜在视觉推理(Latent Visual Reasoning)

指多模态大模型不在文本中显式写出思维链,而是通过连续隐藏状态的迭代计算完成中间推理。代表方法包括 LVR(迭代演化潜在视觉状态)、Monet(用连续视觉嵌入作中间表征)、SkiLa(文本与潜在计算混合)、UniVLR(统一文本与视觉的潜空间)等,它们在隐藏空间中维护并精炼与任务相关的视觉信息。

这是本文的研究对象:论文论证这些方法的潜在状态虽然信息丰富,但因存在旁路而并非预测的因果必经之路,CVRR 正是为解决这一问题而设计。

KV 缓存与推理旁路(bypass)

自回归解码时模型会缓存前缀各层的键值(KV cache)供后续 token 注意。在多模态模型中,图像 token 的隐藏状态和多模态前缀缓存共同构成一条『图像信息直达答案』的通路;即使模型另有潜在推理状态,答案仍可通过注意这些缓存绕开潜在计算,这条替代通路称为旁路。

旁路是论文指出的核心问题根源;CVRR 的关键一步就是在解码前物理删除视觉行与全部多模态 KV 缓存,使最终循环状态成为唯一图像条件信息源。

激活补丁与因果干预(Activation Patching)

因果表征分析的常用手段:构造只在一个因素上不同的对比样本,把一个样本在某层的内部激活替换为另一个样本的,观察输出(如答案对数概率裕度)如何变化,从而定位该层激活对预测的因果影响。本文用它双向测量视觉 token 激活的下游影响并选取循环边界层。

边界定位(Qwen2.5-VL 上 $\ell^*=20$)和第 5 节全部因果检验(损坏 $h_T$、交叉状态实验、区域阻断)都基于此类干预,是理解论文证据链的核心工具。

循环/共享层 Transformer(Recurrent-Depth Transformer)

让同一层 Transformer 参数在深度方向重复使用的架构,如 Universal Transformer 与循环深度 Transformer:内部状态被同一变换反复更新,迭代次数相当于可变的计算深度。近期工作用它做隐式推理和测试时深度扩展。

CVRR 复用第 21 层作为共享循环转移函数反复精炼问题状态,理解这一机制才能分清它与这些前作在『为何循环、循环什么』上的本质区别。

LoRA 低秩适配

冻结预训练权重、只训练注入线性层的低秩矩阵 $BA$(秩 $r \ll d$)的参数高效微调方法。本文在共享循环层上加 LoRA(rank 32、$\alpha=16$、dropout 0.01),仅 2,883,584 个可训练参数,约占 8.295B 总参数的 0.0348%。

CVRR 依赖『骨干全冻结 + 极小适配』来保留预训练视觉能力,LoRA 是其训练设置的基础,也是复现时必须对齐的关键超参。

VQA 基准与 Pair Accuracy

论文用四个基准评估:V*(191 个高分辨率视觉搜索样本)、MMVP(150 对视觉相似图像上的 300 题,pair accuracy 要求一对中两题均正确)、BLINK(Counting、IQ-Test、Jigsaw、Relative Reflectance、Spatial Relation 等感知子任务)与 MME-RealWorld-Lite(真实世界 VQA)。

这些基准与指标是读懂主实验表、消融表以及『无旁路重训基线崩溃』结论的数字前提,例如 pair accuracy 的大幅坍缩(52.7% 对最高 2.7%)正是论文中心论点的直接证据。

研究动机

潜在视觉推理方法(LVR、Monet、SkiLa、Laser、UniVLR、HyLaR 等)声称模型在连续隐藏状态中完成多模态推理,但『潜在状态包含视觉信息』并不等于『模型用它来产生答案』:只要答案解码器仍能访问原始多模态上下文(视觉 token、多模态前缀 KV 缓存),图像信息就能经旁路直接到达答案。作者对已有多债方法做干预实验——把潜在内容替换为空白图像潜在状态、来自不同答案样本的配对状态、或行范数匹配的噪声,同时保持原始多模态答案上下文不变——发现多数方法准确率几乎不动,例如 UniVLR 在三种替换下变化不超过 0.5 个百分点。这说明强基准成绩不足以证明模型真的依赖所提出的潜在计算,『潜在信息性』与『因果路径必要性』被普遍混为一谈。

本文的目标是本文目标不是把潜在状态做得更有信息量,而是让预测在结构上必须经过潜在计算,同时不牺牲预训练形成的视觉能力。为此提出两条设计要求:其一,潜在计算应从保留预训练视觉能力的表征出发——作者预先验证,在冻结的 Qwen2.5-VL-7B 中间层,多模态前向的问题行表征(Multimodal Q 75.4%)几乎保留了完整多模态状态(Full MM 75.9%)的全部视觉能力,而纯文本问题状态、以及文本状态拼接原始视觉特征的版本都只有 35.6%;其二,应移除所有替代的图像条件答案路径,使最终循环状态成为预测的唯一图像信息来源。同时满足这两条的架构就是 CVRR。

与已有工作不同的是,已有工作主要研究如何构造、更新潜在状态以及如何与视觉证据耦合(潜在视觉 token、循环更新、文本-潜在混合轨迹等),并默认把基准性能提升当作『模型在用潜在推理』的证据;因果中介分析等事后诊断虽然发现预测可以对中间状态的大幅改动不敏感,但只停留在诊断层面。本文的独特切入是把潜在状态依赖性重述为一个因果路径设计问题:不靠事后发现模型是否使用潜在状态,而是用架构约束(严格解码接口、no-bypass)在构造上保证路径必要性,再检验该约束能否在不破坏预训练视觉能力的前提下保住性能——事实表明兼容的已有方法在同样约束下重训后 V* 最高仅 39.8%,而 CVRR 保持在 81.2%。

核心方法

直觉上,CVRR 让答案只能『看见』一个被循环计算反复打磨过的图像条件状态:先把图像读进问题表征,再让问题表征反复回看固定的视觉证据并更新自己,最后切断其他一切图像信息通道。技术上分四步:第一步,用逐层激活补丁在冻结骨干上定位『因果视觉读取边界』,对 Qwen2.5-VL-7B 得到 $\ell^*=20$,即用第 21 层 $f_0=L_{21}$ 作为循环层——此处问题状态已充分吸收图像、而视觉 token 仍保有下游影响力。第二步,在该边界取原生多模态前向输出 $H^{*}_{mm}$,用无适配器的原生层跑一次得 $H_1=f_0(H^{*}_{mm})$,问题行 $h_1$ 作初始循环状态、视觉行 $v$ 作持久视觉证据。第三步,用共享层(LoRA 适配)反复更新:$\hat{h}_t=P_Q f_\phi(\mathrm{Replace}_Q(H_1,h_{t-1}))$,$h_t=(1-\beta)h_{t-1}+\beta\hat{h}_t$,默认 $T=4$、$\beta=0.5$。第四步,解码前丢弃视觉行与全部多模态 KV 缓存,答案解码只接收 $h_T$ 与图像无关的文本前缀缓存 $K_{txt}$。全程仅训练 LoRA(约 288 万参数,占 0.0348%),损失为答案 token 交叉熵。

核心创新是把『路径必要性』从经验性质变成构造性质。已有潜在推理方法把潜在状态当作附加计算路径,答案解码仍可经原始多模态前缀访问图像,潜在状态因此信息丰富但非必要;CVRR 从三方面保证 $h_T$ 是预测的唯一图像条件通路:用原生多模态问题状态初始化循环,而非从文本状态重建——消融显示把 $h_1$ 换成文本锚 $B$ 后 V* 从 81.2% 崩到 37.2%;循环中通过该层原生的因果自注意力反复重读固定视觉证据 $v$,而非把 $h_t$ 孤立变换;解码前物理删除视觉行与多模态 KV 缓存,而非依赖辅助损失去『鼓励』使用潜在状态。关键难题是这条约束会不会摧毁预训练能力,CVRR 用图像条件初始化作答:视觉能力已在 $h_1$ 中,循环只需在其上做预测相关的精炼。

方法步骤详情

完整流程见论文 Algorithm 1。步骤一(边界定位):构造对比对 $x=(I,q,y)$ 与 $x'=(I',q,y')$(同问题、不同图像、不同答案),在候选层 $\ell$ 把 $x$ 的视觉 token 激活替换为 $x'$ 的,测双向对数概率裕度变化 $b_{mi}(\ell)=\tfrac{1}{2}\big[\tfrac{M_x(x)-M_x(P_\ell(x\leftarrow x'))}{m_i(0)}+\tfrac{M_{x'}(x')-M_{x'}(P_\ell(x'\leftarrow x))}{m_i(0)}\big]$,取首个持续下降之前的层,得 $\ell^*=20$。步骤二(原生初始化):$H^{*}_{mm}=F_{\le\ell^{*}}(I,q)$,禁用 LoRA 的原生层跑一次得 $H_1$,切出 $h_1=P_QH_1$ 与 $v=P_VH_1$;同时 text-only 前向产生图像无关前缀缓存 $K_{txt}$。步骤三(持久视觉循环,$t=2..T$):$H_t=\mathrm{Replace}_Q(H_1,h_{t-1})$,视觉行固定为 $v$ 并保留原生因果 mask、token 顺序与位置;$\hat{h}_t=P_Qf_\phi(H_t)$;$h_t=(1-\beta)h_{t-1}+\beta\hat{h}_t$。步骤四(严格解码与训练):丢弃 $v$、$H^{*}_{mm}$ 与全部多模态/循环缓存,最小化 $\mathcal{L}_{ans}=-\tfrac{1}{|B|}\sum_i\tfrac{1}{|A_i|}\sum_j\log p_\phi(y_{i,j}\mid y_{i,<j},h_{T,i},K_{txt,i})$;AdamW、学习率 $2\times10^{-5}$、余弦调度、warmup 0.05、3 个 epoch、4 张 B200、有效批 128。

技术新颖性

新颖性有四点。其一,问题重述:首次把潜在视觉推理的状态依赖性表述为因果路径设计问题,明确区分『信息性』与『路径必要性』,并给出可操作判据(干预潜在状态后准确率是否变化)。其二,架构层面的必要性保证:必要性由解码接口的物理约束实现,不需要潜在目标、教师轨迹或重构损失,这与用训练目标诱导依赖的方法本质不同。其三,与 Universal Transformer、循环深度 Transformer 等共享层方法不同,CVRR 的循环目的是反复重读持久视觉证据、并使预测必须经过该图像条件状态,而非单纯参数共享或深度自适应。其四,效率:重用单个原生解码层使 $T=4$ 时推理延迟仅 1.146 秒、解码算力 53.96 TFLOPs、增量显存 1.16 GiB,均优于六个潜在推理基线(1.329–1.516 秒、约 59.7–59.9 TFLOPs、1.85–2.88 GiB)。

Overview of CVRR.
Figure 2: Overview of CVRR.
Query-channel corrections across recurrent transitions.
Figure 6: Query-channel corrections across recurrent transitions.
Projection-wise functional corrections across recurrence.
Figure 7: Projection-wise functional corrections across recurrence.
Localizing the causal visual-read interface.
Figure 8: Localizing the causal visual-read interface.

实验结果

主实验(Table 1)的核心不是绝对排名,而是『视觉能力能否在无旁路约束下存活』。CVRR 在严格接口下达到 V* 81.2%、MMVP pair 52.7%、BLINK 55.2%、MME-RealWorld-Lite 46.7%;而六个兼容基线在同样约束下重训后全面崩溃:V* 最高 39.8%(HyLaR)、MMVP pair 最高 2.7%、BLINK 最高 38.8%、MME-RW 最高 33.1%,例如 LVR 在 V* 上从 81.2 跌至 35.6(-44.0)、MMVP pair 从 44.7 跌至 0.7。全多模态 SFT 对照为 80.6/52.0/53.0/44.7,CVRR 在前三个基准持平或更好,MME-RW 跌幅 4.1 也小于对照的 6.1。组件消融(Table 2):去掉视觉重读使 V* 掉 12.0 点、MMVP pair 掉 34.7 点;$h_1$ 换成文本锚使 V* 从 81.2 崩到 37.2、pair 从 52.7 到 2.0;去掉学习转移掉 4.7/20.0;$T=1$ 只解码 $h_1$ 时 pair 仅 22.7。因果检验(Figure 3):损坏 $h_T$ 使 matched-swap 从 81.2 掉到 14.0,恢复多模态前缀可部分回补(noise 条件 35.6 升至 44.5);交叉状态下干净 $v$ 拯救错误 $h_1$(+14.84pp)、错误 $v$ 拖累干净 $h_1$(-14.84pp),关闭问题到视觉的 KV 连接后效应基本消失。Figure 4:MMVP 同问题替换 $h_T$ 使准确率从 73.3% 掉到 26.7%,而文本锚为 50.0%,排除『只是打乱问题表征』的解释。Figure 5/Table 6:相邻循环步因果图的余弦相似度仅 0.367/0.350,说明每步依赖的视觉区域在变化。跨骨干(Table 7):InternVL3-9B 严格接口 75.9% vs 全多模态 75.4%,损坏 $h_T$ 掉 57.1pp;Gemma-3-4B 上循环依赖较弱(swap drop 仅 7.3pp),Gemma-4-12B 严格接口反而低于全多模态 4.7 点。

Results across V*, MMVP, BLINK, and MME-RealWorld-Lite.
Table 1: Results across V*, MMVP, BLINK, and MME-RealWorld-Lite.
Component analysis on V* (n=191) and MMVP (n=300).
Table 2: Component analysis on V* (n=191) and MMVP (n=300).
Accuracy and inference cost across recurrent depths.
Table 3: Accuracy and inference cost across recurrent depths.
Inference cost compared with six latent visual reasoning baselines under a matched four-step budget.
Table 4: Inference cost compared with six latent visual reasoning baselines under a matched four-step budget.
Projection-wise functional correction magnitudes (%).
Table 5: Projection-wise functional correction magnitudes (%).
Population statistics for spatial causal re-reading on V*.
Table 6: Population statistics for spatial causal re-reading on V*.
Generalization across multimodal backbones.
Table 7: Generalization across multimodal backbones.
Causal tests of recurrent computation. (a) Corrupting hT degrades prediction under the strict path, while restoring the multimodal prefix partially compensates. (b) Clean v corrects an incorrect h1, while incorrect v degrades a clean h1 when question-to-visual KV connections are enabled (ON); blocking these connections (OFF) largely removes effects.
Figure 3: Causal tests of recurrent computation. (a) Corrupting hT degrades prediction under the strict path, while restoring the multimodal prefix partially compensates. (b) Clean v corrects an incorrect h1, while incorrect v degrades a clean h1 when question-to-visual KV connections are enabled (ON); blocking these connections (OFF) largely removes effects.
Same-question MMVP intervention with a fixed question and text-only anchor.
Figure 4: Same-question MMVP intervention with a fixed question and text-only anchor.
Step-varying causal visual influence across recurrence.
Figure 5: Step-varying causal visual influence across recurrence.
查看结构化数据
任务指标本文基线提升
V*(高分辨率视觉搜索 VQA,n=191) Overall accuracy 81.2%(D.A. 82.6 / R.P. 79.0) 预训练骨干 Qwen2.5-VL-7B-Instruct 79.6%;无旁路重训基线最高 39.8%(HyLaR) 较骨干 +1.6 个百分点;较最强无旁路基线 +41.4 个百分点
MMVP(视觉相似图像对) Pair accuracy(一对两题全对) 52.7%(item 74.7) 骨干 47.3%;无旁路重训基线最高 2.7%(HyLaR);全多模态 SFT 对照 52.0% 较骨干 +5.4 个百分点;较最强无旁路基线 +50.0 个百分点
BLINK(感知类子任务集合) Overall accuracy 55.2%(Spatial Relation 90.9、Counting 70.0、Jigsaw 62.7) 骨干 55.0%;无旁路重训基线最高 38.8%(SkiLa) 较骨干 +0.2 个百分点;较最强无旁路基线 +16.4 个百分点
MME-RealWorld-Lite(真实世界 VQA) Overall accuracy 46.7% 骨干 50.8%;全多模态 SFT 对照 44.7% 较骨干 -4.1 个百分点(但仍比 SFT 对照高 2.0 个百分点,与 Visual CoT 训练分布不匹配有关)
推理效率($T=4$,单张 B200,32 样本) 延迟 / 解码 TFLOPs / 增量显存 1.146 s / 53.96 / 1.16 GiB 六个潜在推理基线:1.329–1.516 s / 约 59.7–59.9 / 1.85–2.88 GiB 延迟降低约 13–24%,增量显存降低约 37–60%

局限与改进

作者承认三点局限:视觉读取边界 $\ell^*$ 依赖具体骨干、需逐模型定位;机制分析主要在多选题设置上进行;当前设计依赖持久固定的视觉证据而非自适应获取。我补充观察:训练只用 Visual CoT(43.8 万 QA 对),领域较窄,MME-RealWorld-Lite 上比骨干跌 4.1 点、BLINK 的 IQ-Test/Jigsaw 也有小幅下滑,暴露分布不匹配;循环深度 $T$ 是固定超参且收益非单调($T=6$ 时 V* 降至 78.5%),作者自己也强调不能当作测试时扩展律,且缺少自适应停止机制;持久证据设计无法像 DeepEyes 等方法那样按需获取新区域或放大细节,对需要主动视觉搜索的高分辨率任务可能受限;因果与机制分析多采用受限的首选项 token 读出,与生成式评测设定不同;跨骨干实验显示效果有选择性——Gemma-3-4B 上循环依赖很弱、Gemma-4-12B 严格接口反而低于全多模态续算 4.7 点,说明『严格接口不掉点』并非对所有架构成立;此外未验证开放式长文本生成场景,单一 $h_T$ 是否足以承载长推理链仍是未知数。

独立分析的弱点

独立分析几点弱点。第一,边界定位是骨干特定的手工流程:需对每个新骨干做激活补丁扫描(Qwen2.5-VL 得 $\ell^*=20$,Gemma-3-12B 为 25、InternVL3-9B 为 35),且 Gemma-4-12B 上严格接口反而掉 4.7 点,改进方向是让边界选择自动化或可学习,例如基于『问题充分性—残余视觉影响』曲线自动选层,或引入逐样本软边界。第二,视觉证据在整个循环中固定不变,无法按推理需要重新获取、裁剪或放大新区域,在需要多轮视觉搜索的任务上不如显式工具调用方法,改进方向是让循环状态决定下一步读取哪些区域(可微分的证据获取策略或强化学习)。第三,训练分布单一导致 MME-RealWorld-Lite 下降,改进方向是混合多领域指令数据并做领域平衡采样。第四,$T$ 固定且收益非单调,改进方向是基于状态变化量 $\|\Delta h_t\|$ 的自适应深度或早停准则,把循环深度变成按样本难度分配的计算资源。第五,评估以多选题为主,开放式生成下单状态 $h_T$ 是否够用存疑,可探索多状态并行或分段循环;第六,只训练单层 LoRA 虽高效,但也把循环计算的表达上限锁死在单层上,可研究多层共享组的收益。

未来方向

作者提出的方向是把因果路径必要性扩展到更自适应、开放式的多模态推理。基于本文成果还可延伸:其一,把严格接口思想搬到纯文本连续潜在推理(如 Coconut 类方法),检验文本域的潜在计算是否同样存在旁路问题,把『信息性 vs 必要性』的辨析推广为潜在推理的通用评估标准;其二,将循环重读与主动视觉工具(裁剪、放大、再检索)结合,形成『潜在推理驱动视觉获取』的闭环,并用本文的因果干预作为『是否真正使用了新证据』的检验手段;其三,系统研究边界层 $\ell^*$ 与模型规模、架构的关系(文中 20/22 区域在 Qwen 上有效,InternVL3-9B 则为 35),建立跨骨干的边界选择理论;其四,把步变因果图(相邻步余弦仅约 0.35–0.37)发展成可解释性工具,追踪每个循环步关注哪些图像区域、如何逐步聚焦到问题相关对象;其五,在更大骨干与更高分辨率输入上检验能力保留与循环依赖的规模律,并以因果干预指标而非仅基准分数来评价潜在推理方法的有效性。

复现评估

复现条件较好但算力门槛高。代码匿名公开(anonymous.4open.science/r/CVRR-D43E),附录 B 完整给出超参:AdamW、学习率 $2\times10^{-5}$、余弦调度、warmup 0.05、梯度裁剪 1.0、3 个 epoch、有效批 128、bf16、seed 0、$\beta=0.5$、$T=4$、LoRA rank 32 / $\alpha=16$ / dropout 0.01、视觉 token 上限 8192;可训练参数仅约 288 万(0.0348%)。训练硬件为 4 张 NVIDIA B200 180GB,这是主要门槛;训练数据 Visual CoT(438K)与四个评测基准均公开可得。论文报告了 bootstrap 95% 置信区间(MMVP 按图像对聚类重采样)、消融用 Holm 校正,并明确区分主基准与机制分析的评测协议,还给出六个基线无旁路重训的实现条件(PEARL 因接口不兼容被排除)。边界定位只用训练对、不接触评测集,附录 H 用独立训练的边界扫描验证了 20–22 层区域。总体而言代码、数据、协议齐备,7B 规模训练在单机 4 卡 A100/H100 上应可行但偏紧,复现难度中等。