视觉推理中的局部性与长度泛化 On Locality and Length Generalization in Visual Reasoning
局部感知加循环计算让视觉模型获得长度泛化能力
前置知识
长度泛化 (Length Generalization)
指模型在训练时只见过某种长度(如序列长度、对象数量)的任务,但在测试时被要求处理比训练长度更长的情况时仍能正确泛化的能力。这是衡量模型是否真正学会组合式 (compositional) 算法而非死记硬背的关键指标,常见测试如二进制序列奇偶性 (parity)。
本文核心就是将语言模型中研究得非常成熟的长度泛化范式迁移到视觉推理,判断视觉模型是否学到了真正可外推的算法。
状态跟踪 vs 召回 (State Tracking vs Recall)
状态跟踪任务要求模型按顺序更新一个内部状态(如奇偶性累加、有限状态机迁移),输出依赖于整段历史的有序处理;召回任务则是 key-value 检索,模型只需找出某个目标是否存在,结果与处理顺序无关。前者天然需要循环计算,后者可以用全局并行计算解决。
论文的核心结论是局部+循环只在状态跟踪任务上带来 OOD 泛化收益,在召回任务上反而全局模型更强——理解这一区分才能正确解读实验结果。
中央凹视觉 (Foveated Vision)
受人类视觉系统启发的感知机制:人眼通过中央凹获取高分辨率的局部细节,同时用周边视觉 (peripheral) 提供低分辨率的广角上下文,再通过眼跳 (saccades) 把高分辨率中央凹移动到感兴趣位置。本文模型 FOVEAGENT-LSTM 就模仿这个机制,每步同时输入一个高分辨率局部一瞥和一个低分辨率外周一瞥。
中央凹机制是论文解决『既要小一瞥防 shortcut,又要大一瞥做导航』这一矛盾的关键设计,理解它才能看懂 Figure 3 和 Figure 6 的实验。
循环网络 vs Transformer 在状态跟踪上的差异
已有研究(如 Merrill et al. 2024、Ebrahimi et al. 2024)表明 Transformer 由于全局注意力机制容易学到『捷径 (shortcut)』解,无法做真正的随机访问寻址;线性 RNN 和状态空间模型 (Mamba、xLSTM) 同样不行;只有非线性循环网络 (LSTM/GRU/RNN) 能将推理任务分解为真正的逐步计算,从而具备长度泛化能力。
本文的 H2 假设(循环是 OOD 泛化必要条件)直接来自这条脉络,Figure 8 的实验就是把这一结论从文本迁移到视觉。
全局 vs 局部感知 (Global vs Local Perception)
全局感知指模型在一次前向中看到整张高分辨率图像(如标准 ViT/VLM);局部感知指模型每步只看到图像的一小块区域,需要多步累积信息。论文证明:即使骨干网络是循环的,只要看到全图,模型仍会学到依赖全局统计的捷径解,从而无法 OOD 泛化。
这是论文最反直觉的发现之一——光有 recurrence 不够,必须配合局部感知(H1 假设),Figure 5 专门验证这一点。
研究动机
当前主流视觉和视觉-语言模型(如 QWEN2.5-VL、GPT-5.4、Claude Sonnet 4.6)在图像描述、视觉问答等任务上已达人类水平,但这些模型全部依赖『单次前向、全局编码』的范式:图像被切成 token 序列一次性送入,模型在每一步推理时都对全部 token 做自注意力。这与人类视觉通过眼跳 (saccades) 串行收集局部一瞥的机制截然不同。问题在于:当任务长度超过训练范围——例如训练时只见过 2–10 个开关,测试时要处理 11–20 个开关——这些全局模型会快速退化。语言模型领域的同类研究表明,这种退化源于全局注意力学到了与长度绑定的『捷径 (shortcut)』解而非真正的组合式算法。作者指出,在视觉任务中问题更严重:模型不仅要执行抽象推理,还要先在二维画布上『收集』分散的局部信息,而这一『信息收集』环节在文本任务中被分词器掩盖了,是被视觉推理独有且长期被忽视的失败源。
本文的目标是本文要回答一个根本问题:串行、局部的视觉处理机制到底是进化的副产品,还是计算上确实必要?为此作者构建了一组可严格控制任务长度的视觉推理测试集(VISUAL PARITY、STATE MACHINE、RECALL、FINDING ROOTS),并训练一个仿生中央凹模型 FOVEAGENT-LSTM,验证两个具体假设:H1 局部感知是 OOD 泛化的必要条件,H2 循环计算是 OOD 泛化的必要条件,二者合起来 (H3) 是充分条件。目标是用准确率这一可量化指标证明:在状态跟踪类任务上,训练于 2–10 个开关、1200×800 分辨率的模型,能稳定泛化到 11–20 个开关、不同分辨率;并进一步在真实世界的 FINDING ROOTS 任务上验证局部高分辨率一瞥能带来显著精度提升。
与已有工作不同的是,已有长度泛化研究几乎全集中在语言模型,因为文本任务里相关符号已经被分词器预先切成有序 token 序列送入模型——『信息已被收集好』。论文作者敏锐地指出:视觉任务的难点恰恰在于模型必须自己决定去哪里看、看什么、何时停止,这种『主动信息收集』是被既有工作完全忽视的维度。此外,以往用循环网络做视觉 OOD 的工作(Veerabadran et al. 2023)让循环模型看整张图,导致随图像变大性能急剧下降;Lotfi et al. 2025 用卷积网络做全局修改。本文第一次把『感知接口(局部 vs 全局)』和『计算骨干(循环 vs 全局)』两个维度正交分离、独立研究,从而定位到『局部感知』这个一直被掩盖的必要条件。
核心方法
直觉层面,作者把模型设计成『会主动看』的眼睛:每次只盯住画面上一小块高分辨率区域(中央凹),同时用一张模糊的低分辨率大图作为周边视觉指引下一步往哪看,看完更新内部状态,再决定下一眼的位置,如此循环直到收集够信息输出答案。技术路线上,模型名为 FOVEAGENT-LSTM,骨干是一个 4 层 LSTM(Hochreiter & Schmidhuber 1997),视觉编码器是 ResNet-18(He et al. 2016)。每步输入两个一瞥:一个 80×80 分辨率的局部高分辨率一瞥 $G_l$,和一个尺寸为 4 倍、但下采样到同样 80×80 传感器分辨率的外周一瞥 $G_p$。两个一瞥分别过 ResNet-18 后拼接,送入 LSTM,输出三类信号:probe(当前一瞥看到什么)、action(下一眼去哪)、task(最终答案)。下采样到固定传感器分辨率是关键,目的是『饿死』外周一瞥,让它只能做导航而无法计算全局捷径。
全文最核心的论点是:OOD 长度泛化需要『局部感知』和『循环计算』两个条件同时成立,缺一不可。这有两个层面的反直觉发现。第一,光有循环骨干不够:作者做了对照实验(Figure 5),同样用 LSTM 骨干,只要让它看到整张高分辨率图(Global 设置)或同时看到局部+全图(Local+Global 设置),它在训练分布内表现优秀,但一到 OOD 就崩盘——因为模型学会了利用全局统计的捷径。第二,光有局部感知也不够:Figure 8 把同一串局部一瞥喂给不同骨干,只有 LSTM/RNN/GRU 这种严格循环结构能泛化,Transformer、Mamba、xLSTM 全部失败。中央凹的双分辨率设计(高分辨率中央凹 + 低分辨率外周)则是同时满足『要小一瞥防捷径、要大一瞥做导航』这一矛盾的优雅解法,Figure 6 显示外周的最佳分辨率是 80、最佳尺度是 4 倍,再大或再小都会变差。
方法步骤详情
训练分四步:1) 用 Gymnasium 环境生成任务图像与 oracle 策略轨迹,每条含局部一瞥 $G_l$、外周一瞥 $G_p$、动作 $A$、probe $P$、问题 $Q$、答案 $O$;合成任务各 5 万条,FINDING ROOTS 用 MathSearch 的 2 万样本。2) FOVEAGENT-LSTM 从 $(0,0)$ 出发,每步 LSTM 输出动作 $(\theta,d)$ 和 probe,下一眼 $x_{t+1}=x_t+d\cdot u_t(\theta)$,约束 $0\le d\le G_p$ 保证不跳出外周,并输出停止位 $s\in\{0,1\}$。3) STATE MACHINE 转移形式化为二面体群作用 $\delta((s,b),\text{advance})=(s+b\pmod S,b)$、$\delta((s,b),\text{reverse})=(s,-b)$,$S=3$ 保证推理时不遇训练未见的状态值。4) Adam 优化器、学习率 $1\times10^{-4}$、batch 48、4 块 A100 训练 20 万步,每 1 万步选最优 checkpoint,且必须访问所有任务相关对象才算正确。
技术新颖性
本文新颖性在于三处正交分离。第一,把『视觉接口』(局部 vs 全局)与『计算骨干』(循环 vs 全局注意力)做成两个独立可控的实验轴,分别用 Figure 5 和 Figure 8 隔离验证,从而把以往混为一谈的『为什么全局模型不行』拆解清楚。第二,引入『中央凹+外周』的双分辨率机制解决 glimpse 尺寸的根本矛盾:以往工作要么用固定尺寸一瞥(导航能力差),要么用全图(学捷径),本文用 4× 尺度+下采样到固定传感器分辨率的方式让外周只负责导航、中央凹只负责识别,这一设计在 Figure 6 中被定量证明有最优点。第三,与 Veerabadran et al. 2023『循环+全图』、Lotfi et al. 2025『CNN 全局修改』不同,本文强调局部感知本身是一个被忽视的归纳偏置 (inductive bias),而非单纯实现细节。
实验结果
实验系统性支持三个假设。Figure 4 是核心结果:FOVEAGENT-LSTM 训练于 2–10 个开关、1200×800 分辨率,在 11–20 个开关和各种分辨率下准确率几乎不掉;QWEN2.5-VL-3B 分布内好但 OOD 急剧下滑;GPT-5.4、Claude Sonnet 4.6 少样本同样糟糕。Figure 5 证明 H1:同样 LSTM 骨干,Global 和 Local+Global 设置 OOD 都崩,只有纯 FOVEAGENT-LSTM 保持高位。Figure 8 证明 H2:同一串局部一瞥喂不同骨干,只有严格循环结构(LSTM/RNN/GRU)能泛化,Transformer、Mamba、xLSTM、QWEN2.5-VL-3B 全部失败。Figure 9 的 RECALL 给出反证:QWEN2.5-VL-3B 反超 FOVEAGENT-LSTM,因召回不需状态跟踪、全局并行更合适。Table 1 的 FINDING ROOTS 上,G(1200,800)+L 在 InD 达 82.26%、OOD-subplots 达 77.24%,纯全局基线仅 57.24% 和 50.12%;Figure 10 显示相同 token 预算下 FOVEAGENT-QWEN 几乎翻倍精度,全局 10× 算力仅 +3.8%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VISUAL PARITY / STATE MACHINE(OOD,11–20 个开关) | Success Rate | FOVEAGENT-LSTM 在 OOD 任务长度上保持高位平缓曲线(见图 4) | QWEN2.5-VL-3B-INSTRUCT 随开关数增加急剧下滑;GPT-5.4、Claude Sonnet 4.6 少样本同样差 | 全局 VLM 在 OOD 几乎归零,FOVEAGENT-LSTM 维持接近 InD 水平 |
| FINDING ROOTS(In-distribution) | Accuracy (%) | FOVEAGENT-QWEN G(1200,800)+L:82.26% | 全局 QWEN2.5-VL-3B G(1200,800):57.24% | +25.02 个百分点 |
| FINDING ROOTS(OOD-subplots) | Accuracy (%) | FOVEAGENT-QWEN G(1200,800)+L:77.24% | 全局 QWEN2.5-VL-3B:50.12% | +27.12 个百分点 |
| FINDING ROOTS(OOD-numroots) | Accuracy (%) | FOVEAGENT-QWEN G(1200,800)+L:67.12% | 全局 QWEN2.5-VL-3B:32.63% | +34.49 个百分点 |
| FINDING ROOTS(算力匹配对比) | Accuracy (%) | FOVEAGENT-QWEN 在相同 token 预算下接近翻倍精度 | 全局模型 10× 算力 | 同等算力 +29.0% Acc;全局 10× 算力仅 +3.8% |
| RECALL(视觉检索) | Accuracy | FOVEAGENT-LSTM | QWEN2.5-VL-3B-INSTRUCT 显著更优 | 全局模型反超——证明局部+循环不是万能,状态跟踪任务才适用 |
局限与改进
作者明确承认几个局限:第一,局部感知策略是用模仿学习基于 oracle ground-truth 策略训练的,对于合成任务很容易生成 oracle,但要在广泛的真实任务上学习通用策略仍是开放问题,可能需要强化学习或与 IL 结合。第二,FINDING ROOTS 上的 OOD-numroots 只是『中等程度的外推』(从相近的根数外推),并非合成状态跟踪任务上那种严格的系统性长度泛化,因此这部分结果只能支持『中央凹感知有助于收集视觉证据』,不能直接证明 OOD 状态跟踪能力。第三,论文没有真正循环的预训练 VLM 骨干,所以 FINDING ROOTS 上不得不使用 FOVEAGENT-QWEN(即 Transformer 骨干+中央凹输入),这与合成任务的循环骨干不一致。我自己观察的局限还包括:所有合成任务的视觉风格非常简单(圆形开关、箭头),与现实图像差距大;评估指标对 FOVEAGENT-LSTM 强制要求『访问所有任务对象』,这一约束可能高估了它的相对优势;缺乏在更大规模(数十万样本、自然图像)上的验证。
独立分析的弱点
第一个弱点是 oracle 策略依赖:训练数据来自手工设计的 oracle(如沿箭头访问、找到下一个未访问开关),现实任务很难定义这种『正确扫视轨迹』。改进方向是用 RL 让模型自己探索、或用大规模人类眼动数据做行为克隆,配合 curriculum learning 逐步扩大任务长度。第二个弱点是合成任务到自然图像的鸿沟:开关、箭头这类符号化元素与真实场景的纹理、遮挡、光照差距极大,FOVEAGENT-LSTM 的 ResNet-18 视觉骨干对自然图像可能严重欠拟合。改进方向是用预训练的 DINOv2/SigLIP 等强视觉编码器替换 ResNet-18,并把中央凹机制做成可插拔模块嵌入现有 VLM。第三个弱点是步数开销:局部感知天然比全局前向慢若干倍(需多步串行),在实时性要求高的场景(机器人、AR)部署困难,改进方向是用投机解码式的并行预测批量提交一瞥位置,或训练一个『终止预测器』提前停止。第四个弱点是评估协议对 FOVEAGENT-LSTM 的『必须访问全部对象』要求带有利偏见,公平起见应同时报告松弛指标(只看最终答案正确性)以便和 VLM 严格对齐。
未来方向
作者明确提到的方向包括:把局部视觉注意力策略从模仿学习扩展到强化学习或 IL+RL 混合,以支持更多样化任务;探索循环计算在视觉推理中是否也像 Ebrahimi et al. 2026 在语言模型中那样能显著提升分布内数据效率。基于本文成果可延伸的方向至少还有:构建一个真正循环骨干的大规模预训练视觉-语言模型(目前不存在),从而把 H1+H2 的结论在真实任务上联合验证;把中央凹机制引入机器人操作和具身导航(那里主动感知天然必要);研究多智能体协同中央凹——多个『眼睛』并行扫描不同区域以缓解步数开销;在人机交互场景中用人类眼动数据微调一瞥策略,让模型的可解释性天然对齐人类注意力。
复现评估
复现门槛中等偏上。有利因素:作者给出了较完整的实现细节——4 层 LSTM + ResNet-18、Adam 学习率 $1\times10^{-4}$、batch 48、4 块 A100、20 万步;FINDING ROOTS 基于公开 MathSearch 数据集;环境用标准 Gymnasium;附录 C 给出 STATE MACHINE 形式化构造和 oracle 轨迹伪代码。不利因素:合成任务(VISUAL PARITY 等)的数据生成与 oracle 策略代码是否随论文开源需查补充材料;论文未公开 checkpoint 或完整训练曲线;算力需求约 4 块 A100 训练数天,学术实验室可承受但个人偏高;评估中『必须访问全部对象』判定脚本需自行实现。整体估计:有 RL/序列建模经验的团队 2–4 周可复现合成任务主结果,FINDING ROOTS 复现需额外 1–2 周对接 MathSearch。
论文图表
这张总览图把全文核心问题可视化:当测试任务长度超出训练范围时,全局模型(单次前向看全图)会学到失效的捷径,而中央凹循环模型把任务分解为重复的『局部观察+状态更新』步骤,从而支持向更长视觉序列泛化。
这是理解全文论点的入口图,一眼就能抓住『全局 vs 局部』的核心对立和『长度泛化』这一目标。如果不看这张图,读者很难快速建立对论文立意的整体认知。
展示了四个测试任务的样例:VISUAL PARITY(开关奇偶性)、STATE MACHINE(带箭头的有序状态机)、RECALL(在干扰物中找特定颜色+形状的目标)、FINDING ROOTS(在含干扰子图中找函数零点)。每个任务都可控制任务长度来构造 OOD。
理解这四个任务是读懂全部实验的前提,特别是要区分状态跟踪类(前两个+第四个)与召回类(第三个),否则无法理解 Figure 9 的反直觉结论。