← 返回 2026-08-12

JigShape:通过拼图游戏评估视觉语言模型的视觉-几何推理能力 JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao 📅 2026-08-04 👍 7 2026-08-17 18:30
基准评测 空间推理 视觉语言模型

用凹凸互锁拼图构建无歧义基准,揭示VLM几何推理随网格增大全面崩塌

前置知识

视觉语言模型(VLM)

视觉语言模型是以大语言模型为核心、接入视觉编码器(如 ViT)的多模态模型,能把图像与文本统一到同一表示空间,完成图像问答、描述、文档理解与多模态推理。它先把图像切成 patch 由视觉塔编码,再与文本 token 一起送入语言模型自回归地生成答案。GPT-5.5、Claude Opus 4.8、Grok-4.2、Qwen3-VL-8B、Gemma3-12B 都是这类模型。

本文的评测对象就是 VLM,理解其 patch 化视觉输入与自回归输出方式,才能明白为什么密集拼图(单块极小、需输出大量坐标)对它们格外困难。

Tab-and-Blank 互锁边界

真实拼图块的边不是直线,而是凸榫或凹槽:相邻两块共享边必须一凸一凹互补才能拼合。JigShape 为每条内部边随机指定榫/槽极性,每块的四边签名 $(e_{top}, e_{right}, e_{bottom}, e_{left})$ 构成几何约束;平边只出现在外框,故 2 条平边为角块、1 条为边块、0 条为内部块。

这是全文核心机制:几何约束把有歧义的视觉匹配任务变成有唯一解的约束满足问题,并使“有形状 vs 无形状”的成对消融成为可能。

监督微调(SFT)

监督微调是在标注好的输入-输出数据上用交叉熵损失继续训练预训练模型,使其掌握特定任务的格式与技能。本文用混合网格数据(4×4:3K、8×8:2K、12×12:1K、16×16:0.5K,共 6.5K 样本)微调 Qwen3-VL-8B 与 Gemma3-12B 各 1 个 epoch,学习率 $1\times10^{-5}$、有效 batch 64、BF16 加 FlashAttention-2。

SFT 提供了“任务可学性”的上界参照:4×4 上超过 97% 说明任务本身可学,随后在更大网格上崩塌才构成“缩放悬崖”这一核心结论。

评测指标 PA / EM / AA / SC

Piece Accuracy(PA)是被放到正确位置的块的比例 $PA=\frac{1}{N^2}\sum_{i}\mathbb{1}[\hat{p}(i)=p^*(i)]$;Exact Match(EM)是整局全对的实例比例;Adjacency Accuracy(AA)是预测中正确保留的真实相邻对比例(4×4 随机基线 20%);Shape Compatibility(SC)是预测相邻边中榫槽相容的比例(4×4 随机基线 30.8%)。

四个指标分别度量全局正确、整体解、局部连贯与几何利用程度,论文所有结论(如 SFT 依赖形状捷径)都建立在它们的差分比较之上。

组合复杂度与随机基线

$N\times N$ 拼图共有 $(N^2)!$ 种排列:4×4 约 $2\times10^{13}$、8×8 约 $10^{89}$、16×16 约 $10^{507}$,难度指数级增长。随机猜测的 PA 为 $1/N^2$(4×4 为 6.25%),而 AA 与 SC 因平边效应各有网格相关基线(4×4 到 16×16 的 SC 基线为 30.8%–44.1%,经 $2\times10^6$ 次蒙特卡洛模拟验证)。

只有对照这些随网格变化的随机基线,才能判断模型是“真推理”还是“瞎猜”,这正是先前矩形切块基准所缺失的严谨性。

研究动机

现有拼图类评测基准全部采用矩形切块,带来两个根本缺陷。其一是真值歧义:图像切成矩形小块后,天空、草地、墙面等重复纹理区域在视觉上无法区分,例如一张风景图的三个天空块可以任意互换而感知上完全等价,但标准答案只承认一种排列,导致“答错”可能只是标签任意而非推理失败,评测本身是病态的。其二是网格密度过低:Jigsaw-Puzzles 只用 2×2 与 3×3(最好模型 Gemini-2.5-Pro 总体 77%,但开放式排序生成仅 30%),JPwLEG 与 Visual Jigsaw 也只到 3×3/5×5;$3 imes3$ 仅有 $9!?pprox3.6 imes10^5$ 种排列,而 $8 imes8$ 有 $64!?pprox10^{89}$ 种。粗糙网格既限制难度上限,也可能被“匹配边缘颜色”这类简单启发式破解,无法真正压力测试空间推理。

本文的目标是论文的目标是把拼图求解改造成一个良构的联合视觉-几何推理评测。做法是用真实拼图的凹凸互锁边界提供强局部相容性约束,结合每块独一无二的视觉内容,保证每个实例存在唯一正确解,从根上消除矩形切分的真值歧义;同时把网格密度从 4×4 一路扩展到 16×16(16 到 256 块),覆盖 $2 imes10^{13}$ 到 $10^{507}$ 的排列空间,以测量性能随组合复杂度的衰减曲线。数据上基于 23,742 张高清源图(DIV2K 900 张、DIV8K 1,500 张、Unsplash 21,342 张)生成 95,468 个实例,并成对构造带形状/无形状两个版本,使“模型是否真正利用边界几何”成为可精确测量的变量,共评测 5 个前沿 VLM 的 6 种零样本配置与 2 个微调模型。

与已有工作不同的是,本文的独特切入是把“边界几何”从被忽略的背景提升为一等评测维度。此前所有拼图基准(Jigsaw-Puzzles、JPwLEG、Visual Jigsaw、Jigsaw-R1)都用矩形切分:无形状约束、不保证解唯一、更没有形状消融,因此无法区分模型是败于空间推理还是败于监督歧义。JigShape 让每条内部边随机分配凸榫/凹槽极性,使几何签名随实例变化、无法死记;平边显式标记角块与边块,让几何本身携带可推理的位置信息;再通过同源图、同排列的 shape/no-shape 成对消融直接量化几何约束的贡献。这把拼图评测从“视觉匹配是否正确”升级为“视觉内容与几何约束如何联合满足”,是一个干净的可控实验设计。

核心方法

直觉上,JigShape 让模型做一件人类儿童都会做的事:看一张散落且标了编号的拼图,输出每块编号到正确网格位置 $(row, col)$ 的映射。形式化地,一个实例是四元组 $(I, G, E, \pi)$:$I$ 为源图,$G$ 为 $N imes N$ 网格,$E$ 把每条边映射到 {tab, blank, flat},$\pi$ 是把块 ID 打乱到展示位置的随机排列。模型输入是按 ID 顺序排布、每块印有数字标签的打乱布局图,输出 JSON 形式的 ID→位置映射。评测在 4×4/8×8/12×12/16×16 四档密度上各取 250 个 eval 样本,用四个指标衡量:Piece Accuracy($PA=\frac{1}{N^2}\sum_i\mathbb{1}[\hat{p}(i)=p^*(i)]$)、Exact Match(全对才计 1)、Adjacency Accuracy(AA,相邻对正确率)与 Shape Compatibility(SC,预测相邻边中榫槽相容比例)。

核心创新是凹凸互锁边界带来的双重信息。第一是局部相容性约束:相邻块必须满足 $E(p_i,\text{right})=\text{tab}\Leftrightarrow E(p_j,\text{left})=\text{blank}$,每条内部边随机分配极性,几何签名随实例变化、无法死记;该约束大幅压缩合法搜索空间,与每块独有的视觉内容结合后保证解唯一(作者用带回溯搜索与约束传播的经典求解器在四档网格各 500 个测试实例上 100% 复原,验证解唯一)。第二是全局位置线索:平边只出现在外边界,2 条平边即角块、1 条即边块、0 条即内部块,模型可先定位再配对。此外 tab 区域携带邻格像素内容,模拟真实拼图的视觉连续性线索。这与矩形切块“只有视觉内容、无几何约束”形成本质区别,是让评测从病态变良构的关键。

方法步骤详情

生成流水线分五步,全程由随机种子决定、完全可复现:(1) 图像预处理:用 Lanczos 重采样把源图缩放到两维均可被 $N$ 整除;(2) 边分配:$N imes N$ 网格共 $2N(N-1)$ 条内部边各自等概率随机指定 tab/blank 极性,边界边置 flat;(3) 形状掩码与内容提取:tab 为半径 $r=\text{tab ratio}\times\min(h,w)/2$ 的半圆凸起(tab ratio 从 4×4 的 0.15 到 16×16 的 0.28 递增以保证可见性),用 alpha 掩码提取块内容,tab 区携带邻格像素;(4) 布局合成:块 ID 经随机排列 $\pi$ 后按 ID 序排布并印上数字标签,不做旋转以保证解唯一,版面从 724×744 到 3292×3312 像素;(5) 质量验证:块须能重新拼合精确复原原图,并用经典求解器确认唯一解。数据按源图划分 train 91,968 / eval 1,000 / held-out test 2,000 / no-shape 500,杜绝同图跨集泄漏。

技术新颖性

技术新颖性有三点。首先,它是首个引入物理互锁形状约束的 VLM 拼图基准:与 Table 1 中的 Jigsaw-Puzzles(最大 9 块)、JPwLEG(25 块)、Visual Jigsaw(9 块)、Jigsaw-R1(4 块)相比,JigShape 最大 256 块、9.5 万实例,且是唯一同时具备形状约束、唯一解保证与形状消融的基准。其次,随机极性 + 禁止旋转 + 按 ID 排布的设计在保证唯一解的同时封死了“ID 与位置相关”的捷径,系统提示还显式警告块号与位置无关。第三,混合网格微调(1 epoch、$1\times10^{-5}$、batch 64、BF16+FlashAttention-2)给出“任务可学性”上界,成对 no-shape 消融提供归因工具,两者共同把模型失败分解为“学不会”与“不善用几何”两类,这是以往基准做不到的诊断粒度。

Example 12×12 puzzle instance from JigShape.
Figure 2: Example 12×12 puzzle instance from JigShape.
Example instances from JigShape.
Figure 4: Example instances from JigShape.

实验结果

零样本中仅 GPT-5.5 超过随机:4×4 上 PA 69.65%、EM 26.40%(随机 6.25%),SC 71.33% 远超随机基线 30.8%,真正联合了视觉与几何线索;其余五个零样本配置的 PA 仅 6.62%–11.97%,EM 全为 0。网格增大后零样本全线崩塌:GPT-5.5 在 8×8 跌至 4.37%、12×12 仅 0.67%,已接近随机水平。SFT 证明任务可学:Qwen3-VL-8B/Gemma3-12B 在 4×4 达 97.28%/97.82% PA、约 90% EM,但出现缩放悬崖:8×8 降至 27.34%/33.58%,12×12 仅 3.44%/4.57%,16×16 归于随机。形状消融中 GPT-5.5 去形状后跌至 23.90%,SFT 模型崩至 10.00%/13.78%,说明微调主要学到几何捷径而非视觉推理;位置分解呈 corner > edge > interior(12×12 上 Gemma3-12B 角块 39.70%、内部块仅 1.78%);60/64 块已定位时 GPT-5.5 对剩余 4 块仍仅 25% PA。

Comparison with existing jigsaw-style benchmarks.
Table 1: Comparison with existing jigsaw-style benchmarks.
Grid configurations in JigShape.
Table 2: Grid configurations in JigShape.
Benchmark split statistics.
Table 3: Benchmark split statistics.
Main results: Piece Accuracy (PA) and Exact Match (EM) on JigShape.
Table 4: Main results: Piece Accuracy (PA) and Exact Match (EM) on JigShape.
Auxiliary metrics: Adjacency Accuracy (AA) and Shape Compatibility (SC) on JigShape.
Table 5: Auxiliary metrics: Adjacency Accuracy (AA) and Shape Compatibility (SC) on JigShape.
Shape vs. No-Shape ablation on 4×4 puzzles.
Table 6: Shape vs. No-Shape ablation on 4×4 puzzles.
Position-based accuracy (%) for SFT models.
Table 7: Position-based accuracy (%) for SFT models.
Comparison of baseline SFT vs. weighted SFT on Qwen3-VL-8B across all metrics.
Table 8: Comparison of baseline SFT vs. weighted SFT on Qwen3-VL-8B across all metrics.
Effect of visual similarity hints on 8×8 puzzles (Qwen SFT).
Table 9: Effect of visual similarity hints on 8×8 puzzles (Qwen SFT).
Clue benchmark results on 8×8 puzzles.
Table 10: Clue benchmark results on 8×8 puzzles.
Visual similarity hint.
Figure 3: Visual similarity hint.
查看结构化数据
任务指标本文基线提升
4×4 拼图(零样本) Piece Accuracy / Exact Match GPT-5.5 69.65% / 26.40% 随机基线 6.25% / 0% +63.4 个百分点,六个零样本配置中唯一超过随机基线的模型
4×4 拼图(监督微调) Piece Accuracy / Exact Match Gemma3-12B 97.82% / 89.20%;Qwen3-VL-8B 97.28% / 90.80% 随机基线 6.25% / 0% 证明任务在监督信号下完全可学习,4×4 接近解决
8×8 拼图(零样本) Piece Accuracy GPT-5.5 4.37%(其余模型 1.38%–1.66%) 随机基线 1.56% GPT-5.5 优势消失,所有零样本模型退化为随机水平,缩放悬崖显现
12×12 拼图(SFT) Piece Accuracy Gemma3-12B 4.57%;Qwen3-VL-8B 3.44% 随机基线 0.69% 较自身 4×4 成绩(约 97%)下跌逾 93 个百分点
16×16 拼图(SFT) Piece Accuracy Qwen3-VL-8B 0.40%;Gemma3-12B 0.35% 随机基线 0.39% 与随机无异,256 块任务完全失败
形状消融(4×4,同图同排列) Piece Accuracy(无形状 vs 有形状) Qwen3-VL-8B 97.28%→10.00%;Gemma3-12B 97.82%→13.78%;GPT-5.5 69.65%→23.90% 随机基线 6.25% 量化几何约束贡献:SFT 模型依赖形状捷径,GPT-5.5 真正联合利用几何与视觉

局限与改进

作者承认且可观察到的局限:评测集较小,每档网格仅 250 个样本,EM 这类稀有指标的置信区间很宽;前沿模型未测 16×16(以 12×12 已随机化为由省略),“缩放悬崖”在最极端密度上缺少直接证据;强制 JSON 输出且无效输出计零,会把格式失败混入推理失败,12×12 起需一次输出 144–256 个坐标,输出长度本身可能成为瓶颈;任务不涉及旋转,与真实拼图设定有差距;no-shape 消融只做了 4×4(更大矩形网格本就无唯一解),无法观察几何依赖随密度的变化;SFT 只覆盖两个 8B/12B 级模型、仅 1 个 epoch,未探索 RL、思维链提示或搜索增强,“架构性极限”的结论略显超前。我的补充观察:经典求解器能 100% 解决全部网格,说明任务对符号搜索方法完全可解,评测真正揭示的是 VLM 缺乏显式约束传播机制,而非任务无解。

独立分析的弱点

独立分析有四个弱点。其一,输出协议苛刻:要求一次性输出全部 $N^2$ 个坐标的 JSON,12×12 起输出就可能截断或格式崩坏,解析失败计零分混淆了“写不下”与“想不出”,改进方向是分块/增量作答或逐块选择的评测协议。其二,16×16 版面达 3292×3312 像素,经 VLM 内部下采样后单块可能只剩几十个像素,视觉信息或低于可辨识阈值,应补充“逐块裁剪单独输入”的对照实验剥离分辨率因素。其三,“架构无法扩展”的结论主要基于 1 个 epoch 的 SFT 负结果(逆精度加权的 Table 8 甚至更差),缺少课程学习、GRPO 式 RL 或测试时搜索的尝试,因果证据链不完整。其四,聚合指标难以诊断失败模式,SC 基线推导虽严谨(30.8%–44.1%,经 $2\times10^6$ 次蒙特卡洛验证),但可增加按位移距离的误差热图与逐边相容性分析,把“不会全局布局”与“不会局部匹配”分开度量。

未来方向

作者建议三个方向:跨网格密度的课程学习、鼓励视觉-几何联合整合的训练目标(如在无形状数据上也施加强约束的奖励)、以及具备组合约束满足能力的新架构(显式约束传播、把 DiffAssemble 式图扩散组装迁移到通用 VLM)。基于本文成果还可延伸:把 JigShape 用作 RLVR 的训练信号来源,检验拼图奖励能否泛化到检测、分割等下游空间任务(呼应 Visual Jigsaw、Jigsaw-R1、PuzzleCraft 一系工作);引入旋转与任意裁剪形状把任务推向更接近真实拼图;研究测试时搜索或工具调用(让模型调用经典求解器式推理)能否弥合与 100% 求解器的差距;把 clue benchmark(extreme60 只剩 4 块仍仅 25% PA)发展成细粒度空间定位的诊断子任务,用于指导数据构造与架构改进。预留的 2,000 个 held-out 测试集为后续公开比赛与公平比较提供了基础设施。

复现评估

复现条件相当好。数据集已在 HuggingFace 发布(ShawnLi02/JigShape-Train),作者承诺开源完整生成流水线、评测代码与配置;流水线对随机种子完全确定,源图来自 DIV2K/DIV8K(学术许可)与 Unsplash(宽松许可),无版权障碍,并用经典约束求解器(四档网格各 500 实例 100% 复原)公开验证解唯一性。评测需调用 5 个前沿商业 API(GPT-5.5、GPT-5.4-mini、Grok-4.2 双模式、Llama-4-Maverick、Claude Opus 4.8),每档网格 250 样本,成本以 API 费用为主;SFT 需微调 8B/12B 多模态模型,配置完整(6.5K 混合网格样本、1 epoch、lr $1\times10^{-5}$、有效 batch 64、BF16、FlashAttention-2),单节点 A100/H100 级多卡即可完成。难度上生成与求解器验证为低,SFT 与评测为中等;主要不确定性来自闭源 API 版本更替导致的分数漂移,且 held-out 测试集不公开,第三方只能在 eval 集上报数。