JigShape:通过拼图游戏评估视觉语言模型的视觉-几何推理能力 JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
用凹凸互锁拼图构建无歧义基准,揭示VLM几何推理随网格增大全面崩塌
前置知识
视觉语言模型(VLM)
视觉语言模型是以大语言模型为核心、接入视觉编码器(如 ViT)的多模态模型,能把图像与文本统一到同一表示空间,完成图像问答、描述、文档理解与多模态推理。它先把图像切成 patch 由视觉塔编码,再与文本 token 一起送入语言模型自回归地生成答案。GPT-5.5、Claude Opus 4.8、Grok-4.2、Qwen3-VL-8B、Gemma3-12B 都是这类模型。
本文的评测对象就是 VLM,理解其 patch 化视觉输入与自回归输出方式,才能明白为什么密集拼图(单块极小、需输出大量坐标)对它们格外困难。
Tab-and-Blank 互锁边界
真实拼图块的边不是直线,而是凸榫或凹槽:相邻两块共享边必须一凸一凹互补才能拼合。JigShape 为每条内部边随机指定榫/槽极性,每块的四边签名 $(e_{top}, e_{right}, e_{bottom}, e_{left})$ 构成几何约束;平边只出现在外框,故 2 条平边为角块、1 条为边块、0 条为内部块。
这是全文核心机制:几何约束把有歧义的视觉匹配任务变成有唯一解的约束满足问题,并使“有形状 vs 无形状”的成对消融成为可能。
监督微调(SFT)
监督微调是在标注好的输入-输出数据上用交叉熵损失继续训练预训练模型,使其掌握特定任务的格式与技能。本文用混合网格数据(4×4:3K、8×8:2K、12×12:1K、16×16:0.5K,共 6.5K 样本)微调 Qwen3-VL-8B 与 Gemma3-12B 各 1 个 epoch,学习率 $1\times10^{-5}$、有效 batch 64、BF16 加 FlashAttention-2。
SFT 提供了“任务可学性”的上界参照:4×4 上超过 97% 说明任务本身可学,随后在更大网格上崩塌才构成“缩放悬崖”这一核心结论。
评测指标 PA / EM / AA / SC
Piece Accuracy(PA)是被放到正确位置的块的比例 $PA=\frac{1}{N^2}\sum_{i}\mathbb{1}[\hat{p}(i)=p^*(i)]$;Exact Match(EM)是整局全对的实例比例;Adjacency Accuracy(AA)是预测中正确保留的真实相邻对比例(4×4 随机基线 20%);Shape Compatibility(SC)是预测相邻边中榫槽相容的比例(4×4 随机基线 30.8%)。
四个指标分别度量全局正确、整体解、局部连贯与几何利用程度,论文所有结论(如 SFT 依赖形状捷径)都建立在它们的差分比较之上。
组合复杂度与随机基线
$N\times N$ 拼图共有 $(N^2)!$ 种排列:4×4 约 $2\times10^{13}$、8×8 约 $10^{89}$、16×16 约 $10^{507}$,难度指数级增长。随机猜测的 PA 为 $1/N^2$(4×4 为 6.25%),而 AA 与 SC 因平边效应各有网格相关基线(4×4 到 16×16 的 SC 基线为 30.8%–44.1%,经 $2\times10^6$ 次蒙特卡洛模拟验证)。
只有对照这些随网格变化的随机基线,才能判断模型是“真推理”还是“瞎猜”,这正是先前矩形切块基准所缺失的严谨性。
研究动机
现有拼图类评测基准全部采用矩形切块,带来两个根本缺陷。其一是真值歧义:图像切成矩形小块后,天空、草地、墙面等重复纹理区域在视觉上无法区分,例如一张风景图的三个天空块可以任意互换而感知上完全等价,但标准答案只承认一种排列,导致“答错”可能只是标签任意而非推理失败,评测本身是病态的。其二是网格密度过低:Jigsaw-Puzzles 只用 2×2 与 3×3(最好模型 Gemini-2.5-Pro 总体 77%,但开放式排序生成仅 30%),JPwLEG 与 Visual Jigsaw 也只到 3×3/5×5;$3 imes3$ 仅有 $9!?pprox3.6 imes10^5$ 种排列,而 $8 imes8$ 有 $64!?pprox10^{89}$ 种。粗糙网格既限制难度上限,也可能被“匹配边缘颜色”这类简单启发式破解,无法真正压力测试空间推理。
本文的目标是论文的目标是把拼图求解改造成一个良构的联合视觉-几何推理评测。做法是用真实拼图的凹凸互锁边界提供强局部相容性约束,结合每块独一无二的视觉内容,保证每个实例存在唯一正确解,从根上消除矩形切分的真值歧义;同时把网格密度从 4×4 一路扩展到 16×16(16 到 256 块),覆盖 $2 imes10^{13}$ 到 $10^{507}$ 的排列空间,以测量性能随组合复杂度的衰减曲线。数据上基于 23,742 张高清源图(DIV2K 900 张、DIV8K 1,500 张、Unsplash 21,342 张)生成 95,468 个实例,并成对构造带形状/无形状两个版本,使“模型是否真正利用边界几何”成为可精确测量的变量,共评测 5 个前沿 VLM 的 6 种零样本配置与 2 个微调模型。
与已有工作不同的是,本文的独特切入是把“边界几何”从被忽略的背景提升为一等评测维度。此前所有拼图基准(Jigsaw-Puzzles、JPwLEG、Visual Jigsaw、Jigsaw-R1)都用矩形切分:无形状约束、不保证解唯一、更没有形状消融,因此无法区分模型是败于空间推理还是败于监督歧义。JigShape 让每条内部边随机分配凸榫/凹槽极性,使几何签名随实例变化、无法死记;平边显式标记角块与边块,让几何本身携带可推理的位置信息;再通过同源图、同排列的 shape/no-shape 成对消融直接量化几何约束的贡献。这把拼图评测从“视觉匹配是否正确”升级为“视觉内容与几何约束如何联合满足”,是一个干净的可控实验设计。
核心方法
直觉上,JigShape 让模型做一件人类儿童都会做的事:看一张散落且标了编号的拼图,输出每块编号到正确网格位置 $(row, col)$ 的映射。形式化地,一个实例是四元组 $(I, G, E, \pi)$:$I$ 为源图,$G$ 为 $N imes N$ 网格,$E$ 把每条边映射到 {tab, blank, flat},$\pi$ 是把块 ID 打乱到展示位置的随机排列。模型输入是按 ID 顺序排布、每块印有数字标签的打乱布局图,输出 JSON 形式的 ID→位置映射。评测在 4×4/8×8/12×12/16×16 四档密度上各取 250 个 eval 样本,用四个指标衡量:Piece Accuracy($PA=\frac{1}{N^2}\sum_i\mathbb{1}[\hat{p}(i)=p^*(i)]$)、Exact Match(全对才计 1)、Adjacency Accuracy(AA,相邻对正确率)与 Shape Compatibility(SC,预测相邻边中榫槽相容比例)。
核心创新是凹凸互锁边界带来的双重信息。第一是局部相容性约束:相邻块必须满足 $E(p_i,\text{right})=\text{tab}\Leftrightarrow E(p_j,\text{left})=\text{blank}$,每条内部边随机分配极性,几何签名随实例变化、无法死记;该约束大幅压缩合法搜索空间,与每块独有的视觉内容结合后保证解唯一(作者用带回溯搜索与约束传播的经典求解器在四档网格各 500 个测试实例上 100% 复原,验证解唯一)。第二是全局位置线索:平边只出现在外边界,2 条平边即角块、1 条即边块、0 条即内部块,模型可先定位再配对。此外 tab 区域携带邻格像素内容,模拟真实拼图的视觉连续性线索。这与矩形切块“只有视觉内容、无几何约束”形成本质区别,是让评测从病态变良构的关键。
方法步骤详情
生成流水线分五步,全程由随机种子决定、完全可复现:(1) 图像预处理:用 Lanczos 重采样把源图缩放到两维均可被 $N$ 整除;(2) 边分配:$N imes N$ 网格共 $2N(N-1)$ 条内部边各自等概率随机指定 tab/blank 极性,边界边置 flat;(3) 形状掩码与内容提取:tab 为半径 $r=\text{tab ratio}\times\min(h,w)/2$ 的半圆凸起(tab ratio 从 4×4 的 0.15 到 16×16 的 0.28 递增以保证可见性),用 alpha 掩码提取块内容,tab 区携带邻格像素;(4) 布局合成:块 ID 经随机排列 $\pi$ 后按 ID 序排布并印上数字标签,不做旋转以保证解唯一,版面从 724×744 到 3292×3312 像素;(5) 质量验证:块须能重新拼合精确复原原图,并用经典求解器确认唯一解。数据按源图划分 train 91,968 / eval 1,000 / held-out test 2,000 / no-shape 500,杜绝同图跨集泄漏。
技术新颖性
技术新颖性有三点。首先,它是首个引入物理互锁形状约束的 VLM 拼图基准:与 Table 1 中的 Jigsaw-Puzzles(最大 9 块)、JPwLEG(25 块)、Visual Jigsaw(9 块)、Jigsaw-R1(4 块)相比,JigShape 最大 256 块、9.5 万实例,且是唯一同时具备形状约束、唯一解保证与形状消融的基准。其次,随机极性 + 禁止旋转 + 按 ID 排布的设计在保证唯一解的同时封死了“ID 与位置相关”的捷径,系统提示还显式警告块号与位置无关。第三,混合网格微调(1 epoch、$1\times10^{-5}$、batch 64、BF16+FlashAttention-2)给出“任务可学性”上界,成对 no-shape 消融提供归因工具,两者共同把模型失败分解为“学不会”与“不善用几何”两类,这是以往基准做不到的诊断粒度。
实验结果
零样本中仅 GPT-5.5 超过随机:4×4 上 PA 69.65%、EM 26.40%(随机 6.25%),SC 71.33% 远超随机基线 30.8%,真正联合了视觉与几何线索;其余五个零样本配置的 PA 仅 6.62%–11.97%,EM 全为 0。网格增大后零样本全线崩塌:GPT-5.5 在 8×8 跌至 4.37%、12×12 仅 0.67%,已接近随机水平。SFT 证明任务可学:Qwen3-VL-8B/Gemma3-12B 在 4×4 达 97.28%/97.82% PA、约 90% EM,但出现缩放悬崖:8×8 降至 27.34%/33.58%,12×12 仅 3.44%/4.57%,16×16 归于随机。形状消融中 GPT-5.5 去形状后跌至 23.90%,SFT 模型崩至 10.00%/13.78%,说明微调主要学到几何捷径而非视觉推理;位置分解呈 corner > edge > interior(12×12 上 Gemma3-12B 角块 39.70%、内部块仅 1.78%);60/64 块已定位时 GPT-5.5 对剩余 4 块仍仅 25% PA。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 4×4 拼图(零样本) | Piece Accuracy / Exact Match | GPT-5.5 69.65% / 26.40% | 随机基线 6.25% / 0% | +63.4 个百分点,六个零样本配置中唯一超过随机基线的模型 |
| 4×4 拼图(监督微调) | Piece Accuracy / Exact Match | Gemma3-12B 97.82% / 89.20%;Qwen3-VL-8B 97.28% / 90.80% | 随机基线 6.25% / 0% | 证明任务在监督信号下完全可学习,4×4 接近解决 |
| 8×8 拼图(零样本) | Piece Accuracy | GPT-5.5 4.37%(其余模型 1.38%–1.66%) | 随机基线 1.56% | GPT-5.5 优势消失,所有零样本模型退化为随机水平,缩放悬崖显现 |
| 12×12 拼图(SFT) | Piece Accuracy | Gemma3-12B 4.57%;Qwen3-VL-8B 3.44% | 随机基线 0.69% | 较自身 4×4 成绩(约 97%)下跌逾 93 个百分点 |
| 16×16 拼图(SFT) | Piece Accuracy | Qwen3-VL-8B 0.40%;Gemma3-12B 0.35% | 随机基线 0.39% | 与随机无异,256 块任务完全失败 |
| 形状消融(4×4,同图同排列) | Piece Accuracy(无形状 vs 有形状) | Qwen3-VL-8B 97.28%→10.00%;Gemma3-12B 97.82%→13.78%;GPT-5.5 69.65%→23.90% | 随机基线 6.25% | 量化几何约束贡献:SFT 模型依赖形状捷径,GPT-5.5 真正联合利用几何与视觉 |
局限与改进
作者承认且可观察到的局限:评测集较小,每档网格仅 250 个样本,EM 这类稀有指标的置信区间很宽;前沿模型未测 16×16(以 12×12 已随机化为由省略),“缩放悬崖”在最极端密度上缺少直接证据;强制 JSON 输出且无效输出计零,会把格式失败混入推理失败,12×12 起需一次输出 144–256 个坐标,输出长度本身可能成为瓶颈;任务不涉及旋转,与真实拼图设定有差距;no-shape 消融只做了 4×4(更大矩形网格本就无唯一解),无法观察几何依赖随密度的变化;SFT 只覆盖两个 8B/12B 级模型、仅 1 个 epoch,未探索 RL、思维链提示或搜索增强,“架构性极限”的结论略显超前。我的补充观察:经典求解器能 100% 解决全部网格,说明任务对符号搜索方法完全可解,评测真正揭示的是 VLM 缺乏显式约束传播机制,而非任务无解。
独立分析的弱点
独立分析有四个弱点。其一,输出协议苛刻:要求一次性输出全部 $N^2$ 个坐标的 JSON,12×12 起输出就可能截断或格式崩坏,解析失败计零分混淆了“写不下”与“想不出”,改进方向是分块/增量作答或逐块选择的评测协议。其二,16×16 版面达 3292×3312 像素,经 VLM 内部下采样后单块可能只剩几十个像素,视觉信息或低于可辨识阈值,应补充“逐块裁剪单独输入”的对照实验剥离分辨率因素。其三,“架构无法扩展”的结论主要基于 1 个 epoch 的 SFT 负结果(逆精度加权的 Table 8 甚至更差),缺少课程学习、GRPO 式 RL 或测试时搜索的尝试,因果证据链不完整。其四,聚合指标难以诊断失败模式,SC 基线推导虽严谨(30.8%–44.1%,经 $2\times10^6$ 次蒙特卡洛验证),但可增加按位移距离的误差热图与逐边相容性分析,把“不会全局布局”与“不会局部匹配”分开度量。
未来方向
作者建议三个方向:跨网格密度的课程学习、鼓励视觉-几何联合整合的训练目标(如在无形状数据上也施加强约束的奖励)、以及具备组合约束满足能力的新架构(显式约束传播、把 DiffAssemble 式图扩散组装迁移到通用 VLM)。基于本文成果还可延伸:把 JigShape 用作 RLVR 的训练信号来源,检验拼图奖励能否泛化到检测、分割等下游空间任务(呼应 Visual Jigsaw、Jigsaw-R1、PuzzleCraft 一系工作);引入旋转与任意裁剪形状把任务推向更接近真实拼图;研究测试时搜索或工具调用(让模型调用经典求解器式推理)能否弥合与 100% 求解器的差距;把 clue benchmark(extreme60 只剩 4 块仍仅 25% PA)发展成细粒度空间定位的诊断子任务,用于指导数据构造与架构改进。预留的 2,000 个 held-out 测试集为后续公开比赛与公平比较提供了基础设施。
复现评估
复现条件相当好。数据集已在 HuggingFace 发布(ShawnLi02/JigShape-Train),作者承诺开源完整生成流水线、评测代码与配置;流水线对随机种子完全确定,源图来自 DIV2K/DIV8K(学术许可)与 Unsplash(宽松许可),无版权障碍,并用经典约束求解器(四档网格各 500 实例 100% 复原)公开验证解唯一性。评测需调用 5 个前沿商业 API(GPT-5.5、GPT-5.4-mini、Grok-4.2 双模式、Llama-4-Maverick、Claude Opus 4.8),每档网格 250 样本,成本以 API 费用为主;SFT 需微调 8B/12B 多模态模型,配置完整(6.5K 混合网格样本、1 epoch、lr $1\times10^{-5}$、有效 batch 64、BF16、FlashAttention-2),单节点 A100/H100 级多卡即可完成。难度上生成与求解器验证为低,SFT 与评测为中等;主要不确定性来自闭源 API 版本更替导致的分数漂移,且 held-out 测试集不公开,第三方只能在 eval 集上报数。
论文图表
左半对比矩形切分与凹凸互锁切分:矩形切法在重复纹理区域产生多解歧义,而 tab-blank 几何约束结合视觉内容保证唯一解;右半给出基准分类学,覆盖 4×4 到 16×16 四档网格密度以及 shape/no-shape 消融设计。
一张图讲清研究动机(矩形切分的病态性)与解决方案(几何约束良构化),是理解全文逻辑的入口。