SpatialBlock:用合成积木堆叠问题增强大型视觉语言模型的空间智能 SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型
前置知识
LVLM(大型视觉语言模型)
以视觉编码器(如 ViT)加大语言模型为主体、经投影层对齐图文表征的多模态模型,如 Qwen2.5-VL、InternVL3、Qwen3-VL。输入图像与文本指令后自回归生成文本回答,可完成视觉问答、图表理解等任务,但对 2D 投影背后的 3D 几何结构缺乏显式建模,空间推理普遍薄弱。
本文的训练对象就是 LVLM,所有基座(Qwen2.5-VL-3B/7B、Qwen3-VL-4B、InternVL3-2B)、训练流程与评测协议都围绕这类模型展开,理解其输入输出形态是读懂实验的前提。
GRPO(组相对策略优化)
DeepSeek 提出的在线强化学习算法:对每个问题,让旧策略采样一组 G 个候选回答,用组内奖励的均值和标准差把奖励标准化为优势 $A_i=\frac{r_i-\mathrm{mean}(r)}{\mathrm{std}(r)}$,再做 PPO 式裁剪更新,省去价值网络,并以 KL 散度约束策略不偏离参考模型。
SpatialBlock-reason 模型的第二阶段训练就使用 GRPO,其三项二值奖励设计与组内优势计算直接决定了推理模型的质量,是读懂方法章节数学部分的基础。
LoRA(低秩适配)
冻结预训练模型全部权重,只训练注入到注意力等层旁路的低秩矩阵 $\Delta W=BA$(秩 $r\ll d$)的参数高效微调方法。训练参数量小、显存省,且对模型原有能力扰动小,常用于在保留通用能力的同时适配新任务。
本文发现全参数微调做冷启动会破坏基座固有的思维链推理能力,而 LoRA 微调既对齐积木任务又保留推理能力,是 reason 模型初始化策略的关键设计,也是消融实验的核心对比项。
冷启动与 SFT-RL 两阶段范式
R1 式推理训练的标准流程:先用品德更高教师模型(如 GPT-5)合成的思维链轨迹做监督微调(SFT 冷启动),让模型学会基本答题格式与推理模式,再用强化学习放大推理能力。冷启动数据质量通常被视为决定 RL 训练上限的关键。
本文反其道而行:GPT-5 在 SB-Bench 上准确率仅 20.8%,合成轨迹充满空间逻辑错误,因此作者放弃冷启动、改用 LoRA SFT 初始化。理解这一背景才能领会其实验设计(Table 2(d))的动机。
3D-to-2D 投影与心理模拟
空间认知的两项核心能力:3D-to-2D 投影要求在脑内把三维结构变换到指定视角并做深度遮挡推理,判断哪些方块可见;心理模拟指在脑内预演旋转、组合等变换的结果而不实际执行。发展心理学研究表明积木游戏能有效培养这两类能力。
两者正是本文 Q1/Q2/Q3 三类积木任务背后的能力假设,也是 MindCube、MMSI-Bench 等域外基准所考察的对象,理解它们才能明白数据集设计与评测选择的对应关系。
研究动机
LVLM 在 2D 图像理解上表现强劲,但把 2D 图像在脑内重建为 3D 结构并推理的空间智能仍然薄弱。作者用积木堆叠题实测(Figure 1):人类接近满分(95.0%),而 Qwen2.5-VL-7B 只有 36.7%,Gemini-2.5-flash 为 30.0%,GPT-5 也仅 20.8%,且 GPT-5 的思维链中出现明显的空间逻辑错误。现有改进路线大体两类:一是改架构,如引入空间 token、深度感知插件、3D 编码器(SpatialMLLM 等);二是构建真实场景空间问答数据做层级训练或 RL(SpatialLadder 用 25K、Spatial-SSRL 用 81K、SpaceR 用 150K 样本)。但真实场景数据需要稠密的几何与物体级标注,往往依赖分割、深度估计等外部感知模块生成伪标签,构建成本高、耗时长且噪声大,限制了空间数据的可靠性与可扩展性。
本文的目标是本文的目标是绕开标注密集的真实场景监督,用可程序化生成、零标注噪声的合成任务系统性训练 LVLM 的基础空间技能,并验证这些技能能否迁移到真实场景。具体交付物包括:(1) SpatialBlock-15k 数据集——15,000 道积木堆叠选择题,覆盖 3D-to-2D 投影、视角变换、结构组合三类任务各 5k,并含颜色视觉线索扩展版;(2) 两种训练范式——直接作答的 SpatialBlock-direct,与先推理后作答、经 LoRA SFT 加 GRPO 强化学习的 SpatialBlock-reason;(3) 在 SB-Bench(域内 600 题 held-out)与 MindCube、MMSI-Bench、SPBench、MMMU(域外)上证明:仅用 15k 合成数据即可超越用 25K-150K 真实数据训练的空间专精模型,且不损害 MMMU 上的通用视觉能力。
与已有工作不同的是,本文的独特切入角度有三层。其一,灵感来自发展心理学:人类早期空间能力正是在积木这类结构化操作玩具中习得的,积木游戏被证明能培养空间整合与心理模拟能力,因此作者把提升空间智能重新定义为学习基础技能,而非拟合真实场景问答分布。其二,任务天然自带可验证真值:积木结构由程序生成,答案精确可知,从根上规避了外部感知模块引入的标注噪声。其三,训练策略上反潮流:R1 式训练普遍依赖大模型合成思维链做冷启动,但作者实测连 GPT-5 在 SB-Bench 上也只有 20.8% 的准确率,生成的积木描述与推理频繁出错,合成轨迹不可靠,于是改用 LoRA 轻量初始化保留基座固有推理能力,再进 GRPO 强化学习。
核心方法
直觉上,学会在脑内重建并操控一堆积木的 3D 结构,就等于掌握了空间推理的基本功:判断投影中的可见方块需要深度遮挡推理,预测旋转结果需要心理模拟,拼接两个结构需要空间整合。技术路线分三步。第一步是数据合成:程序化生成积木 3D 结构并渲染成多视图图像,构造三类四选一问题——Q1 给定 3D 结构与观察方向,预测该视角的 2D 投影;Q2 预测结构旋转(如顺时针 270°)后的样子;Q3 预测两个结构沿接触面组合后的整体。每类 5k 共 15k,另留 600 题作域内测试集 SB-Bench;每类还有颜色线索扩展版。第二步训练 direct 模型:只对答案序列做交叉熵 $\mathcal{L}_{ce}(\theta)=-\sum_i \log p_\theta(y_i \mid y_{(1:i-1)},q,v)$,追求快速直觉式作答。第三步训练 reason 模型:先 LoRA SFT 建立基本解题能力,再用 GRPO 强化学习,优化正确性、格式、长度三项二值奖励,鼓励模型显式写出推理路径。
核心创新是与真实场景标注范式彻底脱钩,改用结构化合成任务教空间基本功。与已有方法的本质区别在于:(1) 任务来源是认知发展心理学而非真实数据分布,Q1/Q2/Q3 分别对应空间组合、心理模拟、空间整合三种基础能力,形成互补监督;(2) 颜色不是装饰而是功能性线索——Q1 按深度着色,要求用颜色追踪前后关系;Q2 指定独特颜色的锚块,要求变换前后保持其结构角色;Q3 用重叠色块替代箭头标示拼接位置,模拟人类以显著物体为参照点理解场景的认知机制(Table 2(b) 显示去掉颜色线索后 MindCube 掉 7.9/7.3 分);(3) 训练上用 LoRA 初始化替代全参冷启动——GPT-5 与 Qwen2.5-VL-7B 生成的积木推理轨迹错误率高,用噪声轨迹冷启动只有边际收益,而 LoRA 既对齐任务又保留 CoT 能力。
方法步骤详情
流程分三步。(1) 数据构建:程序化生成积木 3D 结构并渲染多视图,产出三类四选一题,各含单色版与颜色线索版:Q1 给定结构图与观察方向,预测 2D 投影(颜色版按深度着色);Q2 给定结构图与旋转角(顺时针 270° 等),预测变换后结构(颜色版指定锚块);Q3 给定两个结构(颜色版用重叠色块标拼接处),预测组合结果。共 15k 样本,600 题 held-out 作 SB-Bench。(2) direct 训练:对答案 token 序列最小化交叉熵。(3) reason 训练:先 LoRA SFT 打底,再用 GRPO:每题采样 $G$ 个候选回答,奖励 $\mathcal{R}=\mathcal{R}_{acc}+\mathcal{R}_{format}+\mathcal{R}_{len}$,均为 0/1——答案正确、包在 标签内、长度 50<L<1024;优势按组内标准化 $A_i=(r_i-\mathrm{mean})/\mathrm{std}$,裁剪更新加 KL。基座含 Qwen2.5-VL、Qwen3-VL、InternVL3 的 2B-7B 型号。
技术新颖性
技术新颖性体现在三个层面。数据层面:此前空间训练集要么依赖外部模块抽取伪 3D 信号(SpaceQwen 2B、SpatialMLLM 120K),要么用真实场景视频与人工标注构建层级推理数据(SpatialLadder 25K、SpaceR 150K),本文首次证明纯合成积木题就能形成有效的空间监督信号。实验设计层面:Table 3 的对照实验颇具匠心——把相对方向、相对距离两类主流真实空间题型移植进同样的积木环境构成 Synthetic-Real(同为 15k、生成成本相当),结果它在域外全面落后于 SpatialBlock(MindCube 32.8 对 49.1),证明收益来自积木任务设计本身而非合成性或数据规模。训练层面:绕过冷启动、以 LoRA 保推理能力再 GRPO 的组合,是对 R1 范式必须依赖高质量教师轨迹这一假设的有效反驳,消融显示其 overall 41.2 优于全参冷启动的 40.8/40.5。
实验结果
(1) 域内 SB-Bench:direct 94.8%-97.2%,reason 77.5%-94.5%,基座仅 17.0-29.9%。(2) MindCube:4B-direct 51.3%,较基座 26.2% 提升 25.1,为开源最佳且超 GPT-5 的 43.8%;3B-direct 49.1%(超 SpatialLadder-3B 2.7);7B-direct 48.8%(+17.6)。(3) MMSI-Bench:7B-reason 29.7% 超 SpaceR 27.4% 与 Spatial-SSRL 27.5%;3B-reason 29.2% 超 SpatialLadder-3B 3.2。(4) SPBench/MMMU:7B-reason 50.9%/55.5% 均超基座,通用能力不降。(5) 消融:三类混训 41.2 优于单类 38.0-39.1;去颜色线索后 MindCube 49.1 跌至 41.2;换训 SpatialLadder-26k 仅域内 SPBench 占优;LoRA 初始化 41.2 优于无初始化 39.2 与冷启动 40.8/40.5。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 积木堆叠域内测试(SB-Bench,600 题) | 多项选择准确率 | SpatialBlock-3B-direct 94.8%(2B-direct 最高 97.2%) | Qwen2.5-VL-3B-Instruct 29.9% | +64.9 个百分点 |
| MindCube(域外空间心理建模) | 准确率 | SpatialBlock-4B-direct 51.3%(开源最佳) | Qwen3-VL-4B 26.2%;此前最佳专精 SpatialLadder-3B 46.4% | 对基座 +25.1,对最佳专精模型 +4.9,且超过 GPT-5 的 43.8 |
| MMSI-Bench(域外复杂空间推理) | 准确率 | SpatialBlock-7B-reason 29.7% | Qwen2.5-VL-7B 27.4%;SpaceR 27.4%、Spatial-SSRL-7B 27.5% | 对基座 +2.3,超过同基座专精模型 |
| SPBench(域外空间基准) | 准确率 | SpatialBlock-7B-reason 50.9% | Qwen2.5-VL-7B 46.7% | +4.2 个百分点(未在 SPBench 上训练) |
| MMMU(通用多模态理解,检验是否损伤通用能力) | 准确率 | SpatialBlock-7B-reason 55.5% | Qwen2.5-VL-7B 46.6% | +8.9 个百分点,说明空间训练不损害通用能力 |
| 综合总分(五基准 Overall) | 五基准平均准确率 | SpatialBlock-7B-reason 43.5%(仅 15k 合成数据) | Qwen2.5-VL-7B 38.0%;SpatialLadder-7B 同量级约 39.9 | 对基座 +5.5,开源专精模型中最佳 |
局限与改进
作者承认的局限:所有评测限定为多项选择题以对齐训练格式,未测开放式生成;SB-Bench 上 direct 模型接近饱和(94.8%-97.2%),任务可能被快速学会,区分度有限。我的补充观察:(1) 域内 95% 对域外 MMSI 约 28% 的巨大落差,暗示模型可能部分学到任务格式捷径而非完全可迁移的 3D 表征;(2) reason 模型域内反而低于 direct(7B 上 77.5% 对 95.0%),说明 RL 阶段的格式与长度奖励可能约束了域内精度;(3) 奖励只有三项二值信号,对中间推理步骤的几何正确性无细粒度监督,推理对齐分 21.1 仍处低位;(4) 积木渲染风格单一(纯净背景、轴对齐方块),未覆盖真实场景的纹理、光照与不规则遮挡;(5) 论文未报告数据规模 scaling 曲线,也未测试 8B 以上更大模型;(6) 与 SPBench 这类近域专精数据相比优势缩小(其域内模型达 76.6%),说明积木范式并非在所有空间子域都占优。
独立分析的弱点
独立分析的弱点与改进方向:(1) 四选一选择题格式允许模型靠排除法而非真正空间推理作答,域内近乎饱和说明判别式信号已榨干——建议扩展为开放式任务,如直接预测积木 3D 坐标或生成结构描述,并配几何误差指标;(2) 单一渲染域可能让模型依赖积木风格线索,跨到真实照片时收益衰减(MMSI 仅 27%-30%)——可引入纹理、光照、遮挡与相机参数的域随机化;(3) 二值奖励过于粗粒度,RL 只看最终答案与长度——可利用程序化真值构造中间状态的密集奖励,如每列高度、遮挡关系、变换前后一致性;(4) 颜色线索与任务绑定过紧(深度即颜色、锚块即颜色),可能让模型学会找彩色块的启发式而非通用参照机制——可随机化颜色语义、采用多锚点、渐进褪色做课程训练;(5) 三类题型固定且无难度分级——生成器天然支持按方块数、遮挡率、旋转粒度参数化难度,可引入自动课程学习。
未来方向
作者提出的方向之外,可延伸的研究:(1) 把积木范式推广到时序与具身场景,如积木搭建过程的视频预测、机械臂装配预训练任务,把空间组合能力接到动作空间;(2) 合成与真实数据混合训练,例如 SpatialBlock 与 ScanNet 类真实 3D 数据联训,检验两者互补性;(3) 自动课程学习:利用程序化生成器做由易到难的难度递增(方块数量、视角数、组合复杂度),提升 RL 阶段效率;(4) 把颜色锚点思想泛化为一般性的参照物引导训练,用显著性检测或语义对象替代颜色作为锚;(5) 深挖 reason 模型学到的推理模式:推理对齐分从 17.8 升至 21.1 但仍低,可分析 RL 是否催生可解释的空间内部表征(如列-行编码),并用探针实验验证;(6) 检验该范式对 3D 感知下游任务(单目深度估计、3D 检测)的迁移效果,以及数据规模与模型规模的 scaling 特性。
复现评估
复现条件良好。代码与数据已在 GitHub 开源(https://github.com/rsoohyun/SpatialBlock),数据集为程序化生成的 15k 合成样本,若生成器代码完整发布则数据成本几乎为零。训练基座全部为公开模型(Qwen2.5-VL-3B/7B、Qwen3-VL-4B、InternVL3-2B),规模在 2B-7B 之间;direct 路线只需标准 SFT,reason 路线为 LoRA SFT 加 GRPO,单机 4-8 张 A100 量级即可完成,算力门槛中等。评测基准公开可得(MindCube、MMSI-Bench、SPBench、MMMU),SB-Bench 为自建 held-out 集随数据发布。论文附录 A 提供数据构建细节,附录 B/C 提供推理质量分析与完整数值。总体复现难度中低,主要不确定性在于 GRPO 超参数(采样组大小 $G$、$\varepsilon$、$\beta$、学习率)等工程细节的披露完整度。
论文图表
顶部展示一道 3D-to-2D 投影题:给定积木 3D 结构与观察方向,要求选出正确的正面视图。柱状图给出四组正确率:人类 95.0%、Qwen2.5-VL-7B 36.7%、Gemini-2.5-flash 30.0%、GPT-5 仅 20.8%。下方附 GPT-5 的完整思维链样例:它尝试定义列与行、构建 4x3 网格逐项填色,再对比选项,但最终选错答案,暴露出专有模型的空间逻辑缺陷。
这是全文问题的实证起点:用一道人类近乎满分的题量化了人机之间约 60-75 个百分点的差距,直观论证了 LVLM 缺乏基础空间智能,也为后文放弃 GPT-5 冷启动轨迹埋下伏笔。
以 Qwen2.5-VL-3B 为基座的四组消融:(a) 单一题型训练(Q1 only overall 38.8、Q2 only 38.0、Q3 only 39.1,均低于三类混训的 41.2);(b) 去掉颜色线索(direct 的 MindCube 49.1 降至 41.2,MMSI 28.1 降至 26.2);(c) 同配方训练 SpatialLadder-26k(除域内 SPBench 外全面落后于本文任务);(d) 初始化策略(无初始化 overall 39.2、全参 SFT 冷启动 40.8/40.5、LoRA 初始化 41.2 最优)。
归因分析的核心:逐项证明三类题型互补、颜色线索有效、收益来自任务设计而非数据量、LoRA 初始化优于冷启动,支撑了方法设计的每一个决策。