← 返回 2026-09-11

SpatialBlock:用合成积木堆叠问题增强大型视觉语言模型的空间智能 SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

Soohyun Ryu, Sohee Kim, Eunho Yang 📅 2026-09-07 👍 87 2026-09-12 18:30
GRPO 合成数据 后训练 强化学习 空间智能 视觉语言模型

仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型

前置知识

LVLM(大型视觉语言模型)

以视觉编码器(如 ViT)加大语言模型为主体、经投影层对齐图文表征的多模态模型,如 Qwen2.5-VL、InternVL3、Qwen3-VL。输入图像与文本指令后自回归生成文本回答,可完成视觉问答、图表理解等任务,但对 2D 投影背后的 3D 几何结构缺乏显式建模,空间推理普遍薄弱。

本文的训练对象就是 LVLM,所有基座(Qwen2.5-VL-3B/7B、Qwen3-VL-4B、InternVL3-2B)、训练流程与评测协议都围绕这类模型展开,理解其输入输出形态是读懂实验的前提。

GRPO(组相对策略优化)

DeepSeek 提出的在线强化学习算法:对每个问题,让旧策略采样一组 G 个候选回答,用组内奖励的均值和标准差把奖励标准化为优势 $A_i=\frac{r_i-\mathrm{mean}(r)}{\mathrm{std}(r)}$,再做 PPO 式裁剪更新,省去价值网络,并以 KL 散度约束策略不偏离参考模型。

SpatialBlock-reason 模型的第二阶段训练就使用 GRPO,其三项二值奖励设计与组内优势计算直接决定了推理模型的质量,是读懂方法章节数学部分的基础。

LoRA(低秩适配)

冻结预训练模型全部权重,只训练注入到注意力等层旁路的低秩矩阵 $\Delta W=BA$(秩 $r\ll d$)的参数高效微调方法。训练参数量小、显存省,且对模型原有能力扰动小,常用于在保留通用能力的同时适配新任务。

本文发现全参数微调做冷启动会破坏基座固有的思维链推理能力,而 LoRA 微调既对齐积木任务又保留推理能力,是 reason 模型初始化策略的关键设计,也是消融实验的核心对比项。

冷启动与 SFT-RL 两阶段范式

R1 式推理训练的标准流程:先用品德更高教师模型(如 GPT-5)合成的思维链轨迹做监督微调(SFT 冷启动),让模型学会基本答题格式与推理模式,再用强化学习放大推理能力。冷启动数据质量通常被视为决定 RL 训练上限的关键。

本文反其道而行:GPT-5 在 SB-Bench 上准确率仅 20.8%,合成轨迹充满空间逻辑错误,因此作者放弃冷启动、改用 LoRA SFT 初始化。理解这一背景才能领会其实验设计(Table 2(d))的动机。

3D-to-2D 投影与心理模拟

空间认知的两项核心能力:3D-to-2D 投影要求在脑内把三维结构变换到指定视角并做深度遮挡推理,判断哪些方块可见;心理模拟指在脑内预演旋转、组合等变换的结果而不实际执行。发展心理学研究表明积木游戏能有效培养这两类能力。

两者正是本文 Q1/Q2/Q3 三类积木任务背后的能力假设,也是 MindCube、MMSI-Bench 等域外基准所考察的对象,理解它们才能明白数据集设计与评测选择的对应关系。

研究动机

LVLM 在 2D 图像理解上表现强劲,但把 2D 图像在脑内重建为 3D 结构并推理的空间智能仍然薄弱。作者用积木堆叠题实测(Figure 1):人类接近满分(95.0%),而 Qwen2.5-VL-7B 只有 36.7%,Gemini-2.5-flash 为 30.0%,GPT-5 也仅 20.8%,且 GPT-5 的思维链中出现明显的空间逻辑错误。现有改进路线大体两类:一是改架构,如引入空间 token、深度感知插件、3D 编码器(SpatialMLLM 等);二是构建真实场景空间问答数据做层级训练或 RL(SpatialLadder 用 25K、Spatial-SSRL 用 81K、SpaceR 用 150K 样本)。但真实场景数据需要稠密的几何与物体级标注,往往依赖分割、深度估计等外部感知模块生成伪标签,构建成本高、耗时长且噪声大,限制了空间数据的可靠性与可扩展性。

本文的目标是本文的目标是绕开标注密集的真实场景监督,用可程序化生成、零标注噪声的合成任务系统性训练 LVLM 的基础空间技能,并验证这些技能能否迁移到真实场景。具体交付物包括:(1) SpatialBlock-15k 数据集——15,000 道积木堆叠选择题,覆盖 3D-to-2D 投影、视角变换、结构组合三类任务各 5k,并含颜色视觉线索扩展版;(2) 两种训练范式——直接作答的 SpatialBlock-direct,与先推理后作答、经 LoRA SFT 加 GRPO 强化学习的 SpatialBlock-reason;(3) 在 SB-Bench(域内 600 题 held-out)与 MindCube、MMSI-Bench、SPBench、MMMU(域外)上证明:仅用 15k 合成数据即可超越用 25K-150K 真实数据训练的空间专精模型,且不损害 MMMU 上的通用视觉能力。

与已有工作不同的是,本文的独特切入角度有三层。其一,灵感来自发展心理学:人类早期空间能力正是在积木这类结构化操作玩具中习得的,积木游戏被证明能培养空间整合与心理模拟能力,因此作者把提升空间智能重新定义为学习基础技能,而非拟合真实场景问答分布。其二,任务天然自带可验证真值:积木结构由程序生成,答案精确可知,从根上规避了外部感知模块引入的标注噪声。其三,训练策略上反潮流:R1 式训练普遍依赖大模型合成思维链做冷启动,但作者实测连 GPT-5 在 SB-Bench 上也只有 20.8% 的准确率,生成的积木描述与推理频繁出错,合成轨迹不可靠,于是改用 LoRA 轻量初始化保留基座固有推理能力,再进 GRPO 强化学习。

核心方法

直觉上,学会在脑内重建并操控一堆积木的 3D 结构,就等于掌握了空间推理的基本功:判断投影中的可见方块需要深度遮挡推理,预测旋转结果需要心理模拟,拼接两个结构需要空间整合。技术路线分三步。第一步是数据合成:程序化生成积木 3D 结构并渲染成多视图图像,构造三类四选一问题——Q1 给定 3D 结构与观察方向,预测该视角的 2D 投影;Q2 预测结构旋转(如顺时针 270°)后的样子;Q3 预测两个结构沿接触面组合后的整体。每类 5k 共 15k,另留 600 题作域内测试集 SB-Bench;每类还有颜色线索扩展版。第二步训练 direct 模型:只对答案序列做交叉熵 $\mathcal{L}_{ce}(\theta)=-\sum_i \log p_\theta(y_i \mid y_{(1:i-1)},q,v)$,追求快速直觉式作答。第三步训练 reason 模型:先 LoRA SFT 建立基本解题能力,再用 GRPO 强化学习,优化正确性、格式、长度三项二值奖励,鼓励模型显式写出推理路径。

核心创新是与真实场景标注范式彻底脱钩,改用结构化合成任务教空间基本功。与已有方法的本质区别在于:(1) 任务来源是认知发展心理学而非真实数据分布,Q1/Q2/Q3 分别对应空间组合、心理模拟、空间整合三种基础能力,形成互补监督;(2) 颜色不是装饰而是功能性线索——Q1 按深度着色,要求用颜色追踪前后关系;Q2 指定独特颜色的锚块,要求变换前后保持其结构角色;Q3 用重叠色块替代箭头标示拼接位置,模拟人类以显著物体为参照点理解场景的认知机制(Table 2(b) 显示去掉颜色线索后 MindCube 掉 7.9/7.3 分);(3) 训练上用 LoRA 初始化替代全参冷启动——GPT-5 与 Qwen2.5-VL-7B 生成的积木推理轨迹错误率高,用噪声轨迹冷启动只有边际收益,而 LoRA 既对齐任务又保留 CoT 能力。

方法步骤详情

流程分三步。(1) 数据构建:程序化生成积木 3D 结构并渲染多视图,产出三类四选一题,各含单色版与颜色线索版:Q1 给定结构图与观察方向,预测 2D 投影(颜色版按深度着色);Q2 给定结构图与旋转角(顺时针 270° 等),预测变换后结构(颜色版指定锚块);Q3 给定两个结构(颜色版用重叠色块标拼接处),预测组合结果。共 15k 样本,600 题 held-out 作 SB-Bench。(2) direct 训练:对答案 token 序列最小化交叉熵。(3) reason 训练:先 LoRA SFT 打底,再用 GRPO:每题采样 $G$ 个候选回答,奖励 $\mathcal{R}=\mathcal{R}_{acc}+\mathcal{R}_{format}+\mathcal{R}_{len}$,均为 0/1——答案正确、包在 标签内、长度 50<L<1024;优势按组内标准化 $A_i=(r_i-\mathrm{mean})/\mathrm{std}$,裁剪更新加 KL。基座含 Qwen2.5-VL、Qwen3-VL、InternVL3 的 2B-7B 型号。

技术新颖性

技术新颖性体现在三个层面。数据层面:此前空间训练集要么依赖外部模块抽取伪 3D 信号(SpaceQwen 2B、SpatialMLLM 120K),要么用真实场景视频与人工标注构建层级推理数据(SpatialLadder 25K、SpaceR 150K),本文首次证明纯合成积木题就能形成有效的空间监督信号。实验设计层面:Table 3 的对照实验颇具匠心——把相对方向、相对距离两类主流真实空间题型移植进同样的积木环境构成 Synthetic-Real(同为 15k、生成成本相当),结果它在域外全面落后于 SpatialBlock(MindCube 32.8 对 49.1),证明收益来自积木任务设计本身而非合成性或数据规模。训练层面:绕过冷启动、以 LoRA 保推理能力再 GRPO 的组合,是对 R1 范式必须依赖高质量教师轨迹这一假设的有效反驳,消融显示其 overall 41.2 优于全参冷启动的 40.8/40.5。

Spatial Abilities Underlying Block-Stacking Reasoning
Figure 2: Spatial Abilities Underlying Block-Stacking Reasoning
SpatialBlock-15k
Figure 3: SpatialBlock-15k

实验结果

(1) 域内 SB-Bench:direct 94.8%-97.2%,reason 77.5%-94.5%,基座仅 17.0-29.9%。(2) MindCube:4B-direct 51.3%,较基座 26.2% 提升 25.1,为开源最佳且超 GPT-5 的 43.8%;3B-direct 49.1%(超 SpatialLadder-3B 2.7);7B-direct 48.8%(+17.6)。(3) MMSI-Bench:7B-reason 29.7% 超 SpaceR 27.4% 与 Spatial-SSRL 27.5%;3B-reason 29.2% 超 SpatialLadder-3B 3.2。(4) SPBench/MMMU:7B-reason 50.9%/55.5% 均超基座,通用能力不降。(5) 消融:三类混训 41.2 优于单类 38.0-39.1;去颜色线索后 MindCube 49.1 跌至 41.2;换训 SpatialLadder-26k 仅域内 SPBench 占优;LoRA 初始化 41.2 优于无初始化 39.2 与冷启动 40.8/40.5。

Main Results
Table 1: Main Results
Comparison of Training on SpatialBlock and Synthetic-Real
Table 3: Comparison of Training on SpatialBlock and Synthetic-Real
Synthetic-Real Dataset
Figure 4: Synthetic-Real Dataset
查看结构化数据
任务指标本文基线提升
积木堆叠域内测试(SB-Bench,600 题) 多项选择准确率 SpatialBlock-3B-direct 94.8%(2B-direct 最高 97.2%) Qwen2.5-VL-3B-Instruct 29.9% +64.9 个百分点
MindCube(域外空间心理建模) 准确率 SpatialBlock-4B-direct 51.3%(开源最佳) Qwen3-VL-4B 26.2%;此前最佳专精 SpatialLadder-3B 46.4% 对基座 +25.1,对最佳专精模型 +4.9,且超过 GPT-5 的 43.8
MMSI-Bench(域外复杂空间推理) 准确率 SpatialBlock-7B-reason 29.7% Qwen2.5-VL-7B 27.4%;SpaceR 27.4%、Spatial-SSRL-7B 27.5% 对基座 +2.3,超过同基座专精模型
SPBench(域外空间基准) 准确率 SpatialBlock-7B-reason 50.9% Qwen2.5-VL-7B 46.7% +4.2 个百分点(未在 SPBench 上训练)
MMMU(通用多模态理解,检验是否损伤通用能力) 准确率 SpatialBlock-7B-reason 55.5% Qwen2.5-VL-7B 46.6% +8.9 个百分点,说明空间训练不损害通用能力
综合总分(五基准 Overall) 五基准平均准确率 SpatialBlock-7B-reason 43.5%(仅 15k 合成数据) Qwen2.5-VL-7B 38.0%;SpatialLadder-7B 同量级约 39.9 对基座 +5.5,开源专精模型中最佳

局限与改进

作者承认的局限:所有评测限定为多项选择题以对齐训练格式,未测开放式生成;SB-Bench 上 direct 模型接近饱和(94.8%-97.2%),任务可能被快速学会,区分度有限。我的补充观察:(1) 域内 95% 对域外 MMSI 约 28% 的巨大落差,暗示模型可能部分学到任务格式捷径而非完全可迁移的 3D 表征;(2) reason 模型域内反而低于 direct(7B 上 77.5% 对 95.0%),说明 RL 阶段的格式与长度奖励可能约束了域内精度;(3) 奖励只有三项二值信号,对中间推理步骤的几何正确性无细粒度监督,推理对齐分 21.1 仍处低位;(4) 积木渲染风格单一(纯净背景、轴对齐方块),未覆盖真实场景的纹理、光照与不规则遮挡;(5) 论文未报告数据规模 scaling 曲线,也未测试 8B 以上更大模型;(6) 与 SPBench 这类近域专精数据相比优势缩小(其域内模型达 76.6%),说明积木范式并非在所有空间子域都占优。

独立分析的弱点

独立分析的弱点与改进方向:(1) 四选一选择题格式允许模型靠排除法而非真正空间推理作答,域内近乎饱和说明判别式信号已榨干——建议扩展为开放式任务,如直接预测积木 3D 坐标或生成结构描述,并配几何误差指标;(2) 单一渲染域可能让模型依赖积木风格线索,跨到真实照片时收益衰减(MMSI 仅 27%-30%)——可引入纹理、光照、遮挡与相机参数的域随机化;(3) 二值奖励过于粗粒度,RL 只看最终答案与长度——可利用程序化真值构造中间状态的密集奖励,如每列高度、遮挡关系、变换前后一致性;(4) 颜色线索与任务绑定过紧(深度即颜色、锚块即颜色),可能让模型学会找彩色块的启发式而非通用参照机制——可随机化颜色语义、采用多锚点、渐进褪色做课程训练;(5) 三类题型固定且无难度分级——生成器天然支持按方块数、遮挡率、旋转粒度参数化难度,可引入自动课程学习。

未来方向

作者提出的方向之外,可延伸的研究:(1) 把积木范式推广到时序与具身场景,如积木搭建过程的视频预测、机械臂装配预训练任务,把空间组合能力接到动作空间;(2) 合成与真实数据混合训练,例如 SpatialBlock 与 ScanNet 类真实 3D 数据联训,检验两者互补性;(3) 自动课程学习:利用程序化生成器做由易到难的难度递增(方块数量、视角数、组合复杂度),提升 RL 阶段效率;(4) 把颜色锚点思想泛化为一般性的参照物引导训练,用显著性检测或语义对象替代颜色作为锚;(5) 深挖 reason 模型学到的推理模式:推理对齐分从 17.8 升至 21.1 但仍低,可分析 RL 是否催生可解释的空间内部表征(如列-行编码),并用探针实验验证;(6) 检验该范式对 3D 感知下游任务(单目深度估计、3D 检测)的迁移效果,以及数据规模与模型规模的 scaling 特性。

复现评估

复现条件良好。代码与数据已在 GitHub 开源(https://github.com/rsoohyun/SpatialBlock),数据集为程序化生成的 15k 合成样本,若生成器代码完整发布则数据成本几乎为零。训练基座全部为公开模型(Qwen2.5-VL-3B/7B、Qwen3-VL-4B、InternVL3-2B),规模在 2B-7B 之间;direct 路线只需标准 SFT,reason 路线为 LoRA SFT 加 GRPO,单机 4-8 张 A100 量级即可完成,算力门槛中等。评测基准公开可得(MindCube、MMSI-Bench、SPBench、MMMU),SB-Bench 为自建 held-out 集随数据发布。论文附录 A 提供数据构建细节,附录 B/C 提供推理质量分析与完整数值。总体复现难度中低,主要不确定性在于 GRPO 超参数(采样组大小 $G$、$\varepsilon$、$\beta$、学习率)等工程细节的披露完整度。