← 返回 2026-08-17

SPARGen:通过原生多模态生成统一空间感知与推理 SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo 📅 2026-08-14 👍 0 2026-08-22 18:30
3D视觉 光流估计 多模态统一模型 整流流生成 空间推理

用单一原生多模态生成模型统一3D重建、稠密对应与空间推理

前置知识

MoT(Mixture-of-Transformer-Experts)

Bagel 采用的统一多模态骨干:同一个 Transformer 内含"理解专家"和"生成专家"两套模态特定的投影与 FFN,但通过联合多模态自注意力交互。文本、ViT 视觉 token 走理解通路,VAE 潜变量 token 走生成通路,两条 token 流共享注意力层。

SPARGen 的全部能力都建立在 MoT 的双通路结构上:自回归专家产出 token 序列,整流流专家产出稠密场,理解共享注意力是实现多任务知识迁移的关键前提。

整流流(Rectified Flow)

一类生成模型训练方式:在干净数据潜变量 $z_0$ 与高斯噪声 $\epsilon$ 之间构造直线路径 $z_t = (1-t)z_0 + t\epsilon$,训练网络预测速度 $u_t = \epsilon - z_0$;推理时从纯噪声 $z_1$ 出发沿预测速度场积分回 $z_0$,再解码成图像。

SPARGen 的深度图、点图、光流全部通过 Bagel 原生的整流流图像生成通路产生,流匹配损失 $\mathcal{L}_{field}$ 是其两大训练目标之一。

VAE 潜空间与图像对齐场

预训练文生图模型中的 VAE 把 RGB 图像压缩到低分辨率潜空间(通常 8 倍下采样),解码器可从潜变量重建图像。"图像对齐场"指形状与 RGB 图像相同、但通道里编码几何量(深度、坐标、位移)的三通道数组,可当作图像被 VAE 编解码。

这是本文最核心的技巧:把非图像的几何输出伪装成图像,从而复用冻结 VAE 和整流流通路,无需任何新回归头;其 8 倍压缩也是作者承认的精度瓶颈。

点图(Point Map)

每个像素对应的三维世界坐标 $(X,Y,Z)$ 组成的图像尺寸张量。DUSt3R 首创把未标定双目重建表述为点图回归,VGGT 进一步联合预测位姿、深度、点图与轨迹,成为前馈几何重建的主流表示。

点图是 SPARGen 三维重建输出的核心形式,其归一化方式(序列共享中心与尺度)直接决定多视角几何一致性和 7Scenes/ETH3D 上的重建指标。

前馈几何模型(DUSt3R/VGGT 范式)

一次前向传播直接从一张或多张图像回归几何量(深度、位姿、点图)的网络,取代传统 SfM/MVS 的多阶段管线。它们精度高但能力固定,只做几何预测,不接受语言指令,也无法做空间问答。

它们是 SPARGen 视觉几何实验的主要对照(如 VGGT 在 Co3Dv2 AUC@30 上 89.78),理解其"专用但封闭"的局限才能体会本文统一化的价值与代价。

空间推理基准(MindCube/SPAR 等)

考察模型对视角、相对位置、旋转、遮挡等空间关系做语言问答的评测集,如 OmniSpatial、OST-Bench、SPAR-Bench,指标为答案准确率,通常按难度或子能力(如 SPAR 的 Low/Medium/High)细分。

这些基准衡量"几何理解能否转化为语义结论",SPARGen 在四个基准上平均分全部第一(如 SPAR 66.60),是论文最亮眼的实验结果。

研究动机

空间智能的三种互补能力长期被割裂在不同系统里。前馈几何模型(DUSt3R、FLARE、VGGT)能精确回归深度、点图和相机位姿——VGGT 在 7Scenes 上重建精度误差仅 0.022、Co3Dv2 位姿 AUC@30 达 89.78——但它们是固定管线,无法回答"站在沙发位置朝前看,白桌右边是什么"这类空间问答。反过来,多模态大模型(GPT-4o、Qwen2.5-VL-72B)擅长指令遵循和推理,却缺乏稠密几何与对应监督:GPT-4o 在 MindCube 上平均只有 41.52 分,Qwen2.5-VL-72B 也仅 41.71 分。即便是与本文最接近的统一模型 G2VLM,也需要引入几何专用组件,其 2B 版本在 MindCube 上只有 28.48 分,位姿 AUC@30 仅 56.85。专用编码器、回归头或外挂几何模块的存在,阻断了稠密几何、跨视角对应与语义监督之间的知识迁移,使同一物理场景的多源监督无法共同塑形一套共享空间表征。

本文的目标是本文要构建一个单一的原生多模态生成模型,把 3D 重建(相对深度图、相机位姿、多视角点图)、稠密对应估计(光流)和空间推理(空间问答)统一表述为指令条件生成任务:给定 RGB 图像序列 $I$ 和自然语言指令 $p$,模型在同一个架构内既生成图像对齐的稠密几何场 $\Phi_\tau(Y_\tau) \in \mathbb{R}^{M_\tau \times H \times W \times 3}$,又以自回归方式生成序列化输出 $S_\tau(Y_\tau)$ 和文字答案,全程不引入任务特定的回归头或外部几何预测模块,并在视觉几何、光流、空间推理三类基准上都与专用模型保持竞争力和知识迁移收益。

与已有工作不同的是,本文的独特切入是"输出形式的原生匹配"。与 G2VLM 给统一模型加装几何专家的做法相反,SPARGen 从预训练统一模型 Bagel 出发,不增加任何几何组件,而是把异构空间目标改写成模型两条原生生成通路天然能产出的形式:稠密几何场(深度、点图、光流)编码为图像对齐的三通道场,走原生图像生成通路(VAE 潜空间 + 整流流);相机位姿、空间问答等紧凑结构化输出序列化为离散 token 序列,走自回归通路。两条通路在 MoT 骨干中通过联合多模态自注意力共享表征,几何、对应、语义三种监督由此作用于同一套参数。作者的核心观点是:空间智能不是孤立任务的集合,而是"从观察构建空间表征,再据此回答条件查询"的统一过程。

核心方法

SPARGen 建立在 Bagel 的 MoT 架构(理解专家 + 生成专家)上。输入图像经 ViT 编码为理解 token,指令经文本 tokenizer 编码,稠密场生成还额外拼接冻结 VAE 编码的图像 token,构成条件上下文 $C_{seq}$(文本+ViT)与 $C_{field}$(文本+ViT+VAE)。生成侧:稠密场在 VAE 潜空间用整流流产生,训练时干净潜变量 $z_0 = E_{vae}(\Phi_\tau(Y_\tau))$ 与高斯噪声构成 $z_t = (1-t)z_0 + t\epsilon$,网络预测速度场并匹配目标 $u_t = \epsilon - z_0$,推理时从 $z_1 \sim \mathcal{N}(0,I)$ 积分到 $t=0$ 再由冻结 VAE 解码;序列目标则按 $\prod_j p_\theta(s_j \mid C_{seq}, s_{<j})$ 自回归生成。训练从 Bagel 预训练权重初始化,在 64 块 H100 上用 AdamW 微调 100K 步,学习率 $2.5\times10^{-5}$,序列损失权重 $\lambda = 0.25$,VAE 编解码器全程冻结。

核心创新是把空间监督"翻译"成统一模型的原生输出形式,而非外挂模块。稠密侧:深度按 $\tilde{D} = 1-(D-d_{\min})/(d_{\max}-d_{\min}+\epsilon)$ 归一化为相对深度并复制成三通道;点图统一到以首帧相机为原点的坐标系,用全序列共享的中心 $c$ 与尺度 $s$ 归一化 $\tilde{P}_i=(P_i-c)/(s+\epsilon)$,共享统计量保证跨视角几何一致;光流按宽高归一化后做带符号平方根变换 $\rho(x)=\mathrm{sgn}(x)\sqrt{|x|}$ 压缩动态范围。序列侧:相机位姿参数化为 $q=\mathrm{Quat}(R)$、平移方向 $d=t/\|t\|_2$、幅值 $r=\|t\|_2$,标量以 $10^{-3}$ 分辨率量化为专用数值 token;查询点深度等稀疏几何量同样量化入序列。与已有方法的本质区别:G2VLM 加装几何专家、SpatialRGPT 依赖外部深度插件,而本文监督经由共享生成接口直接注入 MoT 联合自注意力,几何与语义表征天然耦合。

方法步骤详情

第一步,输入编码:图像序列与指令分别经 ViT、文本 tokenizer、VAE 编码器转为条件 token,拼成 $C_{seq}$ 或 $C_{field}$。第二步,目标表示:稠密场任务(深度/点图/光流)经 $\Phi_\tau$ 变为图像对齐场并缩放到 VAE 输入范围;序列任务(位姿/QA)经 $S_\tau$ 序列化为规范 token 序列,QA 中的查询点深度按指令出现顺序排列后接答案 token。第三步,训练:冻结 VAE 把目标场编码为 $z_0$ 构造整流流路径,每个样本按任务类型激活对应损失——序列任务为 $\mathcal{L}_{seq} = -\frac{1}{L_\tau}\sum_j \log p_\theta(s_j \mid C_{seq}, s_{<j})$(仅在目标 token 位置计算),稠密场任务为流匹配损失 $\mathcal{L}_{field}$,单样本损失取 $\lambda\mathcal{L}_{seq}$ 或 $\mathcal{L}_{field}$。第四步,推理:位姿与答案自回归解码后确定性反序列化;光流执行"预测-扭曲-再预测"细化——用当前流 $F$ 对齐第二帧 $I'_2(x)=I_2(x+F(x))$ 后预测残差 $\Delta F$,输出 $F+\Delta F$。

技术新颖性

本文与三条技术路线形成对照。相比 DUSt3R/VGGT 等固定管线的前馈几何模型,SPARGen 把重建与对应变成指令条件行为,同一模型还能回答空间问题,Sintel 深度 AbsRel 0.235 甚至优于 VGGT 的 0.265。相比最接近的 G2VLM(引入几何专用专家组件),本文完全复用 Bagel 原生的整流流与自回归通路,靠"改写输出形式"而非"增加模块"实现统一——G2VLM 在 7Scenes Acc 退到 0.062,SPARGen 保持 0.034。相比 SpatialVLM/SpatialRGPT/VLM-3R 依赖外部深度插件或几何编码器,本文的几何监督直接作用于 MoT 共享自注意力中的联合表征。消融为互补监督提供了证据:去几何监督后 KITTI 光流 EPE 从 4.09 恶化到 4.29、SPAR 降到 62.41;去光流监督 7Scenes Acc 升到 0.040、SPAR 降到 65.92,说明对应监督利于跨视角一致性;去推理监督后光流反而略升(EPE 4.06),作者据此指出自回归 token 生成与稠密场预测间存在温和的容量竞争——这种坦率的机制分析在同类工作中少见。

Overview of SPARGen. Given a sequence of RGB images and a language instruction, SPARGen represents spatial outputs as sequences or image-aligned fields. These two output formats are generated through the native autoregressive and rectified-flow pathways of a shared MoT backbone. The dashed box denotes the training-only encoding of target fields.
Figure 2: Overview of SPARGen. Given a sequence of RGB images and a language instruction, SPARGen represents spatial outputs as sequences or image-aligned fields. These two output formats are generated through the native autoregressive and rectified-flow pathways of a shared MoT backbone. The dashed box denotes the training-only encoding of target fields.

实验结果

实验遵循最接近基线 G2VLM 的协议,采用尺度对齐评估。视觉几何(表1):Sintel 深度 AbsRel 0.235、$\delta_1$ 0.725,优于 VGGT(0.265/0.676)与 G2VLM(0.257/0.674);NYU-v2 AbsRel 0.071 优于 G2VLM 的 0.079、略逊 VGGT 的 0.065;7Scenes 点图 Acc 0.034 显著好于 G2VLM 的 0.062(VGGT 仍最优 0.022);Co3Dv2 位姿 RRA/RTA/AUC@30 = 96.84/94.33/74.32,全面超 G2VLM(AUC 56.85)但低于专用 VGGT(89.78)。空间推理(表2):四基准平均分全部第一——MindCube 76.04、OmniSpatial 54.00、OST 56.02、SPAR 66.60,15 个类别中 13 项居非专有模型之首,较各基准最强对手分别提升 9.85/1.97/4.99/24.71 分,且超过 Qwen2.5-VL-72B(41.71)与 GPT-4o(41.52),说明收益不能仅归因于模型规模。光流(表3):KITTI 零样本 EPE 4.09、F1-all 13.34,均优于 RAFT(5.03/17.45)、GMFlow(7.77/23.40)与 FlowFormer(4.10/14.51),细化步骤贡献显著(无细化 EPE 5.26)。表4 消融进一步证实三类监督的正向交互。

Comparison across depth estimation, point map estimation, and camera pose estimation benchmarks. Bold indicates the best performance within each model group.
Table 1: Comparison across depth estimation, point map estimation, and camera pose estimation benchmarks. Bold indicates the best performance within each model group.
Results on spatial-reasoning benchmarks. Bold and underlined values indicate the best and second-best results among non-proprietary models.
Table 2: Results on spatial-reasoning benchmarks. Bold and underlined values indicate the best and second-best results among non-proprietary models.
Zero-shot optical flow results on KITTI. Bold values indicate the best performance.
Table 3: Zero-shot optical flow results on KITTI. Bold values indicate the best performance.
Ablation of geometry, optical flow, and spatial-reasoning supervision. Bold values indicate the best performance.
Table 4: Ablation of geometry, optical flow, and spatial-reasoning supervision. Bold values indicate the best performance.
Qualitative results of SPARGen on point map reconstruction, optical flow estimation, and depth estimation. For optical flow, we show the predictions and error maps before and after refinement.
Figure 3: Qualitative results of SPARGen on point map reconstruction, optical flow estimation, and depth estimation. For optical flow, we show the predictions and error maps before and after refinement.
查看结构化数据
任务指标本文基线提升
深度估计(Sintel) AbsRel↓ / δ1↑ 0.235 / 0.725 VGGT 0.265/0.676;G2VLM 0.257/0.674 AbsRel 较 VGGT 降低 11.3%,δ1 提升 4.9pt
深度估计(NYU-v2) AbsRel↓ / δ1↑ 0.071 / 0.935 VGGT 0.065/0.938;G2VLM 0.079/0.935 优于 G2VLM,略逊专用 VGGT
点图重建(7Scenes) Acc.↓ / Comp.↓ 0.034 / 0.028 VGGT 0.022/0.032;G2VLM 0.062/0.031 Acc 较 G2VLM 改善 45%,Comp 为全表最优
相机位姿(Co3Dv2) RRA@30 / RTA@30 / AUC@30↑ 96.84 / 94.33 / 74.32 VGGT 98.79/96.89/89.78;G2VLM 96.69/92.22/56.85 AUC@30 较 G2VLM 提升 17.47pt,仍落后 VGGT 15.46pt
空间推理(MindCube Tiny) 平均准确率↑ 76.04 Spatial-MLLM-7B 66.19;GPT-4o 41.52 +9.85pt(相对最强非专有对手)
空间推理(SPAR-Bench) 平均准确率↑ 66.60 VLM3R-7B 41.89;Bagel-7B 39.51 +24.71pt,High 子集 79.25 领先最多
空间推理(OmniSpatial / OST) 平均准确率↑ 54.00 / 56.02 OmniSpatial 最强 52.03(Qwen2.5-VL-72B);OST 最强 51.03(VLM3R-7B) 分别 +1.97pt 和 +4.99pt
光流估计(KITTI 零样本) EPE↓ / F1-all↓ 4.09 / 13.34 FlowFormer 4.10/14.51;RAFT 5.03/17.45;GMFlow 7.77/23.40 两项指标均最优,细化步骤使 EPE 从 5.26 降至 4.09

局限与改进

作者明确承认的局限:复用冻结 VAE 使潜空间存在固有空间压缩,几何边缘和高精度物理量的保真度受限。结合正文可进一步观察到:① 与 VGGT、G2VLM 一样,SPARGen 预测归一化深度和点图,无法恢复度量尺度,这在需要绝对尺寸的机器人导航、AR 场景中是实际障碍;② 统一性在部分几何指标上仍有代价——Co3Dv2 AUC@30(74.32)落后专用 VGGT 15.46 分,ETH3D 点图 Acc 0.393/Comp 0.445 也劣于 VGGT 的 0.311/0.372;③ 消融显示自回归 token 生成与稠密场预测存在容量竞争,去掉推理监督后 KITTI EPE 反而从 4.09 微降到 4.06,说明多任务配比尚未调到最优;④ 训练消耗 64 块 H100、100K 步,并聚合了 30 多个数据集还需 MoGe 生成伪标签,资源门槛极高;⑤ 光流细化虽把 EPE 从 5.26 降到 4.09,但预测-扭曲-再预测带来额外推理开销,且消融只覆盖 7Scenes/KITTI/SPAR 三个点,NYU-v2、ETH3D 等基准对监督消融的敏感性未知。

独立分析的弱点

弱点一:VAE 潜空间分辨率瓶颈。VAE 约 8 倍空间下采样会抹平细小结构——栏杆、细线、远处行人——的深度和光流精度,这在高精度三维测量场景是硬伤。改进方向:引入边缘感知的潜空间约束、多尺度级联解码,或训练几何感知的 tokenizer 替代冻结 VAE。弱点二:位姿 token 化的精度封顶。$10^{-3}$ 量化叠加固定序列化顺序,使长序列视觉定位的累积误差难以控制(AUC@30 仅 74.32 vs VGGT 89.78),可改用混合表示:token 给粗值、旁路轻量回归给出残差修正。弱点三:容量竞争缺乏机制级分析。论文仅以"自回归 token 生成与动态稠密场预测竞争 MoT 容量"一句带过,未量化梯度冲突,可引入任务梯度冲突度量、专家路由正则或损失动态加权。弱点四:评测协议单一。所有基准都跟随 G2VLM 协议且为尺度对齐评估,缺少 SLAM、机器人抓取等真实下游任务验证,实用性证据不足。弱点五:推理成本不透明。双通路推理加光流细化的延迟、显存与专用模型(如 VGGT 单次前向)的对比完全缺失,影响工程落地判断。

未来方向

作者在结论中点名:突破 VAE 空间压缩对几何边缘和高精度物理量的瓶颈是首要方向,例如几何感知潜空间或超高分辨率生成通路。基于本文成果可延伸:① 把"输出形式原生匹配"范式推广到表面法线、特征匹配、视频深度、4D 动态重建等更多稠密任务,检验统一接口的普适性;② 恢复度量尺度,如引入 IMU 先验、CAD 先验或可学习的尺度 token;③ 消融揭示了监督间的正向迁移与容量竞争并存,值得系统研究监督配比定律、课程学习以及交叉通路蒸馏,让语义与几何任务"各占其位";④ 面向具身智能:把 3D 重建、光流与空间问答的统一指令接口接入机器人操纵与导航规划,验证几何感知对下游决策的增益;⑤ 将"预测-扭曲-再预测"细化为通用的生成-对齐-修正迭代范式,应用于点图与深度输出的自我修正;⑥ 沿 VGGT-Ω 的路线扩大骨干与数据规模,观察空间能力是否随规模继续增长。

复现评估

复现难度中等偏高。有利条件:基座 Bagel 开源;训练数据全为公开数据集(推理侧 MindCube、SPAR-7M、LLaVA-OneVision,几何侧 ScanNet v2/++、CO3D、BlendedMVS、Hypersim、Taskonomy、WildRGB-D 等,光流侧 TartanAir、FlyingThings3D、Spring 等),伪标签工具 MoGe 同样开源;超参完整——AdamW、100K 步、学习率 $2.5\times10^{-5}$、$\lambda=0.25$、各任务 ViT/VAE 最大分辨率 518/448/980 与 1024/512/1024、位姿量化分辨率 $10^{-3}$。不利条件:正文未附代码发布声明;64 块 H100 的算力需求远超普通实验室,完整复现成本高昂;数据混合比例与 MoGe 伪标签生成配置指向附录(所给正文未含),细节完整性待查。建议路径:先在小规模子集上微调 Bagel,验证"稠密场走整流流 + 序列走自回归"的双目标训练管线能否收敛,再逐步扩展至完整数据配比。