← 返回 2026-05-27

SpatialBench:你的空间基础模型是个全能选手吗? SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

Haosong Peng, Hao Li, Jiaqi Chen, Yuhao Pan, Runmao Yao, Yalun Dai, Fushuo Huo, Fangzhou Hong, Zhaoxi Chen, Haozhao Wang, Dingwen Zhang, Ziwei Liu, Wenchao Xu 📅 2026-05-26 👍 72 2026-07-13 08:36
3D视觉 具身智能 基准测试 多视角重建 数据集 空间基础模型

跨范式确定性空间基础模型评测基准,配套DA-Next-5M与DA-Next。

前置知识

空间基础模型(Spatial Foundation Model)

指能够从图像或视频中端到端恢复3D结构(深度、相机位姿、点云)的通用视觉几何骨干网络,代表工作如DUSt3R、MASt3R、VGGT、DA3等。它们将传统SfM/SLAM中的优化与匹配统一进单次前向推理,是当前具身智能与AR/VR的核心感知模块。

本文正是围绕这类模型的评测展开,理解不同范式(优化式、端到端、流式等)的设计取舍才能读懂主表里的对比。

重建范式(Reconstruction Paradigm)

空间模型处理多视图输入的六大工程路线:Optimization、Feed-Forward、Online Streaming、Chunk-wise、SLAM-based与Test-Time Training,分别代表全局对齐、单次前向、空间记忆、分块拼接、跟踪+学习先验与推理时在线适应等设计取舍。

SpatialBench的核心创新就是首次把六种范式放到同一评测协议下公平对比,读者必须分清这些范式才能看懂Table 1。

Bundle Adjustment(光束法平差)

经典的SfM/SLAM优化技术,通过同时优化相机位姿与三维点位置最小化重投影误差。本文在DROID数据治理流水线中用其精化初始位姿,并用SAM3分割的动态区域掩膜排除前景,确保背景静态假设不被破坏。

这是DA-Next-5M数据集能产出高质量相机位姿的关键步骤,理解其流程有助于把握数据集的可信度。

Test-Time Training(TTT)

推理阶段对模型参数或场景表征做在线适应的技术,用于处理训练时未见过、推理时遇到的分布变化。在SpatialBench的TTT范式中,TTT3R、Scal3R、LoGeR分别对应CUT3R、VGGT、Pi3三种base模型的扩展。

本文专门设置Table 2检验TTT是否“万能解药“,发现其仅在dense长序列上稳定获益,是核心结论之一。

确定性多密度采样(Deterministic Multi-Density Sampling)

SpatialBench的核心方法论创新:对每个场景预先计算Single/Sparse/Medium/Dense四套确定的帧索引配置,所有模型在相同帧上评测,从而把场景难度与输入密度两个变量解耦。Sparse使用集合覆盖式贪心选择最大化视角多样性,Medium则在固定预算下偏好中度重叠。

这是SpatialBench区别于以往基准(如E3D-Bench用随机采样)的关键,理解它才能理解为什么同模型在不同regime下性能差异巨大。

研究动机

当前空间基础模型(如VGGT、DA3、Pi3等)虽然在各自设计的数据集上表现惊艳,但面对真实部署场景时暴露出严重短板。第一,现有评测覆盖的范式太窄,多数基准只测feed-forward而忽略streaming、SLAM、TTT等,使不同方法不可比;第二,不同论文即便用同一数据集也常采用不同的scene split、私有子集、帧索引或窗口长度,导致横向对比模糊;第三,几乎没有基准系统考察模型在不同输入密度(从单帧到上千帧)下的可扩展性,导致dense长视频场景下的OOM、漂移、一致性问题被掩盖;第四,测试域过于集中在室内或物体级重建,机器人ego-view、wrist-view、自动驾驶等具身场景几乎缺位。例如Table 1里VGGT在sparse下AUC@30达0.700,但dense下直接OOM;而SLAM-based方法MASt3R-SLAM在sparse下AUC@30仅0.190,反差巨大。

本文的目标是构建一个跨范式(6类)、跨域(5类场景、19个数据集、546个场景)、多任务(5个任务套件)、多密度(4档输入)的统一评测基准SpatialBench,对当前31个模型41个变体做公平可复现的横向打分;并在评测基础上识别领域泛化、密度扩展、数据质量等关键短板,提出针对性解决方案。具体可量化目标包括:让每个模型在四档密度下都跑同一组确定帧;让prior-enhanced模型在GT深度/位姿先验下的能力差异被精确测出(Table 3);让DA-Next-5M在ego/wrist域上的实测增益达+47%/+59% AbsRel。

与已有工作不同的是,已有基准如E3D-Bench、Robust MVD虽然涉及多任务评估,但要么不支持跨范式横向,要么测试域单一,要么采样策略随机不可复现;模型自带评测(DA3、Pi3、MapAnything各自报告)则普遍存在选择性偏差。SpatialBench抓住了“评测本身需要标准化、可复现、跨范式“这一被忽视的方法论缺口,并发现当前领域的最大短板不是模型容量而是具身ego/wrist数据的严重缺失,进而用DA-Next-5M+DA-Next这套“评测+数据+模型“三件套填补缺口。

核心方法

SpatialBench的设计哲学可类比为“3D视觉领域的ImageNet“——它本身不发明新模型,而是提供一套“考卷“和一个“考生参考书“。具体做法分三步:首先把19个异构数据集归一化到统一schema(RGB+metric depth+pose+intrinsics),并对DROID专门设计一条stereo→S2M2→MapAnything→SAM3分割→Bundle Adjustment的治理流水线以得到高质量腕视真值;然后为每个场景预计算Single/Sparse/Medium/Dense四档确定帧索引,其中Sparse用加权集合覆盖最大化视角多样性、Medium鼓励中等重叠、Dense保留时序连续性;最后统一封装31个模型41个变体的适配器,让它们在五种任务(深度、相机位姿、轨迹、稠密重建、先验增强)上同台打分。配套提出的DA-Next在DA3-Giant基础上增加Scale Token与轻量MLP头,预测每个scene的metric scale因子 $\hat{S}$,从而把DA3的affine-invariant输出升级为绝对尺度metric预测。

本文有两条相互独立又互补的核心idea。第一条是评测层面:把“输入密度“和“领域覆盖“作为独立的可调变量,使用确定性采样把所有模型关进同一个“考卷“,让原本不可比的方法获得统一打分(Figure 1那张比E3D-Bench在“测试域×密度×范式“三维空间大几个量级的对比图就是这一思想的视觉化)。第二条是模型层面:DA-Next在DA3的alternating attention + Dual-DPT基础上,引入一个全局Scale Token $\mathbf{e}_s$ 和3层MLP head,输出每个scene的metric scale $\hat{S} \in \mathbb{R}^+$,配合 $\mathcal{L}_{scale}=\|f_{\log}(\hat{S})-f_{\log}(S)\|_1$ 的log空间监督,让网络从原本的scale-invariant表示升级到end-to-end的metric输出——这与Pi3-X依赖后端AMB3R恢复metric的方案思路完全不同,是首次在Giant级别feed-forward transformer内原生回归绝对尺度。

方法步骤详情

SpatialBench侧分四步:(1)归一化,19个数据集转统一schema,DROID经S2M2→MapAnything→SAM3→BA精化pose;(2)多密度采样,Sparse用集合覆盖贪心最大化voxel覆盖,Medium偏好中等重叠,Dense保留时序连续性并加帧数上限;(3)统一打分:深度AbsRel/RMSE,位姿AUC@30,轨迹ATE/RPE(Sim(3)对齐),先验增强以GT depth/pose为辅助;(4)汇总41个变体出主结果。DA-Next侧:输入与Scale Token拼接经$L=40$层alternating attention,Patch/Camera Token进Dual-DPT输出深度与ray,Scale Token经3层MLP输出metric scale;损失含深度/梯度/ray/point/scale五项,GT经canonical化与场景尺度归一化;4×H200训练7天、相机条件以$p=20\%$注入。

技术新颖性

技术新颖性体现在三个层面:评测协议上,deterministic multi-density sampling与weighted set-cover公式是首创,把以往随机评测的不确定性彻底消除;数据治理上,DROID pipeline把stereo depth + learned pose + segmentation + BA四步串起来首次产出高质量腕视真值序列;模型上,DA-Next把scale token作为可学习的全局表征嵌入alternating attention,与Pi3依赖affine-invariant、AMB3R依赖后端metric scale等已有方案相比,是第一条在giant级feed-forward transformer内部原生回归metric scale的路径——其训练目标里 $\mathcal{L}_{scale}$ 用log-space压缩动态范围也是首次出现在这类setting中。

SpatialBench场景类别分布(左)与数据源/帧数中位数(右)概览。
Figure 2: SpatialBench场景类别分布(左)与数据源/帧数中位数(右)概览。
DROID数据治理流水线:S2M2→MapAnything→SAM3→Bundle Adjustment。
Figure 3: DROID数据治理流水线:S2M2→MapAnything→SAM3→Bundle Adjustment。
DA-Next-5M数据样本展示:ADT、Xperience、HOI4D、RoboLab、RLBench、RoboTwin、Colosseum。
Figure 4: DA-Next-5M数据样本展示:ADT、Xperience、HOI4D、RoboLab、RLBench、RoboTwin、Colosseum。
DA-Next模型架构总览:新增Scale Token与Scale Head用于预测metric scale。
Figure 5: DA-Next模型架构总览:新增Scale Token与Scale Head用于预测metric scale。

实验结果

四条结论:(1)Full-context定义精度上限——DA3-Giant sparse AUC@30=0.785、AbsRel=0.095,Pi3紧随其后0.742,显著优于streaming(Spann3R仅0.329);(2)Bounded-memory解锁长序列——full-context显存随$N$上升至OOM,LongStream等维持平缓曲线,dense下LongStream-S的ATE=5.634远低于失败基线;(3)数据质量胜过数量——DA3通过合成+伪GT精化在数据集数量并非最多时取得feed-forward内最高分;(4)Ego/wrist域是主要缺口——DA-Next在sparse AbsRel从0.095降到0.050(-47.4%)、medium从0.086降到0.035(-59.3%),pose AUC@30提升+3.1%与+5.5%。Table 3揭示反直觉事实:GT深度先验让所有模型逼近近完美深度,但GT位姿先验收益不一致——DA3-Giant严格服从先验,OmniVGGT、Pi3-X则部分覆盖注入的pose。

SpatialBench主结果表:41个模型在Single/Sparse/Medium/Dense及Average下的AbsRel/AUC@30/ATE/F-Score。
Table 1: SpatialBench主结果表:41个模型在Single/Sparse/Medium/Dense及Average下的AbsRel/AUC@30/ATE/F-Score。
TTT vs Base模型在不同输入长度regime下的对比(base→TTT格式)。
Table 2: TTT vs Base模型在不同输入长度regime下的对比(base→TTT格式)。
GT深度/位姿先验注入对5个prior-aware模型的影响(Sparse/Medium)。
Table 3: GT深度/位姿先验注入对5个prior-aware模型的影响(Sparse/Medium)。
SpatialBench采用的19个源数据集及其场景属性(environment/dynamics/viewpoint/data type)。
Table 4: SpatialBench采用的19个源数据集及其场景属性(environment/dynamics/viewpoint/data type)。
所有被评测模型的训练数据集使用情况矩阵。
Table 5: 所有被评测模型的训练数据集使用情况矩阵。
DA-Next-5M数据集统计:7个数据集在视角(Ego/Wrist)、real/synthetic、帧数、scene数上的分布。
Table 7: DA-Next-5M数据集统计:7个数据集在视角(Ego/Wrist)、real/synthetic、帧数、scene数上的分布。
DA-Next训练用18个数据集的mixture比例与帧数。
Table 8: DA-Next训练用18个数据集的mixture比例与帧数。
固定输入长度$N=800$下的memory–accuracy–time全景snapshot。
Figure 6: 固定输入长度$N=800$下的memory–accuracy–time全景snapshot。
Peak GPU memory随输入序列长度的scaling曲线。
Figure 7: Peak GPU memory随输入序列长度的scaling曲线。
训练数据集数量、参数量与SpatialBench综合得分的关联散点图。
Figure 8: 训练数据集数量、参数量与SpatialBench综合得分的关联散点图。
Domain-level OOD严重程度:按评测域分组的跨模型平均AUC@30。
Figure 9: Domain-level OOD严重程度:按评测域分组的跨模型平均AUC@30。
SpatialBench上多视角重建的定性对比:MASt3R、OmniVGGT、Fast3R、MapAnything、CUT3R、VGGT-SLAM、Pi3-X、LingbotMap、DA-Next等。
Figure 10: SpatialBench上多视角重建的定性对比:MASt3R、OmniVGGT、Fast3R、MapAnything、CUT3R、VGGT-SLAM、Pi3-X、LingbotMap、DA-Next等。
查看结构化数据
任务指标本文基线提升
Sparse 深度估计 AbsRel↓ 0.050 (DA-Next) 0.095 (DA3-Giant) -47.4%
Medium 深度估计 AbsRel↓ 0.035 (DA-Next) 0.086 (DA3-Giant) -59.3%
Sparse 相机位姿 AUC@30↑ 0.809 (DA-Next) 0.785 (DA3-Giant) +3.1%
Medium 相机位姿 AUC@30↑ 0.819 (DA-Next) 0.776 (DA3-Giant) +5.5%
Sparse 重建 F-Score↑ 0.727 (DA-Next) 0.742 (DA3-Giant) -2.0%
Dense 长序列 ATE↓ 1.989 (LingbotMap*-S) OOM (VGGT, DA3-Giant) 可运行
TTT vs Base on Dense AUC@30↑ 0.598 (Pi3→LoGeR) 0.524 (Pi3) +14.1%
GT 深度先验注入 (Pi3-X medium) AbsRel↓ 0.008 (有先验) 0.078 (无先验) -89.7%
GT 位姿先验注入 (DA3-Giant sparse) AUC@15↑ 0.969 (有先验) 0.699 (无先验) +38.6%
Wrist-view 域训练增益 in-domain 覆盖率 10/10 ego/wrist数据集 0/10 (DA3) 闭合域缺口

局限与改进

作者明确承认的局限:(1) DA-Next在dense regime仍OOM,说明Giant级feed-forward架构的内存墙未被打破,长序列任务仍要靠Stream3R、LoGeR等bounded-memory方案;(2) Dense regime下绝大多数full-context模型的ATE远高于1(如Pi3-X=8.478、DA3-Streaming=4.569),global consistency尚未解决;(3) GT位姿先验对OmniVGGT/WorldMirror等模型的覆盖率有限,揭示“先验服从“并未成为通用能力。我自己的观察:(4) 评测未涉及RGB-only novel view synthesis与动态目标级重建这两大重要任务,benchmark的几何偏向性较强;(5) 41个模型中的weight checkpoint版本、训练数据子集等元信息未完全公开,公平性可能受checkpoint迭代影响;(6) 评测协议固定帧索引但模型代码栈持续迭代,存在“基准老化“风险。

独立分析的弱点

独立分析的弱点有四:(1)场景级可扩展性不足——DA-Next在dense下OOM的根本原因是alternating attention仍做full self-attention,复杂度$O(N^2)$,改进方向是引入Nyströmformer式线性attention并在Scale/Patch Token间设计sparse交互;(2)度量尺度回归边界模糊——log-space压缩在scale差异极大的混合训练下可能梯度不均衡,建议按scene类型分桶训练;(3)Wrist-view数据合成与真实有差距——DA-Next-5M中5/7是仿真数据,其光照、材质与真实DROID有gap,建议追加更多real-world wrist序列并用RL-based domain randomization缩小sim-to-real差距;(4)Prior服从能力未单独评估——Table 3揭示不同模型对GT pose的服从度差异巨大,但缺乏专门的prior rejection vs acceptance子基准,建议未来加一项先验鲁棒性评测。

未来方向

作者提出的未来方向包括:(a) 探索memory-efficient attention降低full-context模型的$N^2$成本;(b) 扩充具身领域数据并验证sim-to-real gap的影响。基于成果可延伸的方向:(c) 把deterministic multi-density协议推广到4D动态重建benchmark,覆盖Sintel、Davis等动态序列;(d) 把Scale Token设计抽象为“task-specific global latent“机制,推广到其他需要全局上下文的任务(如novel view synthesis的相机控制);(e) 把prior-enhanced的Table 3做成一个独立sub-benchmark,量化每个模型在多大程度上“信任“外部先验,这对融合传统SfM/SLAM与学习模型至关重要;(f) 探索在线学习式的scale calibration,用首帧的metric depth微调Scale Head以避免跨域尺度漂移。

复现评估

复现评估:作者明确开源——项目页 ropedia.github.io/SpatialBench、数据集 ropedia-ai/DA-Next-5M、代码 github.com/Ropedia/SpatialBench、模型 ropedia-ai/DA-Next全部公开;训练算力门槛中等偏高,DA-Next在4×H200 GPU上训练7天(BF16混合精度、batch=18帧/epoch、10 epoch),按当前云端价格估算约2000-4000美元一次完整训练;数据集规模5.5M帧×RGB+depth+pose全部需要本地存储约数TB;评测门槛更低,单卡A100/H100即可对baseline做单regime复现。整体难度:评测模块中等(环境配置+adapter封装),模型复现较高(算力与全量数据门槛)。