SpatialBench:你的空间基础模型是个全能选手吗? SpatialBench: Is Your Spatial Foundation Model an All-Round Player?
跨范式确定性空间基础模型评测基准,配套DA-Next-5M与DA-Next。
前置知识
空间基础模型(Spatial Foundation Model)
指能够从图像或视频中端到端恢复3D结构(深度、相机位姿、点云)的通用视觉几何骨干网络,代表工作如DUSt3R、MASt3R、VGGT、DA3等。它们将传统SfM/SLAM中的优化与匹配统一进单次前向推理,是当前具身智能与AR/VR的核心感知模块。
本文正是围绕这类模型的评测展开,理解不同范式(优化式、端到端、流式等)的设计取舍才能读懂主表里的对比。
重建范式(Reconstruction Paradigm)
空间模型处理多视图输入的六大工程路线:Optimization、Feed-Forward、Online Streaming、Chunk-wise、SLAM-based与Test-Time Training,分别代表全局对齐、单次前向、空间记忆、分块拼接、跟踪+学习先验与推理时在线适应等设计取舍。
SpatialBench的核心创新就是首次把六种范式放到同一评测协议下公平对比,读者必须分清这些范式才能看懂Table 1。
Bundle Adjustment(光束法平差)
经典的SfM/SLAM优化技术,通过同时优化相机位姿与三维点位置最小化重投影误差。本文在DROID数据治理流水线中用其精化初始位姿,并用SAM3分割的动态区域掩膜排除前景,确保背景静态假设不被破坏。
这是DA-Next-5M数据集能产出高质量相机位姿的关键步骤,理解其流程有助于把握数据集的可信度。
Test-Time Training(TTT)
推理阶段对模型参数或场景表征做在线适应的技术,用于处理训练时未见过、推理时遇到的分布变化。在SpatialBench的TTT范式中,TTT3R、Scal3R、LoGeR分别对应CUT3R、VGGT、Pi3三种base模型的扩展。
本文专门设置Table 2检验TTT是否“万能解药“,发现其仅在dense长序列上稳定获益,是核心结论之一。
确定性多密度采样(Deterministic Multi-Density Sampling)
SpatialBench的核心方法论创新:对每个场景预先计算Single/Sparse/Medium/Dense四套确定的帧索引配置,所有模型在相同帧上评测,从而把场景难度与输入密度两个变量解耦。Sparse使用集合覆盖式贪心选择最大化视角多样性,Medium则在固定预算下偏好中度重叠。
这是SpatialBench区别于以往基准(如E3D-Bench用随机采样)的关键,理解它才能理解为什么同模型在不同regime下性能差异巨大。
研究动机
当前空间基础模型(如VGGT、DA3、Pi3等)虽然在各自设计的数据集上表现惊艳,但面对真实部署场景时暴露出严重短板。第一,现有评测覆盖的范式太窄,多数基准只测feed-forward而忽略streaming、SLAM、TTT等,使不同方法不可比;第二,不同论文即便用同一数据集也常采用不同的scene split、私有子集、帧索引或窗口长度,导致横向对比模糊;第三,几乎没有基准系统考察模型在不同输入密度(从单帧到上千帧)下的可扩展性,导致dense长视频场景下的OOM、漂移、一致性问题被掩盖;第四,测试域过于集中在室内或物体级重建,机器人ego-view、wrist-view、自动驾驶等具身场景几乎缺位。例如Table 1里VGGT在sparse下AUC@30达0.700,但dense下直接OOM;而SLAM-based方法MASt3R-SLAM在sparse下AUC@30仅0.190,反差巨大。
本文的目标是构建一个跨范式(6类)、跨域(5类场景、19个数据集、546个场景)、多任务(5个任务套件)、多密度(4档输入)的统一评测基准SpatialBench,对当前31个模型41个变体做公平可复现的横向打分;并在评测基础上识别领域泛化、密度扩展、数据质量等关键短板,提出针对性解决方案。具体可量化目标包括:让每个模型在四档密度下都跑同一组确定帧;让prior-enhanced模型在GT深度/位姿先验下的能力差异被精确测出(Table 3);让DA-Next-5M在ego/wrist域上的实测增益达+47%/+59% AbsRel。
与已有工作不同的是,已有基准如E3D-Bench、Robust MVD虽然涉及多任务评估,但要么不支持跨范式横向,要么测试域单一,要么采样策略随机不可复现;模型自带评测(DA3、Pi3、MapAnything各自报告)则普遍存在选择性偏差。SpatialBench抓住了“评测本身需要标准化、可复现、跨范式“这一被忽视的方法论缺口,并发现当前领域的最大短板不是模型容量而是具身ego/wrist数据的严重缺失,进而用DA-Next-5M+DA-Next这套“评测+数据+模型“三件套填补缺口。
核心方法
SpatialBench的设计哲学可类比为“3D视觉领域的ImageNet“——它本身不发明新模型,而是提供一套“考卷“和一个“考生参考书“。具体做法分三步:首先把19个异构数据集归一化到统一schema(RGB+metric depth+pose+intrinsics),并对DROID专门设计一条stereo→S2M2→MapAnything→SAM3分割→Bundle Adjustment的治理流水线以得到高质量腕视真值;然后为每个场景预计算Single/Sparse/Medium/Dense四档确定帧索引,其中Sparse用加权集合覆盖最大化视角多样性、Medium鼓励中等重叠、Dense保留时序连续性;最后统一封装31个模型41个变体的适配器,让它们在五种任务(深度、相机位姿、轨迹、稠密重建、先验增强)上同台打分。配套提出的DA-Next在DA3-Giant基础上增加Scale Token与轻量MLP头,预测每个scene的metric scale因子 $\hat{S}$,从而把DA3的affine-invariant输出升级为绝对尺度metric预测。
本文有两条相互独立又互补的核心idea。第一条是评测层面:把“输入密度“和“领域覆盖“作为独立的可调变量,使用确定性采样把所有模型关进同一个“考卷“,让原本不可比的方法获得统一打分(Figure 1那张比E3D-Bench在“测试域×密度×范式“三维空间大几个量级的对比图就是这一思想的视觉化)。第二条是模型层面:DA-Next在DA3的alternating attention + Dual-DPT基础上,引入一个全局Scale Token $\mathbf{e}_s$ 和3层MLP head,输出每个scene的metric scale $\hat{S} \in \mathbb{R}^+$,配合 $\mathcal{L}_{scale}=\|f_{\log}(\hat{S})-f_{\log}(S)\|_1$ 的log空间监督,让网络从原本的scale-invariant表示升级到end-to-end的metric输出——这与Pi3-X依赖后端AMB3R恢复metric的方案思路完全不同,是首次在Giant级别feed-forward transformer内原生回归绝对尺度。
方法步骤详情
SpatialBench侧分四步:(1)归一化,19个数据集转统一schema,DROID经S2M2→MapAnything→SAM3→BA精化pose;(2)多密度采样,Sparse用集合覆盖贪心最大化voxel覆盖,Medium偏好中等重叠,Dense保留时序连续性并加帧数上限;(3)统一打分:深度AbsRel/RMSE,位姿AUC@30,轨迹ATE/RPE(Sim(3)对齐),先验增强以GT depth/pose为辅助;(4)汇总41个变体出主结果。DA-Next侧:输入与Scale Token拼接经$L=40$层alternating attention,Patch/Camera Token进Dual-DPT输出深度与ray,Scale Token经3层MLP输出metric scale;损失含深度/梯度/ray/point/scale五项,GT经canonical化与场景尺度归一化;4×H200训练7天、相机条件以$p=20\%$注入。
技术新颖性
技术新颖性体现在三个层面:评测协议上,deterministic multi-density sampling与weighted set-cover公式是首创,把以往随机评测的不确定性彻底消除;数据治理上,DROID pipeline把stereo depth + learned pose + segmentation + BA四步串起来首次产出高质量腕视真值序列;模型上,DA-Next把scale token作为可学习的全局表征嵌入alternating attention,与Pi3依赖affine-invariant、AMB3R依赖后端metric scale等已有方案相比,是第一条在giant级feed-forward transformer内部原生回归metric scale的路径——其训练目标里 $\mathcal{L}_{scale}$ 用log-space压缩动态范围也是首次出现在这类setting中。
实验结果
四条结论:(1)Full-context定义精度上限——DA3-Giant sparse AUC@30=0.785、AbsRel=0.095,Pi3紧随其后0.742,显著优于streaming(Spann3R仅0.329);(2)Bounded-memory解锁长序列——full-context显存随$N$上升至OOM,LongStream等维持平缓曲线,dense下LongStream-S的ATE=5.634远低于失败基线;(3)数据质量胜过数量——DA3通过合成+伪GT精化在数据集数量并非最多时取得feed-forward内最高分;(4)Ego/wrist域是主要缺口——DA-Next在sparse AbsRel从0.095降到0.050(-47.4%)、medium从0.086降到0.035(-59.3%),pose AUC@30提升+3.1%与+5.5%。Table 3揭示反直觉事实:GT深度先验让所有模型逼近近完美深度,但GT位姿先验收益不一致——DA3-Giant严格服从先验,OmniVGGT、Pi3-X则部分覆盖注入的pose。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Sparse 深度估计 | AbsRel↓ | 0.050 (DA-Next) | 0.095 (DA3-Giant) | -47.4% |
| Medium 深度估计 | AbsRel↓ | 0.035 (DA-Next) | 0.086 (DA3-Giant) | -59.3% |
| Sparse 相机位姿 | AUC@30↑ | 0.809 (DA-Next) | 0.785 (DA3-Giant) | +3.1% |
| Medium 相机位姿 | AUC@30↑ | 0.819 (DA-Next) | 0.776 (DA3-Giant) | +5.5% |
| Sparse 重建 | F-Score↑ | 0.727 (DA-Next) | 0.742 (DA3-Giant) | -2.0% |
| Dense 长序列 | ATE↓ | 1.989 (LingbotMap*-S) | OOM (VGGT, DA3-Giant) | 可运行 |
| TTT vs Base on Dense | AUC@30↑ | 0.598 (Pi3→LoGeR) | 0.524 (Pi3) | +14.1% |
| GT 深度先验注入 (Pi3-X medium) | AbsRel↓ | 0.008 (有先验) | 0.078 (无先验) | -89.7% |
| GT 位姿先验注入 (DA3-Giant sparse) | AUC@15↑ | 0.969 (有先验) | 0.699 (无先验) | +38.6% |
| Wrist-view 域训练增益 | in-domain 覆盖率 | 10/10 ego/wrist数据集 | 0/10 (DA3) | 闭合域缺口 |
局限与改进
作者明确承认的局限:(1) DA-Next在dense regime仍OOM,说明Giant级feed-forward架构的内存墙未被打破,长序列任务仍要靠Stream3R、LoGeR等bounded-memory方案;(2) Dense regime下绝大多数full-context模型的ATE远高于1(如Pi3-X=8.478、DA3-Streaming=4.569),global consistency尚未解决;(3) GT位姿先验对OmniVGGT/WorldMirror等模型的覆盖率有限,揭示“先验服从“并未成为通用能力。我自己的观察:(4) 评测未涉及RGB-only novel view synthesis与动态目标级重建这两大重要任务,benchmark的几何偏向性较强;(5) 41个模型中的weight checkpoint版本、训练数据子集等元信息未完全公开,公平性可能受checkpoint迭代影响;(6) 评测协议固定帧索引但模型代码栈持续迭代,存在“基准老化“风险。
独立分析的弱点
独立分析的弱点有四:(1)场景级可扩展性不足——DA-Next在dense下OOM的根本原因是alternating attention仍做full self-attention,复杂度$O(N^2)$,改进方向是引入Nyströmformer式线性attention并在Scale/Patch Token间设计sparse交互;(2)度量尺度回归边界模糊——log-space压缩在scale差异极大的混合训练下可能梯度不均衡,建议按scene类型分桶训练;(3)Wrist-view数据合成与真实有差距——DA-Next-5M中5/7是仿真数据,其光照、材质与真实DROID有gap,建议追加更多real-world wrist序列并用RL-based domain randomization缩小sim-to-real差距;(4)Prior服从能力未单独评估——Table 3揭示不同模型对GT pose的服从度差异巨大,但缺乏专门的prior rejection vs acceptance子基准,建议未来加一项先验鲁棒性评测。
未来方向
作者提出的未来方向包括:(a) 探索memory-efficient attention降低full-context模型的$N^2$成本;(b) 扩充具身领域数据并验证sim-to-real gap的影响。基于成果可延伸的方向:(c) 把deterministic multi-density协议推广到4D动态重建benchmark,覆盖Sintel、Davis等动态序列;(d) 把Scale Token设计抽象为“task-specific global latent“机制,推广到其他需要全局上下文的任务(如novel view synthesis的相机控制);(e) 把prior-enhanced的Table 3做成一个独立sub-benchmark,量化每个模型在多大程度上“信任“外部先验,这对融合传统SfM/SLAM与学习模型至关重要;(f) 探索在线学习式的scale calibration,用首帧的metric depth微调Scale Head以避免跨域尺度漂移。
复现评估
复现评估:作者明确开源——项目页 ropedia.github.io/SpatialBench、数据集 ropedia-ai/DA-Next-5M、代码 github.com/Ropedia/SpatialBench、模型 ropedia-ai/DA-Next全部公开;训练算力门槛中等偏高,DA-Next在4×H200 GPU上训练7天(BF16混合精度、batch=18帧/epoch、10 epoch),按当前云端价格估算约2000-4000美元一次完整训练;数据集规模5.5M帧×RGB+depth+pose全部需要本地存储约数TB;评测门槛更低,单卡A100/H100即可对baseline做单regime复现。整体难度:评测模块中等(环境配置+adapter封装),模型复现较高(算力与全量数据门槛)。
论文图表
Teaser图,密集展示五个关键洞察(Full Context设精度上限、Bounded Memory解锁长序列、Domain Converge、OOD in Ego/Embodied、Data Quality vs Quantity)和DA-Next-5M的统计信息。
这张图是整篇论文的视觉摘要,能让读者一图掌握全文核心论点与贡献清单。