← 返回 2026-08-07

GST-Bench:视觉语言模型能否从视频中建立全局空间感知 GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li 📅 2026-08-06 👍 43 2026-08-11 18:30
VQA 具身智能 基准测试 空间智能 视觉语言模型 视频理解

视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。

前置知识

视觉语言模型 (Vision-Language Model, VLM)

能够同时处理图像/视频与文本、并对视觉内容进行理解与推理的大型多模态模型,如 Gemini-3-Pro、GPT-5、Qwen3-VL 系列、InternVL3.5 等。它们通常以视觉编码器抽取的 token 与文本 token 拼接后送入 LLM,从而回答关于图像或视频的问题。

GST-Bench 的全部评测对象就是 22 个 SOTA VLM,必须先理解 VLM 的输入输出接口(多帧视频+图像+文本→答案),才能看懂为何从单一帧难以完成全局空间任务。

全局空间感知 (Global Spatial Awareness)

指智能体在长时序、自我中心的视觉观测流中持续累积空间记忆,构建覆盖整个场景的一致性全局表征,并据此推理那些当前视野之外的目标位置、自身朝向与场景结构。它区别于只看一两张图就能回答的“局部空间感知”。

这是本文核心评测目标。理解“全局”二字是读懂三大能力(自我定位、目标定位、场景结构理解)以及为何要把目标物从查询视角中强制隐藏的关键。

自我中心视角与俯视图 (Egocentric View & Top-Down Image)

自我中心视角指从智能体第一人称相机看到的图像;俯视图则是从场景正上方鸟瞰渲染的全局地图,本文设了三档抽象:easy 级照片级鸟瞰、medium 级保留物体/墙体足迹的占用图、hard 级仅保留墙体的户型图。把自我中心观测映射到俯视图正是全局对齐能力的核心。

GST-Bench 的多数任务都要求模型把长视频的自我中心观测与俯视图对齐,不理解这两种视角及其三档抽象,就无法理解任务输入与场景结构理解子任务的设计。

OmniGibson 与 BEHAVIOR-1K 仿真平台

OmniGibson 是基于 NVIDIA Isaac Sim 的高保真室内仿真器,BEHAVIOR-1K 是其中包含上千个真实房屋扫描场景、带完整物体位姿与可导航区域的资产库。本文在其上构建自动数据生成流水线,可任意采样相机轨迹、视点,并直接获得 3D 坐标、距离、角度、俯视投影作为答案真值。

正是因为使用仿真才能做到“答案从几何直接算出”与“目标物在查询视角不可见”的硬约束,这是理解整个数据生成流水线与高质量标注的基础。

平均相对准确率 MRA (Mean Relative Accuracy)

沿用自 VSI-Bench 的距离误差指标:对预测 $\hat{y}$ 与真值 $y$,在置信阈值集 $C_d=\{0.50,0.55,\dots,0.95\}$ 上取相对误差 $|\hat{y}-y|/y < 1-\theta$ 的指示函数平均:$\text{MRA}=\frac{1}{|C_d|}\sum_{\theta\in C_d}\mathbb{1}(\frac{|\hat{y}-y|}{y}<1-\theta)$。它对误差大小敏感而非只看是否完全正确。

本文距离类任务(如自我中心距离)使用 MRA 评分,表1中 EDistv 项 Gemini-3-Pro 仅 25.35、人类 41.50 等数字都基于该指标,必须理解它才能正确解读模型与人类的差距。

研究动机

空间智能是具身智能体的根基——一个家用机器人要取物,必须从自我中心探索视频中增量构建场景表征、记住物体在哪里,并在物体离开当前视野后仍能推断其相对位置。然而现有空间基准大多局限于单图(如 left-of/under 类介词判断、CV-Bench)或多图(仅 2–3 视角,如 MM-Spatial、SPAR、MMSI-Bench),评测的是物体大小、相对深度、前后左右这类“局部空间属性”。即便是 VSI-Bench、MMSI-Video-Bench、OST-Bench、STI-Bench 等视频基准也存在三个共性问题:第一,未区分“单帧可解”与“必须跨帧全局推理”的任务,例如物体大小估计或存在性查询可能只需一帧;第二,方向类推理仍以左右/前后这类粗粒度类别为主,缺乏精确角度;第三,几乎不评估自我中心观测与显式全局表征(如俯视图)之间的对应关系。

本文的目标是本文要构建一个真正能压力测试“全局空间感知”的视频 VQA 基准 GST-Bench(Global-Spatial-Temporal Benchmark)。具体目标包括:强制每个任务都必须整合跨帧信息(目标物在查询视角中不可见),使单帧捷径失效;用精确的数值答案(距离、角度、点坐标)取代粗粒度类别判断以支持细粒度评测;引入俯视图作为显式全局表征以检验“自我中心→全局”的映射能力;并沿“我在哪里、目标在哪里、场景长什么样”三大能力展开成 12 个子任务、2,762 道人工核验题目、累计 6,790 分钟视频输入,最终用 22 个 SOTA VLM 全面暴露当前模型与人类之间的全局空间推理鸿沟。

与已有工作不同的是,本文的独特切入角度体现在四条“从构造上杜绝捷径”的设计原则。第一,目标物在查询视角被严格保证不可见,且查询视角采样自与视频轨迹无关的独立视点,模型既不能靠单帧识别目标,也不能靠图像直接匹配。第二,摒弃“A 和 B 谁更近”“A 在左还是右”这类粗判,改用距离、角度、点坐标等精确数值,配以 MRA、角度阈值准确率 $C_a=\{15°,30°,45°\}$、点距阈值准确率 $C_p=\{100,150,200,250,300\}$ 像素等连续指标。第三,首次系统引入三档抽象俯视图来评估自我中心观测能否被组织成全局一致的场景表征。第四,构造 GST-Bench-Local 的三档受控变体(Global/Local-Video/Local-Image),把“局部感知”与“跨帧全局整合”两类失败解耦,这是以往视频空间基准完全缺失的诊断维度。

核心方法

GST-Bench 的整体思路是:先从直觉上确认“全局空间推理=跨帧记忆+新视角推理+全局表征对齐”,再据此把能力拆成三大核心并实例化为 12 个子任务,最后用仿真流水线批量生成可自动标注的问答对并辅以人工核验。三大核心能力为自我定位(Where am I?)、目标定位(Where is the target?)、场景结构理解(What does the scene look like?)。自我定位含全局朝向、全局位置 2 个子任务;目标定位含自我中心方向/距离的语义与视觉两种模态、加上俯视图全局位置,共 6 个子任务,且全部强制目标物在当前视角不可见;场景结构理解含三档难度的俯视图选择与轨迹选择共 4 个子任务。所有任务共享 5 类视觉输入:探索视频、物体标注视频、短轨迹视频、三档俯视图与当前查询视角。整体分数为 12 个子任务得分的算术平均 $\text{Score}=\frac{1}{12}\sum_{i=1}^{12}s_i$。

核心创新点在于“用构造性约束把局部空间任务升级为全局空间任务”。与现有基准的本质区别有四:其一,目标物不可见 + 查询视点离轨迹的硬约束,从根上排除了单帧捷径,这是 VSI-Bench/MMSI-Video-Bench 等未做到的;其二,答案完全由仿真几何直接算出——自我中心方向/距离来自相机-物体位姿,点坐标来自俯视投影,选择题标签来自场景/轨迹身份——因此可大规模、无歧义地生成精确真值;其三,把方向推理从二分类(前后左右)提升为以角度误差 $e_a=\min(|\hat{\alpha}-\alpha|,360°-|\hat{\alpha}-\alpha|)$ 评分的连续任务;其四,配套 GST-Bench-Local 的 Global/Local-Video/Local-Image 三档受控设置,把“看得到但拼不起来”与“单图就看不清”两类瓶颈首次解耦,提供以往基准没有的诊断力。

方法步骤详情

完整流水线分八步。1) 场景准备:从 BEHAVIOR-1K、HyperSim、ArtVIP 及内部场景中选评测集与训练集且场景互斥防泄漏,评测用 50 个室内场景。2) 探索视频生成:在可导航区域采样空间分散视点、连成遍历轨迹渲染自我中心 RGB 视频,并扰动起点/视点生成多条轨迹保证全覆盖。3) 物体标注视频生成:用仿真实例/语义分割定位可见物体,对目标实例在其出现帧叠加红色边界框,支持视觉模态目标指定。4) 短轨迹视频生成:独立采集轨迹并切成短片段用于轨迹选择。5) 俯视图生成:渲染 easy(照片级鸟瞰)、medium(占用图)、hard(仅墙体户型图)三档。6) 当前视角生成:离轨迹采样视点与独立朝向,仅当与探索视频有足够视觉重叠时保留,目标定位任务再要求目标物在此视角不可见。7) QA 生成与自动过滤:套模板生成问答对,答案从几何直接计算;自动剔除投影无效、可见性歧义、查询重叠不足、选项退化或违反目标不可见约束的样本。8) 人工核验:标注员从“目标能否在视频中被识别”“离轨迹当前视角能否被定位”两方面逐条核验,不通过即丢弃,最终得 2,762 题。

技术新颖性

技术新颖性可归纳为四点。第一,全自动 + 人工核验的混合数据生产:仿真保证答案精确可算、可无限扩展,人工核验则保证了题目的可答性与挑战性,最终 2,762 题全部经过两维度人工校验,质量显著高于纯自动基准。第二,首次把“目标不可见 + 离轨迹查询视角”作为不可绕过的硬约束写入任务定义,使每个题目都强制依赖跨帧全局推理,这是相对 VSI-Bench/OST-Bench 的关键升级。第三,用连续几何指标(MRA、角度/点距阈值准确率)替代粗粒度类别,提供远超以往的评测粒度,能区分“方向偏差 10°”与“偏差 170°”。第四,GST-Bench-Local 的三档受控变体是一个独立的方法论贡献——它把同一道空间题在“需跨帧”“冗余视频”“单图”三档下重测,从而把模型失败归因到感知阶段还是整合阶段,这种因果诊断能力是以往基准完全不具备的。

Representative GST-Bench samples from each of the twelve task types.
Figure 2: Representative GST-Bench samples from each of the twelve task types.
Overview of the automatic data generation pipeline.
Figure 3: Overview of the automatic data generation pipeline.

实验结果

表1 评测 22 个 SOTA VLM,四点结论。①巨鸿沟:人类均分 79.08,最强零样本 Gemini-3-Pro 仅 42.68,差 36.4 分;朝向(Ori 21.52 vs 85.00)与俯视全局位置(GPv 42.23 vs 93.00)最悬殊。②开源模型挣扎:最强 Qwen3-VL-32B(30.43)、InternVL3.5-38B(30.71) 优势几乎全来自 easy/medium 俯视选择,多个模型低于随机基线 20.01。③私有模型小幅领先:Gemini-3-Pro(42.68)、Gemini-2.5-Pro(40.95)、GPT-5(40.85) 第一梯队,12 子任务最优全被私有把持,不足人类 55%。④具身微调模型继承盲点:RoboBrain2.5-8B(24.61) 低于通用 Qwen3-VL-8B(25.89)。表2解耦揭示:私有 EDs Local-Image 较 Global 暴涨(Gemini-3-Pro 22.11→61.20),属“局部看得见、全局拼不起”;开源两阶段都失败,甚至负增长(InternVL3.5-8B −8.03)。

Performance of various models on GST-Bench across three core competencies.
Table 1: Performance of various models on GST-Bench across three core competencies.
Performance comparison under disentangled local settings.
Table 2: Performance comparison under disentangled local settings.
Illustration of the three controlled settings used to disentangle global reasoning from local perception.
Figure 4: Illustration of the three controlled settings used to disentangle global reasoning from local perception.
查看结构化数据
任务指标本文基线提升
GST-Bench 总分(12 子任务平均) 算术平均分 微调 Qwen3-VL-8B: 53.52 Gemini-3-Pro(最强零样本) 42.68; 人类 79.08; 随机 20.01 定向训练把 25.89 提升到 53.52(+27.63),超越全部零样本私有模型,但仍距人类 25.56 分
自我中心方向(语义)解耦 角度阈值准确率 mAcc 微调后 EDs 显著提升 Gemini-3-Pro Global 22.11 → Local-Image 61.20 Local-Image 较 Global +39.09 分,证明私有模型瓶颈在跨帧整合而非单图感知
开源模型局部 vs 全局解耦(EDs) 角度阈值准确率 mAcc InternVL3.5-2B Global 18.11 → Local-Image 25.40 同模型 Local 设置仅 +7.29,远低于 Gemini-2.5-Pro 的 66.49 开源模型局部绝对分仍极低,揭示其在感知与整合两阶段都失败,局部感知是更紧迫瓶颈

局限与改进

作者承认的局限与可观察到的局限如下。其一,全部数据来自仿真(OmniGibson/BEHAVIOR-1K/HyperSim/ArtVIP)室内场景,缺乏真实世界视频与户外场景,模型在仿真上的表现能否迁移到真实机器人部署未被验证。其二,能力维度局限于室内三维空间的自定位、目标定位与场景结构,未涉及动态场景、多智能体交互、物理因果推理等更广义的空间智能。其三,人类基线仅基于每任务 20 个样本,样本量偏小,79.08 的均分与子项(如 EDistv 41.50)方差可能较大,作为参照的稳健性有限。其四,自我中心距离任务上人类自身 MRA 也只有约 41,说明绝对度量恢复对人也很难,该子项对“模型 vs 人”差距的诊断力较弱。其五,作者虽提供了 GST-Train 与微调结果,但仅在 Qwen3-VL-8B 上验证,未覆盖其他架构,训练数据与评测数据是否真正场景级互斥(仅声明场景不重叠)仍可能存在布局/物体分布泄漏。其六,评测采用贪婪解码单一设置,未报告采样多样性与 prompt 鲁棒性对分数的影响。

独立分析的弱点

独立分析有五个弱点及改进方向。第一,纯仿真域导致 sim-to-real gap:场景光照、纹理、噪声分布与真实世界差异大,建议加入真实室内扫描视频(如 Ego44D、HM3D 实采)做跨域评测,或用 NeRF/Gaussian-Splatting 重建真实场景再生成 QA。第二,12 个子任务全为静态场景的空间推理,缺乏时序动态(如目标移动、自身连续运动状态估计),改进方向是把 GST-Bench 扩展为动态版本,引入运动预测、碰撞预警等子任务。第三,方向/距离的精确数值评测依赖固定模板问答,模型自由作答的鲁棒性未测,建议增加开放式作答 + 程序评判(如 LLM-as-judge 解析数值)以评估真实部署友好度。第四,人类基线仅 20 样本/任务,统计意义弱,建议扩到 100+ 并报告置信区间,尤其 EDistv 等低分项需重新校准。第五,微调实验只验证了 Qwen3-VL-8B,未做架构无关性验证(如 InternVL、Gemini 是否也能从 GST-Train 受益),改进方向是在多家族模型上做迁移实验并分析 GST-Train 的数据效率。

未来方向

作者提出的隐含方向是把 GST-Bench 与 GST-Train 作为社区资源推动全局空间推理研究,并希望缩小模型-人类鸿沟。基于此可延伸五条研究线。①动态与交互扩展:把基准从静态场景升级为可交互、目标可移动的时序版本,考察在线空间记忆更新。②更大规模与跨模态训练数据:GST-Train 当前来自四类仿真资产,可进一步纳入真实扫描、合成到真实域适应数据,并研究数据混合比例对 GST-Bench 增益的影响。③架构级探索:既然私有模型“局部看得见、全局拼不起”,可探索显式的时序记忆模块(如可读写场景地图 token、神经辐射场记忆)或测试时多视角采样来强制跨帧整合。④具身后训练范式反思:RoboBrain/Robix 继承盲点的负面结果提示,当前具身微调偏重局部 affordance,未来应设计面向长时序空间记忆的后训练目标与奖励。⑤安全与可解释:把全局空间表征作为可解释性载体,要求模型在给出方位/距离答案时同步输出其构建的俯视地图,用于事后审计具身决策的空间合理性。

复现评估

复现评估分四方面。①数据与代码可获得性:论文提供项目主页 https://qwerirwq.github.io/GST-Bench/ 并声明 GST-Bench 与 GST-Train 作为资源发布;BEHAVIOR-1K、HyperSim、ArtVIP、OmniGibson 均为公开资产,但 GST-Train 是否完全开源、微调权重是否发布正文未明确。②任务与指标定义清晰:12 子任务输入输出、四类指标公式(MRA、角度阈值 $C_a$、点距阈值 $C_p$、选择题准确率)、总体分 $\frac{1}{12}\sum s_i$ 均给出,全用贪婪解码与官方 prompt,协议可复现。③人工核验标准透明:两维度核验规则写明,但标注一致性(IAA)未报告。④算力与工程:评测需调用多家私有 API(Gemini、GPT)与 2B–38B 开源权重,长视频(单题可达数百分钟累计)的帧/token 处理工程量不小;微调 Qwen3-VL-8B 规模适中但需多卡。总体看中等团队可复现主表,完全复现 53.52 分依赖 GST-Train 完整开放与一定算力。