← 返回 2026-07-24

展示而非讲述:以生成像素而非大模型文本评估空间认知 Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang 📅 2026-07-23 👍 35 2026-07-29 18:30
Benchmark 文生图模型 空间推理 空间认知评测 视觉语言模型 视觉问答 评测方法论

提出 ProVisE 与 SpatialGen-Bench,让文生图模型在像素空间作答并公平评测。

前置知识

答案接口错配 (Answer-interface mismatch)

指评测任务的期望答案形式与被测模型的原生输出形式不一致。现有空间推理基准通常要求模型以坐标(如边界框 $[x_1, y_1, x_2, y_2]$)、选项标签或文字描述作答,而文生图模型的原生输出是一张图像(可以标点、勾画区域、画轨迹)。把连续的视觉判断硬塞进坐标或文字,不仅对文本 VLM 不自然,更让文生图模型的输出无法被原评测器直接打分,从而无法在相同任务语义下与文本模型比较。

这是全文的出发点。理解了"接口错配",才能理解为什么需要 ProVisE:它只替换图像模型的回答接口(用受约束的视觉协议),却保留原任务的目标和打分规则,从而把两类模型拉到同一指标下比较。

文本输出 VLM 与文生图模型 (Text-output VLM vs Image-generation model)

文本输出 VLM(如 GPT-5.4、InternVL3.5-8B)接收图像后用文本/坐标作答,空间判断必须先"语言化"或"符号化"。文生图模型(如 GPT Image 2、FLUX.2、Seedream 4.5)直接在像素空间操作,可以通过修改、标记、合成视觉内容来表达空间判断——直接"画出来"一个深度场、勾出一个区域或画出一条轨迹。论文把同一模型支持两种接口时视为两个独立"系统",因为它们暴露的是不同的回答机制。

论文的核心对比就是这两类系统。所有主结果(31 个系统、20 文本+11 视觉)、互补性分析(图 6、表 3)都建立在这一区分上,看不懂二者区别就读不懂任何实验。

视觉协议 (Visual Protocol)

ProVisE 的基本单元,由"引导提示"(约束模型如何在像素空间表达答案)和"解析器"(把生成的图像转成结构化预测)配对组成,并规定期望答案格式、无效输出条件以及到原任务指标的映射。任务感知的协议池覆盖实例/点标记、方向网格、相对深度图、区域掩码、状态匹配、轨迹绘制、任务接地证据渲染等多种形式。因为协议在评测模型前就已冻结,生成的响应无需主观的事后判断即可被解释。

协议是 ProVisE 的最小工作单元,也是"指标兼容"得以实现的关键。理解协议=提示+解析器+映射,才能理解为什么文生图模型的输出能被打回原基准的指标空间。

指标兼容评测 (Metric-compatible evaluation)

指无论答案来自文本还是像素,最终都用原基准的同一套打分规则评测。文本 VLM 的原始响应直接归一化为所需答案格式;文生图模型的视觉响应在协议引导生成后,由解析器转回该格式。两种输出因此被同一指标评分。ProVisE 优先用确定性解析(图像处理、几何或固定相似度模型),Fallback 任务则用"只看生成图、不看原图和原题"的约束解析器,与无约束的事后 VLM 判官严格区分。

这是论文相较"用 VLM 当裁判"路线的本质差异。明白了指标兼容,才能理解表 5 解析器敏感性实验为什么重要——它证明换一种解析方式会同时改变分数和排名。

智能体协议构建 (Agentic protocol construction)

面对未配置的新基准,ProVisE 让一个 Agent 自动完成三步:(1) 识别基准记录、输入媒体、任务标签、答案格式和评测指标,归一化为任务级契约;(2) 审查每类任务样例后从三条路线中选一条——Reuse 复用已有兼容协议、Build 用注册的解析组件组装、Fallback 在确定性组件无法恢复答案形式时用受约束辅助解析器;(3) 在小样例集上做冒烟验证,检查能否成功生成、稳定解析并与原指标兼容,失败可修订一次。Agent 不生成可执行评测代码,且最终协议对所有目标模型共享不变。

这让 ProVisE 能跨基准泛化(表 4 的六个外部基准就靠它)。理解这条自动构建路径,才能理解为什么框架号称"基准无关",也才能理解 Fallback 的设计取舍。

Discrete Fréchet Distance 与 DFD-success@0.4

离散 Fréchet 距离衡量两条折线/轨迹之间的相似度,是把一条轨迹"牵狗绳式"地与另一条对齐时的最小最大点对距离。论文用它定义轨迹规划任务的指标:当生成轨迹与真值轨迹的 DFD 低于阈值 0.4 时判为成功(DFD-success@$0.4$)。空间接地用点在掩码内的精度,可供性用平均掩码精度,状态预测用带部分得分的端点分。

SpatialGen-Bench 各子任务指标各异,DFD 是其中轨迹规划的核心度量。看主结果时这些指标都做宏观平均(先任务内平均、再跨任务平均),不弄清指标含义就无法解读 GPT Image 2 的 54.49 与人类 87.79 的差距。

研究动机

现有空间推理基准几乎都为文本输出 VLM 设计,要求模型用坐标(如边界框 $[x_1, y_1, x_2, y_2]$)、选项标签或文字描述作答。这种范式对 VLM 可测,却把连续的视觉判断强行塞进文本或坐标输出,对空间任务极不自然——就像要求一个人不指出来、而是报出精确像素坐标。对文生图模型更糟糕:它们能用标记、勾画区域、画轨迹来表达空间判断,但这类原生视觉响应无法被期待文本/坐标答案的基准直接打分。一个自然的变通是用辅助 VLM 当裁判读图推断最终答案,但裁判分数依赖裁判模型自身的可靠性,可能反映的是裁判的不确定性而非生成答案本身,且难以与文本 VLM 原指标对齐,导致两类模型在共享任务语义下的受控比较不可靠。结果是:尽管生成式视觉模型已能产出可解码的深度、分割、法向等密集预测,它们的空间认知在"答案能被视觉表达"时仍基本未被系统研究。

本文的目标是作者的目标是让生成式空间认知变得可测,并提供一套可复用的评测套件。具体而言:构建 ProVisE(Protocolized Visual Evaluation)这一基准无关框架,让文生图模型在像素空间给出"协议约束的视觉答案",再解析成与原任务指标兼容的结构化预测;因为手写协议无法规模化,ProVisE 还要提供自动构建路径,把任意新基准归一化为任务契约并为每个任务构造并验证"生成—解析"协议。在此之上构建 SpatialGen-Bench 诊断基准,覆盖感知/理解/推理/交互四个能力层级共 14 个子任务、多种答案形式,从而在共享任务语义与指标下系统比较文本 VLM 与文生图模型,揭示各自互补的长短,而非宣布一个赢家。

与已有工作不同的是,已有评测线都留下未填的空白。文生图基准评估的是提示保真度、组合对齐或合成图像中的空间关系——它们评估的是"生成图是否满足文本提示",而非"模型能否就输入场景回答一个空间问题";空间推理基准则只面向文本输出模型、对符号/结构化预测打分。两者之间缺的,正是一种指标兼容地把文生图模型与文本 VLM 放到相同空间任务语义下比较的方法。本文的独特切入角度是:只替换图像模型的回答接口(用受约束视觉协议),却不动任务目标与打分规则,并以"只看生成图、不看原图原题"的隔离解析器严格区别于事后 VLM 判官,从而把连续视觉判断保留在像素空间同时拉回指标空间。

核心方法

整体思路可以用一句话概括:空间判断可以"直接画成一个可抓取的区域",所以只需把图像模型的回答接口换成受约束的视觉协议、保留原基准指标即可。ProVisE 流水线(图 2)对文本 VLM 走 2a 分支、由原评测器直接打分;对文生图模型走 2b 分支,一个路由好的协议引导其生成并解析成结构化答案,两者最终都由同一来源任务指标评分。协议是基本单元,由"引导提示+解析器+期望答案格式+无效输出规则+指标映射"组成,存在任务感知的协议池(实例/点标记、方向网格、相对深度图、区域掩码、状态匹配、轨迹绘制、接地证据渲染等)。路由阶段:若基准已有验证配置就直接用,否则由智能体构建器构造任务专属协议,且被所有评测模型共享,从而把"协议设计"与"模型比较"解耦。论文还在此之上构建了 SpatialGen-Bench(470 样本、14 子任务、四层级、多样答案形式),作为框架的诊断测试床。

核心创新是"协议约束的视觉答案 + 确定性解析回指标空间",且严格拒绝主观的事后 VLM 判官。与已有"用 VLM 当裁判"路线的本质区别在于信息隔离:Fallback 解析器只接收"生成响应 + 固定视觉证据契约 + 所需答案格式 + 候选项",不接收源图像也不接收原始问题,因此无法独立重解基准题目;而判官式方法把原图原题都交给裁判 VLM,分数会混入裁判自身的能力。这一点保证了解析只负责"读图取答"而非"替模型做题"。其次,协议在模型评测前就冻结、对所有视觉模型共享不变,杜绝了针对单个模型的协议优化。这种"换接口、保指标、隔离解析"的组合,是本文区别于文生图基准(只看提示保真)和空间 VLM 基准(只打分符号答案)的根本所在。

方法步骤详情

ProVisE 对未配置基准走三阶段自动构建。第一步,识别基准记录、输入媒体、任务标签、答案格式与评测指标,归一化为任务级契约,不改任务语义与打分规则。第二步,Agent 审查每类任务样例并从三条路线选一:Reuse 复用已有兼容协议、Build 用注册解析组件组装任务专属协议、Fallback 在确定性组件无法恢复答案形式时用受约束辅助解析器;每条路线都产出同一套声明式产物(生成提示、解析器配置、答案契约、无效输出规则、指标映射),且不生成可执行评测代码。第三步,在小样例集做冒烟验证,检查能否成功生成、稳定解析并与原指标兼容,失败可修订一次。通过后协议不变地应用于所有目标模型。执行阶段:图像模型在协议约束下产出标记实例/方向网格/掩码/接地点/渲染状态/轨迹等响应,优先用确定性解析转回结构化答案。最后进入指标兼容评测:每个响应转成原基准期望的答案空间并用原任务指标打分;文本 VLM 原始响应直接归一化到该格式。计数等用精确匹配准确率,空间接地用点在掩码内精度,可供性用平均掩码精度,状态预测用部分得分端点分,轨迹规划用 DFD-success@$0.4$。

技术新颖性

技术新颖性可归纳为四点。第一,基准无关性:ProVisE 把"协议约束生成+解析回指标"抽象成框架,可用在 FLUX、Seedream、Janus 等当代生成模型,也兼容 MindCube、SAT、VSR 等 VLM 空间基准,不把事后判官当默认评测器。第二,智能体自动构建:用 Agent 把任意新基准归一化、路由协议、做冒烟验证,使框架能扩展到手写协议之外,表 4 六个外部基准的迁移正靠它。第三,信息隔离的 Fallback:解析器只看生成图不看原图原题,从机制上防止"裁判替模型答题",这是与判官式方法最本质的工程差异。第四,SpatialGen-Bench 的诊断价值:14 子任务横跨感知/理解/推理/交互四层与离散选择、计数、点、掩码、候选状态、连续轨迹多种答案形式,首次同时支持层级能力诊断、多种答案形式、以及文本 VLM 与文生图模型在共享语义指标下的评测(表 1 对比中三项全打勾,此前基准最多两项)。

Overview of ProVisE.
Figure 2: Overview of ProVisE.
Agentic protocol construction in ProVisE.
Figure 3: Agentic protocol construction in ProVisE.
Representative protocol-execution cases for ProVisE.
Figure 4: Representative protocol-execution cases for ProVisE.
Overview of SpatialGen-Bench.
Figure 5: Overview of SpatialGen-Bench.

实验结果

论文评测 31 个系统(20 文本、11 视觉),得到"互补而非一边倒"的结论。表 2 显示人类 87.79 居首,文本最强 GPT-5.4 为 61.04、视觉最强 GPT Image 2 为 54.49,均远低于人类;最大能力差距在理解层(38.57 分),瓶颈是维持关系语义与跨视角表示变换而非单纯多步推理。图 6 揭示接口互补:视觉在答案能直接留在像素级状态时最强(Depth 模型组对比 $+18.85$、SenseNova 同族 $+50.00$,Relationship $+6.74$/$+5.71$),文本在需超越可见证据做约束组合、状态更新等变换时更强(推理层平均领先 17.63 分)。表 3 给出样本级互补:GPT Image 2 挽回 GPT-5.4 的 71 个错题(37.0%),SenseNova 视觉态挽回 78 题(30.6%)。表 4 证明智能体构建器可迁移到六个外部基准;表 5 证明换通用 VLM 解析器会同时改分数和排名(等级相关仅 0.60/0.31/0.60);图 7 显示 88.03% 失败是"有效但预测错误",说明瓶颈在空间推理而非视觉通道。

Comparison with representative spatial evaluation benchmarks.
Table 1: Comparison with representative spatial evaluation benchmarks.
Main results on SpatialGen-Bench (%).
Table 2: Main results on SpatialGen-Bench (%).
Paired sample-level outcomes on the shared benchmark items.
Table 3: Paired sample-level outcomes on the shared benchmark items.
Matched cross-benchmark evaluation after Agentic protocol construction (%).
Table 4: Matched cross-benchmark evaluation after Agentic protocol construction (%).
Universal VLM parser sensitivity.
Table 5: Universal VLM parser sensitivity.
Where does showing help?
Figure 6: Where does showing help?
Failure attribution by visual-answering model and task.
Figure 7: Failure attribution by visual-answering model and task.
查看结构化数据
任务指标本文基线提升
SpatialGen-Bench 总体(470 样本,14 子任务宏平均) Overall 宏平均分 (%) GPT Image 2(视觉最强)54.49;GPT-5.4(文本最强)61.04 人类 87.79;视觉第二 Nano Banana 2 为 48.63 视觉最强比文本最强低 6.55 分,但视觉态在 Depth/Relationship 等可直接外化任务上反超;两者距人类仍有 26–33 分差距
接口互补性(同题配对) 视觉补救率 = 视觉独解/(视觉独解+两者皆错) GPT Image 2 对 GPT-5.4 补救 71/192=37.0%;SenseNova 视觉对文本补救 78/255=30.6% GPT-5.4/GPT Image 2:双对 182、仅文本 96、仅视觉 71、皆错 121 视觉回答可独立挽救约三成文本回答的诊断性失败,证明二者非子集关系而是能力互补
跨基准迁移(六个外部空间基准各 50 条任务平衡子集) 任务平衡子集宏平均分 (%) GPT Image 2 平均 56.33(SAT 74.00、RoboAfford 64.00 列内第一) GPT-5.4 平均 60.67、Qwen3-VL-8B 58.33、InternVL3.5-8B 52.00 文本模型在四个基准列领先、GPT Image 2 在 SAT 与 RoboAfford 领先;主要贡献是端到端协议迁移成功而非刷榜
通用 VLM 解析器敏感性 与 ProVisE 声明解析器的 Spearman 等级相关 / 平均绝对分数变化 Qwen3-VL-8B 相关 0.60、Qwen2.5-VL-72B 为 0.31、Llama 4 Scout 为 0.60;分数变化 5.87/5.63/5.26 分 ProVisE 自身解析器作基线,六图像模型排名由此改变(如 JoyAI-Image 被 Qwen2.5-VL-72B 排第一) 证明换解析器会同时改变分数与排名、并非均匀校准偏移,凸显任务专属确定性解析的价值
视觉回答失败归因 失败类别占比 (%) 预测有效但错误 88.03%、协议不合规 8.46%、解析失败 3.45%、生成失败 0.06% Size/Feasibility 多数失败发生在恢复有效预测之前(54.64%/55.22%);Depth 无解析失败 证明视觉通道基本可靠、瓶颈是空间推理本身,为"按任务/阶段选择表示"提供实证依据

局限与改进

作者自承四点局限。其一,智能体协议构建依赖其规划与验证后端(论文用最强的 GPT-5.4 与 GPT Image 2 为所有生成器构造同一共享协议),这可能偏向 GPT Image 2 能执行的视觉表示,从而不利于训练方式不同的较弱生成器——即协议构建的强后端既是质量保证也是公平性隐患。其二,基于 VLM 的 Fallback 路线在部分外部任务上频繁出现,暴露出可复用配方/算子/验证测试的库覆盖不全,并引入依赖服务商的变异性。其三,文本与视觉两个回答池在架构、规模、训练数据上差异很大,因此它们的对比刻画的是当前系统而非隔离出的"模态因果效应"——主结论是"互补强弱"而非"模态因果"。其四,ProVisE 目前只面向有可恢复标注与指标、且为静态图像的基准,扩展到视频、仿真与闭环具身任务仍是未来工作。

独立分析的弱点

从独立视角看,论文有几处可强化的弱点。第一,基准体量偏小:SpatialGen-Bench 仅 470 样本(感知 145、理解 140、推理 90、交互 95),任务级(如 Perspective、Mental Modeling)样本更少,宏平均与互补性比例的置信区间可能较宽,作者虽在附录给出 bootstrap 不确定度但主表未直接呈现。改进方向是分层扩充样本并把不确定度写进主表。第二,单一共享协议可能系统性偏向"强后端能执行"的视觉表示,弱生成器即使有更好的潜在表示也无从发挥;可让协议构建对每个被测生成器做轻量适配(如调整提示风格)再做归一化比较,并报告"协议适配增益"。第三,Fallback 仍依赖 VLM,引入服务商变异性,建议把 Fallback 的占比、所用模型与不确定性显式纳入主结果,并开发更多确定性算子。第四,互补性分析(表 3)目前是描述性的,两接口模型池不同,难以做因果模态断言;可在同架构同规模模型上做配对,把"模态效应"与"模型规模效应"解耦。

未来方向

作者明确指出两个方向:扩展可复用的配方、算子与验证测试以降低 Fallback 依赖;把 ProVisE 推广到视频、仿真与闭环具身任务。基于成果可延伸的方向包括:把"按任务/推理阶段选择表示"落到一套可调度系统——让文本或隐状态处理约束与规划、视觉生成外化几何与接地状态、确定性算子做验证,并让"展示"与"讲述"交换中间状态互相交叉校验;把样本级互补性(GPT Image 2 挽救 37.0%、SenseNova 30.6%)升级为可控的接口路由或集成学习策略;针对 Perspective/Relationship 等 30–50 分差距任务,构造更细粒度的子能力诊断;以及用同架构同规模模型做受控配对,从"描述性互补"走向"模态因果"。

复现评估

复现性总体较好但仍需注意。作者公开了项目主页、GitHub 代码库与 HuggingFace 数据集(SpatialGen-Bench),并承诺 ProVisE 为开源框架,附录给出了归一化字段、路线定义、验证准则、任务级结果、输入例外与运行设置,便于他人复现协议池与构建流程。算力方面,评测了 31 个系统,主力模型多为商用 API(GPT-5.4、GPT Image 2、Nano Banana 2、Seedream 4.5 等),复现主要瓶颈在 API 访问与费用而非本地训练。难度在于:协议构建依赖 GPT-5.4/GPT Image 2 等闭源后端,他人难以完全复现智能体构建过程;表 4 各列为任务平衡的 50 条 pilot,并非全基准榜单估计;表 5 解析器敏感性依赖固定保存的生成产物,若被测模型版本更新则数值需重测。综合看,框架与数据可复现,但端到端数值复现受商用模型版本与费用制约。