360CityArena:面向具身智能体的照片级真实虚拟城市导航基准 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents
602段360°视频重建秋叶原,175个人工任务暴露LMM城市导航远逊人类
前置知识
具身智能体(Embodied Agent)
指通过感知-行动闭环完成任务的AI系统:智能体接收摄像头视角等观测,维护记忆,输出离散动作(移动、转动视角、作答),环境状态随之改变并产生新观测。本文将其形式化为部分可观测序贯决策过程 $(S, A, \Omega, T)$,其中转移函数 $T: S \times A \to S$ 为确定性映射。
360CityArena的评测正是围绕感知-决策-行动闭环设计,理解这一定义才能明白为何导航任务要求输出终点坐标、并以状态转移的视角分析智能体行为。
视觉语言导航(VLN)
要求智能体理解自然语言多步指令(如'直行,看到Sukiya左转,继续直行,停在Burger King前'),并结合视觉观察逐步导航到目标。相比只给目标坐标的point-goal导航或给参考图的image-goal导航,VLN额外要求消解语言歧义和地标指代,是更高阶的空间推理任务。
VLN是本文路径推理类的核心子任务,也是人机差距最悬殊的场景之一(人类88%,最佳模型仅12%),是解读实验结论的关键。
大型多模态模型(LMM)
能同时处理文本与图像等多模态输入并生成文本的大规模模型,如GPT-5、Gemini 2.5 Flash、Claude Sonnet 4.5,以及开源的Qwen2.5-VL-32B和InternVL3.5-8B/38B。它们是当前具身智能体最常用的'大脑',负责从视觉观察中提取信息、规划路径并决定动作。
本文全部基线智能体由LMM驱动,基准的核心价值就是量化这些模型在真实城市空间理解与导航上的短板。
姿态图(Pose Graph)
把环境表示为图结构:节点是可驻留的拍摄位姿(位置加朝向),边是节点间的可行移动。本文的秋叶原环境由193个节点、305条边组成单一连通图,平均分支度3.16。智能体沿边在预录的360°视频流之间平滑移动,只能在图上探索,而非在任意3D空间自由行动。
姿态图定义了动作空间的边界和'连续导航'的确切含义,也解释了边界过渡动作占11.3%等实现细节与局限。
平均相对精度(MRA)
数值估计任务的柔性评分指标。对计数预测 $\hat{y}$ 与真值 $y$,在阈值集合 $\mathcal{C}=\{0.5, 0.55, \ldots, 0.95\}$ 上计算 $MRA=\frac{1}{10}\sum_{\theta \in \mathcal{C}} \mathbb{1}\left(\frac{|\hat{y}-y|}{y} < 1-\theta\right)$,误差越小得分越高,避免了二元判分丢失误差幅度信息。
物体计数任务用MRA判分,理解该指标才能正确解读结果表中该列的数值含义(人类45.2%、Gemini 2.5 Flash 24.0%、GPT-5仅2.4%)。
研究动机
现有户外导航评测环境与真实城市差距巨大,可分为三类问题。其一,传统3D模拟器(EmbodiedCity、MetaUrban、CARLA)虽支持交互,但照片级真实感与结构复杂度不足,难以还原真实街道的密集招牌、狭窄人行道和复杂建筑布局。其二,基于Google Street View的环境(如StreetLearn)影像逼真,却缺乏行人和车辆等动态元素,且全景图之间只能离散跳转,无法支撑连续的自车中心导航。其三,视频转仿真方法(Vid2Sim)虽能生成高保真环境,但依赖短片片段,不适合探索延展的真实街道网络。此外,航拍视角导航(CityNav)和纯地图路线规划评测与地面视角的城市探索互补却彼此割裂。这导致具身智能体在城市尺度真实环境下的感知、导航与空间推理能力长期缺乏严格检验,现有最优模型与真实需求之间的差距从未被量化。
本文的目标是本文的目标是构建一个照片级逼真、含真实动态元素、支持连续自车中心导航的街区级具身智能基准。具体而言,作者基于360°视频在Unity中重建了东京秋叶原街区(南北约750米、东西约650米,覆盖85条互联街道),并在其上人工设计了175个任务,系统划分为三大类七个子类:环境理解(定位、语言地标搜索、图像地标搜索)、路径推理(地图导航、视觉语言导航)与空间推理(关系空间推理、物体计数),每个子类25题。基准还按距离、指令歧义度、地标可见性和所需探索量为每个任务标注Easy/Medium/Hard三档难度,配合四种评测协议(精确匹配exact_match、模糊匹配fuzzy_match、坐标匹配coordinate_match与平均相对精度MRA),力求对智能体的感知、规划与推理能力做全面、可复现的诊断式评估。
与已有工作不同的是,本文的独特切入是选择'真实拍摄视频加可导航姿态图'这条被忽视的技术路线。与3D模拟器牺牲真实感换取交互性、与GSV基准用离散全景牺牲连续性换取覆盖面不同,作者利用先行工作Realistic Virtual World(RVW)把602段360°视频投影到球面并组织成姿态图:在拍摄轨迹内导航连续平滑且保留真实的行人车流动态,轨迹边界的跳转仅占全部动作的11.3%,人工检查未发现由此导致的明显失败。同时,不同于以往只评单一任务的工作,360CityArena在完全相同的环境配置下并置语言与图像两种地标搜索,实现输入模态的受控对比;还系统消融显式位置先验(地图)的作用,发现移除后部分任务反而提升,这是现有城市导航基准均未覆盖的诊断维度,直接指向地图-视觉对齐这一被低估的能力瓶颈。
核心方法
360CityArena的思路是先有环境、再有任务、最后定协议。环境层面,基于RVW把覆盖秋叶原的602段360°视频投影到球面,在Unity 6000.0.30f1中组织成含193个节点、305条边、平均分支度3.16的单一连通姿态图;智能体沿预录轨迹移动,动作空间为7个离散动作(前进、上/下倾斜视角、左/右旋转视角、视角复位、输出答案),在岔路口会额外解锁与可通行方向对应的移动动作;每条街双向各拍摄一次,保留方向相关的视觉差异;地理上以秋叶原站为中心,南北约750米、东西约650米,覆盖85条街。任务层面,8名标注者(均亲自去过秋叶原)在Unity中直接交互并逐一验证可解性,共耗时约60小时完成175个任务。评测层面配置四类协议,例如坐标匹配要求终点与目标的欧氏距离不超过阈值 $\varepsilon$(一般10米,地图导航因地图标记尺寸噪声放宽到20米)。
核心创新是用'姿态图化的360°视频流'作为城市环境载体,在真实感、动态性、连续性与规模之间取得此前无法兼得的平衡。论文Table 1的对比很直观:3D模拟器照片真实感与结构复杂度低但可交互;GSV基准(StreetLearn)真实感和覆盖好,但动态性低且只能离散跳转;Vid2Sim高保真却只有短片、无法街区级探索;360CityArena则同时做到高照片真实感、高结构复杂度、高动态性,并支持沿轨迹的连续街区级探索。第二个关键设计是诊断性任务体系:三大类七子类各25题,其中语言与图像地标搜索除输入模态外配置完全相同,构成天然对照组;难度标注依据随难度单调递增的统计量背书,如地图导航路径长度124/247/347米、决策点数3.3/6.4/9.0,物体计数真值3.5/4.6/9.0,VLN指令步数4.4/5.9/7.4。
方法步骤详情
构建与评测流程分四步。第一步,环境准备:以RVW为底座,将602段360°视频组织成193节点/305边的姿态图,在Unity中实现渲染与交互接口,观测为当前视角视觉输入加可选的带位置标记的地图图像。第二步,任务设计:8名标注者两两负责一个子类,并有一名作者全程参与所有子类以保证一致性;定位任务在5×5网格上从视觉观察推断初始格点,地标搜索需导航至指定地标('animate'等文字或参考图像)并输出坐标,地图导航按蓝起点到红终点规划路线,VLN需逐步执行如'直行、见Sukiya左转、停在Burger King前'的指令,关系空间推理回答诸如'Kitchen Jiro右边第三家店'的相对位置问题,物体计数输出指定区域内目标数量。第三步,难度分级:按距离、指令歧义、地标可见性与探索需求标为Easy/Medium/Hard。第四步,评测协议:定位用exact_match;关系推理用GPT-5做fuzzy_match(与人类多数票一致率97.9%,$\kappa=0.937$,接近标注者间$\kappa=0.984$,且裁判与智能体完全隔离);导航类用coordinate_match($\varepsilon=10$m,地图导航20m);计数用 $MRA=\frac{1}{10}\sum_{\theta\in\mathcal{C}}\mathbb{1}\left(\frac{|\hat{y}-y|}{y}<1-\theta\right)$,$\mathcal{C}=\{0.5,\ldots,0.95\}$。
技术新颖性
从技术新颖性看,本文的贡献不在提出新算法,而在定义了一个更接近真实世界条件的评测面,并配套了此前缺失的诊断工具。首先,环境载体新颖:以Movie Map范式为参照,论证了'GPS/SLAM定位360°帧、识别路口、拼接片段'的城市无关建图流程可以规模化复制到其他城市,使基准具备可扩展性。其次,评测协议工程化程度高:GPT-5裁判与智能体完全隔离、只比较最终输出与标准答案以杜绝信息泄漏,其与人类一致率达97.9%($\kappa=0.937$);阈值敏感性检验显示在0.75倍至1.5倍阈值范围内模型排名稳定(Kendall's $\tau \geq 0.89$),即使放宽到 $\varepsilon=30$m 人机差距仍超36个百分点,地图导航在 $\varepsilon=15$–25m 内变化不超过±2个百分点,说明结论对协议参数不敏感。最后,消融设计新颖:通过移除显式自定位信息,发现性能并非一致下降、某些任务反而上升,揭示了地图-视觉对齐能力这一此前少有基准触及的瓶颈。
实验结果
核心发现是人类与最强LMM之间存在巨大鸿沟:5名去过秋叶原的本地被试总成绩77.3%,远高于最佳的Gemini 2.5 Flash(17.1%)。分任务看(Table 2),人类在地图导航92%、图像地标搜索92%、关系空间推理92%、VLN 88%,而所有模型在地图导航上得分0%–4%,GPT-5和Gemini均为0;语言地标搜索人类64%对Gemini 28%;物体计数人类45.2%对Gemini 24%(GPT-5仅2.4%)。图像版地标搜索普遍优于语言版(GPT-5:48.0对16.0;Claude:16.0对4.0;Qwen:20.0对16.0),但InternVL无此增益(8B:20.0对20.0;38B:0.0对16.0)。成绩随难度下降:GPT-5环境理解28.0→25.0→18.5,路径推理11.1→0.0→0.0。移除位置先验后GPT-5语言地标搜索从16.0升至24.0、关系推理从32.0升至48.0,说明静态地图可能干扰推理。失败归因(用Gemini 3 Flash分析并经人工核验)显示GPT-5探索失败占55%、动作失败仅12%,而Gemini 2.5 Flash与InternVL3.5-38B动作失败约40%;空间推理任务中所有模型感知失败激增(Gemini达38%),Gemini还在各类别持续出现15%–21%的定位对齐错误。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 基准总体(七任务平均) | 平均成功率(%) | 人类本地专家基线 77.3% | 最佳LMM Gemini 2.5 Flash 17.1%(GPT-5、Claude Sonnet 4.5、Qwen2.5-VL-32B、InternVL3.5-8B/38B均更低) | 人类领先60.2个百分点,城市尺度具身导航远未解决 |
| 定位(Localization,5×5网格) | exact_match 成功率(%) | 人类 68.0% | Gemini 2.5 Flash 12.0%(GPT-5 8.0%,InternVL3.5-38B 0.0%) | 人类领先56个百分点,依赖城镇布局与本地地标的细粒度自定位极难 |
| 地标搜索(语言) | coordinate_match 成功率(ε=10m) | 人类 64.0% | Gemini 2.5 Flash 28.0% | 人类领先36个百分点,抽象文字描述提供的导航线索有限 |
| 地标搜索(图像) | coordinate_match 成功率(ε=10m) | 人类 92.0% | GPT-5 48.0%(Gemini 2.5 Flash 36.0%) | 人类领先44个百分点;图像相对语言带来最多32个百分点的模态增益 |
| 地图导航(Map Navigation) | coordinate_match 成功率(ε=20m) | 人类 92.0% | 全部六模型 0%–4% | 人类领先至少88个百分点,是差距最悬殊的任务 |
| 视觉语言导航(VLN) | coordinate_match 成功率(ε=10m) | 人类 88.0% | InternVL3.5-8B/38B 12.0%(最佳),GPT-5与Gemini 8.0% | 人类领先76个百分点,多步语言指令的执行是普遍短板 |
| 物体计数(Object Count) | MRA(平均相对精度) | 人类 45.2% | Gemini 2.5 Flash 24.0%(GPT-5仅2.4%) | 人类领先21.2个百分点,连人类也仅有约半数把握,任务本身困难 |
| 关系空间推理(Relational Spatial Reasoning) | fuzzy_match 成功率(GPT-5裁判,人工复核) | 人类 92.0% | GPT-5 32.0%(Gemini 12.0%) | 人类领先60个百分点;移除位置先验后GPT-5反而升至48.0% |
局限与改进
作者坦承两大局限:一是环境由预录360°视频构成,智能体只能沿拍摄轨迹移动,不能自由到达任意3D位置、无法与物体物理交互,轨迹边界处存在不连续(占11.3%的动作,但人工检查未发现由此导致的明显失败);二是仅覆盖秋叶原一个街区,无法回答跨区域泛化问题。我补充几点观察:人类基线是5名'去过或常去秋叶原'的本地专家,77.3%应视为域内上界而非通用人类水平,作者自己也如此声明;每子类仅25题、共175题,规模偏小,模型间几个百分点的差异可能缺乏统计显著性;坐标匹配只看终点欧氏距离,无法刻画中途探索质量;路径推理类全体模型接近0分,也可能部分源于动作接口或提示设计对模型不够友好,而不纯粹是空间推理能力不足,需要更长行动预算或分层控制实验来剥离;此外fuzzy_match依赖GPT-5裁判,存在评估器偏置的潜在风险(虽有一致率97.9%和人工复核背书)。
独立分析的弱点
独立分析几点弱点。其一,交互缺失:预录视频决定智能体不能开门、推车或避让动态行人,'具身'程度有限,改进方向是引入可控的合成动态层,或与3D高斯泼溅等可渲染表示混合,在保留真实感的同时开放交互。其二,单一城市:秋叶原视觉风格独特(大量招牌与动漫元素),模型可能依赖这些域特征取得部分成绩,建议按论文给出的Movie Map式流程扩展到多城市多街区检验泛化。其三,长程探索机制薄弱:GPT-5探索类失败占55%、所有模型地图导航近乎0分,暗示缺乏子目标分解与拓扑记忆,可考虑引入显式地图记忆或分层RL控制器。其四,样本量与主观性:每子类25题且难度标注含主观判断(作者承认边界情形存在主观性),宜扩充规模并报告置信区间。其五,评测粒度:统一的10米阈值对不同任务并不等价,可按任务自适应标定;失败归因目前依赖另一个大模型(Gemini 3 Flash)加人工核验,流程较重,难以频繁复跑。
未来方向
作者提出的方向包括:扩展环境以支持更自由的探索与更丰富的物理交互;跨城市、跨区域的泛化评测;以及独立评测并学习地图-视觉对齐能力。基于本文成果可自然延伸的方向:一是把姿态图环境转为训练数据源(作者明确指出可作为照片级虚拟世界中训练数据构建的实用指南),用强化学习或模仿学习训练城市导航策略;二是引入多智能体与行人交互,研究社会性导航;三是把Action/Grounding/Perception/Explore/Planning五类失败归因自动化为持续诊断流水线,用于训练过程中的回归测试;四是研究位置先验的最优注入方式,例如从静态全局地图转向增量式信念地图;五是把评测扩展到更细粒度的空间认知(透视、遮挡、几何估计),并与室内具身基准衔接,形成从家庭、街道到城市的连续评测谱系。
复现评估
复现评估:项目主页为 https://360mm-team.github.io/360CityArena/,论文承诺以Movie Map范式提供可复制的建图流程。算力方面,闭源模型走API(GPT-5、Claude Sonnet 4.5、Gemini 2.5 Flash),开源模型(Qwen2.5-VL-32B-Instruct、InternVL3.5-8B/38B)推理需要8张NVIDIA A100 80GB;环境运行于Unity 6000.0.30f1(macOS)。任务构建成本方面,175个任务由8人耗时约60小时完成,且要求标注者熟悉目标街区,这对其他团队复制同等规模基准是不小的人力门槛;环境本身依赖先行工作RVW与602段360°视频采集,完整重建秋叶原环境难度高,更现实的做法是用其发布的环境跑评测,或按论文流程自建其他城市的环境。fuzzy_match依赖GPT-5裁判,API版本更迭会引入轻微不确定性,好在有97.9%人工一致率与人工复核兜底。总体判断:用官方环境复现实验表难度中等,从零重建基准难度高。
论文图表
展示基准的整体形态:由360°视频轨迹重建的秋叶原街景(如面向Animate店铺的AI助手场景示意),强调照片级真实感与互联街道网络,任务涵盖环境理解、路径推理与空间推理。
开篇即给出基准的直观印象,让读者直观理解'照片级真实虚拟城市'到底长什么样,以及智能体在其中的交互方式。