UrbanGround:真实尺度城市中从局部感知到空间能动性 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
把真实香港搬进物理仿真沙盒,测出多模态智能体“认得出却走不到”的城市行动能力断层。
前置知识
多模态大语言模型(MLLM)智能体
多模态大语言模型是在文本基础上接入视觉等模态的大模型,能把截图、照片等图像输入与文本指令联合编码后生成文本或结构化输出。作为智能体使用时,它以“观察—推理—动作”循环工作:每回合读入当前画面与对话历史,输出一个结构化动作(本文中是 JSON 格式的移动、转向或地图操作指令),而不是一次性给出最终答案。
本文的评估对象正是 GPT-5.5、Claude-Opus-5、Gemini-3.6-Flash 等十种 MLLM 智能体,全部实验接口、动作空间与提示协议都围绕 MLLM 的输入输出方式设计,不理解这一点就无法理解任务的设定方式。
闭环具身交互(closed-loop embodied interaction)
指智能体的每个动作都会改变环境状态、进而改变下一次观察的交互方式:动作产生新的第一人称视角,新视角又决定下一步决策,形成观察 $o_t$ 到动作 $a_t$ 再到新状态 $s_{t+1}$ 的循环。与之相对的是静态单轮问答——模型只看一张图就作答,动作后果无从体现。
论文的核心论点是“单帧识别强不代表持续行动可靠”:只有在闭环中,小错误才会逐步累积并放大。这一概念是理解 RQ1 到 RQ3 递进设计以及长程导航崩溃现象的前提。
空间接地与空间能动性(spatial grounding / spatial agency)
空间接地指从当前观察中建立与任务相关的局部空间关系(周围有什么、在哪个方向);空间能动性是本文提出的更强能力,要求这些关系在视角变化后仍然可用(持久性 persistence),并能在环境改变时被修正(适应性 adaptation)。论文将其形式化为接地、持久性、适应性三种逐级累积的能力。
这是全文的主线概念:五级任务阶梯就是按这三种能力逐步加压设计的,最终结论也按“识别强于定向、局部移动强于完成路线、合规移动强于计划更新”的层级组织,不懂这组定义就读不懂实验逻辑。
地理配准与 Cesium 3D Tiles
地理配准指把三维模型坐标绑定到真实地理坐标系(本文为 WGS84),使虚拟位置与真实世界位置一一对应、轨迹可事后对账。Cesium 3D Tiles 是流式加载超大规模三维瓦片场景的开放格式,香港地政总署正是以该格式通过开放 API 发布倾斜航拍重建的全域城市纹理网格。
理解 UrbanGround 的数据来源与“真实尺度”的确切含义(全境覆盖、坐标可追溯、与政府测绘数据对齐)需要这一背景,这也是它区别于生成式城市模拟器(如 UrbanWorld)的根本所在。
行人网络依从率(PNA)等过程级指标
PNA(pedestrian-network adherence)定义为动作时间中、动作后状态落在注册行人网络上的时间占比。类似的过程指标还有 SPR(封路后尊重封路且有朝目标进度的 episode 比例)与 PCR(与行人发生碰撞的 episode 比例)。它们刻画“怎么走”,与只看“是否到达”的终点指标互补。
论文最重要的发现之一就是答案正确与行为合规脱节:模型能答对问题却横穿马路,封路后 PNA 仍高达 93% 以上但 SPR 极低。不理解这些过程指标,就看不懂 Table 1 和 Table 4 传递的关键信息。
ReAct 协议
一种智能体提示范式,要求模型每回合依次显式输出观察(observation)、推理(reason)与动作(action)三部分,把思考过程写进上下文以支撑多步决策。本文用 JSON 严格规定输出格式,每回合只允许提交一个动作,且模型无法获得任何隐藏状态(坐标、剩余距离、路线计算 API)。
附录 B 公开的全部实验提示都基于该协议,且“无特权信息”设定直接决定了任务难度与失败模式——模型必须靠自己的上下文记忆维持空间状态,这正是被测能力的核心。
研究动机
现有 MLLM 在单帧街景理解上表现出色,但作者指出城市中的行动能力取决于另一个问题:当智能体开始移动后,局部证据是否仍然有用。拐过街角后,支撑上一个决策的地标就从视野中消失,智能体必须把先前证据与新观察整合,维持可用的位姿估计。然而现有评测环境都无法检验这一点。游戏沙盒(Minedojo、BALROG、MineExplorer 等)能展示长时程决策如何展开,但空间结构由游戏机制自身定义,任务内的进步不能说明智能体把观察锚定到了一个在游戏之外仍然有效的空间框架上。室内具身基准(OpenEQA、NavBench、CapNav 等)把行为锚定在场景几何中,但空间范围有限,局部观察不需要关联更大的空间框架。城市尺度的研究用街景全景与航拍影像(VELMA、CitySeeker、CityNavAgent、UrbanNav 等)保留了真实地理语境,但智能体只是在采样的视点之间跳跃,与同一座城市没有连续的物理接触,视点变化不是由连续移动产生的。交互式城市模拟器(UrbanWorld、MetaUrban、Virtual Community、SimWorld 等)虽恢复了动作-观察闭环,但其场景是为仿真生成或拼装的,不保留真实大都会的地理配准复杂结构。于是,“当前 MLLM 能否在真实尺度的物理城市中把局部感知转化为可靠行动”这一关键问题始终无法被检验。
本文的目标是论文的目标是构建并利用 UrbanGround——首个以全域真实地理数据构建、物理受约束的真实尺度城市沙盒,把香港复杂的地理结构变成 MLLM 智能体可进入的交互世界。香港是理想的试验场:密集开发坐落在陡峭地形上,行人网络在街面与高架通道之间反复切换,对空间能力要求极高。具体目标分三层。第一,建成环境本体:把香港地政总署的 3D Visualisation Map(倾斜航拍重建的纹理网格)与 3D Pedestrian Network(行人连接线要素)流式载入 Unity,提供物理碰撞、第一人称交互、可平移缩放的交互式地图、连续时钟与天气控制、动画行人种群与动态封路,所有轨迹以地理坐标记录、可在受控条件下重放。第二,把“空间能动性”操作化为可测量对象:分解为接地(grounding)、持久性(persistence)、适应性(adaptation)三种累积能力,通过三个研究问题(RQ1 局部接地、RQ2 导航扩展、RQ3 动态适应)与五级任务阶梯在固定接口下系统测量。第三,量化诊断:对 GPT-5.5/5.4/5.2、Claude-Opus-5/4.6、Gemini-3.6-Flash/3.1-Pro、Doubao-Seed-2.0-Pro、GLM-5V-Turbo、Kimi-K3 共十个模型,在 810 个人工验证实例上回答“局部能力能否组合成持续的目标导向行为”。
与已有工作不同的是,本文的独特切入角度有三点。其一,数据真实性与物理闭环的统一:不同于街景/航拍评测的采样视点跳切,也不同于生成式模拟器的人造场景,UrbanGround 直接把真实香港的全域倾斜摄影网格作为渲染表面兼碰撞几何,每个动作都在同一地理坐标系下产生下一个观察,行为成败可以与真实城市坐标对账——这是第一次有环境同时满足“真实尺度、地理配准、物理约束、闭环交互”四个条件。其二,把问题的“生长过程”显式化:作者不在一个固定难度上比较模型,而是构建五级评估阶梯(局部理解→显式指令导航→隐式指令探索→多任务规划→动态环境交互),接口完全不变,只单调增加“必须跨动作保持可用的空间状态量”,从而把“技能组合失败”与“输入格式适应失败”在因果上分离开。其三,评估维度的创新:引入 PNA、SPR、PCR 等过程级指标,配合起终点距离分箱分析、oracle 检查点回溯重打分与失败类型分类,把“答对问题”“走到终点”“合规且安全地走”三个层面分开测量,暴露出纯成功率指标看不到的失败模式——例如模型答对问题却横穿马路、封路后继续做局部合规移动却不修正路线。
核心方法
直觉上,作者把整个香港“搬进”游戏引擎,让模型像行人一样在真实街区以第一人称走动、看地图找路。技术上分三层实现闭环。地理空间层:把地政总署 3D Visualisation Map 瓦片(Cesium 3D Tiles、WGS84)载入 Unity 并统一坐标系,按视距流式更新,瓦片几何兼作渲染与碰撞体;行人网络导入为连通图,仅用于轨迹对账,不限制智能体沿图边移动。仿真层:第一人称角色以连续运动对抗碰撞几何;时钟控制天光与阴影,入夜后人造光源启动;雨雾改变可见度并产生“暴露”信号;虚拟行人沿网络行走并记录碰撞。智能体层:模型与仿真器以 client-server 通信,每回合只收第一人称 RGB 图像、任务文本与交互历史,输出一个结构化 JSON 动作。闭环形式化为 $o_t = O(s_t)$,$m_t = U(m_{t-1}, o_t, a_{t-1}, g)$,$a_t = \pi(m_t, g)$,$s_{t+1} = T(s_t, a_t, \xi_t)$;隐藏状态 $s_t$ 含位姿、接口状态与城市条件,模型不可读取;$\xi_t$ 为执行中因封路或行人运动发生的外部变化。
核心创新首先是环境本体:与游戏环境不同,这里的空间结构来自真实城市网格,行为可以与地理坐标对账;与街景/航拍城市评测不同,视点变化由连续物理移动产生而非视点跳切;与生成式城市模拟器不同,场景保留真实大都会的复杂结构(陡坡、天桥、立体步行网络),局部几何与全局地图天然耦合。四个条件——真实尺度、地理配准、物理约束、闭环交互——首次同时满足,使“局部能力能否组合成空间能动性”第一次成为可检验问题。第二个关键思想是把空间能动性分解为接地、持久性、适应性三种累积能力,并组织成五级阶梯(L1 局部理解→L2 显式指令导航→L3 隐式指令探索→L4 多任务规划→L5 动态环境交互),所有层级共用同一动作空间与观察接口,只增加“必须跨动作保持可用的空间状态”,这使能力退化可以归因于组合失败而非接口变化。第三个关键思想是过程级评估:除答案准确率与 15 米到达判据外,定义 PNA(动作时间中落在注册行人网络的比例)、SPR(封路后尊重封路的有进度比例)、PCR(行人碰撞率),配合距离分箱成功率、不改动作只重打分的 oracle 检查点回溯、以及四类失败模式划分,把“知、行、规”三层面的脱节量化出来。这种诊断能力是以往只报告最终成功率的城市导航评测所不具备的,也是本文方法学上最有复用价值的部分。
方法步骤详情
构建:①获取地政总署开放数据:全境 3D Visualisation Map(倾斜航拍纹理网格,Cesium 3D Tiles、WGS84)与 3D Pedestrian Network 连接线要素。②Unity 载入瓦片并统一坐标系,随移动流式更新,几何兼作渲染与碰撞体;③行人网络导入为连通图。④实现时间(时钟可固定或推进)、天气(雨雾可见度变化与雨滴“暴露”信号)与行人系统(沿网络行走并记录碰撞)。⑤定义动作空间 $A = A_{fp} \cup A_{map} \cup \{\text{terminate}\}$:$A_{fp}$ 为 move/sprint(方向加 0.05–2 秒时长)、look、jump、open map,$A_{map}$ 为 select/pan/zoom/orbit/close map。⑥人工构建并二次验证 810 个实例(L1 220、L2 240、L3/L4 各 120、L5 110),标注者以相同 100 步上限验证可解。⑦按 ReAct 协议运行十模型,每回合一个 JSON 动作,episode 止于提交答案、声明完成或 100 步,运动预算约 200 秒;⑧问答按答案一致率计分,导航要求 15 米内到达且满足约束,另记录 PNA、SPR、PCR。
技术新颖性
技术新颖性体现在四个层面。数据层面:首次把政府级全域真实 3D 数据(倾斜摄影纹理网格加行人网络)变成可交互、可碰撞、可重放的 MLLM 评测世界;轨迹以地理坐标记录,使离网移动、路线效率、重复探索等行为可以事后与真实城市对账,城市不再是背景板而是带坐标的“考卷”。评估设计层面:五级阶梯在固定接口下单调增加“必须保持的空间状态”,这种控制变量式设计让“局部能力无法组合”的结论具有因果解释力;地理层、仿真层、智能体层的三层解耦保证不同模型面对完全相同的地理世界与具身接口,比较公平。指标层面:PNA/SPR/PCR 加上距离分箱(把 ShortNav 与 InstructionNav 按起终点直线距离四等分)、oracle 检查点回溯(不改变任何动作、只在最优中间状态重打分)与四类失败模式划分(过早停止、从未实质进展、进展后丢失、进展保持但超时),构成一套可迁移到其他具身基准的过程诊断方法学。发现层面:论文用该环境首次系统量化了三重脱节——识别局部证据的能力强于定向能力,执行局部运动的能力强于完成整条路线的能力,保持合规移动的能力强于在变化后更新计划的能力;例如长程导航中超过半数 episode 在接近目标(GPT-5.5 为 57.5%)却几乎无人到达(最好 3.8%),封路后 PNA 高达 93% 以上而 SPR 仅 10–46.7%。这类细粒度、可归因的结论在以往只能给出单一成功率的城市评测中是不可见的。
实验结果
RQ1:视觉识别全员强势(最高 Gemini-3.6-Flash 93.8%),主动探索仅中度下降(Claude-Opus-5 82.5%),方向理解却断崖下跌——最高 58.3%,多模型逼近 25% 随机线;Overall 以 Claude-Opus-5 79.1% 居首。PNA 揭示为抢答横穿马路:视觉识别任务中仅 63.8–70.0%。RQ2:短程导航部分模型达 75%,长程几乎全灭(最好 Kimi-K3 3.8%);指令导航最好 42%,约束导航最高 6.7%,时间窗与多站点 0–3.3%;成功率随起终点距离增大系统性下降(Figure 7)。GPT-5.5 有 57.5% 的长程 episode 比起点更近目标却 0% 到达,多站点仅完成 7.1–20.7% 目的地(Figure 8);oracle 回溯至最佳中途点仍无法到达(Table 7);失败类型:进展后丢失 31.25%、从未进展 27.5%、过早停止 22.5%、超时 18.75%(Figure 11)。RQ3:黄昏与夜晚主要打击问答(Claude-Opus-5 79.1%→66.4%/69.6%)且黄昏差于夜晚;天气对导航影响不一致。封路 SR 几乎全 0,PNA 超 93% 而 SPR 仅 10–46.7%——模型继续局部合规移动而不修正路线;行人 PCR 达 76.3–90%。总体三重脱节:识别优于定向,局部移动优于完成路线,合规移动优于计划更新。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视觉识别(L1 问答,VR) | 答案准确率 | Gemini-3.6-Flash 93.8%(最佳),十模型区间 75.0–93.8% | 四选一随机猜测约 25% | 全员大幅超越随机基线,任务在显式证据下接近解决 |
| 方向理解(L1 问答,OU) | 答案准确率 | Claude-Opus-5 58.3%(最佳) | Gemini-3.1-Pro 23.3%、GPT-5.4 31.7%(接近 25% 随机线) | 最佳模型仅高出随机线约 33 个百分点,暴露共享原子弱点 |
| 短程目标导航(SGN) | 15 米内到达成功率 | GPT-5.5 与 Claude-Opus-4.6 均为 75.0% | GPT-5.4 15.0%、Gemini-3.6-Flash 23.8% | 问答上接近的模型在闭环交互中分化达 60 个百分点 |
| 长程目标导航(LGN) | 15 米内到达成功率 | Kimi-K3 3.8%(最佳),GPT-5.5 为 0% | 多数模型 0–1.3% | 相对短程 75% 崩溃式下跌,局部能力无法组合成持续导航 |
| 动态封路重规划(DCR) | 成功率 / 安全进度率 SPR | 成功率最高 3.3%;SPR 以 Claude-Opus-5 的 46.7% 最高 | 十个模型中八个成功率 0%,SPR 多在 10–20% | 封路后几乎无人完成重规划,行为依旧合规但不朝目标推进 |
| 行人环境中导航(NP) | 行人碰撞率 PCR(越低越好) | 最低 Doubao-Seed-2.0-Pro 76.3% | Gemini-3.6-Flash 90.0%(最高) | 全员高碰撞,说明高 PNA 不等于碰撞感知的运动控制 |
局限与改进
作者承认或隐含的局限:其一,评测对象是十个商业 API 模型、单一城市(香港),陡坡与天桥密集的地理结构是否放大了特定失败模式尚不清楚,结论向其他城市形态的迁移性未验证。其二,每 episode 上限 100 步、每步运动至多 2 秒,约 200 秒命令运动预算;作者以人类完成全部任务证明可行性,但长程最优路线可能接近预算上限,部分失败或是效率问题而非能力问题——Figure 11 中 18.75% 的“保持进展但超时”正暗示这一点。其三,问答任务为四选一选择题,存在猜测成分,方向理解接近随机线的结论可能受选项设计影响。其四,行人是沿注册网络行走的预制 Rocketbox 动画,缺乏真实人流的自组织与交互复杂性。其五,论文仅 Figure 8 报告 95% 置信区间,部分子任务每格约 20–40 个实例(如约束导航 30 例、方向理解 60 例),相邻名次间的差异未必统计显著。我的补充观察:其一,被测智能体完全依赖文本交互历史维持空间状态,未测试显式空间记忆、认知地图或自定位模块,“局部能力不能组合”更像是对朴素 ReAct 智能体的诊断,若提供路径草图、语义地标记忆等外部记忆工具,结论可能改观。其二,倾斜摄影网格的招牌文字清晰度与夜间人造光的渲染保真度会直接影响“读牌找店”类任务难度,仿真-真实视觉差距未被量化。其三,15 米到达阈值未做敏感性分析,对“到达某栋建筑”类任务偏松或偏紧不得而知。
独立分析的弱点
独立分析的弱点与改进方向:第一,方向理解是共享原子弱点(多数模型逼近随机线),根源可能是 MLLM 缺乏把自我中心视角变化累积为稳定航向估计的机制;改进是在上下文中显式注入每步航向增量摘要(如“已左转 90 度”的状态跟踪),或微调时加入航向保持任务。第二,长程误差累积且无修正:Figure 10 中 GPT-5.5 朝目标方向横穿马路、被中央障碍挡住后重复 forward 直至步数耗尽;改进是引入分层架构(全局路线规划器加局部执行器)、周期性自定位,以及把“卡死检测”(连续相似动作且无位移)作为强制重规划触发器。第三,封路适应失败:通知后模型继续局部合规移动(PNA 93% 以上而 SPR 低),说明通知未进入工作空间状态;改进是把环境事件做成显式“计划失效”信号,收到后强制先开地图重算路线。第四,行人碰撞率 76.3–90%:缺乏对移动障碍的检测-预测-避让回路;改进是外挂局部避障层(行人检测加速度预测加减速绕行),或作为安全过滤器串联在动作输出后。第五,PNA 与速度的冲突(视觉识别任务仅 63.8–70%):模型为省时间横穿马路;改进是把行人网络约束外化为环境硬约束或评分惩罚——Figure 9 证明模型有走天桥的能力,缺的是动机。第六,黄昏普遍差于夜晚:低角度光照与阴影造成视觉歧义;改进是多时段数据增广与低照度文字增强。
未来方向
作者提出的方向:希望 UrbanGround 支撑“当前 MLLM 智能体能否在复杂开放城市中可靠探索”的更广泛研究,特别是研究局部感知如何支撑持续的、物理扎根的行为。基于其成果可延伸的工作:其一,从诊断走向训练——把沙盒作为强化学习或模仿学习环境,针对误差累积、封路重规划、行人避让三类失败设计训练课程。其二,架构研究——在固定环境下对比显式空间记忆(认知地图、拓扑图构建、自定位模块)与纯上下文记忆的差距,检验“组合失败”能否通过记忆外化解决;Table 7 的 oracle 分析显示模型中途常已接近目标,说明“在正确位置重定位”这一单一机制可能带来显著收益。其三,跨城市泛化——用其他城市的开放 3D 数据(如新加坡、纽约的同类政府测绘数据)复制该管线,检验结论的地理普适性,并研究模型在陌生城市与训练数据中常见城市之间的表现差。其四,任务维度扩展——加入多智能体协同、车辆驾驶尺度、室内外过渡、语音多模态指令等更接近真实城市服务的形态。其五,把 PNA/SPR/PCR 等过程指标纳入模型对齐目标或排行榜,推动“合规且安全”成为导航评测的一等公民。其六,sim2real——沙盒的地理配准特性使轨迹可直接映射到真实香港坐标,可探索与真实机器人或 AR 导航的联动验证。
复现评估
复现条件较好。开源情况:项目主页 urbanground.github.io,代码仓库 github.com/UrbanGround/UrbanGround,沙盒提供 Web 版与 macOS、Windows、Linux 原生构建下载。底层数据来自香港地政总署的公开开放 API(3D Visualisation Map 与 3D Pedestrian Network),无需自行采集或重建。任务与协议透明度很高:810 个人工验证实例随环境发布;附录 A 给出全部任务定义与构建流程(含标注者以 100 步上限亲自验证、二次审核的规定);附录 B 原样公开所有系统提示、动作 schema 与 ReAct 输出格式,并明确说明模型不可调用 navigate、teleport、路线计算等接口;附录 C–E 给出十模型全量结果矩阵、oracle 检查点方法与失败类型定义。算力与成本:环境本体是 Unity 应用,消费级硬件即可运行(论文未列具体配置要求);主要成本是对十个商业模型的 API 调用费用,按 810 实例乘 100 步乘 10 模型估算调用量较大但可控。难度评估:复现单模型单任务是低门槛的,环境开箱即用、提示全公开;完整复现十模型全矩阵需要相当的 API 预算与运行时间,总体属中等偏易;若要自建新任务,则需遵循其人工验证流程(标注者亲自完成加二审),有一定标注成本。
论文图表
系统概览图:展示 UrbanGround 支持的四类视角(街面场景、第一人称自由导航、全局地图探索、密集城市俯瞰)与高架道路、航拍城景、街面天桥等真实画面,并标注移动/转向/跳跃、地图缩放、天气控制、时段控制、行人网络等交互能力,说明沙盒以 Web 与三大桌面平台原生构建发布。
一张图看懂整个系统的形态与能力边界:真实香港地理数据、第一人称与地图双接口、可编程的智能体控制、多平台发布,是读者理解论文贡献全貌的入口。
条形图给出各子任务实例数:L1 共 220(视觉识别 80、方向理解 60、主动探索 80),L2 共 240(短程 80、长程 80、指令 50、约束 30),L3 共 120(地点搜索与意图推理各 60),L4 共 120(时间窗与多站点各 60),L5 共 110(封路 30、行人 80)。
提供解读所有结果表必需的样本量背景——例如约束导航仅 30 例、方向理解 60 例,直接影响对结果差异显著性的判断。