将基础模型脚手架化为物理世界智能体:推进长时程导航前沿 Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation
用意图-观察-记忆三通道协议把VLM与导航基础模型耦合成持久具身智能体,刷新三大EQA基准
前置知识
视觉语言模型(VLM)
以图像和文本为输入的多模态大模型,能理解视觉内容并执行推理、规划与问答。本文用 Qwen3.6-Plus 或 Qwen3.5-397B-A17B 作为上层智能体,负责决定寻找什么证据、去哪里搜索、何时停止,以及何时基于已积累的证据给出最终答案。
NavMCP 的上层推理核心就是 VLM,理解其能力边界(擅长推理但不擅长连续低层控制)是理解本文动机与分工设计的前提。
导航基础模型(NFM)
在大规模导航数据上预训练的通用导航策略,接收自我中心 RGB 观测、位姿与自然语言目标,输出短时程航点轨迹,可零样本迁移到物体导航(ObjectNav)、视觉语言导航(VLN)、目标跟随等任务,代表工作包括 SAME、Uni-NaVid、NavFoM、Qwen-RobotNav。本文以 Qwen-RobotNav 作为底层执行器。
NFM 是本文的执行层。论文核心主张是 NFM 强于闭环执行但弱于长时程任务推理,这直接决定了 VLM+NFM 分工协作的框架设计。
具身问答(EQA)
智能体需要在物理或仿真环境中主动探索、收集视觉证据后回答情境化问题(如“床边的灯开着吗?”)。证据常在远处或初始视野之外,智能体必须形成搜索假设、跨区域积累正面与负面证据,并判断何时证据已足以作答。主要基准有 HM-EQA、MT-HM3D、EXPRESS-Bench。
EQA 是本文的实验载体,天然考验长时程推理与执行的结合,是验证 NavMCP 价值最苛刻的测试床。
智能体脚手架(Agentic Scaffolding)
在不重训模型参数的前提下,用外部协议、工具接口与状态管理来组织模型行为的工程框架,典型如 ReAct 的推理-行动循环与工具调用机制。脚手架决定多个模型之间如何传递意图与信息,把单次模型调用升级为持久的智能体行为。
NavMCP 本质上就是一个脚手架框架:不训练任何模型,只靠三通道协议组织 VLM 与 NFM 协作,这是理解其“免训练”特性的关键。
情景式接口鸿沟(Episodic Interface Gap)
把导航器当普通工具调用时产生的三重失配:路线级指令无法表达证据意图;只返回终点状态导致途中观察全部丢失;独立调用之间不积累已搜索区域与负面证据。本文用消融量化其代价:换成情景接口后 HM-EQA 准确率从 74.0% 跌至 59.1%,损失 14.9 个百分点。
这是论文的核心概念与主要贡献点,意图、观察、记忆三个通道分别对应修复这三重失配。
证据账本与上下文状态
NavMCP 的记忆表示 $C_t = (H_t, E_t, U_t)$:$H_t$ 是压缩后的交互历史,$E_t$ 是带源关键帧引用的证据账本(正面观察、已搜索区域、不确定发现、负面证据、候选决策支撑),$U_t$ 是未解决目标。原始工具返回只有在外化进账本之后才允许被压缩。
这是记忆通道的具体实现,消融显示去掉它损失 4.6 个百分点,是跨调用积累能力不随上下文压缩而腐化的物质基础。
研究动机
长时程物理世界任务需要两种今天的基础模型各自只具备一半的能力。视觉语言模型(VLM)擅长推断缺失信息、分解目标、调整高层计划,但把推理反复落地为导航动作既脆弱又低效——在先前的直接控制协议下一次 VLM 决策最多让智能体位移 3 米,探索一个多房间场景需要数百次调用。导航基础模型(NFM,如 SAME、Uni-NaVid、NavFoM、Qwen-RobotNav)能稳健地执行语义目标,但一次只处理一个有界目标:不决定下一步找什么,也不跨回合保留任务状态。更关键的是,若把 NFM 当作普通工具调用,会产生作者所称的“情景式接口鸿沟”:其一,路线级指令无法承载智能体的证据需求、搜索模式、预算与约束;其二,工具只返回终点状态和最终观测,途中经过的物体、瞥见的房间等有用证据全部丢失;其三,各次调用相互独立,已搜索区域、被排除的假设、不确定发现与负面结果都不留存。在具身问答(EQA)这类需要远距离、初始不可见证据的任务中——例如要在 267 个 HM3D 场景中找到“小黑沙发”并排除五个错误房间——这些缺陷被急剧放大。
本文的目标是本文目标是把互补的两个基础模型组织成一个持久的物理世界智能体,而不是分别去造更强的推理器或导航器。具体而言:VLM 智能体决定寻找什么证据、去哪里搜索、何时停止;NFM 执行器把每个语义子目标落地为闭环导航。整个框架必须在不重训任何一方模型的前提下工作,且导航器应可替换——只要支持相同的调用模式与返回格式即可换用其他执行器。在结果层面,作者要求在 HM-EQA、MT-HM3D、EXPRESS-Bench 三个具身问答基准上超越最强已报告结果,并在真实机器人(Unitree Go2)上验证随任务时程增长的优势是否保持。最终达成:HM-EQA 匹配条件下领先 FAST-EQA 10.5 个百分点(74.0% 对 63.5%),真实场景总体成功率达 78.3%,且对最强基线的领先随任务时程从 10 点扩大到 45 点。
与已有工作不同的是,已有工作要么改进探索机制(Explore-EQA、FAST-EQA 的目标导向探索)、记忆机制(Memory-EQA)、场景表示(Graph-EQA 的场景图)或工具增强推理(ToolEQA),要么训练更强的导航策略。本文的独特切入是把问题重新定义为接口设计问题:不是让某个模型更强,而是用证据为中心的三通道协议(意图、观察、记忆)修补“情景式接口鸿沟”,使孤立的导航回合变成可复用的具身经验。与 ToolEQA 等工具调用方法相比,本质区别在于 NavMCP 不把每次调用简化为终端结果,而是保留源锚定的途中证据与负面证据;与端到端训练方法相比,它完全免训练,并把“上层智能体能力”与“底层导航能力”解耦成两个可独立替换、可独立度量的组件——Table 3 的两组受控扫描与 Table 4 的协议消融正是为这种可分解评估而设计,从而首次直接测量出情景接口本身的代价是 14.9 个百分点。
核心方法
直觉上,NavMCP 把 VLM 变成“会指挥的侦探”、NFM 变成“会跑腿的执行者”:侦探决定去哪个房间找什么线索、何时收队结案,跑腿者把每条指令变成具体路径并沿途汇报。技术上,系统在回合 $t$ 维护上下文状态 $C_t = (H_t, E_t, U_t)$,即压缩交互历史、证据账本与未解决目标三元组。VLM 智能体读取 $C_t$ 后要么给出答案 $y_t$,要么发出证据需求 $u_t$;$u_t$ 经意图通道转成结构化导航调用(模式、自然语言子目标、步数预算、约束),由 Qwen-RobotNav 执行一次完整 rollout 并返回含关键帧的轨迹记录;观察通道用 VLM 总结器把轨迹转成源锚定的“旅程证据”;记忆通道把信息写入账本与未解决目标后才允许压缩原始返回。三个通道分别封闭情景接口鸿沟的一个侧面,把孤立回合变成跨回合可积累的具身交互,全程免训练。效率核算上,外层调用数 $H$ 按每超出 3 米加收一次折算当量步 $n_{eq} = H + \sum_{k=1}^{K} \max(0, L_k/3\,\text{m} - 1)$,再以场景步数预算 $N$ 归一化为 $\hat{n}_{eq}$。
核心创新是证据为中心的三通道设计,与把导航器当黑盒工具的传统接口有本质区别。意图通道的关键抽象是“子目标表达意图而非控制”:智能体可以要求“搜索厨房台面找咖啡机”,但不发模拟器动作、不管低层路径,且提供 navigate_to_object(对应物体导航)与 navigate_by_instruction(对应视觉语言导航)两种模式,分别支持物体中心搜索与语言引导移动。观察通道拒绝“只回终点”:沿轨迹采样关键帧而非仅在终点采样,因为答案证据可能出现在执行器停止之前;VLM 总结器产出覆盖子目标状态、路线语境、观测物体、规划线索与不确定性的旅程证据,并区分服务当前决策的房间/物体证据与服务未来搜索的空间线索/未探索出口。记忆通道把每次返回外化进 $E_t$(正面观察、已搜区域、不确定发现、负面证据、候选决策支撑)与 $U_t$ 后才执行保守压缩,使后续推理依赖源锚定账本而非易失的原始轨迹;每个物体或房间提及都绑定源关键帧与置信度标签,总结器被明确要求只报告视觉可见证据、显式标注不确定性、不得把单视角缺失断言为确定性否定。
方法步骤详情
第一步,证据需求生成:VLM 智能体读取 $C_t=(H_t,E_t,U_t)$ 与当前问题,决定给出答案或发出证据需求 $u_t$。第二步,意图通道编码:把 $u_t$ 转为语义导航调用,含模式(navigate_to_object / navigate_by_instruction)、自然语言子目标、步数预算与可选约束;执行器仅见自我中心 RGB、位姿与在线地图,无特权信息。第三步,NFM 执行:Qwen-RobotNav 将子目标、当前观测与导航状态映射为短时程航点轨迹,返回含 rollout 状态、路径、终点位姿与采样关键帧的轨迹记录。第四步,观察通道总结:VLM 总结器产出旅程证据,区分服务答案推理的房间/物体证据与服务未来搜索的空间线索,全部绑定源关键帧。第五步,记忆通道更新:在原始返回被压缩前,把新证据写入 $E_t$、证据缺口写入 $U_t$。第六步,辅助验证:按需调用全景检查、开放词汇检测、近距离物体检查(zoom_in_object)、已存关键帧复查等感知工具精化账本条目。第七步,答案承诺:只有回答被当前观测、旅程证据、已复查关键帧或笔记条目支撑时才允许作答,正面回答须引用所见内容及所在位置,负面回答须有覆盖目标可能位置的已搜区域记录支撑。
技术新颖性
第一,问题重构:把长时程具身智能从模型能力问题转为接口协议问题,并首次量化情景接口本身的代价——固定 Qwen3.5-397B-A17B 智能体与 Qwen-RobotNav-8B 执行器时,换成情景接口使准确率从 74.0% 降至 59.1%(-14.9 点),这是对“脚手架价值”的直接测量。第二,证据保真机制:源锚定(每个提及绑定关键帧)、明确的负面证据语义(单视角缺失不等于否定)、保守压缩(外化后才压缩)三者组合,在免训练前提下保证长程信息不腐化,区别于此前只做终端返回或简单历史截断的工具调用系统。第三,可替换性与可分解评估:执行器只要支持相同意图模式与返回格式即可替换(实验中换用 Random Walk、Frontier、StreamVLN、Qwen-RobotNav-4B/8B),上层智能体亦可独立升级,从而把端到端提升分解为两层各自的贡献。第四,跨范式统一的效率核算:当量步公式 $n_{eq} = H + \sum_{k=1}^{K} \max(0, L_k/3\,\text{m} - 1)$ 只对调用 NFM 的方法加收距离补偿,使直接控制与 NFM 调用两类方法在归一化步数 $\hat{n}_{eq}$ 上可比。
实验结果
跨基准对比(Table 1):NavMCP 在 HM-EQA 达 76.7±0.1%(FAST-EQA 为 69.2%,+7.5 点),MT-HM3D 达 54.4±1.5%(对 50.5%,+3.9 点),EXPRESS-Bench 达 LLM Score 79.27±0.44 / Epath 33.96±0.75(对 68.7 / 29.25,分别 +10.57 / +4.71),且归一化当量步 0.15 与 0.19 为报告方法中最低,三个格式全部刷新 SOTA。匹配全系统对比(Table 2):统一 Qwen3.5-397B-A17B 智能体、回合、初始状态与预算后,NavMCP+Qwen-RobotNav-8B 达 74.0±0.3%,领先 Explore-EQA(57.6%)16.4 点、ToolEQA(60.8%)13.2 点、FAST-EQA(63.5%)10.5 点,证明优势不来自评测条件差异。架构消融(Table 3):固定 Qwen-RobotNav-8B 时,无智能体 38.2% → 单轮 58.4% → 反应式 62.0% → 完整 Qwen3.5 74.0% → Qwen3.6-Plus 76.7%;固定上层时 Random Walk 60.9% → Frontier 65.3% → StreamVLN 69.3% → RobotNav-4B 73.3% → 8B 74.0%,两层互补、任一侧增强皆有收益。协议消融(Table 4):情景接口 -14.9、仅终点返回 -5.9、去 EQA 上下文状态 -4.6、去旅程分析 -4.4、稀疏关键帧 -2.8、单导航模式 -2.0。真机实验(Table 5):Unitree Go2 总体成功率 78.3%,对 Frontier(48.3%)与反应式(38.3%)的领先随任务时程从单房间 +10 点扩大到 20 米以上的 +45 点。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| HM-EQA 具身问答(500 道选择题、267 个 HM3D 场景) | 回答准确率 Acc. (%) | 76.7±0.1 | FAST-EQA 69.2(跨论文);匹配复现条件 63.5 | +7.5(跨论文)/ +10.5(匹配复现) |
| MT-HM3D 多目标具身问答 | 准确率 Acc. (%) | 54.4±1.5 | FAST-EQA 50.5 | +3.9 |
| EXPRESS-Bench 自由格式具身问答(2,044 题) | LLM Score(0-100 语义正确性) | 79.27±0.44 | FAST-EQA 68.7 | +10.57 |
| EXPRESS-Bench 探索路径质量 | Epath(按参考充分路径长度与实际路程之比加权) | 33.96±0.75 | FAST-EQA 29.25 | +4.71 |
| Unitree Go2 真实机器人多房间搜索(6 类任务、每档 20 回合) | 总体成功率 (%) | 78.3 | NavMCP+Frontier 48.3 / 反应式+Qwen-RobotNav 38.3 | +30.0 / +40.0 |
局限与改进
作者承认两点:其一,框架依赖大型 VLM(Qwen3.6-Plus / Qwen3.5-397B-A17B),尽管归一化当量步最低,外层智能体的 API 延迟仍主导墙钟时间,需要更小模型或蒸馏来降本;其二,跨视角重复观察会损害计数类问题。我的补充观察:第一,观察通道本身也是 VLM 总结器,源锚定只是提示词约束而非机制化校验,总结幻觉仍可能污染账本,论文未报告旅程证据自身的错误率;第二,Table 1 的跨论文对比被明确标注为“仅供语境参考”,因为当量步补偿项只对调用 NFM 的方法生效,与非 NFM 基线的原始步数核算口径不完全可比;第三,所有仿真结果都来自 HM3D 系室内家庭场景,开放街道或工业场景未验证;第四,性能对执行器强度仍然敏感(换 Random Walk 掉到 60.9%),在 NFM 能力薄弱的部署环境下脚手架收益会缩水;第五,证据账本与未解决目标随回合增长,数百回合量级任务下的记忆管理只在“上下文压缩”消融(-0.9 点)中间接触及,超长时程的可扩展性尚未检验。
独立分析的弱点
弱点一:延迟与成本。每回合涉及外层 VLM 决策、NFM rollout、轨迹总结 VLM 三类调用,作者承认 API 延迟主导墙钟时间;改进方向是训练小型蒸馏智能体(论文已建议),或让总结器改用轻量本地 VLM,并对高频总结模式做缓存。弱点二:计数与跨视角重复。同一物体在多个视角被重复记入账本会引发计数错误;可引入实例级重识别与拓扑地图去重,把“房间-物体-视角”层级结构写入 $E_t$。弱点三:总结器约束是软性的。源锚定靠提示词实现,缺乏“提及必须可从关键帧验证”的机制校验;可加开放词汇检测器对关键帧-物体对做交叉验证,或对低置信条目强制触发辅助感知工具复核。弱点四:意图模式只有两种。navigate_to_object 与 navigate_by_instruction 难以表达“沿墙搜索”“避开某区域”等空间约束型意图;可扩展约束 schema(区域多边形、禁区、优先级、预算再分配)。弱点五:真实评测规模小。每档仅 20 回合、共 6 类任务,统计功效有限,78.3% 对 48.3% 的差距虽大但置信区间宽;后续应在更多环境与任务类型上重复验证,并报告显著性。
未来方向
作者提出的方向:其一,超越 EQA,让智能体用 NFM 探索物理环境并为训练空间智能高效收集具身数据——智能体主导的探索可提供耦合高层推理与落地观测/导航轨迹的任务驱动数据;其二,用更小模型或蒸馏降低大 VLM 的推理成本。基于本文成果可延伸:把三通道协议推广到操作(manipulation)与移动操作任务,用“操作基础模型”替换 NFM 检验协议的任务无关性;多智能体版本——多个 NFM 并行执行不同意图调用,证据账本作为共享黑板;把 NavMCP 的成功轨迹回灌为 NFM 的训练数据,形成“脚手架生成数据 → 模型变强 → 脚手架更简”的飞轮;将证据账本升级为图结构记忆(结合 Graph-EQA 的场景图思路),支持空间查询与跨视角一致性检查;以及把意图-观察接口 schema 标准化为具身工具调用生态的导航子协议——论文取名 NavMCP 显然有向 Model Context Protocol 致意之意,制定开放协议是自然延伸。
复现评估
复现难度中等偏高。有利条件:三个仿真基准全部公开(HM-EQA 500 题/267 场景、MT-HM3D、EXPRESS-Bench 2,044 题),评测协议描述详细——三次独立运行取均值±标准差、当量步公式明确、回合/初始状态/预算/感知设置对齐,消融设计清晰可逐项复刻;实现细节与账本字段在附录 Section G 给出。不利条件:主结果依赖 Qwen3.6-Plus(闭源 API),消融用的 Qwen3.5-397B-A17B 也是超大参数模型,API 成本高;导航执行器 Qwen-RobotNav 的开源情况未在正文明确;论文自述“有限的 API 与代码可用性阻止了跨论文完全对齐”,暗示代码未必完整开源。真机部分需要 Unitree Go2 及传感与定位栈,普通实验室难以复现,但仿真部分基于 HM3D 平台即可覆盖主要结论。综合估计:有 HM3D 使用经验与稳定 API 预算的团队可在数周内复现核心表格,真机结果宜视为方向性证据而非精确基准。
论文图表
三联动机图。(a) 对比两种范式:VLM 直接逐步控制短航点动作在长时程任务中举步维艰,而与 NFM 耦合后 VLM 只发语义导航子目标、NFM 负责闭环执行;(b) 以一个 EQA 问题为例,展示 VLM 把“寻找证据”的决策转成语义导航调用,搜索相关房间、排除不可能区域、最终定位目标证据;(c) 标注本文 Table 1 中 NavMCP 与 FAST-EQA 及各基准专属基线(ToolEQA、Memory-EQA)的数值对比。
这是全文的动机图,一张图讲清“为什么要分工”以及本文结果所处位置,是读者理解整个框架叙事的第一入口。