SpatialCLI:先学会用空间工具推理,再脱离工具内化能力 SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
前置知识
视觉语言模型(VLM)
能同时处理图像和文本的多模态大模型,如Qwen-VL、GPT-5、Gemini。它擅长理解指令、拆解任务、组织多步推理,但对像素级定位、物体边界、度量深度、姿态等精细视觉细节常常不可靠。这正是本文要补的能力短板。
本文的核心矛盾就是VLM的任务级推理能力与精细感知能力不匹配,理解VLM的能力边界才能理解为什么要引入外部专业视觉工具。
专业视觉模型(Specialist Vision Models)
针对单一感知任务训练的专用模型:SAM 3做分割、Depth Anything 3(DA3)估计度量深度、Orient Anything V2与VGGT估计物体朝向和跨视角相机运动、Locate Anything与Grounding DINO做目标定位。它们各自感知精度高,但不懂任务、不会组合输出,也不能把结果转成任务级决策。
SpatialCLI的四个空间工具正是由这些专业模型支撑,理解每个专家处理什么、为何不能单独完成任务,是读懂工具组合必要性的关键。
ReAct智能体与工具调用
ReAct是一种交替进行'推理(Reason)'和'行动(Act)'的智能体范式:模型先内部思考,再选择输出最终答案或发起一次工具调用,工具返回结果后继续推理。SpatialCLI在此基础上引入了'剩余工具调用预算'提示,并在多轮间保留完整的推理内容以避免重复思考带来的token浪费。
Call阶段和Internalize阶段的工具交互轨迹都建立在这个交互循环之上,轨迹的表示τ=(z_t,a_t,o_t)是后续内化监督的数据来源。
GRPO强化学习与冷启动SFT
GRPO(Group Relative Policy Optimization)是组内相对优势的强化学习算法,对一组采样轨迹用组均值/标准差归一化奖励计算优势。本文还借鉴DAPO的非对称Clip-Higher(下界0.20、上界0.28)和token级策略梯度。冷启动SFT指在RL前先用教师模型(Qwen3.5-397B-A17B)采集的正确轨迹做监督微调,给RL一个能正确选工具、写合法参数的初始策略,避免在巨大混合动作空间里瞎探索。
Learn阶段的核心是'先SFT稳定策略再RL优化',理解这条管线才能看懂为什么RL w/o SFT会出现工具调用数从3.36暴涨到6.74、训练不稳定的现象。
能力内化(Capability Internalization)
指把外部工具提供的专业感知能力,通过监督数据'转移'进模型自身参数,使其在不调用工具时也能直接推理出类似结果。本文用'双视角训练'实现:内化视角(直接答+显式感知推理链)学无工具推理,工具视角(保留原交互结构)保住工具使用能力,二者联合优化L_CI=L_internal+λ·L_agentic(λ=0.5)。并用CII(能力内化指数)量化模型无工具时复现工具输出的接近程度。
这是论文最大的创新点和标题'Then Without Them'的含义,理解内化才能理解为什么SpatialCLI既能在有工具时91.3%又能在无工具时72.7%,而传统直接微调做不到。
研究动机
随着物理AI进入开放环境,任务成功越来越依赖按需组合多种空间感知能力,而非孤立提升某一项。例如'找出离我最远的泰迪熊'需要先用分割找出所有熊、再用深度比较距离、最后定位选中那只——这要协调分割、深度、定位三类专业能力。然而现有体系存在根本性能力错配:通用VLM(GPT-5.6 Sol、Gemini 3.1 Pro、Qwen3系列)能理解指令、拆解任务、组织多步推理,可一旦答案取决于精确定位、物体边界、度量深度或姿态就变得不可靠;专业视觉模型(SAM 3、DA3、VGGT)能给出可靠的局部感知证据,但每个只管一种操作,既不懂任务需要哪些能力、也不会组合多个专家的输出、更不能把输出转成任务级决策。最近的SpaceTools、AlloSpatial、S-Agent虽然把外部工具和空间先验组织进智能体流程并训练VLM,但留下一个关键开放问题:工具交互中积累的感知证据能否转化为监督,让VLM把专家感知能力内化、从而在不调用工具时也能推理?现有基准也大多孤立评测单一空间能力,无法评估模型能否协调多种互补能力解决复杂空间问题——GPT-5.6 Sol在作者新构造的组合基准上仅得48.8%。
本文的目标是本文要打造一个让VLM'先用空间工具推理、再脱离工具内化能力'的统一框架SpatialCLI,同时实现两个看似矛盾的目标:(1)在有工具时,让VLM能根据任务自主选择、调用、组合四类空间专家工具(定位/分割/深度/姿态)并利用返回证据完成任务;(2)经过训练后,让VLM在不调用任何工具时也能直接推理出原本需要专家才能给出的精细感知结果,从而逼近'原生物理世界的基础模型'。为了可靠评估这种组合感知推理,还要构造一个专门考察'多能力组合'的基准SpatialCLI-Bench,让模型不再是被分别考察单点能力,而是被考察能否像人一样按任务目标编排多种互补能力。整体目标是证明外部工具使用与内部化直接推理可以在同一个模型里共存、互相增益,而非此消彼长。
与已有工作不同的是,已有工作要么只用工具不内化(SpaceTools、AlloSpatial),要么只直接微调学空间能力(SpatialVLM、SpatialRGPT、RoboRefer、VLM3)而无法利用专家工具产生的高质量感知证据。本文的独特切入角度是'用模型自己成功的工具调用轨迹作为内化监督的来源'——把RL阶段产出的、被任务奖励验证过的正确轨迹,经过渐进式证据落地(Progressive Evidence-Grounded Verbalization)改写成有据可查的感知推理链,再用双视角训练同时学'无工具推理'和'有工具交互'。这一思路借鉴了'从视觉程序执行轨迹学习',但首次把它用在空间专家工具上,填补了'工具用得对→能力内化→脱离工具也能对'这条链路的空白。同时配套的SpatialCLI-Bench用私有可执行oracle工具计划(每例≤5步、平均3.81步)从机制上保证每个问题都需组合≥2类能力,是首个系统评估组合空间感知的基准。
核心方法
整体直觉是:与其让VLM在精细感知上死磕,不如先把专业视觉模型当作'外挂感知器官'接进来让它用,等它用熟了、留下了大量'感知证据+正确答案'的成功轨迹,再把这些轨迹改写成自然语言推理链当教材,教会它在不依赖工具时也能复现这套感知过程。技术路线分三阶段(Call–Learn–Internalize)。Call阶段把六个专业视觉模型封装成四个对智能体可见的工具接口(Locate/Segment/Depth/Pose),构建ReAct式推理-行动循环,每次工具返回后告知剩余调用预算(上限10次)。Learn阶段先用397B教师模型采集正确轨迹做冷启动SFT(约5000任务、过滤后留约40%≈2000条),再用GRPO+DAPO非对称裁剪做智能体RL(约1万任务)。Internalize阶段收集RL模型在约4.2万任务上成功的轨迹,先逐轮做证据落地e_t=Ψ_ext(I,q,e_<t,z_t,a_t,o_t)、再做全局verbalization c=Φ_verb(I,q,E_τ,y*)生成推理链,最后用双视角联合训练L_CI=L_internal+λL_agentic,λ=0.5。整个过程见Algorithm 1。
核心创新是'用模型自己的成功工具轨迹作为内化监督',这与已有方法有本质区别。传统思路要么(像SpaceTools/AlloSpatial)只学工具调用、把感知能力永远留在外部,要么(像SpatialVLM/RoboRefer)另起炉灶用人工空间问答监督直接教VLM——后者无法获得专家工具那种可靠度量证据。SpatialCLI的独特之处在于:(1)轨迹来源是被任务奖励验证过的正确交互,天然带有'哪些感知步骤对解题有用'的信号;(2)渐进式证据落地分两步——先逐轮把异构工具返回(坐标/多边形/深度/朝向)落地成可追溯的证据单元e_t、保留跨轮依赖又不重复处理长历史,再全局verbalization整合成简洁推理链c,且严格禁止引入E_τ中没有的实体/属性/数值,防止'答案条件化的证据伪造';(3)双视角训练保证内化与工具能力共存。这套设计回答了'感知证据能否转为可内化监督'这个被前置工作遗留的开放问题。
方法步骤详情
完整步骤见Algorithm 1。第一步Call:注册四个工具并定义Interact(π,x,U,B)循环——初始化历史H←(P_U,I,q),每轮采样回复r=(z,u);若u是终态答案则返回ξ=(I,q,τ,y),否则解析为工具调用a_{k+1}、执行o_{k+1}=U(a_{k+1})、把(z,a_k,o_k)追加到轨迹τ并把剩余预算(上限10)加回H,耗尽后强制无工具产出答案。第二步Cold-Start SFT:用Qwen3.5-397B-A17B教师跑约5000任务,丢格式非法/失败/错误样本留约40%≈2000条,对模型生成的推理、工具调用、答案token算NLL,得π_SFT。第三步Agentic RL:从π_SFT出发,对每任务用GRPO采G=8条交互,按最终答案给奖励R_i=V(y_i,y*)(多选题匹配得1/0,BOPASK用点集Chamfer分数),以非对称裁剪(ε_low=0.20,ε_high=0.28)、双裁剪C=3.0优化得π_RL。第四步Verbalization:对每条成功轨迹逐轮落地e_t=Ψ_ext(I,q,e_<t,z_t,a_t,o_t)、再全局c=Φ_verb(I,q,E_τ,y*)生成推理链,禁止引入E_τ外的实体/数值。第五步双视角训练:内化视角(I,q,c,y*)与工具视角原交互ξ(屏蔽工具返回token)联合最小化L_CI=L_internal+0.5·L_agentic。工具内部,Locate融合两模型(交叉确认框b_F=round((2b_L+b_D)/3)、去重IoU≥0.75),Segment用Douglas-Peucker简化到≤16顶点且掩码IoU≥0.97,Depth在504px读深度像素,Pose对物体放大裁剪框10%喂Orient Anything V2、相机运动用VGGT算外参归一为有符号轴。
技术新颖性
技术新颖性体现在四处。第一,'成功轨迹→内化监督'的闭环首次把空间专家工具的感知证据变成VLM自身能力,这是与SpaceTools/AlloSpatial只学工具、与SpatialVLM只直接微调的根本区别。第二,渐进式证据落地解决了长轨迹一次性verbalization会丢失跨轮依赖、又无法避免重复处理长上下文的难题:逐轮合并e_t保留依赖、全局verbalization整合,每条感知陈述都必须可追溯到当前工具结果或显式视觉观察或前一单元,并刻意扣住正确答案防止证据被答案污染。第三,双视角训练L_CI=L_internal+λL_agentic用一个权重λ优雅协调'内化'与'工具保留'两个目标,消融(Table 3、12)证明λ=0.5是最优平衡点、λ过大(1.5)会让CII从60.8掉到55.6。第四,配套SpatialCLI-Bench用私有oracle工具计划(平均3.81步、≤5步)从构造机制上强制每题组合≥2类能力,并通过两位研究生盲答独立审核(720候选留516,保留率71.67%)保证质量,这是首个系统评估组合空间感知的基准。此外结构化工具返回(坐标/多边形)优于可视化返回(Visual Only 45.9 vs Structured Only 66.5)的发现也指导了内化数据构造。
实验结果
核心发现逐条分析。其一,工具对小模型增益更大:Table 1中GPT-5.6 Sol加工具平均+6.1分,而Qwen3-VL-8B-Instruct加工具+21.0分,原生空间能力越弱外部专家越有价值;受控对比中SpatialCLI工具多数子集优于SpaceTools、所有子集优于AlloSpatial(后者DA-2K还掉2.7分)。其二,训练同时增强两种模式:每个变体无工具成绩在所有子集都超初始模型,训练后有工具成绩多数还高于直接给初始模型加工具——SpatialCLI-8B从35.3→72.7(无工具)→91.3(有工具)。其三,标志性结果在MindCube:Qwen3-VL-8B仅29.3%,SpatialCLI-8B加工具84.6%超过GPT-5.6 Sol加工具(72.1%),无工具73.8%,证明内化与工具共存。其四,训练动力学(Figure 3):RL w/ Tools+SFT每轨迹约2.56次调用、奖励更高更稳;RL w/o SFT调用数从3.36涨到6.74,证明冷启动必要;RL w/o Tools无工具仅52.7远低于内化72.7。其五,缩放(Figure 4):无工具成绩随内化数据从40.1%升到74.0%、CII从45.6升到61.6且趋势同步;有工具成绩不同容量仅差≤1.0分(工具饱和)而无工具成绩随容量明显提升,说明内化继续随容量缩放。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SpatialCLI-Bench(组合空间感知六选一问答,516例) | 准确率(%) | SpatialCLI-8B: 无工具72.7, 有工具91.3 | Qwen3-VL-8B-Instruct: 无工具35.3; GPT-5.6 Sol: 48.8(无工具) | 相对基础模型无工具+37.4分、有工具+56.0分;GPT-5.6 Sol加工具也只到72.9,本文8B模型有工具91.3显著领先 |
| MindCube(多视角空间推理) | 准确率(%) | SpatialCLI-8B: 无工具73.8, 有工具84.6 | Qwen3-VL-8B-Instruct: 29.3; GPT-5.6 Sol有工具72.1 | 相对基础模型+44.5分(无工具)/+55.3分(有工具),有工具超过GPT-5.6 Sol |
| MMSI(Motion-Cam+Pos-Cam-Cam多图空间) | 准确率(%) | SpatialCLI-8B有工具: Motion-Cam 55.2, Pos-Cam-Cam 48.5 | Qwen3-VL-8B-Instruct: 25.8 / 13.3 | Pos-Cam-Cam相对基础模型无工具+39.0分,显著弥补相机运动感知短板 |
| DA-2K(度量深度估计) | 准确率(%) | SpatialCLI-8B: 无工具32.3, 有工具53.8 | Qwen3-VL-8B-Instruct: 25.8; 单Depth工具即达91.6(单工具消融) | 相对基础模型+6.5(无工具)/+28.0(有工具),Depth工具贡献最大 |
| BOPASK(Trajectory+Object-Rearrangement连续点集评分) | Chamfer点集得分(%) | SpatialCLI-8B有工具: Traj. 73.2, ObjRrr 55.2 | Qwen3-VL-8B-Instruct: 35.7 / 25.8 | Traj.+37.5分,ObjRrr+29.4分,体现内化对轨迹与重排的迁移 |
局限与改进
作者在结论中明确承认:SpatialCLI受限于专业工具的覆盖与可靠性,当前范围只覆盖结构化感知输出和以感知为中心的任务。具体而言:四个工具只能输出坐标、多边形、深度米数、离散朝向等结构化结果,无法内化'带标注的图像'这类多模态输出;Segment只序列化外轮廓、不表示孔洞;Depth是单目相机轴Z深度而非欧氏距离或物理传感器测量,存在系统性噪声;Pose只暴露离散八方向和有符号轴,丢了连续角度、平移幅度和相机矩阵;工具调用平均延迟2.916秒,依赖6个专家模型部署在2块GPU上,工程门槛高。我自己补充几点观察:(1)训练数据来自MindCube/BOPASK/RefSpatial等固定源共3.7万任务,专业工具覆盖范围决定了内化天花板,遇到训练分布外的物体(如稀有材质、严重遮挡)专家本身可能失效、内化也会跟着失效;(2)SpatialCLI-Bench虽有人工双盲审核,但516例规模偏小且195例(37.79%)来自MindCube图像源,与MindCube评测集存在数据亲缘,可能高估泛化;(3)GRPO奖励对多选题是0/1稀疏奖励,对开放式空间任务(除BOPASK外)缺乏连续质量信号。
独立分析的弱点
第一个弱点是工具与感知覆盖窄,改进方向是把工具从'感知'扩展到'行动'——作者自己也提到要集成VLA工具在VLM规划下做联合感知与动作,这能补上当前只到感知、不到控制的断层。第二个弱点是结构化返回限制了内化粒度,比如分割丢失孔洞、姿态丢失连续角度,可改进为用统一多模态模型(既能理解又能生成)把工具输出直接以图像/深度图形式回灌并内化,让模型学会生成像素级掩码与稠密深度而非离散标签。第三个弱点是单目深度的系统噪声会传染给内化模型(案例中无工具估计0.362m/0.615m与工具0.351m/0.637m接近,但若专家本身就错内化也会错),改进方向是引入多视角或物理传感器做深度监督、或在verbalization阶段对置信度低的深度标注降权。第四个弱点是基准规模小(516)且与MindCube数据亲缘,改进方向是扩充更多视觉源、引入开放式答案与连续评分、并对'是否真需组合多能力'做更严格的oracle计划审计。第五个弱点是延迟高(单次工具2.916秒、最多10次调用),改进方向是工具蒸馏(把6个专家蒸馏成1个多任务模型)、或在内化后自适应决定何时调用工具以减少调用次数。
未来方向
作者明确提出两条未来方向:(1)用统一多模态模型把内化从结构化输出扩展到多模态输出,让模型能内化并生成图像、深度图、掩码图等非文本感知结果;(2)在VLM规划下集成VLA(视觉-语言-动作)工具,实现感知与动作的联合,向具身控制迈进。基于成果可延伸的方向还有:把'成功轨迹内化'范式推广到非空间领域(如检索、代码执行、GUI操作)的专家工具;研究内化的负迁移与遗忘——当专家被替换或升级后如何低成本更新内化模型;探索自适应工具调用(让内化后的模型自己判断当前任务需不需要工具、用哪个),这与Table 11显示的训练后调用率从99.3%降到81.5%的趋势一致;以及在更大模型(27B/35B)上验证CII随容量继续上升的缩放规律,向物理世界原生基础模型推进。
复现评估
复现评估整体较高。作者已开源代码(github.com/IANNXANG/SpatialCLI)、模型与数据集(HuggingFace ZYT-MFM/SpatialCLI-8B与SpatialCLI-Data),这是重要加分项。训练细节透明:三阶段共用3.7万任务池(Vlaser 5000、MindCube-Train 10000、BOPASK两子集各10000、RefSpatial 2000),SFT用397B教师约5000任务过滤留40%≈2000条,RL约1万任务、GRPO组G=8、非对称裁剪0.20/0.28、双裁剪C=3.0,内化约4.2万成功轨迹→约8.4万视角样本、λ=0.5,冷启动与内化用AdamW lr=2e-5、2 epoch、batch 64、ctx 32768,RL用lr=1e-6、batch 128,工具预算10、随机种子42,硬件为16块约96GB PPU-ZW810E、SFT与RL各4节点。主要复现难点有三:(1)算力门槛高,需4节点×16加速器;(2)依赖6个专业视觉模型的在线服务与两级缓存,部署工程量大;(3)冷启动SFT与verbalization都依赖397B闭源级教师,纯开源复现需找替代教师。基准构造虽详细(720候选→516留71.67%)但涉及人工双盲审核,重构造成本不低。综合看方法学复现度高、端到端完整复现需可观算力与工程投入。
论文图表
用一个'找离我最远的泰迪熊'的真实任务对比:左侧普通VLM直接靠肉眼猜,错误地说中间偏后的小熊最远;右侧加了SpatialCLI工具的VLM依次调用segmentationtool数熊、depthtool比较距离、localizationtool定位,最终给出精确框[190,130,255,302]。
这张图最直观地说明了论文核心动机——通用VLM在精细空间细节上不可靠,而工具组合能可靠解题,是理解'为什么要工具+为什么要组合'的最佳入口。