← 返回 2026-08-25

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准 MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi 📅 2026-08-24 👍 41 2026-08-30 18:30
LLM智能体 基准评测 多智能体协作 工具调用 移动AI

交互式有状态移动沙盒,四维评测移动规划智能体的工具调用与规划能力

前置知识

函数调用

LLM 不再只输出纯文本,而是按预定义的 JSON Schema 生成结构化调用:函数名加参数,由外部运行时真正执行并把结构化结果返回给模型。本文中所有系统能力(直接工具、子智能体派发、记忆查询、技能加载)都被统一成这种函数接口。

整个基准的动作空间就是一套统一的函数调用协议,读不懂函数调用就无法理解任务执行与验证机制。

有状态沙盒

一个维护可变内部状态的模拟执行环境:智能体每次调用工具都会真实读写模拟的应用数据库(如通讯录、日历),并留下操作日志,后续调用的结果取决于之前的状态突变,而非每次都从零开始。

本文与传统静态函数调用评测的核心区别就是有状态执行,任务成败通过数据库变化 $D_T - D_0$ 来判定。

GUI 智能体与 API 智能体之争

GUI 智能体用视觉语言模型看截图、预测像素坐标来点击屏幕(如 AndroidWorld、OSWorld),通用但慢且易错;API 智能体直接调用结构化系统接口,快速、低能耗、可靠。真实移动助手需要二者结合:优先用 API,接口缺失时回退到 GUI 操作。

论文的核心立场是中央规划应与底层视觉操作解耦,GUI 操作被封装为可委派的子智能体,这是理解其架构设计的前提。

子智能体委派

中央规划智能体把复杂任务分解后,将专门工作(如视觉表单填写、图像处理)连同必要的上下文一起移交给下游专职子智能体执行,执行完成后回收状态与反馈。评测关注的是路由选择是否正确、交接上下文是否完整。

子智能体协作是基准四大能力维度之一,占 10% 权重,且是所有模型表现最不稳定的维度之一。

智能体强化学习

让智能体在与环境交互的轨迹上通过奖励信号迭代改进策略的训练范式,需要环境能高频、确定性地生成 rollout 并给出可验证的奖励。有状态沙盒因无需渲染截图、执行成本低,天然适合大规模 RL 训练。

作者把该基准定位为智能体强化学习的交互式基础设施,理解 RL rollout 对评测指标的设计动机很关键。

研究动机

现有移动智能体评测分裂成两个各有致命盲区的阵营。第一类是以 AndroidWorld、OSWorld、MobiBench 为代表的 GUI 中心基准,让视觉语言模型看截图、点像素,只测试了表层屏幕操作,完全忽略了后台工具调用和长程规划,而且虚拟机启动、VNC 截图延迟使得高吞吐评测和强化学习 rollout 代价高昂。第二类是以 BFCL、ToolBench、DroidCall、TAU-Bench 为代表的静态函数调用基准,用离线字符串或 AST 匹配判定对错,没有真实运行环境:既不追踪动态 OS 状态,也不存在调用依赖、权限拦截、运行时异常等真实摩擦。然而真实用户意图——例如计划下周三出发的上海三日游,需含往返机票、酒店和景点——绝非单次 API 调用或 GUI 自动化可以解决:智能体必须检索长期记忆消歧、批量调用结构化接口、处理多模态输入(如扫码),还要在 API 不可用时无缝回退给 GUI 子智能体。用一个僵化指标统一评判所有任务也行不通:精确匹配轨迹会错杀多条等价路径(过严),只看最终状态又无法评估动态决策过程(过松)。

本文的目标是本文要构建一个交互式、有状态、以工具为中心的基准 MobilePA-Bench,系统评测移动规划智能体在复杂真实任务上的能力。具体目标包括四点:其一,建立覆盖 13 个功能域、212 个真实移动工具、共 1,705 个任务的大规模诊断套件,并划分出四个能力维度——基础工具使用(1,040 题)、子智能体协作(89 题)、记忆使用(376 题)、技能使用(200 题);其二,搭建一个可执行沙盒,维护实时应用数据库、返回结构化反馈,并原生注入调用依赖、权限阻断、实体歧义等环境摩擦;其三,设计证据对齐的验证机制,按任务完成语义路由到工具调用、状态突变、智能体行为三类校验桶,配合记忆与技能门控;其四,定义不可变的全分母加权总分,并完整开源全部基础设施,使其同时充当诊断基准和智能体强化学习的交互式训练底座。

与已有工作不同的是,本文的独特切入点是把中央规划与底层视觉解析彻底解耦:作者主张原始的屏幕点击只占移动智能生态的一小部分,称职的移动智能体应优先用结构化 API 实现快速、节能的系统级控制,因此基准把细粒度 UI 操作卸载给专门的 GUI 子智能体,从而严格隔离并诊断中央规划器的高层推理、API 编排与运行时错误恢复能力。与 MemGPT、SkillBench、VOYAGER 等把记忆或技能当作孤立合成任务评测的算法框架不同,MobilePA-Bench 把子智能体委派、记忆检索、技能调用原生嵌入真实移动工作流中考察。与 TAU-Bench 的纯文本事务、SWE-bench 的容器执行、WebArena 的网页渲染相比,它用轻量级有状态数据库沙盒实现了确定性、高吞吐、可回放的执行,是表 1 对比中唯一同时满足有状态数据库、动态 OS 反馈、三大高级能力和 RL 友好吞吐四项的基准。

核心方法

MobilePA-Bench 把移动智能形式化为以工具为中心的编排闭环。任务是四元组:用户意图 $q$、初始状态 $S_0$、对话历史 $H_0$、候选动作集 $A_0$。在步 $t$,中央规划器预测 $a_t = \pi(q, H_t, A_t)$;沙盒执行后 $(S_{t+1}, f_t) = \mathrm{Exec}(S_t, a_t)$,$H_{t+1} = H_t \oplus (a_t, f_t)$,循环到 Finish 或最大步数 $T_{max} = 15$。动作空间分四类接口:直接移动工具(消息、日历、媒体等)、子智能体入口工具(如 GUI 子智能体路由)、记忆工具(如 search_user_memory)、技能加载工具。初始候选集为 $A_0 = R_N(q, H_0; \mathcal{G}) \cup L_q$,其中 $R_N$ 是为查询召回的前 $N$ 个工具 Schema(评测固定 $N = 15$),$L_q$ 是可用技能加载器。沙盒状态建模为 $S_t = \langle D_t, O_t \rangle$(应用数据库加操作日志),反馈为 $f_t = \langle \mathrm{Status}, \mathrm{ErrorType}, \mathrm{Payload} \rangle$,全部 1,705 个任务在标注时路由到三个证据对齐的验证桶之一。

核心创新有三层。第一,统一动作空间:子智能体派发、记忆查询、技能加载全部表示为标准函数 Schema,使四种能力维度共享同一套以工具为中心的决策协议;尤其技能加载会动态扩容动作空间——当规划器调用技能加载器 $s \in L_q$ 时,$A_{t+1} = A_t \cup \mathcal{G}(s)$,其中 $\mathcal{G}(s)$ 是绑定到该技能的具体工具集,避免了从原子工具逐步规划导致的误差累积。第二,证据对齐的三桶验证:不同于任何单一指标,按完成语义路由——桶 1(工具调用)做精确匹配,校验工具名、调用顺序、参数字段与归一化取值且无多余副作用调用;桶 2(状态突变)校验终态数据库增量 $D_T - D_0$ 与标注目标一致且无破坏性写入;桶 3(智能体行为)用任务专属评分准则检查是否调用了正确子智能体路由及跟进行为是否得当。第三,能力门控:记忆门控 $g_{mem}(q) = \mathbb{1}[M^*_q \subseteq \hat{M}_T]$ 要求轨迹检索到全部金标记忆 ID,技能门控 $g_{skill}(q) = \mathbb{1}[s^*_q \in \hat{K}_T]$ 要求加载金标技能,最终成功为 $\mathrm{Succ}(q) = g(q) \wedge C_b(q)(H_T, S_T)$,即门控与主校验器取合取。

方法步骤详情

第一步,任务构建:从真实移动场景合成任务并注入缺参、权限阻断、指代混淆、状态突变等摩擦;基础工具使用按五个行为类别组织;376 个记忆任务来自连贯用户画像世界,请求刻意隐去偏好并记录金标记忆 ID 集 $M^*_q$;技能任务标注金标技能 $s^*_q$,在仅技能路由(SOR)与工具-技能混合路由(MTSR)下评测。第二步,标注每题的初始沙盒状态 $S_0$、候选动作空间 $A_0$、金标目标,并固定验证桶 $b(q) \in \{tool, state, behavior\}$。第三步,在线交互:模型以多轮函数调用逐步执行,每步收到结构化反馈 $f_t$ 并可据错误(如 PermissionDenied)实时改计划,直到 Finish 或 $T_{max} = 15$。第四步,离线验证:按桶执行主校验器 $C_b(q)(H_T, S_T)$,需要时叠加记忆门控 $g_{mem}$ 或技能门控 $g_{skill}$。第五步,聚合总分:$\mathrm{Score}_{overall} = 0.50 \times \mathrm{Score}_{Basic} + 0.10 \times \mathrm{Score}_{SubAgent} + 0.20 \times \mathrm{Score}_{Memory} + 0.20 \times \mathrm{Score}_{Skill}$,缺失或无效预测一律计 0 分(不可变全分母)。

技术新颖性

与已有工作的本质区别可以从表 1 的对比看清。GUI 中心基准(AndroidWorld、OSWorld、WindowsAgent、MobiBench)虽有状态和动态反馈,但渲染与截图开销使其不 RL 友好,且不支持任何高级能力维度;静态函数调用基准(BFCL v1-v4、DroidCall、AppBench)用静态 AST/字符串匹配,无状态、无反馈、无高级能力;TAU-Bench 虽是工具沙盒但只做纯文本事务、无动态反馈;SWE-bench、WebArena 有状态有反馈但容器与渲染成本高,同样不支持高级能力维度;OpenCLAW、MemGPT、SkillBench、VOYAGER 各自只覆盖子智能体、记忆或技能中的一个,且大多没有真实环境。MobilePA-Bench 是唯一以轻量级有状态 OS 沙盒同时统一基础工具、子智能体、记忆、技能全部四个维度的基准。技术上的新颖点还包括:把错误恢复作为一等公民——沙盒在初始状态中系统化注入受控摩擦,强制规划器观察动态反馈 $f_t$ 并在线修复计划;以及证据对齐验证哲学,承认不同任务的成功语义本质不同,用不可互换的三个桶加门控取代一刀切指标。

Overview of the MobilePA-Bench evaluation paradigm
Figure 2: Overview of the MobilePA-Bench evaluation paradigm
Closed-loop execution and verification protocol in MobilePA-Bench
Figure 3: Closed-loop execution and verification protocol in MobilePA-Bench
An overview of the stateful simulation sandbox architecture in MobilePA-Bench, illustrated via an add_contact tool invocation
Figure 4: An overview of the stateful simulation sandbox architecture in MobilePA-Bench, illustrated via an add_contact tool invocation
MobilePA-Bench evaluation framework across three evidence-aligned query buckets
Figure 5: MobilePA-Bench evaluation framework across three evidence-aligned query buckets
Hierarchical scenario distribution over a 1,530-query analysis snapshot
Figure 6: Hierarchical scenario distribution over a 1,530-query analysis snapshot
Coverage of the 376 Memory Usage tasks along three diagnostic axes
Figure 7: Coverage of the 376 Memory Usage tasks along three diagnostic axes

实验结果

作者用标准化提示词、多轮函数调用设置评测了 13 个前沿模型($N=15$ 工具召回,$T_{max}=15$)。总体上,最强的 Claude-Opus-5 加权总分仅 75.52%,13 个模型中 7 个低于 70%,最弱的 Kimi-2.6 只有 55.63%。分维度看:基础工具使用最强(13 模型均值 76.58%),Claude-Opus-5 以 83.85%(872/1040)领先但仍失败 168 题;子智能体协作为 43.82%(Kimi-2.6)到 77.53%(Gemini-3.1-Pro),是全面短板;记忆使用最难,均值仅 50.98%,最优 Qwen-3.8-Max 也只有 64.63%(243/376),Kimi-K3 63.56%、Gemini-3.6-Flash 62.77%,即使最强模型也在三分之一记忆任务上失败;技能使用池化 SOR 与 MTSR 共 400 条轨迹计分,Claude-Opus-5 以 78.00%(312/400)居首,13 模型均值 66.77%,表明预打包技能确实缓解长程规划误差。稳定性方面,Qwen3.6-27B 三次完整评测中基础/记忆/技能标准差均低于 1 点,子智能体极差 2.25 点仅对应 89 题中 2 题翻转,总分稳定在 57.22%–57.63%(带宽低于 0.5 点)。关键讨论指出:误差会跨能力边界级联;没有任何模型同时统治四个维度(冠军分属 Claude-Opus-5、Gemini-3.1-Pro、Qwen-3.8-Max);模型缺乏校准的克制与自适应纠错,遇到能力边界或权限异常时倾向幻觉式提前调用而非澄清提问。

Holistic comparison of stateful, interactive, and tool-centric agent benchmarks
Table 1: Holistic comparison of stateful, interactive, and tool-centric agent benchmarks
Tool domains in the MobilePA-Bench mobile function-call environment
Table 2: Tool domains in the MobilePA-Bench mobile function-call environment
Main evaluation results across four MobilePA-Bench capability dimensions
Table 3: Main evaluation results across four MobilePA-Bench capability dimensions
Run-to-run stability over three complete evaluations of Qwen3.6-27B
Table 4: Run-to-run stability over three complete evaluations of Qwen3.6-27B
查看结构化数据
任务指标本文基线提升
总体加权得分(1,705 题,50/10/20/20 加权) Score_overall (%) 基准本身无本文模型,最高分模型为 Claude-Opus-5:75.52% 13 模型中 7 个低于 70%,最低 Kimi-2.6 为 55.63% 反映最强前沿模型仍有至少 24.48% 失败率,凸显基准区分度
基础工具使用(1,040 题,5 个行为类别) 分类别聚合准确率 (%) Claude-Opus-5 达 83.85%(872/1040) 13 模型均值 76.58%,最低 GPT-5.5 为 68.94% 领先均值约 7.3 个百分点,但仍有 168 题失败
子智能体协作(89 题,路由与交接质量) 路由-交接联合成功率 (%) 最高 Gemini-3.1-Pro:77.53% 最低 Kimi-2.6 仅 43.82%,多数模型在 50% 左右 模型间差距达 33.7 个百分点,为区分度最大的维度之一
记忆使用(376 题,端到端门控指标) E2E 成功率 (%) 最高 Qwen-3.8-Max:64.63%(243/376) 13 模型均值 50.98%,最低 Kimi-2.6 为 33.78% 表明个性化上下文的检索与正确应用远难于直接工具执行
技能使用(200 题 × SOR/MTSR = 400 条轨迹) 金标技能门控联合成功率 (%) 最高 Claude-Opus-5:78.00%(312/400) 13 模型均值 66.77%,最低 Kimi-2.6 为 46.50% 复合技能复用普遍优于从原子工具规划,但混合路由仍是弱项

局限与改进

作者坦承的最主要局限是天花板发现:即便最强的 Claude-Opus-5 总分也只有 75.52%,最可靠的维度(基础工具使用)冠军仍有 168/1040 失败,说明参数定位、委派时机、个性化上下文应用均未解决。作者还用三次重复实验承认了子智能体维度的统计脆弱性:仅 89 题,单次评测中 2 题翻转就造成 2.25 点极差,方差远大于其他维度。我自己的观察有五点:其一,验证桶在标注时一次性固定,若标注者选了较严的桶 1,规划器即使找到了等价正确路径也会被判失败,桶分配本身的正确性没有做人工一致性检验;其二,桶 3 依赖评分准则(可能含 LLM judge),其判定信度与偏差未报告;其三,总分权重 50/10/20/20 是人为设定,子智能体维度仅 89 题却参与加权,噪声被放大;其四,沙盒是 Python 模拟的应用数据库,注入的摩擦(缺参、权限阻断)是人工构造的分布,未必对齐真实 OS 的异常分布,且未涵盖通知推送、跨应用竞态等真实动态性;其五,论文宣称沙盒适合智能体强化学习,但全文没有任何 RL 训练实验来验证这一基础设施主张。

独立分析的弱点

弱点一:子智能体协作维度样本过少(89 题),单题权重约 1.1%,两题翻转即引起 2.25 点极差,导致该维度 leaderboard 排名不可靠,改进方向是扩容到数百题或对该维度报告置信区间并在总分中降权/去噪。弱点二:桶 3 的行为验证依赖任务专属评分准则,论文未公开 judge 的一致性数据(如与人工标注的 Kappa),改进方向是开源判分 prompt、报告 judge-人工一致率,并提供人工复核抽检。弱点三:金标记忆 ID 集合匹配要求 $M^*_q \subseteq \hat{M}_T$,检索到多余相关记忆不会扣分但漏一条即失败,这可能低估了近似正确的个性化能力,可考虑按 ID 的 F1 软评分。弱点四:环境摩擦是模板化注入的(缺参、权限块、实体歧义五类),真实 OS 的失败模式(网络抖动、应用闪退、权限弹窗超时)未被覆盖,建议从真实设备日志挖掘摩擦样本。弱点五:工具召回固定 $N = 15$,未报告召回率对成绩的敏感度,若金标工具不在前 15,失败可能归因于召回而非规划,应做 $N$ 的消融或报告 oracle 上界。

未来方向

作者明确提出的方向有三个:其一,把该沙盒用作智能体强化学习的交互式底座,基于状态化反馈做联合强化学习训练,这是摘要与结论反复强调的定位,最直接的延伸是用 GRPO/PPO 类算法在 1,705 个可验证任务上训练开源模型并报告增益;其二,强调跨智能体通信的纪律性训练,改善子智能体路由与交接质量这一全面短板;其三,把个人记忆检索与工具参数定位紧耦合,因为记忆是最低分维度(均值 50.98%)。基于论文成果还可延伸:引入课程式摩擦难度分级以训练错误恢复能力;把 GUI 子智能体真正接入真实设备(如 Android 虚拟机)检验模拟到现实的迁移;扩展到多设备、多用户协同场景;为桶 3 探索基于过程奖励模型而非规则/LLM judge 的自动化行为评分;以及用记忆维度的失败案例驱动检索-应用联合微调。

复现评估

复现条件相当好:作者完整开源了全部基础设施(GitHub: Tongyi-MAI/MobilePA-Bench),包括 1,705 个基准任务、评测数据集和高吞吐沙盒环境。评测协议明确可复制:标准化系统提示词、多轮函数调用、工具召回 $N=15$、最大步数 $T_{max}=15$、不可变全分母计分。验证桶、金标记忆 ID、金标技能 ID 随任务标注给出,主校验器(桶 1 精确匹配、桶 2 数据库增量比对)是确定性的,桶 3 的评分细则虽未详述但应随数据发布。算力方面,跑评测主要是 API 调用成本(13 个前沿模型),自建开源模型(如 Qwen3.6-27B)需单卡级 GPU 推理,三次稳定性重复实验表明流程确定性良好(总分带宽 0.41 点)。难度评估:运行评测门槛低,沙盒是轻量 Python 模拟环境无需真机或虚拟机集群;若要复现数据构建管线(任务合成、摩擦注入、桶标注)则门槛较高,需要移动领域标注专家。