SPIEval:面向分散个人信息的移动助手大语言模型评测基准 SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
首个评测LLM移动助手跨应用检索分散个人信息的基准,最强模型准确率仅57.3%
前置知识
LLM 智能体与工具调用
LLM 智能体指以大语言模型为核心、通过调用外部工具完成任务的系统。工具调用将工具的名称、功能描述和参数规范以 JSON Schema 形式提供给模型,模型生成结构化的函数调用请求,环境执行后把结果返回给模型,如此多轮往复直至任务完成。本文中模型需在最多 50 轮交互内先调用检索工具收集信息,再调用执行工具落完成任务。
SPIEval 评测的正是移动助手形态的 LLM 智能体,理解工具调用机制才能理解任务形式化中的轨迹 $\tau = (c_1, r_1, \ldots, c_n, r_n)$,以及为什么评测只看最终执行调用而不评中间步骤。
多跳推理
多跳推理指完成一个推断需要串联多个相互依赖的中间步骤,前一步的输出是后一步的输入。例如『保存我经理的联系方式』:先从会议记录推断经理是谁,再用名字去通讯录查电话,最后才能执行保存。任何一步出错都会级联导致最终失败。
SPIEval 五大认知能力中的推理能力直接对应这一概念,且其失败分析(79% 错误来自参数值错误)本质上就是多跳链条中信息定位环节的断裂。
信息定位
信息定位指模型面对一个未指明参数的指令时,主动判断需要什么信息、应该到哪个应用的哪些记录中找、如何构造检索查询,并对检索结果进行核验的能力。它区别于被动接收信息,强调模型自主发起检索并根据反馈决定是否继续搜索。
这是全文的核心概念:作者通过 no-search 和 full 两个对照实验证明信息定位是当前 LLM 移动助手的主要瓶颈(去掉检索后平均准确率从 35.5% 跃升至 66.8%)。
结构化检索模式
指检索工具暴露给模型的三种匹配方式:子串匹配(精确包含)、正则表达式匹配(模式描述)和模糊匹配(容忍错字变体),并支持限定搜索字段和大小写。例如查电话号码片段或姓名变体时,模糊匹配比子串匹配更有效。
论文对 126,279 次检索调用的统计显示 98.5% 都是最朴素的子串匹配,正则和模糊合计不足 2%——模型不会用工具提供的高级能力,这直接导致含噪音或变体的记录查不到。
参数级二元准确率
一种避免 LLM-as-a-judge 主观性的自动评测协议:将模型最终发出的执行工具调用与人工标注的金标准答案逐一比对,只有调用的执行工具和所有参数值完全匹配才判正确;无约束参数(如闹钟重复次数)只校验类型,7.0% 的参数允许多个合法值,多工具任务的判定与调用顺序无关。
SPIEval 的所有结论都建立在这一指标上,理解它才能明白为什么该基准声称结果可验证、可复现,以及人类准确率为何可由构造保证为 100%。
研究动机
大语言模型正被快速部署为手机上的智能助手(Apple Intelligence、豆包手机助手、荣耀 YOYO 等),它们必须利用散落在多个应用里的个人信息来完成用户简短模糊的指令。以『打给我经理』为例,指令既没说经理是谁,也没说用什么方式打,助手需要先从会议记录确认经理身份,再去通讯录查电话号码,最后根据备忘录里记录的偏好选择视频通话。然而现有评测基准都无法覆盖这一场景:AppWorld(750 任务、9 应用)和 Gaia2(1,120 任务、12 应用)虽然评测工具编排,但用户指令通常显式给出所需参数;SAPA-Bench(7,138 任务、50 应用)同样要求参数已在指令中给出;HiCUPID(60,000 问答对)和 PersonaBench(582 任务)引入了个人数据,但信息获取仅限于从单个文档中检索,而非跨多个应用定位。因此,LLM 移动助手在分散个人信息场景下的真实能力此前几乎是未知的。
本文的目标是本文的目标是构建并开放一个专门评测『分散个人信息』场景的基准 SPIEval,系统回答三个问题:当前 LLM 作为移动助手在这一场景下究竟表现如何?哪些认知能力是瓶颈?失败的根本原因是什么?具体而言,基准需覆盖五项认知能力(推理、消歧、整合、偏好推断、多意图分解),包含 250 个人工构建的任务、散布于 10 个模拟应用中的 4,335 条个人记录,并提供 21 个工具(11 个检索 + 10 个执行)支持多轮交互;同时对九个代表性 LLM 进行评测并做深入的失败归因分析,为后续研究指明方向。
与已有工作不同的是,本文的独特切入角度在于把评测重心从『工具编排能力』转移到『主动信息定位能力』上。已有基准要么把参数喂到嘴边,要么只考单文档检索;SPIEval 则让每条指令显式提供的必需参数为零——平均仅 34 字符的指令平均需要推断 8.47 个执行参数,全部要从平均 17.3 条、横跨 6.2 个应用的记录中定位。方法上它坚持全人工构建而非 LLM 生成任务,采用『一人出题、另一人盲解』的交叉验证协议保证每个任务有唯一可验证的解;评测上完全绕开 LLM-as-a-judge 的偏差问题,用参数级精确匹配实现全自动、可复现的判定,这些设计共同把『散、隐、需主动检索』这一真实但被忽视的挑战第一次变成可严格度量的对象。
核心方法
直觉上,SPIEval 把一部手机抽象成模型可交互的模拟环境:给定指令 $q$ 和应用集合 $A = \{a_1, \ldots, a_K\}$,每个应用 $a_k$ 存有结构化记录集 $R_k$,模型配备工具集 $T = T_{\text{retrieve}} \cup T_{\text{exec}}$,需生成工具调用轨迹 $\tau = (c_1, r_1, \ldots, c_n, r_n)$($c_i$ 为调用、$r_i$ 为反馈),以执行调用收尾。技术路线分四步:先建立统一用户画像(职业、家庭成员、手机号、支付账号、当前时间戳,注入系统提示),使『我爸爸』『部门经理』等自然指代可被解析;再抽象出 10 个常用应用(住宿、闹钟、通讯录、会议、备忘录、日程、短信、交易、出行、语音留言),每应用平均 8.1 个字段并区分必填/选填,使记录常常只填了一部分;然后设计 21 个工具:11 个检索工具(10 个应用内 + 1 个全局)支持子串/正则/模糊匹配、字段限定和大小写控制,结果按每页至多 5 条分页返回,另配 10 个与应用一一对应的执行工具;最后按五大认知能力各出 50 题共 250 题,每题写指令、构造任务专属记录、逐步推理标注和含全部参数的金标准执行调用。系统提示明确告知模型所有信息都可检索到、不要反问用户,可并行检索、可翻页。
核心创新是『信息结构先行』的任务设计:每个任务先由标注者设计底层信息结构——规定任务相关信息如何散布在哪些应用、通过姓名/电话/账号等共享属性如何跨应用链接——再据此生成指令、记录、推理路径和金答案四件套。记录独立填充,保证完成任务所需信息全部可得,但只有通过预设的检索与推理路径才能获得。这与已有工作的本质区别有三点:其一,指令显式提供零参数,工具选择与参数推断全部隐式,而 AppWorld/Gaia2 的指令把参数写在明面上;其二,个人信息不是存于单个文档而是分布在部分填充、跨应用关联的结构化记录中,这与个性化基准的单文档检索有本质差异;其三,环境完全确定性——工具调用先经规范校验、非法输入返回有信息量的报错,合法输入执行结果唯一,使性能差异可归因于模型本身而非环境噪声。
方法步骤详情
构建与评测流程如下。第一步,用户画像构建:确定统一身份(采购部员工徐艺轩,妻子谢玲、儿子徐鑫、女儿徐淼,手机号 15711227837 等)注入系统提示。第二步,应用构建:把 10 个真实应用抽象为带域特定字段的模式,区分必填字段(如联系人姓名、电话)与选填字段(如公司、生日),相关字段跨应用共享以便通过共同属性链接。第三步,工具构建:每应用配一个专属检索工具外加一个跨应用全局检索工具(结果标注来源应用),支持子串、正则、模糊三种模式及字段定向与大小写控制,结果分页返回;另配带类型标注和必填/选填区分的执行工具。第四步,任务构建:标注者选定认知能力,设计信息散布结构,产出指令、任务专属记录、逐步推理标注、金标准执行调用四组件,共 250 题、4,335 条记录、357 个执行操作。第五步,质量控制:六位 NLP 研究者历时三个月,模式经全员评审;每题由另一研究者不看金答案独立盲解,两人通过预期路径得到相同答案才收录,否则修改以消除歧义或意外解法;所有金答案实际执行验证,因此人类准确率由构造保证为 100%。第六步,评测:二元准确率,最终执行调用须与金答案的工具及参数完全匹配,7.0% 参数允许多合法值,76 个多工具任务判定与调用顺序无关;每模型在最高/最低推理努力两档各跑 3 次取均值,每任务至多 50 轮交互。
技术新颖性
技术新颖性体现在四个层面。基准设计层面,首次把『分散个人信息』形式化为可评测属性,并与 AppWorld、Gaia2、SAPA-Bench、HiCUPID、PersonaBench 逐项对比,是唯一同时满足指令欠规格、分散个人信息、主动检索、动作执行、结果可验证、人工构建六项性质(Table 5)。构建方法层面,拒绝 LLM 合成任务,采用双人交叉盲解协议,从机制上排除了歧义任务和意外解法,并保证人类 100% 可解。评测协议层面,以参数级精确匹配取代 LLM-as-a-judge,规避评审模型偏差与输出随机性,同时通过无约束参数、多合法值参数(7.0%)和顺序无关判定(76 个多工具任务)保留合理的灵活性。分析框架层面,作者设计了标准分页、full(一次性返回全部匹配记录)、no-search(全部相关记录直接放入系统提示)三档对照,把『检索瓶颈』从『推理瓶颈』中干净地剥离出来;再辅以 126,279 次检索调用的配置统计和成功/失败任务的检索次数对比,形成一套可迁移的智能体失败归因方法论。
实验结果
九个模型、十八个配置的评测(Table 2)显示任务极难:最强的 GPT-5.5(xhigh)仅 57.3%,最弱的 Kimi K2.6(none)只有 16.4%,而人类为 100%。五项能力两极分化:推理、消歧、整合平均约 46%,偏好推断与多意图分解仅为其一半。对照实验(Figure 5)定位瓶颈:no-search 设定下平均准确率从 35.5% 跃至 66.8%(+31.3),full 设定只从 35.5% 微升至 36.0%,说明难点不在读信息而在构造查询找到信息;偏好推断在 no-search 下达 67.0%(+44.1),说明模型有推断能力只是找不到证据;多意图分解在 no-search 下也仅 45.7%,瓶颈在分解与规划本身。失败归因(Figure 6):三大最强模型的失败中 79% 是参数值错误(定位到似是而非的错误信息)、13% 是数量错误、6% 是漏填必填参数。检索行为:所有模型在失败任务上检索次数反而更少(Figure 7,差距 1.0–3.8 次),即过早承诺而不再验证;126,279 次检索中 98.5% 用子串匹配,正则 0.9%、模糊 0.6% 合计不足 2%,仅 9.5% 限定字段(Figure 8)。提高推理努力平均 +13.8 点,但 GPT-5.5 达 +28.8、GLM-5.2 仅 +6.0。策略分化:Gemini 3.1 Pro 在推理/消歧/整合上均超 73% 但偏好推断仅 20%,每任务 7.6 次检索;GPT-5.5 偏好推断与多意图分解最强,检索 11.2 次,以更全面的检索换取最高总分。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SPIEval 全部 250 任务总体完成 | 参数级二元准确率(3 次运行均值) | 最佳模型 GPT-5.5 (xhigh) 57.3% | 人类准确率 100%(由构建协议保证) | 距人类尚差 42.7 个百分点;最弱配置 Kimi K2.6 (none) 仅 16.4% |
| 平均任务完成(18 个模型配置,no-search 对照) | 平均准确率 | no-search 设定 66.8% | 标准分页检索设定 35.5% | 移除检索环节提升 31.3 个百分点,证明信息定位是主要瓶颈 |
| 一次性返回全部匹配记录(full 对照) | 平均准确率 | full 设定 36.0% | 标准分页检索设定 35.5% | 仅提升 0.5 个百分点,说明瓶颈在构造有效查询而非翻页阅读 |
| 偏好推断(no-search 对照) | 准确率 | 67.0% | 标准设定下的表现(最强模型 38.7%) | 提升 44.1 个百分点,证据可得时模型具备推断能力 |
| 多意图分解(no-search 对照) | 准确率 | 45.7% | 标准设定 32.7%(最强配置) | 即使信息全给仍仅约一半正确,瓶颈在分解与规划能力本身 |
| 提高推理努力档位(全部模型) | 准确率平均提升 | 平均 +13.8 点(GPT-5.5 +28.8 最大) | GLM-5.2 仅 +6.0(最小) | 增益差异达 22.8 点,反映模型将额外思考转化为有效检索的能力差异 |
局限与改进
作者承认的局限包括:所有个人数据均为虚构,环境是对真实手机应用的抽象(平均 8.1 个字段),可能与真实设备的记录复杂度、噪音水平有差距;基准规模为 250 题(每能力 50 题),统计功效有限,部分配置报告的标准差较大(如 Hy3 (no think) 在整合上 ±10.5)。从我的观察看还有几点:其一,统一用户画像只有一个身份(采购部员工徐艺轩),任务间场景多样性受单一职业背景约束,模型可能过拟合该画像的实体分布;其二,环境是 API 级模拟,不含 GUI 截图感知、权限弹窗、跨应用异步事件(对比 Gaia2 的动态性)或安全约束,移动助手在真机上还要处理屏幕理解与误操作风险;其三,二元准确率把『多检索 4 次』与『失败』同等对待,未报告 token 成本与延迟,而论文自己也强调移动助手受时延约束;其四,金答案由人工枚举合法值(仅 7.0% 参数允许多值),现实中可能存在合理但未被标注的替代路径被判错;其五,被评的九个模型均为 API 闭源模型为主(含 DeepSeek-V4-Pro 等),结论对开源小模型的适用性有限。
独立分析的弱点
独立分析本文暴露的可改进弱点如下。第一,模型『过早承诺』的失败模式(失败任务检索次数反而更少,差距 1.0–3.8 次)提示可以在解码或训练中加入『证据充分性自评』机制:让模型在执行前显式判断候选记录是否唯一、是否与其他应用记录一致,不足时强制继续检索,这可直接攻击 79% 的参数值错误。第二,98.5% 的检索是朴素子串匹配,说明模型把通用文本检索习惯带进了结构化环境;改进方向是在后训练中加入工具使用的针对性数据(正则、模糊、字段限定查询的示范与强化学习奖励),或让工具端自动升级查询(子串无结果时回退模糊匹配)。第三,偏好推断与多意图分解即使信息全给也只有 67.0% 和 45.7%,说明这不止是检索问题,需要在规划层面训练任务分解能力(如先输出子任务清单再逐个执行的过程监督)。第四,基准本身可扩展:只有单一用户画像与静态环境,可加入多画像、时间演化记录(同一联系人号码变更)、干扰性相似实体和动态事件,考察鲁棒消歧;并应补充成本-延迟-准确率三维权衡报告。
未来方向
作者指出的方向包括:提升信息定位能力(判断证据是否充分、决定何时继续检索)是首要研究目标;让模型学会利用工具暴露的高级检索方法;以及把额外推理预算更有效地转化为检索策略规划、中间结果核验与查询重构。基于本文成果还可延伸:把『检索-验证-再检索』循环形式化为可优化的目标,用本文的确定性环境做强化学习(参数级精确匹配天然是无噪声奖励信号);研究不确定性校准,让模型在信息冲突时宁可拒绝执行而非基于错误个人信息行动(论文强调这对手机助手危害更大);将基准扩展到动态、多用户、跨设备的真实数据流;结合 GUI 智能体评测,把 API 级信息定位与屏幕操作贯通;以及针对移动端时延约束研究小模型 + 高效检索策略的蒸馏方案。
复现评估
复现条件良好。数据与代码已在 HuggingFace 开放(https://huggingface.co/datasets/Junjie-Ye/SPIEval),用户画像、10 个应用的完整模式(Table 4)、全部 21 个工具的规范文档、中英文系统提示模板均在附录中完整给出。环境完全本地化且确定性:所有记录预加载,工具调用先经规范校验、合法输入执行结果唯一,评测为参数级自动比对,无需 LLM 评审,因此结果可精确复现。算力方面不需要训练,只需调用九个商业模型的 API,按每配置 3 次运行、每任务至多 50 轮交互计算,主要成本是 API 费用(论文统计了 126,279 次检索调用,可估总量在数万至十几万次请求量级)。需要注意的坑:需按论文实现分页(每页至多 5 条)、无约束参数的类型校验、7.0% 多合法值参数以及 76 个多工具任务的顺序无关判定,否则指标会与原文不可比。总体复现难度中低,若只复用单个开源模型自评则更低。
论文图表
以指令『打给我经理』为例展示移动助手的工作方式:助手先在会议应用中搜索确认经理是 Daniel Reed,再在通讯录中查到其电话 +1 415-739-2098,最后在备忘录中发现用户与 Daniel 通话偏好视频通话,从而以 Video Call 方式拨出。指令中的三个未知量(谁?哪个号码?怎么打?)分别由三个不同应用解答。
这是全文的任务定义样例,一图讲清『分散个人信息』的含义和五步检索-推理-执行流程,是理解后续所有设计的起点。