← 返回 2026-08-17

MobileMem:从一年移动使用经验中学习的设备端长期记忆基准 MobileMem: Learning from a Year of Mobile Experiences

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang 📅 2026-08-11 👍 25 2026-08-22 18:30
基准评测 多模态 数据合成 移动智能体 长期记忆

基于一年真实移动经验的设备端记忆基准与KEME数据合成框架,现有记忆系统远未达标

前置知识

智能体长期记忆

指智能体在与用户跨天、跨月甚至跨年的交互中,把碎片化观察转化为可持续累积、组织和更新的用户知识,并在未来任务中检索利用的能力。通常形式化为记忆状态更新 $\mathcal{M}_t = \mathrm{Update}(\mathcal{M}_{t-1}, x_t)$,即每收到一个动作 $x_t$ 就更新记忆状态,问答时基于最终记忆状态 $\mathcal{M}_{|\tau|}$ 生成答案,再与参考答案集比对。

本文的评测对象就是这类记忆层,全文的问题定义(轨迹元组 $(\mathcal{T}, \mathcal{Q})$)、基准构造与端到端评估协议都围绕'轨迹→记忆→问答'这条链路展开,不理解该概念就无法理解被评测系统的工作方式。

RAG(检索增强生成)

把历史信息切分为记忆单元并建立索引,回答时先用向量相似度(Embedding/BM25)检索 top-$k$ 相关单元,再拼入上下文让 LLM 生成答案。本文的主要基线都是其变体:NaiveRAG 是朴素实现,HippoRAG2 引入实体关系图与个性化 PageRank 改进多跳检索,A-MEM 给记忆单元附加关键词、标签等元数据,Mem0/MemOS/EverMemOS 则是更复杂的记忆管理框架。

论文 Table 1 和 Table 4 的主要对比对象就是这些 RAG 式记忆系统,理解'检索-生成'两阶段才能看懂为什么失败大多发生在检索环节(如 NaiveRAG 的失败案例中 12/20 是检索不到目标证据)。

LLM-as-a-Judge

用一个强 LLM 代替人工评分:把问题、参考答案、模型预测(有时加上相关证据)一起输入裁判模型,让它输出对错判断或分数。本文文本版使用 Qwen3.5-397B-A17B 做裁判,多模态版使用 Qwen3-14B,后者在 1,320 个抽样样本上与人工评估达到 80.7% 的一致率。

MobileMem 的答案是开放式生成文本,无法用精确匹配评分,两张主表的分数全部来自该协议;理解其原理和一致率上限(约八成),才能正确解读实验数字的可信度与名次差距的意义。

多模态大模型与截图感知

多模态大模型(MLLM)能同时处理文本与图像输入。在移动记忆场景,一种主流做法是周期性截屏,让 MLLM 从连续界面变化中推断用户行为,代表系统有 MRIXI 和 MineContext;本文的 MobileMem-Omni 则采用另一种设定:用户主动向助手分享重要交互的截图,需要系统具备细粒度视觉语义理解与跨模态检索能力。

MobileMem-Omni 的 19,060 张合成图像和'视觉推理'题型都建立在这一背景之上;不熟悉截图感知路线,就看不出本文'应用主动上报事件 vs 被动截屏观察'这一对比的针对性,也理解不了视觉记忆点、HTML 模板渲染截图等合成设计。

黑板架构与认知卸载

黑板架构是经典 AI 协作模式:多个专用知识源读写一块共享工作区,由控制器调度求解任务。认知卸载指把部分认知负担转移给外部工具存储与处理。本文借用这两个概念描述设备端记忆生态:系统级记忆层充当黑板,存储全局用户状态、跨应用偏好与行为抽象;各应用充当知识源并按标准化协议上报/供查,相当于为系统记忆做'认知卸载'。

这是论文提出的核心系统愿景(Figure 3),也是两个评测场景的理论出发点——MobileMem 对应'应用通过模板主动上报'的简化版,MobileMem-Omni 对应'应用独立、用户分享截图'的更通用设定。

研究动机

现有智能体记忆研究几乎都建立在云端假设上:无限存储、集中式数据库、云端算力。但下一代智能体的真实落点是手机、AR 眼镜、耳机、可穿戴与车载助手,这些设备每天产生数千条事件、数百张图片、长视频和连续语音流,很快压垮有限的存储与带宽,造成'记忆爆炸'。更麻烦的是数据天然碎片化:聊天记录、相册、笔记、购物、出行分散在不同应用和模态中,缺乏统一语义结构,重要记忆常以'跨应用、跨模态事件'的形式存在;同时用户兴趣、习惯与情境持续演化,记忆系统必须识别过时信息、吸收新经验而不发生灾难性遗忘;设备端还受存储、功耗、延迟与算力的硬约束;把高度敏感的个人数据上传云端又有严重隐私风险。而现有长期记忆基准主要基于人与助手的对话,无法覆盖这种异构、多模态、持续演化的移动场景;即便像 MRIXI、MineContext 那样用周期截屏扩大可观测范围,也只是把应用当作被动观察对象,从噪声界面信号重建高层行为,带来冗余、隐私风险和大量处理开销。

本文的目标是本文要为'设备端长期记忆'建立可复现的评测基础设施。具体目标有三:其一,构建一年尺度的移动经验数据基础,并设计知识引导的合成流水线 KEME,从用户先验知识(人物画像、时间约束、知识锚点)自动生成时间一致、随用户状态演化的长程交互轨迹;其二,提供两种互补的评测场景——文本版 MobileMem(应用通过预定义模板向系统级助手上报记录创建事件)与多模态版 MobileMem-Omni(应用独立运行,用户向助手分享重要交互的截图),覆盖多跳推理、时间推理、知识更新、隐式偏好推断与拒答(abstention)等核心能力;其三,让评测贯穿'记住过去、理解现在、适应未来'的完整记忆生命周期:考察系统能否把碎片事件转化为连贯的情景/语义表示,并随用户情境演化而持续更新,为下一代移动个人助手的研究与产业基准化提供标准化的数据模式、题型分类、评测指标与版本管理。

与已有工作不同的是,本文的独特切入有两点。第一是系统观:作者不再把记忆层看作单体数据库,也不走截屏感知路线,而是注意到'许多应用本身就是专门的记忆系统'——浏览器维护带时间戳、支持关键词检索的历史(类似 BM25 记忆库),记账应用把流水持续聚合为月度收支统计(类似记忆固化过程)。由此提出双层记忆生态:系统级记忆层以黑板架构沉淀跨应用的用户全局状态,应用级记忆层以认知卸载方式过滤、结构化本域事件,二者经标准化协议协作,且用户与开发者可自定义信息交换边界。第二是数据观:真实的长程多模态轨迹采集昂贵且涉及隐私,直接让 LLM 编造用户数据又多样性差、缺乏个性化。KEME 选择第三条路——以结构化先验知识为锚,交替进行自顶向下的时间规划与自底向上的经验演化,把真实采集的应用会话作为不可变的'知识锚点'嵌入合成轨迹,同时自底向上合成需要跨事件、跨时间推理的多跳 QA,兼顾真实性、时间一致性与个人化。

核心方法

直觉上,与其让 LLM 一次性生成一整年的用户数据(必然前后矛盾、千篇一律),不如先建立“用户先验知识”作剧本大纲,让具体经验在大纲约束下逐步生长,已写成的情节再反过来修订未写的大纲。技术路线是四模块流水线(Figure 4):先验知识构建→轨迹合成→QA 合成→质量控制。KEME 把合成形式化为两阶段:由初始画像 $P_{\mathrm{start}}$、知识锚点集合 $\mathcal{K}$ 与时间区间生成长程演化轨迹 $\mathcal{T}$,再基于轨迹、题型体系与最终画像合成问答对 $\mathcal{Q}$。落地为两个基准:文本版由 GPT-5.2 驱动,基于 2 名志愿者的访谈画像与 OPPO 手机脱敏使用统计,围绕账单、录音、截屏备忘、文档、笔记、日历、待办七类应用模板合成用户-应用会话作锚点;多模态版由 GPT-5.1 驱动简化版 KEME,含 16 名用户(中英各 8)、1,589 个事件、19,060 张合成图像、7,415 条 QA,人均上下文约 1.72M tokens。

核心创新是“知识锚点+时间事件图+画像演化”的闭环合成:轨迹不是静态拼装,而是在锚定知识与已有经验的双重约束下增量展开、持续修订。KEME 用递归时间事件图 $G=(V,E)$ 组织人生经历:规划器 $\mathcal{A}_{\mathrm{plan}}$ 自顶向下把粗粒度生活事件细分为子事件图直至会话;接地器 $\mathcal{A}_{\mathrm{ground}}$ 把真实采集的会话分配给时间区间完全覆盖它的事件节点,无相容节点则修改事件图,锚点内容摘要为“相容性上下文”向下传播为非矛盾约束,保证真实数据不可变保留、合成对话不与之冲突;实现器 $\mathcal{A}_{\mathrm{realize}}$ 在叶节点生成会话并触发画像更新——画像表示为带版本历史和消息级证据链接的维度化属性,只有被消息引用才算“有证据揭示”;修订器 $\mathcal{A}_{\mathrm{revise}}$ 每次展开后增删改未来事件,形成“展开-修订”交替的自底向上反馈环。QA 合成同样自底向上:从叶子的单跳问题出发,逐层以子问题为积木组合出跨会话、跨维度的多跳问题。

方法步骤详情

第一步,先验构建:访谈收集画像;从志愿者手机只采集应用使用统计与元数据,按七类应用模板 few-shot 生成内容并设定主题、时间与字数分布;消息间隔超两天即切分新会话;Omni 版另抽取社交关系图并生成人物头像。第二步,轨迹合成:四个 agent 协作——规划器 $\mathcal{A}_{\mathrm{plan}}$ 递归展开事件图,接地器 $\mathcal{A}_{\mathrm{ground}}$ 把锚点分配给时间相容的事件节点,实现器 $\mathcal{A}_{\mathrm{realize}}$ 生成会话(有锚点直接采用,否则合成人-助手对话)并链接证据、更新画像,修订器 $\mathcal{A}_{\mathrm{revise}}$ 增删改未来事件。超参:最大深度 2、每图 2–15 个事件、每事件最多 1 个锚点、上下文上限 8,000 tokens。第三步,QA 合成:自底向上遍历层级树,未用子问题随机采样 10 个向上传播,初始题型七类可扩展。第四步,质量控制:人工抽查轨迹;图像经 MLLM 过滤与 InsightFace 人脸校验;QA 验证证据充分性并去重。Omni 版简化:链式事件图、省略反馈环,每会话先产对话目标与文本/视觉记忆点,图像用 HTML 渲染、头像合成或文生图生成。

技术新颖性

技术新颖性体现在四个层面。其一,评测对象新:这是首个把'应用即记忆系统'的生态视角形式化为基准的工作,模板上报(MobileMem)与截图分享(MobileMem-Omni)分别对应双层生态的两种简化实现,区别于 LoCoMo、LongMemEval 等纯对话式记忆基准,也区别于 MRIXI 式被动截屏感知。其二,合成机制新:知识锚点让真实数据成为不可变的事实锚,同时化解纯合成数据失真与真实采集隐私风险的两难;'自顶向下规划 + 自底向上修订'的交替循环和带证据链接的画像版本史,使百万 token 级轨迹保持时间一致性——人工抽检仅发现少量可解释的数值噪声。其三,QA 构造新:问题不是事后套模板生成,而是沿事件层级自底向上组合,天然携带跨会话证据结构,且题型分类体系可在合成中自我扩展。其四,可复用性新:KEME 只需修改全局系统提示,就能围绕既有 QA 合成'更短但更难'的对抗轨迹(实验中使 NaiveRAG 的 top-5 准确率从 40% 跌至 20%),为记忆检索研究提供了制造 hard negatives 的通用工具,用途超越单一基准本身。

The position of MobileMem in the envisioned on-device memory ecosystem, with a two-layer composite architecture and an information exchange protocol between them.
Figure 3: The position of MobileMem in the envisioned on-device memory ecosystem, with a two-layer composite architecture and an information exchange protocol between them.
Overview of the data synthesis framework. The KEME framework progressively synthesizes long-horizon interaction trajectories and QA pairs from user prior knowledge, with quality control applied throughout the pipeline.
Figure 4: Overview of the data synthesis framework. The KEME framework progressively synthesizes long-horizon interaction trajectories and QA pairs from user prior knowledge, with quality control applied throughout the pipeline.

实验结果

一、文本版(Table 1):双骨干评测 9 种记忆系统,A-MEM(79.68)与 HippoRAG2(78.85/80.06)大幅领先,Long Context 仅 54.51/45.19,NaiveRAG 37.23,LangMem 低至 24.79;MemOS 换 GPT-5.4-mini 提升最明显(65.88→74.00)。性能随证据数递减:单跳>多跳>摘要;时间推理普遍薄弱;最弱的 LangMem 反而在对抗题最好(76.42),因强系统检索出弱相关高干扰记忆而过度自信;A-MEM 换新骨干后 token 成本翻倍至 11,170k。错误分析(Figure 5,各抽 20 例):Long Context 13/20 是更新错误,NaiveRAG 12/20 是检索失败,Mem0 是抽取漏掉应用消息,EverMemOS 多败在答案生成——答案是共同瓶颈。二、KEME 难例合成(Figure 6):围绕 LongMemEval 10 题重造更短更难的轨迹,NaiveRAG top-5 40%→20%、EverMemOS 90%→80%,证据归一化排名恶化 10.63 个百分点,难度来自干扰项布局而非轨迹变长。三、多模态版(Table 4):EverMemOS+GPT-5.4-mini 最佳(39.41%),LightMem 33.8% 次之且更省;多模态长上下文视觉推理 21.9% 远超 caption 版 12.16%;拒答题普遍低于 20%;中文落后英文,短期事件最难。

End-to-end task performance and token cost (in thousands) of memory systems. We evaluate each method with two LLM backbones, GPT-4.1-mini and GPT-5.4-mini.
Table 1: End-to-end task performance and token cost (in thousands) of memory systems. We evaluate each method with two LLM backbones, GPT-4.1-mini and GPT-5.4-mini.
Trajectory diversity under varying profile schema granularity. Values are averaged across three seed persons and five length-matched sampling rounds.
Table 2: Trajectory diversity under varying profile schema granularity. Values are averaged across three seed persons and five length-matched sampling rounds.
Statistical Overview of MobileMem-Omni.
Table 3: Statistical Overview of MobileMem-Omni.
Question-answering performance of methods on MobileMem-Omni. Scores for task columns are evaluated using LLM-as-a-Judge.
Table 4: Question-answering performance of methods on MobileMem-Omni. Scores for task columns are evaluated using LLM-as-a-Judge.
Distribution of error types across four memory systems. We randomly sample 20 failure cases from each system for error analysis.
Figure 5: Distribution of error types across four memory systems. We randomly sample 20 failure cases from each system for error analysis.
Hard-distractor synthesis with KEME. (a) The top table compares average accuracy (%) across two memory systems on the original LongMemEval trajectories and the KEME-synthesized trajectories. (b) The bottom-left panel shows the trajectory length distribution measured by the number of messages. (c) The bottom-right panel visualizes the rank change of source evidence under semantic-similarity-based ranking with NaiveRAG.
Figure 6: Hard-distractor synthesis with KEME. (a) The top table compares average accuracy (%) across two memory systems on the original LongMemEval trajectories and the KEME-synthesized trajectories. (b) The bottom-left panel shows the trajectory length distribution measured by the number of messages. (c) The bottom-right panel visualizes the rank change of source evidence under semantic-similarity-based ranking with NaiveRAG.
Existing memory methods are slow and resource-intensive, hence unsuitable for on-device scenarios.
Figure 7: Existing memory methods are slow and resource-intensive, hence unsuitable for on-device scenarios.
LLM-Judge changes in NaiveRAG: captions improve visual reasoning but degrade other text-oriented questions.
Figure 8: LLM-Judge changes in NaiveRAG: captions improve visual reasoning but degrade other text-oriented questions.
Radar chart of event type LLM-Judge performance (%). Events are divided by interaction language: Chinese, English; and by event span: short-term, medium-term, long-term.
Figure 9: Radar chart of event type LLM-Judge performance (%). Events are divided by interaction language: Chinese, English; and by event span: short-term, medium-term, long-term.
查看结构化数据
任务指标本文基线提升
文本记忆问答(MobileMem 总体) LLM-as-a-Judge 准确率(%) A-MEM 79.68(GPT-4.1-mini);HippoRAG2 80.06(GPT-5.4-mini) Long Context 54.51 / 45.19;NaiveRAG 37.23 / 37.45 较最强朴素基线 Long Context 高约 25–35 个百分点,较 NaiveRAG 高逾 40 个百分点
多模态记忆问答(MobileMem-Omni 总体) LLM-Judge(%) EverMemOS 39.41(GPT-5.4-mini) Long Context 19.14;Qwen3-VL-8B 下 EverMemOS 仅 24.76 较长上下文基线 +20.27 个百分点,凸显专用记忆框架价值
视觉推理(MobileMem-Omni) LLM-Judge(%) 多模态长上下文 21.9(GPT-5.4-mini)/ 13.5(Qwen3-VL-8B) caption 版长上下文 12.16 / 6.78 约 +7~10 个百分点,直接看图远胜文字转述
拒答/Abstention(MobileMem-Omni) LLM-Judge(%) 最佳约 24.44(多模态 M2A) 多数文本方法 4–20(如 EverMemOS 7.04、Mem0 7.12) 负向结论:所有方法普遍不及格,暴露'不会说不知道'的领域共性短板
KEME 对抗轨迹(基于 LongMemEval 10 题) top-5 检索后答对率(%) KEME 合成轨迹:NaiveRAG 20.00 / EverMemOS 80.00 原始 LongMemEval 轨迹:NaiveRAG 40.00 / EverMemOS 90.00 定向制造难度:轨迹更短但准确率下降 10–20 个百分点,证据归一化排名平均恶化 10.63 个百分点

局限与改进

作者承认三点局限:合成数据虽经多级质检仍难免噪声与不一致;用户建模仍较粗糙,难以刻画偏好、习惯与目标的完整动态演化;所评记忆系统与 LLM 尚不代表最先进的个人智能体水平。我补充几点观察:其一,样本量小——文本版仅 2 名志愿者、Omni 版 16 名用户(其中 8 名为 LLM 生成的虚拟人),用户分布窄,结论普适性有限;其二,评测依赖 LLM 裁判,Omni 版与人工一致率仅 80.7%,意味着约五分之一判断可能含噪声,而 Table 1 中前两名(80.06 vs 79.68)的差距完全落在噪声区间内,名次不宜过度解读;其三,作者自认部分多跳题是两个可独立回答的单跳题的组合拼装,提问不够自然;其四,动机反复强调设备端约束,但实验只报 token 成本这一代理指标,未度量延迟、存储占用与端侧小模型表现;其五,双层记忆生态只是愿景,基准把场景简化为模板上报或截图分享,并未真正评测跨应用协调检索能力;其六,拒答题的超低分部分源于开放式生成评分协议,与'能力不足'混在一起,难以剥离。

独立分析的弱点

独立分析五个弱点。1)合成-真实分布差距:即便有知识锚点兜底,LLM 生成的对话语气、事件密度与时间规律和真实手机使用仍有系统性差异,榜单名次未必迁移到真实设备日志;改进方向是引入更大规模的真实锚点数据做在线 A/B 校准。2)裁判噪声影响排序:单裁判协议下 0.4 个百分点的领先不足为凭;改进方向是多裁判投票加关键子集人工复核,或发布带人工标注的校准子集。3)缺设备约束维度:论文反复强调存储/功耗/延迟约束,实验却只有 token 成本;改进方向是增加端侧量化小模型、内存峰值与首字延迟基准,形成'能力-效率'双轴评测。4)语言与人群覆盖不足:中英各 8 人且观察到中文系统性落后,但未分析根因究竟在分词、检索器跨语言对齐还是记忆抽取提示词偏英文;改进方向是补齐多语言检索诊断实验。5)知识更新与时间推理的评分粒度不够细:未区分'记住旧值''记住新值'与'记住变化过程',难以定位记忆覆盖/合并策略的具体缺陷;改进方向是引入带时间戳证据链的细粒度诊断指标。此外,开源版本是否包含全部合成提示词与质检脚本,直接影响第三方重建数据的可比性。

未来方向

作者规划的方向包括:扩展音频、视频与传感器模态以贴近真实移动使用;建立在线评测协议以持续评估演化中的记忆系统;用更先进的合成技术强化隐私保护;针对记忆构建、检索、更新与答案生成各阶段的不同瓶颈(如 Figure 5 揭示的差异化失败模式)研发针对性方案;把记忆源扩展到可穿戴、平板、PC、智能家居与车载,形成生态级终身记忆评测;扩大多语言覆盖与用户群体多样性;引入长期规划、协作记忆、持续个性化与跨模态知识整合等更难推理任务。基于其成果还可延伸:用 KEME 批量生成带证据链的训练数据,对记忆构建与更新做 SFT 或强化学习训练;把双层生态的标准化协议具体化为操作系统级接口规范并在真机上试点;沿 LightMem 的思路研究 token 高效记忆以满足端侧预算;为拒答能力设计'证据充分性校验 + 不确定性校准'的记忆架构;并利用 KEME 的对抗轨迹合成能力建设持续演化的 hard-negative 测试集,形成动态'打榜'机制。

复现评估

复现评估:代码与数据已在 GitHub 开源(zjunlp/MobileMem),直接使用基准门槛较低——评测侧只需编排若干 API:文本版用 Qwen3-Embedding-4B 检索(固定 30 条)、GPT-4.1-mini/GPT-5.4-mini 做骨干、Qwen3.5-397B-A17B 做裁判;Omni 版用 all-MiniLM-L6-v2、检索 $K=15$、Qwen3-14B 做裁判(与人工一致率 80.7%)。但完整复现数据合成较难:文本版依赖 GPT-5.2、Omni 版依赖 GPT-5.1 驱动的多 agent 流水线,Omni 人均 1.72M tokens 的轨迹加上 19,060 张图像的生成与质检重试(Seedream 为主、InsightFace 人脸校验),API 成本预计达数百至数千美元量级,且闭源模型版本更替会影响产出。真实志愿者数据经匿名化脱敏,原始采集不可复现,但流水线允许用 PersonaHub、OPeRA 等公开画像数据替换先验来源。总体:跑基准评测为中等难度(多 API 编排),从零重建数据集为较高难度(成本高+闭源依赖)。