← 返回 2026-08-06

FocusMem:潜空间 GUI 记忆中内容、读出与信任的解耦 FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang 📅 2026-08-05 👍 13 2026-08-11 18:30
GUI 智能体 信任门控 冻结策略训练 潜空间记忆 状态条件读出 记忆压缩

把潜空间 GUI 记忆拆成内容、读出、信任三职责,冻结策略下五个基准平均涨近 20 点。

前置知识

GUI 智能体的两类记忆

GUI 智能体通过点击、输入、滚动完成网页或 App 任务,需要在两个时间尺度记东西:情节记忆保留已完成任务里可复用的经验(如『打开商品页才能读属性』),工作记忆保留当前这一轮交互里已完成的进度和未完成的约束(如『刚查到 A 价格,还要查 B』)。

本文整个框架就建立在『这两种记忆职责不同、不能塞进同一个固定潜块糊在一起』这个核心判断上,角色感知内容基的全部设计都围绕它展开。

潜空间记忆压缩(Q-Former)

完整多模态轨迹(截图+动作)塞回策略上下文会迅速撑爆 token 预算。潜空间压缩用一组可学习连续 query token,通过交叉注意力把整条轨迹读成 K 个连续向量(本文 K=8),再投影到策略嵌入维度,作为连续前缀拼到输入前面。

本文所有创新都在这 K 个 token 的瓶颈接口内部做文章——什么该被压进去(content)、什么该被读出来(readout)、什么该被放行(trust),理解这个瓶颈才能看懂三个职责为什么要解耦。

冻结策略 + 适配器训练

GUI 策略(Qwen3-VL-8B)和 grounding 模型全程冻结,只训练记忆通路(编码器、Q-Former、读出适配器、信任门),压缩主干用 LoRA(r=64、α=16,约 174.59M 参数)。这样既复用强基座,又把改善完全归因于记忆机制本身。

理解这点才能看懂为什么作者反复强调『收益来自记忆怎么形成、怎么适配、怎么控制,而不是来自更强的策略』,也才能理解主结果里完全匹配的 Action-only Fixed 对照为什么关键。

知识蒸馏与 KL 散度

语义监督用 KL 散度把冻结策略看到原始轨迹时的下一个 token 分布蒸馏到只看到压缩潜块时的分布,公式 $\mathcal{L}_{sem}=\sum_{i,j}D_{KL}^{sg[p^{raw}]}[p^{lat}]$,stop-gradient 锁教师侧。比硬标签保留更完整的软分布信息。

这是 Content Basis 阶段让潜块『内容可恢复』的核心监督信号之一,看懂它才能理解 content probe 表里为什么语义监督和功能监督是互补的、缺一不可。

HardConcrete 稀疏门控

信任门要做保留/丢弃这种不可微的二值决策。HardConcrete 用连续松弛在训练时给可微梯度(配 straight-through 直通估计),推理时用阈值 $\sigma(g_{t,i})>\gamma=0.3$ 做硬判决,被拒块从策略注意力里移除。

这是第三个职责『证据信任』的实现方式,理解它才能看懂为什么门监督的梯度被显式截断在潜块处(stop-gradient),不让它污染内容基。

研究动机

现有 GUI 潜空间记忆方法把每条检索到的轨迹一刀切映射成一个固定的、与决策状态无关的潜块,而且几乎只用『下一个动作』这一种监督来训练它。这带来三个实际失败模式,论文 Figure 1 用一个购物任务把它们串起来讲:第一,内容不可恢复——压缩瓶颈会把关键细节丢掉,比如比较 A、B 两个产品价格时,A 的 5 美元价格被压没了,只剩 B 的 10 美元;第二,固定读出不匹配不同决策阶段——同一条轨迹在不同步骤需要暴露不同信息,但同一个潜块要同时服务『搜索』『比较』『加入购物车』所有阶段,必然顾此失彼;第三,检索回来的轨迹不能全信——一个检索到的情节记忆可能整体看似合理但与当前任务不兼容(比如它是『加购物车』的经验,但你现在该做的是『搜索』),强行塞进策略反而误导。这三个问题在 web 导航这类长程、多决策阶段任务里尤其致命,而且它们在潜空间里没法靠外部改写或丢弃来补救。

本文的目标是作者的目标是在不改动冻结的 GUI 策略(Qwen3-VL-8B)前提下,设计一个紧凑的潜空间记忆接口,让它同时解决『什么内容在压缩后仍可恢复』『同一份证据在当前决策下该暴露哪一部分』『这份证据到底该不该影响策略』这三个之前被混为一谈的职责,并且在五个标准 GUI 基准上稳定超过固定动作基线和已有潜空间记忆方法。更进一步,他们希望用定向诊断(content probe、oracle 扩展、污染实验)证明每一点收益确实来自对应的机制,而不是简单地堆更多轨迹或换个更强策略。

与已有工作不同的是,已有工作的切入角度都把这三个问题笼统当作同一种『记忆选择』问题:文本记忆靠改写、选择、丢弃人读得懂的记录;CoMEM 只编码情节记忆;Mem-W 用一个固定压缩器同时压情节和工作记忆,但查询共享、不做信任控制。本文的独特切入在于指出:在潜空间里,内容恢复性、状态条件读出、证据信任是三个正交的、不可互换的职责,必须在这个紧凑连续接口内部显式解耦学习,而不能靠外部检索或文本改写来凑。作者用『what is retained / what is exposed / what is allowed』这个三分框架把问题重新形式化——这是和已有方法最本质的区别,也是后续三个机制设计的理论支点。

核心方法

整体思路三步走:先把记忆『存对』(内容可恢复),再『读对』(按当前决策状态读出),最后『信对』(决定要不要用),三步都发生在同一个 K=8 token 的潜块接口里,策略全程冻结。每个记忆证据(情节轨迹或工作历史分块)先经共享的证据编码器和 Q-Former 压成潜块;Stage A 用角色感知的内容基(语义 KL 蒸馏加角色专属功能监督)让情节块留住可复用经验、工作块留住进度,得到与决策无关的固定读出 $Z_i^{fixed}$;Stage B 启用一个零初始化的轻量状态-证据适配器,生成残差查询 $\Delta Q_{t,i}=A_\eta(u_t,\mathrm{Pool}(H_i),e_{r_i})$,让同一证据在不同决策状态产出不同的 $Z_{t,i}^{dynamic}$;再接一个块级信任门 $g_{t,i}=T_\xi(u_t,\mathrm{Pool}(Z_{t,i}^{dynamic}))$,按阈值 $\gamma=0.3$ 用 HardConcrete 掩码决定放行。被接受的块拼到冻结策略上下文前面预测动作。

核心创新是把『记忆选择』这个笼统概念分解成三个互不重叠的职责,每个职责配一个独立可训练的子模块,而它们共享同一个潜块载体。和已有方法的本质区别有三处:其一,Mem-W 等共享同一组查询给情节和工作记忆,FocusMem 给两种角色各配独立基查询 $Q_{r_i}^0$ + 角色嵌入 $e_{r_i}$,让『压什么』受角色控制;其二,已有方法的潜块是决策状态无关的固定映射,FocusMem 用状态条件残差查询让『同一证据在不同步骤读出不同内容』,残差零初始化保证从 Stage A 平滑起步、不崩溃;其三,已有方法默认检索回来的就直接用,FocusMem 加了一个独立的、梯度被截断在潜块外的信任门,只学『用不用』、不学『压什么』,并用注入的无关负样本 $\mathcal{L}_{gate}=-\sum_{i\in N_t}\log(1-\sigma(g_{t,i}))$ 显式训练它学会拒绝。

方法步骤详情

第一步构造证据:情节证据用固定检索器对 episodic bank(25,737 条)做 top-M=3 余弦检索,每条完整轨迹是一个 item;工作证据把当前 episode 的过期前缀按每块 W=4 个交互事件切分,两种来源各至多 3 个 item。第二步共享编码压缩:每个 item 经编码器得 $H_i$,Q-Former 用 K=8 个 query 做掩码交叉注意力,输出 $C_\Phi(s_i;Q)\in\mathbb{R}^{K\times d}$ 的潜块。第三步 Stage A 训内容基:用角色专属基查询得 $Z_i^{fixed}$,最小化语义 KL、功能 QA 和动作模仿损失 $\mathcal{L}_A$。第四步 Stage B 训读出和门:适配器生成残差查询得 $Z_{t,i}^{dynamic}$,信任门打分,用注入负样本训门、用动作损失 $\mathcal{L}_B$ 端到端调通路。第五步推理:阈值 $\gamma=0.3$ 过门,被接受的块拼到冻结策略上下文前面预测动作,策略不动。门监督梯度在潜块处截断,不污染内容。

技术新颖性

技术新颖性体现在三处工程与算法设计的耦合上。首先是『角色感知内容基』——用语义 KL 把广义可言语化内容蒸馏进潜块,用四个角色专属功能 QA 子型(情节的摘要+锚点决策、工作的最新状态+观察变化)做功能监督,论文用 content probe 证明两者互补且缺一不可:单用语义在泛化重建上强、单用功能在角色对齐和迁移查询上强,合在一起三个指标都最优。其次是『状态条件读出的零初始化残差设计』——$\Delta Q$ 从零起步,保证 Stage B 初期行为等于已训好的 Stage A,再渐进引入决策依赖,这避免了从头学状态条件导致崩溃,也是『动态读出不是无条件更好、而是在证据要和无关内容竞争有限预算时才显优势』这一结论的方法基础。第三是『信任门梯度隔离』——门监督的梯度在 $Z_{t,i}^{dynamic}$ 处 stop-gradient,让门只学使用模式、不干扰内容;正样本信号完全来自端到端动作损失,负样本靠显式注入的无关情节轨迹。这套设计让三个职责各自独立优化、互不污染。

FocusMem retrieves complete episodic trajectories, segments expired working history, and encodes each evidence item once.
Figure 2: FocusMem retrieves complete episodic trajectories, segments expired working history, and encodes each evidence item once.

实验结果

主结果(Table 1)FocusMem 在五个基准 Overall 48.3 最高。最关键的对照是完全匹配的 Action-only Fixed:FocusMem 在 MMInA-Wiki/Shop、DeepShop、WebVoyager、Online-Mind2Web 上分别 +10.8、+13.5、+18.0、+17.0、+13.9,最大两个提升在 DeepShop 和 WebVoyager——印证状态条件读出在长程任务的价值。对比最强已有方法 Mem-W-style(Overall 42.5)每个基准都领先 +4.5~+8.0;比 No Memory(28.5)涨近 20 点,比 Retrieved Full Trajectory(33.2)高约 15 点——后者反而更差,说明瓶颈在怎么用而非给更多上下文。消融显示 Fixed/Content/Readout/Gate 累加各 +4.5/+5.0/+4.0/+4.5 点,三组件贡献相近、无单一机制吃掉全部收益。诊断侧:content probe 证语义加功能监督互补最优;污染实验里完整 FocusMem 比无门强 9–11 点。

Interactive task success rate (SR; evaluated by Gemini-3.1-Pro).
Table 1: Interactive task success rate (SR; evaluated by Gemini-3.1-Pro).
Cumulative component ablation.
Table 2: Cumulative component ablation.
Content-basis recoverability after Stage B.
Table 3: Content-basis recoverability after Stage B.
Oracle-centered evidence expansion on 100 WebVoyager decisions.
Figure 3: Oracle-centered evidence expansion on 100 WebVoyager decisions.
Evidence-dependence and episodic-contamination diagnostics.
Figure 4: Evidence-dependence and episodic-contamination diagnostics.
查看结构化数据
任务指标本文基线提升
五个 GUI 基准平均任务成功率 Overall SR (%) 48.3 Action-only Fixed 33.7 / No Memory 28.5 较 Action-only Fixed +14.6,较 No Memory +19.8
MMInA-Wikipedia SR (%) 65.3 Action-only Fixed 54.5 +10.8
MMInA-Shopping SR (%) 59.0 Action-only Fixed 45.5 +13.5
DeepShop SR (%) 48.7 Action-only Fixed 30.7 +18.0(最大增益)
WebVoyager SR (%) 39.6 Action-only Fixed 22.6 +17.0
Online-Mind2Web SR (%) 28.9 Action-only Fixed 15.0 +13.9
MMInA-Shopping 累加消融(完整 FocusMem) SR (%) 59.0 No Memory 41.0 +18.0(Fixed +4.5 / Content +5.0 / Readout +4.0 / Gate +4.5)

局限与改进

作者承认的局限有三:第一,主要在冻结的 Qwen3-VL-8B 上、只跑 web 基准,迁移到别的基座和移动端、桌面端环境还没验证;第二,信任诊断只用了『注入无关情节轨迹』这一种粗糙的负样本,没覆盖更隐蔽的不匹配(比如部分相关、跨任务语义相近但动作不兼容)以及工作记忆的陈旧问题;第三,所有分数都靠 Gemini-3.1-Pro 判,虽然用 method-blind 固定 prompt 降低裁判偏差,但并不能消除。我自己的观察补充几点:一是整套 pipeline 重度依赖 Gemini-3.1-Pro 做数据筛选、轨迹评分、成功判定,裁判与策略生态同源可能有系统性倾向;二是 episodic bank 含同域示踪轨迹,因此 No Memory 只是『系统级参考』,外部真正迁移时 bank 怎么建没说清;三是所有结果都是单次 rollout,没有方差和显著性报告,几个 +4~5 点的组件增益落在噪声范围内是否稳健存疑;四是 K=8、M=3、W=4 这些关键超参的敏感性曲线没给,只报告一组最优值。

独立分析的弱点

弱点一:信任门只能拒『整块』记忆,粒度太粗。一条检索轨迹里可能既有可复用的程序又有不兼容的具体数值,一刀切丢弃会损失有用部分。改进方向是把门细化到 token 级或子段级,做软加权而非硬二值决策。弱点二:状态条件读出依赖冻结策略的 pooled 表征 $u_t=\mathrm{Pool}(F_\theta(c_t))$ 作为唯一条件信号,对截图语义理解强的策略才有效;换到弱基座时 $u_t$ 质量差,读出适配器可能学不出有意义的残差。改进方向是引入显式的任务/阶段编码或动作历史摘要作为额外条件信号。弱点三:检索器固定且与记忆通路解耦训练,检索错的东西再聪明的门也救不回来(污染实验里 Working-Only 在 100% 污染时反而最稳就是旁证)。改进方向是让检索与记忆联合优化,或在门拒绝时触发重检索。弱点四:只压成统一 K=8 token,长轨迹和短轨迹用同样预算浪费严重。改进方向是自适应 token 预算或层级压缩。弱点五:训练需要 23,438 条高质量同域轨迹,数据成本高、跨域冷启动困难——可结合合成轨迹或无监督自蒸馏缓解。

未来方向

作者提出的方向集中在迁移:换更强或更弱的策略基座、迁移到移动端和桌面 GUI、把信任诊断扩展到更隐蔽的不匹配和陈旧工作记忆。基于本成果我认为可延伸的方向有四条:第一,把『内容恢复性、状态条件读出、证据信任』这套三职责框架推广到非 GUI 的长程 agent(机器人操作、工具调用、多轮对话记忆),那里同样存在『同一条经验在不同阶段有用、不相关经验会误导』的问题,LaMem-VLA、MemoryVLA 这类机器人记忆工作可直接套用。第二,信任门目前只学『用不用』,可扩展成『信多少』的连续可信度,与不确定性估计结合做贝叶斯式记忆融合。第三,状态条件读出本质上是一种轻量 cross-attention 适配,可探索用 MoE 给不同决策阶段配专家读出头。第四,把 content probe、oracle 扩展、污染实验这套诊断方法论标准化,变成潜空间记忆的通用评测协议——目前这个领域最缺的就是这种能定位收益来源的细粒度评测。

复现评估

复现门槛中等偏高。有利因素:作者公开 GitHub 仓库(github.com/stanley-ju/FocusMem)和全部训练超参(Stage A/B 学习率 $1\times10^{-5}$/$5\times10^{-6}$、batch 32、$\gamma=0.3$、K=8、M=3、W=4),可训练参数量写清(Q-Former LoRA 约 174.59M),数据流程和裁判 prompt 都附附录。难点在于:一是算力——训练用 8×RTX PRO 6000 Blackwell(约 768GB 显存),普通实验室复现训练有压力,但推理评估(vLLM、32K 上下文)单卡 8B 可行;二是数据——episodic bank(25,737 条)和训练集(23,438 条)依赖 MolmoWeb 轨迹加 Qwen3.6-27B rollout,需重跑 rollout 和三级泄漏过滤;三是基线是 -style 重实现而非原仓库直接跑,跨组复现有主观空间;四是评估锁定 Gemini-3.1-Pro 裁判,换裁判数字会变。代码加配置可复现,但数据重建和裁判一致性是主要障碍。