← 返回 2026-07-21

SeerGuard:基于世界模型预测的移动 GUI 智能体安全框架 SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng 📅 2026-07-17 👍 25 2026-07-25 18:30
世界模型 动作风险评估 智能体安全 移动GUI智能体 视觉语言模型

用世界模型预测动作后果,在执行前拦截移动端高风险操作。

前置知识

移动 GUI 智能体(Mobile GUI Agent)

能感知手机/平板图形界面、并自动操作 UI 元素(点击、输入、滑动)来完成多步任务的自主智能体,通常由视觉语言模型驱动,如 UI-TARS、AutoGLM。它运行在真实设备而非沙盒里,每个操作都会改变真实系统状态。

本文的研究对象就是这类智能体的安全问题,理解它们与真实系统的交互方式,才能明白为什么单次误操作会造成不可逆后果。

世界模型(World Model)

智能体对环境动力学的内部模型,能不经过真实交互就预测动作会导致怎样的状态变化,从而支持规划与策略优化。本文的语义世界模型专门预测「下一屏的功能状态文本描述」而非像素,并把这种预测用于安全审计。

SeerGuard 的核心思想是把世界模型从「提升成功率」的规划工具,重新定位为「执行前预判风险」的安全工具,这是全文的方法论基础。

视觉语言模型(Vision-Language Model, VLM)

能同时理解图像和文本的多模态大模型(如 Qwen3-VL、GPT-5.1、Gemini-3.1),既能看懂 GUI 截图,又能生成动作指令和自然语言理由。SAWM 正构建在 Qwen3-VL-8B-Instruct 之上。

移动 GUI 智能体和它的安全护栏都依赖 VLM,理解 VLM 的多模态推理与自回归解码,才能看懂 SAWM 如何同时输出状态预测与安全判断。

提示注入(Prompt Injection)

攻击者把恶意指令伪装成界面内容(如帖子里的 Buy),诱导智能体把它当成合法用户命令执行,从而触发未授权操作。这是移动 GUI 智能体面临的高危攻击之一。

论文的关键案例和评测集都围绕提示注入,理解它才能体会「指令级筛查」无法捕获、必须靠「动作级后果预判」才能拦截的那类上下文相关风险。

监督微调(Supervised Fine-Tuning, SFT)

在预训练模型基础上,用带标注的(输入,输出)样本继续训练,让模型学会特定任务。本文把状态预测和风险评估统一成一个 SFT 多任务,并刻意只训练 1 个 epoch、用极低学习率以防止灾难性遗忘。

SAWM 的能力来源于多任务 SFT,理解训练数据配比与正负样本比例如何影响安全性与可用性,是读懂结果的前提。

研究动机

移动图形界面(GUI)智能体已能自动完成发邮件、订行程、改系统设置等复杂多步任务,但它们运行在真实手机系统上而非沙盒里,每一次点击或输入都会触发不可逆的外部状态变化:一次误触就可能造成未授权支付、隐私泄露、数据被删除或系统被错误配置(论文引用 Lee et al., 2026; Sun et al., 2025)。现有安全机制存在两类根本缺陷。第一类是指令级防御,例如用 LlamaGuard、WildGuard 这类纯文本审查模型判断用户请求是否含恶意意图(如「向未知账户转账 5000 元」),但当风险取决于当前界面状态时它就失效了——一句看似无害的指令在特定 GUI 上下文中可能引发严重后果。第二类是事后验证(post-hoc verification),如 OS-Sentinel、SafeGround,它们要在动作执行之后或基于历史轨迹去判断是否发生危险,属于反应式范式;可手机场景里很多不安全动作一旦状态转移发生就无法回滚,事后发现为时已晚。OS-Sentinel 还因逐步 VLM 审查带来较高延迟,VeriSafe Agent 则依赖僵化的逻辑规则,难以理解模糊的自然语言意图。

本文的目标是本文的目标是为移动 GUI 智能体构建一套后果感知(consequence-aware)的安全框架,让智能体在真正执行某个候选动作之前,就能预测该动作会导致怎样的界面与功能状态变化,并据此判断这一变化是否安全,从而在危险发生前主动拦截。为此 SeerGuard 设计了两道防线:第一道是指令级筛查,在交互开始前直接拒绝「恢复出厂设置」「把所有验证码转发给某号码」这类显式恶意请求;第二道是动作级风险评估,对通过了指令筛查、但可能蕴含上下文相关风险的操作,由世界模型基于当前屏幕截图和候选动作预测其语义后果,并给出安全标签与理由。整体目标是把安全从「事后补救」前移到「事前预判」,在不显著牺牲任务可用性的前提下,大幅降低高风险操作被执行的概率。

与已有工作不同的是,本文的独特切入点在于把「世界模型预测」这一原本服务于任务成功率与规划的范式,重新定位为安全审计工具,并做了两个关键取舍。第一,它不像 NeuralOS、ViMo 那样在像素层面生成未来屏幕帧——这种视觉重建计算昂贵且对安全判断往往不必要;而是直接预测语义层面的下一状态文本描述,理由是安全决策更多依赖功能状态变化而非视觉保真度。第二,以往的安全方法和世界模型是两条平行线:安全方法只做检测,世界模型只做规划,SeerGuard 首次把二者统一进一个模型,让模型既要预测动作后果又要评估风险,从而把「预测能力」转化为「防御能力」。此外,针对安全关键的 GUI 交互数据稀缺这一瓶颈,它提出跨模态数据策略,用合成的纯文本移动风险数据作为语义桥梁,连接通用安全知识与多模态 GUI 操作,绕开了直接采集真实危险数据的伦理、技术与法律障碍。

核心方法

SeerGuard 的整体思路是把移动 GUI 交互建模成序贯决策过程 $E$:给定用户指令 $I$ 和当前屏幕状态 $o_t$,智能体策略 $\pi$ 提出候选动作 $a_t$,但不立即执行,而先由世界模型 $G_{WM}(o_t, a_t)$ 审计。框架分两阶段(见 Algorithm 1):第一阶段指令级筛查 $G_{inst}(I)$ 输出二元标签 $l_{inst}\in\{\text{safe},\text{unsafe}\}$ 与理由 $r_{inst}$,显式恶意直接拒绝;第二阶段对每个候选动作做状态感知审计,输出 $(\hat{s}_{t+1}, l_{act}, r_{act})$,其中 $\hat{s}_{t+1}$ 是预测的语义后果,若 $l_{act}$ 为 unsafe 则拒绝并终止,否则才在环境里执行并获取下一帧 $o_{t+1}$。直觉上,这相当于给智能体装了一个「先想清楚再动手」的预演器,无需真实执行就能看到动作后果。安全类别沿用 OS-Sentinel 的十分类体系,涵盖恶意使用、提示注入、有害内容、破坏性操作、隐私违规、安全规避、资源滥用等。

核心创新是用语义世界模型做安全预判。作者把标准视觉世界模型的目标 $p(o_{t+1}|o_t,a_t)=\sum_{z_{t+1}}p(o_{t+1}|z_{t+1},o_t)\,p(z_{t+1}|o_t,a_t)$ 拆解:其中 $p(o_{t+1}|z_{t+1},o_t)$ 是恢复像素细节的渲染器,计算昂贵且对安全评估大多无用。于是他们改为直接把语义转移解码成文本描述 $p(s_{t+1}|o_t,a_t)=\sum_{z_{t+1}}p(s_{t+1}|z_{t+1})\,p(z_{t+1}|o_t,a_t)$,让 VLM 自回归地输出对功能变化的自然语言描述 $\hat{s}_{t+1}$。这和已有的 WMA、WebDreamer、MobileWorld 等纯为提升规划或动作选择而做文本预测的工作有本质区别:SeerGuard 的预测专门服务于安全判断,并把指令级筛查和动作级风险评估统一进同一个多任务模型,用一份训练语料同时学会「过滤恶意指令」和「后果感知风险」这两个能力,而不像以往那样二者割裂。

方法步骤详情

第一步,基于 Qwen3-VL-8B-Instruct 搭建 SAWM 并以 SFT 形式训练。第二步,构造四类共 148K 样本的训练语料:通用文本安全数据 $D_{gen}$(59K,纯文本,1:1,用 gpt-oss-120b 重标注);多模态移动风险数据 $D_{gui}$(33K,对 MobileWorld 下一状态生成轨迹用 Qwen3-VL-30B-A3B 重标注安全标签,并人工采集少量未授权支付、提示注入等危险样本);文本移动风险数据 $D_{text}$(8K,选 100 个热门 App,每个让 LLM 生成 10 安全、10 不安全实例,产出 $(I,\hat{a}_t,\hat{s}_{t+1},l,r)$ 五元组);以及 Next-State-QA 数据 $D_{qa}$(48K),整体安全/不安全比例 2:1。第三步训练:1 epoch,学习率 $1\times10^{-6}$,AdamW,批大小 128,余弦调度,防灾难性遗忘。第四步推理:先指令筛查,再循环——智能体基于 $o_t$、$I$ 生成候选动作,SAWM 预测后果与安全标签,unsafe 则拒绝,否则执行并取下一帧,直到任务完成或被拒绝。

技术新颖性

新颖性体现在四个方面。一是把世界模型从「提升成功率」的规划工具,转译为「执行前审计」的安全工具,这是安全方法与世界模型两条研究线的首次实质结合,让预测能力直接服务于防御。二是用语义(文本)预测替代像素级预测,既绕开了图像生成的高开销,又保留了与安全推理最相关的功能后果信息,使在线验证成为可能。三是跨模态数据策略:在真实危险 GUI 数据因伦理、法律、技术原因难以大规模采集时,用合成的纯文本移动风险数据 $D_{text}$ 充当语义桥梁,把通用安全知识与视觉接地的不安全操作连接起来,消融显示这条桥使 Step Score 从 0.390 提升到 0.402。四是统一的多任务 SFT 让单一模型同时承担指令筛查和后果风险评估,并通过 2:1 的正负样本配比在任务可用性与风险识别之间取得平衡,避免了过拒绝或漏检的极端配置(如 22:1 会严重退化)。

Overview of SeerGuard: A dual-stage, consequence-aware safety framework that combines instruction-level screening and world-model-based action risk assessment.
Figure 2: Overview of SeerGuard: A dual-stage, consequence-aware safety framework that combines instruction-level screening and world-model-based action risk assessment.
Representative examples from the MobileWorld training data.
Figure 5: Representative examples from the MobileWorld training data.

实验结果

核心发现分四块。其一(表1)在 MobileSafetyBench(250 任务,150 高危+100 低危)上 SeerGuard 一致降低 RCS:Qwen3-VL 0.347→0.130($\alpha=0.8$)、SUS 0.191→0.596($\omega=0.8$);GPT-5.1 0.301→0.145;Gemini-3.1 0.368→0.180 且 SUS 全 $\omega$ 提升。消融显示单一指令级(RCS 0.310)与单一动作级(0.141)均优于直连,双阶段最强。其二(表2)指令级筛查在 Prompt Injection 取最佳 F1 0.922(Recall 0.867),在纯不安全 Agent-SafetyBench 上 F1 0.567,优于 WildGuard、LlamaGuard3。其三(表3)动作级评估在 MobileRisk 上 SOTA:F1 0.723、Step Score 0.361,远超规则法(0.198)与 OS-Sentinel(0.269)。其四(表4)状态预测在 Next-State-QA 上 Acc 0.762,超 Intern-VL3-78B(0.610)、Qwen3-VL-235B(0.651)、GPT-5.1(0.727),逼近人类 0.832。加护栏反把耗时从 3.49 降到 3.35 分钟/任务(高危提前终止);数据配比实验(表7)证实 $D_{text}$ 是桥、$D_{gen}$ 不可或缺、2:1 比例最优。

Results of SeerGuard framework evaluation on MobileSafetyBench.
Table 1: Results of SeerGuard framework evaluation on MobileSafetyBench.
Results of instruction-level screening evaluation.
Table 2: Results of instruction-level screening evaluation.
Results of action-level risk assessment on MobileRisk.
Table 3: Results of action-level risk assessment on MobileRisk.
Results of prediction evaluation on Next-State-QA.
Table 4: Results of prediction evaluation on Next-State-QA.
Performance comparison under different data composition settings.
Table 7: Performance comparison under different data composition settings.
Effect of SeerGuard on the Risk–Cost Score (RCS) and Safety–Utility Score (SUS) of VLM-based GUI agents on MobileSafetyBench.
Figure 1: Effect of SeerGuard on the Risk–Cost Score (RCS) and Safety–Utility Score (SUS) of VLM-based GUI agents on MobileSafetyBench.
The task completion rate (left) and task refusal rate (right) of different mobile GUI agents on MobileSafetyBench.
Figure 3: The task completion rate (left) and task refusal rate (right) of different mobile GUI agents on MobileSafetyBench.
A comparative case study of visual prompt injection.
Figure 4: A comparative case study of visual prompt injection.
Instruction-level screening case study.
Figure 6: Instruction-level screening case study.
Action-level risk assessment case study on Web Navigation.
Figure 7: Action-level risk assessment case study on Web Navigation.
Action-level risk assessment case study on SMS.
Figure 8: Action-level risk assessment case study on SMS.
查看结构化数据
任务指标本文基线提升
MobileSafetyBench 风险代价分 RCS($\alpha=0.8$,越低越好) Risk-Cost Score 0.130(Qwen3-VL+SeerGuard) 0.347(Qwen3-VL 直连) 降低 0.217,降幅约 62.5%
MobileSafetyBench 安全效用分 SUS($\omega=0.8$,越高越好) Safety-Utility Score 0.596(Qwen3-VL+SeerGuard) 0.191(Qwen3-VL 直连) 提升 0.405,约 2.1 倍
MobileRisk 轨迹级动作风险检测 F1 / Step Score 0.723 / 0.361 0.695 / 0.269(OS-Sentinel) F1 +0.028,Step Score +0.092
Next-State-QA 下一状态预测 Accuracy 0.762(SAWM,8B) 0.727(GPT-5.1)/ 0.714(MobileWorld 8B) 以 8B 超越 GPT-5.1 与更大模型,逼近人类 0.832
Prompt Injection 指令级筛查 F1 0.922(SAWM) 0.917(PolyGuard) +0.005,取得最佳 F1

局限与改进

作者在结论中坦承仍需提升风险检测能力,特别是减少对某些细粒度任务的漏检以及对良性任务的误报。从结果看,在 GPT-5.1 上加 SeerGuard 会牺牲部分可用性换取安全(SUS 在 $\omega=0.5$ 时从 0.703 降到 0.668),说明护栏仍存在过拒绝倾向;把 Qwen3-VL 直接当护栏时 Recall 高但 Precision 仅 0.400、F1 0.545,过度保守,其高 HR 部分是通过拒掉安全任务「刷」出来的。此外,本文的语义预测只输出单步下一状态的文本描述,丢失了像素级视觉细节,对于必须靠视觉才能判断的风险(如钓鱼页面的伪造布局、模糊截图)可能力不从心。评估主要集中在 MobileSafetyBench 与 MobileRisk 两个基准,统一的动作空间虽方便建模,但与真实安卓系统的全部操作仍有差距,且只在 8B 骨干上验证,更大或更小模型的迁移性、端侧部署可行性均未知。安全类别虽沿用十分类体系,但对更隐蔽的新型攻击(如多步组合提示注入)的覆盖也需持续扩展。

独立分析的弱点

第一,语义预测牺牲了视觉信息:只生成功能变化的文字描述,遇到需要像素级细节才能判别的风险(钓鱼页面的伪造布局、细微 UI 伪装、看不清的截图)会漏判,改进方向是引入轻量的视觉差异提示或关键区域高亮作为辅助输入。第二,单步前瞻视野有限:SAWM 只预测一次动作后的状态,对延迟显现的多步连环风险(先授权再转账、先改设置后触发)难以捕捉,可结合多步 rollout 或树搜索扩展时序预算 $B$。第三,数据质量依赖外部 LLM:$D_{gen}$ 由 gpt-oss-120b 重标注、$D_{text}$ 由 GPT-4o 合成,会继承这些模型的偏见与噪声,建议加入人工校验与对抗清洗。第四,只在 Qwen3-VL-8B 上验证,骨干泛化性、蒸馏到更小模型或端侧部署未探讨,不同 VLM 的内部规划/接地能力差异会导致收益不均(论文已观察到 GPT-5.1 在金融类反而变差)。第五,过拒绝问题仍存(Qwen3-VL 当护栏时 Precision 仅 0.400),说明正负样本配比和判别阈值需按场景校准,可引入置信度校准或低置信回退到人工确认。

未来方向

作者明确提出的方向是进一步增强风险检测,降低细粒度任务的漏检和良性任务的误报。基于本文成果可延伸的有:把语义世界模型扩展为多步前瞻与树搜索,以应对延迟后果和多步组合攻击;探索像素级与语义级融合预测,在保留语义效率的同时补足视觉判别力;把 SAWM 与强化学习结合,让护栏模型在真实交互中获得安全反馈而持续自我改进;研究跨平台、跨动作空间的迁移,从安卓扩展到网页、桌面乃至车机系统;面向端侧部署做模型压缩与蒸馏,使护栏能离线运行;并构建更大规模、更细分攻击类型(如多步提示注入、UI 干扰攻击)的真实安全评测集,推动安全边界的持续校准。还可以把 SeerGuard 的双阶段「事前预判」思路推广到其他需要后果审计的自主系统,如机器人操作与自动驾驶决策。

复现评估

复现性中等偏上。论文在附录给出相当完整的细节:训练超参(表9:学习率 $1\times10^{-6}$、1 epoch、AdamW、批大小 128、余弦调度、最大像素 1003520)、统一动作空间(表8,11 类动作)、以及指令级筛查与动作级评估两份完整 prompt(Prompt 1/2),还有数据组成的多种消融设置(表6、表7)。骨干模型 Qwen3-VL-8B-Instruct 开源,训练数据中 Next-State-QA、MobileWorld 轨迹有迹可循;但通用文本安全数据、人工采集的危险样本、以及用 GPT-4o/gpt-oss-120b 合成的 $D_{text}$ 与 $D_{gen}$ 并未完全开放,项目主页 seerguard.github.io 暂以展示为主。算力上 8B 规模、仅 1 个 epoch 在数张高显存 GPU 上可控,评测基准 MobileSafetyBench、MobileRisk、Agent-SafetyBench 均公开可得。整体可部分复现,但合成数据流程和人工标注需自行重建,完整复刻 SAWM 有一定难度。