BadWAM:当世界-动作模型想象正确却执行错误 BadWAM: When World-Action Models Dream Right but Act Wrong
提出世界-动作漂移攻击,让机器人想象正常却执行失败动作
前置知识
世界-动作模型(World-Action Model, WAM)
WAM是一类机器人基础模型,与传统仅把观测和语言指令映射到低层控制动作的反应式策略不同,它额外建模未来世界状态。其世界预测模块先生成潜在未来$z_{t+1:t+K}$或解码未来帧$v_{t+1:t+K}$,动作模块再基于该想象产出动作块$a_{t:t+H-1}$。这种耦合被视为具身AI的鲁棒性、可解释性和安全性来源。
理解WAM的'想象-执行'双接口结构是理解本文攻击面的前提,BadWAM正是利用这两个接口之间的对齐缝隙。
对抗样本与对抗攻击(Adversarial Examples)
对抗攻击指对输入施加人眼几乎不可见的小幅扰动$\delta$(满足$\|\delta\|_\infty \leq \varepsilon$),使深度网络输出剧烈变化。经典工作如FGSM、PGD在图像分类上首次系统研究,后续扩展到黑盒、查询受限、物理世界攻击。本文继承该思想,但攻击对象从分类标签或静态感知输出变为WAM的闭环动作行为。
需要了解对抗攻击的基本范式($\ell_\infty$预算、查询式黑盒、零阶优化),才能理解BadWAM如何在不访问梯度的情况下搜索扰动。
零阶优化 / 同时扰动随机近似(SPSA)
零阶优化指仅通过目标函数取值(而非梯度)更新参数的方法。本文采用SPSA:对扰动$\delta_t$采样随机方向$u_i$,在正负扰动下查询WAM,得到梯度估计$\hat{\nabla}J \approx \frac{1}{m}\sum_i \frac{J(\delta_t+cu_i) - J(\delta_t-cu_i)}{2c} u_i$,再做投影更新。
BadWAM的黑盒特性正源于此——攻击者只需查询WAM的动作和(可选的)未来输出,无需梯度或权重,使攻击适用于部署的策略API。
闭环机器人操控(Closed-loop Manipulation)
闭环评估指策略在每个重规划步被反复查询:机器人执行WAM输出的动作块的一部分,再次观测环境,重复该过程。本文使用的LIBERO(四套件:Spatial/Object/Goal/Long-horizon,桌面操控)和RoboTwin(双臂长程任务)基准均采用闭环协议。
BadWAM的关键发现是攻击造成的动作偏移会随重规划累积并放大,单步动作对比无法捕捉这种渐进式失败,因此闭环评估不可或缺。
动作块(Action Chunk)
WAM/VLA模型不是逐帧输出单个动作,而是一次性输出未来$H$步的动作序列$a_{t:t+H-1}$(action chunk),机器人执行其中一部分后再重规划。这种chunking策略能减少推理延迟并提升时序一致性。本文实验中LIBERO动作维7、RoboTwin动作维14。
BadWAM的动作距离度量$D_{act}$和horizon-level分析都建立在action chunk之上,论文发现攻击主要影响连续动作通道(XYZ平移/旋转)和action chunk的后段,而非简单翻转夹爪指令。
研究动机
现有世界-动作模型(WAM)普遍将'未来预测'视为提升鲁棒性和安全性的核心机制:研究者设想,既然机器人能'想象'自己动作的后果,那么就可以用一个监控器$M$检查预测的未来$safe = M(z_{t+1:t+K}, g)$来在执行前拦截不安全计划。这一假设被多项WAM安全工作(imagine-then-check验证器、JailWAM、oracle-level完整性攻击等)直接采纳。然而作者在闭环执行轨迹中发现一个被忽视的现象:任务失败episode的动作偏移明显大于成功episode,而预测未来的偏移在成功与失败case之间却存在大量重叠(见Figure 1)。这说明'未来预测看起来合理'并不等同于'将要执行的动作与该未来对齐'。具体场景上,在LIBERO基准中干净WAM成功率高达96.5%-100%,但只需小幅$\ell_\infty$有界视觉扰动就能让成功率骤降到43.1%,而此时模型想象出的未来视频帧仍可与干净预测十分接近。现有以未来预测本身为攻击对象的BadWorld、Physical-conditioned攻击,或针对动作输出的传统对抗攻击,都未触及这一对齐缝隙。
本文的目标是本文目标是形式化并实证一类全新的WAM专属安全威胁——世界-动作漂移攻击(World-Action Drift Attack)。具体而言,作者希望回答:能否通过小幅视觉扰动$\tilde{o}_t = clip(o_t + \delta_t),\ \|\delta_t\|_\infty \leq \varepsilon$,让WAM执行的动作块$a_{t:t+H-1}$发生足以导致任务失败的大幅偏移,同时让其预测的未来$z_{t+1:t+K}$或$v_{t+1:t+K}$与干净想象保持接近?为此作者提出BadWAM统一框架,沿'攻击强度'和'隐蔽性'两个维度刻画攻击面,并设计两种实例:仅追求最大化执行破坏的action-only攻击,以及在破坏执行的同时显式约束想象漂移的imagination-preserving攻击。作者还希望系统评估该威胁在多种WAM变体、不同任务套件、不同扰动预算下的表现,并检验其跨模型迁移性和对简单防御的抵抗力,从而为WAM安全评估提供可复用的诊断协议。
与已有工作不同的是,与已有工作相比,BadWAM的独特切入角度是把'想象'与'动作'之间的对齐关系作为安全关键对象,而非单独攻击其中之一。BadWorld攻击的是视觉世界模型的未来rollout本身;Physical-conditioned攻击扰动条件通道引起语义扭曲;JailWAM聚焦通过视觉轨迹表示的不安全/破坏性行为;最接近的oracle-level完整性攻击[3]是通过污染受信想象力来破坏依赖未来预测的下游安全门、MPC规划器或imagine-then-check验证器。这些方法都把未来预测当作主攻击对象。而BadWAM研究的是互补的失效模式:未来预测保持接近干净值、看似合理,但执行的动作已与该未来解耦。这一威胁模型对那些把'未来看起来合理'当作放行判据的安全监控器尤其危险——本文matched-strength实验显示,在40个LIBERO任务中有39个任务的预测未来距离被降低,但闭环任务成功率仍大幅下降,证明仅看未来合理性会严重高估安全性。
核心方法
BadWAM的整体思路可概括为'把WAM当作可查询的预测-动作黑盒系统,在每个重规划步用零阶有限差分搜索有界视觉扰动'。直觉上,WAM的视觉编码器被'想象头'和'动作头'共享,但这两个头对输入扰动的敏感方向并不完全一致——攻击者只要找到那些主要推动动作输出、却较少影响未来预测的观测方向,就能制造'看起来在正常想象、实际却执行错动作'的失效。技术路线上,作者定义两个接口级距离:动作距离$D_{act}(a_\delta, a)$衡量干净与受扰动作块的偏差,未来距离$D_{img}(z_\delta, z)$衡量想象漂移,并将隐蔽攻击形式化为$\max_{\|\delta\|_\infty \leq \varepsilon} D_{act}$ s.t. $D_{img} \leq \tau_{img}$的拉格朗日松弛。两种攻击实例仅通过改变标量目标$J$即可切换,整个流程无需梯度、无需权重、无需训练数据,天然适配部署的policy API。
核心创新点在于识别并形式化了一个WAM专属的安全缝隙:动作生成与未来想象可以异步失效。与已有对抗攻击的本质区别在于——传统图像分类对抗攻击改变的是标签,传统机器人策略对抗攻击改变的是动作向量或最终奖励,这些都可以通过单一接口(动作输出或任务成功率)评估。而BadWAM攻击的是两个耦合能力之间的接口:能否让$a_\delta$大幅偏离$a$的同时让$z_\delta$(或$v_\delta$)几乎不变?作者用拉格朗日松弛$\delta_t^\star = \arg\max_{\|\delta_t\|_\infty \leq \varepsilon} D_{act}(a_{\delta}, a) - \lambda D_{img}(z_{\delta}, z)$显式建模这种'强度-隐蔽性'谱。当$\lambda=0$退化为纯动作破坏;$\lambda$增大时优化器被惩罚改变想象,攻击更隐蔽但可能破坏力减弱。这种'解耦攻击'对依赖未来预测做安全检查的系统构成根本威胁,因为监控器看到的未来依然合理。
方法步骤详情
BadWAM在每个重规划步在线执行:先用干净观测查询冻结WAM,得到参考动作块$a_{t:t+H-1}$和(若可观测)参考未来$z_{t+1:t+K}$;初始化$\delta_t=0$。随后循环$B$次(默认8次,每次采样1个Rademacher方向$u_i$成对查询,共17次WAM前向),按$\hat{\nabla}J=\frac{1}{m}\sum_i\frac{J(\delta_t+cu_i)-J(\delta_t-cu_i)}{2c}u_i$估计梯度,投影更新$\delta_t\leftarrow\Pi_{[-\varepsilon,\varepsilon]}[\delta_t+\eta\hat{\nabla}J]$($c=\eta=0.02$)。保留预算$\|\delta\|_\infty\leq\varepsilon$内最优扰动,构造$\tilde{o}_t=clip(o_t+\delta_t)$送入WAM得受扰动作块交机器人执行;执行后再次观测回到第一步。切换两种攻击只需改标量目标$J$(后者附加$-\lambda D_{img}$项),整个过程零阶、在线、模型无关。
技术新颖性
技术新颖性体现在四个层面。第一,威胁模型新颖:首次把'动作-想象对齐'而非任一单独输出定义为安全关键对象,并形式化为公式(7)的拉格朗日问题,导出action-only与imagination-preserving两个端点。第二,攻击接口级度量:$D_{act}$和$D_{img}$不依赖具体WAM架构,只要求能查询相应输出,因此同时覆盖'先想象再决策'(IDM WAM)、'联合预测'(Joint WAM)和'仅动作'(Action-only WAM)三类变体。第三,纯黑盒零阶在线优化:采用SPSA风格的成对有限差分,每个重规划步仅17次前向查询,无需训练单独的攻击模型,自然适应当前观测、指令和机器人状态。第四,统一诊断协议:作者提出闭环成功率、动作距离、预测未来距离、解耦分数、horizon-level偏移、失败分布等多组度量,把WAM安全评估从'干净vs受扰成功率'升级为'想象-执行是否同步'的同步性检查问题,为后续防御研究奠定评测基础。
实验结果
Table 1主结果:LIBERO上action-only WAM从96.5%骤降到43.1%(↓53.4pp),Joint WAM降至61.5%/63.0%,IDM WAM降至66.1%/68.1%;RoboTwin降幅仅6-8pp。失败具系统性(Fig 5/7/8):42.5%任务落入0-25%成功bin,Spatial 96.5→16.0%、Goal 97→40%、Long-horizon 92.5→23.5%,Object保持93%,pass@k始终低于干净参考。机制(Fig 9-11)上受扰机器人渐进drift、per-replan偏移持续累积。隐蔽性(Fig 12):matched-strength下img-pres把平均预测未来距离从14.01降到13.04(40任务中39个更低)而成功率仍接近action-only。敏感性(Fig 13/14):攻击力随$\varepsilon$(0.01/0.06/0.20对应约95.8%/56.7%/0%成功率)和$\lambda$单调可调;跨模型迁移与防御基线详见Table 2/3与Fig 6/15。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO闭环操控(Action-only WAM) | 闭环任务成功率 | 43.1%(action-only攻击) | 干净96.5% | ↓53.4pp(攻击造成的成功率下降) |
| LIBERO闭环操控(Joint WAM) | 闭环任务成功率 | 63.0%(imagination-preserving攻击) | 干净98.1% | ↓35.1pp |
| LIBERO闭环操控(IDM WAM) | 闭环任务成功率 | 68.1%(imagination-preserving攻击) | 干净98.4% | ↓30.3pp |
| 跨模型迁移(Joint WAM→IDM WAM) | 目标任务成功率 | 60.8%(img-pres迁移攻击) | 目标干净100% | ↓39.2pp |
| JPEG-noise集成防御(IDM WAM) | 攻击后成功率 | 90.0% | 无防御54.6% | ↑35.4pp(防御恢复) |
| 白盒梯度参考(Joint WAM) | 闭环任务成功率 | 49.2% | 黑盒action-only 61.5% | 额外↓12.3pp(攻击上限) |
局限与改进
作者承认若干局限。首先,RoboTwin上的攻击效果远弱于LIBERO(仅6-8pp下降),作者解释这与训练步数和模型成熟度有关,并在Table 4标注计划在默认5 epoch(约23.5k步)上重跑,目前RoboTwin结果是50k步训练版本——意味着该基准数字可能尚不稳定。其次,多项诊断实验(未来保持权重消融、扰动/查询预算消融、迁移、防御)仅在12任务×10试验的balanced子集上完成,作者明确表示将在最终版重跑full LIBERO sweep,当前这些结论的统计强度有限。第三,本文只测了三种基于FastWAM的变体,未涵盖OA-WAM、ABot-M0.5、VT-WAM等更新的WAM系统,外部效度有待验证。从我的观察看:白盒参考(49.2%/52.8%)与黑盒action-only(43.1%)之间仍有差距,说明零阶搜索未饱和攻击上限;防御实验只考虑非自适应预处理,自适应攻击者可通过期望变换绕过;论文也未讨论扰动在物理相机上的可实现性(如对抗补丁、光照扰动),威胁模型仍停留在数字图像层面。
独立分析的弱点
独立分析四大弱点。弱点一:RoboTwin效果弱(仅6-8pp),可能因为该基准视觉观测更丰富(3相机、240×320)且任务对单步动作容错更高——改进方向是研究在更高维观测和更复杂双臂任务上的攻击上限,并探索针对长程任务的horizon-targeted策略。弱点二:零阶搜索未饱和——白盒参考比黑盒action-only低约7-15pp,改进方向是结合少量替代模型梯度或score-based估计(如NES、ZOO)来逼近白盒上限。弱点三:在$\varepsilon=0.01$时攻击几乎失效(成功率95.8%/98.3%),说明微小扰动下WAM仍较鲁棒——改进方向是研究更结构化、更稀疏但视觉更不显眼的扰动模式(如对抗补丁、低频扰动、光照扰动)以提升小预算下的攻击力。弱点四:物理可实现性未验证,本文所有扰动都是数字层面的$\ell_\infty$球内向量,未考虑相机噪声、运动模糊、量化等真实部署因素——改进方向是设计可印在物体表面或通过光照投射的物理扰动,并测试在真实相机 pipeline 下的鲁棒性,这对评估实际机器人部署的攻击风险至关重要。
未来方向
作者提出的方向包括:把BadWAM扩展到OA-WAM(object-addressable)、ABot-M0.5(移动操控)、VT-WAM(视觉-触觉)等更新WAM变体,研究object-addressable、mobile-manipulation、visual-tactile等场景下的对齐攻击;将诊断协议(成功率+动作距离+未来距离+解耦分数+horizon分析+失败分布)标准化为WAM安全评测套件。基于成果可延伸的方向我认为至少有五条:一是设计自适应攻击,能穿过JPEG/blur/resize-crop等预处理防御(论文已指出当前攻击是非自适应的);二是构建以'动作-想象同步性'为直接优化目标的运行时监控器,而不仅检查未来合理性;三是研究对抗训练防御,把BadWAM扰动作为数据增广注入WAM训练以提升鲁棒性;四是把威胁模型扩展到指令级和跨模态攻击(语言指令、本体感觉通道、深度图);五是把分析推广到RT-2、pi_0/0.7、OpenVLA等更广义的VLA模型,检验'想象-执行解耦'是否是耦合预测模型的通病。
复现评估
复现评估总体较好。代码与checkpoint已开源(GitHub/HuggingFace见首页),action-only WAM直接用官方FastWAM checkpoint,Joint/IDM WAM按FastWAM默认配方在8×H100上训练(LIBERO 10 epoch、RoboTwin 50k步),超参详列Table 5(lr $1\times10^{-4}$、wd $1\times10^{-2}$、batch 16/GPU、cosine)。攻击超参完整:$\varepsilon=0.06$、$c=\eta=0.02$、默认8次迭代=17次WAM前向、$\lambda=0.015$、Rademacher方向。基准(LIBERO、RoboTwin 2.0)公开,协议(full sweep 800 episode、balanced子集120 episode)在Table 4透明披露并标注待重跑项。算力门槛较高(训练8×H100),但攻击只需推理查询、单次重规划约2.5-30秒。风险:RoboTwin训练步数与最终版不一致、部分诊断仅子集完成,需注意版本对齐。整体难度中等偏上。
论文图表
散点图展示失败episode(failure)的动作偏移显著大于成功episode(success),而预测未来偏移(predicted-future distance)在成功与失败case之间大量重叠。
这是全文的实证出发点:直接说明安全关键对象不是动作或想象之一,而是二者的对齐——这正是BadWAM的核心动机。
对比无保持项(a)与有保持项(b)下,干净与对抗观测生成的预测未来帧及放大8×的绝对像素差。两者都引发动作失败,但保持项让对抗未来更接近干净想象。
直观展示'imagination-preserving'攻击的隐蔽性——这正是WAM专属失效模式(看起来想象正常却执行错误)的可视化证据。
柱状图对比随机噪声、action-only、img-preserving、白盒参考四种方法在Joint WAM和IDM WAM上的受扰成功率。随机噪声最弱(71-75.2%),白盒参考最强(49.2%/52.8%),BadWAM黑盒居中。
sanity check:证明BadWAM的破坏力来自有针对性的世界-动作攻击,而非通用视觉脆弱性;同时标定黑盒攻击距白盒上限还有空间。
分组柱状图按Spatial/Object/Goal/Long-horizon展示三种WAM在干净/action-only/img-pres下的成功率。Spatial(96.5→16)和Long-horizon(92.5→23.5)受创最重,Object保持93相对鲁棒。
揭示攻击的结构性:在动作误差会通过几何/接触时序/序列依赖累积的任务上最有效,提示哪些场景最需要防御。
折线图展示受扰成功率、预测未来距离随$\lambda$变化。适度$\lambda$(如0.015)降低未来距离并改善动作-未来tradeoff;过大的$\lambda$反而削弱动作操纵。
证明$\lambda$控制的是真实的强度-隐蔽性折衷,而非仅改变报告度量——为部署者选择超参提供依据。
ROC曲线展示基于JPEG增强一致性检测器的性能:Joint WAM AUROC=0.675,IDM WAM AUROC=0.725;5%FPR下TPR仅13.4%/21.4%。
说明简单一致性检测在机器人安全要求的低误报率下基本无效——为'需要主动同步性防御'的结论提供反证。