DRIFT:用对抗补丁破坏流匹配视觉-语言-动作模型的去噪轨迹 DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
首例测试时对抗补丁攻击流匹配VLA,仅攻击首步去噪即近乎100%攻破π0
前置知识
视觉-语言-动作模型(VLA)
VLA模型将原始视觉观测和自然语言指令直接映射为低层机器人动作,是通用机器人控制的范式。根据动作表示方式可分为两类:自回归VLA(如OpenVLA)将动作离散化为token后像语言一样解码;连续VLA(如π0)直接生成实值动作。本文针对的是流匹配VLA——它通过迭代去噪过程生成连续动作块(action chunk),而非逐个token解码,这一独特结构正是攻击者可利用的薄弱环节。
理解VLA的分类与动作生成机制,是理解为何流匹配VLA的去噪ODE成为独特攻击面的前提,也是读懂本文威胁模型的基础。
流匹配(Flow Matching)与去噪速度场
流匹配在纯高斯噪声和干净动作块之间构造连续插值:$A^{\tau}_t = \tau A_t + (1-\tau)\epsilon$,其中$\tau \in [0,1]$为流时间。训练时模型学习速度场$v_\theta(A^{\tau}_t, o_t)$预测从噪声指向干净动作的方向。推理时从纯噪声$A^0_t = \epsilon \sim \mathcal{N}(0, I)$出发,用$K$个离散欧拉步积分:$A^{\tau+\Delta\tau}_t = A^{\tau}_t + \Delta\tau \cdot v_\theta(A^{\tau}_t, o_t)$,最终得到动作块。π0使用$K=10$步。这种自回归式ODE求解意味着早期误差会被后续步骤逐级放大。
去噪速度场及其多步ODE积分是本文攻击的直接目标,必须理解它才能领会'早期注入、全程放大'的级联效应,以及为何仅攻击第一步就能奏效。
对抗补丁攻击(Adversarial Patch)
对抗补丁是一种物理可实现的攻击:优化一个小的图像块(sticker),贴在相机视野内的固定区域,仅修改该区域像素,其余观测保持不变。在本文中,补丁尺寸为$32 \times 32$像素(约占$224 \times 224$腕部相机图像的2%),贴在机器人夹爪上。攻击者拥有离线白盒权限(可获取梯度)但部署时无需访问模型,补丁在所有任务和场景中通用,属于测试时、输入空间的攻击。
本文采用标准白盒补丁威胁模型,理解补丁的物理可实现性与'通用性'约束,才能评估攻击的现实危害与对比基线的公平性。
投影梯度下降(PGD)
PGD是制作对抗样本的标准优化方法。每步沿目标函数的梯度符号方向更新:$\delta \leftarrow \text{clip}_{[0,1]}(\delta + \alpha \cdot \text{sign}(\nabla_\delta \mathcal{L}(\delta)))$,其中$\alpha$为步长,更新后投影回有效像素范围或$\ell_\infty$约束球内。本文用500次迭代、步长$\alpha=0.01$,从均匀灰色补丁初始化,每次迭代从696帧LIBERO腕部相机观测池中采样条件,使补丁具有通用性。
PGD是本文攻击的优化算法,理解它能明白为何攻击只需单次前向反向传播,以及K倍成本节省的来源。
FlowHijack(训练时后门攻击)
FlowHijack是An等人(2026)提出针对流匹配VLA的训练时后门攻击:通过在投毒数据上重新训练策略,植入一个触发模式,使推理时去噪轨迹被引向攻击者指定的目标行为。它同样利用'早期注入、全程放大'效应,但要求白盒访问训练管线、修改模型权重,是远强于测试时补丁的威胁模型。本文DRIFT与FlowHijack形成鲜明对比:测试时仅需冻结模型上贴一个补丁。
FlowHijack是本文最重要的对照,理解它才能领会DRIFT'更少步骤更强'这一发现为何与训练时后门'需要宽窗口'的结论恰好相反——这是本文核心洞察。
研究动机
近期基准研究(Guo等人2026)报告称,流匹配VLA如π0对对抗扰动具有显著的鲁棒性,不像OpenVLA等自回归模型那样容易被欺骗。然而作者认为这种鲁棒性很大程度上是假象,根源在于现有攻击的构建方式:UADA(Wang等人2025)在最终动作空间攻击,EDPA(Xu等人2025a)在视觉编码器嵌入空间攻击,二者都忽略了定义流匹配策略如何产生动作的多步去噪ODE——恰恰忽略了使这些模型最脆弱的结构。另一方面,FlowHijack(An等人2026)虽正确指出去噪轨迹是可利用的攻击面,但它通过训练时后门实现,需要重新训练策略、白盒访问训练管线、且假设模型已被入侵,这是一个远强于部署场景、远不切实际的威胁模型。因此,能否仅凭一个物理可实现的测试时对抗补丁、不修改冻结策略、不访问训练管线,就攻破现成的流匹配VLA,仍是一个开放问题。
本文的目标是本文的目标是回答上述开放问题:设计一种实用、保守的测试时通用对抗补丁攻击,直接针对流匹配VLA的去噪速度场——即策略积分以生成每个动作的那个量。具体地,攻击者拥有冻结策略的离线白盒访问(可计算梯度),在机器人夹爪上贴一个小的物理补丁($32 \times 32$像素,约占腕部图像2%),离线优化一次后固定不变,部署时无需访问模型、无需逐实例优化,应用于所有任务、场景和回合。攻击采用无目标设定,目标是最大化任务失败率(使生成的动作块偏离正常行为),直接反映'单一物理贴纸就能让部署的机器人不可靠'这一安全关切。
与已有工作不同的是,本文的独特切入角度有三层。第一,首次提出明确利用流匹配VLA去噪速度场的测试时对抗补丁攻击——既不同于FlowHijack的训练时后门(需修改模型),也不同于动作/嵌入空间攻击(忽略去噪ODE)。第二,揭示了一个反直觉的核心发现:对测试时补丁而言,仅攻击第一步去噪步骤既更强又更便宜,而非像直觉那样攻击更宽的早期步骤窗口。第三,给出该'更少更强'效应的机制解释——输入空间优化独有的梯度冲突,并指出这与训练时后门(FlowHijack需要宽早期窗口)的规律恰好相反。这一对比揭示了'攻击输入还是重训练权重'从根本上决定了应攻击一步还是多步。
核心方法
DRIFT的整体思路是:与其攻击最终动作输出或视觉嵌入,不如直接攻击去噪速度场$v_\theta$。直觉上,流匹配策略的全部行为都通过积分速度场产生,那么扰乱速度场就能从源头改变整个去噪轨迹。技术上,攻击者制作一个通用补丁$\delta \in [0,1]^{h \times w \times 3}$,贴在腕部图像固定区域$R$(覆盖夹爪),将观测$o_t$扰动为$o^+_t$。关键设计在于通过逐步骤脆弱性分析确定攻击哪些去噪步骤:单步消融发现早期步骤($k \le 5$)脆弱、晚期步骤($k \ge 6$)近乎无效;进一步的首$M$步消融则揭示反直觉现象——仅攻击第一步($M=1$)平均ASR最高(99.8%),攻击3步降到77.5%、5步降到79.7%。因此最终DRIFT仅攻击$K=10$步去噪中的第一步($k=0$),用PGD最大化速度场在干净与扰动条件下的发散。
核心创新点是与已有方法的本质区别:DRIFT攻击的是去噪速度场而非最终动作或视觉嵌入,且只攻击第一步。这与FlowHijack的训练时后门形成根本对立——FlowHijack必须在宽早期窗口上注入恶意动力学,因为窗口过窄时权重空间学不到一致的恶意向量场;而DRIFT在冻结模型上不学习任何场,只寻找单一输入扰动,此时将全部攻击集中在第一步既必要(避免梯度抵消)又充分。这个'更少更强'效应源于输入空间优化独有的梯度冲突:每步速度发散对补丁的梯度$g_k$互相错位,首步梯度$g_0$与末步梯度$g_9$甚至反相关($\cos(g_0, g_9) \approx -0.35$),累加多步会部分抵消信号。因此集中攻击一步反而最强。
方法步骤详情
方法分两部分。步骤一(逐步骤脆弱性分析):定义单步发散目标$\mathcal{L}_k(\delta)=\mathbb{E}_o\|v_\theta(A^{\tau(k)},o^+)-v_\theta(A^{\tau(k)},o)\|^2_2$,$\tau(k)=k/(K-1)$。对$S=\{k\}$逐$k$优化,发现早期步发散最高、ASR近100%,晚期步崩溃。步骤二(首$M$步消融):对窗口$S=\{0,\dots,M-1\}$求和各步发散并绘梯度$g_k$余弦相似度,确认宽窗口抵消。步骤三(DRIFT攻击):取最有效成员$S=\{0\}$,目标$\mathcal{L}_{DRIFT}=\mathcal{L}_0$,用PGD迭代500次、步长$\alpha=0.01$,每步对去噪轨迹做可微rollout,在第一步评估干净与扰动速度后$\delta\leftarrow\text{clip}(\delta+\alpha\,\text{sign}(\nabla_\delta\mathcal{L}))$;可选投影到$\ell_\infty$球以隐蔽。输出单一通用补丁,部署无需逐实例优化。
技术新颖性
技术新颖性体现在四个层面。攻击面方面,据作者所知这是首个明确利用流匹配VLA去噪速度场的测试时对抗补丁攻击,区别于FlowHijack(需训练时后门)和动作/嵌入空间攻击(忽略去噪ODE)。攻击设计方面,'更少步骤更强攻击'是反直觉的发现,且通过首$M$步消融(Table 1)与梯度冲突分析(Figure 3,生存比从$M=1$的1.00降到$M=10$的0.45)严格验证。机制解释方面,首次用梯度冲突解释输入空间优化的多步抵消,并指出与训练时后门规律相反——这一对照此前训练时工作完全缺失。效率方面,因仅攻击单步,每迭代只需一次前向反向传播,相比全轨迹攻击成本降低$K$倍(10倍),却产生更强补丁——既更便宜又更有效。这些组合使DRIFT在相同补丁尺寸预算下大幅超越UADA和EDPA基线。
实验结果
核心发现可逐实验归纳。主结果(Table 2):π0上DRIFT以$32\times32$补丁在四套件(Spatial/Goal/Object/Long)达100.0/99.7/100.0/99.6 ASR,平均99.8%;同预算UADA仅13.2%、EDPA放大到64像素也仅25.3%。π0.5更鲁棒,DRIFT用$64\times64$补丁达99.3%平均ASR。更少更强(Table 1):$M=1$(DRIFT)平均99.8%最强,$M=3$降到77.5%、$M=5$为79.7%。梯度冲突(Figure 3):$\cos(g_0,g_9)\approx-0.35$,生存比随窗口宽化从1.00降到0.45,与ASR下降吻合。失败模式'幻影抓握'(Figure 5):补丁使夹爪在前7步内(均值3.8步)闭合,远早于干净策略均值46步,机械臂持续移动却不接近物体。扰动预算呈相变(Figure 6):$\epsilon\le0.05$近零,$\epsilon=0.1$跃升至97%。迁移弱(π0→π0.5仅8.9%);JPEG在$Q\lesssim50$基本阻断,Long残留16-21%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO四套件攻击成功率(π0) | 平均ASR(%,越高越强) | 99.8%($32 \times 32$补丁) | UADA 13.2%;EDPA 25.3%(需$64$像素补丁) | 约为EDPA的3.9倍、UADA的7.6倍 |
| 动作偏离程度(π0) | 平均NAD(%,越高偏离越大) | 8.5% | UADA 4.3%;EDPA 5.4% | 动作级偏离最大,确认攻击强度 |
| 攻击π0.5(更鲁棒继任模型) | 平均ASR(%) | 99.3%($64 \times 64$补丁) | UADA 30.5%;EDPA 1.5% | 几乎全破,基线均大幅落后 |
| 首M步消融(攻击步数影响) | 平均ASR(%) | 99.8%(M=1,DRIFT) | M=3为77.5%;M=5为79.7% | 攻击更少步骤反而更强 |
| 跨模型迁移(无重优化) | 平均ASR(%) | π0→π0.5 仅8.9% | 白盒内近100% | 迁移弱,证实补丁模型特异 |
局限与改进
作者承认的局限主要有三方面。第一,跨模型迁移性弱(Table 3):DRIFT补丁在源模型上近乎100%ASR,但无重优化迁移到另一流匹配VLA时大幅下降(π0→π0.5仅8.9%),这强化了'有效攻击需要对部署策略的梯度访问'的白盒假设,也意味着攻击难以跨模型版本通用。第二,JPEG压缩可作为廉价的第一道缓解(Figure 8):在Spatial/Goal/Object上当质量因子$Q\lesssim50$-60时攻击基本被阻断,作者明确指出JPEG不应被视为通用防御——Long套件在最强压缩下仍残留16-21%的ASR,约为其他三套件的4倍。第三,更隐蔽的灰度补丁需约两倍于彩色补丁的扰动预算才能成功,隐蔽性与攻击力存在权衡。我自己的观察补充:论文仅在仿真(LIBERO)上评估,未涉及真实机器人;攻击对象局限于π0/π0.5两个同族模型,未测试其他流匹配或连续动作策略;灰度隐蔽补丁的相变阈值仍较高(需约2倍预算),在严格隐蔽约束下是否仍有效未充分讨论。
独立分析的弱点
第一个弱点是白盒假设的现实性。DRIFT需对冻结策略的梯度做离线优化,真实部署中攻击者未必能拿到商业策略权重;改进方向是研究黑盒迁移或基于查询的攻击,提升在无梯度访问场景的可行性。第二个弱点是跨模型迁移弱,补丁高度模型特异(π0→π0.5仅8.9%),意味着模型版本更新即可削弱攻击;改进方向是探索跨架构的通用扰动或集成多模型优化提升迁移性。第三个弱点是仿真与真实差距:仅在LIBERO仿真评估,真实相机的噪声、光照、打印补丁的色彩偏差可能影响有效性;改进方向是在真实机器人上验证物理可移植性。第四个弱点是防御方向已现端倪:JPEG压缩在强压缩下基本阻断攻击(Long除外),且攻击依赖早期速度场,改进方向应同时驱动防御研究(如对早期去噪步骤加噪/正则、对抗训练、输入净化)。第五个弱点是隐蔽性与强度的权衡:更隐蔽的灰度补丁需2倍预算,且相变在$\epsilon=0.1$处,严格隐蔽预算下可能失效;改进方向是设计更低预算下仍能扰乱去噪轨迹的扰动结构。
未来方向
作者明确提出的方向是开发保护去噪最早步骤的防御机制,因为本文表明流匹配VLA的'鲁棒性'主要是忽略了去噪ODE的攻击假象。基于本文成果可延伸的方向包括:第一,将攻击面分析推广到其他流匹配或连续动作生成策略(Diffusion Policy、Octo),验证'早期速度场脆弱'是否为流匹配机制的普遍性质。第二,研究测试时补丁与训练时后门为何在'攻击步数'上规律相反的更深层数学根因,可能对输入空间对抗优化理论有启发。第三,把'幻影抓握'这类失败模式逆向用于鲁棒性诊断,识别策略最易崩溃的行为子空间。第四,探索对抗训练或去噪轨迹正则化作为防御,特别是针对早期步骤的速度场。第五,将DRIFT扩展到真实物理机器人与多相机设置,评估打印补丁的真实可移植性与对抗清洗、随机化相机视角等防御的组合效果。
复现评估
论文复现性总体良好。攻击配置充分:补丁为$32\times32$(π0)或$64\times64$(π0.5)像素,贴于腕部图像底部中央(Table 4给精确坐标,π0为$(192,96)$),PGD迭代500次、步长$\alpha=0.01$、从均匀灰色初始化,每次迭代从696帧LIBERO腕部观测池采样。受害者为公开π0/π0.5 LIBERO微调检查点,冻结。评估协议明确:四套件每任务10回合共100 episodes/suite,patch仅用libero spatial训练后四套件通用评估,默认$K=10$步去噪、每5步重查询策略,每配置$4\times100=400$回合、3种子。基线复现(附录A.3)详给UADA(最大化最终动作块平方偏差、反向传播全$K$步rollout)与EDPA(PaliGemma塔上InfoNCE+图文对齐,EMA平衡)的损失与超参。算力仅需单张RTX 3090(24GB)。主要缺口是未明确开源代码/补丁权重,且白盒梯度需访问冻结策略权重;但所给超参与损失公式足以复现主要结果。
论文图表
图展示JPEG压缩作为防御在四套件上的效果:ASR随JPEG质量因子$Q$的变化。ASR随$Q$下降而递减;温和压缩($Q\ge75$)时DRIFT在Spatial和Object仍较有效(75-100%),Goal较弱且多变(38-94%);当$Q\lesssim50$-60时攻击在Spatial/Goal/Object上基本被阻断(ASR降至0-12%)。Long套件例外,在最强压缩($Q=10$)下仍残留16-21%的ASR,约为其他三套件的4倍。
这张图评估了廉价防御的可行性,同时也指出其局限(Long套件残留攻击),对实际部署安全与未来防御研究有直接参考价值。