← 返回 2026-08-14

从不可听输入到模型失效:大型音频语言模型的低频安全风险 From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou, Haoran Gao, Kun Wang, Chen Li, Li Sun, Sen Su 📅 2026-08-10 👍 10 2026-08-19 18:30
低频信号 大型音频语言模型 对抗攻击 红队测试 音频安全 鲁棒性防御

用人耳不可闻的低频波形黑盒攻击音频大模型,准确率最多降67个百分点,并提出DRG防御

前置知识

大型音频语言模型(LALM)

把声学编码器与语言模型拼接的多模态系统:音频前端将采样波形切分为连续的音频 token(如 Qwen2.5-Omni、StepAudio2、MiniCPM-o),再交给语言模型做语音识别、音频问答、翻译、情感分类等开放生成。关键在于模型的输入面由音频前端决定,而非人耳感知。

本文攻击的全部前提是音频前端能接收人耳听不到的信号,后续的注意力分析和 DRG 防御也都建立在理解 LALM 内部音频 token 表示机制之上。

人耳可听域与次声

人耳大致在 20Hz–20kHz 范围内有听觉,20Hz 以下称为次声。论文引用测量表明商用扬声器和驻极体麦克风在 0.5–20Hz 仍保持非零响应,智能手机麦克风在非隔声环境下也能测到次声能量(如爆炸信号集中在 10–20Hz 附近)。

攻击把扰动完全放在 5–20Hz 频带,形成感知边界错位:模型听得见、用户听不见,这正是隐蔽性的物理来源,也是附录 A 讨论物理链路可行性的基础。

短时傅里叶变换(STFT)与谱质心

STFT 对信号分窗做 FFT,得到时频矩阵 $X_x \in \mathbb{C}^{U_x \times V}$。谱质心 $\xi_x[u]$ 是第 u 帧幅度的频率加权中心,即 $\xi_x[u] = \sum_v \nu_v |X_x[u,v]| / \sum_v |X_x[u,v]|$,刻画局部谱能量落在哪个频率位置。

Frequency Confusion Transfer 用逐帧谱质心把语料的声学动态量化为低频状态序列;DRG 也用 STFT 幅度谱构造检测描述子,两者都依赖这一基础工具。

因果自注意力矩阵

Transformer 每层每头的自注意力 $A^{l,h}$ 中,当前 token 只能关注过去位置,形成下三角结构。对 $L$ 层 $H$ 头取平均并对每行做因果归一化 $P[p,q] = B[p,q]/(\sum_{a=0}^{p} B[p,a]+\varepsilon)$ 后,矩阵元素的绝对值大小反映局部注意力质量的分布。

Sentence Attention Scale Estimation 直接对参考模型的音频 token 注意力做跨边界切片统计来估计句级时长,是攻击时序设计的核心;Table 6 的机理分析也依赖注意力质量的度量。

黑盒通用迁移攻击

攻击者不访问、不查询目标模型,只用一个固定的参考模型离线构造一个扰动,使其对不同测试样本和不同目标模型都有效。与之相对的是白盒攻击(需要梯度)和样本特定攻击(逐条优化)。

ILL 只用 Qwen2.5-Omni 构造一次波形就迁移到包括 GPT-audio-mini、Gemini-3.5-flash 在内的六个模型,这种通用性决定了威胁的现实严重程度。

WER 与 BLEU

WER(词错误率)是语音识别的标准指标,计算识别结果与参考文本之间的编辑距离比例,越低越好;BLEU 是机器翻译的 n-gram 精度指标,越高越好。

论文用 WER 评价 LibriSpeech 识别、用 BLEU 评价 CoVoST2 英中翻译在攻击下的退化程度,是 Figure 2 和 Table 4 中结果解读的基础。

研究动机

大型音频语言模型正被广泛用于语音交互与通用音频理解,但它们的输入面由音频前端而非人耳决定:一段足够低频的信号可以进入模型前端,却对用户完全不可闻,造成模型可用的声学证据与用户感知之间的错配。已有研究显示恶意或损坏的音频输入会危及任务表现与安全——对抗音频可操纵模型行为(Carlini and Wagner 2018 等),声学损坏会降低理解能力与安全表现(Yin et al. 2026 等)——但这些工作要么依赖可听噪声,要么需要白盒访问或逐条语句优化(如 Audio-Adv 针对 DeepSpeech 的白盒攻击、DolphinAttack 的超声命令注入),攻击面集中在命令识别而非 LALM 的开放生成。与之不同,一段与人无关、固定的低频物理信号所造成的可用性风险此前未被系统研究;而测量表明商用扬声器与驻极体麦克风在 0.5–20Hz 保持非零响应,智能手机麦克风在次声段亦有可测响应,说明这条隐藏信道在物理上真实可达。

本文的目标是本文的目标分三层。第一,识别并形式化低频不可听输入给 LALM 带来的安全风险:设计一个黑盒红队方法 ILL,用离线构造、对所有测试样本和目标模型固定的通用波形,在用户说话时通过扬声器发射、与语音在空气中自然叠加,评估其对音频问答、语音识别、语音翻译、情感分类四类任务的破坏能力,并用客观指标(可听带能量占比 ANR)与主观指标(112 人 7 分制评分)双重验证隐蔽性。第二,打开模型内部,用注意力质量、表征余弦相似度、输出置信度等统计量解释失效来源。第三,提出轻量级检测与恢复机制 DRG:在推理前检测低频分布偏移,仅对受扰输入请求第二次录音做联合语义恢复,并在多种其他攻击下检验该机制的泛化性,同时量化其对良性输入的效用代价。

与已有工作不同的是,本文的独特切入点有三。其一,攻击目标从语义转向可用性:不同于音频越狱或对抗命令注入试图控制模型输出,ILL 只让人听不见的低频能量干扰声学证据流,使模型答错、译乱、置信度失真,用户却毫无察觉。其二,攻击构造完全离线且通用:不访问目标模型,而是用语料在参考 LALM 上的注意力统计决定激活时长(Sentence Attention Scale Estimation),用参考语料的谱质心动态决定低频频率序列(Frequency Confusion Transfer),得到一个跨样本、跨模型固定的模板。其三,防御思路从降噪修补转向条件式再采集:DRG 不试图清洗被污染的输入,而是先用 $O(V)$ 的无神经网络频谱描述子判断是否存在低频分布偏移,再让模型基于两次独立录音的一致内容作答,与主流的 MMSE-STSA、DFL 等信号处理增强路线形成鲜明对比。

核心方法

直觉上,人耳听不见的 5–20Hz 信号虽不含语义,但进入 LALM 音频前端后会污染承载语义的音频 token;若让信号以与句子节奏匹配的间歇方式发射,就能在模型处理连续语义的关键窗口反复锁定其注意力。技术路线分三步。第一步 Sentence Attention Scale Estimation:把训练集 $D$ 中每条录音 $x$ 过参考 LALM,得到 $L$ 层 $H$ 头的平均注意力 $\bar{A}=(LH)^{-1}\sum_l\sum_h A^{l,h}$,取音频 token 子矩阵 $B$ 并按行因果归一化 $P[p,q]=B[p,q]/(\sum_{a=0}^{p}B[p,a]+\varepsilon)$;在尺度 $w\in\{\rho,5\rho,10\rho\}$($\rho$ 为每秒 token 数)上比较候选边界 $b$ 两侧的跨段质量 $C_w(b)=\|P[R_{b,w},L_{b,w}]\|_{1,1}$ 与段内质量 $I_w(b)$,平滑平均得边界分数 $g(b)$,保留 $g(b)\ge m+d$(中位数加中位绝对偏差)的局部极大值,相邻边界间隔的中位数即为激活时长 $L_{on}$。第二步 Frequency Confusion Transfer:把低频区间 $[f_{min},f_{max}]$ 均分为 $n$ 个状态 $f_j=f_{min}+\frac{j-1}{n-1}(f_{max}-f_{min})$,用 STFT 谱质心把每帧量化到状态,统计语料级转移矩阵 $Q[j,k]=(c_{jk}+\alpha)/(c_{\to j}+n\alpha)$。第三步合成与调度:给定占空比 $\gamma$,由 $L_{off}=L_{on}(1-\gamma)/\gamma$、$T_{cyc}=L_{on}+L_{off}$ 得到间歇调度,把激活波形按 $\tau(t)=t \bmod T_{cyc}$ 周期重复,即得通用模板 $\delta^\star$。

ILL 与已有音频攻击的本质区别在于通用性、隐蔽性与结构化的三位一体。通用性:波形离线构造一次即固定,不查询、不适配目标模型和具体语句,却能迁移到从未参与构造的模型(最大降幅 67 个百分点恰好出现在未见的 StepAudio2 上)。隐蔽性:扰动全部位于 5–20Hz 次声带,可听带能量占比 ANR 仅 0.06–0.08%,人类评分 1.33 与干净音频 1.17 几乎无差。结构性:关键创新是把低频当成承载信息的载体——用语料的谱质心状态序列及其马尔可夫转移统计 $Q[j,k]$,通过强制相邻子段状态不同的动态规划解码出最可能路径 $s^\star=\arg\max\sum_k \log Q[s_{k-1},s_k]$,再合成相位连续波形 $\delta_{on}(t)=\beta e(t)\sin(2\pi\int_0^t \phi(u)du)$,端点包络归零避免爆音。消融证明这种结构化构造显著优于高斯噪声、固定频率与均匀扫频,即起作用的不是低频能量本身而是能量随时间的组织方式。防御端 DRG 的核心思想则是不修复、只补证:检测到低频分布偏移后请求第二次录音,指示模型只依据两段证据中一致且可理解的内容作答。

方法步骤详情

完整流程如下。步骤一(离线时长估计):输入 100 条训练录音与参考模型 Qwen2.5-Omni;对每条录音前向得到平均因果注意力 $P$,在三个尺度上计算边界分数 $g(b)$ 并取 $g(b)\ge m+d$ 的局部极大为边界,相邻边界间隔的中位数给出 $L_{on}$(跨数据集/参考模型稳定在 3.67–5.07 秒);给定占空比 $\gamma$ 计算 $L_{off}$ 与周期 $T_{cyc}$。步骤二(谱质心量化):对每条录音做 STFT 得 $X_x\in\mathbb{C}^{U_x\times V}$,计算逐帧谱质心 $\xi_x[u]$ 并按语料极值 $\xi_{min},\xi_{max}$ 线性映射到 $n$ 个低频状态,得到保留时间顺序的状态序列 $y_x$。步骤三(统计与解码):聚合全部序列统计状态频次 $c_j$ 与相邻转移 $c_{jk}$,经 Laplace 平滑得转移矩阵 $Q$;把每个激活段按时长归一化分为 $K=\mathrm{round}(T_{cyc}/\bar{T})+1$ 个等长子段,动态规划在强制相邻子段状态不同的约束下最大化转移对数似然,解码出状态路径 $s^\star$。步骤四(波形合成与部署):每子段持续 $\Delta=L_{on}/K$、频率为 $f_{s_k}$,按式 (10) 合成相位连续、包络平滑的激活波形,再按式 (11) 周期调度得 $\delta^\star$;攻击者用扬声器独立发射,所有对比方法在统一 RMS 预算($\beta=4$)下公平比较。步骤五(DRG 离线拟合):对干净与受扰训练录音提取 STFT 幅度按时间求和并 $\ell_1$ 归一化的描述子 $d_x\in\mathbb{R}^V$,K-means 聚成两簇,比较两簇在 $[f_{min},f_{max}]$ 内的平均描述子质量来标注干扰簇。步骤六(DRG 在线):对首录 $x^{(1)}$ 提取描述子并按最近质心分类(仅两次 $V$ 维距离,$O(V)$,无神经网络前向);判干净则直接推理,判受扰则请求第二次录音 $x^{(2)}$,将两段一起交给 LALM 并指示其只依据一致且可理解的内容作答。

技术新颖性

从技术新颖性看,本文在四个层面区别于已有工作。攻击面层面:DolphinAttack 用超声频段注入语音命令、Audio-Adv 需要白盒梯度、Whisper 通用攻击仍工作在可听带且面向 ASR 系统;ILL 首次把不可听信道拓展到 LALM 的开放生成任务,且只做可用性破坏、不注入任何语义指令,属于此前被忽视的风险类别。时序设计层面:激活时长不是人工设定,而是从参考模型自身注意力的多尺度统计中估计出来,且这一统计表现出惊人的跨数据集、跨参考模型一致性(3.67–5.07 秒,同数据集内最大跨模型差仅 0.50 秒),说明它捕捉到了不同 LALM 共享的句级语义处理节奏,这是通用迁移能够成立的深层原因。信号构造层面:把语料的谱动态经马尔可夫转移矩阵与约束动态规划搬移到次声带,并保证相位连续,这在音频攻击文献中是新组合。防御层面:DRG 用无神经网络的 $O(V)$ 频谱描述子加两簇 K-means 作为触发器,配合条件重采集与联合语义恢复,绕开了降噪路线在不可听干扰上失效的问题(实验显示 MMSE-STSA、LF-Suppression、DFL 均不如 DRG),且检测器完全不依赖对目标模型的查询。

Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.
Figure 1: Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.

实验结果

攻击有效性:在六个模型(MiniCPM-o 4.5、StepAudio2、Qwen2.5-Omni、Qwen3-Omni、GPT-audio-mini、Gemini-3.5-flash)× 四类任务上,固定波形全面退化性能。Table 1 中 RAVDESS 最大降幅为 StepAudio2 的 75.0%→8.0%(−67 个百分点),而该模型从未用于构造波形,直接证明黑盒迁移性;Qwen2.5 与 Qwen3 在 RAVDESS 上分别降 39 和 21 个百分点至 8.0%,Gemini 降 28 个百分点至 12.0%;MMAU 上各模型降 9–15 个百分点。附录 E 的细粒度统计显示 18 个模型-任务格中 ILL 全部低于干净基线,平均降 13.1、中位 11.0 个百分点(单侧配对 Wilcoxon $p=3.81\times10^{-6}$)。Figure 2 显示 ILL 在所有六个目标的 CoVoST2 翻译上都取得最低 BLEU。隐蔽性:Table 2 中 ILL 的 ANR 仅 0.06–0.08%,而所有对比攻击超过 98.9%;Figure 3 的 112 人 7 分制评分中 ILL 均值 1.33、中位数 1,接近干净音频的 1.17/1,最好的对比方法 Audio-Adv 也有 3.75、Whisper 3.92。统计对比:Table 13 显示 ILL 显著强于 Audio-Adv(18 格中 17 格更低,平均差 9.8 个百分点,Holm 校正 $p=3.81\times10^{-5}$)和 Whisper(18/18,11.3 个百分点,$p=2.29\times10^{-5}$),与高斯噪声及三类 PNL 环境噪声相当(校正后不显著)——关键结论是仅凭 5–20Hz 频带就能造成广泛退化。防御:Table 3 中 DRG 检测在 Average 训练条件下 F1 达 89.69–99.00%(RAVDESS 最难,F1 89.69%、精确率 81.30%、召回 100%);Figure 4 中干净二次采集把六模型平均受扰准确率从 28.5% 提升到 46.1%(+17.6 个百分点),优于 MMSE-STSA、LF-Suppression、DFL,持续干扰下仍高于无防御;Figure 5 显示该恢复机制在另外四种攻击的 24 个设置中 19 个最佳或并列最佳。良性代价:Table 4 中强制对全部干净输入重采集,12 项指标中 10 项变化不超过 0.03,两项分类反而提升。机理:Figure 6 消融表明幅度 $\beta$ 在 4 之前陡降其后饱和、占空比超过 70% 后收益递减、默认段长即阈值、状态序列构造显著优于高斯/固定频/均匀扫频;Table 6 显示攻击使音频注意力质量从 0.0416 降至 0.0373(MMAU)、0.0777 降至 0.0531(RAVDESS),表征余弦相似度从 1.0000 降至 0.8659 与 0.6309(DRG 后恢复约 0.96),正确答案概率从 0.8050 骤降至 0.1709(MMAU)、0.8240 降至 0.0179(RAVDESS),而最终答案的置信度下降少得多(0.805→0.636、0.824→0.777),即模型错而不自知,DRG 能把四项指标同时拉回接近干净水平。

Attack results on accuracy-based tasks. MMAU scores are averaged over its speech, sound, and music categories.
Table 1: Attack results on accuracy-based tasks. MMAU scores are averaged over its speech, sound, and music categories.
Audible noise ratio (ANR, %) for clean audio and seven interference methods across four datasets.
Table 2: Audible noise ratio (ANR, %) for clean audio and seven interference methods across four datasets.
Precision, recall, and F1 scores (%) for DRG interference detection under different detector training datasets.
Table 3: Precision, recall, and F1 scores (%) for DRG interference detection under different detector training datasets.
Benign task performance under standard clean inference and forced DRG requery.
Table 4: Benign task performance under standard clean inference and forced DRG requery.
Corpus-median attention-derived active-interval duration Lon in seconds across datasets and LALMs.
Table 5: Corpus-median attention-derived active-interval duration Lon in seconds across datasets and LALMs.
Internal attention, representation, and confidence statistics under clean, attack, and defense settings.
Table 6: Internal attention, representation, and confidence statistics under clean, attack, and defense settings.
Paired comparisons between ILL and the six attack baselines across the 18 model–task cells.
Table 13: Paired comparisons between ILL and the six attack baselines across the 18 model–task cells.
Attack effectiveness on translation and recognition.
Figure 2: Attack effectiveness on translation and recognition.
Human audibility ratings across 100+ responses.
Figure 3: Human audibility ratings across 100+ responses.
Defense effectiveness of DRG.
Figure 4: Defense effectiveness of DRG.
Recovery under four additional attack types.
Figure 5: Recovery under four additional attack types.
ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.
Figure 6: ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.
查看结构化数据
任务指标本文基线提升
RAVDESS 情感分类(StepAudio2,未见迁移目标) 准确率 8.0%(ILL 攻击) 75.0%(干净音频) 下降 67 个百分点
RAVDESS 情感分类(六模型平均,防御评估) 准确率 46.1%(DRG + 干净二次采集) 28.5%(无防御) 提升 17.6 个百分点
MMAU 音频问答(Qwen3-Omni) 准确率 59.3%(ILL 攻击) 74.7%(干净音频) 下降 15 个百分点
可听带扰动能量占比(四数据集) ANR(%) 0.06–0.08%(ILL) 98.93–100.00%(高斯/PNL/Audio-Adv./Whisper) 低约三个数量级
人耳可闻度评分(112 名被试,7 分制) 平均评分(越低越隐蔽) 1.33(中位数 1) 1.17(干净);3.75(Audio-Adv.);3.92(Whisper) 与干净音频几乎无异
DRG 低频干扰检测(Average 训练条件,四数据集) F1(%) 89.69–99.00% 无同类检测基线;对比方法为降噪增强(MMSE-STSA 等) 各数据集召回均达 97–100%
CoVoST2 英中语音翻译(六个目标模型) BLEU 在全部六个目标上取得最低 BLEU(Figure 2) 干净音频及其他四种攻击 生成式任务上退化幅度最大

局限与改进

作者明确承认的局限有三点:出于负责任评估的考虑,未在无控真实场景部署 ILL;实验模拟的是麦克风接收到的波形,没有复现从扬声器经真实声学环境到麦克风的完整物理链路,器件与环境相关的效应留待受控物理评估;机理分析只刻画了注意力、表征与置信度的变化,属于相关性证据而非完整因果机制。我的补充观察:其一,物理可行性存在不小门槛——附录 A 引用的次声源是 3.8 公里 standoff 的旋转声源与旋转低音炮等特制装置,常规扬声器受质量控制的辐射阻抗限制,低频辐射效率很低,现实攻击需要大功率低音设备,这削弱了随手可实施的威胁图景;其二,DRG 的检测频带与 ILL 的构造频带共用同一 $[f_{min},f_{max}]$ 区间,攻击者把能量移到区间之外或采用更缓慢的准周期调制可能规避检测;其三,判为受扰后需要用户再说一遍,交互延迟与用户负担未量化,且 Figure 4 显示二次录音本身受扰时恢复收益大幅缩水;其四,每个数据集仅采样 100 例(MMAU 聚合 300 例),统计功效有限,人机研究被试为 112 名无报酬学生,代表性受限;其五,闭源 API 模型的结果会随版本漂移,可比较性随时间衰减。

独立分析的弱点

独立分析后我认为有以下值得注意的弱点。第一,检测器与攻击共享同一频带假设:DRG 的两簇 K-means 标签依赖 $[f_{min},f_{max}]$ 内平均质量,攻击者只需把干扰能量移出该区间(例如压到 5Hz 以下或用扫频躲避)就可能让检测失效,改进方向是宽带次声监测、多分辨率异常检测而非固定带内二分类。第二,恢复机制的单点依赖:联合语义恢复完全押注在第二次录音的质量上,攻击者持续发射时(noisy second recording)收益骤减,论文自己也承认这一点;改进方向包括多帧投票、麦克风阵列波束成形、或在模型侧直接滤除次声带 token,把防御从交互层下沉到表示层。第三,机理深度不足:Table 6 只建立相关性,尚不清楚低频 token 究竟通过何种通路(音频编码器的时域卷积?注意力温度?)劫持证据流,可用注意力消融与因果干预实验定位。第四,评测规模偏小:每数据集 100 例、人机研究 112 人,对 67 个百分点这样大的效应足够,但 DRG 检测边界(如 RAVDESS 精确率仅 81.30%)在更大规模下是否稳定存疑。第五,威胁模型单薄:ILL 只能造成无差别退化,不能定向操纵输出,与能注入命令的对抗攻击相比危害上限较低;若能与语义攻击级联(先降级再诱导)价值会更大,但这也带来更高的滥用风险,需要与防御研究同步推进。

未来方向

作者指出的方向包括:在受控条件下进行真实声学链路的物理部署评估,验证从发射、传播到麦克风接收各环节对 5–20Hz 分量的增益与相位影响;开展更深入的机制研究,弄清低频干扰如何改变模型对声学证据的使用。基于本文成果可以自然延伸的方向有:其一,把感知边界错位(perception boundary mismatch)作为一类通用威胁推广到其他模态,例如视觉系统的红外/紫外信道、超声触觉接口;其二,在音频前端加入可学习的高通/陷波预处理并与 DRG 的条件重采集融合,形成分层防御,同时用次声干扰做训练时数据增广以获得内生鲁棒性;其三,建立感知对齐评测基准——系统化度量模型行为与用户可感知内容的一致性,把本文的单点发现变成可横向比较的社区标准;其四,把 DRG 的被动检测升级为主动感知策略,让模型在低置信或证据冲突时主动请求用户重复或澄清,这与当前语音助手的不确定性处理研究可以衔接;其五,从归因角度研究不同 LALM 音频编码器对频率成分的敏感性差异,解释为何 StepAudio2 受扰最重而 MiniCPM 相对抗性更好。

复现评估

复现基础较好但无官方代码。数据全部公开:MMAU(speech/sound/music 三子集)、LibriSpeech、CoVoST2 英中方向、RAVDESS,PNL 提供三类环境噪声;每数据集采样 100 例测试、另用不相交的 100 例构造 ILL,划分方式在附录 C 有明确说明。模型方面四个开源(MiniCPM-o 4.5、StepAudio2、Qwen2.5-Omni、Qwen3-Omni)加两个闭源(GPT-audio-mini、Gemini-3.5-flash),构造波形只需对 100 条录音在 Qwen2.5-Omni 上做前向提取注意力,其余全部是经典信号处理(STFT、谱质心、K-means、Laplace 平滑、约束动态规划),单张消费级 GPU 即可完成。论文公式完备(式 1–14),附录 D 统一了各攻击的 RMS 能量预算($\beta=4$),附录 B 给出 DRG 的复杂度分析,附录 F 描述了人机研究协议,方法层面足以复现。主要不确定性:论文未提及开源代码链接,注意力切片统计与 DP 解码的实现细节需要自行摸索;闭源模型结果会随 API 版本漂移;部分超参($n$、$f_{min},f_{max}$ 的精确取值)需从 5–20Hz 的描述中推断。综合评估复现难度为中等,熟悉音频信号处理与 LALM 推理的研究者约一到两周可复现主要结果。