← 返回 2026-08-21

向前听:下一补丁嵌入预测赋能可扩展音频学习器 Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic 📅 2026-08-20 👍 6 2026-08-26 18:30
Transformer 自回归预测 自监督学习 表征学习 音频表示学习 音频预训练

因果Transformer预测下一音频补丁嵌入,仅凭掩码加停梯度实现极简SOTA音频自监督

前置知识

自监督学习(SSL)

不依赖人工标注、从数据自身构造监督信号的预训练范式。典型做法包括掩码重建(MAE)、对比学习、学生-教师蒸馏、联合嵌入预测等,模型先在海量无标签数据上预训练,再迁移到下游任务微调。

本文属于音频自监督学习,理解各类SSL配方(重建、蒸馏、预测)的差异才能体会NAPE的极简之处。

掩码频谱建模

音频SSL主流范式:把log-mel频谱图切成patch,随机遮住一部分,让编码器结合双向上下文重建被遮内容(如Audio-MAE),或预测tokenizer提供的离散声学单元(如BEATs)。需要解码器或tokenizer配合。

NAPE正是针对这一范式组件繁重的痛点提出的替代方案,是论文对比的主要基线家族。

因果注意力掩码

Transformer中的下三角注意力掩码:位置t只能看到位置1到t的token,看不到未来位置。GPT类语言模型用它实现自回归下一词预测,训练时虽然并行计算但语义上逐位生成。

NAPE把GPT的因果掩码搬到频谱图patch序列上,是方法成立的前提;消融显示去掉它性能暴跌。

Stop-gradient(停梯度)

把张量标记为常数、切断反向传播的操作。在自监督损失中对目标分支加stopgrad后,梯度只从预测侧回传,防止编码器通过同时优化损失两边来走捷径坍塌。

它是NAPE防表征坍塌的三大机制之一,消融证明去掉它预训练直接发散。

表征坍塌

自监督训练的失效模式:编码器把所有输入映射到同一个(或低范数)常数向量,损失看似很低但表征毫无信息。 cosine相似度因对幅度不敏感可避免缩到零的坍塌,而L1/L2距离则不能。

理解坍塌的成因与对策,才能看懂为何NAPE只需三个机制而JEPA家族需要EMA教师或正则器。

log-mel频谱图与patch化

把波形经短时傅里叶变换映射到mel刻度后取对数得到的时频表示(本文128 mel带、25ms窗、10ms hop)。再切成16×16的不重叠patch,每个patch投影为一个嵌入向量,类似ViT处理图像。

NAPE的全部输入表示与预测目标都建立在这套patch嵌入之上,扫描顺序也定义在patch网格上。

线性探测(Linear Probing)

冻结预训练编码器,只在其输出特征上训练一个线性分类器,用以衡量特征的线性可分性。是比微调更严格的表征质量检验,对预测式SSL方法通常明显偏低。

论文用线性探测评估表征质量,并发现最佳探测层位于编码器中部而非顶层。

研究动机

音频自监督学习近年主要沿两条路线演进:掩码频谱建模(Audio-MAE、MaskSpec等直接对频谱图patch做MAE式重建)和学生-教师蒸馏(BEATs需迭代训练声学tokenizer提供离散目标,EAT结合重建与data2vec式潜在目标,SSLAM额外引入音频混合监督,SPEAR蒸馏多个专门教师)。为达到竞争性能,这些方法依赖越来越繁复的预训练配方:重建解码器、单独预训练的tokenizer、EMA更新的教师编码器、方差-协方差等辅助正则损失。每加一个组件都带来额外超参数、工程复杂度和新的训练不稳定来源。与此同时,「预测下一个元素」的自回归范式在语言(GPT)和视觉(NEPA等next-embedding方法)中大放异彩,并扩展到点云(PointNTP)与世界模型(LeWorldModel),但在音频SSL中完全缺失——尽管音频沿明确的时间轴展开、序列结构是信号内在属性而非外加假设,理论上是最适合自回归预测的模态。

本文的目标是本文的目标是验证一个极简的因果预测范式能否成为音频表示学习的有力竞争者:训练一个因果Transformer,仅凭因果注意力掩码和stop-gradient作为训练信号,从频谱图已见patch预测下一个patch的连续嵌入,不使用重建解码器、声学tokenizer、学生-教师结构或任何辅助正则损失。具体而言,作者希望在AudioSet无标签数据上预训练的模型,在六个音频与语音基准(AudioSet-2M/20K、ESC-50、Speech Commands V1/V2、IEMOCAP)的微调上达到或超越现有精心设计的SSL方法;在Small(19M)、Base(85M)、Large(303M)三个模型规模上展现一致的正向扩展性;并通过系统消融收敛出一套最优配置,为音频建立与语言模型同构的统一预训练接口。

与已有工作不同的是,本文的独特切入有三点。其一,首次把「下一嵌入预测」从视觉搬到音频,抓住音频相比图像的本质优势:频谱图有强时间轴,因果顺序不是外加的而是声学事件在时间中自然展开的反映。其二,指出在因果范式下「扫描顺序」从无关紧要的实现细节升格为核心设计轴——双向注意力下自注意力对置换等变,线性化方式不影响结果;而因果掩码下不同扫描顺序决定了每一步可用的因果上下文,作者系统比较了raster、time-major、zigzag、diagonal四种顺序,这是音频特有的新设计维度。其三,证明防坍塌只需三个互相咬合的机制——因果性、预测偏移、stop-gradient——无需JEPA家族的EMA教师或SIGReg等正则器,把预训练配方压缩到极致,并回答了「逐位置因果预测是否与非平稳、时间结构化的音频信号兼容」这一悬而未决的问题。

核心方法

直觉上,NAPE让模型像GPT预测下一个词一样「听向前方」:看完频谱图前面若干patch后,猜下一个patch的嵌入是什么。猜得准,说明模型内化了音频的时频结构与声学事件演化规律。技术路线:先把16kHz单声道波形成log-mel频谱图(128 mel带、25ms窗、10ms hop),10秒片段得 $1 \\times 128 \\times 1008$ 的时频图;再用 $16 \\times 16$ 步幅Conv2d切成不重叠patch并投影为 $d$ 维嵌入,每片段504个token;按选定扫描顺序把2D网格线性化为1D序列;送入带因果注意力掩码的ViT式Transformer,配双轴RoPE、LayerScale和query-key归一化保证深层稳定;最后轻量predictor在每个位置 $t$ 输出 $\\hat{z}_{t+1} = g(h(z_{\\leq t}))$,与真实嵌入 $z_{t+1}$ 计算负余弦相似度,目标侧加stop-gradient。下游微调时关闭因果掩码改用双向注意力,平均池化后接线性分类头。

核心创新是把学习信号完全压缩进「时间预测」本身,并用三个互相咬合的机制保证训练不塌缩:(i) 因果性——因果掩码禁止位置 $t$ 看到 $t$ 之后的patch,封死「直接看到答案」的恒等捷径;(ii) 预测偏移——模型在位置 $t$ 预测的是位置 $t+1$ 的嵌入而非自身输入,使因果性无法被「复制当前输入」绕过;(iii) stop-gradient——目标嵌入视为常数,梯度只从预测侧回传,否则编码器会把损失两边一起拉向共享常数。消融显示三者缺一不可:去掉偏移或stopgrad预训练直接发散;去掉因果掩码虽不发散但性能暴跌(AS-2M掉7.8 mAP、AS-20K掉14.3、ESC-50掉25.4点),因为损失在几千步内就饱和到−1。这个设计与SimSiam形似(不对称预测器+stopgrad防坍塌),但本质不同:SimSiam比较同一输入的两个增强视图,NAPE用序列内的时间预测替代视图增强;与JEPA的本质区别在于预测目标直接来自共享的浅层embedding层 $f$,它不随编码器迭代更新、天然稳定,从而免除EMA教师。

方法步骤详情

第一步,输入表示:波形重采样为16kHz单声道,转成10秒、128 mel带的log-mel频谱图 $x \\in \\mathbb{R}^{1 \\times 128 \\times 1008}$(25ms窗、10ms hop)。第二步,patch化:切成 $8 \\times 63 = 504$ 个 $16 \\times 16$ 不重叠patch,经Conv2d嵌入层 $f$ 投影为 $d$ 维嵌入序列 $\\{z_1,\\dots,z_N\\}$。第三步,扫描线性化:从raster、time-major、zigzag、diagonal四种顺序中选一(详见Figure 2)。第四步,因果编码:$h$ 为pre-norm ViT,分Small($d{=}384$、约19M)、Base($d{=}768$、约85M)、Large($d{=}1024$、约303M)三档,因果掩码下自回归处理序列。第五步,预测与损失:SimSiam式三层MLP预测器 $g$ 输出 $\\hat{z}_{t+1}$,损失 $\\mathcal{L} = \\frac{1}{N-1}\\sum_{t=1}^{N-1} D(\\mathrm{stopgrad}(z_{t+1}), \\hat{z}_{t+1})$,$D$ 为负余弦相似度;AdamW优化(学习率 $5 \\times 10^{-3}$、cosine衰减、weight decay 0.05),batch 256/128,Small/Large训25个epoch、Base训30个epoch,数据为AudioSet无标签约198万片段。第六步,下游适配:关闭因果掩码改用双向注意力,平均池化后接线性分类头,配SpecAugment、Mixup、CutMix等标准增强微调;线性探测则冻结编码器只训分类器和一个LayerNorm。

技术新颖性

技术新颖性体现在四点。第一,范式首创:NAPE是第一个基于因果next-patch-embedding预测的音频自监督框架,填补了音频SSL在自回归预测方向的空白,此前该范式只出现在视觉(NEPA)、点云(PointNTP)和世界模型(LeWorldModel)中。第二,极简防坍塌:仅凭因果掩码、预测偏移、stop-gradient三个零成本机制避免表征坍塌,而JEPA家族需要EMA教师或VICReg/SIGReg正则器;附录分析显示用第一编码器层做目标会发散、$\ell_1$/$\ell_2$ 损失会向零范数坍塌,反衬出「浅层共享embedding层做目标+余弦相似度」这组搭配的精妙。第三,音频特有设计轴的首次系统研究:发现「随时间推进」的顺序(raster/diagonal/zigzag)远胜先扫满频率再推进时间的time-major,揭示了时间上下文累积对音频分类的决定性作用。第四,工程化稳定配方:双轴RoPE比绝对位置编码在AS-2M/AS-20K分别高1.8和2.4 mAP,加上LayerScale与QK归一化,保证了303M深层因果模型在整个预训练过程中的稳定收敛。

Left: NAPE's overview. Middle: The NAPE pipeline. Right: Encoder architecture (h).
Figure 1: Left: NAPE's overview. Middle: The NAPE pipeline. Right: Encoder architecture (h).
Patch scanning orders.
Figure 2: Patch scanning orders.
Comparison between JEPA, LeWorldModel, and NAPE architectures.
Figure 9: Comparison between JEPA, LeWorldModel, and NAPE architectures.

实验结果

(1)三组件消融(Table 1):去掉预测偏移或stop-gradient预训练发散;去掉因果掩码后AS-2M跌7.8 mAP(49.6→41.8)、AS-20K跌14.3、ESC-50跌25.4点。(2)设计轴消融:Conv2d patch嵌入全面最优(Convstem/Speechstem在AS-20K分别−4.8/−6.0);1.8M参数SimSiam式MLP预测器胜过14.2M的Transformer预测器;patch嵌入与raw mel做目标相当,第一编码器层做目标发散;余弦相似度最优($\\ell_1$/$\\ell_2$发散、交叉熵更差);扫描顺序diagonal与raster领先、time-major全面垫底。(3)主结果(Table 6):NAPE-L raster在AS-2M达50.2 mAP与SSLAM持平,超过A-JEPA(48.6)、EAT(48.6)、BEATs(48.0)、Audio-MAE(47.3);AS-20K 40.5略逊SSLAM的40.9;ESC-50达96.0-96.2%;IEMOCAP达68.0-68.8%,比任意规模最强基线BEATs(64.5%)高3.5-4.3点。(4)扩展性(Fig 4/5):每个规模全面超过Audio-MAE,Small档优势最大(AS-2M +2.6、AS-20K +4.1 mAP),Base到Large斜率更陡。(5)线性探测(Table 7):AS-2M上23.2/25.0/27.1 mAP随规模增长,最佳探测层在中部(第2/6/11层)。(6)定性(Fig 7):预测与真实嵌入余弦相似度接近1.0,注意力聚焦当前时间列加同频率历史。(7)效率:仅6个epoch预训练NAPE-L即达AS-2M 49.45 mAP;随机掩码无益甚至有害(50%时AS-20K −1.0)。

Ablation on main NAPE's design elements: prediction shift, stop-gradient, and causal objective.
Table 1: Ablation on main NAPE's design elements: prediction shift, stop-gradient, and causal objective.
Ablation on the patch embedding layer.
Table 2: Ablation on the patch embedding layer.
Ablation on the predictor-style variants.
Table 3: Ablation on the predictor-style variants.
Ablation on NAPE's target to predict.
Table 4: Ablation on NAPE's target to predict.
Ablation on the similarity function.
Table 5: Ablation on the similarity function.
Comparison with audio methods on audio and speech downstream tasks.
Table 6: Comparison with audio methods on audio and speech downstream tasks.
Linear probing results.
Table 7: Linear probing results.
Hyperparameter list.
Table 8: Hyperparameter list.
NAPE's performance across four scan orders on six benchmarks.
Figure 3: NAPE's performance across four scan orders on six benchmarks.
Scaling comparison between Audio-MAE and NAPE, raster.
Figure 4: Scaling comparison between Audio-MAE and NAPE, raster.
NAPE's results at different scales under raster and diagonal scan orders.
Figure 5: NAPE's results at different scales under raster and diagonal scan orders.
Layer-wise linear probing analysis.
Figure 6: Layer-wise linear probing analysis.
Top: Prediction Quality Analysis. Bottom: Attention/Embedding Analyses.
Figure 7: Top: Prediction Quality Analysis. Bottom: Attention/Embedding Analyses.
Pre-training budget ablation. AS-2M (left) and AS-20K (right) mAP trend as a function of the number of pre-training epochs.
Figure 8: Pre-training budget ablation. AS-2M (left) and AS-20K (right) mAP trend as a function of the number of pre-training epochs.
Pre-training loss curves for multiple NEPA models across scales and configurations.
Figure 10: Pre-training loss curves for multiple NEPA models across scales and configurations.
查看结构化数据
任务指标本文基线提升
AudioSet-2M 音频标注(多标签) mAP 50.2(NAPE-L raster) Audio-MAE 47.3;SSLAM 50.2 +2.9 对比 Audio-MAE,与SSLAM持平但无需其重型配方
AudioSet-20K 音频标注(多标签) mAP 40.5(NAPE-L raster) Audio-MAE 37.1;SSLAM 40.9 +3.4 对比 Audio-MAE,−0.4 对比 SSLAM
ESC-50 环境声分类(5折) top-1 准确率 96.2%(NAPE-L diagonal) A-JEPA 96.3%;Audio-MAE 94.1% +2.1 对比 Audio-MAE,−0.1 对比 A-JEPA
IEMOCAP 语音情感识别(4类,5折) 准确率 68.8%(NAPE-L diagonal) BEATs iter3 64.5%(任意规模最强基线) +4.3
Speech Commands V1 关键词检测 top-1 准确率 98.2%(NAPE-L diagonal) ASiT 98.2%;SSLAM 98.8% 与ASiT持平(任务已饱和)
Speech Commands V2 关键词检测 top-1 准确率 98.9%(NAPE-L diagonal) ASiT 98.9% 持平
AS-2M 线性探测(冻结编码器) mAP 27.1(NAPE-L,第11层) NAPE-S 23.2(第2层) +3.9(随模型规模正向扩展)

局限与改进

作者承认的局限:线性探测绝对值明显低于微调(AS-2M上27.1对50.2 mAP),因为预测目标与线性可分性天然不对齐;关键词任务已饱和、扩展增益小;Base到Large的增益递减。我的补充观察:第一,评估全部集中在分类任务,没有语音识别、声音事件检测、检索或生成任务,因果预测学到的表征是否适合序列到序列任务尚属未知;第二,只在AudioSet一个预训练数据集上验证,数据规模与多样性维度的扩展曲线缺失;第三,扫描顺序是每个模型的全局硬选择,没有探索混合顺序或可学习顺序;第四,预训练用因果掩码而微调切换到双向注意力,存在训练-微调不一致(消融显示因果加最后token池化仅低0.2 mAP,但这一错配值得专门研究);第五,自回归目标对序列每个位置都要计算预测损失,与MAE式高掩码率的稀疏计算相比的效率权衡未讨论;第六,预测的是连续嵌入,模型不含似然、无法直接解码生成音频,与当前音频生成大模型的潮流缺少天然接口。

独立分析的弱点

(1)线性可分性弱:预训练目标鼓励支持下一patch预测的特征而非类别可分特征,冻结特征下AS-2M仅27.1 mAP。改进方向:在中层加辅助对齐损失,或将NAPE作为教师蒸馏给双向编码器。(2)目标语义层次受限:目标来自浅层Conv2d嵌入,语义层次较低——raw mel与patch embed性能相当从侧面印证了这一点;换更深层目标会发散,根源是缺少稳定深层目标的机制。可借鉴LeWorldModel引入轻量正则(如SIGReg)换取更深层目标,但这会牺牲极简性,是配方简洁与目标语义之间的根本权衡。(3)扫描顺序单一固定:不同音频事件有不同的时间粒度,固定顺序可能对某些任务次优,可探索多顺序联合训练或顺序集成。(4)时间上下文有限:504个token只覆盖10秒,对会议、音频文档等长音频需要层次化压缩或更长上下文,RoPE的长序列外推能力也未测试。(5)错失流式推理优势:因果结构天然支持低延迟流式逐块推理,但论文微调时切回双向注意力,未展示实时场景的价值。(6)无不确定性建模:点预测损失不含似然,无法量化预测置信度,限制了在主动学习、数据过滤中的应用。

未来方向

作者明确表示这项工作「打开了把因果预测范式引入音频表示学习的直接道路」。可延伸的方向:第一,规模化验证——在更大模型与更多数据源(AudioSet之外加上VGGSound、LibriSpeech等)上检验扩展律是否延续、是否出现涌现能力;第二,统一音频理解与生成——把连续嵌入预测与潜在扩散或流匹配解码器结合,让同一自回归骨干既能理解又能生成音频;第三,对接音频语言模型——NAPE编码器的因果性使其可作为音频LLM的天然音频前端,实现端到端自回归的音频-文本联合建模;第四,世界模型化——借鉴LeWorldModel把预测条件化于动作或上下文,构建音频场景的潜在空间世界模型;第五,流式与边缘部署——利用因果结构做实时字幕、在线声学监控等低延迟应用;第六,目标层次化——用动量编码器或轻量正则稳定更深层目标,获取更语义化的表征;第七,自适应扫描顺序——按任务或内容动态选择或融合多种扫描顺序,甚至学习顺序本身。

复现评估

复现条件较好。论文标注了项目主页与代码链接,代码开源意愿明确;Table 8完整列出预训练与全部下游任务的超参数(优化器、学习率、层间学习率衰减、增强组合、EMA、损失函数、各数据集归一化统计量),附录C/D补充了线性探测设置与全部消融细节,透明度高。预训练数据为AudioSet无标签子集(实际获取1,964,222条unbalanced加20,961条balanced),需要自行从YouTube下载处理,这是最大的工程成本。算力门槛适中:NVIDIA L40S(46GB)8卡即可预训练,Base约4卡、Large 8卡,batch 256/128,25-30个epoch;每个下游任务微调仅需1-4卡,属于学术实验室可承受范围。方法本身没有脆弱组件(无EMA、无tokenizer、无教师),失败模式(发散、坍塌)在附录F中有清晰的损失曲线描述与诊断,训练稳定性好。总体难度评级:中等——瓶颈在AudioSet数据管道而非训练本身;若官方代码发布,剩余主要不确定性只在非平衡集视频源的获取完整性。