← 返回 2026-07-31

AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏 AMRD: Adaptive Multi-Teacher Relational Distillation for Lightweight Speech Emotion Recognition

Yuqi Li, Yi-Cheng Lin, Xianglong Wang, Kuo Yang, Xiaoqin Feng, Yixuan Wang, Huiran Duan, Yingli Tian 📅 2026-07-28 👍 1 2026-08-05 19:06
多教师学习 情感计算 知识蒸馏 自监督学习 语音情感识别

自适应多教师蒸馏框架,用单类SVM加权与关系相似矩阵损失压缩语音情感模型到边缘设备

前置知识

知识蒸馏(Knowledge Distillation, KD)

知识蒸馏是一种模型压缩技术:训练一个轻量的“学生”模型去模仿一个大型“教师”模型的输出分布,而非只学习真实标签。经典做法(Hinton等)是用带温度 $T$ 的 softmax 软化教师 logit,最小化学生与教师软目标之间的 KL 散度,损失为 $L_{KD} = T^2 \cdot \mathrm{KL}(\log \sigma(s/T) \| p_T)$。软目标携带了类间相似性的“暗知识”,比硬标签信息更丰富,因此小模型能逼近大模型的泛化能力。

AMRD 的全部工作都建立在 KD 之上,论文对比的所有基线(KD、DKD、CKD、RKD)都是 KD 的变体,理解标准 KD 是读懂本文改进之处的前提。

语音情感识别(Speech Emotion Recognition, SER)

SER 旨在从语音信号中识别情感状态,支撑人机交互、心理健康监测、呼叫中心分析等应用。任务难点在于情感标注本身具有主观性,且说话人在韵律、说话风格上的差异阻碍跨说话人泛化。常用基准 IEMOCAP(约 12 小时、10 位说话人、5 个 session,取愤怒/高兴/中性/悲伤 4 类、留一会话 5 折评估)和 CREMA-D(7442 条、91 位演员、6 类、5 折),评价指标为加权准确率 WA 和非加权准确率 UA。

SER 是 AMRD 的目标任务,其“教师可靠性随说话人/情感强度/环境逐 batch 漂移”的特性是本文方法设计的根本动机,必须理解任务背景才能体会方法针对性。

自监督语音模型(data2vec / WavLM)

data2vec 和 WavLM 是大规模自监督预训练(SSL)语音模型,它们在海量无标注语音上学习通用表示,再在下游任务上微调即可取得优异效果。二者预训练目标不同,因此捕获的语音信息互补。但它们的 base 变体就含约 94M 参数,对边缘设备实时部署过于昂贵,这也正是需要用 KD 压缩的对象。AMRD 将它们作为冻结的“教师”。

AMRD 使用的两个教师正是 data2vec Large 和 WavLM Base+,理解它们为何互补、为何过大,才能理解多教师蒸馏与轻量化的必要性。

多教师知识蒸馏(Multi-Teacher KD, MTKD)

当存在多个互补的教师时,MTKD 把它们的软目标聚合后蒸馏给单个学生。核心问题是“如何聚合”:最简单是均匀平均,或用固定权重。难点在于教师的预测质量因样本而异,且会随数据条件变化,固定权重无法适应。AMRD 正是为解决“逐 batch 自适应聚合”而提出的。

AMRD 的第一个核心创新(SVM 动态加权)就是 MTKD 中的教师聚合问题,理解 MTKD 才能看清本文相对“均匀/固定权重”基线的改进点。

单类 SVM(One-class SVM)

单类 SVM 是一种无监督异常检测方法(Schölkopf 等),它学习一个紧致的决策边界来包围大多数数据点,把落在边界外的点视为离群点。给定预计算的核矩阵 $G$,它能给出每个样本到决策边界的“有符号距离”(decision value)。AMRD 把每个教师的 batch logit 相似矩阵 $G_m$ 作为预计算核矩阵喂给单类 SVM,用样本平均有符号距离作为该教师的“可靠性分数”。超参 $\nu$ 控制离群比例上界,论文取 $\nu=0.1$。

单类 SVM 是 AMRD“动态教师加权”的核心机制,本文最独特的创新就是把抽象的“教师可靠性”量化为单类 SVM 的边界距离,不熟悉该算法会难以理解加权原理。

研究动机

语音情感识别在人机交互、心理健康监测、呼叫中心分析中很关键,但表现最好的大规模自监督模型(WavLM Base+、data2vec Large)含约 94M 参数,无法在边缘设备上实时部署。多教师知识蒸馏(MTKD)能把这些大模型压缩成轻量学生,但直接套用存在两个被忽视的挑战。其一是教师可靠性异构:不同教师架构与预训练目标不同,预测质量因样本而异,且这种差异并非静态——它会随说话人身份、情感强度、录音环境等数据条件在不同 batch 之间漂移;标准 MTKD 用均匀或固定的聚合权重,无法适应这种逐 batch 波动,反而会把不可靠的软目标传给学生。其二是知识转移不完整:传统 logit 层面的 KD 独立转移每个样本的预测类别分布,忽略了教师特征空间中样本之间的“关系结构”;而情感相似的语音在特征空间中天然形成聚类,保留这种结构能提供逐样本 logit 匹配所错过的训练信号。

本文的目标是本文提出 AMRD(Adaptive Multi-teacher Relational Distillation)框架,专门针对 SER 任务系统性解决上述两个挑战。具体目标包括四点:第一,为每个 batch 动态评估每个教师的可靠性并据此分配聚合权重,使教师聚合能自适应 batch 级数据条件变化;第二,在 logit 级蒸馏之外引入关系相似矩阵蒸馏(RSMD),让学生保留教师在样本层面的相似性结构;第三,所有自适应与关系机制只在训练时使用,推理时不增加任何开销,从而满足真正的端侧部署需求;第四,在 IEMOCAP 与 CREMA-D 两个标准 SER 基准上,跨四种不同容量(0.78M 至 11.7M)的学生架构验证方法,并证明即使是最小的 0.78M 学生(比 WavLM Base+ 少 120 倍以上参数)也能获得有意义的准确率提升。

与已有工作不同的是,本文的切入角度有三处独特。其一,与基于熵或 softmax margin 这类逐样本置信度度量的教师加权不同,AMRD 通过教师 batch 级 logit 的成对相似性结构来评估教师质量——因为一个教师可能在单个样本上很高置信,却在同一情感类的样本间产生不一致的 logit 模式,这种“自信却互相矛盾”的失败模式在情感类重叠的 SER 中很常见,逐样本度量根本无法察觉。其二,与 SER 中已有的多教师方法(如 Bijoy 等的余弦相似度路由)不同,AMRD 独立于学生来评估教师质量(而非选择学生已认同的教师,后者会强化已有预测而非优先最可靠来源),且师生架构异构($D \neq D'$),并同时结合 logit 级与关系级两种蒸馏。其三,与 RKD、SPKD、PKT、CCKD 等关系蒸馏方法不同,RSMD 用 z-score 归一化把相似性变为皮尔逊相关,可跨不同维度与分布的师生特征空间比较,并通过 Frobenius 分解显示它同时最大化对齐项并惩罚学生特征的均匀高相似性。

核心方法

AMRD 让一组冻结的自监督教师(data2vec Large、WavLM Base+)指导一个可训练的轻量学生,两条互补机制都只在训练时生效、推理时无额外开销。直觉是:若某教师在一个 batch 里预测一致(logit 聚类紧凑)就给更高权重;同时除匹配类别分布外,还让学生模仿教师在样本层面“谁和谁相似”的结构。每个教师对 $B=16$ 条语音输出 logit $z_m\in\mathbb{R}^C$ 和分类前一层特征 $h_m\in\mathbb{R}^D$;学生吃 64 维 log-Mel 频谱图,输出 logit $s$ 和特征 $h_s\in\mathbb{R}^{D'}$($D'\neq D$)。两条损失并行:SVM 动态加权做 logit 级软目标蒸馏,RSMD 做特征级关系对齐,再加交叉熵。总目标 $L=\alpha_{ce}L_{CE}+\alpha_{kd}T^2\mathrm{KL}(\log\sigma(s/T)\|p_T)+L_{RSMD}$,超参 $T=4$、$\alpha_{ce}=\alpha_{kd}=1$、$\alpha_{geom}=0.1$、SVM $\nu=0.1$。所有教师冻结、只更新学生 $\theta$;SVM 拟合不可微,反传时权重 $w_m$ 视为常数。

两个核心创新互补。第一是 SVM 式动态教师加权:对每个教师先 $\ell_2$ 归一化 batch logits 得 $\bar{Z}_m$,算 $B\times B$ 余弦相似矩阵 $G_m=\bar{Z}_m\bar{Z}_m^\top$,再以 $G_m$ 为预计算核拟合单类 SVM,用样本平均有符号距离 $q_m=\frac{1}{B}\sum_i d(i)_m$ 作为质量分数——预测越一致 $q_m$ 越高,softmax 得 $w_m$,软目标 $p_T=\sum_m w_m\mathrm{softmax}(z_m/T)$。本质区别在于它从教师自身 batch 级 logit 结构评估可靠性、独立于学生、逐 batch 自适应。第二是 RSMD:对师生特征做 z-score 再 $\ell_2$ 归一化,算关系相似矩阵 $R=\hat{H}\hat{H}^\top$,损失 $L_{RSMD}=\frac{\alpha_{geom}}{M}\sum_m\mathrm{MSE}(R_s,R_m^t)$;由 $\|R_s-R_t\|_F^2=\|R_s\|_F^2-2\|\hat{H}_t^\top\hat{H}_s\|_F^2+\|R_t\|_F^2$ 可见,最小化 MSE 同时最大化对齐项 $\mathrm{tr}(R_sR_t)$ 并惩罚学生特征的均匀高相似性(防塌缩)。

方法步骤详情

分四步。步骤1(输入):$B=16$ 条原始波形送入两个冻结教师 data2vec Large、WavLM Base+,每条得 logit $z_m\in\mathbb{R}^C$ 与分类前一层特征 $h_m\in\mathbb{R}^D$;学生吃 64 维 log-Mel 频谱图,输出 logit $s$ 与特征 $h_s\in\mathbb{R}^{D'}$($D'\neq D$)。步骤2(SVM 动态加权):对每个教师 batch logits 做 $\ell_2$ 归一化得 $\bar{Z}_m$,算余弦相似矩阵 $G_m=\bar{Z}_m\bar{Z}_m^\top$;以 $G_m$ 为预计算核拟合单类 SVM($\nu=0.1$)算平均有符号距离 $q_m$,softmax 得 $w_m$;用 $T=4$ 软化各教师 logit 后加权聚合得软目标 $p_T=\sum_m w_m\mathrm{softmax}(z_m/T)$。步骤3(RSMD):对师生特征做 z-score(逐样本零均值单位方差)再 $\ell_2$ 归一化得 $\hat{H}$,算 RSM $R=\hat{H}\hat{H}^\top$,元素退化为对逐样本仿射变换不变的皮尔逊相关 $\rho(h_i,h_j)$;损失 $L_{RSMD}=\frac{\alpha_{geom}}{M}\sum_m\mathrm{MSE}(R_s,R_m^t)$($\alpha_{geom}=0.1$,教师均匀平均,不重用 SVM 权重)。步骤4(优化):总损失 $L=\alpha_{ce}L_{CE}+\alpha_{kd}T^2\mathrm{KL}(\log\sigma(s/T)\|p_T)+L_{RSMD}$,AdamW、学习率 $10^{-4}$、权重衰减 $10^{-4}$、余弦退火 50 epoch、batch 16、混合精度+梯度裁剪 1.0,按验证 UA 选模型。

技术新颖性

技术新颖性体现在四处。第一,首次把单类 SVM 动态教师加权用于 SER:把教师 batch 级 logit 的成对相似结构 $G_m$ 当作 SVM 核矩阵,把抽象的“教师可靠性”量化为可经 softmax 微分的 batch 级标量分数;因核矩阵仅 $B \times B$($B=16$),SVM 拟合开销可忽略,且推理时完全不需要。第二,RSMD 在关系蒸馏中引入 z-score 归一化使相似性变为皮尔逊相关——相比 cos 相似性或 RKD 的距离/角度损失,它对师生特征空间的逐样本仿射变换不变,从而能在 $D \neq D'$ 的异构架构间可靠迁移;并通过 Frobenius 分解揭示其“最大化对齐+防塌缩”的双重视角,这是 CCKD(RBF 核)、CKA(Frobenius 范数归一化会移除防塌缩的矩阵幅度项)等方法所不具备的。第三,把 logit 级 SVM 加权与特征级 RSMD 解耦:SVM 权重衡量 logit 一致性,RSMD 用均匀教师平均,因二者衡量不同层面的教师质量,解耦既稳定又简洁。第四,专门针对 SER 中“教师可靠性随数据条件逐 batch 漂移”的独特特性设计,这是 SER 区别于一般 KD 任务的关键挑战。

Overview of AMRD(AMRD 总览)
Fig. 1: Overview of AMRD(AMRD 总览)

实验结果

核心结果分四部分。其一,IEMOCAP(TABLE I):AMRD 在全部 4 个学生上同时取得 WA、UA 最优;最大提升在 MNv3,达 47.21% UA,比最优单教师(WavLM+DKD 44.27%)高 2.9 个百分点;R18、EB0 各高 1.2、1.1 个 UA 点;LSP+ 与最优单教师持平(52.30% vs D2V+RKD 52.26%)但 WA 提升 1.1 点(50.30%→51.41%)。其二,CREMA-D(TABLE II):4 个学生中 3 个领先,LSP+ 达 56.37% UA、超最优单教师(D2V+KD 54.65%)1.7 点;例外是 MNv3,所有方法 UA 聚集在 34.82–36.56%,AMRD(36.09%)略低于无蒸馏基线(36.39%)。其三,8 个学生-数据组合中 7 个 AMRD 匹配或超过最优单教师,且无需预知哪个教师更适合。其四,极端压缩:LSP+ 仅 0.78M 参数(比 WavLM Base+ 少 120 倍以上)配合 AMRD 在两基准分别达 52.30%/56.37% UA,比无蒸馏基线提升 2.8 和 3.4 点。消融(TABLE III)显示两组件独立都有效(CREMA-D 上 SVM 单独让 EB0 UA 从 39.75% 升到 41.51%);敏感性(TABLE IV)显示 $\alpha_{geom}\in[0.05,0.2]$ 稳定、$\alpha_{geom}=0.5$ 因过度正则而下降。

任务指标本文基线提升
IEMOCAP / MobileNetV3 语音情感识别 非加权准确率 UA(%) 47.21 ±2.1(AMRD) 44.27(WavLM+DKD,最优单教师) +2.9 个百分点,4 个学生中最大提升
CREMA-D / LightSERNet+ 语音情感识别 非加权准确率 UA(%) 56.37 ±1.4(AMRD) 54.65(D2V+KD,最优单教师) +1.7 个百分点
极端压缩(0.78M 学生) UA 相对无蒸馏基线提升(百分点) IEMOCAP +2.8、CREMA-D +3.4 无蒸馏 LSP+ 基线 学生比 WavLM Base+ 少 120×+ 参数仍显著提升
整体竞争力 匹配/超过最优单教师的设置数 8 个学生-数据组合中 7 个 各单教师最优基线 无需预知哪个教师最适合每个学生

局限与改进

作者明确承认三点。第一,教师数量:所有实验仅用 2 个教师(data2vec、WavLM),虽然 SVM 加权与 RSMD 对任意 $M$ 都成立,但扩展到更多教师会引入额外的超参选择(教师选择、逐教师损失加权)且训练成本随 $M$ 线性增长,更大更多样的教师池验证留作未来工作。第二,仅音频模态:情感也通过表情与语言内容传达,融合模态能消解纯音频无法解决的歧义,但需对齐的多通道语料与分模态教师,属另一研究问题。第三,语料内评估:训练与测试来自同一数据集,跨语料/跨语言评估能提供更强泛化证据,但需处理标签集与录音条件不匹配。我额外观察到三点不足:MNv3 在 CREMA-D 上所有 KD 变体(含 AMRD)都不如无蒸馏基线,方法缺少提前识别“何时该蒸馏”的机制;最优 $\alpha_{geom}$ 随学生变化(LSP+ 在 IEMOCAP 上偏好 0.05 而非主实验的 0.1),说明固定超参未必最优;IEMOCAP 上 LSP+ 加入 RSMD 反而把 UA 从 52.45% 降到 52.30%,说明关系约束对极小容量学生在模糊情感边界上有害。

独立分析的弱点

弱点一:教师数量仅限 2 个,未验证 $M>2$ 时 SVM 权重是否稳定,也未给教师选择策略——改进方向是用更样的教师池做实验,并设计基于互补性而非仅可靠性的自动选择。弱点二:超参敏感——RSMD 权重 $\alpha_{geom}$、温度 $T$、$\nu$ 需针对学生-数据调优,论文显示 LSP+ 在 IEMOCAP 上 $\alpha_{geom}=0.05$ 最优而主实验用 0.1——改进方向是自适应 $\alpha_{geom}$ 调度或逐教师/逐层权重学习。弱点三:MNv3+CREMA-D 蒸馏失败、LSP+ 在 IEMOCAP 加 RSMD 反而把 UA 从 52.45% 降到 52.30%,方法缺少“何时该蒸馏”的诊断——改进方向是训练前用小规模探针估计增益、对蒸馏无效配置切换纯 CE。弱点四:未提供计算成本与推理时延的实际测量,也未与量化、剪枝正交对比——改进方向是补充端侧延迟/能耗并组合 INT8 量化实验。

未来方向

作者提出三方向:扩展到多于 2 个教师;针对真实部署的噪声鲁棒训练;跨语料/跨语言评估。基于该成果可延伸五点:(1)把 RSMD 的思想推广到 logit 层面——除特征 RSM 外,对齐师生 logit 层面的关系结构(类似 CCKD 但用皮尔逊相关);(2)探索在线/流式 SER 中 SVM 权重的时序自适应,当前是逐 batch 静态,可加入对 batch 历史的记忆以平滑权重;(3)多模态版本,用对齐的音-视-文三模态教师分别做关系蒸馏后融合,直接回应作者承认的“仅音频”局限;(4)与其它压缩手段正交结合——AMRD 训练出的轻量学生可进一步量化到 INT8 或剪枝,叠加上限;(5)在自蒸馏(师生同架构)设置中验证 SVM 加权是否仍有意义,以及把方法迁移到语音识别、说话人识别等其它语音下游任务。

复现评估

复现评估较乐观。数据集 IEMOCAP、CREMA-D 是广泛使用的标准 SER 基准(IEMOCAP 需向 USC 申请许可,CREMA-D 公开可得),学生架构(LSP+、MNv3、EB0、R18)与教师(data2vec Large、WavLM Base+)均来自公开实现或预训练权重。训练配置详尽:AdamW、学习率 $10^{-4}$、权重衰减 $10^{-4}$、余弦退火 50 epoch、batch 16、$T=4$、$\alpha_{geom}=0.1$、$\nu=0.1$、混合精度+梯度裁剪 1.0、留一会话 5 折/5 折交叉验证,关键超参与全部消融/敏感性实验均有报告。单类 SVM 可用标准 scikit-learn 实现。不足之处:论文未提及代码或模型权重开源;特征提取层的具体位置(“classifier 前一层”)对 WavLM/data2vec 的复现有歧义需自行确认;未提供计算资源/训练时长数据;实验仅用两个固定教师,复现第三/更多教师场景需自行设计;标准差来自 5 折但未说明随机种子管理。