X-AuT:面向语音大模型的渐进式音频编码器压缩与跨尺度蒸馏 X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
渐进剪枝+跨尺度蒸馏,把语音大模型音频编码器从18层压到14层而精度几乎无损
前置知识
语音大模型三段式架构
现代语音LLM由深层音频编码器、桥接模块和自回归文本解码器组成:编码器把每帧波形变成隐藏表示,桥接把它映射到语言模型词嵌入空间并替换输入序列中的音频占位符(输入嵌入条件化,而非交叉注意力),解码器据此逐token生成转写。Qwen3-ASR-0.6B就是18层音频Transformer(AuT)+桥接+Qwen3解码器的组合,音频塔共186.376M参数,每层约9.645M。
本文压缩的对象正是音频编码器深度,删层会改变喂给解码器的条件嵌入分布,这个失配是全文要解决的核心问题,不懂架构就看不懂为何剪层会引发提前EOS。
结构化层剪枝
与非结构化稀疏化不同,结构化剪枝直接删除整个Transformer块,得到规则、对部署硬件友好的更浅网络,无需稀疏算子。代价是后续所有层接收的残差流表示整体偏移,桥接模块必须维持住预训练时学到的解码器接口,实践中常表现为大量删除(deletion)错误和过早的结束符预测。
论文的18→16→14两跳剪枝就是结构化剪枝,理解'删块即扰动下游输入'才能理解三阶段恢复配方为何要把表示对齐放在最前面。
知识蒸馏的两种模式
teacher-forced(离线)蒸馏在真实前缀(gold prefix)上对齐师生的logit分布(本文用温度缩放的KL散度,Stage 0温度1.5、Stage 1为1.0),高效但与推理时学生看自己生成历史的状态不一致;on-policy蒸馏让学生先贪心生成前缀,师生在同一个学生生成上下文上比较分布(本文在双方top-k=512的并集支撑上算KL)。
X-AuT的Stage 1'scheduled student-policy'就是把两种模式按每5步一次的频率混合,附录A.6还专门对比了两种模式的收益,这是读懂消融实验的关键背景。
LoRA与'冻结解码器'的含义
LoRA在冻结权重旁注入低秩可训练矩阵 $W + BA$,只训练极少量参数。本文在冻结的Qwen3解码器q/k/v/o注意力投影上加rank-32、alpha=64、dropout=0.05的适配器;由于Qwen3-ASR的输出层与词嵌入共享权重(tied embedding),Stage 0/1还以1×10⁻⁴学习率训练这个tied output embedding,Stage 2将其冻结在5×10⁻⁶以下不动。
论文通篇说'decoder backbone frozen',实际可训练范围是注意力LoRA+tied head这一套,不澄清这一点会误解'冻结'的含义,也是A.2中EOS防护消融的对象。
CER/WER与转写一致性分层
字错误率CER(中文)和词错误率WER(英文)都是编辑距离除以参考长度。本文定义 $e_{\max}$ 为源转写与两个外部ASR系统假设之间三条两两错误率的最大值,用它衡量标注一致性:两个假设都与源转写完全一致记为class 1,仅两条文本完全一致为class 2,依 $e_{\max}$ 区间递推出9档(>50%或投票失败为9档)。
十个基准的报告口径、训练数据筛选(只用class 1)、以及层探针的选择标准全部建立在CER/WER上,看不懂指标就看不懂Tables 2/3和Figure 5。
研究动机
语音大模型中音频编码器必须处理每一帧输入,是流式、移动端和车载场景首token延迟的主要贡献者。Qwen3-ASR-0.6B的音频塔有18层Transformer、共186.376M参数(每层9.645M),是最自然的压缩目标。但直接删除完整层会整体扰动送入解码器的音频嵌入:剪枝后的模型常在生成几个token后就预测EOS,产生大段删除错误。更麻烦的是,某层单独看冗余,与其他层同时删除后可能变得关键——静态重要性分数无法预测'一个多层组合在给定恢复预算内能否恢复',选层和恢复必须联合评估。已有压缩工作要么在训练期引入压缩(LayerDrop、Dynamic Encoder Size supernet),要么只动解码器(Distil-Whisper)或做低秩分解(LiteASR),对已预训练好的语音LLM缺少'选层+恢复'一体化的后训练方案。
本文的目标是本文要回答两个耦合的工程问题:(1) 对预训练好的Qwen3-ASR-0.6B,在固定训练预算内哪些层组合可以被删除并恢复;(2) 恢复过程如何同时消除隐藏状态失配和学生自身解码历史引入的误差。具体目标是产出可部署的后训练深度削减配方:语言模型骨干全程冻结(只训练注意力LoRA与tied output embedding),通过两跳渐进剪枝18→16→14得到两个工作点——16层模型宏观错误率不超过基线(5.61%),14层模型在删除20.7%音频塔参数(186.4M→147.8M)后错误率仍接近基线,且实测编码器延迟在车载PPU上下降21.4%。
与已有工作不同的是,与Kolluri等人在SLAM-ASR上做Whisper编码器层剪枝+LoRA恢复的工作相比,X-AuT有三个独特切入点。其一,把'可恢复性'当作层组合的整体属性而非逐层可加分数:每次剪枝跳之前用匹配初始化、数据和优化预算的短行为探针(0.3-epoch LoRA热身)实测每个候选剪掉后的表现,而不是用静态分数排序。其二,跨尺度蒸馏:用24层、2048维隐藏态的Qwen3-ASR-1.7B教师监督0.6B学生,通过教师层均匀分组匹配加256维瓶颈MLP投影解决深度和宽度的双重不匹配。其三,数据侧引入九档转写一致性分层,恢复训练只用品级最高的class 1,并把置信度过滤与阶段相关的源重加权解耦,避免分阶段混入越来越脏的数据。
核心方法
整体直觉是'先小步试错、再彻底恢复'。(1) 数据:对每条带参考语音,用Qwen3-ASR-1.7B与Qwen3.5-Omni两个外部系统离线解码,按中文CER/英文WER计算三条两两错误率,取最大值 $e_{\max}$ 划入九档一致性等级,恢复训练只用'两假设与源转写完全一致'的class 1(两跳各约29.9万/29.2万条加权记录/epoch)。(2) 选层:第一跳删首尾层{1,18};第二跳从同一个恢复好的16层检查点出发,对每个候选做0.3-epoch LoRA热身,先扫单层再测相邻/非相邻层对,按五个开发集(AISHELL-1、CommonVoice-en、Fleurs-en、WenetSpeech-meeting、座舱私有子集,各限25条)的宏平均TER选出{5,6}。(3) 恢复:每跳跑同样三阶段——Stage 0表示对齐(占蒸馏epoch前5%,四项损失 $\mathcal{L}_{S0}=\lambda_{layer}\mathcal{L}_{layer}+\lambda_{bridge}\mathcal{L}_{bridge}+\lambda_{logit}\mathcal{L}_{logit}+\lambda_{ce}\mathcal{L}_{ce}$)、Stage 1蒸馏加调度式on-policy(0.95 epoch)、Stage 2纯CE微调(1 epoch,学习率5×10⁻⁶)。(4) 在十个公开基准上按宏平均评估。全程32卡、全局batch 512、bf16、AdamW、seed 42。
核心创新有三点。其一,把选层从'打分排序'改为'行为探针':单层分数不可加——{6,8}由两个最强单层删除组成,配对恢复后TER达7.78%,反而输给成分分数更差的相邻对{5,6}(6.93%),交互惩罚(配对TER减成员均值)1.38pp vs 0.58pp,证明可恢复性是组合性质。其二,跨尺度教师监督的价值被单独验证:同一配方下1.7B教师把16层学生Stage 1宏错误从自蒸馏的8.45%降到5.55%,十个基准全面占优(相对基线-1.1% vs +50.6%),且在CommonVoice zh/en上超过未剪枝0.6B基线,说明强教师的声学行为可跨参数规模迁移,而非仅'恢复原状'。其三,调度式student-policy蒸馏抑制剪枝诱发的提前EOS:Stage 1前20%纯teacher-forced,之后每5步让学生贪心生成前缀、师生在同一生成上下文上比分布(top-512并集KL),配合 min_new_tokens=3、时长感知上限 $\min(256,\max(128,\lceil 12d+32\rceil))$、重复/超长回滚过滤,以及单批被拒超50%时回退teacher-forced的兜底。
方法步骤详情
第一步,数据构建:把AISHELL-1/4/5、CommonVoice、Emilia、GigaSpeech、KeSpeech、LibriSpeech、WenetSpeech与座舱语音统一为JSONL清单(源池超28万小时,音频截断40秒),做NFKC、全半角、繁转简等归一化;两个外部ASR离线解码后按 $e_{\max}$ 打九档一致性标签。第二步,行为探针:第一跳删{1,18};第二跳所有候选从同一16层恢复检查点出发、同样0.3-epoch热身,单层扫出6.29–8.90% TER(L6最优6.29%),配对测试确定{5,6}(6.93%)。第三步,Stage 0:24层教师均匀分成M=学生层数个组,学生第m层对齐组内最后一层,表示损失为MSE+余弦距离;加桥接对齐(λ=1.0)、温度1.5的gold-prefix logit KL(λ=0.2)和gold CE(λ=0.5);教师2048维经256维瓶颈MLP投影到学生1024维;音频塔与桥接全参数训练,解码器LoRA与tied head用1×10⁻⁴。第四步,Stage 1:λbridge=0.5、λlogit=0.1、λce=1.0、温度1.0;20%进度后每5步on-policy监督并执行rollout过滤。第五步,Stage 2:从Stage 1最优检查点出发纯gold CE训练1 epoch,全体5×10⁻⁶,tied head冻结,class 1索引按源重加权(增AISHELL-4/5与座舱query)。检查点始终取五开发集宏TER最低者。
技术新颖性
新颖性体现在系统组合而非单点技术。(1) 可恢复性驱动的渐进剪枝:直接18→14(删同样的{1,18,5,6})在同等标称预算下宏错误6.73%,渐进路径5.75%且十基准全胜(Table 8),说明'中间恢复一次再剪'提供更好的优化初值。(2) 跨尺度蒸馏的系统化处理:分组层匹配+瓶颈投影同时解决师生深度(24 vs 16/18)与宽度(2048 vs 1024)不匹配,且对照实验把教师规模变量从配方中剥离单独量化(Table 6)。(3) EOS防护的机制化:2×2消融把'训练tied head'与'最少token门控'拆开——无防护的A配置出现5个含空rollout的百步窗口、最佳TER 6.86%且best-to-last漂移0.72pp,双防护的D配置空事件归零、TER 6.75%、平均rollout长度15.06 vs 11.05 token;C/D触发两千余次过滤拒绝,本质是把提前终止转化为可过滤的退化序列。(4) 诚实的统计框架:明确声明单seed、bold只代表观测最优而非显著性,A.6甚至承认hybrid on-policy(6.41%)未胜过matched off-policy对照(6.23%)。
实验结果
(1) 主结果(Tables 2/3):16层模型宏平均错误5.61%→5.27%(-0.34pp,相对-6.1%),改善AISHELL-1(3.33→3.21%)、CV-zh(-1.83pp至8.12%)、CV-en(-1.85pp至10.50%)、WenetSpeech-meeting(-1.30pp至7.06%),最大劣化Tedlium +0.44pp;14层模型宏错误5.75%(+0.14pp),参数186.4M→147.8M(-20.7%),CV-zh反升1.59pp、LS test-clean 2.45%略优于基线2.48%,Fleurs-en劣化最多+0.93pp;Stage 2使两模型十项指标全部优于各自Stage 1。(2) 教师规模(Table 6):同配方下自蒸馏8.45% vs 跨尺度1.7B教师5.55%,后者十基准全胜,Tedlium差距最大(11.28 vs 3.92%)。(3) 选层与调度:{5,6} 6.93% < {6,8} 7.78%,{14,15}垫底9.93%;渐进5.75% vs 直接6.73%十项全胜。(4) 效率(Table 9):14层编码器延迟车载PPU 14→11ms(-21.4%)、H800 88→78ms(-11.4%),端到端仅-4.7%/-2.6%,RTF 0.0786→0.0748。训练轨迹(Figure 4):Stage 0 TER 10.88%→7.80%,Stage 1最低5.76%,Stage 2再降至5.36%。另需注意:hybrid on-policy 6.41%并未胜过matched off-policy 6.23%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 十个中英文基准宏平均错误率(16层模型) | Macro CER/WER (%) | 5.27 | 5.61(Qwen3-ASR-0.6B 18层基线) | 绝对-0.34pp,相对-6.1%,且音频塔参数减少10.35% |
| 十个中英文基准宏平均错误率(14层模型) | Macro CER/WER (%) | 5.75 | 5.61(18层基线) | +0.14pp但删除20.7%音频塔参数(186.4M→147.8M) |
| 16层Stage 1:跨尺度教师 vs 自蒸馏 | Macro CER/WER (%) | 5.55(Qwen3-ASR-1.7B教师) | 8.45(未剪枝0.6B自蒸馏教师) | -2.90pp,十个基准全胜;相对基线-1.1% vs +50.6% |
| 渐进 vs 直接剪枝至14层 | Macro CER/WER (%) | 5.75(18→16→14) | 6.73(直接18→14,删同样四层、同预算) | -0.98pp,十个基准全胜 |
| 编码器推理延迟(14层,车载PPU) | Encoder latency (ms) | 11 | 14(18层) | -21.4%;端到端486→463ms(-4.7%),RTF 0.0786→0.0748 |
| 编码器推理延迟(14层,NVIDIA H800) | Encoder latency (ms) | 78 | 88(18层) | -11.4%;端到端1672→1629ms(-2.6%) |
局限与改进
作者坦承:全部主结果是seed 42的单次运行,无重复seed、无utterance级bootstrap置信区间、无显著性检验,14层与基线间0.14pp的差距只能算描述性观察;开发集每基准仅25条用于高频评估与选点,引入选择噪声;只覆盖Qwen3-ASR一个模型家族,对Whisper、Qwen2-Audio等架构的外推未知;数据管线支持九档但实验全程只用class 1,未做配比消融;效率测量只保留一次运行的均值未存方差;只压缩音频塔使端到端加速封顶在-4.7%(PPU)。我的补充观察:正文与附录A.4的单层探针数字不一致(正文L6=6.29/L5=6.42/L8=6.52%,附录L8=5.97/L6=6.11/L5=6.15%),虽不改变定性结论但影响可信度;选层和Stage 2重加权都依赖无法公开的座舱私有子集,社区难以复现完整决策链;A.6显示on-policy收益可能主要来自matched对照中额外的student forward/loss设置而非真on-policy信号,机制解释悬而未决;跨尺度对照未加'未剪枝学生+同配方'组,无法剥离配方收益与剪枝恢复收益。
独立分析的弱点
弱点一:选层统计基础薄弱——每基准25条×5个开发集的探针TER差异(如{5,6}与{6,8}的0.85pp)可能被抽样噪声淹没,改进方向是探针跑2-3个seed并对utterance做配对bootstrap检验。弱点二:跨尺度教师收益与配方收益未解耦——同一三阶段配方+LoRA若直接施加在未剪枝0.6B上可能同样降错误,应补'未剪枝学生+同配方'对照才能声称5.55%中有多少来自剪枝恢复。弱点三:hybrid on-policy不敌matched off-policy(6.41% vs 6.23%)却保留进主配方,说明on-policy频率(每5步)、top-k=512、min_new_tokens=3等超参未系统扫描,值得做fraction×k网格。弱点四:端到端加速被自回归解码封顶(-2.6%),应配合流式chunked编码器、推测解码或解码器侧蒸馏才能获得系统级收益。弱点五:class 1过滤依赖两个特定外部ASR的投票一致性,教师偏差会系统性过滤掉难样本(口音、远场、噪声音轨),可能损害泛化,可用交叉教师轮换或按噪声类型分层评估鲁棒性。
未来方向
作者提出的方向:在Whisper、Qwen2-Audio等更多语音-语言架构上验证层交互、投影对齐与EOS行为的可泛化性;扩大候选层组合做因子化实验;系统化数据配比(九档全用、渐进噪声课程);固定软件栈重复硬件测量并报告延迟分布;多seed加置信区间。基于本文成果可延伸的:(1) 把行为探针形式化为小型贝叶斯优化或bandit问题,用更少候选找到可恢复组合;(2) 用因果激活分析检验'相邻删除只造成一个残差流断点'的假说(A.4提出但未验证);(3) 将渐进剪枝与量化、结构化稀疏叠加,在边缘PPU上逼近更大的端到端加速;(4) 把一致性过滤用于教师自身输出的self-training闭环,减少对人工标注的依赖;(5) 研究on-policy蒸馏在长音频和流式ASR上的自适应调度策略;(6) 将探针+三阶段恢复封装为通用'深度削减工具箱'开源。
复现评估
复现难度中等偏高。有利条件:论文给出完整超参表(Table 4:三阶段学习率2×10⁻⁵/1×10⁻⁴/5×10⁻⁶、LoRA r=32/α=64/dropout 0.05、温度1.5/1.0、各损失λ、全局batch 512、seed 42、bf16),评估全用公开基准(AISHELL-1、Fleurs、LibriSpeech、THCHS-30、Tedlium、CommonVoice v15、WenetSpeech),师生模型为公开发布的Qwen3-ASR-0.6B/1.7B,并有项目主页(xpeng-ai.github.io/x-aut)。不利条件:未提及开源训练代码与数据清单;约28万小时源池中的座舱数据和私有开发子集(探针与checkpoint选择都用到)不可得;还需Qwen3.5-Omni参与数据标注;32卡规模算力门槛高——每跳含1个蒸馏epoch加1个微调epoch,两跳之外还有逐候选0.3-epoch探针扫描,估计数百GPU·日;正文与附录A.4探针数字不一致也会阻碍严格对齐。合理路径是先在小模型上复刻流程验证趋势,再争取资源复现5.27%/5.75%两个精确数字。
论文图表
十基准上Base(18L)/Prune-16 S1/Prune-16 S2的逐项CER/WER:参数186.4M→167.1M,宏平均5.61%→5.55%→5.27%,相对变化-1.1%/-6.1%;最大增益在CommonVoice zh(-1.83pp)/en(-1.85pp)与WenetSpeech-meeting(-1.30pp),最大劣化在Tedlium(+0.44pp);S2十项全部优于S1。
论文的主结果表:16层模型不仅恢复而且超过基线,是'精度无损压缩'主张的核心证据。
16层主运行的完整超参表,按Stage 0/1/2三列:epoch占比0.05/0.95/1,音频塔学习率2×10⁻⁵(Stage 2全部5×10⁻⁶),LoRA与tied head 10⁻⁴(Stage 2冻结tied head),AdamW/权重衰减0.01,batch 8×2累积=全局512,LoRA r=32/α=64/dropout 0.05,温度1.5/1.0,λlayer/λbridge/λlogit/λce = 1.0/1.0/0.2/0.5(Stage 0)与0/0.5/0.1/1.0(Stage 1),on-policy起始0.2/比例0.2,top-k 512/无权重,新token上下限3/256,拒绝阈值0.5。14层沿用同配方。
复现本文结果的最关键表格,所有损失权重、温度、学习率和on-policy调度参数都在这里。