← 返回 2026-07-21

GigaAM多语言:面向低资源语言的语音识别基础模型 GigaAM Multilingual: Foundation Model for Underrepresented Languages

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin 📅 2026-07-11 👍 33 2026-07-25 18:30
Conformer 低资源语言 多语言ASR 自监督学习 语音识别

用簇级数据平衡预训练和域感知采样微调,为中亚低资源语言构建ASR基础模型

前置知识

自监督学习(Self-Supervised Learning, SSL)

自监督学习是一种利用无标注数据训练模型的方法。在语音领域,HuBERT风格的方法通过随机遮蔽(masking)输入音频的连续片段,然后让学生模型预测被遮蔽位置对应的离散声学单元来学习表示。这些离散单元由教师模型提取特征后经K-means聚类得到。SSL让模型从海量未标注语音中学习通用的语音表示,再通过少量标注数据微调即可用于下游ASR任务。

本文的预训练阶段完全基于HuBERT风格的SSL,理解遮蔽单元预测目标和教师-学生框架是理解其预训练设计的核心。

Conformer编码器

Conformer是卷积神经网络与Transformer的结合体,将自注意力机制(建模全局依赖)与卷积模块(捕捉局部模式)串联在一起。本文使用600M参数、24层、隐藏维度1024的Conformer,并采用旋转位置编码(RoPE)和25Hz帧率(40ms步长)。Conformer在语音识别任务中被广泛证明优于纯Transformer或纯卷积网络。

GigaAM多语言的基础架构就是Conformer编码器,理解其结构和参数规模有助于评估模型的容量与计算开销。

CTC(连接时序分类)

CTC是一种无需帧级对齐即可训练序列模型的损失函数,特别适合语音识别这类输入序列长于输出序列的任务。CTC通过引入空白(blank)标签并对所有合法对齐路径做边缘化,允许模型在共享字符词表上直接从声学帧预测文本。本文在跨5种语言的共享字符词表上用CTC目标微调预训练编码器。

本文所有微调实验(包括编码器消融)都使用相同的CTC管线,这是隔离预训练编码器贡献的前提。

词错误率(WER)

WER是语音识别最常用的评价指标,定义为(替换词数+删除词数+插入词数)/参考词总数的百分比。WER越低越好。本文在Common Voice、FLEURS和内部真实测试集上用WER评估,并排除了超过30秒的样本和含数字的参考文本,对大小写和标点做了归一化。

WER是贯穿全文所有表格的核心指标,理解其计算方式和测试集构成才能正确解读实验结果。

数据不平衡与重采样

在多语言训练中,头部语言(如俄语、英语)数据量远大于尾部语言,导致模型偏向头部。朴素的按比例采样会使尾部语言严重欠拟合,而朴素上采样又可能过拟合。本文采用簇级采样权重(预训练阶段将70+语言聚成5个簇)和域感知采样(微调阶段对每个语言内的子域加权),在两者间取得平衡。

簇级平衡和域感知采样是本文的两项核心创新,理解数据不平衡问题才能理解为什么这些策略至关重要。

研究动机

近年来多语言ASR在数据规模、模型容量和自监督训练目标的推动下取得了长足进步,但识别质量在不同语言间极不均衡:高资源语言(如英语、俄语)表现优异,而许多低资源和长尾语言的错误率依然高到无法实际应用。论文Table 1清晰展示了这一鸿沟——例如在Kazakh的Common Voice上,Whisper large v3的WER高达57.8%,在Uzbek CV上更是达到109.9%(即输出比参考还长),而在English CV上仅为20.0%。作者指出,造成这种差异的核心原因之一是数据不平衡(data imbalance):经验数据分布偏向头部语言,而简单的均等上采样又会导致头部语言过拟合或性能退化。

本文的目标是本文的具体目标是构建一个针对欠代表的中亚语言(Kazakh、Kyrgyz、Uzbek)的高质量、鲁棒的多语言ASR基础模型GigaAM Multilingual。作者将原有的俄语专用GigaAM扩展到多语言场景,预训练一个基于Conformer的编码器,并提出一套原则性的数据混合与加权策略,使得在预训练和微调两个阶段都能有效缓解头部语言主导的问题。最终目标是在受控对比下,让该模型在目标语言上显著超越Whisper large v3、Omnilingual-1B等强基线,特别是在自发语音(真实野外场景)上取得大幅领先。

与已有工作不同的是,本文的独特切入角度是采用'两层'策略显式地建模长尾结构。第一,不同于以往直接对每个语言做平衡,作者将70+语言通过加权共现图聚类成5个簇,在簇级别做重加权,避免了对低资源语言逐个估权带来的过拟合难题。第二,作者进行严格的受控对比:在相同微调数据、相同CTC配方和相同解码设置下,公平比较不同预训练编码器(GigaAM 240M/600M、Whisper、Omnilingual)的可迁移性,并量化预训练和微调采样策略各自对低资源增益的贡献。这种将'数据策划与混合策略'本身作为设计变量进行系统消融的做法,填补了低资源ASR实践中编码器选择缺乏公开消融的空白。

核心方法

GigaAM多语言的整体思路是:先用海量无标注音频做自监督预训练学习通用语音表示,再用少量标注数据做CTC微调适配目标语言。技术路线为:构建200万小时内部音频语料 → 用语音活动检测切分并用MMS LID-4017做语种识别 → 在加权语言共现图上聚类得到5个语言簇 → 以簇级采样权重做HuBERT式SSL预训练(600M Conformer,K=1000聚类单元,40%遮蔽)→ 在公开/众包/合成/弱监督四类数据上做CTC微调,配合域感知采样。预训练300k步,学习率$2\times10^{-4}$,总音频batch $2048\times32s$(约18.2小时);微调200k步,AdamW,峰值学习率$6\times10^{-5}$,5k步预热后余弦衰减到$1\times10^{-7}$,梯度累积达虚拟batch 3200。

核心创新点是'簇级数据平衡预训练 + 域感知采样微调'的双层组合,本质区别在于:以往工作要么直接逐语言平衡(低资源语言权重估计不稳),要么完全依赖经验分布(头部主导)。本文用归一化共现权重$w_{ij}=c_{ij}/\sqrt{n_i n_j}$构建语言图,让共现频率高于期望的语言对获得更高权重,经图聚类后平衡在簇级别进行,既稳定又避免过拟合。微调阶段则提出域感知采样,防止Kazakh/Kyrgyz的大规模合成子集主导训练课程,从而改善对自发语音的泛化。这套组合使得即使是240M的小编码器,在匹配CTC微调下也能超越Whisper large v3和Omnilingual 1B。

方法步骤详情

步骤1(预训练数据准备):将200万小时内部音频按1分钟分块,逐块跑语音活动检测得到纯语音片段,再对每个片段跑MMS LID-4017语种识别,通过片段级多数投票确定整条录音的语种,置信度阈值设为0.7(多数投票置信度和段内平均模型置信度均需≥0.7),不达标则标记为'uncertain'。步骤2(语言聚类):构建语言共现图,顶点为语言,边权用归一化权重$w_{ij}=c_{ij}/\sqrt{n_i n_j}$,剪除低权边和低度顶点后,用图聚类算法得到5个簇。步骤3(SSL预训练):600M Conformer(24层、隐藏1024、RoPE、25Hz),教师模型提取特征后跑K=1000的K-means得到离散单元,随机遮蔽40%帧让学生预测,按簇级采样权重(最终采用E2: $[0.50,0.15,0.25,0.05,0.05]$)重建训练池。步骤4(CTC微调):在5语言共享字符词表上微调,数据来自公开语料、众包、合成TTS(带ASR验证过滤)和弱监督强制对齐,采用域感知采样。步骤5(评估):在Common Voice、FLEURS和内部真实集上计算WER。

技术新颖性

技术新颖性体现在四个方面。第一,簇级重加权策略:将逐语言平衡问题降维到簇级,用归一化共现图聚类稳定地控制70+语言的数据混合,这是对mHuBERT-147等多语言SSL工作的具体改进。第二,域感知采样:区别于简单语言平衡,本文在语言内部对子域加权,专门解决大规模合成数据主导训练课程导致的自发语音泛化问题,在Kazakh/Kyrgyz的内部集上带来明显增益(如Kazakh Internal WER从17.4降到15.8)。第三,严格的受控编码器消融:在相同CTC配方下证明240M的GigaAM平均WER(12.2%)优于1B的Omnilingual(16.6%)和Whisper large v3(14.1%),揭示了编码器容量与数据混合的权衡。第四,完整的开源发布与端到端可复现配方,包括合成数据生成与ASR验证、众包质量控制(ROVER聚合)等数据工程细节。

实验结果

核心发现五点。第一,最终模型在目标语言上大幅领先(Table 1):Kyrgyz CV上GigaAM WER 10.2%而Whisper large v3达95.2%;Uzbek CV 9.2% vs 109.9%;Kazakh内部自发集15.8% vs Whisper 65.2%。第二,簇级预训练混合有效(Table 3):从E0分布$[0.60,0.27,0.08,0.03,0.02]$到E2的$[0.50,0.15,0.25,0.05,0.05]$,Kyrgyz WER 9.4→8.5、Uzbek 10.5→9.7,Russian仅4.6→4.7。第三,域感知采样最优(Table 4):Kazakh内部集17.4→15.8。第四,编码器消融(Table 5):匹配CTC下GigaAM 240M平均WER 12.2%优于Whisper v3(14.1%)和Omnilingual 1B(16.6%),更小却更强。第五,尾部迁移(Table 6):预训练覆盖不足500小时的Georgian/Bashkir仅用CV训练达3.8%/3.6%,远超基线。

WER (%) of GigaAM Multilingual against public multilingual ASR systems
Table 1: WER (%) of GigaAM Multilingual against public multilingual ASR systems
Fine-tuning data (hours) by language and source
Table 2: Fine-tuning data (hours) by language and source
Pre-training data mixture and cluster sampling weights
Table 3: Pre-training data mixture and cluster sampling weights
WER (%) by fine-tuning sampling strategy
Table 4: WER (%) by fine-tuning sampling strategy
Encoder ablation under matched CTC fine-tuning
Table 5: Encoder ablation under matched CTC fine-tuning
Adaptation to minimal-coverage tail languages: WER (%) on Common Voice
Table 6: Adaptation to minimal-coverage tail languages: WER (%) on Common Voice
查看结构化数据
任务指标本文基线提升
Kyrgyz语音识别(Common Voice) WER(%,越低越好) 10.2% 95.2%(Whisper large v3)/ 21.6%(Omnilingual 1B) 相对Whisper降低约85个百分点
Uzbek语音识别(Common Voice) WER(%) 9.2% 109.9%(Whisper)/ 32.8%(Omnilingual) 相对Whisper降低约100个百分点
匹配CTC微调下的编码器平均WER 5语言平均WER(%) 12.2%(GigaAM 240M)/ 10.2%(600M) 14.1%(Whisper large v3)/ 16.6%(Omnilingual 1B) 240M即优于1B基线
尾部语言迁移(Georgian,Common Voice) WER(%) 3.8% 13.4%(Whisper)/ 7.8%(Omnilingual) 相对Omnilingual降低约51%
尾部语言迁移(Bashkir,Common Voice) WER(%) 3.6% 11.1%(Whisper)/ 8.2%(Omnilingual) 相对Omnilingual降低约56%

局限与改进

作者承认的局限主要在两方面。其一,数据不平衡与覆盖不足仍是根本瓶颈:Table 2显示Kyrgyz的公开数据仅26小时,Uzbek公开数据仅313小时,合成数据虽多但分布单一,导致Uzbek在域感知采样下无额外收益,因为其子集小且缺乏需要域权调节的合成数据。其二,簇级采样策略存在权衡:Table 3的E3尝试兼顾所有语言(恢复English WER到14.6%)却牺牲了目标语言增益,说明难以同时优化所有语言。从读者角度还可观察到:测试集较小(内部集仅6-20小时),统计显著性未给出置信区间;English上GigaAM(CV 21.5%、FLEURS 9.4%)实际弱于Whisper v3(20.0/3.9%)和Seamless(16.2/5.8%),说明策略以牺牲头部语言部分性能换取尾部增益;此外论文为会议短文,缺乏对合成数据比例(Kazakh合成7896小时远超公开1031小时)引入的失真与偏差的深入分析。

独立分析的弱点

第一个弱点是English等头部语言性能不及专用基线。Table 1显示GigaAM在English FLEURS为9.4%,而Whisper v3仅3.9%,这是为了尾部语言刻意调整混合比例的代价。改进方向是探索更精细的帕累托策略,如课程学习或动态采样权重随训练进度调整,避免头部退化。第二个弱点是合成数据偏置未被充分量化。Kazakh合成数据(7896h)远超真实数据(公开1031h+众包876h),虽经ASR验证过滤,但仍可能引入TTS风格偏差,导致表1内部集与CV/FLEURS差距较大。改进方向是引入合成-真实域自适应或更严格的去偏方法。第三个弱点是簇级平衡对簇的划分敏感。5个簇的划分依赖图聚类阈值,文中未给出划分鲁棒性分析。改进方向是研究不同聚类粒度下策略的稳定性,或提出可微的端到端权重学习。第四个弱点是测试集规模偏小且缺乏置信区间,6-20小时的内部集使WER差异的统计意义不明确,改进方向是扩充测试集并报告显著性。

未来方向

作者明确提出的方向包括:进一步扩展到更多欠代表语言并验证迁移效果(Table 6已展示Georgian/Bashkir的潜力);将编码器用于数据策划(data curation)与生产系统。基于本文成果可延伸的研究方向有:第一,将簇级平衡推广到可微的、随训练进度自适应的采样权重学习,避免人工调参(如E0-E3的网格搜索);第二,研究合成数据的域自适应与去偏,量化TTS生成语音对自发语音泛化的影响,并探索更高质量的合成管线;第三,探索更大的模型规模与更长预训练是否能延续240M优于1B基线的效率优势;第四,将域感知采样与课程学习、对抗训练结合,进一步改善自发语音鲁棒性;第五,将该方法迁移到语音翻译、说话人识别等其他低资源下游任务,验证编码器的通用性。

复现评估

复现性整体良好。作者已开源模型权重和代码(https://github.com/salute-developers/GigaAM),声明为open-weight并提供proven recipe。训练超参详尽:预训练300k步、学习率$2\times10^{-4}$、batch $2048\times32s$;微调200k步、AdamW、峰值$6\times10^{-5}$、5k步预热后余弦衰减到$1\times10^{-7}$、虚拟batch 3200。聚类用归一化共现权重$w_{ij}=c_{ij}/\sqrt{n_i n_j}$和0.7置信度阈值均有定义。主要障碍:预训练的200万小时内部音频为专有数据无法公开,研究者只能依赖公开语料近似复现,可能无法完全复现领先幅度。合成TTS系统、众包平台、弱监督强制对齐管线等关键组件披露有限。算力方面,训练600M编码器300k步且batch达18.2小时音频/步,需大规模GPU集群,普通实验室难负担。整体而言方法学和微调可复现,完整预训练复现受限于数据与算力。