← 返回 2026-08-07

MameLoshnLM:意第绪语大语言模型与评测基准 MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith 📅 2026-08-06 👍 21 2026-08-11 18:30
低资源语言 多语言大模型 意第绪语 持续预训练 数字人文 数据质量 语言模型评测

首个意第绪语8B开源模型,配套新语料库Oytser与多任务评测基准Kashes

前置知识

持续预训练(Continued Pretraining)

在已经预训练好的强基座模型(如 Llama 3.1 8B)之上,继续用因果语言建模目标在特定领域或语言数据上追加训练,使其适配新场景。与从头预训练相比,它算力开销小、能继承基座已有能力,但需警惕灾难性遗忘——即新数据覆盖掉原有通用能力。本文用此范式把 Llama 3.1 8B 改造成意第绪语模型 MAMELOSHNLM。

本文的核心方法就是持续预训练,理解它的机制、超参选择(如学习率 $2\times10^{-5}$、预热比例、数据配比)和灾难性遗忘缓解策略(掺入英语数据)是读懂训练章节的前提。

低资源语言建模(Low-resource Language Modeling)

指针对训练数据稀缺、数字足迹薄弱的语言构建语言模型。挑战不仅是数据量少,更关键的是公开语料质量差——常混入机器翻译垃圾、被错误分类的近缘语言文本。意第绪语是典型例子:它是历史上文献丰富的日耳曼语,用希伯来字母书写,但当代网络存在极少。

全文的动机、数据审计、以及『多网络语料只能带来表层流利而非地道表达』这一核心论点,都围绕低资源语境展开,不理解这个背景就难以体会作者为什么坚持构建人工核验的 Oytser 语料。

灾难性遗忘(Catastrophic Forgetting)

持续训练或微调时,模型为新任务/新语言更新参数,导致原有能力(如英语推理、常识)大幅下降的现象。常用缓解手段是在新数据中混入一部分原始分布的数据(如英语 CC100),以维持基座能力。本文采用 Yiddish 72%/English 28%(按词计)的混合配比来平衡。

理解作者为何在训练数据里掺入英语、为何要对比『重新平衡』和『扩展』等多语言变体,都需要灾难性遗忘这个概念;它直接解释了第 7.2 节相关语言混合实验的设计动机。

意第绪语及其 loshn-koydesh 词汇层

意第绪语(Yiddish)是犹太人使用的历史日耳曼语,以希伯来字母书写,词汇融合了日耳曼底层、大量希伯来/阿拉米语借词(称为 loshn-koydesh,缩写 LK)以及斯拉夫成分。LK 词汇包含许多高频日常词如『家庭』『战争』『也许』,是地道意第绪语的标志。

本文最具洞察力的分析(第 8 节)正是围绕 LK 词汇产出率和意第绪语特有形态展开的——这是区分『地道意第绪语』与『机器翻译味的德语化意第绪语』的关键证据,不懂这个语言背景会错过论文最精彩的部分。

COMET 与机器翻译评测

COMET 是基于预训练多语言模型(如 XLM-R)训练的翻译质量评估指标,通过度量译文与参考译文在语义嵌入空间的相似度打分,分数越高表示翻译越好。它比传统 BLEU 更贴合人类判断。本文用它评测英↔意第绪语翻译任务。

翻译是 Kashes 基准的核心任务之一,COMET 是主表(Table 4)和后续 LK 词汇分析的关键指标,需要理解其含义才能解读 MAMELOSHNLM 在英→意第绪语上领先 11+ 分的重要性。

研究动机

意第绪语被全球约一百万人使用,拥有跨越百年的丰富文学遗产,是数字人文研究(如大屠杀证词、历史报刊)的重要对象,但现有大语言模型对它服务得很差。问题首先出在数据侧:作者对主流多语言预训练语料 mC4 的意第绪语切分做了详细审计,发现真正高质量、来源可靠的母语文档仅占 $42.2\%$;约 $29.8\%$ 是机器翻译生成的内容,$21.9\%$ 实为被错误归类为意第绪语的希伯来语文本,剩余 $6.2\%$ 是片段、多语言页面等长尾。也就是说,公开『意第绪语切分』的存在并不等同于有可用的母语训练数据。其次在评测侧,意第绪语基准稀缺,已有的多来自自动翻译(如 Aya 集合),无法反映该语言的真实语言特性。结果是模型既不能服务约百万使用者,也不能支撑学术研究。

本文的目标是本文要为意第绪语打造一套完整、可复现的大语言模型开发流水线,而不只是堆更多数据。具体目标有三:其一,构建 Oytser——一个高质量、经人工核验的意第绪语预训练语料,既覆盖当代网络原生内容(新闻、维基、论坛),又纳入文学传统(Yiddish Book Center 数字图书馆的万余本 OCR 书籍);其二,构建 Kashes——首个多任务意第绪语评测基准,涵盖翻译、语言学分析、信息抽取与语言理解共 9 类任务;其三,基于以上资源持续预训练 Llama 3.1 8B,得到首个意第续语 8B 开源模型 MAMELOSHNLM,并在 Kashes 上系统比较同等规模基线。

与已有工作不同的是,已有低资源持续预训练工作(如 Basque、Estonian、Kazakh、Setswana)通常默认公共多语料切分可用,重点放在配比和微调技巧上。本文的独特切入在于质疑这个前提:它不是简单『加更多意第绪语数据』,而是先用审计量化公共数据的噪声,再用人工核验的 Oytser 提供地道替代;更进一步,作者没有止步于基准分数,而是设计了针对意第绪语特有现象(loshn-koydesh 词汇、不规则形态)的语言学探针,揭示通用多语模型只学到『表层流利』而非地道语言这一更深层的问题。这种『数据审计→地道语料→语言特异性评测→语言学诊断』的闭环,是同类工作罕见的。

核心方法

整体思路是『用对的数据做对的事』。直觉上,既然公共多语料里意第绪语充满噪声,那么单纯加大剂量只会强化错误的语言模式;作者转而构建经人工核验的 Oytser 语料($915.21$M 词、$5.28$B token,来自 9 个高质量来源,其中 Yiddish Book Center 的 OCR 书籍贡献 $723.09$M 词),并在其上对 Llama 3.1 8B 做持续预训练。为缓解灾难性遗忘,训练数据按词计混入 $28\%$ 英语(CC100),实际 token 占比仅 $8\%$。评测方面,作者不仅建了 Kashes 多任务基准,还针对意第绪语设计了 loshn-koydesh 词汇产出率、不规则形态(ge- 过去分词、希伯来源复数、冠词范式、辅助动词)等语言学探针,把『地道程度』量化为可比较的指标。技术路线因此是『语料审计→Oytser 构建→Kashes 构建(含新翻译集 Kashes-mt)→持续预训练→基准评测→语言学诊断』的完整闭环。

核心创新点是把『语言地道性』从抽象主张变成可量化的诊断对象,并用人工核验语料去恢复它。与已有低资源方法的本质区别有三:第一,它不信任公共切分,而是用 URL 分析、二级语言识别器和人工抽查三层审计,证明 mC4 意第续语切分不到一半可用,从而为自建语料提供必要性;第二,Kashes-mt 是首个以母语原生创作为源头的英—意第续语翻译基准(5,287 对,来自 Forverts 和 In geveb 的双语版本,经文档匹配、SentAlign 句对齐、质量过滤、去重四步构建),区别于以往由英语机器翻译派生的 FLORES+;第三,语言学探针揭示 COMET 分数与 LK 召回仅弱相关(Spearman $\rho=0.23$),证明传统翻译指标对词汇层流失是『盲』的——这是对多语评测方法论的直接挑战。

方法步骤详情

第一步审计公共语料:分析 mC4 意第续语切分,得 Table 1 噪声分布(真意第续语 $42.2\%$、机翻 $29.8\%$、误判希伯来语 $21.9\%$、其他 $6.2\%$)。第二步构建 Oytser:整合 9 个来源,论坛数据用正则去标识化并打乱,书籍用 Jochre3 OCR。第三步构建 Kashes:整合 YiTB 树库、三套 NER、Aya 机翻任务,经文档匹配→SentAlign 句对齐→过滤→去重构建 Kashes-mt,并从 Oytser 剔除基准源文档防泄漏。第四步训练:对 Llama 3.1 8B 做 bfloat16 持续预训练,8-bit AdamW,学习率 $2\times10^{-5}$,余弦调度+$2\%$ 预热,权重衰减 $0.01$,1 epoch,序列长 1024,batch 38×4 累积≈$155$K token,约 $5.7$B token、36,663 步,单卡 H200 约 207 GPU 小时。第五步以 1/3/5-shot 留一法评测五个基线;第六步做语言学诊断(LK 词典识别希伯来源词、分形态统计词形还原准确率)。

技术新颖性

技术新颖性集中在三处。其一,端到端首次把意第续语纳入现代 LM 开发框架——既有文献只覆盖机器翻译、ASR、POS 标注等局部能力,本文是首次同时给出大规模预训练语料、多任务基准和开源 8B 模型。其二,数据质量方法论:用 URL + 二级识别 + 人工三层审计量化公共切分噪声,并用规则去标识化与基准源剔除(防泄漏)保证 Oytser 的可信度,这套审计流程对其他低资源语种可复用。其三,语言学探针化诊断:把『地道』拆解为可计算的 LK 词汇产出率与形态准确率,并证明机翻网页的 LK 率($3.6\%$)不足母语源($10.2\%$)一半,而 Llama 的产出率甚至低于机翻网页——这把『数据质量→模型行为』的因果链显式打通,是同类工作很少做到的。

The Kashes-mt construction pipeline.
Figure 1: The Kashes-mt construction pipeline.

实验结果

在 Kashes 主表(Table 4,5-shot)14 项评测中,MAMELOSHNLM 以平均 $62.6$ 分领先 Gemma-2 9B($57.0$)、Llama 3.1 8B($56.8$)、Qwen3 8B($54.7$),明显甩开 EuroLLM 9B、BLOOMZ 7B。增益集中在意第续语中心任务:POS $88.6$、依存 LAS $40.6$、EHRI-NER $41.3$;英→意第续语 FLORES+ COMET 从 $64.8$ 升到 $78.5$(+13.7)。语言学诊断(Table 5)最深刻:金标 LK 内容词占 $6.2\%$,MAMELOSHNLM $4.7\%$,Llama 仅 $1.6\%$($p<10^{-229}$);ge- 过去分词 $50.8\%$ vs $5.1\%$($p<10^{-29}$);规则动词 האָבן 两者持平 $84.7\%$,但不规则的 זײַן 差距悬殊($20.0\%$ vs $8.9\%$),表明差距集中在需词素系统知识的不规则变换上。相关语言混合实验(第 7.2 节)进一步证实保持意第续语主导+少量英语更优。

Yiddish in mC4.
Table 1: Yiddish in mC4.
Statistics of Oytser, the Yiddish training corpus by source and type.
Table 2: Statistics of Oytser, the Yiddish training corpus by source and type.
Datasets included in Kashes.
Table 3: Datasets included in Kashes.
Evaluation results on Kashes benchmark.
Table 4: Evaluation results on Kashes benchmark.
Linguistic competence probes, MAMELOSHNLM vs. Llama 3.1 8B (5-shot).
Table 5: Linguistic competence probes, MAMELOSHNLM vs. Llama 3.1 8B (5-shot).
查看结构化数据
任务指标本文基线提升
POS 标注(YiTB) Accuracy 88.6 Llama 3.1 8B 86.9 / Qwen3 8B 85.9 较 Llama +1.7,为该项最佳
英→意第续语翻译 FLORES+ COMET 78.5 Llama 64.8 / Gemma-2 66.7 +13.7,远超所有基线
英→意第续语翻译 Kashes-mt COMET 75.3 Llama 59.6 / Gemma-2 59.9 +15.4/+15.7
EHRI-NER(大屠杀文献) Micro F1 41.3 Llama 34.2 / Qwen3 20.8 +7.1,该项最佳
Kashes 14 项平均 Average 62.6 Gemma-2 57.0 / Llama 56.8 / Qwen3 54.7 总体最佳,领先次名 +5.6
ge- 过去分词词形还原(语言学探针) Change Acc. 50.8% Llama 5.1% +45.7 个百分点(p<1e-29)
LK 内容词产出率(英→意第续语) 比率 4.7%(金标 6.2%) Llama 1.6% 更接近地道母语分布

局限与改进

作者承认的局限:训练序列长度仅 1024 token,可能不足以学习长程依赖;Kashes 的语言理解任务(PIQA、PAWS-Wiki、WikiQA)仍依赖 Aya 的机器翻译版本,因为目前没有原生意第续语常识/推理基准,这些任务的翻译可能扭曲评测;Oytser 主要覆盖最近 100 年文本,对更早历史变体覆盖有限;模型仅做持续预训练未做指令微调,不适合交互式对话场景。我额外观察到几点:其一,比较口径中 Qwen3 8B 是唯一官方支持意第续语的基线,但它整体仅排第四,说明其多语宣称与实际意第续语能力有落差,这也提示模型能力宣传需谨慎。其二,COMET 与 LK 召回弱相关($\rho=0.23$)虽是论文亮点,但也意味着现有自动指标体系对低资源语言仍有盲区,结论的『地道性』判断部分依赖语言学先验。其三,相关语言混合实验只测了两种配比且规模有限(约 5.7B token),『相关语言无用』的结论可能受数据量与配比粒度限制,未必普适。

独立分析的弱点

第一,预训练规模偏小且无 scaling 分析:仅约 $5.7$B token、序列长 1024,未探索更长序列能否逼近金标 LK 率 $6.2\%$(当前 $4.7\%$ 仍有差距)。改进:做 token 数与序列长度的消融。第二,相关语言混合实验设计偏粗:Rebalanced/Expanded 把意第续语 token 占比从 $91.8\%$ 降到 $85.2\%$/$71.0\%$,混淆了『加相关语言』与『稀释意第续语』两因素,难分离因果。改进:固定意第续语 token 绝对量,只替换非意第续语部分语种。第三,语言理解类基准仍靠机翻(Aya),评测生态不完整。改进:与学界合作构建原生常识/推理/NLI 数据。第四,仅做持续预训练未做指令/对齐,可用性受限。改进:补充 SFT+DPO 并增加开放式生成的人类评估。第五,去标识化主要靠人工抽样,缺乏系统化隐私度量。

未来方向

作者明确提出的方向:对 MAMELOSHNLM 进行指令微调以支持交互式使用;创建更多训练与评测资源;把模型应用于大规模数字人文工作流(如大屠杀证词信息抽取、历史报刊分析)。基于本成果可延伸的方向:其一,把『数据审计 + 语言特异性探针』方法论迁移到其他数字足迹与真实用法脱节的低资源语言(如双言双语、碎片化在线存在的语种),形成可复用的低资源 LM 开发模板;其二,设计对词汇层流失敏感的自动评测指标(超越 COMET),例如基于 loshn-koydesh 词典或形态标注的针对性评分;其三,探索相关语言迁移的更精细机制——例如对希伯来/德语做课程学习或按语言层(词汇 vs 句法)分阶段训练,而非粗粒度混合;其四,结合 Jochre3 OCR 的错误传播分析,研究 OCR 噪声对持续预训练的影响并设计鲁棒训练目标。

复现评估

复现性总体良好。模型与资源已在 GitHub(https://github.com/katzurik/MameLoshnLM)开源。数据层面,Oytser 整合 9 个来源,其中 Yiddish Book Center 书籍需研究协议授权(非完全开放),Forward 归档按非商业/合理使用,Lebns Fragn 非商业授权,其余 CC0/公开可抓取——完全复现训练数据需重新洽谈部分授权,存在门槛。训练超参披露充分:bfloat16、8-bit AdamW、学习率 $2\times10^{-5}$、$2\%$ 余弦预热、权重衰减 $0.01$、序列长 1024、batch 38×4 累积、1 epoch、约 $5.7$B token、36,663 步。算力门槛低——单卡 NVIDIA H200 约 207 GPU 小时,对学术界友好。评测侧 Kashes 数据集、shot 设置(1/3/5-shot 留一法)、SentAlign 阈值(对齐<35%或得分<0.65 剔除)均明确,附录 C 给出示例输入,语言学探针的 LK 词典与形态分类规则也已开源。