← 返回 2026-08-14

缓解英译罗机器翻译中的性别偏见 Mitigating Gender Bias in English to Romanian Machine Translation

Ioana Grigore, Sergiu Nisioi 📅 2026-08-09 👍 9 2026-08-19 18:30
LoRA微调 低资源语言 大语言模型 性别偏见 机器翻译

用LLM性别分类加标签感知翻译模型的混合流水线,把英译罗性别准确率提升40个百分点以上

前置知识

LoRA(Low-Rank Adaptation)

参数高效微调方法:冻结预训练权重 $W_0$,只学习低秩增量 $\Delta W = \frac{\alpha}{r}AB$,其中 $A \in \mathbb{R}^{d \times r}$、$B \in \mathbb{R}^{r \times k}$,$r \ll \min(d, k)$,$\alpha$ 为缩放系数。适配器插入注意力的 q/k/v/o 和 MLP 的 gate/up/down 投影层,可训练参数量远小于全量微调,适合有限显存。

本文性别分类器用 LoRA 微调(秩 $r \in \{8,12,16,24,32\}$,$\alpha \approx 2r$),而翻译侧 LoRA 实验全面失败是关键发现之一,不懂 LoRA 就无法理解这两条主线。

语法性别与罗马尼亚语三性系统

许多语言要求名词携带语法性别,形容词、冠词、动词随之变位达成一致。罗马尼亚语尤为复杂:名词分阳、阴、中三性,中性名词单数表现似阳性、复数似阴性,且一致关系贯穿名词短语和动词链。英语几乎没有显性性别标记,'the teacher' 无法直接映射出罗马尼亚语所需的性别形态。

这是问题根源:为什么英译罗会产生性别偏见,以及为什么'标签→形态一致'的映射比法德西等语言更难学、为什么 LoRA 容量不足。

WinoMT 与 WinoGender 诊断基准

两个经典的 MT 性别偏见评测集。WinoMT 含 1,584 个亲刻板印象和 1,584 个反刻板印象英语句子,性别须从语境代词推断;WinoGender 含 720 个最小对句子,仅代词不同。无偏见的系统应在亲/反两个子集上表现接近,两者差距反映刻板依赖程度。

论文的核心评测都在这两个外部基准上完成(表6),理解其构造才能读懂 96.34% 对 93.68% 等数字背后的含义。

课程学习(Curriculum Learning)

一种训练策略:先让模型在简单样本上习得基础能力,再逐步引入更难样本。本文第一阶段用单实体句子(Dataset 1)教分类器基本的'语境→性别'映射,第二阶段用含干扰实体的句子(Dataset 2)提升难度,难度由易到难递进。

论文的数据集设计和 Forgetting F1 指标都围绕两阶段课程学习组织,是理解方法章节的关键框架。

BLEU / chrF++ / TER / COMET 翻译指标

四种机器翻译自动指标:BLEU 基于词 n-gram 重叠;chrF++ 基于字符 n-gram,对形态丰富的语言更敏感;TER 统计达到参考译文所需的编辑数(越低越好);COMET 是基于神经网络的学得指标,从源句、译文、参考三方评估充分性与流畅度,与人工判断相关性最高。

作者明确指出表面指标在近重复训练数据上容易虚高,最终以 COMET 0.853 为主要判据,理解指标含义才能正确解读表5的对比。

研究动机

机器翻译系统在'性别中立源语言→性别标记目标语言'的转换中系统性失败:英语中职业、角色和人物的性别往往隐含在语境里,而罗马尼亚语要求名词、形容词、动词做显性语法性别一致。典型神经 MT 系统默认输出阳性形式或依赖刻板印象,例如把 'The nurse helped the patient because she was kind' 中的护士译成阳性。论文用基准量化了该问题:未经处理的 Transformer 基线在 WinoMT 亲刻板印象子集上准确率 59.05%,反刻板印象子集仅 50.13%,WinoGender 上 50.28%,说明系统基本放弃从语境推断性别;即便 GPT-5.2 这类最强专有模型也呈明显偏好(79.23% 对 58.79%)。更关键的是,此前性别偏见研究集中在西班牙语、法语、德语等高资源语言,英语—罗马尼亚语语言对完全空白,而罗马尼亚语的阳/阴/中三性系统与复杂形态一致使问题更加棘手。

本文的目标是本文的目标是构建并系统评估首个针对英语→罗马尼亚语机器翻译性别偏见的端到端方案。具体包括三件事:其一,设计一条混合流水线,用微调的小型 LLM(LLaMA 3.2 1B)在翻译前推断英语句中每个目标词的语境性别(阴性/阳性/模糊),并以行内标签 / 显式标注;其二,微调标签感知的 Transformer 翻译模型(基于 Helsinki-NLP/opus-mt-en-ro),使其学会依据标签生成形态一致的罗马尼亚语;其三,发布三个新数据集——EnGen 的两个性别消歧数据集(11,472 例与 996 例)和 EnRoGend 标签化平行语料(1,974 例),并在 WinoMT 与 WinoGender 外部诊断集上验证,最终将性别准确率较基线提升 40 个百分点以上,同时缩小亲/反刻板印象子集间的差距。

与已有工作不同的是,本文的独特切入角度有三点。第一,问题空白:英→罗性别偏见此前无人处理,罗马尼亚语三性系统带来其他罗曼语没有的形态一致难题。第二,架构选择:作者刻意不让 LLM 直接翻译——直接 LLM 翻译成本高、难以规模化控制——而是把 LLM 用于它擅长的判别任务(语境性别推断),把生成留给传统 NMT,用行内标签作为可解释、可审计的中间表示,从而保持与现有 MT 系统的兼容性。这与早期只向翻译模型提供句级说话人性别信号的做法不同:本文是词级、针对目标词的行内标签;也与近期用 instruction-tuned LLM 直接生成阴/阳两版译文的 prompt 工程路线不同:本文模型小得多且输出可控。第三,评测严谨性:针对最小对数据易泄漏的问题设计了 triplet-locked 与 pair-locked 划分策略,并在课程学习中引入 Forgetting F1 度量灾难遗忘,这些方法论贡献对后续性别控制 MT 研究有普适价值。

核心方法

方法的直觉是把'性别推断'与'性别实现'解耦为各司其职的模块,中间用标签桥接。整条流水线(图2)依次为:输入句 'The doctor congratulated the nurse' → 实体选择器用预定义实体表加模糊匹配找出候选角色名词(识别出 doctor、nurse)→ LLM 性别分类器对每个目标词输出三类之一(doctor→ambiguous、nurse→masculine)→ 合并生成带标签中间句 'The doctor congratulated the nurse...' → 标签感知 MT 模型输出性别一致的罗马尼亚语。技术上,分类器是 LLaMA 3.2 (1B),以 4-bit NF4 量化加载,LoRA 适配器注入 q/k/v/o/gate/up/down 投影,取末 token 隐状态 $h_{\text{last}}$ 接线性分类头 $y = Wh_{\text{last}} + b$($W \in \mathbb{R}^{3 \times d}$),交叉熵损失训练。翻译侧在源端 tokenizer 扩展 、、、 四个特殊 token,罗马尼亚语参考译文保持无标签以防性别信息泄漏到目标侧。

核心创新在于'判别与生成分离 + 词级行内标签'的架构。与已有工作的本质区别:(1) 早期性别标签方法只提供句级说话人性别信号,粒度粗且无法处理一句多人;本文为句中每个性别敏感目标词单独打上 / 标签,由翻译模型逐词执行。(2) 近期用 instruction-tuned LLM 直接生成阴阳两个译文的方案只适用高资源语言且推理成本翻倍;本文用 1B 参数分类器加小型 Marian 架构翻译模型,单张 Nvidia L4 GPU(Colab Pro)即可训练,可控性与可解释性更强。(3) 引入两阶段课程学习(单实体→含干扰词的多实体)训练分类器,并定义 Forgetting F1(第二阶段微调前后 D1 测试集 F1 之差)量化灾难遗忘:表4显示多数配置轻微下降(-0.0121、-0.0015),个别恶化到 -0.1820,个别反而提升 0.1950。(4) 数据层面用 triplet-locked / pair-locked 划分配合哈希重叠校验,杜绝最小对跨训练/验证/测试集泄漏,保证评估不被近重复样本虚高。

方法步骤详情

完整步骤如下。第一步数据构建:EnGen D1 含 11,472 例,每例一个性别敏感词(职业/家庭/动物/角色/姓名),上下文最多三句,阴/阳/模糊均衡,GPT 生成加母语者校验,按性别×类别分层 80/10/10 划分(9,177/1,147/1,148);D2 含 996 例,每句两个性别词(目标词加模糊干扰词),三元组锁定 70/15/15 划分;EnRoGend 含 1,974 对,覆盖 82 个职业的阴阳最小对(各 987 例),按对锁定 80/10/10 划分。第二步实体选择:预定义实体表加模糊匹配。第三步分类器训练:LoRA 更新 $\Delta W = \frac{\alpha}{r}AB$,Stage 1 在 D1 上搜 $r \in \{8,...,32\}$、学习率 $4\times10^{-5}$–$1.6\times10^{-4}$、2–3 轮;Stage 2 在 D2 上以更小学习率训练 1–2 轮,Optuna TPE 采样 12 次试验。第四步翻译微调:tokenizer 加四个标签 token,比较全量/部分(解冻最后 $N\in\{1,2,3\}$ 层编码器加解码器与嵌入)/LoRA 三种模式,网格搜索学习率 $\{10^{-5},5\times10^{-5},10^{-4}\}$、batch $\{8,16\}$、1–2 轮。第五步用 BLEU、chrF++、TER、COMET 与母语者人工评测验证。

技术新颖性

技术新颖性体现在四个层面。语言对层面:首个英→罗性别偏见工作,罗马尼亚语三性系统(如表3中 'profesorul'/'jurnalista' 的阴阳对立)要求名词—形容词—动词全链一致,比已有研究的法德西更具挑战。表示层面:行内标签 $<\text{tgF}>\text{teacher}</\text{tgF}>$ 构成可解释的中间表示,使性别约束显式化,比句级说话人标签粒度细、比 prompt 工程更可控、与现有 MT 系统兼容。指标层面:Forgetting F1 定义为第二阶段微调前后 D1 测试集 F1 之差,为课程学习的效果与遗忘程度提供了简单可比的度量。实证层面:给出'参数高效微调不足以学会标签→形态一致映射'的证据——LoRA 的 COMET 仅 0.6467–0.7263,而全量微调达 0.853,说明标签驱动的形态控制需要更大的适配容量,这对低资源语言适配研究有方法论价值。此外,防泄漏划分设计(pair_id 锁定加哈希重叠校验)可被任何最小对数据集直接复用。

Dataset 1 distributions. 左:性别在阴性、阳性、模糊实体间均衡分布;中:类别在家庭、动物、角色、职业、姓名名词间均衡;右:大多数短语只含一个句子,其次是两句和三句上下文。
Fig. 1: Dataset 1 distributions. 左:性别在阴性、阳性、模糊实体间均衡分布;中:类别在家庭、动物、角色、职业、姓名名词间均衡;右:大多数短语只含一个句子,其次是两句和三句上下文。
End-to-end pipeline example. 系统接收英语句子,抽取候选实体,用 LLM 为每个实体分类性别,为性别实体插入标签,并将带标签句子翻译成罗马尼亚语。
Fig. 2: End-to-end pipeline example. 系统接收英语句子,抽取候选实体,用 LLM 为每个实体分类性别,为性别实体插入标签,并将带标签句子翻译成罗马尼亚语。

实验结果

核心发现分三块。其一,LLM 性别分类器:D1 测试集最佳达 F1 0.97、准确率 97%;D2 最佳 F1 0.95 但配置间波动极大(最低 0.66),LoRA 秩 12–16 配合适当 $\alpha$ 最优;联合测试集 F1 最高 0.96、MCC 0.94,Forgetting F1 多数在 ±0.01 量级。其二,翻译模型(表5):全量微调(LR $10^{-4}$、batch 16、2 轮)最佳,验证集 BLEU 97.29、chrF++ 98.57、TER 1.71、COMET 0.853;测试集 COMET 0.846、BLEU 96.92、TER 1.94;部分微调(解冻 2–3 层)COMET 0.8511 几乎持平;LoRA 全面失败(COMET 0.6467–0.7263)。其三,基准评测(表6):完整流水线在 WinoMT 亲刻板印象 96.34%、反刻板印象 93.68%、WinoGender 91.53%,较基线(59.05%/50.13%/50.28%)提升约 37–43 个百分点;GPT-5.2 为 79.23%/58.79%/67.71%,仍带刻板偏好。亲/反差距从 8.92 个百分点缩至 2.66,说明对刻板默认值的依赖显著降低。评测由罗马尼亚语母语者完成,对不影响性别判断的变音符号缺失宽容处理。

Dataset 1 样例。每句包含一个目标词及其对应性别标注。
Table 1: Dataset 1 样例。每句包含一个目标词及其对应性别标注。
Dataset 2 三元组样例。librarian 为目标词,teacher、student、detective 为语境中同样可带性别的干扰实体。
Table 2: Dataset 2 三元组样例。librarian 为目标词,teacher、student、detective 为语境中同样可带性别的干扰实体。
英—罗性别标签数据集样例对。
Table 3: 英—罗性别标签数据集样例对。
Forgetting F1 指标量化灾难遗忘程度:多数配置轻微下降(如 -0.0121 或 -0.0015),少数出现大幅负值(如 -0.1820),个别为正(0.1950)。
Table 4: Forgetting F1 指标量化灾难遗忘程度:多数配置轻微下降(如 -0.0121 或 -0.0015),少数出现大幅负值(如 -0.1820),个别为正(0.1950)。
Transformer 标签微调的验证集超参优化结果,比较全量、部分、LoRA 三种模式在不同学习率、batch、轮数与解冻层数下的表现。
Table 5: Transformer 标签微调的验证集超参优化结果,比较全量、部分、LoRA 三种模式在不同学习率、batch、轮数与解冻层数下的表现。
基准测试集准确率:原始 Transformer 在阳性正确时表现更好(默认阳性),在亲刻板印象子集得分高于反刻板印象子集;GPT-5.2 也有强烈刻板偏好;性别感知流水线通过显式引导大幅提升所有子集。
Table 6: 基准测试集准确率:原始 Transformer 在阳性正确时表现更好(默认阳性),在亲刻板印象子集得分高于反刻板印象子集;GPT-5.2 也有强烈刻板偏好;性别感知流水线通过显式引导大幅提升所有子集。
查看结构化数据
任务指标本文基线提升
WinoMT(亲刻板印象子集) 性别准确率(人工评测) 96.34%(Pipeline LLM-MT) Raw Transformer 59.05%;GPT-5.2 79.23% 较 Raw Transformer 提升 37.29 个百分点,较 GPT-5.2 提升 17.11 个百分点
WinoMT(反刻板印象子集) 性别准确率(人工评测) 93.68%(Pipeline LLM-MT) Raw Transformer 50.13%;GPT-5.2 58.79% 较 Raw Transformer 提升 43.55 个百分点,较 GPT-5.2 提升 34.89 个百分点
WinoGender 性别准确率(人工评测) 91.53%(Pipeline LLM-MT) Raw Transformer 50.28%;GPT-5.2 67.71% 较 Raw Transformer 提升 41.25 个百分点,较 GPT-5.2 提升 23.82 个百分点
标签感知英→罗翻译质量 COMET / BLEU / chrF++ / TER COMET 0.846、BLEU 96.92、chrF++ 98.21、TER 1.94(全量微调,测试集) LoRA 最优 COMET 0.7263、BLEU 41.71;部分微调 COMET 0.8511 全量微调较 LoRA 最优配置 COMET 提升 0.12,验证参数高效微调不足以学习标签→形态一致映射
英语性别消歧(EnGen D1+D2 联合测试) F1 / 准确率 / MCC 联合 F1 0.96、准确率 96%、MCC 0.94;D1 单独 F1 0.97 无外部基线(首个该语言对数据集),D2 最差配置 F1 仅 0.66 课程学习后联合 F1 达 0.96,Forgetting F1 多数配置在 ±0.01 量级,遗忘可控

局限与改进

作者承认的局限:基准测试集没有罗马尼亚语金标准参考译文,性别正确性依赖单一母语者人工评测加抽查,主观性受限且难以规模化;GPT-5.2 因专有性质无法精确复现;部分译文存在选词错误或变音符号缺失,只因基线同样存在才在评测中宽容处理;流水线依赖预定义实体列表(基于先前研究的职业/角色名词表),列表外实体无法覆盖。我自己的观察:错误传播未被量化——分类器在多实体干扰下 F1 最低仅 0.66,一旦分类错误翻译必然错误,论文未报告端到端错误中归因于分类与翻译的比例;ambiguous 类别虽在分类器中存在,但翻译侧只有 / 两个标签,模糊情形如何在译文中落实(中性形式还是阳性行默认)未交代;训练与评测均为 Winograd 风格合成句,真实新闻、对话语料上的泛化未知;数据规模小(EnRoGend 仅 1,974 对、82 职业),对长尾职业和复杂句法覆盖存疑;另外没有报告流水线的推理延迟与成本对比。

独立分析的弱点

独立分析出的弱点及改进方向:(1) 封闭词表实体选择器——遇到表外职业、昵称或隐喻性指称会漏检,模糊匹配只能缓解拼写与复数变体;改进方向是引入 NER 或让 LLM 同时负责候选提议与性别分类,摆脱词表依赖。(2) 错误传播链——性别分类是单点故障,D2 上配置间 F1 从 0.66 到 0.95 的巨大方差说明鲁棒性不足;改进方向是引入置信度阈值,低置信时回退双形式生成或人工审核,让翻译模型接受软标签。(3) 标签体系不完备——只有阴阳二值标签,ambiguous 与 non-binary 情形无对应译文策略,而相关工作指出包容性形式需求真实存在;改进方向是增加中性标签并收集对应罗马尼亚语形式参与训练。(4) 评测无法自动化——人工判定性别正确性难以横向比较与复用;改进方向是从译文反推性别形态(词形分析)构建自动性别准确率脚本。(5) 数据领域窄——82 个职业的模板化句子难以覆盖真实语料的多样性;改进方向是以真实平行语料弱标注扩展,并用更大规模的干扰句增强分类器鲁棒性。

未来方向

作者明确提出:该流水线可推广到其他形态性别标记的目标语言,只需重建性别分类数据并重新适配翻译模型。基于本文成果可延伸的方向包括:其一,扩展标签体系以支持中性/包容性形式,回应多语言性别包容 MT 基准揭示的需求;其二,用多语言 LLM 分类器(多语言 LoRA 适配)同时服务多个目标语言,摊薄数据构建成本;其三,把分类器的概率输出作为软约束传入翻译模型做端到端联合训练,缓解错误传播;其四,在真实世界语料(新闻、维基、对话)上构建诊断集验证泛化;其五,结合更大的翻译基座模型(如 NLLB、Tower)与标签控制,检验 LoRA 失败的结论是否随模型容量增大而反转——这本身就是有价值的科学问题;其六,探索 LLM 直接翻译与标签管线的混合路由,在成本与质量间动态权衡;其七,分析标签如何在罗马尼亚语中触发名词—形容词—动词的一致链,做可解释性研究。

复现评估

复现条件总体友好。数据层面:三个数据集以 CC BY-NC 4.0 在 GitHub(Ioannnnna/EnRoGend)发布,仓库含完整的 LLM 数据生成 prompt,注意 NC 许可限制商用。模型层面:基座均为公开权重(Unsloth 的 LLaMA 3.2 1B、Helsinki-NLP/opus-mt-en-ro),无访问门槛。算力层面:分类器在单张 Nvidia L4(Colab Pro)上以 4-bit NF4 量化加 LoRA 训练,消费级或免费云端即可复现;翻译模型是约 74M 参数的 Marian 架构,超参搜索空间明确(学习率、batch、轮数、解冻层数),Optuna 固定 12 次试验预算,成本低。障碍点:GPT-5.2 基线不可复现;基准评测无金标准参考,需要罗马尼亚语母语者参与人工判定;论文未明确说明翻译训练与评测脚本是否全部开源,复现者可能需自行实现训练循环与 pair-locked 划分逻辑。综合评估复现难度为中低,数据开放与低算力需求是主要加分项。