论文

解释 GAND:关于性别模糊的自然数据和对比归因的资源

Explaining GAND: A Resource on Gender-Ambiguous Natural Data & Contrastive Attribution

模型评测基准与评测资源

摘要

机器翻译 (MT) 系统继续产生带有性别偏见的翻译。在自我表达至关重要的时代,基于默认行为和刻板印象的误译可能会对这些系统的用户造成伤害。为了更好地理解这些系统如何在缺乏明确性别线索的情况下转化性别,我们需要以自然方式反映性别模糊场景的基准资源。为此,我们提出了 GAND,这是一种用于机器翻译的性别模糊自然数据基准测试资源,由英语源句子组成,专门用于分析上下文线索对翻译中性别的影响。我们利用 GAND 进行可解释性分析:我们将 GAND 的子集翻译成两种语法性别语言,并通过手动制作的对比翻译来扩展它们。以下特征归因分析揭示了上下文中的源单词,这些源单词告知目标翻译中模糊所指实体的性别翻译。