论文

多语言 NMT 中未见过的低资源语言的嵌入初始化:边缘英语翻译案例研究

Embedding Initialization for Unseen Low-resource Languages in Multilingual NMT: A Case Study on Limbum-English Translation

模型训练监督微调与指令调优

摘要

NLLB-200 等多语言神经机器翻译模型涵盖 200 种语言,但仍有数千种语言不受支持,其中包括喀麦隆的大多数 Grassfields Bantu 语言。当 微调 这些模型适用于一种看不见的语言时,从业者必须选择一个代理语言标记,但这种选择不存在原则性的方法。我们实现了一种嵌入初始化策略,其中语言标记是模型中已有的多种类型相关语言的嵌入的平均值。我们使用来自新约文本的 8,837 个句子对的平行语料库和双语词典来评估这种方法的 Limbum-to-English 翻译。我们比较模型:NLLB-200 零样本 (chrF2++ = 12.5)、从头开始训练的 Transformer (chrF2++ = 14.5)、使用斯瓦希里代理词元进行微调的 NLLB-200 (chrF2++ = 47.3) 以及使用我们的平均嵌入初始化的 NLLB-200 (chrF2++ = 46.7)。我们发现多语言初始化的性能可与最好的单语言代理相媲美。两种 NLLB-200 变体都比从头开始的基线提高了超过 32 个 chrF2++ 点。这些结果表明,多语言迁移是资源极少的班图语翻译的主导因素,同时消除了启发式代理选择的需要。然而,所有系统都无法保留音调变音符号,这凸显了一个公开的挑战。我们提供数据集和代码以支持进一步的研究。