论文

低资源 Tangkhul 的神经机器翻译--英语

Neural Machine Translation for Low-Resource Tangkhul--English

应用与实践机器翻译

摘要

我们提出了一项针对 Tangkhul-English (nmf-en) 语言对的低资源机器翻译的研究。唐库尔语是一种资源严重匮乏的藏缅语,主要在印度曼尼普尔邦使用,之前几乎没有自然语言处理基础设施。我们描述了两个系统:(1)基于 ByT5-large 的主系统,在 38,336 个 Tangkhul-English 平行句子对上进行微调;(2)基于 mT5-small 的对比系统,在同一语料库上进行微调。我们的主要 ByT5-large 系统在包含 3,856 个句子的测试集上获得了 39.97 的语料库 BLEU 分数、58.07 的 chrF++ 分数、0.8104 的 BERTScore F1 分数和 0.7302 的 COMET (wmt22-comet-da) 分数。我们进一步讨论唐库尔拉丁文字变音符号特有的拼写挑战、我们的训练语料库(包括圣经文本、故事和对话数据)的领域偏见,以及通过数据多样化和领域适应进行未来改进的途径。