论文

为 Kokborok 实现高质量机器翻译:印度东北部资源匮乏的藏缅语

Towards High-Quality Machine Translation for Kokborok: A Low-Resource Tibeto-Burman Language of Northeast India

应用与实践机器翻译

摘要

我们推出 KokborokMT,这是一种适用于 Kokborok (ISO 639-3) 的高质量神经机器翻译 (NMT) 系统。Kokborok 是一种藏缅语,主要在印度特里普拉邦使用,约有 150 万使用者。尽管 Kokborok 是特里普拉邦的官方语言,但它在 NLP 社区中的资源仍然严重不足,之前的机器翻译尝试仅限于在源自圣经的小型语料库上训练且 BLEU 分数低于 7 的系统。我们在包含 36,052 个句子对的多源并行语料库上微调 NLLB-200-distilled-600M 模型:来自 SMOL 数据集的 9,284 个专业翻译的句子,来自 WMT 共享任务数据的 1,769 个圣经领域句子,以及通过 Gemini Flash 从 Tatoeba 英语源句子生成的 24,999 个合成反向翻译对。我们在 NLLB 框架中引入了 Kokborok 作为新的语言标记。我们最好的系统在保留的测试集上获得了 17.30 和 38.56 的 BLEU 分数,这比之前发布的结果有了显着的改进。由三名注释者进行的人工评估得出的平均充分性为 3.74/5,流畅性为 3.70/5,训练有素的评估者之间基本一致。