论文

COILD:以印度语为中心的并行语料库和跨印度语言机器翻译的基准

COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages

模型评测基准与评测资源

摘要

印度语言的机器翻译 (MT) 仍然受到以印度语为中心的高质量平行语料库和评估基准的有限可用性的限制。现有的多语言资源主要是由以英语为中心的内容构建的,往往无法捕捉印度语言的语言多样性、文化复杂性和特定领域的特征。我们提出 COILD,一个以印度语为中心的平行语料库,包含超过 116 万个人工翻译和人工验证的句子对,涵盖印度-雅利安语、德拉威语、藏缅语和南亚语系的 20 个印度语言对。该语料库完全根据从跨八个领域的许可存储库收集的原始印度语言资源构建,具有直接的现实应用性。此外,我们引入了一个以领域为中心的基准,其中包含 2,000 个经过专家验证的句子,以实现跨印度语言对的一致的多语言和跨语言评估。为了验证 COILD 的有效性,我们对两个代表性的多语言神经机器翻译模型 IndicTrans2-Distilled 和 NLLB-200 进行了微调。实验结果表明,跨语言对、领域、自动评估指标和人工评估都有一致的改进,凸显了高质量的以印度语为中心的监督的有效性。 COILD 为推进印度语言的多语言机器翻译和未来多语言语言模型提供了宝贵的训练和评估资源。