论文

EnSiTa - 特定领域机器翻译的三语多领域并行数据集和基准

EnSiTa - A Trilingual Multi-Domain Parallel Dataset and Benchmark for Domain-Specific Machine Translation

模型评测基准与评测资源

摘要

低资源语言的机器翻译 (MT) 仍然远远落后于高资源语言,并且在并行数据稀缺或完全不存在的专业领域中差距最大。我们推出了 EnSiTa,一个三语多域并行数据集和英语、僧伽罗语和泰米尔语基准。 EnSiTa 提供七个领域的人工后期编辑训练数据,以及这些领域和一个附加领域的手动翻译测试集,所有这些数据均由专业翻译人员在多年的严格质量控制流程下生成。使用该数据集,我们对所有六种语言方向的特定领域 MT 进行了广泛的研究,在训练数据大小、模型规模以及域内、跨域、多语言和多域设置中微调了从头开始的 Transformer、预训练的翻译模型 (NLLB-600M) 和仅解码器的 LLM(Gemma 3 系列、1B-12B 和 TranslateGemma)。据我们所知,这是最广泛、系统记录的低资源机器翻译多领域并行数据创建和基准测试工作。我们的数据和模型将公开发布。