论文

翻译还是背诵?校准资源极少的语言的机器翻译的评估分数

Translation or Recitation? Calibrating Evaluation Scores for Machine Translation of Extremely Low-Resource Languages

模型评测评测方法与指标

摘要

资源极少的机器翻译 (MT) 的特点是报告的性能存在令人困惑的可变性,通常使得不同语言对的结果难以情境化。对于专注于特定语言群体(例如古代语言)的研究人员来说,几乎不可能确定在其他背景(例如非洲本土语言或美洲语言)中报告的突破是否源于优越的方法或仅仅是基准收集的产物。为了解决这个问题,我们引入了 FRED 难度指标,其中包括生育率 (F)、检索代理 (R)、预训练 暴露 (E) 和语料库多样性 (D),并作为数据集内在指标来将报告的分数置于上下文中。这些指标表明,结果变异性的很大一部分是由训练测试重叠和 预训练 暴露而不是模型能力来解释的。此外,我们发现一些语言——特别是灭绝的语言和非拉丁本土语言——的标记化覆盖率很差(高标记生育率),这凸显了从缺乏共享词汇的高资源语言转移模型的根本限制。通过提供这些指数和性能分数,我们可以更透明地评估跨语言传输,并为 XLR MT 社区提供更可靠的基础。