论文

XQ-MEval:具有跨语言并行质量的数据集,用于基准翻译指标

XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation Metrics

模型评测基准与评测资源

摘要

自动评估指标对于构建多语言翻译系统至关重要。评估这些系统的常见做法是对不同语言的指标分数进行平均,但这很可疑,因为指标可能会受到跨语言评分偏差的影响,即相同质量的翻译在不同语言之间会获得不同的分数。这个问题尚未得到系统研究,因为不存在提供跨语言并行质量实例的基准,而且专家注释也不现实。在这项工作中,我们提出了 XQ-MEval,这是一个涵盖九个翻译方向的半自动构建的数据集,用于对翻译指标进行基准测试。具体来说,我们将 MQM 定义的错误自动注入到参考译文中,由母语人士过滤它们以确保可靠性,并合并错误以生成质量可控的伪翻译。然后,这些伪翻译与相应的来源和参考文献配对,形成用于评估翻译指标质量的三元组。使用 XQ-MEval,我们对九个代表性指标进行的实验揭示了平均和人类判断之间的不一致,并提供了跨语言评分偏差的第一个经验证据。最后,我们提出了一种源自 XQ-MEval 的归一化策略,该策略可以对齐跨语言的分数分布,从而提高多语言度量评估的公平性和可靠性。