论文

谁在看守守望者?人类不同意未见领域的翻译指标

Who Watches the Watchmen? Humans Disagree With Translation Metrics on Unseen Domains

模型评测评测方法与指标

摘要

自动评估指标是机器翻译系统开发的核心,但其在领域转移下的鲁棒性仍不清楚。大多数指标都是根据机器翻译研讨会 (WMT) 基准制定的,这引起了人们对其对未知领域的鲁棒性的担忧。之前分析看不见的领域的研究会改变翻译系统、注释器或评估条件,从而将领域效应与人类注释噪声混为一谈。为了解决这些偏差,我们引入了一个系统的多注释器跨域错误跨度注释数据集(CD-ESA),其中包含跨三种语言对的 18.8k 人类错误跨度注释,我们在其中修复每个语言对内的注释器,并评估跨一个已见新闻领域和两个未见技术领域的相同六种翻译系统的翻译。使用这个数据集,我们首先发现自动指标对于分段级别的域转移表现出惊人的鲁棒性(高达 0.69 一致性),但是一旦我们考虑到人类标签的变化,这种鲁棒性就基本上消失了。平均注释可将注释者间的一致性提高高达 +0.11。与人类相比,指标在看不见的化学领域上表现不佳(注释者间一致性为 0.78-0.83 vs. 0.96)。在跨不同领域进行评估时,我们建议将度量-人类一致性与注释者间一致性进行比较,而不是单独比较原始度量-人类一致性。