论文

量化翻译错误对多语言 LLM 评估的影响

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

模型评测评测方法与指标

摘要

机器翻译基准被广泛用于评估 大语言模型 (LLM) 的多语言能力,但这些基准中的翻译错误仍未得到充分探索,引发了人们对多语言评估的可靠性和可比性的担忧。我们解决了两个实际差距:(i) LLM 法官和跨度感知 QE 基线 (xCOMET-XXL) 的自动 MQM 式错误跨度与基准翻译上的专家人类跨度注释的匹配程度如何,以及 (ii) 翻译错误(相对于英文原文中的源端问题)对翻译基准的准确性下降的解释程度如何。我们发现,跨度一致性对于自然发生的基准翻译而言并非微不足道,并且即使在控制了英语正确性和源端异常之后,目标端翻译错误始终与翻译准确性的可测量的百分点下降相关。