论文
机器翻译质量标注的大型语言模型:人类和模型都面临挑战
Large Language Models for Machine Translation Quality Annotation: Humans and Models Are Both Challenged
摘要
大型语言模型 (LLM) 被认为是机器翻译 (MT) 评估中人类判断的更有效且更具成本效益的替代方案。由于机器翻译评估跨越大量语言对、领域和注释粒度级别,LLM必须在这些维度上进行彻底评估,然后才能可靠地用作人工评估的替代方案。在本文中,我们通过比较LLM与人类注释者的一致性,评估了两种著名的机器翻译质量评估方案的LLM的性能:多维质量度量(MQM)和误差范围注释(ESA)。我们展示了由 70 个语言对组成的长上下文测试集以及公开可用的 WMT23 和 WMT25 数据的结果,调查了各种语言对和领域之间的分数和错误跨度注释一致性。我们的结果表明,虽然对于某些评估任务,LLM与人类注释者的一致性超过了人类注释者之间的一致性,但两者在注释方案、语言对和领域之间存在很大差异,并且对于大多数设置来说仍然不可靠。 此外,我们还确定了人类和 LLM 注释者面临的挑战:人类尤其受到细粒度 MQM 注释和低资源语言对的挑战,而 LLM 则面临小错误、错误的语言变体和错误跨度注释。我们的结果凸显了人类和LLM注释性能的改进潜力,可能通过人类与LLM协作注释管道来解决本工作中发现的可靠性问题。