论文
LQM:语言驱动的机器翻译多维质量指标
LQM: Linguistically Motivated Multidimensional Quality Metrics for Machine Translation
摘要
现有的机器翻译评估框架,包括自动指标和人工评估方案(例如多维质量指标(MQM)),在很大程度上与语言无关。然而,它们通常无法捕获双语语言(例如阿拉伯语)中的方言和文化特定错误,其中翻译失败源于语言多样性、内容覆盖范围和语用适当性的不匹配,而不仅仅是表面形式。我们引入了 LQM:语言动机的机器翻译多维质量指标。 LQM 是一种分层错误分类法,用于通过六个语言基础级别来诊断 MT 错误:社会语言学、语用学、语义学、形态句法、正字法和字形学(图 1)。我们构建了一个包含 3,850 个句子(每种 550 个)的双向平行语料库,涵盖七种阿拉伯方言(埃及语、阿联酋语、约旦语、毛里塔尼亚语、摩洛哥语、巴勒斯坦语和也门语),这些句子源自对话式、文化丰富的内容。我们在零样本设置中评估了 6 个 LLM,并使用 LQM 进行专家跨度级别的人工注释,在 3,495 个独特的错误句子中生成 6,113 个标记错误跨度,以及严重性加权质量分数。我们使用自动指标 (spBLEU) 来补充此分析。虽然 LQM 已在阿拉伯语上进行了验证,但它是一个与语言无关的框架,旨在轻松应用于或适应其他语言。 LQM 带注释的错误数据、提示和注释指南可在 https://github.com/UBC-NLP/LQM_MT 上公开获取。