论文
注意差距:使用 AlphaMWE 多语言并行语料库揭露 LLM 翻译盲点
Mind the Gap: Exposing LLM Translation Blind Spots Using the AlphaMWE Multilingual Parallel Corpus
摘要
LLM 在机器翻译 (MT) 任务上的性能通常取决于特定领域的数据可用性以及训练所用的语言对。为了检查多词表达式 (MWE) 是否仍然为 LLM 在语言理解和翻译方面设置瓶颈,我们报告了 WMT2026 测试套件共享任务的系统性能,为此我们使用公开的多语言并行语料库 AlphaMWE 作为测试套件。我们收到了 31 个机器翻译系统的输出,涵盖英语到中文 (zh)、波兰语 (pl)、德语 (de)、阿拉伯语 (ar),包括现代标准阿拉伯语 (MSA) 和两个方言(埃及阿拉伯语和突尼斯阿拉伯语)。我们使用 BLEU、ChrF、BERT-score 进行自动评估,以选择每个语言对的 Top3 系统,然后对所选系统进行人工评估。我们的研究结果表明: 比喻/MWE 现象仍然具有挑战性;自动指标有时会不一致;人类评估揭示了总分隐藏的特定于语言的错误;人工评估重新排名前 3 名系统。