衡量多语言机器翻译评估中品种合并的成本:将莫桑比克 Xichangana、Nyanja 和 Sena 添加到 FLORES+
Measuring the Cost of Variety Conflation in Multilingual MT Evaluation: Adding Mozambican Xichangana, Nyanja and Sena to FLORES+
摘要
在本文中,我们使用葡萄牙语来源的评估集扩展了三个莫桑比克班图品种:Xichangana、莫桑比克 Nyanja 和 Sena。我们将 Xichangana 与现有的 Tsonga 参考以及 Mozambican Nyanja 与 Chichewa 进行比较,并评估 NLLB-200、Google Translate、GPT 和变体感知 NLLB 模型。保持系统输出固定可显示出相当大的参考灵敏度。在 \textit{devtest} 上,仅将参考从 Tsonga 更改为 Xichangana 可使 NLLB-200 的 spBLEU 降低 13.10 点,对于 Google 降低 15.30 点。在匹配的 Nyanja 子集上,用 Mozambican Nyanja 替换 Chichewa 会分别产生较小但一致的减少,分别为 3.03 和 6.10 spBLEU。变体感知微调在预期目标上逆转了这种模式:相对于 NLLB-200,它在 \textit{devtest} 上将 Xichangana 提高了 7.04 spBLEU,将 Mozambican Nyanja 提高了 5.33,同时损失了同级引用的性能。 GPT 在 Tsonga 和 Chichewa 品种上具有竞争力,但在莫桑比克品种上明显较弱。对于 Sena,微调模型在 \textit{devtest} 上达到 12.64 spBLEU 和 36.21 chrF++。这些发现激发了对跨境语言或语言方言/变体的多样性感知语言标识符、参考和报告。该数据可在 Hugging Face 上公开获取:https://huggingface.co/datasets/MOZNLP/FLORES_MOZ