评估豪萨语和 Fongbe 机器翻译的 大语言模型:基准、故障和指标可靠性
Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability
摘要
我们调查了当前 大语言模型 (LLM) 英语到豪萨语和英语到丰贝语(分别来自亚非语系和尼日尔刚果语系的两种类型不同的西非语言)的翻译质量,并评估标准自动指标是否可靠地反映了人类对这些低资源语言的判断。我们使用自动指标(BLEU、chrF++、TER、COMET、BERTScore)以渐进规模(500 到 10,000 个句子)评估四种模型(GPT-4o Mini、Claude Sonnet 4、Gemini 2.5 Flash 和 Qwen2.5-7B),并根据母语人士的判断进行验证。我们的结果揭示了三个关键发现。首先,翻译质量因语言而异:豪萨语的翻译质量可以接受(人类得分 4.0-4.5/5),而 Fongbe 的翻译质量较差(1.0-2.2/5),所有系统的 BLEU 差距一致为 3 倍。其次,模型排名因语言而异——根据人类评估,Gemini 领先于 Fongbe,而 GPT-4o 领先于豪萨语——这表明一种资源匮乏的非洲语言的表现并不能预测另一种资源的表现。第三,指标与人类的相关性差异很大:Fongbe 的排名相关性完美 (rho=1.0),但豪萨语的相关性较弱 (rho=0.5),其中人类评估者更喜欢 GPT-4o,尽管所有自动指标都将 Claude 排名第一。我们进一步表明,像 BERTScore 这样的神经指标对于两种语言都表现出嵌入崩溃(语言内相似度 >0.99),限制了它们区分翻译质量的能力。基于这些发现,我们建议对资源匮乏的非洲语言进行多指标评估,在解释神经指标时要特别小心。我们确定稳定的系统排名需要 n=2,500 个句子的最小样本量,因为较小的样本会产生大规模逆转的伪影结果。