论文

Nsanku:评估 LLM 加纳语言的零样本翻译性能

Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在资源丰富的语言上表现出了令人印象深刻的多语言能力,但它们在资源匮乏的非洲语言上的表现仍然知之甚少,而且基本上没有得到评估。本文介绍了 Nsanku,这是一个系统基准测试,用于评估 19 种开放权重和专有 LLM 跨 43 种加纳语言与英语配对的零样本机器翻译性能。评估句子来自 YouVersion 圣经平台,每种语言提供 300 个句子对。采用两个互补的自动指标:双语评估替补 (BLEU) 和字符 n-gram F 得分 (chrF),以及平均准确度得分和跨语言一致性维度。 Nsanku 代表了迄今为止针对加纳语言进行的最全面的 LLM 翻译评估。结果显示,gemini-2.5-flash 的总体平均得分最高,为 26.88(BLEU:24.60,chrF:29.16),其次是 claude-sonnet-4-5,为 24.87(BLEU:22.46,chrF:27.28),gpt-4.1 为 23.20(BLEU:21.15, chrF:25.24)。在开放权重模型中,kimi-k2-instruct-0905 以平均得分 20.87 领先。一致性分析的一个重要发现是,没有模型和语言同时达到高性能和高一致性的领导者象限,这表明当前的 LLM 尚不能可靠地用于大规模加纳语言翻译。 Siwu 的每种语言平均得分最高,为 25.73,而 Nkonya 得分最低,为 11.65。 Nsanku 为非洲语言 NLP 研究建立了一个公开可用、社区可扩展的评估基础设施。