论文
GaelEval:苏格兰盖尔语 LLM 性能基准测试
GaelEval: Benchmarking LLM Performance for Scottish Gaelic
摘要
多语言 大语言模型 (LLM) 通常在没有官方支持的语言中表现出新兴的“影子”功能,但它们在这些语言上的表现仍然参差不齐且未得到充分衡量。对于形态句法丰富的少数民族语言(例如苏格兰盖尔语)来说,这一点尤其严重,因为这些语言的翻译基准无法捕捉结构能力。我们介绍 GaelEval,第一个盖尔语多维基准测试,包括:(i) 专家编写的形态句法 MCQA 任务; (ii)基于文化的翻译基准和(iii)大规模文化知识问答任务。根据流利说话者的人类基线 ($n=30$) 评估 19 LLM,我们发现 Gemini 3 Pro Preview 在语言任务上的准确率达到 $83.3\%$,超过了人类基线 ($78.1\%$)。专有模型始终优于开放权重系统,并且语言(盖尔语)提示产生了微小但稳定的优势(+$2.4\%$)。在文化任务中,领先模型的准确率超过了 90\%$,尽管大多数系统在盖尔语提示下表现较差,并且绝对分数相对于手动基准有所夸大。总体而言,GaelEval 揭示了前沿模型在盖尔语语法的多个维度上实现了高于人类的性能,展示了盖尔语提示的效果,并显示了专有模型与开放权重模型相比一致的性能差距。