论文
KyrgyzLLM-Bench:吉尔吉斯语理解基准
KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding
摘要
跨语言评估 大语言模型 (LLM) 仍然具有挑战性,因为大多数多语言基准依赖于翻译的英语数据集,通常模糊了目标语言的语言和文化特异性。对于吉尔吉斯语等资源匮乏的语言来说,这个问题尤其明显,因为这些语言缺乏可靠的本土编写的评估数据。这项工作以之前引入的吉尔吉斯语评估数据集为基础,报告了使用 KyrgyzLLM-Bench 基准套件对吉尔吉斯语 LLM 进行的首次系统性大规模评估。 KyrgyzLLM-Bench 包含两个本地编写的数据集$-$KyrgyzMMLU 和 KyrgyzRC$-$ 以及精心翻译和手动后期编辑的 WinoGrande、HellaSwag、BoolQ 和 TruthfulQA 版本。我们在零样本和少样本设置下评估了 26 个开源和闭源 LLM,分析模型性能、跨语言迁移以及翻译工件对评估可靠性的影响。在不同的家庭和任务中,模型排名在 WinoGrande 和 BoolQ 上广泛地从英语转移到吉尔吉斯语,在 MMLU 上也有较小程度的转移,而 HellaSwag 表现出巨大的英语-吉尔吉斯语性能差距,这与翻译引起的合理性变化一致。少镜头提示改进了多个开源模型的阅读理解能力,但对于翻译任务的专有模型表现不一致。我们公开发布所有数据集、评估代码和每个模型的结果,并将吉尔吉斯语任务集成到广泛使用的多语言评估框架中,以支持吉尔吉斯语 NLP 的未来研究。