论文
LLM 探针:针对低资源语言评估 LLM
LLM Probe: Evaluating LLMs for Low-Resource Languages
摘要
尽管大语言模型(LLM)取得了快速进展,但由于注释资源有限和缺乏标准化评估框架,它们在资源匮乏和形态丰富的语言中的语言能力仍然没有得到很好的理解。本文提出了 LLM Probe,这是一个基于词典的评估框架,旨在系统地评估 LLM 在低资源语言环境中的语言技能。该框架分析了语言理解四个领域的模型:词汇对齐、词性识别、形态句法探测和翻译准确性。为了说明该框架,我们使用资源匮乏的闪族语言创建一个手动注释的基准数据集作为案例研究。该数据集包含带有语言注释的双语词典,包括词性标签、语法性别和形态句法特征,表现出注释者之间的高度一致性,以确保可靠的注释。我们测试了各种模型,包括因果语言模型和序列到序列架构。结果揭示了各种语言任务的性能存在显着差异:序列到序列模型通常在词法分析和翻译质量方面表现出色,而因果模型在词汇对齐方面表现出很强的性能,但翻译准确性较差。我们的结果强调需要进行基于语言的评估,以更好地理解 LLM 在资源匮乏环境中的局限性。我们将 LLM Probe 和随附的基准数据集作为开源工具发布,以促进可重复的基准测试并支持更具包容性的多语言语言技术的开发。