论文

AfriSUD:用于评估非洲语言模型的依赖树库集合

AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

模型评测基准与评测资源

摘要

尽管非洲语言具有语言多样性和全球重要性,但在支持 NLP 的研究和资源中,非洲语言的代表性仍然不足。我们的目标是通过引入 AfriSUD 来弥补这一差距,这是第一个大规模的语法注释树库集合,涵盖九种不同的非洲语言,涵盖撒哈拉以南非洲的主要语系和地区。使用表面句法通用依赖关系 (SUD) 框架,我们社区主导的工作提供了经过母语验证的高质量数据,这些数据捕获了凝集和语气等类型学关键特征。我们在 AfriSUD 上评估了一系列用于词性标记和依存解析的模型,包括非 Transformer 基线、多语言预训练编码器和 LLM。我们的结果揭示了显着的语法差距,其中模型仍然显示出九种语言的明显局限性,这表明现有架构可能无法完全捕捉非洲语言语法的结构多样性。