论文

EDRAC:阿拉伯语方言阅读理解基准测试

EDRAC: Benchmarking Arabic Dialect Reading Comprehension

模型评测基准与评测资源

摘要

与现代标准阿拉伯语 (MSA) 相比,阿拉伯语方言 (DA) 仍然资源不足,特别是在机器阅读理解 (MRC) 和问答 (QA) 方面。现有的阿拉伯语 QA 基准主要关注正式的书面 MSA 或多项选择 QA,对自然口语方言的覆盖范围有限。在这里,我们的目标是弥合这一差距。我们推出 EDRAC,这是第一个针对阿拉伯语方言机器阅读理解 (MRC) 和生成 QA 的大型基准,涵盖五种主要方言:埃及语、摩洛哥语、阿联酋语、叙利亚语和沙特阿拉伯语。 EDRAC 包含源自自然发生的口语交互的 499 个段落,以及通过人类 LLM 协作管道生成的 4,977 个相应的 QA 对,该管道结合了迭代生成、LLM 作为法官评估和人类验证。我们使用词汇和语义指标在 EDRAC 上对以阿拉伯语为中心的多语言 LLM 进行基准测试。我们的结果揭示了语义答案质量和方言保真度之间的巨大差距,凸显了阿拉伯语方言生成的现有评估指标的局限性。 EDRAC 为阿拉伯语方言 NLP 的未来研究提供了现实且具有挑战性的 MRC 基准。