论文

QuranicMMLU:用于评估古兰经语言知识生成人工智能解决方案的认知感知基准

QuranicMMLU: A Cognitively-Aware Benchmark for Evaluating Generative AI Solutions on Quranic Linguistic Knowledge

模型评测基准与评测资源

摘要

我们推出了 QuranicMMLU,这是一个跨语言复杂性的多个维度评估古兰经阿拉伯语生成人工智能的基准。现有的《古兰经》基准以一般问题回答和语义检索为中心,没有探究特定的语言能力或按认知需求和经文难度进行分层。我们构建了一个涵盖音韵学、形态学、句法学、语义学和语用学的五支柱《古兰经》分类法,其中 31 个叶子涵盖了从 tajwīd 和词根与图案形态到启示场合和古兰经间连贯性的现象。对于每一片叶子,我们都会根据 Bloom 的认知水平和诗句困惑度生成分层的问题,然后让大语言模型作为法官独立回答每个项目并对其进行评分,并将注释路由到人工审核。生成的数据集包含 980 个人工审核的问题,每个问题都以开放式和多项选择的形式发布。我们在这些项目上对 12 个系统进行了基准测试,发现伊斯兰专业模型领先,但每个系统在多项选择准确率(平均 84%)方面的得分都高于开放式答案质量(平均 60%):两个排名非常一致(Kendall's {\tau}=0.73),但多项选择评分隐藏了只有在答案选项被删除后才会出现的失败。因此,QuranicMMLU 提供了一个严格的、以语言为基础的框架,用于评估古兰经领域的阿拉伯语 NLP。