论文

IslamMMLU:评估 LLM 伊斯兰知识的基准

IslamicMMLU: A Benchmark for Evaluating LLMs on Islamic Knowledge

模型评测基准与评测资源

摘要

大语言模型 越来越多地被咨询为伊斯兰知识,但没有全面的基准来评估其在核心伊斯兰学科中的表现。我们引入 IslamMMLU,这是一个包含 10,013 个多项选择题的基准,涵盖三个领域:《古兰经》(2,013 个问题)、圣训(4,000 个问题)和 Fiqh(法理学,4,000 个问题)。每个轨道都由多种类型的问题组成,以检验 LLM 处理伊斯兰知识不同方面的能力。该基准用于创建用于评估 LLM 的 IslamMMLU 公共排行榜,我们最初评估了 26 个 LLM,它们在三个轨道上的平均准确度在 39.8% 到 93.8% 之间变化(通过 Gemini 3 Flash)。 《古兰经》轨道显示了最宽的跨度(99.3% 到 32.4%),而《Fiqh》轨道包括一个新颖的 Madhab(伊斯兰法学派)偏见检测任务,揭示了跨模型的可变思想流派偏好。阿拉伯语特定模型的结果好坏参半,但与前沿模型相比,它们的表现均较差。评估代码和排行榜是公开的。