论文

IslamTurathBench:用于评估伊斯兰学术传统 (turath) 上的 大语言模型 的多任务、多学科基准

IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于问答、教育和研究,包括答案取决于专门来源传统的宗教和文化领域。然而,在伊斯兰研究中,权威学术传统(图拉特)中保留的关键概念、方法和辩论缺乏高质量的注释资源。我们引入 IslamTurathBench (ISTB),这是一个多任务、多学科数据集,用于评估 LLM 关于经典伊斯兰学术的内容。 ISTB 由领域专家开发和审查,包含 3,465 个问答项目,这些问题答案项目取自 35 部公认的源著作,涵盖伊斯兰研究七个关键领域超过 12 个世纪的学术成果。为了实现模型能力的全面分析,ISTB 沿着两个轴构建:学术需求(初级、中级和高级)和任务格式(多项选择题、基于段落的理解和开放式知识问题)。 ISTB 包括来自学术人类参考小组的汇总分数和来自十个系统的零样本基线。该数据集支持对历史分层学术领域中跨源著作、学科、学术需求水平和问题格式的语言模型行为进行可重复的评估。