论文
在多哈历史词典中扎根阿拉伯语 LLM:检索增强对《古兰经》和圣训的理解
Grounding Arabic LLMs in the Doha Historical Dictionary: Retrieval-Augmented Understanding of Quran and Hadith
摘要
大语言模型 (LLM) 在许多语言任务中取得了显着的进步,但他们仍然在复杂的历史和宗教阿拉伯文本(例如《古兰经》和圣训)中挣扎。为了解决这个限制,我们开发了一个基于历时词典知识的检索增强生成(RAG)框架。与之前依赖通用语料库的 RAG 系统不同,我们的方法从多哈阿拉伯语历史词典 (DHDA) 中检索证据,这是记录阿拉伯语词汇历史发展的大型资源。所提出的管道将混合检索与基于意图的路由机制相结合,为 LLM 提供精确的、上下文相关的历史信息。我们的实验表明,这种方法将阿拉伯语本地 LLM(包括 Fanar 和 ALLaM)的准确率提高到 85% 以上,大大缩小了与专有大规模模型 Gemini 的性能差距。 Gemini 还充当 LLM 法官系统,在我们的实验中进行自动评估。自动判断通过人工评估得到验证,表现出高度一致性(kappa = 0.87)。错误分析进一步强调了关键的语言挑战,包括变音符号和复合表达。这些发现证明了将历时词典资源整合到检索增强生成框架中以增强阿拉伯语理解的价值,特别是对历史和宗教文本的理解。代码和资源可在以下位置公开获取:https://github.com/somayaeltanbouly/Doha-Dictionary-RAG。