论文
HalluScore:大语言模型 幻觉问答基准
HalluScore: Large Language Model Hallucination Question Answering Benchmark
摘要
大语言模型(LLM)在自然语言生成方面取得了显着的进展,但仍然容易产生幻觉。为了回应人们对幻觉日益增长的担忧,已经制定了一些基准,主要是英语和中文。然而,阿拉伯语的代表性仍然不足,由于注释资源稀缺和语言的形态复杂性,LLM 幻觉的基准有限。因此,现有基准不能充分反映阿拉伯语的语言、文化和推理特征。为了解决这一差距,我们引入了 HalluScore,这是一种结构化的阿拉伯语问答基准,旨在评估 LLM 中不同推理难度级别、各种知识领域、历史时间线和基于文化的阿拉伯语场景的幻觉行为。它包含 827 个精心策划的问题,用于评估、检测和减轻 LLM 中的幻觉。该数据集是通过结构化管道构建的,涉及质量保证、清晰度和事实有效性的过滤以及模型驱动的选择以保留持续引发幻觉的问题。每个问题都链接到经过验证的 真值 证据、答案解释和多标签注释。使用 HalluScore 基准,我们对 17 种阿拉伯语、多语言和推理 LLM 的幻觉模式进行了全面的实证分析。此外,我们还提供高质量的人类注释,识别所有评估的 LLM 的幻觉、非幻觉和部分幻觉反应。这些结果表明,阿拉伯语 LLM 中的幻觉不仅限于事实错误,还包含与文化理解、语言推理和逻辑一致性相关的挑战。我们发布 HalluScore 是为了支持未来提高阿拉伯语 LLM 的可靠性和文化能力的研究。