论文
HalluTruthQA:阿拉伯语问答中幻觉检测、定位和解释的细粒度基准
HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering
摘要
大语言模型 (LLM) 可以生成流利的阿拉伯语答案,但事实错误仍然难以检测、定位、解释和验证。现有的幻觉基准通常提供响应级别标签,对识别确切的错误内容、解释其错误原因或选择正确的事实答案的支持有限。我们引入 HalluTruthQA,这是阿拉伯语问答中幻觉评估的细粒度基准。该基准包含 2,400 个专家策划的示例,涉及四个知识密集型领域:伊斯兰知识、历史、科学和地理。每个示例将一个阿拉伯语问题和模型生成的答案与经过验证的参考答案、二进制幻觉标签和六个候选答案配对以进行事实验证。幻觉答案还包括字符级错误跨度、人工书写的解释以及宏观和微观层面的幻觉类型。我们在幻觉检测、跨度级定位、事实验证和解释评估的零样本设置中评估了四个开源 LLM、ALLaM-7B、Falcon-H1R-7B、Qwen3-32B 和 SILMA。结果表明,这些任务具有不同的能力:没有一个模型在所有任务中都表现最佳。最佳得分为:检测得分为 0.880 Macro-F1,定位得分为 0.516 F1-Sp,事实验证得分为 0.852 LO-Score,解释评估得分为 0.644。这些发现表明,幻觉评估应该超越反应级别的检测,转向事实错误的定位、验证和解释。