论文
HalluTruthQA-4K:用于阿拉伯语幻觉检测和真相验证的细粒度语料库和注释过程
HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification
摘要
大语言模型 可以生成流利的阿拉伯语答案,同时引入难以识别和验证的事实错误。现有的阿拉伯语幻觉资源通常为整个响应分配一个二元标签,指示它是幻觉还是非幻觉,但提供有关确切错误内容、错误原因或正确事实答案的有限信息。我们推出 HalluTruthQA-4K,这是 HalluTruthQA 资源的扩展版本,包含 4,000 个专家策划的阿拉伯语问答实例,涉及四个知识密集型领域:伊斯兰知识、历史、科学和地理。作为 HalluScoring 2026 共享任务第二轨的官方数据集,HalluTruthQA-4K 将我们的原始语料库扩展到 4,000 个实例。每个实例将一个阿拉伯语问题与模型生成的响应、经过验证的参考答案和五个看似合理的干扰因素配对。幻觉反应还附加了字符级错误跨度、人工编写的解释和分层幻觉类型的注释。该语料库包含 1,643 个幻觉反应和 2,357 个非幻觉反应,以及 1,843 个带注释的错误跨度。我们描述了资源构建和注释方法,包括问题选择、受控答案生成、候选构建、专家注释、独立验证、裁决和质量控制。我们还记录注释指南、分类、数据格式、注释者间协议和语料库统计数据。 HalluTruthQA-4K 为幻觉检测、跨度错误定位、解释生成、事实验证以及阿拉伯语言模型中事实可靠性的更广泛评估提供了可重用的资源。