论文
ARAFA:大语言模型生成的阿拉伯语事实核查数据集
ARAFA: An LLM-Generated Arabic Fact-Checking Dataset
摘要
由于数据集和资源的稀缺,自动事实检查对阿拉伯语自然语言处理提出了重大挑战。在这份手稿中,我们介绍了 Arafa,这是一个用于现代标准阿拉伯语事实核查的新型大型数据集,通过利用大型语言模型 (LLM) 的自动化框架构建。该数据集是通过三步管道构建的:(1)从阿拉伯语维基百科页面生成声明并提供支持文本证据,(2)声明突变以生成具有反驳证据的具有挑战性的反事实声明,以及(3)自动验证步骤以验证生成的声明是否得到其随附证据的支持或反驳,或者证据是否未提供足够的信息来判断声明的有效性。生成的数据集包含 181,976 个声明-证据对,标记为支持、反驳或信息不足。对数据集中的测试样本进行的人工评估表明,使用 Cohen 的 Kappa 表示支持的声明,使用 Cohen 的 Kappa 表示强烈的注释者间一致性(kappa = 0.94)表示反驳的声明。基于人工评估样本的自动验证对于支持的主张的准确率达到 86%,对于反驳的主张的准确率达到 88%。为了展示 Arafa 作为自动阿拉伯语事实检查资源的价值,使用 Arafa 对四个基于开源 Transformer 的模型进行了微调,其中表现最好的模型在测试数据上获得了 77% 的宏观 F1 分数。除了 Arafa 是第一个用于阿拉伯语事实检查的大型数据集之外,我们的框架还提供了一种可扩展的方法,用于为其他低资源语言开发类似的资源。