论文
从文章到前提:构建 PrimeFacts、事实核查证据的提取方法和资源
From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence
摘要
事实核查文章编码了丰富的支持证据和推理,但由于非结构化的呈现,这些证据在很大程度上仍然无法被自动验证系统访问。我们介绍 PrimeFacts,这是一种从完整的事实核查文章中提取细粒度证据的方法和资源。我们编译了 13,106 篇包含主张、判决和所有引用来源的 PolitiFact 文章,并确定了 49,718 个文章内超链接作为查明关键证据的自然锚点。我们的框架利用 大语言模型 (LLM) 将这些锚定句子重写为独立的、上下文无关的前提,并研究额外隐含证据的提取。在跨文章证据检索和声明验证的评估中,提取的前提显着提高了性能。脱离语境的证据具有更高的可检索性,与逐字句子相比,平均倒数排名相对提高了 30%,并且使用证据进行判决预测使 Macro-F1 比基线提高了 10-20 个点。这些收益在不同的判决粒度(2 类与 5 类)和模型架构中是一致的。定性分析表明,脱离语境的前提仍然忠实于原始来源。我们的工作强调了重用事实核查者的证据以实现自动化的前景,并提供了来自现实世界事实核查的大规模结构化证据资源。