论文

ContextClaim:用于可验证声明检测的上下文驱动范例

ContextClaim: A Context-Driven Paradigm for Verifiable Claim Detection

上下文与知识检索增强

摘要

自动事实核查管道通常从过滤阶段开始,该阶段决定哪些声明值得验证,因为后期的证据检索和验证组件大规模应用的成本高昂。此阶段的中心任务是可验证的声明检测,它询问声明原则上是否可以根据外部证据进行检查。先前关于此任务以及密切相关的检查价值概念的工作,其决策仅取决于声明语句本身。我们认为这是限制性的,因为决定一个陈述是否可检查通常取决于识别它提到的实体和事件,以及关于它们的外部信息是否实际上可用。受下游验证系统如何依赖检索到的证据的启发,我们将检索向上游移动到检测阶段并引入 ContextClaim。给定输入声明,该方法识别实体提及,查询维基百科作为结构化背景源,并使用 大语言模型 将检索到的材料压缩为简短的上下文摘要,然后将其传递给分类器。实验在两个领域和类型上进行,即 CheckThat! 2022 年 Twitter 集合和 PoliClaim 政治辩论语料库,涵盖 微调、零样本和少样本设置下的仅编码器和解码器模型。添加的上下文在多种配置中在可验证的声明检测方面产生了收益,尽管改进的大小因数据集、骨干模型和训练设置而异。我们进一步发现相同的检索到的摘要在检测之外是有用的。将它们输入 FEVER 上的下游验证模型可提高验证 F1。组件级分析、人工注释和错误检查进一步阐明了检索到的上下文在什么情况下有帮助,在什么情况下没有帮助。