论文
先理解再核验:用于自动引文验证的主张规范化
Understanding before verifying: Claim normalization for automated citation verification
摘要
由于引用准确性对研究可靠性的重要性,人们对其进行了数十年的研究。内容级引文验证评估学术主张的可靠性。最近的工作采用了继承自事实检查的两阶段检索分类框架。然而,这种设计忽视了原始引用主张的复杂性,并在验证系统中引入了三个问题,即范围不匹配、视角不匹配和命题纠缠。这些问题增加了检索和分类的难度,从而限制了模型的性能。受这一差距的启发,我们提出了主张标准化,它在检索和分类之前对原始引用主张应用三种重写策略,允许每个下游模型执行单一的、明确定义的任务。在此方法的基础上,我们开发了声明规范化引文验证(CNCV),这是一个新的三阶段框架,包括声明规范化、带证据对齐的检索和引文分类。我们使用人工注释的引文实例的析因实验来评估 18 个分类器的 CNCV。与之前的两阶段框架相比,CNCV 将编码器的宏 F1 平均提高了 12%,将生成 LLM 的宏 F1 平均提高了 10%,这是由证据质量提高(我们实验中确定的主导因素)驱动的。从自动标准化的声明中检索的证据产生的下游分类性能在统计上与手动注释的证据获得的性能相当。