论文

通过多轮证据消融评估和改进 LLM 中的循证事实核查

Evaluating and Improving Evidence-Grounded Fact-Checking in LLMs via Multi-Round Evidence Ablation

模型评测评测方法与指标

摘要

自动事实核查系统根据相关文件的证据评估索赔的真实性。 大语言模型(LLM)由于其通用推理能力,在事实检查方面表现出了强大的性能。然而,目前尚不清楚他们是否忠实地利用所提供的证据来做出准确性判断,还是依赖参数知识。为了调查这一点,我们引入了事实消除评估(FAE),这是一种新的评估框架,它迭代地消除引用的证据,以评估 LLM 是否相应地修改了他们的预测。我们的实证结果表明,当前现成的 LLM 作为事实检查系统更多地依赖于其参数知识而不是所提供的证据。为了弥合预测准确性和证据基础之间的差距,我们提出了 REAL(严格证据消融学习),这是一种训练框架,通过对 LLM 作为验证者模型的反事实证据监督来促进证据依赖的验证。对不同领域的四个事实检查数据集的实验表明,与标准微调模型相比,使用 REAL 训练的模型获得了卓越的证据依赖能力。我们的研究结果强调,强大的事实核查性能仍然可以与弱的证据依赖共存,而 REAL 鼓励准确性预测与支持证据的可用性保持更紧密的联系。