论文

自动事实核查系统有多鲁棒?一项跨基准评估

How Robust Are Automated Fact-Checking Systems? A Cross-Benchmark Evaluation

模型评测鲁棒性、公平性与可信度评测

摘要

自动事实核查(AFC)系统检索证据并预测论断真实性,但现有评估遗漏简单基线,系统针对单一基准开发,其在跨领域上的泛化能力难以令人信赖。此前没有工作在多样数据集上交叉评估完整的“先检索后验证”两阶段流水线,本研究补充了仅检索研究(Thakur et al., 2021)与单阶段基准研究(Calamai et al., 2025)。我们评测九个模型——从随机与稀疏基线到微调Transformer、零样本LLM,以及AVeriTeC 2025共享任务排名最高的两个系统——覆盖科学、开放网页与气候领域的四个数据集。三个发现尤为突出:(1)在ClimateCheck上,仅用论断的模型与微调模型优于零样本LLM和表现最好的AVeriTeC 2025系统,凸显噪声证据可能降低真实性预测效果;(2)系统排名强烈依赖领域与指标:SciFact上最佳模型(macro-F1 0.70)在ClimateCheck上降至0.31,而AVeriTeC 2025冠亚军会因评估指标与数据集不同而排名互换;(3)用黄金标注替换检索证据可让各模型的真实性准确率提升14-22分,证实检索仍是首要瓶颈。我们发布代码、预处理数据集和全部结果,以支持可复现的AFC研究。

自动事实核查系统有多鲁棒?一项跨基准评估:论文配图
图3:声明真实性任务上每个方法–数据集组合的 Macro-F1 热力图。