论文

LLM事实核查人员没有后见之明:测量错误信息检测中的泄漏渠道

No Hindsight for LLM Fact-Checkers: Measuring Leakage Channels in Misinformation Detection

模型评测鲁棒性、公平性与可信度评测

摘要

随着社交媒体上自动事实核查规模的扩大,大语言模型 (LLM) 的判决分数可能看起来比保证的要强。原因之一是评估混入了索赔时不可知的信息。两个渠道很容易混淆:训练之前记忆的结果和声明后发布的检索证据。然而标准基准很少将两者分开。在本研究中,我们通过重建时间点证据条件并探测模型表示中编码的结果信息来测量 AVeriTeC 和 QuanTemp++ 上的两个通道。我们发现了参数泄漏的大量证据,这些证据可以通过聚合精度来隐藏,而简单的表示瓶颈比基于互信息的训练惩罚更有效地减少了这种未来的泄漏。我们还发现,在 AVeriTeC 中允许索赔后证据会使零样本准确率提高 6.3 个百分点,而在 QuanTemp++ 中这种影响可以忽略不计,因为检索提供的索赔后证据很少。这些结果表明,当错误信息基准没有考虑到索赔时实际可用的信息时,它们可能会夸大事实核查性能。

LLM事实核查人员没有后见之明:测量错误信息检测中的泄漏渠道的原论文方法或结果图
图 3:零样本 Qwen3-14B 判决。 (a) 证据观点的宏观 F1:AVeriTeC 质量从无证据上升到时间点再到泄露;在 QuanTemp++ 上它是平坦的,因为它的检索表面几乎没有索赔后证据(表 13)。 (b) 在默认提示和纯证据提示下泄露了 $-$ 时间点通胀;当记忆后备被移除时,差距就会扩大。条形图位于完整的二进制声明集 ($n=2{,}513$ / $5{,}537$) 上。