论文
LLM事实核查人员没有后见之明:测量错误信息检测中的泄漏渠道
No Hindsight for LLM Fact-Checkers: Measuring Leakage Channels in Misinformation Detection
摘要
随着社交媒体上自动事实核查规模的扩大,大语言模型 (LLM) 的判决分数可能看起来比保证的要强。原因之一是评估混入了索赔时不可知的信息。两个渠道很容易混淆:训练之前记忆的结果和声明后发布的检索证据。然而标准基准很少将两者分开。在本研究中,我们通过重建时间点证据条件并探测模型表示中编码的结果信息来测量 AVeriTeC 和 QuanTemp++ 上的两个通道。我们发现了参数泄漏的大量证据,这些证据可以通过聚合精度来隐藏,而简单的表示瓶颈比基于互信息的训练惩罚更有效地减少了这种未来的泄漏。我们还发现,在 AVeriTeC 中允许索赔后证据会使零样本准确率提高 6.3 个百分点,而在 QuanTemp++ 中这种影响可以忽略不计,因为检索提供的索赔后证据很少。这些结果表明,当错误信息基准没有考虑到索赔时实际可用的信息时,它们可能会夸大事实核查性能。
