论文

LiveFact:LLM 驱动的假新闻检测的动态、时间感知基准

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection

模型评测基准与评测资源

摘要

大语言模型(LLM)的快速发展将假新闻检测和事实核查任务从简单的分类转变为复杂的推理。然而,评估框架并没有跟上步伐。当前的基准是静态的,这使得它们容易受到基准数据污染(BDC)的影响,并且在时间不确定性下无法有效评估推理。为了解决这个问题,我们引入了 LiveFact,这是一个不断更新的基准,可以模拟真实世界中错误信息检测的“战争迷雾”。 LiveFact 使用动态、时间证据集来评估模型利用不断变化的、不完整的信息进行推理的能力,而不是根据记忆的知识进行推理。我们提出了一种双模式评估:用于最终验证的分类模式和用于基于证据的推理的推理模式,以及用于显式监控 BDC 的组件。对 22 LLM 的测试表明,开源 Mixture-of-Experts 模型(例如 Qwen3-235B-A22B)现在可以匹配或优于专有的最先进系统。更重要的是,我们的分析发现了显着的“推理差距”。有能力的模型通过识别早期数据切片中不可验证的声明来表现出认知上的谦逊——这是传统静态基准忽视的一个方面。 LiveFact 为评估稳健、时间感知的人工智能验证设定了可持续的标准。