论文

CommunityFact:动态、多语言、多领域的错误信息检测基准

CommunityFact: A Dynamic, Multilingual, Multi-domain Benchmark for Misinformation Detection in the Wild

模型评测基准与评测资源

摘要

错误信息验证越来越多地发生在公共、快速变化和多语言的在线环境中,其中静态基准无法完整地衡量模型的可靠性。我们推出了 CommunityFact,这是一个可更新的野外错误信息检测基准,具有三个主要目标:覆盖范围、粒度和可再分发性。此版本包含跨五种语言和两个域的 15,992 个独立声明。我们在不同的推理时间能力(包括思维和网络搜索)下评估了十个 LLM。我们的结果表明,封闭输入验证仍然具有挑战性,网络访问产生了最大的收益,并且网络支持的 LLM 的源选择策略与人类社区笔记评估者所关注的源系统性地不一致——这一差距可以通过特定于模型的检索扩展或修剪机制来弥补。我们进一步发现跨语言领域切片和跨网络系统使用的证据生态系统的巨大差异。除了评估之外,CommunityFact 将社区注释定位为声明条件源建议者的训练信号,可以改进对新颖声明的事实验证。