论文
造假的多种方式:策略驱动的人工智能生成下的假新闻检测基准测试
Many Ways to Be Fake: Benchmarking Fake News Detection Under Strategy-Driven AI Generation
摘要
大语言模型 (LLM) 的最新进展使得大规模生成高度流畅且具有欺骗性的新闻类内容成为可能。虽然之前的工作通常将假新闻检测视为二元分类问题,但现代假新闻越来越多地通过人类与人工智能的协作而出现,其中战略上的不准确性被嵌入到原本准确可信的叙述中。这些混合事实的案例代表了现实和后果性的威胁,但它们在现有基准中的代表性仍然不足。为了解决这一差距,我们引入了 MANYFAKE,这是一个综合基准,包含通过多个策略驱动的提示管道生成的 6,798 篇假新闻文章,这些管道捕获了构建和完善假新闻的多种方式。使用这个基准,我们评估了一系列最先进的假新闻检测器。我们的结果表明,即使是先进的推理模型在完全捏造的故事上也接近饱和,但当谎言微妙、优化并与准确信息交织在一起时,模型仍然脆弱。