论文
佐证错觉:当更多的新闻让大语言模型的预测变得不那么真实时
The Corroboration Illusion: When More News Makes LLM Forecasts Less True
摘要
大型语言模型 (LLM) 越来越多地用于通过新闻检索和推理来预测现实世界事件。我们证明,这种对开放的、可爬行的新闻语料库的依赖创建了一个新的攻击面:对手只能发布文章,而无需访问检索器、模型或用户的查询,就可以系统地改变预测器的输出概率。我们将概率预测者的新闻语料库中毒形式化,这是一种与之前的 RAG 中毒不同的威胁模型,它的目标是事实答案或观点极性,而不是校准概率。我们使用三个基于开放 7-8B 模型构建的检索增强预测器,针对 1740 万篇文章的 Common Crawl News 语料库(具有严格的抓取日期截止时间)评估了对 500 个已解决的 ForecastBench 问题的攻击。每个问题的一篇大语言模型撰写的文章将 56% 的预测翻转到 0.5 的边界;五篇文章的翻转率为 69-73%,扣除中性文章安慰剂后的概率变化为 +0.13 至 +0.22,将 Brier 评分从 0.18 降低至 0.37。其效果在注入文章的数量、检索排名、查询相似性和上下文共享、跨模型系列的传输方面是单调的,并且不受声称的发布者的影响。然后,我们评估了三种自然防御措施——源允许列表、隔离然后聚合预测和困惑过滤——并表明每种防御措施都有一个廉价的绕过方式:分别是欺骗发布者、多数中毒和高温生成。我们的结果表明,概率大语言模型的判断继承了他们所消费的信息供应链的全部脆弱性。