论文

一个被污染的页面就足够了:评估 LLM 推荐器中的 Web 内容污染

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

模型评测安全与风险评测

摘要

搜索增强型 LLM 通过检索实时网络内容越来越多地介导日常消费者推荐。这就产生了一个新的风险:LLM 推荐者可能会使用生成引擎优化 (GEO) 运营商污染的网页内容来误导他们。我们要问:他们在多大程度上无意中成为了假货的推销者?我们引入了 FORGE(生成环境中的虚假在线推荐),它将一组冻结的检索网页中的真实产品本地重写为虚假产品,并测量 LLM 在 15 个类别和 5 个消费场景的 225 种真实产品中推荐虚假产品的频率。在 12 个商业和开放权重 LLM 中,所有模型都容易受到攻击:单个污染页面的愚弄率高达 27%,而完整的 top-3 替换将这一比例提高到 73.8%。不同类别的漏洞各不相同,当模型缺乏对产品的稳定先验知识时,漏洞就会增加。推理并不能缓解此漏洞;相反,它经常会产生虚假的社会证据来证明错误的推荐是合理的。这四种防御措施都不够充分:怀疑提示会像推理一样加剧脆弱性,两个共识过滤器有压制合法产品的风险,可信度重新排名有助于每个模型,但只能去除六分之一的假货。我们在 https://github.com/leoluolol/forge-benchmark 发布了 FORGE 基准测试和评估代码。