论文
SIREN(将 LLM 引诱到岩石上):Web-RAG 推荐器中 PAIR 驱动的偏好操纵
SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders
摘要
本文研究了网络增强 大语言模型 (LLM) 生成的排名推荐的对抗性操纵。当 LLM 通过检索和读取实时网页来回答推荐查询时,它充当推荐器,每个检索到的页面都成为潜在的攻击面。之前的工作已经检查了伪造产品、检索中毒和等级提升。然而,这些研究没有比较对已检索页面的不同编辑如何改变模型的最终排名,而周围的源集保持不变。为了解决这一差距,我们提出了 SIREN,一种自动攻击者判断方法,该方法使 PAIR 越狱循环适应竞争性排名操作,其目标是在 LLM 生成的推荐中将所选实体移动到排名~1。 SIREN 使用 Anthropic 的网络工具检索和捕获网页,然后使用 23 种内容中毒技术的可解释分类法迭代编辑检索到的源。定制 RAG 重播平台以相同的顺序保留相同的源,因此模型排名的变化可以与所提供内容的变化相关联,而不是与检索的差异相关联。在两个 Claude 生产模型中,SIREN 在 8 个查询模型上下文中嵌套的 124 项技术试验中的 62 项中排名第一。然后,达到排名~1 的有效负载在新会话中进行测试,并以 0.805 的平均成功率重现结果。在评估的设置中,声明性排名声明和种子列表通常比指令形式注入更有效,尽管这种差异的强度取决于目标模型。据我们所知,这是第一个针对生产 LLM 中竞争排名操纵的对照研究之一,其中提供的源上下文保持固定。