论文
探索 LLM 偏差来操纵 AI 搜索概述
Exploring LLM biases to manipulate AI search overview
摘要
现代 大语言模型 (LLM) 通常用于许多业务应用程序,特别是用于生成搜索结果概述的 Web 搜索系统和应用程序 - LLM 概述系统。此类系统使用 LLM 从搜索结果中选择最相关的来源并生成用户查询的答案。从许多研究中可知,LLM 具有不同的偏差,在 LLM Overview 应用程序中,源选择和答案生成阶段都可能受到 LLM 偏差的影响(这里我们主要关注选择阶段)。本研究的重点是调查 LLM Overview 系统中是否存在偏差,以及利用偏差来操纵 LLM Overview 结果。在这里,我们使用强化学习来训练一个小型语言模型来重写搜索片段,以增加它们被 LLM 概述首选的可能性。我们的实验设置有意限制策略仅在片段上运行并限制 奖励作弊 策略,反映了网络搜索环境的现实限制。结果证明 LLM Overview 系统存在偏差,并且强化学习在大多数情况下可以优化片段的内容以操纵 LLM Overview 结果。我们还证明,LLM 概述选择是由候选来源之间的比较优势而不是绝对优势驱动的。此外,我们还检查了 LLM Overview 操纵可能性的安全方面,并表明上下文中毒攻击可能导致不准确或有害的结果。