论文

针对基于 LLM 的顺序推荐系统的提示未知促销攻击

Prompt-Unknown Promotion Attacks against LLM-based Sequential Recommender Systems

模型评测安全与风险评测

摘要

大语言模型 支持的顺序推荐系统 (LLM-SRS) 最近展示了卓越的性能,可通过对用户交互序列进行提示驱动的推理来实现推荐。然而,这种范式也引入了新的安全漏洞,特别是文本级操作,使它们成为促销攻击的有吸引力的目标,这些攻击故意提高特定目标项目的排名。尽管此类安全风险已受到越来越多的关注,但现有的研究通常依赖于访问受害者模型或提示揭示攻击机制的不切实际的假设。在这项工作中,我们在更现实的设置下研究了 LLM-SRS 中的项目升级攻击,其中系统提示和受害者模型对于攻击者来说都是未知的,并提出了提示未知双重中毒攻击(PUDA)框架。为了模拟这种完整黑盒设置下的攻击,我们引入了基于 LLM 的进化细化策略,该策略推断离散系统提示,从而能够训练模仿受害者模型行为的有效代理模型。利用提炼的提示和代理模型,我们设计了一种促销攻击,在语义约束下对抗性地修改目标项目文本,并通过高度可信的代理生成的中毒序列进一步补充,以实现具有成本效益的目标项目促销。对现实世界数据集的大量实验表明,PUDA 在提高不受欢迎的目标项目的曝光度方面始终优于最先进的竞争对手。我们的研究结果揭示了现代 LLM-SRS 中的关键安全风险,即使提示和模型都受到保护,并强调需要更强大的防御手段。