论文

DiscourseFlip:针对黑盒检索增强一代的倾斜话语级意见操纵攻击

DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation

模型评测安全与风险评测

摘要

检索增强生成(RAG)系统被广泛部署且影响力日益增强,但它们对外部语料库的依赖暴露了有毒检索内容带来的新安全风险。现有的 RAG 攻击主要集中在单个查询或狭窄的主题本地查询集上,这限制了它们的实际范围,并在现实环境中提供了有限的伪装。在本文中,我们介绍了话语级意见操纵,这是一种新的威胁模型,其中跨语义查询网络的协调影响会导致整体多主题查询空间上的意见转变。我们在黑盒设置中形式化了这种威胁,并提出了 DiscourseFlip,这是一种代理的、图形引导的攻击,可以动态分配有限的中毒预算,以最大化话语层面的意见偏差。大量实验表明,DiscourseFlip 始终能够在上下文查询网络中引发有针对性的意见转变,并且在覆盖范围和有效性方面显着优于现有基线。用户研究进一步证实 DiscourseFlip 是有效的,同时还能很好地隐藏用户检测。此外,系统分析表明,现有的缓解策略对话语层面的操纵无效,这凸显了迫切需要更强大和适应性更强的防御措施来解决话语层面的漏洞。