论文
导致误导:对抗性内容注入攻击神经排名模型
Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models
摘要
神经排序模型(NRM)是现代信息检索的核心,但仍然非常容易受到对抗性操纵。现有的攻击通常依赖启发式或代理模型,限制了有效性和可转移性。我们提出了 CRAFT,这是一种由 大语言模型 (LLM) 提供支持的黑盒对抗等级攻击的监督框架。 CRAFT 分三个阶段运行:通过检索增强生成和自我完善来生成对抗性数据集,在策划的对抗性示例上监督 微调,以及偏好引导优化,以使生成与排名提升目标保持一致。对 MS MARCO 段落数据集、TREC 深度学习 2019 和 TREC 深度学习 2020 基准的大量实验表明,CRAFT 显着优于最先进的基准,实现了更高的晋升率和排名提升,同时保持流畅性和语义保真度。此外,CRAFT 可以在不同的排名架构之间有效传输,包括跨编码器、基于嵌入和基于 LLM 的排名器,强调了现实世界检索系统中的漏洞。这项工作为研究 NRM 中的对抗性威胁提供了一个原则框架,强调了生成式人工智能在排名操纵中的风险,并为开发更强大的检索系统提供了基础。为了支持可重复性,我们公开发布我们的源代码、经过训练的模型和提示模板。