论文
AdversarialCoT:LLM 推理的单文档检索中毒
AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning
摘要
检索增强生成 (RAG) 通过检索外部文档来增强 大语言模型 (LLM) 推理,但也开辟了新的攻击面。我们研究 RAG 中的知识库中毒攻击,攻击者将恶意内容注入检索语料库,然后 检索器 自然地显示该内容,并在推理过程中由 LLM 消耗。与之前用有毒文档淹没语料库的工作不同,我们提出了 AdversarialCoT,这是一种特定于查询的攻击,仅对语料库中的单个文档造成毒害。 AdversarialCoT 首先提取目标 LLM 的推理框架来指导构建初始对抗性思想链(CoT)。对抗性文档通过与 LLM 的交互进行迭代完善,逐步暴露和利用关键推理漏洞。基准 LLM 上的实验表明,单个对抗性文档会显着降低推理准确性,揭示微妙但有影响力的弱点。这项研究揭示了 RAG 系统中的安全风险,并为设计更强大的 LLM 推理管道提供了可行的见解。