论文

BadSKP:针对使用软提示的知识图谱增强LLM的后门攻击

BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts

模型评测安全与风险评测

摘要

近来的知识图谱(KG)增强大语言模型(LLM)超越了纯文本知识增强,通过图神经网络将检索到的子图编码为连续软提示,引入了一个与标准文本接口并行运作的图条件通道。然而,现有后门攻击大多针对文本通道设计,其对这种双通道架构的有效性仍不清楚。我们表明这种架构造成了一个鲁棒性缺口:能轻易攻破文本KG提示系统的文本通道后门攻击,对基于软提示的对应系统基本失效。我们通过语义锚定来解释这一缺口:图导出的软提示使驱动生成的隐藏状态偏向与查询一致的语义,并抑制表层的恶意指令。由于这种锚定效应本身由图通道诱导,操纵图级表示的攻击者可以反过来将其重新导向对抗性语义。为证明这一风险,我们提出BadSKP,一种针对图到提示接口的后门攻击,采用多阶段优化策略:它构造对抗性目标嵌入,优化被投毒的节点嵌入以引导所诱导的软提示,并用流畅的对抗性节点属性近似优化后的表示。在两个软提示KG增强LLM上、跨四个数据集的实验表明,BadSKP在冻结和木马两种设置下都取得很高的攻击成功率,而纯文本攻击即使在基于困惑度的防御下也不可靠。

BadSKP:针对使用软提示的知识图谱增强LLM的后门攻击:论文配图
图2:BadSKP总览:冻结设定执行步骤1-3,木马设定执行全部4步,展示KG增强模型的后门攻击面。