论文
知己知彼:通过多样化数据合成与指令级思维链学习使 LLM 抵御提示注入
Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning
摘要
集成大语言模型(LLM)的应用日益普遍,却面临来自提示注入(PI)攻击的严重安全漏洞。防御 PI 攻击面临两大问题:恶意指令可以通过多样的载体注入;且被注入的指令往往与周围上下文缺乏清晰的语义边界,使其难以识别。为解决这些问题,我们提出 InstruCoT,一种用于 PI 防御的模型增强方法,它合成多样化的训练数据并采用指令级思维链微调,使 LLM 能够有效识别并拒绝恶意指令,无论其来源或其在上下文中的位置如何。我们从行为偏离(Behavior Deviation)、隐私泄露(Privacy Leakage)与有害输出(Harmful Output)三个关键维度评估 InstruCoT。在四个 LLM 上的实验结果表明,InstruCoT 在所有维度上均显著优于基线,同时保持效用性能不下降。
