论文

通过解码中安全意识探测防御大语言模型的越狱攻击

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

模型推理解码与生成控制

摘要

大语言模型(LLM)在自然语言任务上表现出色,并日益广泛部署于真实应用。尽管安全对齐工作大量投入,近期研究表明这种对齐往往浅层,且依旧容易受到越狱攻击。现有防御机制,包括基于解码的约束与事后内容检测器,难以应对复杂的越狱,常常干扰可靠检测或过度降低模型效用。本工作中,我们检视 LLM 的解码过程并做出一个关键观察:即便被成功越狱,模型在生成过程中内部仍表现出潜在的安全相关信号。然而,这些信号被模型对流畅续写的驱动所覆盖,阻止了及时的自纠或拒绝。基于这一观察,我们提出一种简单而有效的方法,显式呈现并利用这些潜在安全信号,在解码期间及早检测不安全内容。在多样越狱攻击上的实验表明,我们的方法显著增强安全性,同时对良性输入保持低过拒率并保留响应质量。我们的结果表明,在解码期间激活内在安全意识为防御越狱攻击提供了有前景的补充方向。代码已发布于:https://github.com/zyz13590/SafeProbing。

通过解码中安全意识探测防御大语言模型的越狱攻击
图2:我们的防御方法总览。训练模型使其在有害内容之后为短语 "Note that this is illegal and unethical" 分配更高的概率,而在良性内容之后分配更低的概率。在推理时,我们随机采样解码步,追加 "Note that this is",并以 "illegal and unethical" 的概率作为有害性的指示。