论文
梯度控制解码:具有双锚转向的 LLM 的安全护栏
Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering
摘要
大语言模型 (LLM) 仍然容易受到越狱和直接提示注入攻击,但最强大的防御过滤器经常过度拒绝良性查询并降低用户体验。之前关于越狱和提示注入检测的工作(例如 GradSafe)使用单个“接受所有”锚标记来检测不安全的提示,但其阈值很脆弱,并且不能提供确定性保证,即一旦解码开始就不会发出有害内容。我们引入了梯度控制解码(GCD),这是一种 无需训练 护栏,它结合了接受锚标记(“Sure”)和拒绝锚标记(“Sorry”),收紧了决策边界并显着降低了误报。在缓解阶段,如果标记了提示,GCD 会在自回归解码恢复之前预设注入一个或两个拒绝词元(“抱歉,我不能......”),从而保证第一个词元的安全性,无论采样策略如何。在 ToxicChat、XSTest-v2 和 AdvBench 上,在可比召回率下,GCD 与 GradSafe 相比,误报率降低了 52%,与最强的仅解码基线相比,攻击成功率降低了 10%,在 V100 实例上平均增加了 15-20 毫秒的延迟,传输到 LLaMA-2-7B、Mixtral-8x7B 和 Qwen-2-7B,并且仅需要 20演示模板。