论文

重新激活对齐:通过意图感知输入输出匹配防止LLM越狱

Reactivating Alignment: Defending LLMs from Jailbreaks via Intention-Aware Input-Output Matching

模型推理解码与生成控制

摘要

大语言模型(LLM)仍然容易受到越狱攻击,这些攻击在复杂的对抗性提示中隐藏了有害意图。现有的防御主要依赖于输入扰动或有害输出抑制,但它们很少对恶意意图所在的位置进行建模,从而导致脆弱的保护和过度的过度拒绝。我们提出了 SENTINEL,一种即插即用、生成时的越狱防御,它将缓解措施重新定义为意图提取问题。我们的主要见解是,指令调整的LLM表现出强大的输入输出语义一致性:无论越狱复杂性如何,生成的输出往往与攻击者的真实意图一致。 SENTINEL 通过匹配语义对齐的输入输出区域来利用此属性来提取意图揭示子序列,使用拒绝方向投影对这些子序列进行评分以估计危害性,并在必要时停止生成。在 HarmBench 上跨多个LLM的实验表明,SENTINEL 将越狱成功率降低到接近 5%,同时保持较低的过度拒绝率。我们进一步证明了对自适应攻击的鲁棒性,并提供了机械解释:SENTINEL 将越狱功能从对齐盲点重新分配到对齐区域。

重新激活对齐:通过意图感知输入输出匹配防止LLM越狱的原论文方法或结果图
图 1:意图提取建模。我们解决了提取概率 $\mathbf{p,q}$ 的优化问题,以对齐语义上接近的上下文窗口,同时保持组内语义多样性。优化发现具有$\{f_{\mu_{2}},f_{\mu_{3}},f_{\mu_{4}}\}$特征的上下文窗口与$\{f_{\nu_{2}},f_{\nu_{3}},f_{\nu_{4}}\}$高度相似。因此,我们提取与意图相关的输入输出上下文子序列,例如“在家制造炸弹(adv token)”,消除了大多数对抗性的token并使防御变得更容易。