论文
面向语言模型拒答规避的潜在空间攻击
Latent-space Attacks for Refusal Evasion in Language Models
摘要
安全对齐的语言模型经训练会拒绝有害请求,但其拒答行为可以通过引导内部表征来抑制。现有方法通过从模型激活中消融拒答方向来做到这一点,试图把拒答从模型的残差流中移除。尽管在实证上有效,这些方法缺乏对它们所诱发的潜在空间变换及其为何能抑制拒答的原理性解释。在这项工作中,我们把拒答抑制重新表述为一种针对线性探测器的潜在空间规避攻击,该探测器经训练用于区分被拒答与被回答的提示。在此视角下,先前工作的均值差方向自然地定义了这样一个探测器,而对其消融恰好等于投影到其决策边界上,即一种最低置信度规避攻击。这一视角不仅解释了先前工作的实证成功,也揭示了一个关键局限:规避止步于决策边界,因而需要把表征进一步推入顺从区域,即模型作答的区域。据此我们提出受控潜在空间规避攻击,以经过优化的置信度将表征投影越过边界。我们在 15 个指令微调、多模态与推理模型上取得最先进的攻击成功率,优于现有拒答消融基线与专门的越狱攻击。
