论文
转向向量是对抗性攻击面
Steering Vectors are an Adversarial Attack Surface
摘要
激活转向已成为在没有 微调 的情况下控制 大语言模型 (LLM) 行为的流行方法。由于该技术是即插即用的,用户可以共享数据集和预先计算的向量来引导模型激活。然而,我们表明\emph{隐形数据中毒攻击}悄悄地损害了这个管道。通过替换转向数据集中的 $4{-}6\%$ 词元,攻击者可以悄悄地将结果向量与反拒绝方向对齐。这会越狱目标模型,同时保留对良性提示的预期转向效果。在这种威胁模型下,恶意行为者可以分发一个看似安全的包,其中包含文本、向量和权重,以及最终用户可以验证的等效证书。我们在两个开放权重模型系列和八个模型属性组合上测试了攻击,观察到中毒向量在干净的参考上达到了 $20{-}55\%$、$+19\%$ 到 $+51\%$ 的绝对攻击成功率 (ASR)。最后,我们发现拒绝方向正交化防御可以恢复 ${\approx}82\%$ 的 ASR 差距,而不会损害良性行为。