论文
无目标的潜在安全调整
Target-free Latent Safety Alignment
摘要
大语言模型(LLM)仍然非常容易受到越狱攻击,这些攻击会引发有害行为并规避安全调整。为了防御此类攻击,人们提出了对抗性训练范式,首先模拟故障模式,然后训练模型来纠正它们,从而在安全调整方面产生有希望的改进。然而,这些方法通常通过鼓励固定的有害目标完成或通过执行从固定的良性-有害数据对派生的有针对性的激活消融来构建对抗性样本。因此,生成的对抗样本往往会引发同质的有害行为,而这些行为很难反映现实世界越狱攻击所引发的行为多样性。这种行为层面的狭窄从根本上限制了它们的稳健性。为了解决这个问题,我们提出了一种无目标对抗性训练框架,以无监督的方式生成对抗性样本。通过放大模型潜空间中的行为水平变化并使之多样化,我们的方法产生了语义上多样化的对抗性样本,从而诱发了广泛的有害行为。这种扩大的行为覆盖范围暴露了更多样的故障模式,从而提高了安全性。为了量化这种影响,我们使用语义熵作为对抗行为多样性的输出级度量。根据经验,我们的方法在目标模型中引发了多种有害行为,大大减轻了行为狭窄性并提高了对越狱攻击的鲁棒性。
