论文

无目标的潜在安全调整

Target-free Latent Safety Alignment

模型训练偏好优化

摘要

大语言模型(LLM)仍然非常容易受到越狱攻击,这些攻击会引发有害行为并规避安全调整。为了防御此类攻击,人们提出了对抗性训练范式,首先模拟故障模式,然后训练模型来纠正它们,从而在安全调整方面产生有希望的改进。然而,这些方法通常通过鼓励固定的有害目标完成或通过执行从固定的良性-有害数据对派生的有针对性的激活消融来构建对抗性样本。因此,生成的对抗样本往往会引发同质的有害行为,而这些行为很难反映现实世界越狱攻击所引发的行为多样性。这种行为层面的狭窄从根本上限制了它们的稳健性。为了解决这个问题,我们提出了一种无目标对抗性训练框架,以无监督的方式生成对抗性样本。通过放大模型潜空间中的行为水平变化并使之多样化,我们的方法产生了语义上多样化的对抗性样本,从而诱发了广泛的有害行为。这种扩大的行为覆盖范围暴露了更多样的故障模式,从而提高了安全性。为了量化这种影响,我们使用语义熵作为对抗行为多样性的输出级度量。根据经验,我们的方法在目标模型中引发了多种有害行为,大大减轻了行为狭窄性并提高了对越狱攻击的鲁棒性。

无目标的潜在安全调整的原论文方法或结果图
图 1:所提出的无目标潜在对抗训练框架的概述。 (A) 先前的 LAT 方法通常会优化针对一个有害目标的单一潜在干预,这会导致行为上狭窄的对抗样本。 (B) 相反,我们的内部对手学习多个源层干预方向,并最大化由此产生的行为转变矩阵的核规范,以鼓励强大且多样化的行为水平转变。 (C) 将不同的学习方向应用于相同的有害提示会引发语义上不同的有害行为,从而增加通过语义熵衡量的输出水平多样性。 (D) 在外部对齐阶段,模型经过训练,在所有学习的干预方向下保持对有害输入的一致拒绝行为,同时保留对良性输入的有益行为,从而产生有利的安全性与效用权衡。