论文

当自回归一致性损害安全对齐时

When Autoregressive Consistency Hurts Safety Alignment

模型评测安全与风险评测

摘要

大语言模型 (LLM) 中的安全对齐很脆弱,部分原因是它通常很浅:微调 主要重塑模型在前几个输出标记附近的行为。我们认为,这种现象可以通过自回归一致性来理解,即下一个标记预测一致地保留和扩展当前响应轨迹的趋势。通过分析安全对齐的学习动态,我们表明自回归一致性可以将对齐更新集中在早期标记上,为浅层安全对齐提供机械解释。同样的机制还预测了对 LLM 的更广泛的攻击:在输出轨迹中的任意位置引发有害连续状态的攻击。作为一个具体的例子,我们引入了随机插入攻击,它将一个短的有害跨度插入到原本安全的拒绝轨迹中,并利用自回归一致性来维持所产生的有害分支,从而绕过安全对齐。值得注意的是,即使在较长的拒绝前缀之后,较短的有害跨度也可以将生成重定向为有害,这凸显了自回归一致性作为潜在的更广泛的故障机制。这表明安全对齐还应该打破整个输出轨迹中有害的自回归一致性。因此,我们提出对抗性安全对齐,这是一个基于最坏情况有害连续状态的初始框架,并通过随机最坏插入训练来实例化它。总的来说,我们的结果表明,自回归一致性应被视为安全调整和攻击设计中的核心考虑因素。