论文

大语言模型 使用不同的机制生成有害响应,跨危害类型共享

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

模型评测模型行为与机制分析

摘要

大语言模型 仍然容易受到引发有害响应的越狱的影响,但人们对有害响应生成背后的机制知之甚少。在这里,我们研究如何在模型参数中组织此功能。我们识别并修剪专门支持有害合规性的参数,在参数级别提供直接的机制分析。我们发现这种能力取决于一组稀疏的关键参数:修剪这些参数大大减少了有害的合规性,同时仅导致良性能力的有限退化,这表明有害生成的关键组成部分与一般公用事业的关键组成部分是分开的。从一种伤害类别中确定的参数也可以减少其他伤害类别中的有害反应,表明不同伤害类型共有的成分。这种可分离性主要出现在对齐模型中,这表明即使行为保障措施仍然脆弱,对齐训练也会在内部重塑有害反应机制。我们进一步表明,有害反应的产生与识别和推理有害性的能力是分不开的。最后,我们将分析扩展到紧急失准,并确定了一组稀疏的导致失准的参数,并在 微调 域之间进行了大量共享。总之,这些结果揭示了不安全行为背后的一致参数级组织,并指出了提高模型安全性的更有原则的干预措施。