论文

细粒度危害信号在大语言模型安全中的作用

The Role of Fine-grained Harm Signals in LLM Safety

模型评测模型行为与机制分析

摘要

先前的工作表明,大型语言模型中的内部危害性表示因风险类别而异,但共享共同的一般危害表示组件。这就提出了一个关于特定类别组件在大语言模型安全性中超越一般危害表征的作用的问题。为了回答这个问题,我们通过从每个类别危害性表示中删除共享的一般危害性表示来隔离特定于类别的组件,从而产生与每一层的一般危害性正交的类别残差。在 3 个指令调整的 LLM 中,使用跨 11 个风险类别的类别残差的激活引导,我们发现类别残差是否编码有害性在不同类别中有所不同,并且这种类别模式在不同模型中是相似的。类别残差是否会导致拒绝也因类别而异,但这种类别模式更依赖于模型。我们还发现,类别残差增加了大语言模型与共享的一般危害性表征的下游内部一致性。总之,这些发现表明,除了共同的一般危害性表示之外,还应该考虑更细粒度的类别残差,以充分了解大语言模型的安全性。更广泛地说,我们的研究结果表明,即使是与某一层概念正交的方向也可能有助于该概念的下游放大。