论文
Transformer 拒绝机制的组件与维度稀疏性
Component and Dimension Sparsity in Transformer Refusal Mechanisms
摘要
激活转向通过干预内部激活来操纵大语言模型行为,但这些干预措施的机制基础仍然知之甚少。我们将拒绝转向分解为跨四个 开放权重 模型的组件级干预,识别注意力的稀疏子集和 MLP 组件,其转向足以重现完整的行为效果。我们发现拒绝方向集中在包含 28--48% 上游组件的稀疏组件机制中,保留了 88--101% 的转向有效性。在这些机制中,有效转向进一步集中在约 50% 的残余流尺寸,保留 85--98% 的组件机制基线,与特权基础结构一致。因此,稀疏性在两个层面上运行:哪些组件被引导,以及这些组件内的哪些维度承载信号。这些发现共同表明,拒绝并不是在Transformer中广泛编码的,而是由结构化的、可识别的机制组装而成,为机械地理解拒绝行为如何表示和引导提供了基础。为了便于重现,我们在 https://github.com/wang-research-lab/Refusal_Mechanisms. 中发布了所有代码和原始实验结果
