论文

Transformer 拒绝机制的组件与维度稀疏性

Component and Dimension Sparsity in Transformer Refusal Mechanisms

模型评测模型行为与机制分析

摘要

激活转向通过干预内部激活来操纵大语言模型行为,但这些干预措施的机制基础仍然知之甚少。我们将拒绝转向分解为跨四个 开放权重 模型的组件级干预,识别注意力的稀疏子集和 MLP 组件,其转向足以重现完整的行为效果。我们发现拒绝方向集中在包含 28--48% 上游组件的稀疏组件机制中,保留了 88--101% 的转向有效性。在这些机制中,有效转向进一步集中在约 50% 的残余流尺寸,保留 85--98% 的组件机制基线,与特权基础结构一致。因此,稀疏性在两个层面上运行:哪些组件被引导,以及这些组件内的哪些维度承载信号。这些发现共同表明,拒绝并不是在Transformer中广泛编码的,而是由结构化的、可识别的机制组装而成,为机械地理解拒绝行为如何表示和引导提供了基础。为了便于重现,我们在 https://github.com/wang-research-lab/Refusal_Mechanisms. 中发布了所有代码和原始实验结果

Transformer 拒绝机制的组件与维度稀疏性:论文原图
图 2:残余流导向效率与尺寸百分比的函数关系。每个标记都显示相对于全维转向恢复的 ASR,并根据所使用的隐藏维度的比例进行绘制。标记标签指示相应的范数解释阈值 $t$ – 由保留维度解释的 $\|\mathbf{r}^{*}\|^{2}$ 的分数。在所有四个模型中,在 95% 标准阈值下保留 $\sim$50% 的尺寸可以恢复超过 90% 的全转向 ASR,其中一些模型超过了密集基线。仅当预算低于 50% 正常阈值时,性能才会急剧下降,从而确认拒绝方向集中在一组稀疏的高幅度坐标中。