论文
是什么推动了表征转向?转向拒绝的机械案例研究
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
摘要
将转向向量应用于 大语言模型 (LLM) 是一种高效且有效的模型对齐技术,但我们缺乏对其工作原理的可解释解释 - 具体来说,转向向量影响哪些内部机制以及这如何导致不同的模型输出。为了研究引导向量有效性的因果机制,我们对拒绝进行了全面的案例研究。我们提出了一个多词元激活修补框架,并发现不同的转向方法在应用于同一层时会利用功能上可互换的电路。这些电路表明,转向向量主要通过 OV 电路与注意力机制交互,而很大程度上忽略了 QK 电路。在转向过程中冻结所有注意力得分,三个车型系列的性能仅下降 8.83%。转向 OV 电路的数学分解进一步揭示了语义上可解释的概念,即使在转向矢量本身不能解释的情况下也是如此。利用激活修补结果,我们表明引导向量可以稀疏高达 85-96%,同时保留大部分性能,并且不同的引导方法在重要维度的子集上达成一致。