论文

LLM 干预的低秩子空间分析

A Low-Rank Subspace Analysis of LLM Interventions

模型评测模型行为与机制分析

摘要

旨在改变 LLM 中特定行为(例如拒绝或阿谀奉承)的干预措施通常会导致其他行为发生意想不到的变化。缺乏针对性的控制使得设计和实施可靠的安全控制变得困难。为了理解这些副作用,我们引入了一个诊断框架来分析 LLM 中的交互行为。我们将行为建模为激活空间中的低秩子空间,并研究干预措施如何影响行为。在多个指令调整模型(7B-70B)以及拒绝、越狱和阿谀奉承的设置中,我们发现不同的行为共享内部表征,并且对一种行为的干预会以不对称的方式改变其他行为。一些行为充当上游控制点,其干预措施广泛传播到其他行为,而另一些行为则更加孤立。我们将这些影响与两个几何量联系起来:(i)行为子空间之间的重叠,以主角的平均平方余弦来测量,以及(ii)每个行为子空间和决策子空间之间的角度(捕获模型的最终决策,例如拒绝与遵守)。根据经验,对于具有较高子空间重叠的行为对以及子空间与决策子空间更接近(较小角度)的源行为,对其他行为的干预效果往往更大。这些发现凸显了目标行为控制的挑战:行为很难独立修改,因为干预措施可以通过共享表征和不对称交互传播。