论文

论语言模型中拒绝的转向维度

On the Steering Dimensionality of Refusal in Language Models

模型评测模型行为与机制分析

摘要

现有的激活引导方法通常假设高级概念可以通过单个引导方向来调节。为了支持这一点,应该实现两种互补的干预措施:附加转向应该诱导目标行为,而定向消融应该抑制它。然而,行为可能占据超出单一方向的更丰富的激活几何形状,并且语义上相似的行为可以由不同的方向表示。在这项工作中,我们研究了有多少个方向可以可靠地控制两种不同类型的拒绝行为:安全对齐触发的拒绝和一般情况下的拒绝。考虑到单个转向向量的表达能力有限,我们研究了转向子空间的一般设置,并引入了转向维数的概念作为可靠控制行为所需的最小子空间维数。我们通过足够维数之前的(单调)改进和超过它的饱和度来表征足够的转向子空间,该子空间覆盖了目标行为的全部范围。根据经验,我们发现安全对准触发的拒绝是 1 维可操纵的,而多个不同的转向方向可以实现类似的控制。相比之下,一般情况下的拒绝表现出更丰富的激活几何形状,即使是 5 维的转向子空间也无法可靠地捕获其完整的可转向变化。我们的结果表明,拒绝背后的激活几何结构高度依赖于上下文,并且可能比单个线性转向方向复杂得多。

论语言模型中拒绝的转向维度的原论文方法或结果图
图 1:本工作中研究的两种拒绝类型的定性示例:安全调整触发的拒绝和一般情况下的拒绝。