论文
LocUS:在词表子空间和少量头中定向激活引导
LocUS: Head Selection and Subspace Projection for Targeted Activation Steering
摘要
激活引导是一种强大的免训练范例,用于在推理时控制大型语言模型。然而,标准方法根据对比数据估计每层转向方向并将其应用到该层的整个表示空间上,这可能会将干预与对比数据中存在的偏离目标属性耦合起来并降低不相关的能力。为了缓解这个问题,我们引入了 LocUS(局部非嵌入引导),这是一种将激活引导到模型自己的输出词汇子空间的方法。通过识别非嵌入矩阵内特定于属性的线性子空间,LocUS 强制执行几何约束,将转向变换限制到特定子空间,同时将其应用定位到注意力头的稀疏子集。对三个模型系列在毒性缓解、情绪重定向和阿谀抑制方面的广泛评估表明,LocUS 匹配或优于最先进的基线,同时对低于 6% 的参数进行干预,并更好地保留一般能力。
