论文
语言模型激活空间的可操纵性签名
Signatures of Steerability in Activation Space of Language Models
摘要
使用一组对比表示来引导语言模型一直是控制模型行为的规范且计算高效的方法。尽管在控制某些模型行为方面取得了成功,但激活控制的有效性在不同概念之间存在显着差异。引导向量的泛化属性通常被认为是用于构造它们的数据集的函数。我们使这种数据集依赖性声明更加严格,并表明简单的分离指标与跨不同设置的语言模型的下游可操纵性密切相关,即使在控制层和数据集效应之后也是如此。除了预测之外,我们还提供了来自合成叠加实验的证据,表明分离度量与经验特征方向和真实特征方向之间的对齐密切相关。我们的结果表明,简单的可分离性统计可以作为转向向量何时可能发挥作用的实用诊断。