论文
语言模型特征学习:梯度更适合干预,激活更适合检测
Gradients for Interventions and Activations for Detection: Targeted Feature Learning in Language Models
摘要
模型内部特征可以通过其识别指定概念的能力及其在操纵时的因果效应(例如通过转向或权重编辑)来研究。特征学习的一种重要方法是稀疏自动编码器(SAE),它学习广泛的特征字典,这些字典与特定概念的关系通常是事后确定的。然而,许多可解释性问题是假设驱动的,并且涉及预先指定的概念。我们将这种设置作为有针对性的特征学习来研究,其中针对这样一个预定义的概念构建单个特征。我们对三个模型信号(激活值、激活梯度和参数梯度)和两个估计器(对比平均值和学习的一维编码器-解码器)进行了受控比较,产生了六种有针对性的方法,其中 CAA 和 GRADIEND 作为现有实例,以及覆盖其余组合的四种新方法。我们将这些方法与 15 个任务和三种语言模型中的预训练 SAE 进行比较,评估检测和因果干预。在模型中,最强的检测性能是通过对比激活值方法实现的,而最强的干预性能是通过基于梯度的方法实现的。总的来说,我们的结果表明,目标特征质量共同取决于模型信号和估计器,检测和干预捕获互补的特性。