论文

稀疏自动编码器对概念和函数进行编码:特征效果的下游几何

Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 作为可解释性工具的广泛使用受到 SAE 特征和模型行为之间不一致链接的限制。具有明确激活描述的特征可能具有微弱或意外的因果效应;转向可能会因提示而异或与预期方向相反;基于激活的特征选择可能会错过产生所需输出变化的特征。先前的工作研究了模型内部的特征几何形状,其中计算了特征。相反,我们研究由特征干预引起的模型 logits 变化的几何形状。我们引入了特征效应几何分析 (FEGA),这是一种无监督框架,可以跨上下文删除相同的活动 SAE 特征,并分析由此产生的 logits 更改云。在 SAE 变体中,一致的一维效果很少见:很少有特征表现得像可重复使用的方向。为了解释这种变化,我们区分与静态信息(例如事实属性)相关的类值特征和与上下文相关操作相关的类指针特征。类似值的特征通常表现出结构化的低维效应,尽管这些效应通常跨越多个方向。相比之下,类似指针的特征主要表现出漫射效应。我们的结果表明,一个特征可以被解释并且具有因果关系,而无需提供稳定的转向方向。