论文
稀疏自动编码器自动解释性中的描述性冲突:当一种解释描述许多特征时
Descriptive Collision in Sparse Autoencoder Auto-Interpretability: When One Explanation Describes Many Features
摘要
稀疏自动编码器(SAE)现在是用于将语言模型激活分解为可解释特征的标准工具,并且自动可解释性管道通常为每个特征分配一个简短的自然语言解释。现有对这种做法的批评集中在多语义性——一个具有多种含义的特征——或者解释是否可以预测激活。我们发现了一个互补的、结构上不同的问题,我们称之为描述性冲突:许多不同的 SAE 特征都承认相同的解释。重新分析最大的人工注释 SAE 特征公开数据集(Marks 等人,2025 年),其中包含 Gemma 2 2B 和 Pythia 70M 中的 722 个注释特征,我们发现平均注释字符串在 3.07 个特征中被重用; 82.1% 的特征与至少一个其他特征共享注释;单个最常见的注释字符串(“复数名词”)标记了跨越 18 个层和四个模型组件的 101 个不同特征。从信息理论上讲,平均注释只能解析 70% 的特征同一性。我们形式化了一个称为歧视的属性,证明当前的检测式自动可解释性评分对于碰撞是不变的,并提出了两个互补的纠正指标——碰撞调整检测和歧视评分——明确惩罚无法区分特征与其邻居特征的解释。碰撞问题独立于先前识别的自动解释性故障模式,并且与先前识别的故障模式相加;忽略它会使报告的特征可解释性膨胀,其数量大约相当于识别特征所需比特的三分之一。