论文
通过非局域性度量SAE特征的语义抽象度
Measuring Semantic Abstractness of SAE Features via Nonlocality
摘要
稀疏自编码器(SAE)通过理解相应任务相关且因果有效的特征,帮助揭示大语言模型(LLM)推理、越狱等行为的机制性解释。为评估此类机制性解释,下游研究必须区分表面词汇特征与真正高层的特征。然而,无论是基于自动可解释性(autointerp)的语义描述还是因果转向效用,都不能完全判定一个特征的抽象层级。为此,我们提出特征非局域性(FNL),定义为SAE特征激活上归一化的逐位置影响的熵。我们报告FNL与现有基于LLM的特征语义抽象度代理指标相关,并成功区分上下文依赖的推理特征与token驱动的特征,在由一个上下文特征和一个token级特征组成的随机抽取特征对中,73-84%的情况正确地将更高的FNL分配给上下文特征。我们展示两个下游应用。我们审计用于越狱缓解的基于SAE的特征,惊讶地发现最有效的特征是低FNL的位置特征,而非真正识别有害意图的特征。我们报告,在DeepSeek-R1-Distill-Llama-8B上转向高FNL特征使MATH-500准确率比未转向模型提高4.6分,且优于转向低FNL特征,尽管增益依赖于具体模型。我们得出结论:FNL为SAE特征的抽象层级提供了独立于LLM的、免标签的相关性证据,可应用于评估机制性解释以及为下游干预选择特征。
