论文
SAEVerbalizer:通过表示语言化生成稀疏自动编码器特征的解释
SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
摘要
稀疏自动编码器(SAE)被提出从 大语言模型(LLM)表示中提取大量特征,但解释这些特征仍然主要依赖于外部观察。这种依赖导致从观察到的模型行为推断出肤浅的解释,以及大规模收集此类行为证据的计算效率低下。我们引入了 SAEVerbalizer,这是一个框架,它将 SAE 解码器方向注入到 LLM 的表示中,并微调 LLM 的下游层以生成注入特征的自然语言解释。经过训练后,生成的言语器可以直接从解码器方向解释 SAE 特征,从而解决这两个限制。我们的实验表明,学习到的语言表达能力可以泛化到未见过的特征,在单独训练的 SAE 词典之间传输,并且通过轻量级适配器,可以扩展到来自不同 LLM 的 SAE 特征。干预实验表明,注入多个方向会产生结合其含义的解释,而反转各个方向会产生相应的含义转变。