论文

SharedSAE:跨语言模型的一个特征字典

SharedSAE: One Feature Dictionary Across Language Models

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 广泛用于解释语言模型激活,但 SAE 训练和潜在标记通常会针对每个模型重复进行。在这里,我们展示了单个共享 SAE 可以取代一组专用的每模型 SAE。我们的方法 SharedSAE 将共享字典与特定于模型的编码器-解码器对相结合。最接近的先验方法会丢弃激活幅度并要求所有模型进行推理,而 SharedSAE 则仅对选择分数进行归一化,保留幅度,并使用模型 dropout 进行单模型推理。我们在跨越不同家族和分词器的四个 1B 级基本语言模型上训练 SharedSAE。尽管跨模型共享其潜力,SharedSAE 仍保留了专用 SAE 的平均解释方差的 96.6%;它的潜在激活表现出的跨模型相关性是事后对齐的单独 SAE 的 1.8 倍,并且其潜在描述可以跨模型转移。字典冻结后,新模型可以有效地适应它,在重用共享潜在描述的同时实现近乎专用的 SAE 重建质量。