论文
从token列表到图基元:稀疏自编码器特征的Weisfeiler-Lehman分析
From Token Lists to Graph Motifs: Weisfeiler-Lehman Analysis of Sparse Autoencoder Features
摘要
稀疏自动编码器(SAE)已成为机械可解释性的核心,它将Transformer激活分解为单语义特征。然而,现有的分析几乎完全通过顶部激活标记列表或解码器权重向量来表征特征,而在特征之间共享的高阶共现结构在很大程度上未经检查。我们引入了一种图结构表示,其中每个 SAE 特征都被建模为词元共现图:节点是强激活附近最频繁的词元,边连接在本地上下文窗口中同时出现的对。然后,自定义 WL 样式的频率分箱图内核提供该结构空间上的相似性度量。作为对在 GPT-2 Small 上训练并使用合成混合域语料库进行探测的大型 SAE 特征的概念证明,我们的聚类恢复了启发式主题家族(标点符号较多的模式、语言和脚本集群以及类似代码的模板),而这些主题家族是通过解码器余弦相似性聚类无法恢复的。词元直方图基线实现了更高的整体纯度,因此图视图的贡献是补充性的而不是主导性的:它表面了词元频率和解码器权重视图单独无法捕获的结构关系。集群分配在图构造超参数和随机种子中是稳定的。