论文

稀疏自动编码器特征匹配和电路压缩的语义最优传输

Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)已成为解释语言模型的核心工具。然而,仍然难以扩展的两个关键 SAE 分析是 (1) 跨多层匹配语义相似的特征,以及 (2) 将大型特征电路压缩为可解释的超级节点。尽管这些已被视为单独的问题,但我们表明两者都是更基本挑战的实例,我们将其框架为不同激活流形上的 SAE 特征之间的语义距离的估计。我们为这个问题引入了一个分布式框架,其中每个特征不是像文献中那样由单个解码器向量表示,而是由表达它的隐藏状态上的激活加权分布表示。通过将这些分布投影到共享参考空间中并将它们与 Wasserstein 距离进行比较,我们的方法为跨层特征比较提供了统一的语义度量。我们证明我们的表示对于激活重新缩放是不变的,在扰动下稳定,并且在有限样本裕度条件下恢复真实匹配。根据经验,我们的方法优于解码器向量和基于 LLM 的基线,并捕获相关特征之间的微妙功能差异。值得注意的是,我们的方法自动将大型特征电路压缩为可解释的超级节点。