论文
叠加中神经网络表示的相似性
Similarity of Neural Network Representations in Superposition
摘要
比较内部表示是神经科学和机器学习的核心目标,但标准线性对齐度量(表示相似性分析、中心核对齐和线性回归)经常应用于神经活动坐标而不是底层特征。我们证明,当神经系统以叠加方式运行时,通过线性压缩编码比神经元更多的特征,这一点很重要。封闭式推导证明这些度量取决于每个系统投影的 Gram 矩阵,而不是潜在特征本身:对齐因此将系统表示的内容与其编码方式结合起来。对于那些对两个系统共享哪些功能感兴趣的人来说,这是一个问题:两个网络可以具有相同的功能内容,但看起来比表现出部分功能重叠的网络更加不同。这种明显的错位不需要反映丢失的信息,因为压缩感知保证稀疏特征仍然可以从压缩活动中恢复。我们通过训练有监督的 TopK 稀疏自动编码器来证实这一点,这些自动编码器通过构造实现可解的压缩感知,即使在原始激活对齐保持收缩的情况下,也可以在恢复的潜在变量上找到对齐。我们将结果扩展到没有 真值 潜在变量训练的无监督 SAE,以及预训练的视觉和语言模型 SAE,其中 SAE 潜在对齐超过原始激活对齐,与真实系统中的叠加一致。