论文
通过稀疏自编码器比较状态空间模型和Transformer中的潜在概念形成
Comparing Latent Concept Formation in State Space Models and Transformers via Sparse Autoencoders
摘要
Transformer 自注意力的二次缩放推动了像 Mamba 这样的次二次选择性状态空间模型 (SSM) 的采用,它将过去的上下文压缩为固定大小的循环隐藏状态。这种严格的信息瓶颈提出了机械可解释性的一个基本问题:SSM 和 Transformer 是否学习根本上不同的潜在表示?在这项工作中,我们采用稀疏自动编码器 (SAE) 在 1000 万个词元语料库上进行 Mamba-130m 和 Pythia-70m 之间的大规模特征级对应分析。与预测广泛架构分歧的假设相反,我们没有发现架构之间存在系统表征分歧的证据:在观察到的 Jaccard 分布中,99.98% 的 Mamba 特征聚集到上对齐边界,为普遍性假设提供了初步的特征级别支持。我们进一步识别并定性地描述了这种微观部分(0.02%)的发散特征,找到了与循环瓶颈有选择地限制严格语法而不是广泛语义本体的解析这一假设相一致的模式。我们证明,虽然 Pythia 不受约束的注意力允许对不同格式边缘情况进行单语义分解,但 Mamba 被迫将不相关的句法异常压缩到多语义的“垃圾抽屉”神经元中,以保留状态容量。总的来说,这些结果表明架构路由机制对核心语义理解的影响可以忽略不计,表示分歧仅限于极端的结构边缘。