论文

全局发散,局部收敛:SSM 和 Transformer 中的表示几何

Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers

模型评测模型行为与机制分析

摘要

尽管依赖于根本不同的架构,但最近的状态空间模型(SSM)(例如 Mamba)实现了与 Transformer 相当的语言建模性能。这就提出了一个重要的问题:这些结构差异如何影响其内部表示的几何形状和功能性质?我们通过对 Transformer、SSM 和混合架构中的表示进行多尺度分析来研究这个问题。首先,我们发现 SSM 在所有维度上均匀分布其表征信息,而 Transformer 表征很大程度上受单个主方向支配。通过评估混合架构,我们观察到在每个注意力层之后表示空间变得越来越偏向单一主导方向。接下来,我们探讨表示的不同几何分布如何通过可压缩性影响表示能力。令人惊讶的是,我们发现尽管它们的几何结构截然不同,但两种架构都表现出紧密匹配的有效容量。我们进一步研究这种倾斜的几何形状是否影响概念的编码方式。使用秩约束探针,我们证明两种架构都在维度惊人相似的子空间中编码概念。此外,我们证明 Transformer 的主导主方向本身并不编码更多概念信息。最后,我们通过分析特定主题的表示或查看标记的最近邻域来放大并检查流形之间的对齐,并发现它们高度对齐。最终,我们的分析表明,虽然 Transformer 和 SSM 导致潜在空间的不同使用,但它们在局部语义流形水平上表现出惊人的功能收敛。