论文
深度语言模型中层更新的几何结构
On the Geometric Structure of Layer Updates in Deep Language Models
摘要
我们研究深度语言模型中层更新的几何结构。我们不是分析中间表示中编码了哪些信息,而是询问表示如何从一层到下一层的变化。我们表明,分层更新允许分解为主要的 tokenwise 组件和受限 tokenwise 函数类未捕获的残差。在包括 Transformer 和状态空间模型在内的多种架构中,我们发现全层更新几乎与 tokenwise 组件完美对齐,而残差则表现出明显较弱的对齐、更大的角度偏差以及在主要 tokenwise 子空间上的投影明显较低。这表明残差不仅仅是一个小的校正,而且是变换的几何上不同的组成部分。这种几何分离具有功能性后果:受限 tokenwise 模型下的近似误差与输出扰动密切相关,Spearman 相关性通常超过 0.7,在较大模型中高达 0.95。总之,这些结果表明,大多数分层更新的行为类似于沿主导方向的结构化重新参数化,而功能上重要的计算集中在几何上不同的残差分量中。我们的框架提供了一种简单的、与体系结构无关的方法,用于探测现代语言模型中层更新的几何和功能结构。