论文
语言模型中的不变特征:几何表征和模型归因
Invariant Features in Language Models: Geometric Characterization and Model Attribution
摘要
语言模型对释义表现出很强的鲁棒性,这表明语义信息可以通过稳定的内部表示进行编码,但这种不变性的结构和起源仍不清楚。我们提出了一种局部几何框架,其中语义等价的输入占据潜在空间中的结构化区域,沿着讨厌的方向进行释义变化,并且在不变子空间中保留语义同一性。基于这个观点,我们做出了三个贡献:(1)不变潜在特征的几何表征,(2)将语义变化与语义保留变化分开的对比子空间发现方法,以及(3)不变表示在零样本模型归因中的应用。跨模型和层级的实证结果支持了这些贡献。不变结构出现在特定的深度区域,语义位移很大程度上位于讨厌的子空间之外,并且表示级干预表明不变成分在模型输出中的因果作用。不变的表示还可以捕获特定于模型的几何图案,从而实现准确的归因。这些发现表明,语义不变性可以被视为潜在表示的局部几何属性,为语言模型如何组织意义提供了原则性的视角。