论文
不变原子:语言模型表示中局部语义几何的稀疏坐标
Invariant Atoms: Sparse Coordinates of Local Semantic Geometry in Language Model Representations
摘要
尽管措辞、风格和语法发生了重大变化,大语言模型通常仍保留意义,而小型语义编辑可以系统地改变其隐藏的表示。这表明语义变异可能沿着重复出现的局部方向进行组织。我们提出不变原子假设:局部语义运动允许沿着在意义保留变换下保持稳定的方向的首选稀疏坐标。我们学习了一个共享的语义框架和稀疏坐标,可以重建语义位移,同时抑制令人讨厌的变化,通过依赖于锚的对角调制来调整原子强度,而无需样本特定的旋转。根据经验,原子表现出很强的语义——干扰分离、稀疏重建、可重复的方向以及对模型预测的因果影响。学习到的几何可推广到看不见的语义邻域和讨厌的族,而局部重新加权提高了语义选择性并保留了一致的全局到局部结构。原子签名在模型修改下也保持稳定。这些发现支持可重用的不变方向作为语言模型中局部语义几何的稀疏坐标系。