论文

部分词元向量像磁铁一样组织语言模型各层的语言计算

Some Tokens Behave like Magnets: Revealing Linguistic Organization in the Layers of Language Models

模型评测模型行为与机制分析

摘要

我们在 大语言模型 (LLM) 中识别出一组特殊的标记向量,我们将其称为磁向量,它们通过吸引或排斥周围的标记来组织它们。特别地,与吸引磁铁指向相同方向的词元被拉长;与排斥磁铁指向相同方向的词元被压缩。正如物理磁铁拉动或推开周围的铁屑一样,这些矢量通过两个相反的极性组织周围的环境。此外,我们在语言类别中发现了一种统计上显着的模式,其中功能词在早期层中始终充当排斥磁体,并且我们还发现磁体在模型更深处以独特的方式一致地重组其极性。在进一步的案例研究中,我们发现这一观察结果可能揭示了 LLM 处理语言的一种有意的、分层的组织。此模式在不同的 LLM 架构、大小和层配置中是一致的。这也是有因果关系的。当 LLM 针对下游任务进行微调时,任务功能词元会像磁铁一样出现。例如,在回答问题时,答案跨度标记在最后一层中成为独特的排斥磁铁,从周围的上下文中几何地雕刻出答案。此外,移除早期层的排斥磁体会破坏句法任务(词性标注准确度从 91% 下降到 10% 以下),同时保留语义任务,而移除后期层的吸引磁体则相反。我们认为这种现象值得进一步研究,因为它开辟了第一个无探针路径来理解语言模型如何跨层几何地组织语言计算。