论文

多语言中的分布感知语言神经元识别 大语言模型

Distribution-aware Language Neuron Identification in Multilingual Large Language Models

模型评测模型行为与机制分析

摘要

多语言 大语言模型 (mLLM) 包含一小部分对特定语言敏感的前馈神经元,通常称为语言特定神经元。现有的工作使用每个神经元的语言活跃概率的熵来测量语言特异性,其中当神经元的激活值为正时,该神经元被认为是活跃的。然而,这种方法可能无法完全捕捉 mLLM 的多语言性质,其中语言表示是分布式的且相互关联的。我们提出了分布感知语言神经元选择,它利用整个激活范围内每种语言激活分布之间的成对关系,包括负值。具体来说,我们通过使用激活分布之间的成对重叠系数对语言进行聚类来量化每个神经元的语言特异性。在两个 mLLM 和两个保留的语料库中,我们的标识符更有效地隔离了特定于语言的因果效应,每个神经元的目标语言损害高达 4.9$\times$,同时保留了非目标语言性能。