论文
语法“祖母神经元”在大语言模型中很少见
Grammatical "grandmother neurons" are rare in LLMs
摘要
了解大型语言模型 (LLM) 如何编码语言结构仍然是可解释性研究中的一个基本挑战。虽然诊断分类器(或“探针”)广泛用于此任务,但它们面临着重大的方法论批评:训练辅助分类器引入了容量混淆和校准问题,通常使得很难区分模型的内在表示和探针学习任务的能力。为了解决这些限制,我们引入了一个无探针框架,用于在单个神经元水平上本地化语言选择性。利用语言最小对的受控对比,我们提出了神经元可分离性指数(NSI),该指标可以直接量化单个神经元在不更新参数的情况下区分语法结构和非语法结构的可靠性。将 NSI 应用于 68 个语言范式和七个检查点揭示了三种主要模式:1)形态和句法区别的原始可分离性比句法语义界面和概念区别更早达到接近峰值水平。 2)排列归一化后,单个单元的选择性稀疏、弱且调整范围窄:只有一小部分单元对平均范式敏感,强选择性的“祖母神经元”很少见。 3)全向量线性可分离性、单神经元选择性和行为能力在很大程度上是分离的,并且有针对性的消融进一步将激活选择性与因果依赖性分开。