论文
计算机中的朋友和祖母:本地化语言模型中的实体单元
Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models
摘要
语言模型如何从其参数中检索特定于实体的事实?我们通过搜索稀疏的、实体选择性的 MLP 神经元(我们称之为实体细胞,类似于神经科学中的“祖母细胞”假说)来研究这个问题,并测试它们是否在事实回忆中发挥因果作用。我们通过对 MLP 神经元进行排序来定位候选实体细胞,以确保同一实体的不同提示之间的激活一致性,并在 PopQA 的精选子集上的七个模型中应用此过程。在所有模型中,局部神经元主要聚集在早期层,这是一种并非由架构强加的经验模式。使用 Qwen2.5-7B 碱基作为模型生物,我们找到了最清晰的因果证据:抑制局部细胞选择性地消除对其匹配实体的回忆,同时保持其他细胞完好无损,并且激活单个细胞足以恢复大多数实体的正确知识 - 即使该实体不存在于上下文中。相同的细胞在别名、首字母缩略词、拼写错误和多语言表面形式下被恢复,并通过指令调整保持稳定,这表明它们编码规范实体身份而不是表面标记模式。因果信号因模型系列而异,表明实体知识组织方式的架构差异。这些发现为理解、控制和纠正语言模型中的事实知识提供了具体的、可解释的接入点,并与神经科学中关于概念稀疏编码的长期问题得出了令人惊讶的经验相似之处。