论文

微小的大脑,巨大的影响:只需几个提示即可揭示 LLM 的关键神经元

Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts

模型评测模型行为与机制分析

摘要

大语言模型(LLM)表现出很强的综合能力,但支持这些行为的内部机制仍不清楚。在这项工作中,我们表明,在各种开放权重 Transformer 中,神经元子集在跨多个能力维度的任务进行推理期间始终保持高度激活。通过探索跨任务激活强度,分离出一个极其稀疏的子集,其删除会导致模型行为崩溃,我们将其称为关键神经元。我们的分析表明,关键神经元是模型的稳定且内在的神经元子集,主要是在预训练期间建立的。与这些神经元相关的参数在训练过程中经过严格校准,它们的精确值对于模型的能力至关重要。基于这些见解,我们提出了一种有监督的 微调 方法,该方法仅更新关键神经元,实现与全参数 微调 相当甚至更好的任务增益,同时更好地保留其他能力维度的性能,尽管修改的参数数量要少得多。