论文
DPN-LE:大语言模型 的双重人格神经元定位和编辑
DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models
摘要
随着大语言模型(LLM)的广泛采用,了解其个性表征机制变得至关重要。作为个性编辑的一种新颖范例,大多数现有方法都采用神经元编辑来定位和修改 LLM 神经元,需要更改大量神经元并导致性能显着下降。这就提出了一个基本问题:所有修改过的神经元都与人格表征直接相关吗?在这项工作中,我们通过评估一般能力影响和表征级别模式来调查和量化这种特殊性。我们发现:1)当前的方法可以改变性格但会降低整体表现。 2)神经元具有多功能性,连接人格特征和常识。 3)对立的人格特质表现出明显相互排斥的表现模式。受这些发现的启发,我们提出了 DPN-LE(双重人格神经元定位和编辑),它通过对比高特质和低特质样本之间的 MLP 激活来识别人格特异性神经元。 DPN-LE 构造逐层引导向量,并应用基于 Cohen 的 $d$ 效应大小和激活幅度的双标准过滤来隔离互斥的神经元子集。对这些神经元的稀疏线性干预可以在推理时实现精确的个性控制。每个特征仅使用 1,000 个对比样本对,DPN-LE 对 $\sim$0.5\% 的神经元进行干预,同时实现竞争性人格控制和跨推理任务的更好的能力保留。 LLaMA-3-8B-Instruct 和 Qwen2.5-7B-Instruct 上的实验证明了我们方法的有效性和通用性。