论文

心理概念神经元:神经控制能否在LLM中偏置探测和移位生成?

Psychological Concept Neurons: Can Neural Control Bias Probing and Shift Generation in LLMs?

模型评测模型行为与机制分析

摘要

使用“大五”等心理学结构,大语言模型 (LLM) 可以模仿特定的个性特征并预测用户的个性。虽然 LLM 可以表现出与这些构造一致的行为,但仍不清楚它们在模型中的位置和方式以及它们与行为输出的关系。为了解决这一差距,我们关注问卷操作化的大五概念,分析其内部表征的形成和定位,并使用干预措施来检查这些表征与行为输出的关系。在我们的实验中,我们首先使用探测来检查大五信息在模型深度中出现的位置。然后,我们识别对每个大五概念有选择性反应的神经元,并测试增强或抑制它们的激活是否可以使潜在表征和标签生成偏向预期方向。我们发现大五信息在早期层中可以快速解码,并且在最后层中仍然可以检测到,而概念选择性神经元在中间层中最为普遍,并且跨域的重叠有限。对这些神经元的干预始终将探针读数转向目标概念,某些概念的目标成功率超过 0.8,这表明模型对大五人格特征的内部分离可以进行因果控制。在标签生成层面,相同的干预措施通常会使生成的标签分布偏向预期方向,但效果较弱,更依赖于概念,并且常常伴随着跨特征溢出,这表明即使对大部分概念选择性神经元进行干预,对生成的标签进行类似的控制也很困难。总体而言,我们的研究结果揭示了 LLM 中表征控制和行为控制之间的差距。