论文

LLM 中有情感和修辞神经元吗?用于情绪修辞预测指导的神经元识别和自适应掩蔽

Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction Steering

模型评测模型行为与机制分析

摘要

情感和修辞的准确理解和可控生成对于增强大语言模型(LLM)的推理能力至关重要。现有研究大多依赖外部优化,缺乏对内部表示机制的深入探索,从而未能实现神经元层面的细粒度转向。一些关于神经元的研究仅限于情感,忽略了修辞神经元及其内在联系。传统的神经元掩蔽还表现出违反直觉的现象,使得对神经元功能的可靠验证变得不可行。为了解决这些问题,我们系统地研究了 6 个情感类别和 4 个核心修辞手段的神经元表征机制和内在关联。我们提出了一种集成多维筛选的神经元识别框架,并设计了一种结合动态过滤、衰减掩蔽和反馈优化的自适应掩蔽方法,能够对神经元功能进行可靠的因果验证。通过神经元调节,我们实现了非目标句子的定向诱导和通过修辞神经元增强情感任务。对 5 个常用数据集的实验验证了我们方法的有效性,为 LLM 中情感和修辞表达的细粒度控制提供了一种新颖的范例。