论文
大语言模型中的情绪概念及其功能
Emotion Concepts and their Function in a Large Language Model
摘要
大语言模型(LLM)有时似乎会表现出情绪反应。我们在Claude Sonnet 4.5中探究其原因,并考察其对对齐相关行为的影响。我们发现了情绪概念的内部表示,它们编码某一特定情绪的宽泛概念,并能泛化到该情绪可能关联的各种情境与行为。这些表示追踪对话中给定token位置上正在起作用的情绪概念,其激活取决于该情绪与处理当前语境及预测后续文本的相关性。我们的关键发现是,这些表示会对LLM的输出产生因果影响,包括Claude的偏好以及其表现出奖励破解、勒索与谄媚等未对齐行为的频率。我们将这一现象称为LLM表现出功能性情绪(functional emotions):模仿人类在情绪影响下的表达与行为模式,并由底层的情绪概念抽象表示所中介。功能性情绪的运作方式可能与人类情绪大不相同,且并不意味着LLM拥有任何情绪的主观体验,但对理解模型行为而言似乎十分重要。
