论文

模特的幸福在哪里?开源中的情感向量 LLM

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

模型评测模型行为与机制分析

摘要

最近的工作在 Claude Sonnet 4.5 中确定了情感向量,它们是编码情感概念、因果影响行为并展示反映人类心理结构的几何形状的内部表征。我们在两个开放权重模型 Apertus-8B-Instruct-2509 和 Gemma-4-E4B-it 中测试了这些发现的普遍性,使用两个模型生成的语料库提取所有层的情感对比向量。我们恢复了两个模型的价几何,峰值 PC1-价相关性为 $r = 0.76$ 和 $r = 0.83$,接近 Claude 报告的 $r = 0.81$。除了复制之外,我们观察到跨模型深度的价表示如何出现的显着差异。在 Gemma-4-E4B-it 中,价态在早期层中被强烈编码,但向后面的层塌陷,而 Apertus-8B-Instruct-2509 则表现出相反的模式,价态表示在早期层中不存在,但在中间深度出现。相反,唤醒编码对提取语料库很敏感:两个模型都显示出与 Gemma 生成的故事($r$ 高达 $0.45$)的 PC2-唤醒一致性比 Apertus 生成的故事($r \leq 0.21$)更强,这表明与唤醒相关的线索在生成的语料库中分布不均匀。我们开源我们的实验代码和数据集,以便跨语言模型架构对情感表示进行可重复的研究。