在基础开放权重模型中复制情感表征的几何形状
Replicating the Geometry of Emotion Representations in a Base Open-Weights Model
摘要
索弗罗涅夫等人。 (2026) 报告称,Claude Sonnet 4.5 中的情感概念被表示为向量,其几何形状反映了人类情感心理学。我们在基本预训练模型 google/gemma-2-27b 上复制了该研究的代表性核心,继承每个公开的参数,通过公开的规则解决未指定的步骤,并仅更改主题模型。从与原始语料库设计相匹配的 205,200 个新生成的 Claude Sonnet 4.5 故事中,我们提取了 171 个情感向量并恢复了核心结果。主要的主要成分形成情感循环(PC1 与原始研究的约 27% 相比有 26.7% 的方差,PC2 与约 14% 相比有 13.4% 的方差),情感聚集成类似的直觉家族,并且几何形状涵盖了广泛的中后期带。价轴与人类标准一致(r = 0.72,对比 0.81),并且在尺度和深度上保持稳定。唤醒在 r = 0.67 处对齐(相对于 0.66),但仅在完整的 171 情绪尺度和后期深度上对齐,因此我们不将其归类为重复。扩展原始分析,46 层扫描在 L22-26 处找到了一个锐利的接缝,在那里几何图形得到巩固,词汇读出变得清晰。嵌入层基线会发现静态词元嵌入中已经存在的大部分几何图形,唤醒是个例外。在顶部激活保留文本上,几何预测 r = 0.907 处的标记级共同激活。至少 52% 的向量在结构上的非概念标记上达到峰值,这是最大激活混淆的测量下限。即使文档包含向量的情感词,峰值出现在该词上的概率也只有 6.1%。因为主体是基础模型,并且刺激是克劳德生成的虚构,所以恢复的结构是克劳德渲染的情感的预训练表示的属性。原著的因果分析和面向助理的分析超出了范围。代码和数据已发布。