跨小语言模型的共享情感几何:表示、行为和方法论混淆的跨架构研究
Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds
摘要
我们在统一理解模式管道下以 fp16 精度从 12 个小语言模型(6 个架构 x 基础/指令、1B-8B 参数)中提取 21 个情感向量集,并通过对原始余弦 RDM 进行表征相似性分析来比较生成的几何图形。五个成熟的架构(Qwen 2.5 1.5B、SmolLM2 1.7B、Llama 3.2 3B、Mistral 7B v0.3、Llama 3.1 8B)共享几乎相同的 21 情感几何,成对 RDM Spearman 相关性为 0.74-0.92。这种普遍性在截然相反的行为特征中持续存在:Qwen 2.5 和 Llama 3.2 占据 MTI 合规方面的相反极点,但产生几乎相同的情感 RDM (rho = 0.81),因此行为方面的差异出现在共同的情感表示之上。 Gemma-3 1B 碱基是我们数据集中的一个不成熟的情况,表现出极端的残余流各向异性 (0.997),并通过 RLHF 在所有几何描述符上进行重组,而五个已经成熟的家族显示家族内碱基 x 指示 RDM 相关性 rho >= 0.92(Mistral 7B v0.3 at rho = 0.985),这表明 RLHF 仅重组不存在的表示但还是有组织的。在方法论上,我们表明,先前的工作被解读为单一理解与生成方法的效果实际上分解为四个不同的层——粗略的方法相关解离、生成内强大的子参数敏感性、真正的精度(fp16 vs INT8)效果,以及对不同模型以相反方向扭曲的混合交叉实验偏差——因此,两个先前的情感向量研究之间的单个 rho 并不是在没有分层分解的情况下进行解释的安全基础。