论文
在小语言模型中提取和引导情感表示:方法比较
Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison
摘要
100M-10B 参数范围的小语言模型 (SLM) 日益为生产系统提供动力,但它们是否拥有最近在前沿模型中发现的内部情感表征仍然未知。我们首次对 SLM 的情感向量提取方法进行了比较分析,使用 20 种情感和两种提取方法(基于生成和基于理解)评估了 5 个架构系列(GPT-2、Gemma、Qwen、Llama、Mistral)的 9 个模型。基于生成的提取产生统计上优越的情感分离(Mann-Whitney p = 0.007;Cohen's d = -107.5),其优势通过指令调整和体系结构进行调节。情感表示位于 Transformer 中间层(~50% 深度),遵循从 124M 到 3B 参数架构不变的 U 形曲线。我们根据 4 个模型的表征各向异性基线验证了这些发现,并通过引导实验确认因果行为效应,并由外部情绪分类器独立验证(92% 成功率,37/40 场景)。转向揭示了三种机制——外科手术(连贯的文本转换)、重复崩溃和爆炸性(文本退化)——通过困惑度比率进行量化,并通过模型架构而不是规模进行分隔。我们记录了 Qwen 中的跨语言情感纠缠,其中转向激活了 RLHF 不会抑制的语义对齐的中文标记,从而引发了多语言部署的安全问题。这项工作为开放权重模型的情绪研究提供了方法指南,并通过将外部行为分析与内部表征分析联系起来,为模型医学系列做出了贡献。