论文

大语言模型中的使用调制情感表示

Usage-Modulated Sentiment Representations in Large Language Models

模型评测模型行为与机制分析

摘要

先前的工作表明,情感通常可以通过LLM激活空间中的近似线性方向来捕获,但单个方向可能无法完全捕获情感表示。在自然交流中,情感不仅受到极性的影响,还受到使用因素的影响,例如语气和受众的适应。我们测试这些因素是否系统地调节超出共同情绪方向的情绪表征。我们构建了一个受控配对数据集,该数据集在改变情绪极性和使用因素的同时保持事件内容固定,并分析 Llama、Mistral 和 Gemma。我们确定一个共同的情感方向,将其删除,并通过擦除和生成时音调控制来测试残留结构。在模型中,共享方向是稳健的(中值余弦 0.953-0.975),但删除它会留下原始正负表示差异范数的 0.833-0.909。残差包含紧凑的、可重复的使用条件结构。与随机和标签混洗控制相比,有针对性的擦除更能削弱留出使用指标。在 Llama 上,在 92.8% 的盲目目标音比较中,沿着残余音调分量引导的输出是首选,同时在 98.7% 的评估输出中保留了所请求的情感极性。