论文

一些情绪更深层次:《大语言模型》中的分层探究和因果干预

Some Emotions Run Deeper: Layer-wise Probing and Causal Intervention in Large Language Models

模型评测模型行为与机制分析

摘要

情感在文本中表达的范围很广,从表面的词汇线索到与内容纠缠在一起的推论。 LLM 中的大多数情感分层分析都使用单个语料库,而情感可访问的深度是模型的属性还是文本源的属性尚不明确。我们通过跨越不同程度的情感表达的明确性和语境化的三个数据集(Twitter 帖子、Reddit 评论和自传体叙述)和来自 Llama、Qwen 和 Granite 家族的八个 1B--9B 开放权重 LLM 来研究这一点。我们将分层探测与离线特征缩放和在线前向干预、转移分析和提前退出分类器相结合。我们发现(i)最佳探测层在整个语料库中系统地转移,从输入相邻层到超过一半的模型深度,并且在匹配按长度箱分布的标签后,这种顺序仍然存在; (ii) 在评估的设置中,对探针选择的频段进行前向传递干预比相同宽度的随机频段降低了 5--6 个点的测试精度 ($q < 0.01$); (iii)选定的频带在数据集和情感类别之间转移,表明部分共享情感信息而不是严格的每个情感基础; (iv) 调查选择的提前退出代表的表现平均比全面退出代表高 6.9 个百分点。