论文

先负后正:大语言模型 中的不对称价处理

Negative Before Positive: Asymmetric Valence Processing in Large Language Models

模型评测模型行为与机制分析

摘要

机械可解释性揭示了概念是如何在 大语言模型 (LLM) 中编码的,但情感内容在机械层面上仍然知之甚少。我们研究 LLM 是否通过专门的内部结构或通过表面词元匹配来处理情感效价。使用开源 LLM 上的激活修补和引导,我们发现负价和正价在不同的网络深度进行处理。负面结果局限于早期层,而正面结果在中后期层达到顶峰。保持主题固定,同时翻转价会产生符号相反的响应,从而排除主题检测。在已识别的层上转向好消息方向会将中性提示转向正价,表明这些层将价编码为可操纵的方向。 LLM 中的情感价是本地化的、因果性的和可操纵的,使其成为基于可解释性的监督的具体目标。