论文
为什么有些情绪对于 LLM 来说更难?通过稀疏自动编码器揭示情感推理的因果机制
Why Are Some Emotions Harder for LLMs? Uncovering the Causal Mechanisms of Emotion Inference via Sparse Autoencoders
摘要
大语言模型 (LLM) 越来越多地用于情绪敏感的人类人工智能应用,其中可靠的情绪检测至关重要。然而,他们的情绪识别能力仍然参差不齐:模型通常在某些情绪上表现良好,但在其他情绪上却一直表现不佳。尽管最近的工作探索了 LLM 中的情绪机制,但从机械可解释性的角度来看,为什么模型在某些情绪上比其他情绪更弱,人们知之甚少。在这项工作中,我们通过使用稀疏自动编码器(SAE)的情绪推理因果机制来研究特定于情绪的偏差。我们系统地识别驱动情感推理的因果稀疏情感特征,并分析它们在情感内部和情感之间的稀疏因果组织。我们表明,一些情绪,例如惊讶和恐惧,依赖于高度集中的特征集,而厌恶则表现出更加分散的稀疏因果组织:其因果特征通常较弱,经常与其他情绪的特征共同激活,并且经常被愤怒的因果特征所掩盖。这些代表性差异为为什么 LLM 在某些情绪上更加挣扎提供了机械解释。最后,我们进行了两项干预实验:有针对性地引导较弱的因果特征以减轻特定于情绪的失败,以及对已识别的因果特征进行引导向量的全局优化以提高整体情绪识别性能。