论文

大语言模型 中情感表征的潜在结构

Latent Structure of Affective Representations in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中潜在表示的几何结构是一个活跃的研究领域,部分原因在于它对模型透明度和 AI 安全性的影响。现有文献主要关注所学习表示的一般几何和拓扑特性,但由于缺乏 真值 潜在几何,验证此类方法的发现具有挑战性。情绪处理为探索表征几何学提供了一个有趣的测试平台,因为情绪表现出分类组织和连续情感维度,这在心理学文献中已得到充分证实。此外,理解这些表示具有安全相关性。在这项工作中,我们使用几何数据分析工具研究 LLM 中情感表征的潜在结构。我们提出三个主要发现。首先,我们证明 LLM 学习情感情绪的连贯的潜在表征,这些表征与广泛使用的心理学中的效价唤醒模型相一致。其次,我们发现这些表示表现出非线性几何结构,但可以很好地线性逼近,为模型透明度方法中通常假设的线性表示假设提供经验支持。第三,我们证明了学习到的潜在表示空间可以用来量化情感处理任务中的不确定性。我们的研究结果表明,LLM 获得了与已建立的人类情感模型平行的几何结构的情感表征,对模型的可解释性和安全性具有实际意义。