论文

大语言模型激活中的语义搜索特征

Signatures of semantic search in the activations of large language models

模型评测模型行为与机制分析

摘要

在语义流畅性任务 (SFT) 中回忆概念列表(例如动物)时,人类和大语言模型 (LLM) 都会将其输出组织成相关项目(例如海洋动物)的集群,这些项目之间通过集群之间的策略切换进行打断。在人类中,这种模式可以通过语义觅食过程来解释,其中不同的神经和行为特征伴随着簇内生产(“利用”)和簇间切换(“探索”)。LLM是否同样代表其内部状态中的这两种检索制度尚不清楚。在这里,我们应用了一系列机械解释技术来为此提供证据。在研究 1 中,我们使用雅可比透镜(J-lens),它将中间层残差流表示映射到词元级激活,以表明概念级激活预测切换。首先,我们发现切换与低下一个词元激活同时发生。此外,随着最强 J 透镜激活集(J 空间)耗尽当前正在生产的类别中的物品,切换的概率会增加,类似于补丁觅食期间的探索-利用决策。然后,我们表明,抽象类别相关标签(例如“水”)的中层 J 透镜激活会增加切换到该类别的预期。我们通过推导针对类别切换的引导向量来确认这些表示对切换有因果影响。在研究 2 中,我们确定了在切换期间和预期切换时激活的通用残余流方向。通过沿着这些方向引导激活,我们可以增加或减少切换率。我们的研究将语义搜寻框架扩展到人工智能,并提供证据表明LLM在表达概念信息时保持着探索和利用的独特表征特征。