论文
语言模型中的信念和行为
Beliefs and Behavior in Language Models
摘要
诸如信念或欲望之类的抽象是否能有效地描述大型语言模型(LLM)的行为存在很大的不确定性。除了这个问题固有的科学兴趣之外,这些潜在量还经常被用来向用户解释大语言模型的行为或定义和评估与意图相关的有害行为。然而,我们目前缺乏一种方法来系统地测试“信念”等概念是否适用于大语言模型,以及它们是否可能成为将模型与人类利益结合起来的尝试的富有成果的成分。我们提出了一种对此类问题进行实证研究的方法,询问从大语言模型的输出中推断出的单个潜在变量(解释为信念程度)是否允许观察者对大语言模型将如何响应新的提示做出可解释的预测。我们发现,高能力模型被有效地描述为持有信念,并且通常,基于推断的潜在信念的模型输出的可预测性跟踪模型能力的总体趋势。基于这些发现,我们提供了实证策略来研究如何衡量大语言模型的信念、大语言模型遵守指示决策规则或回报的程度,以及在推理过程中大语言模型的个体实例中信念如何演变。