论文

语言化概率和内部概率在大语言模型中耦合

Verbalized and Internal Probabilities Are Coupled in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型在其采样分布中带有不确定性的内部概念,即它们生成一个答案而不是另一个答案的概率。他们还可能被要求以文字或数字的形式表达信心:口头表达的不确定性。先前的工作表明,内部概率跟踪训练数据中的相对频率,而言语概率跟踪训练数据中的明确概率断言。然而,我们不知道这两个读数是否对齐,除非训练数据中的频率和概率断言恰好对齐。这限制了我们对何时可以使用语言不确定性作为训练数据频率或模型内部分布的代理的理解。我们通过干预数据中潜在的不确定性来源,系统地探索大语言模型概率读数如何受到训练和上下文数据的影响,从而解决了这一差距。我们发现内部概率读数和口头概率读数都受到训练数据中分布和断言不确定性的影响。此外,我们发现言语概率和内部概率的一致性超出了独立跟踪相同不确定性源的预期,这表明言语概率可用于探测模型的内部分布。