论文

大语言模型 的概率归因

Probabilistic Attribution For Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的生成性质反映在它们计算的条件概率中,以在给定先前标记的情况下对每个响应标记进行采样。这些概率编码了模型在训练中学习并在推理中利用的分布结构。在这项工作中,我们使用这些概率将 LLM 置于随机过程的数学理论中。我们使用这个框架来设计一个与模型无关的概率词元归因度量,使用贝叶斯规则反转下一个词元对数概率,以便捕获词元序列分布的模型内部表示。该表示独立于模型计算结构。这种表示产生给定提示的响应的条件概率,以及给定边缘化词元的提示的响应的条件概率。我们的归因得分是这些概率之比的对数。我们进一步计算单个提示标记分布的熵,以剩余上下文为条件。熵和归因分数之间的相互作用揭示了 LLM 行为。我们评估了 7 个提示中的 8 个模型,并调查异常情况、词元敏感性、响应稳定性、模型稳定性和训练收敛性,从而提高可解释性并引导用户关注生成的不确定或不稳定部分。