论文
以经验下一token分布把LLM行为追踪到训练数据
Tracing LLM Behavior to the Training Data with Empirical Next-Token Distributions
摘要
本文研究LLM输出分布与训练所用数据之间的联系。具体地,我们研究LLM的下一token分布在多大程度上与训练数据中给定上下文的经验下一token分布(ENTD)一致。ENTD是诱人的目标:它既是预训练所用下一token交叉熵损失的无约束全局最小化器,也是预训练语料库的易于解读函数。我们发现:对相当比例的输入,LLM的分布与ENTD几乎完全一致,且一致度总体随模型规模与训练算力增加。但存在一条输入序列长尾,其上LLM与ENTD显著不同;我们跨Transformer架构、训练流程与ENTD估计自身的有限样本噪声考察该差异的若干可能来源。更广地,我们希望这些发现鼓励更多“数据中心机制可解释性”工作——标准机制可解释性的补充:打开模型行为如何从数据产生的黑箱,而非它们如何编码在学得的权重中。
