论文

以经验下一token分布把LLM行为追踪到训练数据

Tracing LLM Behavior to the Training Data with Empirical Next-Token Distributions

模型评测模型行为与机制分析

摘要

本文研究LLM输出分布与训练所用数据之间的联系。具体地,我们研究LLM的下一token分布在多大程度上与训练数据中给定上下文的经验下一token分布(ENTD)一致。ENTD是诱人的目标:它既是预训练所用下一token交叉熵损失的无约束全局最小化器,也是预训练语料库的易于解读函数。我们发现:对相当比例的输入,LLM的分布与ENTD几乎完全一致,且一致度总体随模型规模与训练算力增加。但存在一条输入序列长尾,其上LLM与ENTD显著不同;我们跨Transformer架构、训练流程与ENTD估计自身的有限样本噪声考察该差异的若干可能来源。更广地,我们希望这些发现鼓励更多“数据中心机制可解释性”工作——标准机制可解释性的补充:打开模型行为如何从数据产生的黑箱,而非它们如何编码在学得的权重中。

以经验下一token分布把LLM行为追踪到训练数据:论文配图
图 1:在非常高的水平上,我们的发现可以通过此 CDF 图进行总结。解释是,LLM 的下一个标记分布几乎完全匹配 (TV ≤0.0056\leq 0.0056) 20% 分层评估样本的经验下一个标记分布。本文的其余部分更详细地研究了这一现象,并试图解释剩下的 80%。