论文

大语言模型 是否捕获了训练数据的多样性?

Do Large Language Models Capture the Diversity in their Training Data?

模型推理解码与生成控制

摘要

大语言模型 经过训练,可以对文本上的条件分布进行建模,但仍然没有充分了解它们是否捕获了训练数据中存在的合理输出的全部多样性。我们通过将模型生成的输出的条件熵与相应训练数据的条件熵进行比较,通过信息论的视角来研究这个问题。给定成对的输入-输出样本,我们使用条件熵及其基于冯·诺依曼熵的基于矩阵的模拟来测量超出条件输入解释范围的输出变化,而无需针对同一提示使用多个参考输出。在具有公开可用训练数据的 LLM 系列(包括 OLMo、Pythia 和 GPT-Neo)中,我们一致发现,在不同的模型规模、序列长度和解码策略中,模型生成的输出表现出比训练数据更低的条件熵。我们在语言建模之外观察到类似的条件多样性差距,包括类条件 ImageNet 生成器和在 MS-COCO 上训练的文本条件模型。为了解决这一差距,我们提出了一种事后校正机制,为每个输入生成多个输出,并通过矩阵熵投影重新加权它们,增加条件多样性,同时保持接近原始模型分布。我们证明了基于矩阵的条件熵函数的凹性,这使得所得的熵约束投影成为凸优化问题,并为其实现开发了一种可扩展的镜像下降算法。我们的结果揭示了现代生成模型与其训练数据之间存在系统的条件多样性差距,并为衡量和缓解这种差距提供了信息论框架。