论文
预训练暴露解释了 大语言模型 中的受欢迎程度判断
Pretraining Exposure Explains Popularity Judgments in Large Language Models
摘要
大语言模型 (LLM) 对知名实体表现出系统性偏好,这种现象通常归因于受欢迎程度偏差。然而,这些偏好在多大程度上反映了现实世界的受欢迎程度与预训练期间的统计暴露程度仍不清楚,这主要是由于大多数训练语料库无法访问。我们提供了第一个基于完全可观察的预训练数据的直接、大规模的流行度偏差分析。利用开放的 OLMo 模型及其完整的预训练语料库 Dolma,我们计算了 7.4 万亿个词元的精确实体级曝光统计数据。我们分析了涵盖五种类型(人、位置、组织、艺术、产品)的 2,000 个实体,并将预训练暴露与维基百科页面浏览量和两个引出的 LLM 流行度信号进行比较:直接标量估计和成对比较。我们的结果表明,训练前的暴露程度与维基百科的受欢迎程度密切相关,验证了暴露程度作为训练期间现实世界显着性的有意义的代理。更重要的是,我们发现 LLM 受欢迎程度判断与维基百科的曝光度更加一致,尤其是通过成对比较得出时。这种一致性对于较大的模型来说最为强烈,并且在长尾中持续存在,在长尾中,维基百科的流行度变得不可靠。总的来说,我们的研究结果表明,LLM 中的受欢迎程度先验主要是由预训练统计数据而不是外部受欢迎程度信号决定的,这提供了具体的证据,表明数据暴露在推动受欢迎程度偏差方面发挥着核心作用。