论文

表征网络规模 LLM 预训练数据中的叙事内容

Characterizing Narrative Content in Web-scale LLM Pretraining Data

AI 基础设施数据基础设施

摘要

尽管叙事是人类交流的基本模式,但网络规模 LLM 预训练语料库的叙事构成在很大程度上仍未被探索。我们首次对卓玛(Dolma)的叙事特征进行细粒度研究,卓玛是一个 3 万亿词元的开放预训练语料库。借鉴叙事理论,我们设计了一个涵盖三个核心叙事元素(机构、背景和事件)的框架,并可操作为 11 个可解释的维度。在整理和手工注释了 400 个段落的不同集合之后,我们创建了一个包含 25K 段落的 LLM 标记数据集,最后,我们微调并验证了 NarraBERT,这是两个基于 RoBERTa 的模型,用于细粒度的叙事预测。我们将 NarraBERT 应用于 1300 万个段落,产生了一个新的数据集 NarraDolma。我们发现,叙事结构可以在极其异构的数据中进行大规模测量,并且叙事质量在预训练源、主题和格式之间分布不均,而当前的数据管理实践既无法测量也无法解释。我们的框架、数据集和分析为理解 LLM 预训练数据中的叙事质量如何分布提供了基础。