论文
了解数据时态对 大语言模型 预训练 的影响
Understanding Data Temporality Impact on Large Language Models Pre-training
摘要
大语言模型 (LLM) 通常在打乱的语料库上进行训练,产生的模型的知识在训练时被冻结,并且其时间基础仍然知之甚少。在这项工作中,我们研究了 预训练 动态对获取时间敏感的事实知识的影响,特别关注数据排序。我们的主要贡献是双重的。首先,我们引入了超过 7,000 个基于时间的问题的综合基准和评估协议,可以分析模型是否正确地将事实与其相应的时间段关联起来。其次,我们在时间排序的 Common Crawl 快照上预训练 6B 参数模型,并将它们与标准打乱的 预训练 进行比较。我们的结果表明,顺序训练的模型与一般语言理解和常识的打乱基线相匹配,同时始终表现出更新和时间精确的知识。临时排序的 预训练 提高了事实新鲜度,而对旧数据进行洗牌的 预训练 峰值可能是由于事实重复增加。这些发现以及我们在 https://github.com/kyutai-labs/kairos 上发布的代码、检查点和 https://huggingface.co/collections/kyutai/kairos 上的数据集,为 LLM 持续学习的未来研究奠定了基础。