论文

扩展时间点语言模型

Scaling Point-in-Time Language Models

模型训练预训练

摘要

在不受限制的互联网语料库上训练的 大语言模型 不可避免地嵌入了来自未来的信息,引入了前瞻偏差,从而损害了金融和社会科学中回测和因果推理的有效性。时间点语言模型(仅根据每个日历日期可用的文本进行训练)通过构造消除了这种泄漏,但现有的努力通常产生的模型大大落后于不受约束的对应模型。我们证明,这种性能差距可以通过规模来大幅缩小。我们在来自 FineWeb 的 1 万亿个按时间顺序过滤的词元上训练仅解码器 Transformer,使用多达 40 亿个参数,构建了一系列跨越 2013 年至 2024 年的每月模型检查点。在一系列常识推理和语言理解基准中,我们的模型接近于在时间不受限制的数据上训练的同等大小的领先开放权重模型(例如 Gemma-3-4B 和 LLaMA-7B)的性能,尽管在一些任务上仍然存在性能差距。通过 LoRA 的指令 微调 进一步提高了下游可用性。我们发布了完整的管道(包括数据集构建、训练基础设施和评估代码),以实现可重复的时间点语言建模并支持需要严格时间有效性的研究应用程序。