论文
1913 年的语言模型:历史文本预训练
A Language Model from 1913: Pretraining on Historical Text
摘要
虽然现代语言模型越来越依赖于越来越大的网络语料库,但我们表明,在数据受限的环境中对历史文本(例如 1913 年之前的文本)进行预训练可以产生基于时间的语言模型,该模型在语言理解方面仍然表现出合理的性能。然而,开发历史 LM 需要解决数据质量方面的挑战,防止 后训练 中的时间泄漏,并构建时间对齐的评估。我们应对这些挑战并对 TypewriterLM 进行预训练,这是一个 7.24B 参数模型,知识截止点为 1913 年。我们构建了 TypewriterCorpus,一个具有广泛时间过滤的 54B 词元历史语料库,提出了基于词汇的指令调整,限制了对历史源文档中词汇的所有响应,并引入了 History-Event,这是一个包含 2,344 个事件的基准,用于评估能力和截止遵守情况。我们发布了 TypewriterLM 和所有相关资源来支持历史 LM 的未来研究。