论文

综合预训练在规模上仍然存在,但不能作为语法先验

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

模型训练预训练

摘要

对合成非自然语言数据进行预训练(PPT)可提高语言模型预训练(PT)期间的标记效率。先前的工作将这种增益归因于语法先验,即在 PPT 过程中学到的结构归纳偏差会转移到自然语言语法。然而,PPT 仅在最多 1B 参数的模型和低于 2B 词元的 PT 预算(主要是网络文本)上进行了测试。目前尚不清楚 PPT 在更大范围内以及在结合了不同来源(例如代码和数学)的更现实的 PT 数据混合下是否有效。因此,我们提出了一项关于 PPT 的全面研究,涵盖五个 PPT 任务、四个 PT 数据混合、四个参数范围(500M 到 7B)以及高达 100B 词元的 PT 预算。我们的结果表明,PPT 的下游性能和词元效率增益在规模上持续存在,例如,在 3B 规模上节省至少 21B PT 词元。然而,与之前的工作相比,我们没有发现一致的证据表明这些收益源于语法先验。下游性能与不同模型大小的语法可接受性不一致。相反,我们发现下游收益来自于改善远程检索的 PPT 任务。最后,PPT 性能提升对于 PT 数据混合的组成方式是稳健的,并且仅在不存在 Web 文本时才会减弱。总体而言,PPT是PT的低成本补充,未来的PPT任务设计应该针对远程检索而不是自然语言语法。