论文

抽象预训练超越困惑的持久影响

Lasting Effects of Abstract Pretraining Beyond Perplexity

模型训练预训练

摘要

语言模型通常是通过随机初始化进行预训练的。最近的工作挑战了这一惯例,表明对抽象的、算法生成的数据进行简短的热身可以为后续的自然语言学习提供更好的起点。在本文中,我们表明,在小型语言模型中,这种预热可以提高特定能力,而这些能力并未反映在语言建模困惑中。我们的预热使用了一个抽象的堆栈操作任务,需要组合和状态跟踪功能。向此数据分配少至 1% 的预训练标记,可将 MUSIQUE 上的多跳问答提高高达 3.9 个 F1 点,尽管语言建模的复杂度相当,但 HOTPOTQA 和 2WIKIMULTIHOPQA 上的收益却有所增加。对照实验表明,预热大大加速了更深层次推理链的获取。我们还探讨了推动这种转移的因素。首先,数据的结构很重要:用队列替换堆栈任务无法产生相同的收益。其次,收益是具体的:顺序推理链的性能提高,但对组合或比较独立事实的任务没有一致的好处。第三,时机很重要:将抽象数据与自然语言混合的效果远不如最初的专用阶段有效,并且预训练后的暴露完全消除了好处。早期的优势在数十亿个后续语言标记中仍然存在。这些结果表明,早期的抽象训练可以可靠地塑造语言模型随后获得的能力。