论文

REER-PT:困惑引导 预训练 数据增强的逆向工程推理

REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation

模型训练合成数据

摘要

随着语言模型计算的不断扩展,高质量的训练数据正成为越来越重要的瓶颈。传统的下一个标记预测监督上下文之后的内容,但隐含了该延续背后的中间推理。我们引入了 \textbf{REER-PT},这是一个可扩展的框架,它将逆向工程推理(REER)扩展到原始 预训练 数据。 REER-PT 识别难以预测但仍可以从前面的上下文中推断出的延续,并插入简洁的推理注释来重建上下文和延续之间缺失的连接。候选注释是离线生成和细化的,困惑度作为优化信号。对长度和目标泄漏的限制会过滤掉无用或琐碎的注释。这种稀疏转换保留了源文本并与标准的下一个标记预测保持兼容,从而避免了 预训练 期间的在线推理轨迹采样。我们应用 REER-PT 将源 预训练 语料库转换为增强语料库。在增强数据、原始标记和选择延续比较中,困惑度降低范围从 0.42 到 7.29,并且只有大约 0.05% 的注释 13-gram 逐字出现在源文本中。然后,我们分别在源语料库和增强语料库上训练两个具有相同架构和训练配置的 680M 参数模型。增强数据模型在多项知识和推理基准测试中提升了 2.07 个百分点。总之,困惑度分析表明连续可预测性得到了改善,而受控的 预训练 实验表明,这种增强可以在不改变标准 预训练 目标的情况下提高模型性能。