论文
综合 Pre-预训练 提高了语言模型对嘈杂 预训练 数据的鲁棒性
Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data
摘要
大语言模型 (LLM) 依赖于 预训练 的网络规模语料库。这些数据集中固有的噪声往往会掩盖有意义的模式,并最终降低模型性能。数据管理可以减轻但无法消除此类噪音,因此 预训练 语料库在实践中仍然存在噪音。因此,我们研究基于具有可学习时间结构的合成数据的轻量级 pre-预训练 (PPT) 阶段是否有助于抵抗 预训练 (PT) 阶段期间的噪声数据。在各种损坏设置中,我们的方法始终如一地提高了 PT 期间对噪声的鲁棒性,在较高噪声水平下具有较大的相对增益。对于 1B 参数模型,仅使用 65M 个词元的合成 PPT 阶段实现了与基线相同的最终损失,同时在不同噪声级别上使用的自然文本 PT 词元减少了 49%。机制分析表明 PPT 不会立即抑制对嘈杂标记的关注。相反,PPT 初始化的模型在嘈杂的 PT 期间逐渐降低了损坏词元之间的注意力。这表明合成 PPT 抑制了噪声自建模并塑造了后续的优化轨迹。代码可在 https://github.com/guox18/formal-language-prepretraining 获取。