论文
预训练期间知识获取? 大语言模型 通过辅助视图更好地学习
Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
摘要
我们对 大语言模型 (LLM) 如何在 预训练 期间获取知识的理解仍然存在差距。我们认为辅助观点、知识的重新表述对学习有因果帮助。我们设计了对照实验来隔离这一点。首先,我们确认重复对于获取数据是必要的,并澄清释义仅对较小的批量大小有帮助。其次,保持 词元预算 固定,将文档重复中的标记分配给辅助视图可以改善学习,这与直觉相反,即使对于事实回忆也是如此。第三,辅助观点的有效性并不取决于产生它们的教师模型的强度。第四,我们确定了背景知识和基础知识的形式,这些知识有助于在现有知识差距存在的情况下进行学习。最后,我们研究这些效应如何通过分层偏差和压缩机械地表现出来。总之,我们的研究结果表明,在大型 预训练 语料库中自然出现的知识辅助表示是 预训练 成功的关键因素,并为数据多样性为何重要提供了合理的解释。