论文

记忆或检索:扩展预训练和检索之间的交互

To Memorize or to Retrieve: Scaling the Interaction Between Pretraining and Retrieval

上下文与知识检索增强

摘要

检索增强生成 (RAG) 通过在测试时为知识密集型情况提供相关上下文来提高语言模型 (LM) 性能。在这项工作中,我们系统地研究了预训练和检索之间的权衡,方法是在多达 100B DCLM 词元上训练基于 OLMo-2 的 LM,参数范围从 30M 到 3B,同时跨推理、科学 QA 和开放域 QA 基准改变预训练数据规模、检索存储大小和检索存储源(预训练与新数据)。我们发现检索增益取决于模型容量和预训练暴露,并且具有很强的前载性,通过每个模型参数一个检索标记实现了最大观察到的改进的中位数 91%。然而,交互是依赖于目标的:较小的模型在参考答案困惑度方面获得更多,而较大、经过更多预训练的模型在准确性方面获得更多。从以前看到的数据中检索也保留了大部分保留的检索增益。因此,检索是对参数学习的任务、机制和度量相关的补充,参数学习的价值还取决于数据存储大小和信息新颖性。总体而言,这促进了 LM 设计的内部化和外部访问之间数据的显式划分。