论文

语言模型真的可以检索上下文吗?淹没在百万词元规模的文档中

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

模型架构Transformer

摘要

语言模型 (LM) 为基于向量的检索提出了一种有趣的替代方案:以上下文语料库为条件并直接生成相关答案。然而,之前的工作主要集中在专有系统或较小规模的重新排序任务上,而语料库规模的上下文检索在很大程度上尚未得到探索。在这项工作中,我们首次系统地研究了两种规模的上下文检索实际 检索器 需求:百万词元语料库和远远超出训练时间大小的长度泛化。我们首先介绍 BlockSearch,这是一个 0.6B LM 检索器,其架构和训练修改比之前的 LM 基线有所改进,并且长度泛化比其训练体系高出 10 倍。然而,在更极端的外推下,检索仍然失败。我们将这种失败归因于注意力稀释效应:随着语料库的增长,不相关的文档在 softmax 分母中占据主导地位,从而减少了标准相关文档的归一化概率质量,即使其 pre-softmax 分数保持较高水平。受此分析的启发,我们引入了对注意力 softmax 和文档级稀疏注意力的长度感知调整。通过这些修改,在百万词元规模上,我们的模型可与广泛研究的基准(例如 MS MARCO 和 NQ)上的密集检索相匹配,同时优于并发模型 MSA,尽管其尺寸小了 7 倍。此外,在需要完全不同的相似性概念的任务(例如 LIMIT)上,它的性能显着优于密集检索,得分高出 3 倍。总之,我们的结果将上下文检索定位为经典检索的有前途的替代方案,同时强调极端上下文增长下的注意力控制是一个新的挑战。