论文
用于学习稀疏检索的紧凑而高效的索引
Compact and Efficient Indexes for Learned Sparse Retrieval
摘要
本文研究了如何在不牺牲最先进的检索数据结构的效率的情况下大幅减少学习的稀疏检索索引的内存占用。在 SEISMIC 的基础上,我们重新审视了其设计的两个层面:用于选择候选者的倒排索引和用于对候选者评分的正向索引。对于倒排索引,我们用 medoids 替换昂贵的每块摘要,即选举为块代表的现有文档,将每块元数据从稀疏向量折叠为单个文档标识符。对于前向索引,我们压缩组件和值。我们重新排序词汇表,将同时出现的组件放置得更紧密,并使用 DOTPACKING8 对所得的 $Δ$-间隙进行编码,DOTPACKING8 是一种 SIMD 友好的位打包方案,它将解压缩与点积评估融合在一起;值通过适合每个组件分布的紧凑的每个组件 4 位码本进行量化。我们进一步介绍 JUMPDOT,这是一个为仅包含少数非零条目的查询量身定制的分块点积内核。我们的前向索引压缩是 独立于 SEISMIC,并且可以插入任何依赖于基于前向索引的评分的系统,正如我们通过将其集成到 KANNOLO 中所演示的那样。对具有三个最先进的学习稀疏编码器的 MS MARCO 进行的综合评估表明,我们的解决方案显着改善了学习稀疏检索的速度与空间权衡:在同等精度下,我们的索引回答查询的速度比最佳竞争对手快 5.3 倍,同时使用的内存减少约 3 倍;在内存最受限的情况下,它们在使用最多 3.9 倍的内存的同时仍保持快 1.9 倍的速度。