论文

使用词元感知聚类和分层索引进行高效多向量检索

Efficient Multivector Retrieval with Token-Aware Clustering and Hierarchical Indexing

AI 基础设施向量数据库

摘要

多向量检索模型通过细粒度的 词元级 表示实现了最先进的有效性,但它们的部署会产生大量的计算和内存成本。当前的解决方案基于众所周知的 k 均值聚类算法,将相似的向量分组在一起,以实现有效的压缩和高效的检索。然而,标准 k 均值在聚类数量和数据集大小方面的扩展性很差,并且在训练期间偏向于频繁出现的标记,而低估了罕见的、具有区分性的标记。在这项工作中,我们介绍了 TACHIOM,这是一种多向量检索系统,它利用 词元级 结构来显着加速聚类和检索。通过在质心分配期间考虑词元的分布,TACHIOM 可以轻松扩展到数百万个质心,从而仅使用质心即可实现高度准确的文档评分,从而避免昂贵的 词元级 计算。 TACHIOM 将基于图形的质心索引与优化的产品量化布局相结合,以实现高效的最终评分。 MS-MARCOv1 和 LoTTE 上的实验表明,TACHIOM 的聚类速度比 k-means 快 247 倍,检索速度比最先进的系统快 9.8 倍,同时保持相当或更高的有效性。