论文
Stellar:用于自然语言查询的可扩展多模式文档检索
Stellar: Scalable Multimodal Document Retrieval for Natural Language Queries
摘要
多模态文档检索(从大型语料库中选择最相关的多模态文档来回答自然语言查询)在检索增强生成(RAG)系统中发挥着重要作用。最先进的方法用多个 词元级 嵌入表示每个文档和查询,并使用后期交互来实现高效率。然而,这种多向量表示在检索过程中会产生大量内存开销,导致可扩展性差并阻碍实际部署。在本文中,我们提出了 Stellar,一种可扩展的多模式文档检索框架,它将 词元级 文档嵌入存储在磁盘上,并仅将一小部分候选嵌入加载到内存中以进行后期交互。 Stellar 包含两个关键组件:(i)基于词法表示的过滤(LRF),它对多模态 大语言模型(MLLM)作为稀疏编码器进行微调,以生成高质量的词法表示,从而实现高效且有效的文档过滤,从而显着减少候选集; (ii) 高效磁盘支持的后期交互(DLI),它设计了由平衡聚类算法引导的磁盘上词元嵌入存储布局,并使用简单而有效的成本模型仅将必要的词元嵌入动态加载到内存中。对四个真实世界基准和新提出的大规模数据集的大量实验表明,与现有方法相比,Stellar 在不影响检索效率的情况下将内存开销和查询延迟降低了 1-2 个数量级。