论文
MM-Matryoshka:通过 2D 多模态 Matryoshka 训练框架实现预算弹性的视觉文档检索
MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework
摘要
多向量视觉文档 检索器 通过使用来自深度视觉语言模型 (VLM) 的多个向量表示每个页面来实现强大的细粒度匹配,但这种设计使得部署在存储和计算开销方面都很昂贵。现有的效率技术通常仅优化该预算的一部分,使得多模态 检索器 没有统一的方法来权衡矢量宽度和编码器深度的精度。因此,我们提出了MM-Matryoshka,一种用于预算弹性视觉文档检索(VDR)的2D Matryoshka训练框架,使得ColPali风格的多向量检索在维度和层上都具有弹性。在推理时,单个 检索器 可以选择 2D 可选预算,而无需针对不同预算训练单独的模型。通过跨多个代表性骨干网的综合实验,我们证明,通过保留比直接截断基线显着更高的质量,同时大幅减少存储和计算开销,MM-Matryoshka 可以为高效的 VDR 提供强大的预算弹性。