论文
面向多粒度视觉文档检索的空间套娃训练
Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval
摘要
多模态后期交互检索器通过根据补丁嵌入和词元级别匹配来表示每个页面,从而实现对视觉丰富的文档的强大检索。然而,这种方法会产生高昂的存储成本。现有的压缩方法通常在索引时固定单个压缩级别,从而限制了灵活性。我们提出了 ColSNAP(空间嵌套平均池化)1,这是一种直接从骨干网的补丁网格生成压缩级别的嵌套层次结构的训练方法。通过在空间上将补丁嵌入池化到逐渐粗糙的层中并同时训练所有层,单个模型学会支持多个压缩级别的检索,而无需更改架构。至关重要的是,单个编码过程会产生每一层,从而能够在索引时配置准确性与存储的权衡,以匹配可用的存储预算,而不是在训练期间固定。我们证明,使用 ColSNAP 训练的模型在大量压缩下保持接近全分辨率的检索性能,并且 ColSNAP 可以有效地跨多个后期交互主干进行传输,并通过应用于预训练检索器的轻量级适应阶段实现大部分改进。
