论文

MINER:挖掘多模态内部表示以实现高效检索

MINER: Mining Multimodal Internal Representation for Efficient Retrieval

摘要

视觉文档检索对于访问视觉丰富的文档中的信息已变得至关重要。现有的方法分为两个阵营。后期交互 检索器 通过细粒度的 词元级 匹配实现了强大的质量,但每页存储数百个向量,导致索引占用空间大和服务成本高。相比之下,密集单向量 检索器 保留了存储和延迟优势,但质量始终落后,因为它们将所有信息压缩到单个最终层嵌入中。在这项工作中,我们首先对单向量 检索器 进行分层诊断,揭示与检索相关的信号驻留在内部表示中。受这些发现的启发,我们提出了 MINER(挖掘多模态内部表示以实现高效检索),这是一种轻量级插件模块,可探测 Transformer 层上的内部信号并将其融合为单个紧凑嵌入,而无需修改主干或牺牲单向量效率。第一个检索对齐层探测阶段在每一层都连接了一个轻量级探针,显示哪些维度携带检索相关信息。随后的自适应稀疏多层融合阶段将性能自适应神经元级掩蔽应用于所选层,并将幸存信号融合到最终的密集向量中。在 ViDoRe V1/V2/V3 中,MINER 在大多数基准测试中都优于现有的密集单向量 检索器,与相应的骨干网络相比,nDCG@5 提升高达 4.5%。与强大的后期交互基线相比,在某些设置中,MINER 将 nDCG@$5$ 差距大幅缩小至 0.2$,同时保留了密集检索的存储和服务优势。