论文
MIDR:多模态文档检索的内容增强索引
MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval
摘要
对视觉效果丰富的文档进行检索存在表示问题:重要内容通常存在于表格、图表、图形和布局关系中,而普通 OCR 会线性化、损坏或省略这些内容。 ColPali 系列视觉 检索器 通过补丁级多向量索引和后期交互评分来解决这个问题,从而将图像派生的检索保持在查询时服务路径上。我们引入 MIDR(文档检索多模态索引),这是一种用于丰富增强索引的 无需训练 框架,可将多模态推理转移到索引时间。在摄取过程中,多模态 LLM 将渲染的页面转换为经过验证的文本字段,这些文本字段使用 BM25F 进行索引,并可选择与密集检索融合,从而实现基于多模态证据的以文本为中心的服务。在 ViDoRe V3 上,MIDR Hybrid 在五个英语域中实现了 0.6219 平均 nDCG,比 BM25 相对增益 23.0%,与 ColQwen2.5 保持竞争力。在两个法语文档域上,丰富连接了英语查询和法语页面文本,将 BM25 nDCG 从 0.1532 提升到 0.5448,并且表现优于 ColQwen2.5。在所有七个域中,MIDR 在四个域中领先于 ColQwen2.5,同时索引内存减少了约 9 倍,查询延迟降低了约 2 倍。这些结果确立了索引时间多模态推理作为服务时间视觉后期交互的令人信服的准确性部署替代方案。