论文

DocRetriever:具有综合基准的多模式文档检索即插即用框架

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

上下文与知识检索增强

摘要

多模式文档包含不同的元素,例如表格、图形和布局,这可能会使检索任务变得复杂。虽然当前的方法通常将密集视觉嵌入模型与监督重排器相结合以实现高精度检索,但它们面临着固有的局限性。首先,密集嵌入的粗粒度性质往往会混淆显式语义,无法利用结构上显着的信息。其次,监督重排序模型存在泛化瓶颈,因为它们的性能严重依赖于特定领域的训练数据。此外,现有的基准往往缺乏多样化的评估维度和全面的相关性注释,限制了评估的可靠性。为了应对这些挑战,我们提出了 DocRetriever,一个即插即用的框架。它通过布局感知稀疏嵌入技术增强视觉检索,从而实现有效的混合编码,而无需光学字符识别 (OCR) 的开销。我们还引入了一个可推广的重新排序器,它利用推理增强演示和优化采样来提高少数镜头设置的准确性。最后,我们构建了一个新的基准 MultiDocR,以实现更严格的评估。跨不同基准的实验验证了 DocRetriever 相对于最先进方法的优越性。