论文

ConceptFormer:学习视觉文档检索中查询文档对齐的自适应潜在概念

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

上下文与知识检索增强

摘要

视觉文档检索是多模式检索增强生成的关键组成部分,旨在从文档集合中识别与查询相关的页面,其中证据分布在文本、布局、图表和视觉结构中。最近针对更细粒度监督的努力主要依赖于文本描述或局部视觉区域作为证据代理。然而,这种监督信号可能会忽略复杂的视觉结构,或者提供潜在证据的不完整和不准确的表示。为了解决这些限制,我们提出了 ConceptFormer,一种用于视觉文档检索的潜在概念表示学习框架。 ConceptFormer 将与查询相关的证据建模为连续的、以查询为条件的潜在概念,这些概念明确地连接了局部视觉证据和语义相关性,而不需要文本中间表示或直接依赖于原始视觉注释。在训练过程中,ConceptFormer 采用强大的视觉语言模型来动态确定潜在概念标记的数量,并使用这些概念作为中间表示来弥合查询和文档之间的语义差距,从而指导嵌入空间的学习。对不同视觉文档检索基准的实验表明,ConceptFormer 的平均 NDCG@10 相对于最强的视觉检索基线和最强的基于 OCR 的文本检索基线分别实现了 16.7% 和 22.1% 的相对改进。进一步的分析表明,潜在概念有效地将本地化视觉证据与语义相关性联系起来,使 检索器 能够捕获细粒度的文本线索和复杂的文档级视觉结构,同时保持强大的检索对齐。代码和数据可在 https://github.com/Neuir/ConceptFormer 获取。