论文

超越补丁袋:通过文本监督学习全局布局以进行后期交互视觉文档检索

Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

上下文与知识检索增强

摘要

视觉文档检索(VDR)模型主要依赖于后期交互架构,其中文档由一组本地补丁嵌入表示,然后与查询标记进行匹配。该架构虽然高效,但优先考虑文档的局部相似性而不是全局布局结构,以估计文档和查询之间的相关性。在实践中,这会导致错误,因为相关性源自具有组合图形、表格和文本的异构布局的文档的布局结构。我们在不改变推理的情况下使文档布局变得可学习。我们提出了一种多模态编码器,它通过全局布局嵌入增强局部补丁表示,并通过编码文档布局信息的文本描述进行训练。在四个 ViDoRe-v2 数据集上,我们的模型比最强的架构可比 ColPali/ColQwen 基线提高了 +2.4 nDCG@5 和 +2.3 MAP@5,每个数据集比 ColQwen 具有统计上显着的增益。