论文

DocPC:通过代表性页面组合进行文档级视觉检索

DocPC: Document-Level Visual Retrieval via Representative Page Composition

上下文与知识上下文工程

摘要

通过使用视觉语言模型对页面屏幕截图进行编码,绕过 OCR 管道,视觉文档检索得到了进步。然而,现有的方法仍然以页面为中心,与需要完整文档检索的现实场景不一致。当相关性跨越多个页面时,简单的页面然后文档聚合会遭受线性索引成本和检索降级的影响。我们提出了 DocPC,一种基于代表性页面组合的文档级视觉检索框架:选择代表性页面并将它们组合成单个网格图像以进行文档级索引,将索引图像、向量和存储减少 10.1 倍,并将端到端索引时间减少约 7.7 倍。为了处理文档级别普遍存在的多重正向监督,我们将多重正向对比学习与稀疏调度列表优化相结合。我们还介绍了 DocViRe,一个具有多重正相关注释的基准。 DocPC-ColQwen 在 DocViRe 上的 NDCG@5 达到了 44.09,超过了最强的页面级基准 38.91,同时将存储减少了 10.1 倍。代码可在 https://anonymous.4open.science/r/DocPC-Document-Level-Visual-Retrieval-via-Representative-Page-Composition-1D52 获取。数据可在 https://huggingface.co/datasets/anonymous-7219/docpc 上获取。