论文
ReAlign:通过推理引导的细粒度对齐优化视觉文档 检索器
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
摘要
视觉文档检索旨在从视觉丰富的集合中检索与查询相关的一组文档页面。现有方法通常采用视觉语言模型(VLM)将查询和视觉页面编码到共享嵌入空间中,然后通过对比训练进行优化。然而,在视觉文档表示过程中,局部证据通常分散在复杂的文档布局中,这使得检索模型很难捕获有效嵌入学习的关键线索。在本文中,我们提出了推理引导对齐(ReAlign),这是一种通过利用 VLM 的推理能力提供细粒度的视觉文档描述作为训练监督信号来增强视觉文档检索的方法。具体来说,ReAlign 采用高级 VLM 来识别页面上与查询相关的区域,然后生成基于裁剪视觉区域的查询感知描述。然后使用这些以区域为中心的描述来训练 检索器,以通过鼓励以区域为中心的描述引起的文档排名分布与原始查询引起的匹配来对齐查询和视觉文档之间的语义。对各种视觉丰富的文档检索基准的实验表明,ReAlign 持续改进了域内和域外数据集上的视觉文档检索性能,实现了高达 2% 的相对改进。此外,通过引导模型更好地将注意力集中在文档表示的关键视觉线索上,ReAlign 的优势可以推广到不同的 VLM 主干。所有代码和数据集均可在 https://github.com/NEUIR/ReAlign 上获取。