论文

Invoice Haystack:强视觉同质性下的文档检索和视觉问答的基准测试

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

模型评测基准与评测资源

摘要

视觉语言模型在单文档视觉问答上实现了接近人类的性能,但当从大量视觉同质文档中检索信息时,其有效性会显着下降。现有的多文档基准聚合了不同的文档类型,在嵌入空间中创建了人为分离,这不能反映企业文档存储库,其中数千条记录共享相同的视觉模板。我们将其识别为嵌入崩溃,并引入了 Invoice Haystack,这是一个基准测试,包含 1,500 张匿名发票图像和 200 个有区别的问答对,专门设计用于在强视觉同质性下对检索进行压力测试。 Invoice Haystack 的平均成对余弦相似度为 0.73,而现有基准测试中的平均成对余弦相似度为 0.38 (DocHaystack) 和 0.31 (InfoHaystack),这从根本上提出了更具挑战性的检索问题。为了解决已确定的挑战,我们提出了 VL-RAG,这是一种混合检索增强生成框架,它联合利用文本和视觉嵌入来利用两种模式的互补优势,然后使用基于 VLM 的验证过滤器来进行精确的文档识别。 VL-RAG 在 Invoice Haystack-500 上实现了 60.0\% Recall@1,比现有最先进的方法高出 13.5 个百分点。它进一步显着改进了 DocHaystack-1000(77.1% vs. 75.2%)和 InfoHaystack-1000(84.5% vs. 80.0%)的检索,将所提出的双流融合确立为跨同质和异构文档集合的始终如一的卓越检索策略。