论文

EVIE:用于视觉文档检索的证据向量知情嵌入

EVIE: Evidence-Vector-Informed Embeddings for Visual Document Retrieval

摘要

准确且可扩展的视觉文档检索(VDR)需要细粒度的页面理解和高效的索引,但现有的方法很难同时实现这两个目标。基于 OCR 的文本检索增加了预处理延迟,并且可能会丢失理解复杂页面所需的视觉和结构线索。单向量视觉语言模型绕过 OCR,但将整个页面压缩为一个向量会限制查询文档匹配的粒度。采用 MaxSim 的多向量检索器可提供更精细的交互,但需要较大的索引,并且仍然留有提高准确性的空间。我们认为,克服这些限制需要在表示学习和索引构建过程中保留与查询相关的页面证据。为此,我们引入 \textbf{\textit{EVIE}} (Evidence-Vector-Informed Embeddings),这是一系列原生视觉文档检索器,集成了三个关键创新:(1)证据判断的数据治理,它使用多模态判断来识别带有答案的肯定并过滤不可靠的否定。 (2) 双向师生学习 对称列表蒸馏和基于前缀的俄罗斯套娃表示学习(Prefix-MRL),使一个学生检查点能够服务六个嵌套嵌入维度,而无需重新编码。 (3) 分层凝聚索引压缩(HAC),它通过空间正则化对页面标记进行聚类,并存储语义质心以用于单阶段 MaxSim 检索。 ViDoRe V1、V2、V3 和 JinaVDR 的 138 项任务的广泛实验验证了 EVIE。 EVIE-8B 在 V3 上达到 66.75 nDCG@10,超出最佳外部基线 1.43 点,四套件平均值为 79.51。具有 HAC 的 EVIE-4.5B 以每百万页仅 3.81 GiB 的速度保留 59.58 nDCG@10,将向量有效负载减少 128 美元。总之,这些结果提高了准确性——视觉文档检索的存储权衡。