论文
ViSAR:无需训练 自适应-$k$ 视觉文档问答检索
ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering
摘要
文档视觉问答 (DocVQA) 通常利用检索增强生成 (RAG),其中后期交互编码器通常用于在大型视觉语言模型 (LVLM) 生成答案之前识别与用户查询相关的文档页面。现有方法通常会检索固定的 top-$k$ 数量的页面,而不管查询复杂性如何,这会增加 LVLM 延迟并可能降低答案准确性。我们介绍 ViSAR(视觉语义激活检索),这是一种用于后期交互视觉文档检索的 无需训练 自适应 $k$ 检索方法。 ViSAR 直接在嵌入空间中运行,构建查询条件的页面级相似度矩阵,突出显示与查询相关的语义并动态确定要检索的页面数量。在多个编码器和 LVLM 中,ViSAR 检索紧凑、适应查询的页面集,与固定的 top-$k$ 和自适应检索启发式相比,可将 RAG 延迟减少高达 58.7%,同时保持或提高答案准确性。此外,我们表明相似性矩阵结构与答案准确性相关,为检索质量感知文档理解的未来方向提出了建议。