论文
LightSTAR:通过轻量级选择和视觉自适应细化实现高效视觉文档检索
LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement
摘要
视觉文档检索需要从大型多模态语料库中快速定位相关页面以响应用户查询。虽然最近由多模态 大语言模型 (MLLM) 支持的方法显示出具有竞争力的准确性,但由于对每个页面应用密集的 MLLM 编码,它们的计算成本过高。同时,我们观察到用户查询通常是关键字锚定的,包含语义丰富的单词,这些单词预计会直接出现在相关页面的可见文本中,为快速缩小候选页面范围提供有效的提示。基于这一见解,我们提出了 LightSTAR,这是一个有效的框架,它将视觉文档检索分解为:1)无 LLM 的视觉选择,它利用基于内容的查询编码来关注信息丰富的单词,并采用无 LLM 的视觉嵌入来生成高召回率候选集; 2)视觉自适应语义细化,通过自适应区域特征融合,进一步对这些顶级候选者进行细粒度语义匹配,以有效地结合文本和布局线索,并通过硬度感知对比目标进行优化。实验结果表明,LightSTAR 实现了最先进的检索精度,同时将端到端延迟降低了数倍,为视觉文档检索中的精度与效率权衡提供了高度实用的解决方案。代码可在 https://github.com/bokufa/LightSTAR 获取。