论文
WikiSeeker:重新思考视觉语言模型在基于知识的视觉问答中的作用
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
摘要
多模态检索增强生成(RAG)已成为基于知识的视觉问答(KB-VQA)的高效范例。尽管最近取得了进步,但主流方法仍然主要依赖图像作为检索关键,并且经常忽视或错位视觉语言模型(VLM)的作用,从而未能充分发挥其潜力。在本文中,我们介绍了 WikiSeeker,这是一种新颖的多模态 RAG 框架,它通过提出多模态 检索器 并重新定义 VLM 的作用来弥补这些差距。我们不只是充当答案生成器,而是为 VLM 分配了两个专门的代理:Refiner 和 Inspector。 Refiner 利用 VLM 的功能根据输入图像重写文本查询,显着提高了多模态 检索器 的性能。 Inspector 通过有选择地将可靠的检索到的上下文路由到另一个 LLM 来生成答案,从而促进解耦生成策略,同时在检索不可靠时依赖 VLM 的内部知识。对 EVQA、InfoSeek 和 M2KR 的大量实验表明,WikiSeeker 实现了最先进的性能,在检索准确性和答案质量方面都有显着提高。我们的代码将发布在 https://github.com/zhuyjan/WikiSeeker 上。