论文
通过问题链引导检索增强生成,使用多模式 LLM 增强视觉问答
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
摘要
随着多模态研究和深度学习的进步,多模态 大语言模型 (MLLM) 已成为各种多模态任务的强大范例。作为视觉语言研究的核心问题,视觉问答(VQA)越来越多地采用 MLLM 来提高性能,特别是在外部知识至关重要的开放领域环境中。在这项工作中,我们的目标是通过更有效地将 MLLM 与结构化推理和知识获取相结合,进一步增强基于检索的 VQA。我们引入了一种逻辑提示策略,将思想链 (CoT) 推理与视觉问题分解 (VQD) 相结合,称为 CoVQD,以指导检索更准确和相关的 MLLM 推理知识。基于这个想法,我们提出了一个新的框架,即 CoVQD 引导的 RAG (CgRAG),它使 MLLM 能够访问更全面、更连贯的外部知识,同时受益于结构化的视觉文本推理指导,从而提高复杂的跨域 VQA 场景的泛化性和可靠性。 E-VQA、InfoSeek 和 OKVQA 基准的大量实验证明了该方法的有效性。