论文
通过结构化上下文推理促进基于知识的视觉问答
Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning
摘要
基于知识的视觉问答旨在通过将外部知识与视觉和文本信息相结合来回答有关图像的问题。最近的方法通常依赖于上下文学习,以零样本或少样本的方式在多模态上下文中提示 大语言模型 (LLM)。然而,我们观察到,由于过多的不相关上下文和缺乏明确的关系结构,直接将异构视觉描述和检索到的知识连接成长的、非结构化的提示通常会降低推理性能。在本文中,我们提出了一种基于 LLM 的结构化上下文推理 (SCoRe) 框架,该框架可以推断显式和隐式关系以进行预测。 SCoRe 由三个阶段组成:上下文获取,生成不同的视觉注释并通过高效的两阶段多模态检索策略检索显性知识;上下文选择,使用 LLM 引导选择过滤相关的视觉、显性和隐性知识;上下文压缩,执行关系逻辑 蒸馏 (RLD) 将原始文本转换为显式实体关系三元组。这些关系三元组充当最终答案预测的简洁且结构化的提示。对 OK-VQA 和 A-OKVQA 基准的大量实验表明,SCoRe 始终优于最先进的方法。