论文

SAFE-G:基于知识的视觉问答的结构感知忠实证据引导生成

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

上下文与知识检索增强

摘要

基于知识的视觉问答(KB-VQA)旨在回答需要对视觉内容之外的外部知识源进行推理的查询。通常,当前的方法融合多模态特征来检索外部信息,随后利用多模态 大语言模型 (MLLM) 从检索到的证据中得出答案。然而,这些方法通常难以捕获复杂上下文中的结构关联以有效过滤噪声。此外,他们经常无法确保推理过程严格忠实于检索到的证据。为了应对这些挑战,我们提出了 SAFE-G,一种结构感知的忠实证据引导生成框架,它能够实现精确的证据定位和可信的推理。具体来说,我们首先采用融合视觉和文本模式的粗粒度混合搜索来召回候选文档,然后实现结构感知的细粒度图形检索,捕获结构依赖性以过滤噪声并查明精确证据。此外,我们引入了一种强化学习(RL)策略,该策略具有基于证据的奖励,仅当所选证据正确时才将学分分配给正确的答案。这种严格的对齐约束迫使模型将其响应锚定在检索到的上下文中,从而有效增强其通过多模态特征定位证据并执行忠实推理的能力。 Encyclopedic-VQA 和 InfoSeek 基准测试的大量实验表明,SAFE-G 的性能比之前的方法分别高出 8.9% 和 3.5%,显着提高了整体推理准确性。我们的源代码公开于:https://github.com/MINE-USTC/SAFE-G。