论文

Ground then Rank:通过 无需训练 实体识别重新审视基于知识的 VQA

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

上下文与知识检索增强

摘要

基于知识的视觉问答(KB-VQA)需要将视觉查询扎根于图像中可直接观察的内容之外的外部知识。虽然最近的多模态 大语言模型 (MLLM) 显示出强大的感知能力,但它们在需要细粒度实体和证据级别基础的 KB-VQA 任务上遇到了困难。大多数现有的多模态检索增强生成(MM-RAG)方法将实体辨别和部分级证据排序紧密耦合到单个重新排序阶段,导致成本高昂且泛化能力有限。在这项工作中,我们从工作流程的角度重新审视现有的 MM-RAG 解决方案,并认为实体级和事实级基础都是关键瓶颈。我们观察到,尽管 MLLM 在开放式实体命名下经常失败,但在从一小组候选名称中进行选择时,它们可以更好地识别正确的实体。基于这一见解,我们提出了一个简单的 无需训练 答案前识别 IBA 框架,该框架将实体识别与片段级重排解耦。我们的方法促使 MLLM 仅使用候选名称来选择高置信度实体,然后使用现成的文本重新排序器进行证据选择。 Encyclopedic-VQA 和 InfoSeek 上的实验表明,我们的方法始终优于微调的多模态重排序基线,同时降低了训练和推理复杂性。其他分析表明,这些改进不仅来自于更好的实体识别,而且还来自于在确定正确的实体后选择更多信息证据。我们的实施是公开的,以简化可重复性。