论文

Look Twice:无需训练 基于知识的视觉问答的证据突出显示

Look Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question Answering

上下文与知识上下文工程

摘要

基于知识的视觉问答 (KB-VQA) 需要多模式 大语言模型 (MLLM) 来识别细粒度视觉线索并将其与检索到的文本证据相结合。然而,检索通常会引入噪声和部分相关的内容,而图像包含分散注意力的视觉区域,导致预训练的 MLLM 忽略实际支持答案的证据。为了解决这个问题,我们引入了 Look Twice (LoT),这是一个 无需训练 推理时间框架,它将模型自身的内部注意力转化为显式的多模态证据选择机制。 LoT 首先利用模型的内部注意力模式来识别与查询相关的图像区域和文本句子,过滤注意力池和分散注意力的内容,并重新制定输入以在答案生成之前明确突出显示所选证据。该方法不需要参数更新、辅助模型或架构修改。在四个 KB-VQA 基准测试和十个从 2B 到 38B 参数范围的现成 MLLM 中,LoT 改进了每个评估的骨干网,平均增益高达 +12.5 个准确点。当与已建立的上下文细化策略相结合时,它还可以提供进一步的收益,从而在已经细化的输入的基础上产生额外的改进。这些结果将 LoT 确立为一种通用且有效的机制,使预训练的 MLLM 能够更准确地利用可用的多模态证据。源代码可在 https://aimagelab.github.io/LoT/ 上公开获取。