论文
最终迷失:多模式检索增强问答中的首要偏差
Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering
摘要
基于知识的视觉问答(KB-VQA)让视觉语言系统通过从维基百科衍生的知识库中检索到的段落来限制读者,从而回答超出其参数知识的问题。在纯文本长上下文 LLM 中,检索上下文的使用遵循 Liu 等人的 U 形迷失效应。 (2024):使用上下文开始和结束的信息,中间丢失。这是否转移到已部署的多模式 KB-VQA 尚未确定。为了弥补这一差距,我们设计了多模态 KB-VQA 中读取器端位置依赖性的第一个受控探针:一种标准证据位置协议,其中只有标准证据片段的提示槽在问题中变化。我们在三个开源 7B/8B VLM 阅读器和两个 KB-VQA 基准测试上运行它,最多可检索 20 个段落。形状从 U 型翻转到首要位置:在阅读器和基准的所有六种组合上,最初的黄金比最后的黄金高出 16 到 26 个点,我们将这种效应称为“最后丢失”;在我们测试的每个尺度(3B 到 32B)中,差距都存在,在 32B 时衰减。三种有针对性的消融缩小了病因。删除图像且不更改任何其他内容的纯文本控件表明首要地位已经存在于文本模式中并且不依赖于图像。图像位置和干扰项洗牌消融将效果追踪到指令调整阅读器的提示槽 0,其中稍后放置的第二个带有答案的段落很大程度上被浪费了。在冻结的读取器上,三个检索端修复(MMR、oracle 重新排名、基于排名的重新排序)都无法改进部署默认值。我们的研究结果表明,recall@k 对于已部署的 KB-VQA 来说是错误的指标,并且剩余的空间位于读取器一侧;我们发布我们的协议作为评估读者端干预的受控工具。