论文
学习搜索:基于知识的视觉问答的基于决策的代理
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
摘要
基于知识的视觉问答(KB-VQA)需要视觉语言模型来理解图像并使用外部知识,特别是对于稀有实体和长尾事实。大多数现有的检索增强生成(RAG)方法采用固定的管道,顺序检索信息、过滤信息,然后生成答案。这样的设计很难适应多样化的题型。此外,它将检索与推理分开,使得模型很难决定何时搜索、如何优化查询或何时停止。因此,检索到的证据通常与问题不一致。为了解决这些限制,我们将 KB-VQA 重新表述为搜索代理问题,并将求解过程建模为多步骤决策过程。在每个步骤中,代理根据其当前信息状态选择四个操作之一:应答、图像检索、文本检索和图像描述。我们进一步设计了一个自动化管道来收集多步骤轨迹,记录代理的推理过程、工具使用和中间决策。然后将这些轨迹用作 微调 的监督。 InfoSeek 和 E-VQA 上的实验表明,我们的方法实现了最先进的性能,始终优于先前的基线,并证实了我们框架的有效性。