论文
ProMSA:用于基于知识的视觉问答的渐进式多模态搜索代理
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
摘要
基于知识的视觉问答(KB-VQA)需要模型将图像理解与外部知识相结合。大多数现有方法使用固定的检索然后生成管道,具有预先选择的 检索器 和静态 top-k 设置,这在推理过程中不是自适应的。我们提出了 ProMSA,一种用于 KB-VQA 的渐进式多模态搜索代理。给定图像-问题对,代理在明确的工具调用预算下迭代选择图像搜索、文本搜索或停止,并使用重复数据删除以避免冗余检索。对于训练,我们首先使用拒绝采样 SFT 来学习有效的工具使用格式,然后使用 TN-GSPO 优化代理,TN-GSPO 是一个序列级 RL 目标,可通过生成长度和工具交互深度标准化更新。 E-VQA 和 InfoSeek 的实验表明,与强大的 RAG 和代理基线相比,获得了一致的收益,并且提高了检索和端到端准确性。代码可在 https://github.com/DingWu1021/Promsa 获取。