论文
MMAgent-R$^2$:学习对 Agentic mRAG 进行重新排序和拒绝
MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG
摘要
基于知识的视觉问答(KB-VQA)需要模型从大规模百科全书知识库中检索与查询图像匹配的视觉实体并回答相关问题。现有的多模态检索增强生成(mRAG)方法依赖全局视觉特征来匹配候选实体,但是当知识库包含大量视觉上相似的实体时,检索器 很难区分它们,从而用视觉上相似但实际上不匹配的干扰项填充候选集。由于后续的处理步骤(例如噪声过滤)也仅限于这个固定的候选集,因此失败检索的错误不可避免地会传播到最终答案。为了应对这些挑战,我们提出了 MMAgent-R$^2$,这是一个代理 mRAG 框架,集成了视觉重排序和主动拒绝作为其内部验证机制。视觉重排序直接比较查询图像和候选图像,捕获文本描述之外的判别细节,以精确识别相似候选图像中的目标实体;主动拒绝会丢弃不可靠的结果,并在未找到置信匹配时检索其他候选,超出固定候选池。我们设计了具有阶梯级验证奖励的复合奖励函数,并通过 GRPO 训练实现外部检索、内部验证和答案生成的联合优化。 InfoSeek、E-VQA 和 MMhops 上的实验表明,我们的{}实现了最先进的性能,在具有挑战性的检索场景和复杂的多图像多跳推理任务中具有特别显着的优势。