论文
从场景到元素:可验证多模态 RAG 的多粒度证据检索
From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG
摘要
多模态检索增强生成 (RAG) 系统以粗粒度(整个图像或场景)检索证据,从而与细粒度的用户查询不匹配,并使故障无法验证。我们引入了 GranuVistaVQA,这是一个多模态基准,具有跨多个视点的元素级注释的真实世界地标,捕获单个图像仅包含实体子集的部分观察挑战。我们进一步提出了 GranuRAG,一个多粒度框架,通过三个阶段将视觉元素视为一流的检索单元:元素级检测和分类、证据检索的多粒度跨模态对齐以及归因约束生成。通过将检索建立在元素级别而不是依赖隐式注意力,我们的方法可以实现透明的错误诊断。实验表明,GranuRAG 在此任务的六个强基线上实现了高达 29.2% 的改进。