论文
MG$^2$-RAG:多模态检索增强生成的多粒度图
MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
摘要
检索增强生成 (RAG) 减轻了多模态 大语言模型 (MLLM) 中的幻觉,但现有系统却难以应对复杂的跨模态推理。平面向量检索通常会忽略结构依赖性,而当前基于图的方法依赖于昂贵的“翻译到文本”管道,而这些管道会丢弃细粒度的视觉信息。为了解决这些限制,我们提出了 \textbf{MG$^2$-RAG},一个轻量级的 \textbf{M}ulti-\textbf{G}ranularity \textbf{G}raph \textbf{RAG} 框架,它共同改进了图构造、模态融合和跨模态检索。 MG$^2$-RAG 通过将轻量级文本解析与实体驱动的视觉基础相结合,构建了分层多模态知识图谱,使文本实体和视觉区域能够融合到保留原子证据的统一多模态节点中。在此表示的基础上,我们引入了一种多粒度图检索机制,该机制聚合密集的相似性并在整个图中传播相关性以支持结构化多跳推理。跨越四个代表性多模态任务(即检索、基于知识的 VQA、推理和分类)的广泛实验表明,与先进的基于图的框架相比,MG$^2$-RAG 始终能够实现最先进的性能,同时减少图构建开销,平均加速 43.3$\times$,成本降低 23.9$\times$。