论文

基于多模态知识图谱的多粒度上下文增强RAG

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

上下文与知识上下文工程知识图谱

摘要

检索增强生成(RAG)被广泛用于缓解大语言模型(LLM)和多模态大语言模型(MLLM)的幻觉问题。特别是,基于知识图谱(KG)的RAG利用结构化知识为(M)LLM提供高质量外部信息。在这些工作基础上,近期研究探索了多模态知识图谱(MMKG)作为GraphRAG的知识库,这使Graph RAG能够整合跨多个模态的知识,从而进一步提升性能。然而,现有的基于MMKG的RAG方法大多遵循一个共同管线:不同模态在被融合之前基本各自独立处理。结果是,在视觉信息提取及后续多模态知识融合过程中,文本上下文只能得到有限利用。这在图像与文本之间带来语义鸿沟,限制了多模态GraphRAG的性能。为解决这一问题,我们提出了一个构建上下文增强MMKG(CEMMKG)的新框架,以更好地支持多模态GraphRAG。所提出的CEMMKG在局部和全局两个尺度上为每张图像补充互补的文本上下文。局部上下文超越了周边文本,纳入与图像语义相关的句子,而全局上下文提供整段文本的摘要。我们进一步为局部上下文引入多粒度设计,使其能在不同细节层次上捕捉语义相关信息。在一个选定的以视觉为中心的数据集上的大量实验验证了CEMMKG能有效利用上下文信息提升基于MMKG的RAG性能。此外,它在不同基于MMKG的RAG方法上的有效性证明了其广泛适用性。

基于多模态知识图谱的多粒度上下文增强RAG:论文配图
图1. 基于节点的多模态知识图谱示意图,其中图像也被视为一个节点。基于节点的多模态知识图谱示意图。