论文

用于远程视觉丰富文档理解的多模态图 RAG

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

上下文与知识知识图谱

摘要

多模态 大语言模型 (MLLM) 广泛应用于视觉文档理解。然而,由于上下文窗口有限,理解长文档仍然是一个问题。尽管最近的多模态检索增强生成(MMRAG)可以通过检索相关页面来解决这一挑战。它仍然难以应对需要全面理解文档的视觉问答(VQA)。为了解决这个问题,总结文档全局知识的知识图谱(KG)可以提供有效的解决方案。然而,大多数现有的基于 LLM 的知识图谱构建方法仅处理语言模态,而为视觉丰富的文档自动创建多模态知识图谱(MMKG)在很大程度上尚未被探索。在本文中,我们引入了一种基于多模态图的 RAG 方法来解决这个问题。现有的基于LLM的KG方法依靠全面性、多样性、赋权等间接证据来评估QA绩效。缺乏用于全面文档级 VQA 的带注释数据集对有效的模型评估提出了重大挑战。为了克服这个限制,我们还引入了一个新的基准,DLVQA(文档级VQA),它为全局文档级问题提供参考摘要和相应的支持事实。实验结果表明,我们的方法在多跳 QA/VQA 基准和 DLVQA 上优于现有的 MMRAG 或基于 KG 的方法。