论文

HVM-GraphRAG:复杂文档的整体视图多模态图检索增强生成

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

上下文与知识检索增强

摘要

针对复杂文档的问答 (QA) 需要模型来检索和整合分布在遥远文档区域和模式中的证据。多模态 GraphRAG 通过用图结构组织文档证据提供了一个有前途的方向。然而,现有方法经常遭受不可靠的跨模式证据索引和昂贵的图遍历的困扰。为了解决这些问题,我们提出了 HVM-GraphRAG,一种针对复杂文档的整体视图多模态 GraphRAG 框架。 HVM-GraphRAG 使用整体视图来指导图构建,从而减少嘈杂和冲突的图更新,并在概念级图节点之间构建可靠的索引并支持多模式块。在检索过程中,HVM-GraphRAG 搜索紧凑的概念级图,并通过构建的索引直接访问支持证据,避免了对密集实体级图的昂贵遍历。获得检索到的证据后,HVM-GraphRAG 进一步将块重新组织为特定于模态的组,使应答模型能够更好地整合异构证据。对三个数据集的实验表明,HVM-GraphRAG 在大多数评估设置中实现了最佳答案性能,同时相对于代表性的基于图的基线显着提高了在线检索效率。