论文

TopoGraphRAG-Bench:布局与证据关系驱动的多模态GraphRAG评测

TopoGraphRAG-Bench: Evaluating Multimodal GraphRAG on Layout-Grounded Evidence Reasoning

模型评测上下文与知识检索增强知识图谱基准与评测资源

摘要

现实世界的文档将证据分布在复杂页面布局中的文本、表格、图形和标题中。因此,回答有关此类文档的复杂问题需要的不仅仅是检索相关段落:系统必须恢复连接异构证据单元的证据拓扑。现有的 GraphRAG 评估仍然主要以文本为中心,而多模式文档 RAG 基准评估跨模式检索和生成,而不直接评估预期证据拓扑的恢复。我们介绍了 TOPOGRAPHRAG-BENCH,这是一个基于布局的 GraphRAG 多模态证据推理基准,包含 201 个长而视觉丰富的文档中的 2,024 个问题。问题是在三种受控拓扑下从文本、图形和表格证据单元自下而上构建的:单跳检索、桥链推理和多源合成。为了确保问题保留其预期结构,我们对捷径阻力、模态必要性和证据必要性应用反事实验证。我们使用检索、生成和拓扑感知推理指标来评估纯文本 GraphRAG、页面级视觉检索和多模式 GraphRAG 系统。多模态 GraphRAG 系统实现了最强的整体性能,但当视觉文本证据对齐或多单元组合不完整时仍然会失败。当关键依赖关系基于图形或表格时,纯文本 GraphRAG 会陷入困境,而页面级视觉检索缺乏拓扑恢复所需的细粒度结构。这些发现促使 GraphRAG 系统超越文本派生的实体关系图,对文档布局、跨模式证据对齐和证据单元的推理角色进行显式建模。代码和数据可在https://richardlrc.github.io/TopoGraphRAG-Bench/。获取

TopoGraphRAG-Bench:布局与证据关系驱动的多模态GraphRAG评测:论文原图
图 1:TopoGraphRAG 基准构建和验证流程概述。该管道从基于布局的文档证据单元开始,构建单跳、桥链和多源综合 QA 实例,然后应用反事实拓扑验证来测试捷径阻力、模态必要性和证据必要性。