论文

MAGE-RAG:长文档多模态问答的自适应图证据

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

上下文与知识检索增强

摘要

长文档多模态问答需要一个系统来定位长 PDF 中的稀疏证据,并整合来自文本、表格、图像、图表和复杂布局的线索。现有的 RAG 方法主要依赖于文本块或页面上的固定 Top-k 检索。文本检索可以压缩上下文,但常常会丢失视觉和布局信息;页面级视觉检索保留了原始页面,但它也向读者发送了大量不相关的区域,导致证据覆盖范围、噪音和推理成本之间的静态权衡。本文提出了 MAGE-RAG,一种用于长文档多模态 QA 的多粒度自适应图证据框架。 MAGE-RAG 使用页面检索作为查询时证据构建的入口点。离线时,它使用页面节点和元素节点、编码包含、阅读顺序、布局邻接、章节层次结构和语义邻居关系构建证据图。在查询时,在线证据控制器在明确的预算下迭代地激活、打开、搜索和修剪证据。然后将生成的证据子图呈现为结构化多模态读取器输入,从而允许 LVLM 在有限的上下文中使用紧凑且相关的证据。在LongDocURL和MMLongBench-Doc上,我们建立了统一的比较和分析协议,涵盖Direct MLLM、Text RAG、Page-level Visual RAG和Graph/Agentic RAG。实验表明,MAGE-RAG 在 LongDocURL 上的总体准确率达到 52.75,在 MMLongBench-Doc 上的准确率达到 53.26,F1 为 51.19。细粒度细分、预算绩效曲线、消融和基于跟踪的分析进一步表明,查询时证据子图构建可以平衡分散的证据覆盖与上下文噪声控制。我们的代码可在 https://github.com/laonuo2004/MAGE-RAG.git 获取。