论文
基于超图的多模态检索增强生成与增量细化
Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement
摘要
现代多模态检索增强生成(M-RAG)系统从根本上受限于传统简单图的二元连接范式,它无法捕捉异构实体间复杂的高阶关联,例如视觉图表、散落的文本描述与底层数值数据之间的N元关系。此外,现有细化策略常依赖穷举式的整页重建来对齐跨模态信息,在长文档处理中导致高昂的计算冗余并引入上下文噪声。本文提出Hyper-M2RAG,一个通过高阶超图表示学习重新定义多模态文档检索的新框架。我们首先把文档结构形式化为多模态超图,利用超边作为统一语义容器来封装文本、图像和表格之间的多路关联,从而超越点对点建模。为缓解物理分页导致的语义碎片化,我们引入锚点驱动的增量细化机制。我们的方法不做全局扫描,而是识别跨页边界的锚点节点,并用一跳邻域上下文重建其局部超拓扑。这种有针对性的细化以极小的计算开销有效弥合跨页知识鸿沟。在多模态基准数据集上的大量评估表明,Hyper-M2RAG在检索精度和生成连贯性上都显著优于最先进方法。代码见https://github.com/ShenAoChen2001/MMHRAG。
