论文
LFRAG:面向布局的细粒度检索增强多模态文档理解生成
LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding
摘要
多模态检索增强生成(RAG)已成为利用外部知识增强 大语言模型(LLM)的有效范例。然而,现有的多模态 RAG 系统主要依赖于粗粒度的页面级检索,无法捕获视觉丰富的文档中的细粒度语义和布局结构,从而损害检索准确性并导致下游任务中出现冗余上下文。为了解决这些问题,我们提出了面向布局的细粒度检索增强生成(LFRAG),这是一种将多模式 RAG 从页面级检索推进到块级检索的新颖框架。我们执行布局分割来构建语义连贯的细粒度检索单元,并设计一个语义布局融合编码器,通过交叉注意力将局部语义与全局上下文集成。通过块级后期交互检索,LFRAG 可以实现精确的查询内容对齐,并减少下游生成的不相关内容。为了实现严格的评估,我们构建了 LFDocQA,这是一个具有跨越不同文档类型的块级注释的大规模基准,旨在以比现有数据集更大的粒度评估多模式文档检索和问答。 LFDocQA 上的大量实验表明,LFRAG 在检索任务上实现了最先进的性能,在答案准确性方面比最佳基线高出 7.20%,在生成任务中减少了 73.07% 的标记消耗,证实 LFRAG 是针对视觉丰富的文档的多模态 RAG 的准确高效的框架。我们的代码和数据集将很快发布。