论文

MultiDocFusion:面向长工业文档增强RAG的分层多模态分块流水线

MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents

上下文与知识检索增强

摘要

基于RAG的问答已成为处理长工业文档的有力方法。然而,传统文本分块方法常常忽视复杂冗长的工业文档结构,导致信息丢失与答案质量下降。为解决这一问题,我们提出MultiDocFusion,一个多模态分块流水线,它整合了:(i) 使用基于视觉的文档解析进行文档区域检测,(ii) 通过OCR从这些区域提取文本,(iii) 使用基于大语言模型(LLM)的文档章节层级解析(DSHP-LLM)将文档结构重建为层级树,以及(iv) 通过基于DFS的分组构建层级分块。在多个工业基准上的大量实验表明,与基线相比,MultiDocFusion将检索精确率提升8-15%,将ANLS问答分数提升2-3%,凸显了显式利用文档层级对多模态文档问答的关键作用。这些显著的性能提升强调了结构感知分块对于提升基于RAG的问答系统保真度的必要性。

MultiDocFusion:面向长工业文档增强RAG的分层多模态分块流水线:论文配图
图 1:MultiDocFusion 的管道。该图说明了处理长工业文档的分步过程。 (a) DP提取布局结构; (b) OCR 识别并注释文本; (c) DSHP-LLM 根据已识别的节标题和一般节点构建层次树; (d) 基于 DFS 的分组为检索任务构建连贯的分层块。颜色编码块代表文档元素:黄色表示根和标题,红色表示节标题,绿色表示一般节点(表格、图形和文本块)。