论文
M3DocDep:使用大型视觉语言模型进行多模式、多页面、多文档依赖分块
M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
摘要
在长的多页工业文档中,检索增强生成 (RAG) 在很大程度上取决于块边界是否遵循文档的真实结构。现有的以文本为中心的分块器和生成层次结构解析器经常会错过跨页父子关系、图形/表格标题绑定和边界线索,这会导致碎片或冗余块并降低检索和答案质量。我们提出了 M3DocDep,一种基于 LVLM 的管道,它首先恢复块级依赖关系,然后沿着恢复的文档树构造块。该管道使用 SharedDet 作为通用 DP+OCR 预处理层,使用边界感知 SoftROI 池化提取多模态块嵌入,使用双仿射头对候选父子边缘进行评分,使用 MST 约束解码全局有效的依赖树,并构建用部分路径和页面范围注释的树引导块。在共享块评估协议下,M3DocDep 在 DHP 基准上将 STEDS 提高了 +28.5% 至 +39.6%,在语料库级 RAG 基准上将 nDCG 检索提高了 +1.1% 至 +15.3%,将 QA ANLS 提高了 +4.5% 至 +15.3%。这些结果表明,在分块之前恢复文档依赖性可以为长的多页多模式文档产生更连贯的检索单元。