论文

MinerU-Popo:用于结构化文档解析的通用后处理模型

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

摘要

基于 VLM 的 OCR 模型已成为文档解析的事实上的选择,因为它们可以准确地提取页面级元素(例如各个页面内的段落)及其边界框和文本内容。然而,RAG 等下游应用程序需要连贯的文档级信息,而这些模型通常会破坏跨页面连续性,并且无法恢复中断的结构,例如被页面边界截断的段落和表格。这种关系并不局限于单个页面;相反,它们需要对跨多​​个页面的标题、段落、表格和图像进行联合分析。因此,一个自然的解决方案是重用现有的 OCR 输出并通过后处理重建文档级逻辑结构。为此,我们提出了 MinerU-Popo,这是一个用于 POst 处理 OCR 输出的轻量级通用框架,它将来自不同解析器的页面级结果转换为连贯的文档级结构。 MinerU-Popo 将问题分解为四个重点子任务:文本截断恢复、表截断恢复、标题层次结构重建和图像文本关联。为了有效地解决这些问题,我们构建了一个具有特定于任务的输入过滤功能的面向任务的数据引擎,并使用生成的数据(30K)来微调轻量级后处理模型(Qwen3-VL-4B)。为了支持长文档,我们引入了具有基于重叠的同步的动态分块,它可以对齐微调模型的块级输出并保持全局一致性。最后,我们将对齐的输出组装成树形结构的文档表示,并通过节点分块和摘要进一步丰富以供下游检索和分析。实证结果表明,MinerU-Popo 在所有五个测试的 OCR 模型中将标题层次结构 TEDS 提高了至少 20%,提高了 RAG 准确性并减少了每次查询的延迟。