论文

MinerU2.5-Pro:大规模突破以数据为中心的文档解析的极限

MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale

模型训练合成数据

摘要

当前的文档解析方法主要通过模型架构创新来进步,而训练数据的系统工程仍未得到充分探索。然而,跨越不同架构和参数规模的最先进模型在同一组硬样本上表现出高度一致的故障模式,这表明性能瓶颈源于训练数据的共同缺陷,而不是架构差异。基于这一发现,我们推出了 MinerU2.5-Pro,它纯粹通过数据工程和训练策略设计来推进最先进的技术,同时保留 MinerU2.5 的 1.2B 参数架构不变。其核心是围绕覆盖率、信息量和注释准确性共同设计的数据引擎:多样性和难度感知采样将训练数据从 1000 万个样本扩展到 6550 万个样本,同时减轻分布偏移;跨模型一致性验证利用异构模型之间的输出共识来评估样本难度并生成可靠的注释; Judge-and-Refine 管道通过渲染然后验证迭代校正来提高硬样本的注释质量。三阶段渐进训练策略——大规模 预训练、硬样本 微调 和 GRPO 对齐——依次利用不同质量层的这些数据。在评估方面,我们纠正了 OmniDocBench v1.5 中的元素匹配偏差,并引入了 Hard 子集,建立了更具辨别力的 OmniDocBench v1.6 协议。在没有任何架构修改的情况下,MinerU2.5-Pro 在 OmniDocBench v1.6 上获得了 95.69 分,比相同架构的基线提高了 2.71 分,超越了所有现有方法,包括基于参数超过 200 倍的模型的方法。