论文
WeVisDoc:从覆盖范围到强大的端到端文档解析能力
WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing
摘要
文档解析将文档图像转换为结构化内容,并需要在不同的布局和采集条件下提供可靠的性能。然而,训练语料库偏向于常见的文档类型和干净的数字页面,而仅扩大覆盖范围并不能指定如何解决解析器的剩余弱点。我们推出了 WeVisDoc,一个以数据为中心的两阶段框架,用于强大的端到端文档解析。第一阶段通过异构数据和结构保持退化合成扩大了语义、结构和外观覆盖范围。第二阶段使用保留探针来测量第一阶段解析器在固定视觉结构簇内的残留错误。这些诊断指导有针对性的数据构建和目标词元预算的重新分配。 WeVisDoc-4B 在 OmniDocBench v1.6 上的总体得分为 95.38,在三个 PureDocBench 轨道上的平均总体得分为 75.54,在所有四种设置中的比较的端到端解析器中排名第一。与 Stage I 相比,Stage II 提高了 2B 和 4B 模型在两个基准测试中的总体得分,其中在退化的 PureDocBench 赛道上获得了更大的增益,其中 4B 模型在 Real Degraded 赛道上获得了 4.03 分的增益。