论文

通过现实场景合成和文档感知训练实现真实世界文档解析

Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training

模型训练合成数据

摘要

最近,文档解析通过多模态 大语言模型 (MLLM) 取得了进展,可直接将文档图像映射到结构化输出。传统的级联管道依赖于精确的布局分析,并且经常在随意捕捉或非标准条件下失败。尽管端到端方法减轻了这种依赖性,但它们仍然表现出重复的、幻觉的和结构不一致的预测——这主要是由于缺乏大规模、高质量的全页(文档级)端到端解析数据以及缺乏结构感知训练策略。为了应对这些挑战,我们提出了一个数据训练协同设计框架,用于强大的端到端文档解析。现实场景合成策略通过组合具有丰富文档元素的布局模板来构建大规模、结构多样的全页面端到端监督,而文档感知训练配方则引入渐进式学习和结构词元优化,以增强结构保真度和解码稳定性。我们进一步构建了 Wild-OmniDocBench,这是一个源自真实世界捕获文档的基准,用于鲁棒性评估。我们的方法集成到 1B 参数 MLLM 中,在扫描/数字和现实世界捕获的场景中实现了卓越的准确性和鲁棒性。所有模型、数据合成管道和基准都将公开发布,以推进文档理解方面的未来研究。