论文

DocRevive:文档文本恢复的统一管道

DocRevive: A Unified Pipeline for Document Text Restoration

应用与实践内容创作

摘要

在文档理解中,重建损坏、遮挡或不完整文本的挑战仍然是一个关键但尚未探索的问题。后续的文档理解任务可以从文档重建过程中受益。为此,本文提出了一种新颖的统一管道,结合了最先进的光学字符识别 (OCR)、高级图像分析、掩码语言建模和基于扩散的模型,以恢复和重建文本,同时保持视觉完整性。我们创建了一个包含 30{,}078 个降级文档图像的合成数据集,用于模拟不同的文档降级场景,为恢复任务设定基准。我们的管道检测和识别文本,使用遮挡检测器识别退化,并使用修复模型进行语义连贯重建。基于扩散的模块无缝地重新集成文本、匹配字体、大小和对齐方式。为了评估恢复质量,我们提出了统一上下文相似度度量(UCSM),将编辑、语义和长度相似性与上下文可预测性度量相结合,当正确文本在上下文中显而易见时,该度量会惩罚偏差。我们的工作推进了文档修复,有利于档案研究和数字保存,同时为文本重建设立了新标准。 OPRB 数据集和代码可分别在 \href{https://huggingface.co/datasets/kpurkayastha/OPRB}{Hugging Face} 和 \href{https://github.com/kunalpurkayastha/DocRevive}{Github} 获取。