Persian Pixel:波斯语的大规模合成 OCR 数据集
Persian Pixel: A large-scale synthetic OCR dataset for Persian language
摘要
尽管多个国家有超过 1.1 亿人使用波斯语,但波斯语的光学字符识别 (OCR) 仍远不如拉丁文字语言成熟。这一差距源于两个基本挑战:波斯阿拉伯语书写系统的内在复杂性和大规模、高质量注释数据集的可用性有限。波斯文字表现出强制性的草书连接性、依赖于上下文的字形形状、广泛的连字、变音符号位置以及纳斯赫语和纳斯塔利克语等书写形式的风格变化,所有这些都使文本识别变得非常复杂。与此同时,手动注释的高成本和劳动密集型性质造成了持续的数据瓶颈,限制了强大的 OCR 系统的发展,并减缓了波斯语文档数字化的进展。在本文中,我们介绍了 Persian Pixel,这是一个专门为解决这些挑战而设计的综合合成 OCR 数据集。该数据集包含超过 343,000 个高保真图像文本对,涵盖句子、段落和整页文档布局,这些布局是使用 SynthOCR-Gen 渲染框架从精心策划的 700 万字波斯语语料库生成的。生成管道忠实地模拟了波斯文字的印刷特征,包括上下文字符连接、位置字形变体、变音符号放置和多种代表性波斯字体。为了弥补合成域与真实域之间的差距,渲染图像通过超过 25 个随机降级模型进一步丰富,这些模型模拟真实的文档采集伪影,包括墨水渗色、纸张老化、模糊、照明变化、扫描仪缺陷、压缩伪影和多个噪声过程。通过克服带注释的波斯 OCR 数据的长期稀缺性,Persian Pixel 为训练和 微调 现代 OCR 架构提供了可扩展且公开可用的资源,包括基于 Transformer 的模型,例如 TrOCR 和 Donut。该数据集为波斯语文档分析、历史手稿数字化和端到端文档理解等研究奠定了坚实的基础,同时证明程序化合成数据生成为手动注释提供了一种实用、经济高效且可扩展的替代方案,可在资源匮乏和印刷复杂的脚本中推进 OCR。