论文
UniLipi:历史印度手稿的统一多文字 OCR
UniLipi: A Unified Multi-Script OCR for Historical Indic Manuscripts
摘要
手写印度手稿的光学字符识别 (OCR) 对于手稿遗产的大规模数字化和计算访问至关重要。然而,现有方法通常一次针对一个脚本进行开发,并且需要大量特定于脚本的定制。这限制了跨不同集合的可扩展性和实际部署。我们提出了 UniLipi,这是一种统一的多文字 OCR 模型,用于在单一框架内针对 13 种印度文字进行联合训练的手写印度手稿。 UniLipi 直接处理真实的手稿条件,包括线条几何形状的极端变化、线条长度的巨大变化以及由非文本手稿实体(例如孔、污渍或插图)引起的部分中断。为了在超低资源条件下有效运行,该模型利用脚本感知的合成手稿数据生成,大大减少了对大量真实注释数据的依赖。除了历史手稿之外,我们还表明 UniLipi 是一种有效的基础预训练模型。具体来说,它的学习表征能够为当代印度手写体提供良好的 OCR 性能,并扩展到多种非印度文字,包括藏文、意大利文、拉丁文和中文文字。除了转录之外,UniLipi 还可以预测脚本身份和每行本地字符数,支持实用的手稿编目工作流程。