论文
InscriptionOCR:古代碑刻识读的数据集与方法
InscriptionOCR: A Dataset and Method for Understanding Inscriptions
摘要
古代文字图像修复是计算机视觉的一个基本问题,因为它直接影响历史文献和碑文的可靠分析和解释。阿育王婆罗米文是一种古老的文字,在公元前 3 世纪阿育王统治时期广泛使用,主要用于俗语铭文。这些铭文,包括主要和次要的岩石和柱子法令,构成了用于计算分析的宝贵但很大程度上未经探索的数据源。铭文图像的退化性质和标准化数字资源的缺乏给自动化处理带来了重大挑战。我们提出了一个基于人工智能的端到端框架,用于理解古代铭文,其中包括图像增强、光学字符识别 (OCR)、音译和神经机器翻译 (NMT)。所提出的管道处理直接从石刻中捕获的低质量图像,执行图像恢复和婆罗米文字字符识别,将识别的字符映射到罗马文字,最后翻译结果 Prakrit 文本翻译成英文。我们还引入了两个新数据集:(i) InscriptionOCR 数据集:迄今为止最大的可公开使用的婆罗米文数字 OCR 数据集,由约 600 个类别的 200,000 多个字符图像组成,以及 (ii) 一个双语 Prakrit-English 平行语料库,包含 2,000 多个用于 NMT 的句子对。我们相信,所提出的框架和数据集将促进古代文字分析、低资源 OCR 和数字金石学的未来研究。
