论文

Synth-JDoc:使用不同的布局和嵌入图像合成用于 OCR 的日语文档图像数据集

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

模型训练合成数据

摘要

大视觉语言模型 (LVLM) 读取文档图像中文本的能力至关重要,因为它支持文档视觉问答等各种应用。为了增强 LVLM 的文本阅读能力,高质量的 OCR 数据集至关重要。这种需求对于日语文档尤其重要,因为日语文档通常具有垂直书写的文本和水平书写的文本。目前的 LVLM 在垂直书写的日语文本上表现出的性能远低于水平书写文本的性能,因此需要专门的 OCR 数据集来弥补这一差距。然而,手动构建 OCR 数据集成本高昂且难以扩展。或者,使用 OCR 模型从现有文档图像中提取文本来构建数据集会带来挑战,例如文本识别错误和获取文档图像的先决条件。为了解决这些问题,我们通过直接从文本合成文档图像来构建 OCR 数据集。利用 HTML 和 CSS,我们生成包含垂直和水平书写风格的多列文档。此外,为了确保文档的视觉真实感,我们在布局中嵌入了文本到图像模型生成的图像。此外,为了增强模型的鲁棒性,我们对合成的文档图像应用噪声和退化过滤器。在我们的实验中,我们将在我们的合成数据集上微调的模型的性能与在先前工作的合成数据集上微调的基线以及高性能文本到图像模型生成的基线进行了比较。评估结果表明,我们的合成数据集是提高 LVLM 在阅读垂直书写的日语文本方面的性能的最有效方法。我们的数据集和代码是公开的(https://github.com/LLM-jp/synth-jdoc)。