论文
通过解耦语言模型进行文本行识别的有效域适应
Efficient Domain Adaptation for Text Line Recognition via Decoupled Language Models
摘要
光学字符识别仍然是文档数字化的关键基础设施,但由于计算障碍,最先进的性能往往仅限于资源充足的机构。端到端 Transformer 架构实现了很高的准确性,但需要数百个 GPU 小时进行域适应,限制了从业者和数字人文学者的可访问性。我们提出了一个模块化的检测和校正框架,可以通过单 GPU 训练实现接近 SOTA 的精度。我们的方法使用预训练序列模型(包括 T5、ByT5 和 BART)将轻量级视觉字符检测(与领域无关)与特定领域的语言校正解耦。通过完全基于合成噪声训练校正器,我们可以实现无注释的域适应,而不需要标记的目标图像。通过评估现代干净的手写体、草书和历史文档,我们在架构选择中确定了一个关键的“帕累托前沿”:T5-Base 擅长使用标准词汇的现代文本,而 ByT5-Base 通过在字节级别重建古老的拼写来在历史文档中占据主导地位。我们的结果表明,这种解耦范例与端到端 Transformer 准确性相匹配,同时减少了约 95% 的计算量,为整体 OCR 架构建立了可行的、资源高效的替代方案。