论文

ExpertHTR:具有多任务学习和稀疏专家混合的统一手写文本识别

ExpertHTR: Unified Handwritten Text Recognition with Multi-Task Learning and Sparse Mixture-of-Experts

摘要

手写文本识别资源通常很小,并且分布在语言、脚本、文档结构和注释格式不同的集合中,这使得联合页面级训练变得困难。我们提出了 ExpertHTR,这是一个统一的视觉语言框架,通过互补的监督和条件模型能力来解决这个问题。来自异构数据集的结构注释首先通过通用的页面-区域-行表示进行组织,并用于构建四个相关的训练任务,以实现完整的转录、物理行覆盖、文本本地化和本地化识别,而不需要额外的手动标签。 ExpertHTR 基于联合训练的密集模型,引入了稀疏专家混合架构,具有始终活跃的共享分支和有条件路由的全 MLP 专家。 Sparsegen 允许活跃路由专家的数量随隐藏表示而变化,而路由正则化减少了对一小部分专家的持续集中。对七个异构手写基准的实验表明,补充监督持续改善仅使用页面转录的训练,而联合多源训练则在大多数数据集上提供了进一步的收益。所提出的稀疏专家模型进一步改进了七个来源中六个来源的密集基线。最终的统一模型在大多数基准测试中也大大优于所评估的通用 OCR 和视觉语言系统,并在 IAM 段落级基准测试中实现了最先进的性能,而专用 HTR 系统在几个具有挑战性的集合上仍然更强。