论文
将状态空间模型从行扩展到段落:基于 Mamba 的 OCR 的消融
Scaling State-Space Models from Lines to Paragraphs: An Ablation of Mamba-based OCR
摘要
端到端 OCR 越来越依赖于自回归序列模型,其中 Transformer 注意力的二次成本限制了长段落级文本的有效转录。诸如 Mamba 之类的状态空间模型 (SSM) 提供线性时间解码,并且最近已被证明可以在打印的历史行上匹配 Transformer 的准确性,但是当序列从短行增长到完整段落时,它们的行为以及它们对手写的泛化仍然知之甚少。我们研究基于 Mamba 的 OCR 识别器如何从行扩展到段落。我们首先对 100 到 1,000 个字符的合成段落对其四个核心超参数(解码器深度、状态维度、扩展因子和连接器深度)进行系统探索,将循环状态维度和扩展因子确定为长序列准确性的主导杠杆。然后,我们将识别器与在相同协议下训练的 Transformer 基线进行比较。在干净的合成段落上,两个模型在每个长度上都保持在 1% CER 以下,而 SSM 的运行速度快了 1.4 到 4.5 倍,加速随着序列长度的增加而增长。然而,在真实手写体上,SSM 明显落后:它在 IAM 行上达到 8.2% CER,在 IAM 段落上达到 10.0%,而 Transformer 基线的 CER 为 4.2% 和 3.5%。通过受控实验,我们表明这种差距的很大一部分源于数据稀缺,而不是固有的架构限制:自回归 SSM 解码器在长序列上明显需要大量数据。我们的研究阐明了 SSM 何时是大规模文档转录的实用选择,何时不是。