论文

探索手写文本识别的情境学习

Exploring In-Context Learning for Handwritten Text Recognition

应用与实践通用理解与问答

摘要

手写文本识别(HTR)系统已成为历史文献数字化不可或缺的工具。它们不仅减少了时间和成本,而且还可以通过生成成绩单来实现内容的民主化访问和处理。然而,HTR 方面的文献目前主要关注需要大量带注释样本才能达到令人满意的性能的专用模型。我们探索使用上下文学习和预先训练的视觉语言模型(VLM)来创建转录管道,而无需更新模型的参数。然后,我们跨多个集合和模型评估该流程,并证明通用 VLM 可以有效地学习如何从图像中转录手写文本。为了评估我们的观察结果如何转化为实际应用,我们评估了跨域(CD)场景中的性能,其中上下文示例是从与查询图像不同的集合中提取的。受控域内 (ID) 场景和实际 CD 场景的结果遵循相同的模式。首先,随着上下文大小的增加,误差范围预计会缩小到平均性能。因此,较大的上下文大小会牺牲预言机最佳采样的性能,以降低预期错误率。获得的结果表明,在没有任何参数更新的情况下,该方法在域转移的情况下具有与传统 HTR 竞争的强大潜力。此外,我们表明并认为某些上下文采样比其他采样效果更好,并建议在未来的工作中应投入更多精力寻找理想的采样方法。