论文

OmniHandwritingOCR:手写 OCR 场景中评估多模式 LLM 的诊断基准

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 越来越多地用作文档和知识处理管道中的 OCR 系统,但它们忠实读取真实笔迹的能力仍未得到充分开发。现有的 OCR 基准主要侧重于打印文本或干净的单行输入,而对现实手写 OCR 场景的覆盖范围有限,例如多语言手写、书写错误和结构复杂的数学表达式。我们推出 OmniHandwritingOCR,这是一种诊断基准,用于评估手写 OCR 上的 MLLM 和 OCR 系统。它涵盖了六个子任务和十二个子集的手写文本识别和手写数学表达式识别,共有来自公共数据集和新收集的学生写作的 77.57K 个标记图像。一个关键组成部分是一个难度分层的多行公式语料库,旨在测试结构复杂性不断增加的情况下的稳健性。我们在统一协议下使用五个互补指标评估十三个开源和闭源系统。结果表明,当前的系统距离忠实的转录还很远:复杂的多行公式的性能急剧下降,模型排名因语言和公式设置而异,并且一些生成模型产生了看似合理但视觉上不受支持的更正。 OmniHandwritingOCR 提供了一个具有挑战性的测试平台,用于诊断手写 OCR 场景中多模态模型的语言、内容、结构和视觉基础故障模式。