论文

BanglaWild:OCR 和视觉语言模型的野外孟加拉语场景文本识别基准

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

模型评测基准与评测资源

摘要

野外孟加拉语场景文本识别在很大程度上是未测量的:现有资源针对手写文档或受限标牌解析,仅报告聚合编辑距离指标,并评估传统 OCR 或 VLM,而绝不会同时使用相同的野外数据。为了解决这一差距,我们引入了 BANGLAWILD,这是 2,535 个孟加拉语场景文本图像的基准,每个图像都配有逐字标准转录、两个分类轴、四个诊断属性以及图像内文本偏离规范拼写的拼写标准形式。我们在三种提示策略下评估 15 个 VLM 和 3 个传统 OCR 系统,使用 LoRA 微调 6 个开源模型,并通过 LLM-as-a-Judge 评估补充编辑距离指标。我们的结果揭示了一个持续存在的差距,即同一系列中较大的模型并不优于较小的模型。我们的 15 类错误分类法表明,在最强大的系统中,视觉错误识别约占错误的 60%,而与联合相关的错误则占不到 2%,这挑战了孟加拉语 OCR 研究中长期存在的假设;同样的视觉主导轮廓也适用于各种架构,包括可靠地读取孟加拉语的传统基线。提示语言主要影响跨脚本漂移,LoRA 减少了弱模型中的灾难性故障,而不会提高已经有能力的模型的上限。代码和数据将公开发布。