论文

当低 CER 还不够时:乌拉圭历史文献视觉语言 OCR 系统中的幻觉分析

When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents

模型评测模型行为与机制分析

摘要

光学字符识别 (OCR) 是历史档案数字化的关键组成部分。最近,视觉语言模型 (VLM) 已成为传统 OCR 系统的强大替代品,在标准基准上实现了最先进的性能。然而,它们对于档案转录的适用性仍然没有得到充分的了解。在这项工作中,我们在 Berrutti 数据集上对传统 OCR 系统和基于 VLM 的方法进行了基准测试,该数据集是来自缩微胶片扫描的乌拉圭独裁时代文档的具有挑战性的集合。虽然 VLM 在字符错误率 (CER) 和字错误率 (WER) 方面始终优于传统方法,但我们表明这些改进隐藏了更复杂的情况。通过详细的定性分析,我们发现了标准指标不可见的系统故障模式,包括拼写规范化、虚假内容生成以及在改变含义的同时保持流畅性的语义替换。影响命名实体的错误尤其严重,因为它们可能会引入严重的语义扭曲,而对 CER 和 WER 的影响却很小。这些发现揭示了现实世界档案环境中定量 OCR 性能和转录保真度之间的关键差距,并强调需要超越字符级准确性的评估框架来捕获生成转录的语义可靠性。