论文

阅读还是猜测?古希腊版本中 OCR 视觉语言模型的视觉基础失败

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

模型评测模型行为与机制分析

摘要

最近的工作表明,用于光学字符识别(OCR)的视觉语言模型(VLM)可以生成看似合理但视觉上不受支持的文本,这表明对语言先验的依赖。将开放权重 VLM 与低资源古希腊语批评版本上的传统 OCR 基线进行比较,我们发现 VLM 错误即使在错误时也常常保持流畅,在传统引擎产生本地识别噪音的情况下产生看似合理的希腊语替换。为了分析解码过程中的视觉证据,我们引入了基于条件与无图像解码分布的受控图像扰动和 词元级 视觉证据关联措施。在字符级扰动下,VLM 与扰动的 真值 急剧偏离,而传统 OCR 仍然相对忠实;然而,词元级 分析表明,先验依赖是特定于模型的:在 OCR 专家模型中,产生流畅的词汇错误时几乎不依赖图像,而通用 VLM 即使在错误时仍然以视觉输入为条件。解码时干预无法可靠地恢复基础,而 OCR 后语言模型校正只能通过生成后修复文本来改进多个系统。我们的结果扩展了 OCR 语言先验证据,即对资源匮乏的历史文档和更广泛的模型的依赖,表明流畅的输出不一定以视觉为基础,并激发可解释性驱动的评估超越总体准确性。