论文

从检索到识别:视觉--语言模型如何成为OCR专家

From Retrieval to Recognition:How Vision--Language Models Become OCR Specialists

模型评测模型行为与机制分析

摘要

通用视觉语言模型是否通过开发新的阅读电路或重用现有机制来获得专门的 OCR 能力?我们在全序列 OCR 的设置中解决这个问题,而不是本地答案检索。使用基于证据的协议和坚持的因果干预措施,我们在 GLM-OCR、MinerU2.5 和 PaddleOCR-VL-1.6 中识别出稀疏且稳定的 OCR 头集。然后,我们通过将这些 OCR 头与一般 VLM 中独立识别的文本检索/复制头进行比较来研究这些 OCR 头的机械起源。在两个通用 VLM 中,视觉 OCR 头与独立识别的文本检索/复制头强烈重叠,产生 73.3% 的未调整前 20 个交集,全头 Spearman 相关性为 0.677-0.886。重叠和因果干预表明,全序列 OCR 的运行方式类似于密集顺序多模式复制粘贴,反复检索视觉证据并将其路由到当前输出位置。最后,我们研究了当普通 VLM 变成 OCR 专家时,共享电路如何变化。匹配的基础与专业化比较表明,OCR 专业化在很大程度上保留了头部身份,每个任务保留前 20 个头部中的 17-20 个,所有头部的排名相关性为 0.874-0.942,同时重新分配其功能和因果优势。