论文

VLM是在读取还是改写?论视觉语言模型的转写忠实性

Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型(VLM)正越来越多地取代传统OCR流水线用于文档理解。本文表明,它们并不总是充当忠实的转写者:当文本不完美时,它们往往倾向于将其改写为更说得通的形式——清洁文本OCR基准无法检测到这种行为。我们提出FaithC4,一个多语言扰动基准,包含1,455份单页文档(英语、中文、韩语),涵盖三类扰动:乱序、随机替换与形近替换。我们用该基准评估了15个系统,涵盖通用VLM、OCR专用VLM与传统OCR流水线。这三类系统在扰动下的WER退化各不相同:通用VLM最多退化6.9个点,OCR专用VLM退化0.1-3.4个点,传统OCR在英语上退化不足0.8个点。对Qwen3-VL-4B逐层探测,我们识别出一个一致模式:只有当被扰动词的末层FFN表示仍接近原始编码时,改写才会触发;当表示偏离足够大时,模型会忠实转写。词长影响改写率:短词(4-6个字符)最多有10%被改写,且在8个字符处存在陡峭截断,超过该长度改写率降为0%。

VLM是在读取还是改写?论视觉语言模型的转写忠实性:论文配图
图 1:数据集创建过程。来自 C4 的源文本在单词级别(打乱、视觉或随机)受到干扰,产生修改后的基本事实。扰动的文本被渲染为文档图像并传递到 VLM 进行转录。将转录内容与受到干扰的基本事实进行比较,可以揭示模型是忠实地读取修改后的文本还是将其“重写”回原始文本。