论文

Q-Mask:面向 OCR 的视觉语言模型中用于文本锚定的查询驱动的因果掩码

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

应用与实践视觉感知与空间理解

摘要

光学字符识别 (OCR) 越来越被视为现代视觉语言模型 (VLM) 的基础功能,使它们不仅能够读取图像中的文本,而且还支持现实世界视觉问答 (VQA) 中的下游推理。然而,实际应用还需要可靠的文本锚点,即将查询的文本准确地定位到其相应的空间区域。为了系统地评估这种能力,我们引入了 TextAnchor-Bench (TABench),这是一个细粒度文本区域基础的基准,它揭示了通用和 OCR 特定的 VLM 仍然难以建立准确和稳定的文本锚点。为了解决这一限制,我们提出了 Q-Mask,这是一种基于因果查询驱动掩码解码器 (CQMD) 构建的精确 OCR 框架。受思想链推理的启发,Q-Mask 执行因果视觉解码,在生成最终 OCR 输出之前顺序生成查询条件视觉掩码。这种视觉 CoT 范式将文本的位置与文本的本质分开,在识别之前强制获取有根据的证据,并在推理过程中实现明确的文本锚构建。为了训练 CQMD,我们构建了 TextAnchor-26M,这是一个大规模的图像文本对数据集,用与特定文本元素相对应的细粒度掩模进行注释,鼓励稳定的文本区域对应,并将强大的空间先验注入到 VLM 训练中。大量实验表明,Q-Mask 极大地提高了跨不同视觉场景的文本锚定和理解。