论文

文档视觉语言模型中细粒度感知的状态条件视觉证据检索

State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models

上下文与知识上下文工程

摘要

与典型的视觉语言任务相比,文档解析对细粒度的视觉感知提出了更高的要求。现有的基于视觉语言模型(VLM)的解析方法依赖于全局压缩的视觉标记,其中细粒度的细节纠缠在单个表示中并在解码过程中重复访问。然而,我们观察到每个预测的视觉证据通常是本地化的并以当前解码状态为条件,而这种表示必须在每个解码步骤中完全访问,导致计算效率低下。为了解决这种不匹配问题,我们将感知表述为自回归解码期间的状态条件视觉证据检索(SCVER)。该模型在粗糙结构的紧凑全局表示上运行,并检索以当前词元状态为条件的一小组相关高分辨率区域。这种从粗到细的设计可以按需访问细粒度的视觉线索,从而使全局共享的表示免于编码所有细粒度的细节。我们进一步发现,在 VLM 中学习这种状态条件检索具有挑战性且不稳定。为了稳定这个过程,我们引入了空间引导学习目标(SGLO)来指导检索过程。文档解析基准的实验表明,SCVER 在降低输入分辨率的情况下提高了鲁棒性,并实现了更好的准确性-效率权衡,证明了按需视觉证据检索对于细粒度感知的有效性。