论文

放大重要内容:用于视觉文本理解的注意力引导自适应渲染

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

上下文与知识上下文工程

摘要

视觉文本理解 (VTC) 将文本渲染为图像以供视觉语言模型 (VLM) 读取,避开 LLM 上下文窗口限制,并为从长页 OCR 到多页内存 QA 的应用程序提供支持。然而,现有的 VTC 管道将渲染和布局视为固定的、与内容无关的预处理步骤,并且对 VLM 如何内部处理可视化文本提供很少的机械理解。通过对 VTC QA 任务的集中实证研究,我们揭示了 VLM 表现出一种本地化而不利用的机制:证据本地化注意力在中后期层中急剧出现,并且在很大程度上与答案正确性脱钩,但简单地扩大渲染页面上的本地化范围就可以恢复大部分失败。基于这些观察,我们提出了 AGAR(注意力引导自适应渲染),这是一种与模型无关的 无需训练 方法,它利用 VLM 自己的中后期层注意力来识别前 K 个重要的视觉块,将它们映射回单词跨度,并在重新推断答案之前重新渲染页面,并放大这些跨度。跨九个 VTC 基准​​(短格式、长上下文和多页内存 QA)和四个 VLM 主干的大量实验表明,AGAR (i) 作为即插即用增强功能,始终如一地改进现成的 VLM,(ii) 与 VLM 后训练 组合以产生进一步的增益,以及 (iii) 在视觉和文本端输入退化的情况下仍然保持稳健。