论文
FastOCR:通过 KV 缓存修剪实现动态视觉固定以实现高效文档解析
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
摘要
视觉语言模型 (VLM) 在光学字符识别 (OCR) 方面显示出强大的前景,但编码密集文档所需的视觉标记数量庞大,导致推理成本过高。现有的修剪方法依赖于物理驱逐,例如,在预填充阶段永久丢弃视觉标记。虽然对自然图像有效,但这种策略从根本上在 OCR 上失败了,几乎每个视觉标记都可能对应于一个字符或结构元素,任何不可逆的丢失都会导致灾难性的准确性下降。我们观察到,虽然文档图像看起来全局密集且看似不可修剪,但模型对它们的注意力实际上在时间上是稀疏的:在每个解码步骤中,它集中在一个在步骤中逐渐移动的小区域,就像人类读者专注于连续的单词而不是立即感知整个页面一样。受这种动态视觉固定现象的推动,我们将棘手的全局修剪问题重新定义为易于处理的局部动态问题,并提出了 FastOCR,这是一种具有两个互补模块的 无需训练 框架。具体来说,焦点引导修剪识别一小组焦点层,并在每一步中从中选择与任务最相关的视觉标记,而跨步固定重用则利用固定的逐渐转变来热启动前一步的每一步。通过动态调整所关注的词元而不是从缓存中逐出任何词元,FastOCR 避免了永久性信息丢失。大量实验表明,FastOCR 可作为即插即用加速模块,在不同大小和架构的五个 VLM 中一致地推广。在 Qwen2.5-VL 上,FastOCR 保留了 98% 的未剪枝模型的准确性,同时每个解码步骤仅关注 5% 的视觉标记,从而将注意力延迟减少了 3.0$\times$。