论文

FAVE:用于高效细粒度视觉理解的注视点自适应视觉编码

FAVE: Foveated Adaptive Visual Encoding for Efficient Fine-Grained Visual Understanding

模型架构Transformer

摘要

细粒度的视觉理解取决于局部细节,但视觉编码器面临着昂贵的全图像高分辨率处理和紧凑的全局编码之间的权衡,这可能会削弱此类证据。受人类主动视觉的启发,我们将查看位置与编码内容分开。我们重点关注后者,并介绍 FAVE(注视点自适应视觉编码),这是一种轻量级可变分辨率 ViT,它以高敏锐度对外部选择的区域进行编码,同时保留原生几何形状。我们首先在受控小对象体系中使用 oracle 真值 作物来隔离此编码问题。在原始最大边为 96 像素的 ImageNet 对象上,FAVE 比固定分辨率 ViT 在同一裁剪窗口上将 Top-1 提高了 9.4 个点,FLOP 降低了 12.7 倍。增加全局分辨率或骨干容量并不能恢复相同的工作点。然后,我们将 FAVE 集成为 FastVLM 中的补充本地分支。其本地标记与 FastVLM 的全局视觉标记相结合,而原始的全局路径和语言模型保持冻结。通过最多 16 个额外的本地标记,FAVE 将 TextVQA 提高了 1.60 个点,并实现了 SmolVLM2-2.2B 3.3 倍的受控 TTFT 加速。在 GQA 属性问题上,它将 FastVLM-1.5B 提高了 1.31 个点,将优势扩展到文本之外,同时缩小了与 FastVLM-7B 的差距。总之,这些结果表明,有选择地分配高敏锐度本地容量为更广泛的全局表示和模型扩展提供了有效的补充,以实现对小对象、文本和属性的细粒度理解。