论文

EviViT:用于细粒度感知的证据自适应视觉转换器

EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

模型训练参数高效训练

摘要

细粒度的视觉感知使视觉语言模型能够区分微妙的属性,并将其答案建立在视觉证据的基础上。在高分辨率场景中,以更高分辨率处理整个图像会在不相关的内容上花费视觉标记,而孤立的裁剪区域可能会丢失解释所选证据所需的上下文。我们推出了 EviViT,这是一种轻量级附件,可以学习预训练的视觉变换器应该在哪里获取细节。人类视觉搜索痕迹监督问题条件的证据密度,指导从原始像素的区域重新读取和视觉标记的分配。然后,一座稀疏的、具有坐标感知能力的桥梁将区域特征与全球场景连接起来,使主持人能够在上下文中解释精确的证据。在主机主干冻结的情况下学习,该附件既可以为基础模型提供服务,也可以为兼容的训练后后代提供服务,而无需重新安装。在九个主机上进行的实验表明,平均细粒度准确度持续提高。匹配预算比较进一步表明,EviViT 在每个测试的词元上限上都优于仅全局处理,同时使用更少的视觉词元。