论文

可操纵的视觉表示

Steerable Visual Representations

模型架构Transformer

摘要

DINOv2 和 MAE 等预训练视觉 Transformer (ViT) 提供通用图像特征,可应用于各种下游任务,例如检索、分类和分割。然而,这种表示往往集中在图像中最显着的视觉线索上,而无法将它们引导到不太显着的感兴趣概念上。相比之下,多模态 LLM 可以通过文本提示进行引导,但生成的表示往往以语言为中心,并且失去了对通用视觉任务的有效性。为了解决这个问题,我们引入了可操纵视觉表示,这是一类新的视觉表示,其全局和局部特征可以用自然语言来控制。虽然大多数视觉语言模型(例如 CLIP)在编码后将文本与视觉特征融合(后期融合),但我们通过轻量级交叉注意力将文本直接注入视觉编码器的各层(早期融合)。我们引入了测量表征可操纵性的基准,并证明我们的可操纵视觉特征可以专注于图像中的任何所需对象,同时保持底层的表征质量。我们的方法还匹配或优于异常检测和个性化对象区分的专用方法,表现出对分布外任务的零样本泛化。