论文

用于可控和可概括感知的语言指导视觉嵌入

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

应用与实践视觉感知与空间理解

摘要

视觉基础模型通常被训练为静态特征提取器,将任务适应的负担置于大型下游模型上。我们提出了一种替代范式:我们使用语言本身来动态指导视觉编码器,而不是仅仅将视觉特征输入到语言模型中。我们的方法,语言指导的视觉嵌入(LIVE),利用语言作为高级指导,在推理时生成以任务为中心的嵌入,从而无需进行特定于任务的再训练。这使得编码器能够专注于输入的上下文相关方面,产生更可控和更通用的表示。根据经验,LIVE 减少了视觉幻觉(在 MMVP 上+34 分),超越了视觉语言模型,在视觉问题回答方面具有更多数量级的参数,并泛化到看不见的指令和任务——为自适应、指令驱动的视觉智能提供了直接途径。