论文
用于视觉语言模型的状态视觉编码器
Stateful Visual Encoders for Vision-Language Models
摘要
视觉语言模型 (VLM) 越来越多地用于多图像、多轮代理环境,其中决策取决于视觉变化。然而,在现有的开放权重 VLM 中,视觉比较仅发生在语言模型内部,而视觉编码器本身保持无状态:每个图像都是独立编码的,无法访问先前的视觉上下文。因此,在语言模型有机会比较它们之前,小的但任务关键的变化可能会被减弱,特别是当这些变化不影响场景的高级语义时。我们引入了一个状态视觉编码器,它根据先前的视觉特征来调节每个视觉表示。在监督微调下,配备有状态编码器的 VLM 在涉及跨图像空间聚合、多目标视觉差异和视觉轨迹行为克隆的受控任务上实现了一致的改进。这些改进在输入分辨率、语言模型大小和 VLM 主干上是一致的。最后,我们在现实世界的任务上验证我们的模型,包括纵向放射学、细粒度图像比较和遥感,其中状态编码器持续改进通用 VLM 基线,并且可以匹配或超越选定领域的专业模型。项目页面:https://statefulvisualencoders.github.io/