论文
不同沿海环境中视觉语言模型的评估
Evaluation of Vision-Language Models Across Diverse Coastal Environments
摘要
视觉语言模型(VLM)通过将视觉观察与自然语言概念相关联来实现机器人感知。然而,它们在沿海环境中的表现在很大程度上仍未得到探索。我们引入了一个密集标记的沿海数据集,其中包含在夏威夷欧胡岛三个地区的七个任务中收集的 1,000 多张图像,其中包含 18 个语义类别和 7,400 多个带注释的实例。我们通过三个补充实验来评估七种现代 VLM,测量文本到掩码、掩码到掩码以及掩码到文本对齐。广泛的景观类别通常比传统的物体和沿海类别更准确地识别,其中沿海概念提出了最大的挑战。然而,对沿海和陆地数据集共享的传统类别的比较表明,仅由于环境背景而没有一致的性能差异。传统类别和沿海类别的面具与面具匹配也保持相似,而替代文本标签大大提高了对几个沿海概念的识别。这些结果表明,沿海类别(至少在评估的对象/查询类别上)的较低性能很大程度上受到分割和语言表示的影响。