论文

你还会叫这个达克斯吗? VLM 和人类中的新颖视觉参考

Would you still call this Dax? Novel Visual References in VLMs and Humans

模型评测基准与评测资源

摘要

视觉语言模型(VLM)与人类学习者一样,经常接触新的视觉概念,但它们在接触后如何将新的视觉参考映射到语言仍然很大程度上未被充分探索,特别是当这些参考与 预训练 的先验知识相矛盾时。为了研究这一点,我们提出了新颖视觉参考数据集 (NVRD):19,176 个图像,涵盖不同视觉新颖性级别的 90 个视觉概念,每个图像都有多达 20 个原始对象的逐渐扰动版本,以探索泛化。与之前对熟悉概念进行视觉增强的工作不同,NVRD 包含从头开始构建的完全新颖的、开放式的刺激,反映了人类如何遇到真正的新概念。我们评估了 3 个开源模型和 2 个闭源模型以及 2,400 个人类判断,以进行直接人类模型比较,结果发现 (i) 当模型与先验知识相矛盾时,模型很难在上下文中获取新概念;(ii) 虽然模型和人类对视觉扰动表现出相关敏感性,但模型明显过度概括,将学习到的标签扩展到人类拒绝的刺激。我们贡献 NVRD 作为人类和机器视觉概念学习研究的语料库和基准。