论文

视觉语言模型是脆弱的多语言关联器

Vision-Language Models are Fragile Multilingual Associators

模型评测基准与评测资源

摘要

视觉语言模型必须将视觉实体与文本属性相关联。当输入的语言发生变化时,这些关联或概念绑定是否保持稳定尚未探索。我们引入了 M$^2$BIND,这是一个跨多种语言改变上下文语言和查询的基准。我们通过任务绩效指标从外部评估绑定,并通过因果干预从内部评估绑定。我们发现绑定不是语言不变的:跨系列和跨脚本设置会触发显着的绑定崩溃,模型的内部绑定计算转移到后面的层并失去因果强度。密切相关的语言相对而言可以更好地保留关联。从更广泛的意义上讲,我们的研究结果表明,不能假设 VLM 在多语言环境中全球部署能够保持在单语言评估中观察到的相同关联质量。